Utilisateur:

Prise de décision dans lincertitude

Storyboard

La prise de décision dans lincertitude est le processus de sélection dune action dont le résultat nest pas complètement prévisible. La théorie de l'utilité attendue (Von Neumann-Morgenstern) fournit le cadre normatif : l'action optimale maximise l'utilité attendue EU = P(o|a)·U(o). Cependant, les organismes réels sécartent systématiquement de cet optimal de manière révélatrice.

Le modèle de diffusion de dérive (DDM) est le modèle mécaniste le plus performant du processus de décision : les preuves sont accumulées avec une dérive (proportionnelle au SNR) et un bruit jusqu'à ce qu'un seuil soit atteint. Le seuil contrôle le compromis vitesse-précision : un plus élevé plus lent mais plus précis. Les neurones du LIP et de la zone MT présentent une activité croissante cohérente avec ce modèle.

L'actualisation temporelle hyperbolique V = R/(1+k·t) décrit comment les organismes dévalorisent les récompenses futures : contrairement à l'actualisation exponentielle (V = R·e^(-k·t)), l'hyperbolique produit des préférences temporellement incohérentes (les préférences s'inversent avec le temps). Ce comportement « irrationnel » est observé chez les humains, les rats, les pigeons et les primates non humains.

Le signal d'erreur de prédiction de récompense (_t = r_t + ·V(s_{t+1}) - V(s_t)) est au cur de l'apprentissage par renforcement temporel (TD-learning). Neurobiologiquement, les neurones dopaminergiques du mésencéphale répondent exactement avec _t : ils se déclenchent lorsqu'une récompense inattendue arrive ( > 0), ils s'inhibent lorsqu'une récompense attendue n'arrive pas ( < 0) et ils ne répondent pas aux récompenses prédites ( = 0).

L'aversion au risque ( < 1 dans la fonction d'utilité) explique pourquoi les animaux préfèrent les options sûres aux récompenses égales : l'utilité marginale diminue avec l'ampleur. Cependant, dans le domaine des pertes, les organismes recherchent le risque (fonction convexe), ce qui est décrit par la théorie des perspectives de Kahneman et Tversky. Cette asymétrie a une valeur évolutive : l'aversion aux pertes est adaptative dans des environnements à ressources variables.

>Modèle

ID:('ky', 590)


gphysics.net - Dr. Willy H. Gerber
Palos Verdes, Costa de Corral, Chile