Usuario:

Toma de decisiones bajo incertidumbre

Storyboard

La toma de decisiones bajo incertidumbre es el proceso de seleccionar una acción cuando el resultado no es completamente predecible. La teoría de la utilidad esperada (Von Neumann-Morgenstern) proporciona el marco normativo: la acción óptima maximiza la utilidad esperada EU = P(o|a)·U(o). Sin embargo, los organismos reales se desvían sistemáticamente de este óptimo de formas reveladoras.

El modelo de difusión de deriva (DDM) es el modelo mecanístico más exitoso del proceso de decisión: la evidencia se acumula con deriva (proporcional al SNR) y ruido hasta alcanzar un umbral . El umbral controla la compensación velocidad-exactitud: mayor más lento pero más exacto. Neuronas en LIP y área MT muestran actividad ramping consistente con este modelo.

El descuento temporal hiperbólico V = R/(1+k·t) describe cómo los organismos devalúan las recompensas futuras: a diferencia del descuento exponencial (V = R·e^(-k·t)), el hiperbólico produce preferencias temporalmente inconsistentes (las preferencias se revierten a medida que el tiempo pasa). Este comportamiento 'irracional' es observado en humanos, ratas, palomas y primates no humanos.

La señal de error de predicción de recompensa (_t = r_t + ·V(s_{t+1}) - V(s_t)) es el núcleo del aprendizaje por refuerzo temporal (TD-learning). Neurobiológicamente, las neuronas dopaminérgicas del mesencéfalo responden exactamente con _t: disparan cuando llega una recompensa inesperada ( > 0), se inhiben cuando una recompensa esperada no llega ( < 0), y no responden a recompensas predichas ( = 0).

La aversión al riesgo ( < 1 en la función de utilidad) explica por qué los animales prefieren opciones seguras ante recompensas iguales: la utilidad marginal decrece con la magnitud. Sin embargo, en el dominio de las pérdidas, los organismos son buscadores de riesgo (función convexa), lo que se describe por la teoría prospectiva de Kahneman y Tversky. Esta asimetría tiene valor evolutivo: la aversión a la pérdida es adaptativa en entornos con recursos variables.

>Modelo

ID:('ky', 590)


Toma de decisiones bajo incertidumbre

Descripción

Cálculos


Primero, seleccione la ecuación:   a ,  luego, seleccione la variable:   a 

Símbolo
Ecuación
Resuelto
Traducido

Cálculos

Símbolo
Ecuación
Resuelto
Traducido

 Variable   Dado   Calcule   Objetivo :   Ecuación   A utilizar



Variables

Símbolo
Texto
Variable
Valor
Unidades
Calcule
Valor MKS
Unidades MKS
$a^*$
a_star
Acción óptima
1
$delta_t$
delta_t
Error de predicción de recompensa
1
$X$
X
Evidencia acumulada
1
$alpha$
alpha
Exponente de aversión al riesgo
1
$gamma$
gamma
Factor de descuento RL
1
$P_{ m err}$
P_err
Probabilidad de error
1
$P(o_imid a)$
P_o_i_a
Probabilidad de resultado
1
$R$
R
Recompensa
1
$r_t$
r_t
Recompensa actual
1
$x$
x
Resultado riesgoso
1
$xi(t)$
xi
Ruido blanco
1
$\theta$
theta
Umbral DDM
1
$U(x)$
U_x
Utilidad con aversión al riesgo
1
$U(o_i)$
U_o_i
Utilidad del resultado
1
$EU(a)$
EU
Utilidad esperada
1
$V(s_t)$
V_s
Valor del estado actual
1
$V(s_{t+1})$
V_s_next
Valor del estado siguiente
1
$V_{ m subj}$
V_subj
Valor subjetivo descontado
1
$mu$
mu
Deriva de evidencia
1/s
$k_{ m disc}$
k_disc
Tasa de descuento
1/s
$sigma$
sigma
Ruido de evidencia
1/s¹?²
$t_{ m delay}$
t_delay
Retardo temporal
s
$t$
t
Tiempo
s
$E[T_{ m dec}]$
E_T_dec
Tiempo medio de decisión
s
$t_{ m no-dec}$
t_no_dec
Tiempo no decisional
s

ID:(0, 590)


gphysics.net - Dr. Willy H. Gerber
Palos Verdes, Costa de Corral, Chile