Descrição do produto - Derivación detallada del teorema del gradiente de política
Se da una demostración paso a paso del teorema del gradiente de política, mostrando explícitamente la expansión recursiva, la definición de la visita de estados con descuento y la forma conveniente mediante el log-score ("score function") y el baseline invariante.
**Teorema (Policy gradient).** Si $J(\theta)=V^{\pi_\theta}(s_0)$, entonces
\[ \nabla_\theta J(\theta) = \sum_{s} d^{\pi}_\gamma(s\,|\,s_0) \sum_a \nabla_\theta \pi_\theta(a\,|\,s)\, Q^{\pi}(s,a), \]
donde
\[ d^{\pi}_\gamma(s\,|\,s_0) \equiv \sum_{t=0}^\infty \gamma^t\, p_\pi(s\,|\,s_0,t) \]
es la visita descontada del estado $s$ empezando en $s_0$ bajo la política $\pi$. Además,
\[ \nabla_\theta J(\theta) = \mathbb{E}_{s\sim d^{\pi}_\gamma,\;a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big], \]
y es válido restar un baseline $b(s)$ (dependiente sólo del estado) sin introducir sesgo.
**Demostración completa y paso a paso.**
1) **Derivar la expresión inicial.**
\[ J(\theta) = V^{\pi_\theta}(s_0) = \sum_a \pi_\theta(a\,|\,s_0)\, Q^{\pi}(s_0,a). \]
Diferenciando respecto a $\theta$, por la regla del producto,
\[ \nabla_\theta V^{\pi}(s_0) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s_0)\; Q^{\pi}(s_0,a)
+ \sum_a \pi_\theta(a\,|\,s_0)\; \nabla_\theta Q^{\pi}(s_0,a). \tag{1} \]
2) **Expresar $\nabla_\theta Q^{\pi}(s,a)$ en términos de $\nabla_\theta V^{\pi}$.**
Usando la igualdad (definición de $Q^\pi$)
\[ Q^{\pi}(s,a) = \sum_{s'} P(s'\,|\,s,a)\left[r(s,a,s') + \gamma V^{\pi}(s')\right], \]
la derivada respecto a $\theta$ (recordando que la dinámica $P$ y la recompensa no dependen de $\theta$) es
\begin{align*}
\nabla_\theta Q^{\pi}(s,a) &= \sum_{s'} P(s'\,|\,s,a) \left[ \gamma\, \nabla_\theta V^{\pi}(s') \right] \\
&= \gamma \sum_{s'} P(s'\,|\,s,a)\; \nabla_\theta V^{\pi}(s').
\end{align*}
Sustituyendo en (1) obtenemos
\[ \nabla_\theta V^{\pi}(s_0) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s_0)\; Q^{\pi}(s_0,a) + \gamma \sum_a \pi_\theta(a\,|\,s_0) \sum_{s'} P(s'\,|\,s_0,a) \nabla_\theta V^{\pi}(s'). \]
Definimos
\[ \varphi(s) \equiv \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a). \]
Entonces la expresión se compacta a
\[ \nabla_\theta V^{\pi}(s_0) = \varphi(s_0) + \gamma \sum_{s'} p_\pi(s'\,|\,s_0)\; \nabla_\theta V^{\pi}(s'), \tag{2} \]
donde $p_\pi(s'\,|\,s) = \sum_a \pi(a\,|\,s) P(s'\,|\,s,a)$ es la probabilidad de transición bajo la política.
3) **Desenvolver recursivamente (expansión en serie).**
La ecuación (2) es una ecuación tipo Bellman para $\nabla_\theta V^{\pi}$. Si aplicamos (2) a cada término $\nabla_\theta V^{\pi}(s')$ y repetimos, obtenemos la expansión
\begin{align*}
\nabla_\theta V^{\pi}(s_0)
&= \varphi(s_0) + \gamma \sum_{s_1} p_\pi(s_1\,|\,s_0)\, \varphi(s_1)
+ \gamma^2 \sum_{s_2} p_\pi(s_2\,|\,s_0,2)\, \varphi(s_2) + \cdots \\
&= \sum_{t=0}^{\infty} \gamma^t \sum_{s} p_\pi(s\,|\,s_0,t)\; \varphi(s),
\end{align*}
siempre que se cumpla la convergencia absoluta necesaria para intercambiar suma e operator derivada (caso habitual con $\gamma\in [0,1)$). Aquí $p_\pi(s\,|\,s_0,t)$ es la probabilidad de estar en $s$ exactamente en el tiempo $t$ partiendo de $s_0$ bajo $\pi$ (i.e. la $t$-step transition probability).
4) **Definir la visita de estados descontada.**
Definimos la cantidad
\[ d^{\pi}_\gamma(s\,|\,s_0) \equiv \sum_{t=0}^\infty \gamma^t\, p_\pi(s\,|\,s_0,t). \]
Con esta definición la expansión anterior queda
\[ \nabla_\theta V^{\pi}(s_0) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\; \varphi(s). \]
Sustituyendo la definición de $\varphi(s)$:
\[ \nabla_\theta J(\theta) = \nabla_\theta V^{\pi}(s_0) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\, \sum_a \nabla_\theta \pi_\theta(a\,|\,s)\; Q^{\pi}(s,a). \]
Esta es la forma sumatoria del teorema del gradiente de política.
5) **Pasar a la forma de esperanza usando la "score function".**
Usando la identidad
\[ \nabla_\theta\pi_\theta(a\,|\,s) = \pi_\theta(a\,|\,s)\; \nabla_\theta \log\pi_\theta(a\,|\,s), \]
obtenemos
\begin{align*}
\sum_a \nabla_\theta \pi_\theta(a\,|\,s)\, Q^{\pi}(s,a)
&= \sum_a \pi_\theta(a\,|\,s)\; \nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a) \\
&= \mathbb{E}_{a\sim\pi_\theta(\cdot\,|\,s)}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big].
\end{align*}
Por tanto
\[ \nabla_\theta J(\theta) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\; \mathbb{E}_{a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big] = \mathbb{E}_{s\sim d^{\pi}_\gamma,\;a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big]. \]
6) **Invarianza al baseline dependiente sólo del estado.**
Si sustituimos $Q^{\pi}(s,a)$ por $Q^{\pi}(s,a)-b(s)$, con $b(s)$ arbitrario (no dependiente de $a$), la suma interior queda
\[ \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\,(Q^{\pi}(s,a)-b(s)) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\,Q^{\pi}(s,a) - b(s) \sum_a \nabla_\theta\pi_\theta(a\,|\,s). \]
Pero $\sum_a \pi_\theta(a\,|\,s)\equiv 1$ para todo $\theta$, luego su derivada es cero:
\[ \sum_a \nabla_\theta\pi_\theta(a\,|\,s) = \nabla_\theta \sum_a \pi_\theta(a\,|\,s) = \nabla_\theta 1 = 0. \]
Así que el término con $b(s)$ desaparece y el gradiente no cambia. En la forma de esperanza esto se traduce en que se puede utilizar el estimador
\[ \mathbb{E}_{s,a}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\,(Q^{\pi}(s,a)-b(s))\big] \]
sin introducir sesgo, lo cual se usa para reducir la varianza del estimador.
**Comentarios finales.**
- La cantidad $d^{\pi}_\gamma(s\,|\,s_0)$ es la "visita descontada" de estado; si se prefiere una distribución normalizada se puede definir
\(\mu^{\pi}_\gamma(s) = (1-\gamma) d^{\pi}_\gamma(s\,|\,s_0)\), y corresponderían formulaciones equivalentes del teorema con ese factor adicional.
- La derivación asume condiciones de regularidad que permiten intercambiar sumas infinitas y derivadas (por ejemplo, $\gamma<1$ y $\pi_\theta$ suave en $\theta$).
Con esto queda demostrada la identidad pedida y las consecuencias usuales (forma de esperanza y uso de baseline).
Classificação do produto::
Este produto pertence à categoria Espremedores de alavanca (espremedores de braço, espremedores manuais): de fuso com cesto prensa de parafuso, de rosca , de pé com pedestal de chão , compatíveis com maçãs , compatíveis com uvas , compatíveis com peras , capacidade do cesto: 13 a 20 L , de ferro fundido fundição , de aço pintado ou cromado , de uso profissional (hotelaria) , de uso doméstico lar , desmontáveis para limpeza limpeza fácil, peças desmontáveis , com tabuleiro recolhe-sumo bandeja coletora .
SKU: 8719883696690, 277150
Recursos de Segurança e Produtos