Preços de fábrica

Envio grátis!

Prémio de atendimento ao cliente

Derivación detallada del teorema del gradiente de política

Passe o rato sobre a imagem para a aumentar

Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política
Derivación detallada del teorema del gradiente de política

Derivación detallada del teorema del gradiente de política

Marca: VidaXL - 277150
Vendido por: Habitium
325,73 € PVP -45%
179,15 €
Entrega grátis De 3 a 5 dias úteis
Derivación detallada del teorema del gradiente de política

Derivación detallada del teorema del gradiente de política

179,15 € IVA incluído IVA incluído

179,15 € IVA incluído IVA incluído

Derivación detallada del teorema del gradiente de política

Descrição do produto


Modalidades de pagamento e de financiamento

PayPal Visa MasterCard American Express Transferência bancária Multibanco MB Way

Faça uma pergunta sobre este produto Tempo médio de resposta: 4 horas úteis

Descrição do produto - Derivación detallada del teorema del gradiente de política

Se da una demostración paso a paso del teorema del gradiente de política, mostrando explícitamente la expansión recursiva, la definición de la visita de estados con descuento y la forma conveniente mediante el log-score ("score function") y el baseline invariante. **Teorema (Policy gradient).** Si $J(\theta)=V^{\pi_\theta}(s_0)$, entonces \[ \nabla_\theta J(\theta) = \sum_{s} d^{\pi}_\gamma(s\,|\,s_0) \sum_a \nabla_\theta \pi_\theta(a\,|\,s)\, Q^{\pi}(s,a), \] donde \[ d^{\pi}_\gamma(s\,|\,s_0) \equiv \sum_{t=0}^\infty \gamma^t\, p_\pi(s\,|\,s_0,t) \] es la visita descontada del estado $s$ empezando en $s_0$ bajo la política $\pi$. Además, \[ \nabla_\theta J(\theta) = \mathbb{E}_{s\sim d^{\pi}_\gamma,\;a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big], \] y es válido restar un baseline $b(s)$ (dependiente sólo del estado) sin introducir sesgo. **Demostración completa y paso a paso.** 1) **Derivar la expresión inicial.** \[ J(\theta) = V^{\pi_\theta}(s_0) = \sum_a \pi_\theta(a\,|\,s_0)\, Q^{\pi}(s_0,a). \] Diferenciando respecto a $\theta$, por la regla del producto, \[ \nabla_\theta V^{\pi}(s_0) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s_0)\; Q^{\pi}(s_0,a) + \sum_a \pi_\theta(a\,|\,s_0)\; \nabla_\theta Q^{\pi}(s_0,a). \tag{1} \] 2) **Expresar $\nabla_\theta Q^{\pi}(s,a)$ en términos de $\nabla_\theta V^{\pi}$.** Usando la igualdad (definición de $Q^\pi$) \[ Q^{\pi}(s,a) = \sum_{s'} P(s'\,|\,s,a)\left[r(s,a,s') + \gamma V^{\pi}(s')\right], \] la derivada respecto a $\theta$ (recordando que la dinámica $P$ y la recompensa no dependen de $\theta$) es \begin{align*} \nabla_\theta Q^{\pi}(s,a) &= \sum_{s'} P(s'\,|\,s,a) \left[ \gamma\, \nabla_\theta V^{\pi}(s') \right] \\ &= \gamma \sum_{s'} P(s'\,|\,s,a)\; \nabla_\theta V^{\pi}(s'). \end{align*} Sustituyendo en (1) obtenemos \[ \nabla_\theta V^{\pi}(s_0) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s_0)\; Q^{\pi}(s_0,a) + \gamma \sum_a \pi_\theta(a\,|\,s_0) \sum_{s'} P(s'\,|\,s_0,a) \nabla_\theta V^{\pi}(s'). \] Definimos \[ \varphi(s) \equiv \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a). \] Entonces la expresión se compacta a \[ \nabla_\theta V^{\pi}(s_0) = \varphi(s_0) + \gamma \sum_{s'} p_\pi(s'\,|\,s_0)\; \nabla_\theta V^{\pi}(s'), \tag{2} \] donde $p_\pi(s'\,|\,s) = \sum_a \pi(a\,|\,s) P(s'\,|\,s,a)$ es la probabilidad de transición bajo la política. 3) **Desenvolver recursivamente (expansión en serie).** La ecuación (2) es una ecuación tipo Bellman para $\nabla_\theta V^{\pi}$. Si aplicamos (2) a cada término $\nabla_\theta V^{\pi}(s')$ y repetimos, obtenemos la expansión \begin{align*} \nabla_\theta V^{\pi}(s_0) &= \varphi(s_0) + \gamma \sum_{s_1} p_\pi(s_1\,|\,s_0)\, \varphi(s_1) + \gamma^2 \sum_{s_2} p_\pi(s_2\,|\,s_0,2)\, \varphi(s_2) + \cdots \\ &= \sum_{t=0}^{\infty} \gamma^t \sum_{s} p_\pi(s\,|\,s_0,t)\; \varphi(s), \end{align*} siempre que se cumpla la convergencia absoluta necesaria para intercambiar suma e operator derivada (caso habitual con $\gamma\in [0,1)$). Aquí $p_\pi(s\,|\,s_0,t)$ es la probabilidad de estar en $s$ exactamente en el tiempo $t$ partiendo de $s_0$ bajo $\pi$ (i.e. la $t$-step transition probability). 4) **Definir la visita de estados descontada.** Definimos la cantidad \[ d^{\pi}_\gamma(s\,|\,s_0) \equiv \sum_{t=0}^\infty \gamma^t\, p_\pi(s\,|\,s_0,t). \] Con esta definición la expansión anterior queda \[ \nabla_\theta V^{\pi}(s_0) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\; \varphi(s). \] Sustituyendo la definición de $\varphi(s)$: \[ \nabla_\theta J(\theta) = \nabla_\theta V^{\pi}(s_0) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\, \sum_a \nabla_\theta \pi_\theta(a\,|\,s)\; Q^{\pi}(s,a). \] Esta es la forma sumatoria del teorema del gradiente de política. 5) **Pasar a la forma de esperanza usando la "score function".** Usando la identidad \[ \nabla_\theta\pi_\theta(a\,|\,s) = \pi_\theta(a\,|\,s)\; \nabla_\theta \log\pi_\theta(a\,|\,s), \] obtenemos \begin{align*} \sum_a \nabla_\theta \pi_\theta(a\,|\,s)\, Q^{\pi}(s,a) &= \sum_a \pi_\theta(a\,|\,s)\; \nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a) \\ &= \mathbb{E}_{a\sim\pi_\theta(\cdot\,|\,s)}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big]. \end{align*} Por tanto \[ \nabla_\theta J(\theta) = \sum_s d^{\pi}_\gamma(s\,|\,s_0)\; \mathbb{E}_{a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big] = \mathbb{E}_{s\sim d^{\pi}_\gamma,\;a\sim\pi}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\; Q^{\pi}(s,a)\big]. \] 6) **Invarianza al baseline dependiente sólo del estado.** Si sustituimos $Q^{\pi}(s,a)$ por $Q^{\pi}(s,a)-b(s)$, con $b(s)$ arbitrario (no dependiente de $a$), la suma interior queda \[ \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\,(Q^{\pi}(s,a)-b(s)) = \sum_a \nabla_\theta\pi_\theta(a\,|\,s)\,Q^{\pi}(s,a) - b(s) \sum_a \nabla_\theta\pi_\theta(a\,|\,s). \] Pero $\sum_a \pi_\theta(a\,|\,s)\equiv 1$ para todo $\theta$, luego su derivada es cero: \[ \sum_a \nabla_\theta\pi_\theta(a\,|\,s) = \nabla_\theta \sum_a \pi_\theta(a\,|\,s) = \nabla_\theta 1 = 0. \] Así que el término con $b(s)$ desaparece y el gradiente no cambia. En la forma de esperanza esto se traduce en que se puede utilizar el estimador \[ \mathbb{E}_{s,a}\big[\nabla_\theta \log\pi_\theta(a\,|\,s)\,(Q^{\pi}(s,a)-b(s))\big] \] sin introducir sesgo, lo cual se usa para reducir la varianza del estimador. **Comentarios finales.** - La cantidad $d^{\pi}_\gamma(s\,|\,s_0)$ es la "visita descontada" de estado; si se prefiere una distribución normalizada se puede definir \(\mu^{\pi}_\gamma(s) = (1-\gamma) d^{\pi}_\gamma(s\,|\,s_0)\), y corresponderían formulaciones equivalentes del teorema con ese factor adicional. - La derivación asume condiciones de regularidad que permiten intercambiar sumas infinitas y derivadas (por ejemplo, $\gamma<1$ y $\pi_\theta$ suave en $\theta$). Con esto queda demostrada la identidad pedida y las consecuencias usuales (forma de esperanza y uso de baseline).

Classificação do produto::

Este produto pertence à categoria Espremedores de alavanca (espremedores de braço, espremedores manuais): de fuso com cesto prensa de parafuso, de rosca , de pé com pedestal de chão , compatíveis com maçãs , compatíveis com uvas , compatíveis com peras , capacidade do cesto: 13 a 20 L , de ferro fundido fundição , de aço pintado ou cromado , de uso profissional (hotelaria) , de uso doméstico lar , desmontáveis para limpeza limpeza fácil, peças desmontáveis , com tabuleiro recolhe-sumo bandeja coletora .

SKU: 8719883696690, 277150

Recursos de Segurança e Produtos

Informações e contactos