| Up | GAE | 作成: 2026-07-05 更新: 2026-07-05 |
Σ { γ^k δ(t+k) | k = 0, ‥‥, n-1-t } = R_t − V(t) ここで δ(t+k) と R_t の式を確認: R_t = r_t + γr_{t+1} + ‥‥ + γ^{n-1-t} r_{n-1} 2つの計算の違いは,
そしてこの違いは,つぎの違いになる: δ(t+k) の累積は「低分散で安定」 論理では同値でも,実際計算では同じにならない。 ここに理論の 「落とし穴」 がある。 「アドバンテージをδ(t+k) の累積で計算」 は, GAE (Generalized Advantage Estimation) に基づく。 GAE は,パラメータ値更新 (ポリシー最適化) の方法論の1つ。 「Actor (行動価値関数) - Critic (状態価値関数)」 構成をつくる。 より安定した学習を実現するので,実装では GAE の式を直接使うのが PPO の標準。 |