| Up | PPO | 作成: 2026-05-14 更新: 2026-07-03 |
発散する 探索が足りない 局所解に落ちる 報酬が sparse 行動が極端になる よく使われるのはつぎの 3つ: 4足歩行ロボットの標準 特徴 : KL制約, clipping ロボットアームでよく使われる 実機ロボットで使われることが多い ここでは,PPO を取り上げる。 PPO はつぎの流れ図に表現される: 4096 の並列環境 × n ステップ (s_t, a_t, r_t, s_{t+1}, θ_old(a_t|s_t)) critic が各状態に対して V(s_t) を出力 δ_t = r_t + γ V(s_{t+1}) − V(s_t) A_t = Σ_k (γλ)^k δ_{t+k} V^target_t = A_t + V(s_t) Ratio(τ,t) = θ(a_t|s_t) / θ_old(a_t|s_t; τ) L^CLIP(θ) = E_(τ,t)[ min( Ratio(τ,t) A(τ,t), clip(Ratio(τ,t)) A(τ,t) )] LV(φ) = E_(τ,t)[ (V(s_t) − V^target_t )^2 ] θ ← θ + α ∇_θ L^CLIP(θ) φ ← φ − β ∇_φ LV(φ) (① に戻る)
|