| Up | 訓練のフロー | 作成: 2026-05-21 更新: 2026-07-05 |
ニューラルネットのパラメータ値 ("Policy") を,ランダムに初期設定。 現パラメータ値θにおいて: これが,試行データ1件。 1〜3 を多数回 (例えば 4096回) 繰り返す。 B. パラメータ値の更新 (2) GAE でアドバンテージ A_t を計算 (3) 目的関数 L^CLIP を最大化するように,θ を更新 更新後のパラメータ値 (Policy) で,A, B。 これを繰り返す。 即ち, → 未熟なデータが集まる → そのデータで Policy を改善 → 改善された Policy でまた行動 → より良いデータが集まる → さらに改善 その 「改善」 の模様は: 足をバタつかせてすぐ転ぶ にじり寄るように少し前進するが,まだ不安定 低重心を保ちつつ4 本の脚を協調させて前進 |