Up 試行のフロー 作成: 2026-06-22
更新: 2026-06-25

4足歩行ロボット他律型運動脳 > 訓練試行のフロー

    試行 (試行錯誤) は,1つのパラメータ値θに対し,複数回行う。
    例えば,4096回。

    その1回の試行は,つぎのフローになる:

     初期状態 s_0 から開始する。
     s_0 を,NN に入力する。
     出力される行動を a_0 とする。

     a_0 を,動力系 (シミュレーション) に入力する。
     そして一定時間後の状態 s_1 を得る。
     組 (s_0, a_0, s_1) に対し,報酬 r_0 を与える。

     s_1 を,NN に入力する。
     出力される行動を,a_1 とする。
     以下,これの繰り返し。


    こうして,1試行がつぎの形になる:
       s_0 → a_0 → s_1 → a_1 → ‥‥
         (s_t, a_t, s_{t+1}) → r_t

    この1試行を,4096回行う。


    4096 の試行の結果からθを評価し,これをもとにθを更新する。
    そして新しいパラメータ値 θ_new の上で,また試行を開始する。
    これを繰り返す。