| Up | 試行のフロー | 作成: 2026-06-22 更新: 2026-06-25 |
例えば,4096回。 その1回の試行は,つぎのフローになる: 初期状態 s_0 から開始する。 s_0 を,NN に入力する。 出力される行動を a_0 とする。 a_0 を,動力系 (シミュレーション) に入力する。 そして一定時間後の状態 s_1 を得る。 組 (s_0, a_0, s_1) に対し,報酬 r_0 を与える。 s_1 を,NN に入力する。 出力される行動を,a_1 とする。 以下,これの繰り返し。 こうして,1試行がつぎの形になる: (s_t, a_t, s_{t+1}) → r_t この1試行を,4096回行う。 4096 の試行の結果からθを評価し,これをもとにθを更新する。 そして新しいパラメータ値 θ_new の上で,また試行を開始する。 これを繰り返す。 |