Up 試行 作成: 2026-06-13
更新: 2026-06-13

4足歩行ロボット > 基礎研究型運転脳 > 訓練 > > 試行

    訓練は,試行の繰り返し。
    試行 (エピソード) は, 「いまの状況で F/R/L のどれを選ぶべきか」 の試行。

    1試行は,つぎのフロー:
        状態 s_0 → 行動 a_0 → 報酬 r_0
      → s_1 → a_1 → r_1 → s_2 → ‥‥  


    状態 s_t は,
     「行路からどれだけズレているか」
      ロボットの向き(行路に対して何度ズレているか)
      行路との横ずれ量
     「障害物の位置」
      障害物までの距離
      障害物の左右どちらに寄っているか

    行動 a_t は,
       F / R / L から1つを択ぶ

    報酬 r_t は,
      行路に近づく → +1
      行路から離れる → -1
      障害物に近づきすぎる → -5
      障害物に衝突 → -100
      行路に沿って前進できた → +5


    エピソードの終了
     つぎのいずれかでエピソード終了:
      障害物に衝突した
      行路から大きく外れた
      一定ステップ数を超えた(タイムアウト)