Up 報酬 (Reward) 作成: 2026-06-13
更新: 2026-06-13

4足歩行ロボット > 基礎研究型運転脳標準的な報酬設定

    ① 行路方向に向いているほど,よし
    角度誤差が小さいほどペナルティを小さく。
      r_t(1) = −|角度誤差|
     例:
       0° → 0
       10° → -10
       30° → -30

    ② 行路の中心に近いほど,よし
    横ずれ量が小さいほどペナルティを小さく。
      r_t(2) = −|横ずれ量|

    ③ 前進できたらプラス
    F (前進) を選んで,実際に前に進んだ距離に応じて報酬。
      r_t(3) = +k × 前進距離
      (k は 1〜5 程度の係数)

    ④ 障害物に近づくとマイナス
    距離が短いほど罰を与える。
      r_t(4) = − 1/障害物距離

    ⑤ 衝突したら大きなマイナス
    これは必須。
      r_t(5) = −100

    ⑥ 行路から大きく外れたらマイナス
    行路を失ったら,エピソード終了。
      r_t(6) = −50


    ● 報酬の最終形
    全体の報酬は次のように合計する:
      R_t = r_t(1) + r_t(2) + ‥‥ + r_t(6)