Up 行動の導出 作成: 2026-06-14
更新: 2026-06-14

4足歩行ロボット > 基礎研究型運転脳 > 訓練アルゴリズム行動の導出

    状態 s_t に対し,DQN は
      ( Q(s_t, F), Q(s_t, R), Q(s_t, L) )
    を出す。

    ε-greedy 方策 で,F, R, L から1つをサンプリング:
      F, R, L からランダムに択んだ1つに,確率 ε
      F, R, L のうち Q値が最大のものに,確率 1−ε