Up Q学習 作成: 2026-06-13
更新: 2026-06-13

4足歩行ロボット > 基礎研究型運転脳 > 訓練Q学習

    Q学習は,
      状態の数が限られていて,かつ少ない
    場合の強化学習法。

      いま考えている運転脳は,状態が
        角度誤差(連続値)
        横ずれ量(連続値)
        障害物距離(連続値)
        障害物左右位置(連続値)
      なので,Q学習は訓練方法にはならない。
      訓練方法は,この後に取り上げる 「DQN (Deep Q-Network)」 になる。


    Q学習は,つぎのような表 (「Qテーブル」) を使って,F/R/L の良さ (「Q値」) を覚える:
        状態 s行動 a Q値 
        s1F0.8
        s1R-0.2
        s1L-0.1
        s2F0.1

    Q値が高いほど 「良い行動」。
    学習は,この Q値を更新していく作業。

    Q値の更新式は:
    \[ Q_{new}(s_t, a_t)\ =\ (1-\alpha)\ Q(s_t, a_t) + \alpha\ R \\ R\ =\ r_{t+1} + γ\ max \{⁡ Q(s_{t+1}, a_{t+1})\ |\ a_{t+1} \} \] ここで,
        α : 「学習率」
        γ:「割引率」

     式の読み方 (?)
       モーメント 1 × \( Q_{new} (s_t, a_t) \)
      = モーメント \( (1-\alpha) \) × \( Q(s_t, a_t) \)
      + モーメント \( \alpha \) × \( R \)