Up DQN (Deep Q‑Network) 作成: 2026-06-14
更新: 2026-06-14

4足歩行ロボット > 基礎研究型運転脳 > 訓練DQN

    Q学習は,
      F/R/L の良さを「表」で覚える方式
       → 状態が少ないときだけ使える
    DQN は,
      F/R/L の良さを「ニューラルネット (NN)」で予測
       → 状態が連続でもOK

        項目 Q学習 DQN
        状態離散連続OK
        行動少数少数
        実装簡単少し複雑
        学習速度遅い速い
        実用性低い高い
        (現代の標準)


    NN の入出量
     入力:状態 s
         行路角度誤差
         横ずれ量
         障害物距離
         障害物左右位置
     出力:F/R/L の Q値(3次元)
         ( Q(F), Q(R), Q(L) )

    ネットワーク構造(標準)
      全結合層 × 2〜3
      ReLU
      出力層は線形


    (s, a) の Q値の取得:
       Q(s,a) = NN(s)[a]


    DQN の学習フロー
      状態 s_t を観測
      NN が F/R/L の Q値を出す
      もっとも Q値が高い行動 a_t (F/R/L) を選ぶ
      行動 a_t を実行(運動脳に a_t を送る)
      報酬 r_t を受け取る
      状態 s_t を観測して,上と同じことをする
      NN を更新する(Q学習の式を NN に適用) \[ Q_{new}(s_t, a_t)\ =\ (1-\alpha)\ Q(s_t, a_t) + \alpha\ R \\ R\ =\ r_{t+1} + γ\ max \{⁡ Q(s_{t+1}, a_{t+1})\ |\ a_{t+1} \} \]   これを繰り返す (何千回も)


    この学習で,運転脳は 最適な F/R/L の切り替え方 (「運転の勘」) を覚える:
      行路から右にズレている → L(左回り)がよい
      障害物が左にある → R(右回り)がよい
      行路方向に向いている → F(前進)がよい
      障害物が近い → 回避行動がよい