| Up | DQN (Deep Q‑Network) | 作成: 2026-06-14 更新: 2026-06-14 |
F/R/L の良さを「表」で覚える方式 → 状態が少ないときだけ使える F/R/L の良さを「ニューラルネット (NN)」で予測 → 状態が連続でもOK
NN の入出量 行路角度誤差 横ずれ量 障害物距離 障害物左右位置 出力:F/R/L の Q値(3次元) ( Q(F), Q(R), Q(L) ) ネットワーク構造(標準) ReLU 出力層は線形 (s, a) の Q値の取得: Q(s,a) = NN(s)[a] DQN の学習フロー NN が F/R/L の Q値を出す もっとも Q値が高い行動 a_t (F/R/L) を選ぶ 行動 a_t を実行(運動脳に a_t を送る) 報酬 r_t を受け取る この学習で,運転脳は 最適な F/R/L の切り替え方 (「運転の勘」) を覚える: 障害物が左にある → R(右回り)がよい 行路方向に向いている → F(前進)がよい 障害物が近い → 回避行動がよい |