| Up | Q学習 | 作成: 2026-06-13 更新: 2026-06-13 |
状態の数が限られていて,かつ少ない 場合の強化学習法。
角度誤差(連続値) 横ずれ量(連続値) 障害物距離(連続値) 障害物左右位置(連続値) なので,Q学習は訓練方法にはならない。 訓練方法は,この後に取り上げる 「DQN (Deep Q-Network)」 になる。 Q学習は,つぎのような表 (「Qテーブル」) を使って,F/R/L の良さ (「Q値」) を覚える:
Q値が高いほど 「良い行動」。 学習は,この Q値を更新していく作業。 Q値の更新式は: α : 「学習率」 γ:「割引率」 式の読み方 (?) モーメント 1 × \( Q_{new} (s_t, a_t) \) = モーメント \( (1-\alpha) \) × \( Q(s_t, a_t) \) + モーメント \( \alpha \) × \( R \) |