Up
行動の導出
作成: 2026-06-14
更新: 2026-06-14
4足歩行ロボット > 基礎研究型
>
運転脳 > 訓練アルゴリズム
>
行動の導出
状態 s_t に対し,DQN は
( Q(s_t, F), Q(s_t, R), Q(s_t, L) )
を出す。
ε-greedy 方策 で,F, R, L から1つをサンプリング:
F, R, L からランダムに択んだ1つに,確率 ε
F, R, L のうち Q値が最大のものに,確率 1−ε