Up 行動モジュール 作成: 2026-06-27
更新: 2026-06-27

4足歩行ロボット自律型 > モジュール構造行動

    このモジュールは,歩行脳 NN (MLP) の
      状態ベクトル s → 行動の確率分布 π(a|s;θ)

    行動分布の中身は,
      平均 μ(s)
      分散 Σ(s)
    行動 (例 : 12関節のトルク) は連続値なので,確率分布が出力の形になる。

    行動分布から行動を1つサンプリングするのは,動作系のインタフェースである IMU か?