Up 運動脳 (歩容 gait 生成) 作成: 2026-05-13
更新: 2026-07-06

4足歩行ロボット他律型運動脳

1 ニューラルネット (NN)
 1.1 「歩行訓練」 のキャスティング
 1.2 ニューラルネット (NN)
 1.3 「歩行」 ワールド
 1.4 入力と出力 (状態と行動)
 1.5 NN 用コンピュータの要件
2 「歩行訓練」 のロジック
 2.1 比較 : 「投球フォームづくり」
 2.2 「歩行訓練」 のアルゴリズム
 2.3 「歩行訓練」 は無理矢理をする
 2.4 学習方法=試行錯誤
 2.5 NN の更新
3 試行錯誤
 3.1 教えられないことを教える
 3.2 報酬
 3.3 試行錯誤
4 報酬設計
 4.1 報酬設計とは
 4.2 報酬のカテゴリー
 4.3 報酬設定の難しさ
 4.4 報酬設定の黄金律
 4.5 r_t 値の決め方
5 「奇妙な動き」
 5.1 「奇妙な動き」 の意味
 5.2 学習理論への汎化
 5.3 進化理論への汎化
6 NN をロボットに実装
 6.1 NN 実装のロジック
 6.2 現実とのギャップ (Reality Gap)
 6.3 MCU の調整

  
  訓 練
7 訓練
 7.1 訓練のフロー
 7.2 NN
  7.2.1 NN の訓練とは
  7.2.2 入出力
  7.2.3 計算グラフ
  7.2.4 重みパラメータ
 7.3 シミュレーション (Sim)
  7.3.1 Sim-to-Real
  7.3.2 Sim 設計の2つの考え方
  7.3.3 「現実世界の揺らぎ」 を入れる
  7.3.4 ツール
  7.3.5 行動 (状態変化) の可視化
 7.4 試行
  7.4.1 「並列環境」
  7.4.2 試行のフロー
  7.4.3 状態の初期設定
  7.4.4 (s₀, a₀, r₀, s₁) の実際
 7.5 パラメータ値更新アルゴリズム
  7.5.1 PPO
  7.5.2 古い試行データを使う
  7.5.3 行動のアドバンテージ
  7.5.4 GAE
  7.5.5 状態の価値関数
  7.5.6 パラメータ値の目的関数
  7.5.7 パラメータ値の更新
  7.5.8 勾配計算ツール