| Up | 運動脳 (歩容 gait 生成) | 作成: 2026-05-13 更新: 2026-07-06 |
|
1 ニューラルネット (NN)
1.1 「歩行訓練」 のキャスティング 1.2 ニューラルネット (NN) 1.3 「歩行」 ワールド 1.4 入力と出力 (状態と行動) 1.5 NN 用コンピュータの要件 2.1 比較 : 「投球フォームづくり」 2.2 「歩行訓練」 のアルゴリズム 2.3 「歩行訓練」 は無理矢理をする 2.4 学習方法=試行錯誤 2.5 NN の更新 3.1 教えられないことを教える 3.2 報酬 3.3 試行錯誤 4.1 報酬設計とは 4.2 報酬のカテゴリー 4.3 報酬設定の難しさ 4.4 報酬設定の黄金律 4.5 r_t 値の決め方 5.1 「奇妙な動き」 の意味 5.2 学習理論への汎化 5.3 進化理論への汎化 6.1 NN 実装のロジック 6.2 現実とのギャップ (Reality Gap) 6.3 MCU の調整 |
7.2.1 NN の訓練とは 7.2.2 入出力 7.2.3 計算グラフ 7.2.4 重みパラメータ 7.3.1 Sim-to-Real 7.3.2 Sim 設計の2つの考え方 7.3.3 「現実世界の揺らぎ」 を入れる 7.3.4 ツール 7.3.5 行動 (状態変化) の可視化 7.4.1 「並列環境」 7.4.2 試行のフロー 7.4.3 状態の初期設定 7.4.4 (s₀, a₀, r₀, s₁) の実際 7.5.1 PPO 7.5.2 古い試行データを使う 7.5.3 行動のアドバンテージ 7.5.4 GAE 7.5.5 状態の価値関数 7.5.6 パラメータ値の目的関数 7.5.7 パラメータ値の更新 7.5.8 勾配計算ツール |