Up 歩行脳NN の訓練 作成: 2026-06-15
更新: 2026-07-24

4足歩行ロボット自律型歩行脳NN の訓練

 1. 目的地に向かって歩く
 1.1 色々な歩容の統合
 1.2 NN
  1.2.1 NN の訓練とは
  1.2.2 入出力
  1.2.3 計算グラフ
  1.2.4 重みパラメータ
 1.3 試行
  1.3.1 「並列環境」
  1.3.2 試行のフロー
 1.4 パラメータ値更新アルゴリズム
  1.4.1 PPO
  1.4.2 古い試行データを使う
  1.4.3 行動のアドバンテージ
  1.4.4 GAE
  1.4.5 状態の価値関数
  1.4.6 パラメータ値の目的関数
  1.4.7 パラメータ値の更新
  1.4.8 勾配計算ツール
 1.5 問題解決学習
  1.5.1 矯正から問題解決へ
  1.5.2 環境をランダム化
  1.5.3 タスクを 「状態」 に表現
  1.5.4 報酬設定
  1.5.5 実現される歩容の種類
 1.6 カリキュラム学習
  1.6.1 転移
  1.6.2 カリキュラム学習
  
 2. 目的地に着く──有視界航法
 2.1 訓練の方法論
 2.2 報酬設定
 2.3 報酬設定の数式
 2.4 訓練プログラム

 3. 「疲労感・空腹感」 をもつ
 3.1 訓練の方法
 3.2 動力系データの入力形式
 3.3 報酬設定
  3.3.1 しきい値の設定
  3.3.2 報酬設定