| Up | 歩行脳NN の訓練 | 作成: 2026-06-15 更新: 2026-07-24 |
1.2.1 NN の訓練とは 1.2.2 入出力 1.2.3 計算グラフ 1.2.4 重みパラメータ 1.3.1 「並列環境」 1.3.2 試行のフロー 1.4.1 PPO 1.4.2 古い試行データを使う 1.4.3 行動のアドバンテージ 1.4.4 GAE 1.4.5 状態の価値関数 1.4.6 パラメータ値の目的関数 1.4.7 パラメータ値の更新 1.4.8 勾配計算ツール 1.5.1 矯正から問題解決へ 1.5.2 環境をランダム化 1.5.3 タスクを 「状態」 に表現 1.5.4 報酬設定 1.5.5 実現される歩容の種類 1.6.1 転移 1.6.2 カリキュラム学習 |
3.3.1 しきい値の設定 3.3.2 報酬設定 |