01
学習・意思決定
強化学習 学習ノート
MDP、収益・価値関数、ベルマン方程式、TD 学習、DQN、方策勾配、Actor–Critic、PPO、制約付き・安全な強化学習までを基礎からつなげて理解するノートです。
主な内容
ノートを読む↗ STUDY NOTES
研究で用いる数学的手法、制御手法、学習アルゴリズムを体系的に整理したノートです。新しいものから順に掲載しています。
学習・意思決定
MDP、収益・価値関数、ベルマン方程式、TD 学習、DQN、方策勾配、Actor–Critic、PPO、制約付き・安全な強化学習までを基礎からつなげて理解するノートです。
最適化・制御
動的モデルと有限ホライズン最適化から、リシーディングホライズン、再帰的可行性、安定性、Tube MPC、NMPC、分散MPCまでを一貫して整理します。
システム・制御
状態空間、平衡点・線形化、固有値安定性、可制御性・可観測性、状態フィードバック、LQR、オブザーバ、Kalman filter、追従制御までを一貫して学びます。
凸最適化
射影を使わない制約付き凸最適化を、幾何、LMO、step size、FW gap、収束、active set、Away/Pairwise 変種、応用まで基礎から整理します。