01
学习与决策
强化学习学习笔记
从零建立强化学习完整知识链:MDP、回报与价值函数、Bellman 方程、TD 学习、DQN、策略梯度、Actor–Critic、PPO,以及约束/安全强化学习。
核心内容
查看笔记↗ STUDY NOTES
整理研究中常用的数学工具、控制方法与学习算法。以下按照从最新到最早的顺序排列。
学习与决策
从零建立强化学习完整知识链:MDP、回报与价值函数、Bellman 方程、TD 学习、DQN、策略梯度、Actor–Critic、PPO,以及约束/安全强化学习。
优化与控制
从动态系统建模、有限时域优化一路讲到滚动时域执行、递归可行性、稳定性、鲁棒/Tube MPC、非线性 MPC 与分布式 MPC。
系统与控制
从状态空间建模、平衡点与线性化开始,系统学习特征值稳定性、可控性、可观性、状态反馈、LQR、观测器、Kalman 滤波与参考跟踪。
凸优化
从零理解无投影凸优化:几何直觉、线性最小化 Oracle、步长、Frank–Wolfe gap、收敛、active set、Away/Pairwise 变体以及实际应用。