1. まず直感:強化学習は何を解くのか
強化学習では、エージェントが状態を観測し、行動を選び、報酬を受け、次の状態へ進むという循環を扱います。教師あり学習と異なり、正解行動は直接与えられません。今すぐ高い報酬を得る行動が長期的に良いとは限らないため、中心課題は不確実性の下での逐次意思決定と長期的な信用割当です。
重要ポイント
- 状態は現在の状況、行動は選択可能な操作、報酬は即時のスカラー信号、収益は将来報酬の累積です。
- 方策は意思決定規則であり、方策学習とは状態に応じた行動選択規則を学ぶことです。
- 環境は固定データセットではなく、行動によって次に観測するデータ分布そのものが変化します。
- 探索は未知の行動を試すか、活用は現在最良と思われる行動を選ぶか、という問題です。
この節の要点
一文で言えば、強化学習は正解ラベルではなく遅延した結果からフィードバック方策を学びます。
2. MDP:強化学習の数学言語
マルコフ決定過程(MDP)は強化学習の標準モデルです。時刻 t で状態 s_t を観測し、方策 π(a|s) から行動 a_t を選び、報酬 r_t を得て、環境は P(s_{t+1}|s_t,a_t) に従って次状態を生成します。マルコフ性は「履歴が存在しない」という意味ではなく、「現在の状態表現が将来予測に必要な履歴を要約している」という意味です。
重要ポイント
- S は状態空間、A は行動空間で、離散・連続のどちらでも構いません。
- P は遷移モデルです。モデルフリーRLでは明示的に既知でなくてもよく、モデルベースRLでは学習または利用します。
- 観測だけでマルコフ性が満たされない場合は POMDP と考え、履歴、RNN、belief state などが必要になります。
小さな例
移動ロボットなら、位置・速度を状態、加速度を行動、目標距離とエネルギー消費を報酬にし、運動方程式を遷移モデルとします。
3. 報酬・収益・割引・エピソード
報酬 r_t は局所的な信号で、収益 G_t は将来の結果まで含めて行動を評価します。割引率 γ∈[0,1) により近い将来を重くし、無限ホライズンの和を有限にできます。エピソード型と継続型があり、報酬設計と γ の選択は学習するタスクそのものを変えます。
重要ポイント
- γ が 0 に近いと近視眼的、1 に近いと長期的になります。
- 報酬整形は学習を速めますが、設計が悪いと意図しない最適化を起こします。
- 制御では負のコストを報酬として、状態偏差・制御入力・制約違反などを罰することが一般的です。
数値的な直感
3 ステップの報酬がすべて 1、γ=0.9 なら G_0=1+0.9+0.81=2.71 です。遠い報酬ほど寄与が小さくなります。
4. 価値関数:V・Q・Advantage
価値関数は将来の遅延報酬を現在評価できる量へ圧縮します。V^π(s) は状態 s の良さ、Q^π(s,a) は今 a を選んだ後の良さ、Advantage A^π(s,a)=Q^π(s,a)−V^π(s) はその行動が平均的な方策行動よりどれだけ良いかを表します。
重要ポイント
- 価値ベース法は V や Q を学び、高価値の行動を選ぶことで方策を得ます。
- 方策ベース法は方策を直接パラメータ化し、分散低減のため Critic で V/Q を推定することがあります。
- Advantage は Actor–Critic や PPO で、どの行動確率を上げ下げすべきかを示します。
5. ベルマン方程式:長期問題を1ステップ再帰へ
ベルマンの考え方は RL の中心です。現在価値を「即時報酬+割引された次状態価値」に分解することで、長期問題を再帰的に扱えます。期待ベルマン方程式は固定方策の評価、最適ベルマン方程式は最適価値を特徴づけます。
重要ポイント
- 方策評価は固定方策に対する期待ベルマン方程式を解くことです。
- 方策改善は現在の価値推定に対してより greedy な方策へ更新します。
- モデル既知なら動的計画法、未知ならサンプルから TD 法で同じ再帰構造を近似します。
この節の要点
ベルマン再帰は「将来の累積報酬」を1遷移ずつ学べる局所ターゲットへ変える橋です。
6. 動的計画法・Monte Carlo・TD 学習
これらの違いは主に学習ターゲットです。動的計画法は既知の遷移モデルと期待値、Monte Carlo はエピソード終了後の実収益、TD は次状態の現在価値推定を使ってブートストラップします。現代 RL の多くは TD の拡張とみなせます。
重要ポイント
- Monte Carlo はブートストラップ偏りがありませんが、分散が大きく、完全な収益が必要です。
- TD は低分散でオンライン学習できますが、推定誤差をブートストラップで伝播する可能性があります。
- n-step return と TD(λ) は 1-step TD と Monte Carlo の中間を実現します。
7. SARSA と Q-Learning:On-policy と Off-policy
SARSA と Q-learning はどちらも Q(s,a) を学びますが、ターゲットが異なります。SARSA は実際に次に選んだ行動を使うため on-policy、Q-learning は次状態の最大 Q を使って最適 greedy 方策へ向かうため off-policy です。
重要ポイント
- ε-greedy は確率 ε でランダム行動、それ以外は argmax Q を選ぶ探索法です。
- Q-learning は別の行動方策が生成したデータからも学べるため、リプレイやオフラインデータに適します。
- 関数近似では off-policy・bootstrapping・approximation の組合せが不安定化しやすく、DQN に安定化技術が必要な理由です。
8. DQN:経験再生とターゲットネットワークが必要な理由
DQN は Q-table をニューラルネット Q_θ(s,a) に置き換えます。しかし連続サンプルの相関と、θ 更新に伴うターゲットの移動が不安定性を生みます。経験再生で相関を弱め、ターゲットネットワーク θ⁻ をゆっくり更新して学習目標を安定化します。
重要ポイント
- Replay buffer に (s,a,r,s′,done) を保存し、ランダム mini-batch で相関を弱めます。
- ターゲットネットワークは C step ごとの hard update、または Polyak averaging の soft update が使えます。
- Double DQN は行動選択と評価を分離し、max による過大評価バイアスを軽減します。
- DQN は離散行動向けで、連続制御には方策勾配や Actor–Critic が一般的です。
学習ループ
環境と相互作用 → transition を replay に保存 → batch をサンプル → target network で y を作成 → TD 二乗誤差を最小化 → 定期的に target network を更新。
9. 方策勾配:方策を直接最適化
方策勾配法は Q を学んで argmax するのではなく、π_θ(a|s) を直接パラメータ化して期待収益を最大化します。log π の勾配に収益や Advantage を掛けることで、良かった行動の確率を上げ、悪かった行動の確率を下げます。
重要ポイント
- 離散行動では categorical、連続行動では Gaussian 方策が一般的です。
- REINFORCE は基本形では不偏ですが分散が大きくなります。
- V(s) のような状態依存 baseline を引くと期待勾配を変えずに分散を減らせます。
10. Actor–Critic と GAE
Actor–Critic は Actor π_θ が行動を選び、Critic V_φ/Q_φ が評価します。Critic により Actor の勾配分散を下げられます。GAE は複数ステップの TD error を λ で重み付けし、バイアスと分散を調整する方法で PPO などに使われます。
重要ポイント
- λ≈0 は 1-step TD に近く、低分散だが bootstrap bias が増えます。
- λ≈1 は Monte Carlo に近く、低バイアスだが高分散です。
- Critic の質が低いと Actor 更新も不安定・誤方向になり得ます。
11. PPO:実用的に安定した方策更新
PPO が広く使われる理由は、方策勾配の単純さを保ちつつ、危険な大更新を制限できる点です。新旧方策の確率比 r_t(θ) を使い、clip 目的で Advantage による過大な変化を抑えます。PPO は on-policy なので、古いデータを無制限に再利用する方法ではありません。
重要ポイント
- 典型的な PPO は rollout を収集し、そのデータで数 epoch mini-batch 更新した後、再び新しい rollout を集めます。
- 総損失は通常、policy loss、value loss、探索を促す entropy bonus からなります。
- Advantage 正規化、観測正規化、reward scale、gradient clipping、terminal 処理も実装上非常に重要です。
よくある誤り
- PPO を off-policy のように扱い、古いデータで過度に更新する。
- 報酬項のスケール差が大きすぎて一部の勾配が支配する。
- 連続制御で行動境界と squashing 後の log-prob 補正を無視する。
12. 制約付き・安全RL:制御との接続
工学システムでは報酬最大化だけでは不十分です。エネルギー、衝突回避、遅延、キュー安定性、入力制限はハード制約です。CMDP は報酬と制約コストを分離し、コスト上限の下で収益を最適化します。安全クリティカル用途では MPC、CBF、shield、最適化修復層と組み合わせて実行前に行動を検証します。
重要ポイント
- Lagrangian 法は制約を適応的ペナルティへ変えますが、各時刻の厳密な可行性までは保証しないことが多いです。
- Safety layer は小規模最適化で RL 行動を最小限修正し、既知制約を満たします。
- 信頼できるモデルがなく十分な相互作用が可能なら model-free RL、モデルとハード制約が重要なら MPC、ネットワーク制御ではハイブリッドが有力です。
この節の要点
このノート後には、現代 RL 論文の state/action/reward、価値ターゲット、方策更新、on/off-policy、探索、制約処理を読み解けることを目標とします。