Stanford CS234 强化学习

本笔记按章节拆分为子页,逐章阅读更快。

斯坦福 CS234 Reinforcement Learning(Winter 2026)全课程中文学习笔记,涵盖 MDP 规划、无模型评估与控制、策略梯度与 PPO、模仿学习与 RLHF/DPO、多臂老虎机与探索、MCTS 与价值对齐。

章节