Blog
Thoughts
About
Reinforcement Learning
September 30, 2024
Mastering Reinforcement Learning
蘑菇书EasyRL
Reinforcement Learning Cheat Sheet
Intro to Reinforcement Learning: Monte Carlo to Policy Gradient
RLHF
图解大模型RLHF系列之:人人都能看懂的PPO原理与源码解读 - 知乎
详解RLHF
人人都能看懂的DPO数学原理 - 知乎
详解近端策略优化(ppo,干货满满) - 行者AI - 博客园
Berkeley CS 285
Deep Reinforcement Learning 10-703 • Fall 2022 • Carnegie Mellon University
CS885 Winter 2022 - Reinforcement Learning by Waterloo