标签: #ppo
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
强化学习完全精通:从 DQN、PPO 到 RLHF、DPO 的 LLM 对齐
从 MDP 基础到 DQN、PPO、SAC、RLHF、DPO。结合 PyTorch 与 Stable-Baselines3 代码,完全精通用于 LLM 对齐的强化学习技术。
2026-03-17 · 20 分钟阅读 #reinforcement-learning#ppo#dqn#rlhf#dpo从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppo强化学习(Reinforcement Learning)完全指南:从理论基础到最新算法、实战实现
从强化学习的核心理论 MDP、Bellman 方程,到 Q-Learning、DQN、Policy Gradient、A3C、PPO、SAC 等主要算法逐一用公式推导,并系统整理 RLHF、AlphaGo、机器人应用案例与 PyTorch 实现示例。
2026-03-01 · 59 分钟阅读 #reinforcement-learning#deep-learning#dqn#ppo#rlhf