标签: #dqn
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
强化学习完全精通:从 DQN、PPO 到 RLHF、DPO 的 LLM 对齐
从 MDP 基础到 DQN、PPO、SAC、RLHF、DPO。结合 PyTorch 与 Stable-Baselines3 代码,完全精通用于 LLM 对齐的强化学习技术。
2026-03-17 · 20 分钟阅读 #reinforcement-learning#ppo#dqn#rlhf#dpo强化学习(Reinforcement Learning)完全指南:从理论基础到最新算法、实战实现
从强化学习的核心理论 MDP、Bellman 方程,到 Q-Learning、DQN、Policy Gradient、A3C、PPO、SAC 等主要算法逐一用公式推导,并系统整理 RLHF、AlphaGo、机器人应用案例与 PyTorch 实现示例。
2026-03-01 · 59 分钟阅读 #reinforcement-learning#deep-learning#dqn#ppo#rlhf