标签: #dpo
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
强化学习完全精通:从 DQN、PPO 到 RLHF、DPO 的 LLM 对齐
从 MDP 基础到 DQN、PPO、SAC、RLHF、DPO。结合 PyTorch 与 Stable-Baselines3 代码,完全精通用于 LLM 对齐的强化学习技术。
2026-03-17 · 20 分钟阅读 #reinforcement-learning#ppo#dqn#rlhf#dpo从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppoDPO(Direct Preference Optimization)论文深度解析 — 无需 RLHF 对齐 LLM
从 DPO 的数学原理到实现、与 RLHF 的比较,以及 IPO/KTO/ORPO 变体 — 从实务角度深入分析 LLM 偏好优化的核心。
2026-03-09 · 26 分钟阅读 #ai-papers#dpo#rlhf#llm-alignment#preference-optimization从 DPO 到 KTO:人类反馈对齐技术最新论文综述与实战实现
综述克服 RLHF 局限的 DPO、IPO、KTO 等最新人类反馈对齐技术论文,并提供基于 TRL 的实战实现指南。涵盖算法对比、超参数调优,直至失败案例。
2026-03-05 · 31 分钟阅读 #ai-papers#dpo#kto#alignment#2026-03