标签: #rlhf
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
RLHF 模型为何会钻奖励的空子——奖励破解的机制、症状与缓解方向
Xiaohua Wang 等 23 人于 2026 年 4 月发布在 arXiv 上的《Reward Hacking in the Era of Large Models》,是一篇梳理经 RLHF 对齐的大型模型为何、如何在奖励信号上钻空子的综述。核心提议是把奖励破解理解为目标压缩、优化放大、评估者–策略共同进化这三种力量的"代理压缩假说(PCH)"。它把可辨认的症状汇于一处:冗长偏好、谄媚、看似有理却错误的依据、基准过拟合,以及多模态
2026-07-11 · 9 分钟阅读 #ai#llm#alignment#rlhf#safety强化学习完全精通:从 DQN、PPO 到 RLHF、DPO 的 LLM 对齐
从 MDP 基础到 DQN、PPO、SAC、RLHF、DPO。结合 PyTorch 与 Stable-Baselines3 代码,完全精通用于 LLM 对齐的强化学习技术。
2026-03-17 · 20 分钟阅读 #reinforcement-learning#ppo#dqn#rlhf#dpo从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppoDPO(Direct Preference Optimization)论文深度解析 — 无需 RLHF 对齐 LLM
从 DPO 的数学原理到实现、与 RLHF 的比较,以及 IPO/KTO/ORPO 变体 — 从实务角度深入分析 LLM 偏好优化的核心。
2026-03-09 · 26 分钟阅读 #ai-papers#dpo#rlhf#llm-alignment#preference-optimizationGPT 系列论文完全解析:从 GPT-1 到 GPT-4,语言模型改变世界的历程
按代际完整解析 OpenAI 的 GPT 系列。从 GPT-1 的无监督预训练、GPT-2 的 Zero-shot 学习、GPT-3 的 In-context Learning 与 Scaling Law、InstructGPT 的 RLHF,到 GPT-4 的多模态 — 用公式梳理每篇论文的核心贡献与架构演进。
2026-03-01 · 54 分钟阅读 #gpt#openai#language-model#transformer#pre-training强化学习(Reinforcement Learning)完全指南:从理论基础到最新算法、实战实现
从强化学习的核心理论 MDP、Bellman 方程,到 Q-Learning、DQN、Policy Gradient、A3C、PPO、SAC 等主要算法逐一用公式推导,并系统整理 RLHF、AlphaGo、机器人应用案例与 PyTorch 实现示例。
2026-03-01 · 59 分钟阅读 #reinforcement-learning#deep-learning#dqn#ppo#rlhf