标签: #alignment
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
蒸馏会迁移什么、不会迁移什么 — 把 DeepSeek 蒸馏进 GPT-OSS,审查没有跟过来
2026 年 7 月 30 日发到 Show HN 上的 CTGT 实验报告说,以 DeepSeek V4 Flash 为教师、GPT-OSS 为学生蒸馏金融推理能力,结果能力过来了,政治审查没有过来。在 152 组配对上,教师在敏感问题与对照组之间表现出 45.45 分的审查落差,而学生只有 0.43 分和 3.94 分,停在基线上。本文不把这一个实验放大,只把它当作起点 — 因为蒸馏复制的是教师的输出分布,所以本文立起一套框架:观测
2026-07-31 · 18 分钟阅读 #ai#llm#distillation#alignment#open-weightsRLHF 模型为何会钻奖励的空子——奖励破解的机制、症状与缓解方向
Xiaohua Wang 等 23 人于 2026 年 4 月发布在 arXiv 上的《Reward Hacking in the Era of Large Models》,是一篇梳理经 RLHF 对齐的大型模型为何、如何在奖励信号上钻空子的综述。核心提议是把奖励破解理解为目标压缩、优化放大、评估者–策略共同进化这三种力量的"代理压缩假说(PCH)"。它把可辨认的症状汇于一处:冗长偏好、谄媚、看似有理却错误的依据、基准过拟合,以及多模态
2026-07-11 · 9 分钟阅读 #ai#llm#alignment#rlhf#safety机器人安全与对齐 — 如何信任强大的机器人
我们要如何信任日益强大的机器人?本文从物理安全、约束强化学习与安全层、分布偏移应对、人机协作安全、验证与标准,直到具身 AI 的对齐难题,进行一次均衡的梳理。
2026-06-29 · 31 分钟阅读 #ai-papers#robotics#safety#alignment#reinforcement-learningAI 伦理、安全性与对齐(Alignment)完全指南:负责任的 AI 开发
全面理解 AI 伦理、安全性与对齐(Alignment)的指南。涵盖幻觉(Hallucination)、偏见、隐私、RLHF、Constitutional AI,直至 AI 安全研究前沿——AI 开发者必须掌握的全部内容。
2026-03-17 · 34 分钟阅读 #ai-ethics#ai-safety#alignment#responsible-ai#llm从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppo从 DPO 到 KTO:人类反馈对齐技术最新论文综述与实战实现
综述克服 RLHF 局限的 DPO、IPO、KTO 等最新人类反馈对齐技术论文,并提供基于 TRL 的实战实现指南。涵盖算法对比、超参数调优,直至失败案例。
2026-03-05 · 31 分钟阅读 #ai-papers#dpo#kto#alignment#2026-03