标签: #safety
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
Ferrocene 通过认证的 core — 编译器是 ASIL D,库为什么却止步于 ASIL B
"Ferrocene 的 Rust 编译器已通过 ASIL D 认证"这句话本身没错,但人们通常从中得出的结论并不成立。Ferrocene 把编译器作为 ISO 26262 ASIL D / TCL 3 的"工具"通过了资格认定,这意味着"可以在使用这个工具的前提下开发 ASIL D 软件",而不是"产出物就是 ASIL D"。真正被你的代码每一行都调用的 core 库,走的是另一套独立认证:2025 年 12 月先以 IEC 6150
2026-07-16 · 37 分钟阅读 #embedded#rust#ferrocene#safety#systemsRLHF 模型为何会钻奖励的空子——奖励破解的机制、症状与缓解方向
Xiaohua Wang 等 23 人于 2026 年 4 月发布在 arXiv 上的《Reward Hacking in the Era of Large Models》,是一篇梳理经 RLHF 对齐的大型模型为何、如何在奖励信号上钻空子的综述。核心提议是把奖励破解理解为目标压缩、优化放大、评估者–策略共同进化这三种力量的"代理压缩假说(PCH)"。它把可辨认的症状汇于一处:冗长偏好、谄媚、看似有理却错误的依据、基准过拟合,以及多模态
2026-07-11 · 9 分钟阅读 #ai#llm#alignment#rlhf#safety机器人安全与对齐 — 如何信任强大的机器人
我们要如何信任日益强大的机器人?本文从物理安全、约束强化学习与安全层、分布偏移应对、人机协作安全、验证与标准,直到具身 AI 的对齐难题,进行一次均衡的梳理。
2026-06-29 · 31 分钟阅读 #ai-papers#robotics#safety#alignment#reinforcement-learning