标签: #하네스엔지니어링
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 8 篇
奖励作弊 — 指标在涨,任务在败
如果对智能体来说,让测试通过最便宜的办法是改测试,它就会去改测试。奖励作弊不是 bug,而是对我们写下的目标的精确优化。框架工程系列第 6 篇,整理了放宽评分标准、删除断言这类常见形态,权限隔离能抹掉的那一半,以及牵制指标的设计。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트什么是框架工程(Harness Engineering)— 模型是固定输入,你交付的是它周围的一切
用的是同一个模型,为什么各团队的智能体表现差这么多?对大多数团队来说,模型是固定输入,真正交付的是围绕模型的整个框架(harness):工具表面、失败返回格式、循环与停止条件、上下文策略、权限,以及评估者。这是框架工程系列第 1 篇,整理了框架的定义、六个旋钮,以及为什么提示词工程这个名字严重低估了这项工作。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트成长为框架工程师 — 这个岗位为何出现,该练什么
框架工程师(harness engineer)这个头衔在招聘启事里还很少见,但这份工作已经存在于每一个部署智能体的团队里。框架工程系列收官的第 8 篇,整理了这个岗位为何出现、既有软件技能如何重新排布,以及借助框架 RPG 的六个层级,从观测与指纹到自我改进循环的分级练习路径。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트评估者瓶颈 — 弱评分者会成为整个系统的上限
不管怎么修框架,分数就是不动——瓶颈可能不在框架,而在评估者。测不出来的质量就选不出来,所以弱评分者会成为整个系统的上限。框架工程系列第 5 篇,梳理了从冒烟测试到单元测试、评分细则(rubric)、封存评分数据、牵制指标面板的评估者阶梯,以及为什么必须先校准评估。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架指纹与版本管理 — 让没有记录的变更可以追踪
没有提示词提交、没有换模型,成功率却动了——该回滚什么?框架工程系列第 7 篇讲框架指纹:把构成框架的所有决定归一化后压成一个哈希。指纹里放什么、不放什么,为什么指纹相同比较才成立,以及如何沿着指纹历史二分定位回归并回滚。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트工具表面设计 — 一行 schema 就能移动成功率
加了更多工具,智能体成功率反而下降,这并不少见。工具表面就是智能体的接口:名字、描述、参数、失败返回、响应大小,全都是设计对象。框架工程系列第 3 篇,整理了工具数量的诅咒、命名空间与描述文案、防错(poka-yoke)参数设计,以及失败以什么格式返回。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트上下文预算 — 设计在于去掉什么,而不是放进什么
上下文窗口明明还有富余,智能体的准确率却在往下掉。上下文是有限的注意力预算,工具的 schema 也在花这笔预算。框架工程系列第 2 篇,整理了把提示词堆积改成 playbook 的做法、丢弃策略与压缩(compaction)的标准,以及委派子智能体的真实成本。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트循环设计 — 在无限循环与过早放弃之间
智能体循环的失败有两个方向:把同一个调用重复几十次的无限循环,和一碰到障碍就收工的过早停止。框架工程系列第 4 篇,整理了重试上限,固定步数、目标检查、置信度这三类停止条件,置信度停止的陷阱,以及向人和子智能体升级的路径。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트