标签: #evaluation
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 19 篇
奖励作弊 — 指标在涨,任务在败
如果对智能体来说,让测试通过最便宜的办法是改测试,它就会去改测试。奖励作弊不是 bug,而是对我们写下的目标的精确优化。框架工程系列第 6 篇,整理了放宽评分标准、删除断言这类常见形态,权限隔离能抹掉的那一半,以及牵制指标的设计。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트评估者瓶颈 — 弱评分者会成为整个系统的上限
不管怎么修框架,分数就是不动——瓶颈可能不在框架,而在评估者。测不出来的质量就选不出来,所以弱评分者会成为整个系统的上限。框架工程系列第 5 篇,梳理了从冒烟测试到单元测试、评分细则(rubric)、封存评分数据、牵制指标面板的评估者阶梯,以及为什么必须先校准评估。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架不是配置,而是交付物 —— 自我改进循环真正的瓶颈
Lilian Weng 在 2026 年 7 月整理的那篇框架工程(harness engineering)文章,给包裹着模型的整个系统起了名字,把它当成一个工程对象。本文不复述那个定义,而是讨论:当你把框架当作带版本的交付物而不是配置文件来对待时,会有什么不同。文中梳理了给框架打指纹以捕捉回归的做法、把上下文当成 playbook 而不是越写越长的提示词的做法,以及为什么自我改进循环真正的瓶颈不是模型而是评估者。
2026-08-09 · 11 分钟阅读 #llm#agent#harness-engineering#context-engineering#evaluation评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluationLLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registryGemini Robotics 2 与机器人基础模型 —— 全身控制真正改变了什么
2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2,宣布用一个视觉-语言-动作模型来控制人形机器人,从脚尖到指尖一以贯之。有意思的是,随之公布的数字读起来不像是炫耀,反而更像是对当前状态的诚实记录 —— 拧开灯泡的成功率是 92%,拧上去是 36%,从地板上捡东西是 45.7%。本文梳理 VLA 到底是什么、全身控制为什么比上肢操作更难、跨具身泛化为什么才是真正的瓶颈,以及该怎样正
2026-07-31 · 22 分钟阅读 #ai#robotics#vla#foundation-models#evaluationRAG 答非所问时 — 区分检索失败与生成失败的调试流程
RAG 给出错误答案时,多数人先去改提示,但真实原因大多出在检索阶段。本文先给出一次实验就能把检索失败与生成失败切开的流程——把正确分块直接手动喂进去,然后讲清为什么分块是最常见的凶手、嵌入相似度与语义相似度分道扬镳的地方、混入 BM25 常常获胜的理由、重排序值回票价的条件,以及给分块加上文档标题和元数据后的效果。最后附上构建黄金集并测量 recall@k 与答案包含率的代码。
2026-07-26 · 18 分钟阅读 #llm#rag#retrieval#chunking#evaluation不靠感觉做 LLM 评测 — 样本量、评判者偏差与 CI 回归测试
改完提示就凭“好像变好了”上线的团队,没有办法看见悄悄堆积的回归。本文把评测分成断言、黄金数据集、LLM-as-judge、人工评估四个层次,梳理各自的成本与可信度,并讲清如何抵消评判模型的位置偏差和长度偏好。文中算出用 20 个样例得出的结论其置信区间到底有多宽,并用代码展示配对比较能把所需样本压到几分之一。还包括在温度 0 也无法完全复现的环境里如何搭建 CI 回归测试。
2026-07-26 · 16 分钟阅读 #llm#evaluation#llm-as-judge#statistics#regression-testingAI 代码评审到底能不能用 — 测量证据揭示的准确率与误报
AI 代码评审工具的营销话术里充斥着「80% 的 PR 不需要人类评论」这样的数字,但真正把精确率和误报率一起公开的地方几乎没有。把公开的测量结果收集起来看,方向大体一致 — 在开源 PR 上,AI 评审评论真正带来代码变更的比例因工具而异,只有 0.9~19.2%,远低于人类评论的 60%(Gan 等,GitHub Actions 16 款·仓库 178 个·评论 22,326 条)。而在一家把评论解决写进政策强制执行的企业案例里,同
2026-07-17 · 38 分钟阅读 #ai#code-review#static-analysis#evaluation#software-engineering模拟客户从不离开 — LLM 用户模拟器在哪里把智能体的分数吹高了
在 τ-bench 这一类对话式智能体基准测试里,"用户"这个角色由另一个 LLM 来扮演。可这个模拟器不是被测量的对象,而是测量工具本身,工具是需要校准的。2026 年发表的三项验证研究都指向同一个方向 — 模拟出来的用户太配合了。一项把 τ-bench 协议原样搬给 451 名真人跑的研究报告说,模拟器制造出的"简单模式"会把智能体的成功率推到高于人类基线的水平;另一项研究报告说,换一个用户 LLM,成功率最多能摆动 9 个百分点。
2026-07-16 · 36 分钟阅读 #ai#llm#evaluation#agents#simulationtts-bench:当质量主观时,如何比较本地 TTS
tts-bench 是开发者 5uck1ess 打造的本地基准测试,让你在手头的硬件上比较 55 个 TTS 模型。它把评测拆成三个视角:速度(TTFA、RTF、内存)、试听(用耳朵判断每一个模型)、评分(UTMOS、WER、SIM)。最有意思的是它对主观性的坦诚——没有一个"最好听"的单一分数,因为质量取决于你的耳朵和用途。本文梳理这个工具实际测量什么,客观指标在哪里有帮助、在哪里会误导,以及如何为自己的工作负载挑选合适的 TTS。
2026-07-11 · 8 分钟阅读 #tts#text-to-speech#benchmark#local-ai#evaluation编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarks从 UniClawBench 看 2026 年的智能体基准测试 — 存活容器与隐藏的监督者
香港大学(HKU)MMLab 于 2026 年 7 月投稿到 arXiv 的 UniClawBench,是一个标榜"能力驱动(capability-driven)"的主动式智能体基准测试。它不再与预先静态记录好的标准答案做比对,而是在存活的 Docker 容器中用步骤级检查点来评分,并以执行者、隐藏的监督者、用户智能体组成的闭环来模拟多轮反馈。其核心在于:把 400 个双语任务划分为五种能力,并力图将基座模型的实力与智能体框架的设计分开
2026-07-11 · 9 分钟阅读 #ai#agents#evaluation#benchmark#llmPydanticAI 实战指南:2026 年 Python 团队为什么在生产级智能体中采用它
面向需要 Python 优先的智能体系统、模型可移植性、持久化工作流、可观测性与评估体系的团队的 PydanticAI 实战指南。
2026-04-12 · 10 分钟阅读 #pydantic#pydantic-ai#python#ai-agent#mcpMastra 实战指南:2026 年 TypeScript 团队为什么在生产 AI 智能体中采用它
面向需要在一套开源 TypeScript 技术栈中同时处理智能体、记忆、工作流、可观测性、评估与生产部署的团队,这是一份 Mastra 实战指南。
2026-04-12 · 10 分钟阅读 #mastra#typescript#ai-agent#mcp#memoryOpenAI、Azure、AWS 企业级 Agent 可观测性与评估比较指南
对比 OpenAI、Azure、AWS 在 Agent 可观测性、评估、仪表盘、OpenTelemetry 集成上的差异,并为平台、产品、基础设施团队整理了一份做出上线决策的实务指南。
2026-04-12 · 5 分钟阅读 #openai#azure#aws#observability#evaluationOpenAI RFT 与自定义评分器:面向产品和平台团队的实践指南
一份关于 OpenAI 强化微调(RFT)搭配自定义评分器的实践指南,涵盖何时该用它、如何准备数据、如何评估检查点,以及如何安全地上线。
2026-04-12 · 9 分钟阅读 #ai-platform#openai#rft#reinforcement-fine-tuning#custom-graders把 Gemini API 送上生产环境需要的 Prompt、Guardrails、Evaluation
从运维视角梳理把 Gemini API 接入实际服务时所需的提示词设计、structured output、safety 策略、评估循环、成本控制方法的一份指南。
2026-03-17 · 7 分钟阅读 #gemini#generative-ai#ai#llmops#prompt-engineeringAI 基准数据集完全指南:ImageNet、COCO、GLUE、MMLU、HumanEval
AI 模型评估用主要基准数据集完全指南。详细解析计算机视觉(ImageNet、COCO、ADE20K)、NLP(GLUE、SuperGLUE、SQuAD、MMLU)、代码(HumanEval、MBPP)、LLM 评估(HELM、MT-Bench)。
2026-03-17 · 34 分钟阅读 #benchmark#datasets#imagenet#coco#glue