标签: #rubric
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
为自家服务搭建评测集 —— 从流量采集到统计显著性判定
公开基准测试没法替你测量自己的问题,因为输入分布、正确答案的定义、失败的成本结构统统不一样。本文用真实代码走一遍完整流程:从实际流量里捞出案例、按失败类型分层、给没有唯一正确答案的任务套上评分细则(rubric)、接上打分脚本。文章还讲了如何用置信区间估算需要多少样本才够、以及如何用 McNemar 检验和自助法(bootstrap)判断小评测集上两个模型 5 个百分点的差距是否具有统计意义。最后整理了如何把评测集接入 CI、如何防止污
2026-08-02 · 32 分钟阅读 #llm-evaluation#eval-set#rubric#statistics#regression-testing