标签: #statistics
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
为自家服务搭建评测集 —— 从流量采集到统计显著性判定
公开基准测试没法替你测量自己的问题,因为输入分布、正确答案的定义、失败的成本结构统统不一样。本文用真实代码走一遍完整流程:从实际流量里捞出案例、按失败类型分层、给没有唯一正确答案的任务套上评分细则(rubric)、接上打分脚本。文章还讲了如何用置信区间估算需要多少样本才够、以及如何用 McNemar 检验和自助法(bootstrap)判断小评测集上两个模型 5 个百分点的差距是否具有统计意义。最后整理了如何把评测集接入 CI、如何防止污
2026-08-02 · 32 分钟阅读 #llm-evaluation#eval-set#rubric#statistics#regression-testing邓宁-克鲁格效应 — 那张著名的曲线图并不在原论文里
网上四处流传的“愚昧之巅”曲线图,在邓宁与克鲁格1999年的论文里根本不存在。原论文是四项研究:让康奈尔大学的本科生完成幽默、逻辑与语法任务,再按成绩四分位比较自我评价;真实结果显示,高分组低估自己的幅度,和低分组高估自己的幅度不相上下。更扎心的批评还在后面——把自我评价与实际成绩换成毫无关系的随机数,照样能画出一模一样的图。向平均回归造成的错觉、重新分析929人的2020年论文,以及即便如此仍然值得保留的元认知训练价值,本文一并梳理。
2026-07-26 · 15 分钟阅读 #psychology#paper-review#metacognition#self-assessment#statistics不靠感觉做 LLM 评测 — 样本量、评判者偏差与 CI 回归测试
改完提示就凭“好像变好了”上线的团队,没有办法看见悄悄堆积的回归。本文把评测分成断言、黄金数据集、LLM-as-judge、人工评估四个层次,梳理各自的成本与可信度,并讲清如何抵消评判模型的位置偏差和长度偏好。文中算出用 20 个样例得出的结论其置信区间到底有多宽,并用代码展示配对比较能把所需样本压到几分之一。还包括在温度 0 也无法完全复现的环境里如何搭建 CI 回归测试。
2026-07-26 · 16 分钟阅读 #llm#evaluation#llm-as-judge#statistics#regression-testingAI/ML 数学完全指南:线性代数、微积分与概率统计
一份帮你彻底掌握理解 AI 与机器学习所需核心数学的指南。涵盖线性代数(向量、矩阵、特征值)、微积分(偏导数、链式法则)、概率统计(概率分布、最大似然估计、贝叶斯),并配合直观讲解。
2026-03-17 · 34 分钟阅读 #mathematics#linear-algebra#calculus#probability#statisticsAI 数学完全指南 — 从线性代数到信息论
用代码和直觉梳理 AI/深度学习所需的数学:线性代数(矩阵、特征值)、微积分(偏导数、反向传播)、概率/统计(贝叶斯、分布)、优化(梯度下降法)、信息论(熵、KL 散度)。
2026-03-02 · 17 分钟阅读 #ai#mathematics#linear-algebra#calculus#probability