标签: #benchmark
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
推理强度不是选模型,而是逐请求决定的部署参数
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#cost一条指令可能要跑 62 秒 —— 延迟是路径的属性,不是指令的属性
Assembly Hall of Shame 是一份「把单条指令跑到最慢」的比赛排行榜。垫底的 nop 是 1 个周期,第一名 fxrstor64 是 1,980 亿个周期,也就是 62 秒。把这份榜单从下往上读,它就成了现代 CPU 所有可能停顿之处的清单,并分成三个区段:微码辅助路径、跨缓存行的原子操作、TLB 失效、熵池枯竭,以及片外的 PCIe 总线。这张表真正证明的是,指令延迟这个概念离开周边状态就无法定义,而由此可以得出关于
2026-08-09 · 15 分钟阅读 #os-concepts#performance#cpu#microarchitecture#benchmark把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#scheduler拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injectionAI 智能体的记忆实际上是怎么做出来的 — 四种设计,以及基准测试实际证明了什么
「智能体记忆」不是一种单一技术,而是把至少四种彼此不同的设计笼统打包的说法 — 文件草稿板、摘要/compaction、向量召回、知识图谱。本文先用产品文档确认每一种实际在做什么,然后抛出一个更不舒服的问题:「哪种更好」的证据真的被测量过吗? 直接去读 Mem0 论文(arXiv:2504.19413)的表格就会发现,头条的「相对 OpenAI 提升 26%」是事实,但在同一张表里,把整段对话原样贴进提示词的全上下文方式以 J 72.9
2026-07-17 · 31 分钟阅读 #ai#ai-agent#agent-memory#llm#benchmarktts-bench:当质量主观时,如何比较本地 TTS
tts-bench 是开发者 5uck1ess 打造的本地基准测试,让你在手头的硬件上比较 55 个 TTS 模型。它把评测拆成三个视角:速度(TTFA、RTF、内存)、试听(用耳朵判断每一个模型)、评分(UTMOS、WER、SIM)。最有意思的是它对主观性的坦诚——没有一个"最好听"的单一分数,因为质量取决于你的耳朵和用途。本文梳理这个工具实际测量什么,客观指标在哪里有帮助、在哪里会误导,以及如何为自己的工作负载挑选合适的 TTS。
2026-07-11 · 8 分钟阅读 #tts#text-to-speech#benchmark#local-ai#evaluation从 UniClawBench 看 2026 年的智能体基准测试 — 存活容器与隐藏的监督者
香港大学(HKU)MMLab 于 2026 年 7 月投稿到 arXiv 的 UniClawBench,是一个标榜"能力驱动(capability-driven)"的主动式智能体基准测试。它不再与预先静态记录好的标准答案做比对,而是在存活的 Docker 容器中用步骤级检查点来评分,并以执行者、隐藏的监督者、用户智能体组成的闭环来模拟多轮反馈。其核心在于:把 400 个双语任务划分为五种能力,并力图将基座模型的实力与智能体框架的设计分开
2026-07-11 · 9 分钟阅读 #ai#agents#evaluation#benchmark#llmLLM、Tool Calling、Embedding 基准完全解析:每个基准到底衡量什么
MMLU、HellaSwag、HumanEval、BFCL、MTEB 等主要 AI 基准到底衡量什么、各项分数的含义与局限,以及在实际使用时该参考哪个基准,本文逐一完整解析。
2026-03-17 · 37 分钟阅读 #llm#benchmark#mmlu#mteb#bfclAI 基准数据集完全指南:ImageNet、COCO、GLUE、MMLU、HumanEval
AI 模型评估用主要基准数据集完全指南。详细解析计算机视觉(ImageNet、COCO、ADE20K)、NLP(GLUE、SuperGLUE、SQuAD、MMLU)、代码(HumanEval、MBPP)、LLM 评估(HELM、MT-Bench)。
2026-03-17 · 34 分钟阅读 #benchmark#datasets#imagenet#coco#glue