标签: #efficiency
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
把预训练检查点变成长上下文混合模型 — HyLo 的升级改造配方
混合序列模型(注意力 + 线性·SSM 块)在长上下文上更有优势,但迄今为止大多需要从头重新预训练。2026 年 4 月的预印本 HyLo 提出了一份配方:只用廉价的后处理训练,就把已经训练好的 Transformer 检查点"升级改造"成混合模型 — 混入 MLA(潜在注意力)和 Mamba2、Gated DeltaNet 这类线性块,再叠加分阶段的长上下文训练与教师蒸馏。作者报告称,在把上下文最多拉长到 32 倍的同时,KV 缓存内
2026-07-11 · 9 分钟阅读 #ai#llm#long-context#architecture#efficiency为每一步选择该思考多少 — Ares 的自适应推理努力路由
本文从实践角度梳理了 Ares(2026 年 3 月的预印本)。这篇论文把推理努力当作以步骤为单位的成本杠杆,而不是任务整体层面的选择。一个轻量级路由器查看交互历史,预测每一步所需的最低推理级别,从而减少让所有步骤都以最大努力运行的浪费。作者报告称,在 TAU-Bench、BrowseComp-Plus、WebArena 上,推理 token 最多削减了 52.7%,而成功率下降甚微——但这是未经独立验证的作者自报数值。本文一并讨论路由
2026-07-11 · 7 分钟阅读 #ai#agents#llm#efficiency