标签: #reasoning
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
LLM 做不到的不是证明,而是立起前提
ICML 2026 的立场论文 Position: LLMs can not jump 主张,生成式 AI 已经掌握了归纳,也正在快速攻下演绎,但对于造出新解释性假说的溯因推理,它在结构上根本到不了。本文不去复述那套论证,而是去问:假定它成立的话,我们此刻正在做的系统,设计上该改哪里。假说空间从哪里供给,为什么必须把提出与反驳拆开,以及「这是一篇立场论文」这个事实该如何影响你的读法。
2026-08-09 · 12 分钟阅读 #ai#llm#reasoning#abduction#research想得更多不等于答得更对:测试时计算与过度思考
2026年4月,Shu Zhou 等6人在 "When More Thinking Hurts" 中,对一味增加推理 token 的潮流正面提出质疑。据作者们报告,计算预算越大,额外推理 token 的边际效用就下降得越多,而从某个点开始,模型会陷入"过度思考",亲手推翻自己此前已经答对的答案。最优思考长度因问题难度而各不相同,因此给所有问题相同预算的做法并不高效。摘要并未给出具体的模型名称或数值,所以我只谨慎地带回方向性。
2026-07-11 · 10 分钟阅读 #ai#llm#reasoning#inference#test-time-computeGemini 2.5 开发者实战指南:如何选择 Pro、Flash 与 Flash-Lite
本文以 2025 年 3 月 25 日发布的 Gemini 2.5 为基准,从实务角度梳理 Pro、Flash、Flash-Lite 该如何选择、reasoning 模型如何改变工作流,以及团队实际应该部署什么。
2026-04-12 · 9 分钟阅读 #google#gemini#gemini-2-5#coding#agentic-codingAI Papers: Test-Time Scaling 核心论文梳理 — 用推理预算提升性能的方法
Test-Time Scaling(TTS)不增加训练参数,而是通过增加推理阶段的计算预算来提升性能。本文从论文脉络与实务应用的角度,梳理 Best-of-N、Self-Consistency、Tree Search、以及基于 Verifier/Reranker 的方法。
2026-03-04 · 22 分钟阅读 #ai-papers#test-time-scaling#reasoning#inference#llm