标签: #llm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 90 篇
一篇挂着假作者的论文被接收为口头报告 —— AI 时代同行评审的系统性失败分析
2026 年 7 月 30 日,两位审稿人公开表示,他们今年夏天审的 22 篇机器学习会议投稿中,有 15 篇存在伪造引用、虚构作者,或明显的 LLM 生成痕迹。其中两篇把真实论文的作者姓名换成了假名字,尽管给出了拒稿意见并向组委会举报,这两篇论文最终仍以"只需修正幻觉参考文献"为条件被接收为口头报告。本文不把这件事当成一个值得愤怒的八卦来读,而是当作一次系统性失败来分析:标记流程实际抓住了什么,投稿量激增和强制互审如何挤压整条流水线,
2026-07-31 · 22 分钟阅读 #ai#peer-review#research-integrity#llm#academia用提示词生成 3D CAD 这件事 —— 网格与 B-rep 之别,以及约束条件这个瓶颈
GeekNews 的 Show GN 板块上出现了一个叫 CAID 的工具,能用提示词生成 3D CAD 模型。作者自己坦承的局限,恰好精准概括了整个领域的现状 —— 没有自动尺寸校验,无法判断公差、DFM 和可加工性,而且明确说明输出只是一个已验证的原型,不能直接用于制造。从工程角度看,问题只有一个:CAD 是参数化、基于约束的系统,"生成一个网格"和"生成一个带有可编辑特征、真正可制造的模型"是完全不同的两件事。本文梳理 B-rep
2026-07-31 · 19 分钟阅读 #ai#cad#llm#manufacturing#geometry26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeGPT-5.6 与性价比的极限 — 如何在曲线上找到自己负载的位置
OpenAI 在 2026 年 7 月 30 日把 GPT-5.6 Luna 降价 80%、Terra 降价 20%。距离 7 月 9 日正式发布只有三周,而最顶端的 Sol 价格不变。Luna 从每 100 万 token 输入 1 美元、输出 6 美元,变成输入 0.20 美元、输出 1.20 美元。本文不介绍降价幅度,而是计算这条曲线 — 降价后三个档位的单价比在两个轴上都恰好锁定为 25 比 10 比 1,因此在同一系列内部 t
2026-07-31 · 17 分钟阅读 #ai#llm#openai#inference-cost#prompt-cachingDeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moe蒸馏会迁移什么、不会迁移什么 — 把 DeepSeek 蒸馏进 GPT-OSS,审查没有跟过来
2026 年 7 月 30 日发到 Show HN 上的 CTGT 实验报告说,以 DeepSeek V4 Flash 为教师、GPT-OSS 为学生蒸馏金融推理能力,结果能力过来了,政治审查没有过来。在 152 组配对上,教师在敏感问题与对照组之间表现出 45.45 分的审查落差,而学生只有 0.43 分和 3.94 分,停在基线上。本文不把这一个实验放大,只把它当作起点 — 因为蒸馏复制的是教师的输出分布,所以本文立起一套框架:观测
2026-07-31 · 18 分钟阅读 #ai#llm#distillation#alignment#open-weights用 LLM 搭建企业内部知识库这件事 —— 权限感知检索、新鲜度,以及上线前必须准备的评测集
Cerebras 在 2026 年 7 月 15 日公开的内部知识库搭建记录,揭示了一个日均处理超过 15,000 次查询、由人、自动化脚本和智能体共同调用的系统的内部结构。但企业内部知识库中团队真正容易低估的部分,并不是分块(chunking)或重排(reranking),而是权限、新鲜度、删除传播,以及真相来源(source of truth)的冲突。一个会泄露 HR 文档的搜索,还不如没有搜索;一个自信地引用已经作废的运维手册(r
2026-07-31 · 23 分钟阅读 #ai#rag#enterprise-search#llm#platform-engineeringRAG 答非所问时 — 区分检索失败与生成失败的调试流程
RAG 给出错误答案时,多数人先去改提示,但真实原因大多出在检索阶段。本文先给出一次实验就能把检索失败与生成失败切开的流程——把正确分块直接手动喂进去,然后讲清为什么分块是最常见的凶手、嵌入相似度与语义相似度分道扬镳的地方、混入 BM25 常常获胜的理由、重排序值回票价的条件,以及给分块加上文档标题和元数据后的效果。最后附上构建黄金集并测量 recall@k 与答案包含率的代码。
2026-07-26 · 18 分钟阅读 #llm#rag#retrieval#chunking#evaluationLLM 推理显存计算法 — 比权重先爆的是 KV cache
整理了用几次乘法回答“这个模型能装进我们的 GPU 吗”的方法。权重内存用参数量乘以每参数字节数就算完了,但真正挡住部署的是随序列长度和批大小一起长大的 KV cache。本文用数字讲清 KV cache 公式、GQA 把它压到几分之一的原理、预填充激活与框架开销的量级、PagedAttention 消除的碎片损失,以及 4bit 量化并不免费的理由,并附上一个从现有显存反推可并发序列数的计算器函数。
2026-07-26 · 16 分钟阅读 #llm#inference#vram#kv-cache#quantizationLLM API 成本优化 — 输出 token、prompt caching 与路由的盈亏平衡计算
把 LLM API 账单砍掉一半靠的是算术,不是感觉。由于输出 token 的单价是输入的数倍,最大的杠杆几乎总是控制输出长度,其次才是 prompt caching。本文整理了缓存只命中前缀这一约束如何强制决定提示的排列顺序、RAG 与全文塞入的盈亏平衡点在哪里、模型路由的节省公式以及随之而来的精度损失该如何用同一把尺子衡量,并给出模拟月度成本的代码,以及 token 估算与实际账单对不上的五个原因。
2026-07-26 · 17 分钟阅读 #llm#cost-optimization#prompt-caching#rag#model-routingLLM structured output 的稳定化 — 消灭解析失败的四层防御
明明要的是 JSON,回来的却裹着 markdown 代码围栏,或者后面跟了一句说明,又或者在 token 上限处被截断——本文整理了按层次解决这些问题的方法。先对失败类型做分类,再把防御从提示指令一路叠到函数调用 schema 与约束解码,同时把“约束解码只保证语法有效性、不保证语义正确性”这条界线讲清楚。字段名与顺序为什么会改变精度、把错误信息回灌给模型的重试循环怎么实现、如何检测并应对截断,都用代码讲。
2026-07-26 · 16 分钟阅读 #llm#structured-output#json-schema#constrained-decoding#validation不靠感觉做 LLM 评测 — 样本量、评判者偏差与 CI 回归测试
改完提示就凭“好像变好了”上线的团队,没有办法看见悄悄堆积的回归。本文把评测分成断言、黄金数据集、LLM-as-judge、人工评估四个层次,梳理各自的成本与可信度,并讲清如何抵消评判模型的位置偏差和长度偏好。文中算出用 20 个样例得出的结论其置信区间到底有多宽,并用代码展示配对比较能把所需样本压到几分之一。还包括在温度 0 也无法完全复现的环境里如何搭建 CI 回归测试。
2026-07-26 · 16 分钟阅读 #llm#evaluation#llm-as-judge#statistics#regression-testingRAG · 微调 · 长上下文 — 我的问题该用哪个:论文实际测量了什么,以及没有人测量过什么
这是 LLM 架构领域被问得最多的问题,但大多数答案是没有任何出处的决策树。本文只用测量过的东西来回答。微调无法注入新知识,这一点已被多篇论文反复测量(Ovadia 等、Gekhman 等);看起来正相反的农业案例研究,实际测的是另一种干预(无监督持续预训练 vs 有监督 Q&A 微调),因此并不冲突。长上下文在位置、长度、词汇三条轴上各自崩塌(lost-in-the-middle、Databricks 对 20 个模型的测量、NoLi
2026-07-17 · 34 分钟阅读 #rag#llm#fine-tuning#long-context#aiLLM API 成本如何真正降下来 — 「缓存 90% 折扣」到了账单上为什么只有 25%
提示词缓存的缓存读取只有输入价格的十分之一。但这并不会把账单砍掉 90%。照着 Anthropic 放在自家文档里的计算示例走一遍:即便缓存完全命中,总额也只是从 0.705 美元降到 0.525 美元,减少 25.5%。原因很简单 — 折扣只按该项目在账单中的花钱比例缩减账单,而输出 token 已经吃掉了成本的 60%。所以本文不罗列折扣率,而是直接把账单算出来。缓存的盈亏平衡点(要读几次才回本)、缓存完全不生效的最小 token
2026-07-17 · 32 分钟阅读 #llm#cost-optimization#prompt-caching#api#ai在本地跑 LLM 到底需要多少 VRAM — 别查表,用公式算
「8B 模型需要几 GB」这个问题的正确答案不是一张表,而是两个公式。权重是参数量乘以 bpw 除以 8;KV 缓存是 2 乘以层数乘以 KV 头数乘以 headdim 乘以字节数乘以 token 数。本文把这两个公式直接对照 llama.cpp 的源代码与官方表格来验证 — 从 ggml 块结构体推导出的 Q80 的 8.5 bpw,与 llama.cpp 发布的 8.5008 吻合到小数点后第三位;用同样的方式反推出的参数量为 8.
2026-07-17 · 34 分钟阅读 #llm#quantization#kv-cache#local-llm#gpuAI 智能体的记忆实际上是怎么做出来的 — 四种设计,以及基准测试实际证明了什么
「智能体记忆」不是一种单一技术,而是把至少四种彼此不同的设计笼统打包的说法 — 文件草稿板、摘要/compaction、向量召回、知识图谱。本文先用产品文档确认每一种实际在做什么,然后抛出一个更不舒服的问题:「哪种更好」的证据真的被测量过吗? 直接去读 Mem0 论文(arXiv:2504.19413)的表格就会发现,头条的「相对 OpenAI 提升 26%」是事实,但在同一张表里,把整段对话原样贴进提示词的全上下文方式以 J 72.9
2026-07-17 · 31 分钟阅读 #ai#ai-agent#agent-memory#llm#benchmark上下文工程取代了提示词工程吗 — 哪些被测量过,哪些没有
「提示词工程已死」这句话,在创造这个术语的任何一手来源里都不存在。Karpathy 把 few-shot 示例和任务描述列为上下文工程的组成部分,Anthropic 则写道这是「提示词工程的自然演进(natural progression)」。也就是说,不是替代,而是包含。尽管如此,「这确实是一件不同的工作」是有证据的 — Chroma 的 LongMemEval 实验把问题和措辞原样保留,只把周围上下文从 300 token 增加到
2026-07-17 · 30 分钟阅读 #llm#context-engineering#prompt-engineering#long-context#ai-agent模拟客户从不离开 — LLM 用户模拟器在哪里把智能体的分数吹高了
在 τ-bench 这一类对话式智能体基准测试里,"用户"这个角色由另一个 LLM 来扮演。可这个模拟器不是被测量的对象,而是测量工具本身,工具是需要校准的。2026 年发表的三项验证研究都指向同一个方向 — 模拟出来的用户太配合了。一项把 τ-bench 协议原样搬给 451 名真人跑的研究报告说,模拟器制造出的"简单模式"会把智能体的成功率推到高于人类基线的水平;另一项研究报告说,换一个用户 LLM,成功率最多能摆动 9 个百分点。
2026-07-16 · 36 分钟阅读 #ai#llm#evaluation#agents#simulation改变 LoRA 的 rank 就要跟着改学习率吗 — μA(2026) 划出的两种机制,以及这个测量结果的边界
LoRA 中改变 rank 就必须重新寻找最优学习率的说法,和「用 1/r 缩放,学习率就与 rank 无关」的说法,在实务中同时流传。2026 年 2 月挂上 arXiv 的 μA(Maximal-Update Adaptation) 论文说,这两种说法都对 — 只是取决于你用的是哪种 α 约定、哪种初始化。本文梳理 μA 推导出的两种机制(η 与 rank 的 -1/2 次方成正比的情形,vs 与 rank 无关的情形),以及论文主
2026-07-16 · 28 分钟阅读 #llm#lora#fine-tuning#peft#trainingPD 分离并不会提升吞吐量 — 预填充/解码分离实际买到的是什么
把预填充和解码拆到不同 GPU 上的 PD 分离,是 2026 年 vLLM、SGLang、TensorRT-LLM 都已经引入的设计,但无论从哪里看,流传的都只是"2 倍到 7 倍"这样的数字。然而 vLLM 官方文档却用大写字母把同一个功能钉死为"分离式预填充并不会提升吞吐量"。两者其实都对 — 因为那些厂商数字测的从来都不是吞吐量,而是 goodput(满足 SLO 的处理量),或者是在固定延迟目标条件下的吞吐量。本文梳理 PD
2026-07-16 · 25 分钟阅读 #llm#ai#inference#kv-cache#vllm