标签: #ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 110 篇
GCC 的 AI 政策与开源世界的选择 —— 15 行这条边界线到底想守住什么
2026 年 7 月 29 日,GCC 指导委员会通过了 AI 政策工作组的建议。核心内容是:具有法律意义的贡献如果包含 LLM 生成内容或衍生自这类内容,将不予接受,判定基准线大致沿用 GNU 维护者指南里的约 15 行。不过测试用例是个例外,把 LLM 用于调研、分析、发现 bug、审查补丁本身并不受限制,只是 AI 辅助的工作需要附上 Assisted-by 标签。本文梳理这项政策实际要求了什么、其背后的版权转让与 DCO 问题、
2026-07-31 · 19 分钟阅读 #ai#open-source#gcc#licensing#governanceDeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moe在生产环境里运维 AI 智能体 — 幂等性、预算,以及自信满满的错误答案
把智能体从原型搬到生产环境时,有一片会被很晚才发现的运维表面:被重试的工具调用的幂等性、预算与步数上限、非确定性控制流的可观测性、按工具划分的权限边界,以及智能体自信满满地答错时的升级路径。最近发到 GeekNews Ask GN 上的一份分析,在 6,780 条基准测试轨迹里找到了 8,042 次重复工具执行,其中 159 次是改变状态的工具真的创建出了重复资源。本文以那份数据为起点,梳理该记录什么、该对什么设告警,以及在像第三方 A
2026-07-31 · 24 分钟阅读 #ai#agents#observability#reliability#mcpBun 把 Zig 重写成 Rust 的 11 天 — AI 大规模迁移里真正能带走的东西
本文用一手资料追踪 Bun 在 11 天内把 53.5 万行 Zig 代码迁到 Rust 的整个过程。2026 年 5 月 3 日到 14 日,动用了最多 64 个 Claude 实例、约 50 条工作流、6,502 个提交,按 API 标价折算约 16.5 万美元。本文关心的不是 11 天这个数字,而是让这个数字得以成立的条件 — 一套与语言无关的测试套件充当预言机、文件对文件一一对应的结构保持式翻译,以及编译器这第二位裁判。文章把
2026-07-31 · 19 分钟阅读 #ai#bun#rust#migration#testing蒸馏会迁移什么、不会迁移什么 — 把 DeepSeek 蒸馏进 GPT-OSS,审查没有跟过来
2026 年 7 月 30 日发到 Show HN 上的 CTGT 实验报告说,以 DeepSeek V4 Flash 为教师、GPT-OSS 为学生蒸馏金融推理能力,结果能力过来了,政治审查没有过来。在 152 组配对上,教师在敏感问题与对照组之间表现出 45.45 分的审查落差,而学生只有 0.43 分和 3.94 分,停在基线上。本文不把这一个实验放大,只把它当作起点 — 因为蒸馏复制的是教师的输出分布,所以本文立起一套框架:观测
2026-07-31 · 18 分钟阅读 #ai#llm#distillation#alignment#open-weightsGemini Robotics 2 与机器人基础模型 —— 全身控制真正改变了什么
2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2,宣布用一个视觉-语言-动作模型来控制人形机器人,从脚尖到指尖一以贯之。有意思的是,随之公布的数字读起来不像是炫耀,反而更像是对当前状态的诚实记录 —— 拧开灯泡的成功率是 92%,拧上去是 36%,从地板上捡东西是 45.7%。本文梳理 VLA 到底是什么、全身控制为什么比上肢操作更难、跨具身泛化为什么才是真正的瓶颈,以及该怎样正
2026-07-31 · 22 分钟阅读 #ai#robotics#vla#foundation-models#evaluationAI 如何在 6 月一个月内修复两年份的 Chrome 漏洞 —— 读懂 1,072 这个数字
根据谷歌在 2026 年 7 月 30 日发布的公告,仅 6 月发布的 Chrome 149 和 150 两个版本就修复了 1,072 个安全漏洞,超过了过去两年、23 个里程碑版本合计修复的 1,036 个。其中还包括一个在代码库里潜伏了 13 年以上的沙箱逃逸漏洞。本文不追热闹的标题数字,只看背后的机制 —— 从 2023 年基于 LLM 的模糊测试目标生成,到 2024 年的 Naptime、2025 年的 Big Sleep,再
2026-07-31 · 20 分钟阅读 #ai#security#chrome#fuzzing#vulnerability用 LLM 搭建企业内部知识库这件事 —— 权限感知检索、新鲜度,以及上线前必须准备的评测集
Cerebras 在 2026 年 7 月 15 日公开的内部知识库搭建记录,揭示了一个日均处理超过 15,000 次查询、由人、自动化脚本和智能体共同调用的系统的内部结构。但企业内部知识库中团队真正容易低估的部分,并不是分块(chunking)或重排(reranking),而是权限、新鲜度、删除传播,以及真相来源(source of truth)的冲突。一个会泄露 HR 文档的搜索,还不如没有搜索;一个自信地引用已经作废的运维手册(r
2026-07-31 · 23 分钟阅读 #ai#rag#enterprise-search#llm#platform-engineering用 AI 搬迁代码库的实战流程 — 先把裁判立起来,测评审率而不是行数
本文从 2026 年上半年公开的大规模 LLM 迁移案例(53 万 5 千行 Zig 转 Rust、16 万 5 千行 Python 转 TypeScript)中抽出共同的流程,整理成一份可执行的顺序。关键在于顺序 — 在开始翻译之前先立起行为预言机,并且先确认这台预言机在被故意改坏的代码上真的会亮红灯。然后沿可验证的边界切分成队列,把完成判定交给磁盘状态,让每一步都保持可回退。要测的指标不是转换了多少行,而是人真正读过的差分比例,以及
2026-07-31 · 19 分钟阅读 #ai#migration#refactoring#testing#engineeringRAG · 微调 · 长上下文 — 我的问题该用哪个:论文实际测量了什么,以及没有人测量过什么
这是 LLM 架构领域被问得最多的问题,但大多数答案是没有任何出处的决策树。本文只用测量过的东西来回答。微调无法注入新知识,这一点已被多篇论文反复测量(Ovadia 等、Gekhman 等);看起来正相反的农业案例研究,实际测的是另一种干预(无监督持续预训练 vs 有监督 Q&A 微调),因此并不冲突。长上下文在位置、长度、词汇三条轴上各自崩塌(lost-in-the-middle、Databricks 对 20 个模型的测量、NoLi
2026-07-17 · 34 分钟阅读 #rag#llm#fine-tuning#long-context#ai用一张图片生成视频 — Kling·Veo·Sora vs Wan·HunyuanVideo,何时选哪个
在挑选「一张图片加一段提示词生成视频」的模型时,真正左右决定的不是演示片的画质,而是每秒价格、输入图像限制、许可证这三件事。本文以 2026 年 7 月为基准,只依据各厂商的官方价目表和文档直接核对整理。托管一侧,sora-2 为 720p 每秒 0.10 美元,Veo 3.1 Fast 为含音频 720p 每秒 0.10 美元;Kling 则不按秒、而按 5 秒·10 秒的片段为单位计费,「每秒价格」根本不存在。开放权重一侧,Wan2
2026-07-17 · 31 分钟阅读 #ai#video-generation#image-to-video#open-weights#licensingLLM API 成本如何真正降下来 — 「缓存 90% 折扣」到了账单上为什么只有 25%
提示词缓存的缓存读取只有输入价格的十分之一。但这并不会把账单砍掉 90%。照着 Anthropic 放在自家文档里的计算示例走一遍:即便缓存完全命中,总额也只是从 0.705 美元降到 0.525 美元,减少 25.5%。原因很简单 — 折扣只按该项目在账单中的花钱比例缩减账单,而输出 token 已经吃掉了成本的 60%。所以本文不罗列折扣率,而是直接把账单算出来。缓存的盈亏平衡点(要读几次才回本)、缓存完全不生效的最小 token
2026-07-17 · 32 分钟阅读 #llm#cost-optimization#prompt-caching#api#aiAI 编程智能体,哪个用来干什么 — 仅凭四家厂商官方文档确认的选择标准
在 Claude Code · Cursor · GitHub Copilot · OpenAI Codex 之间做选择时,被问得最多的问题是「哪个最便宜」。然而只靠四家公司公开的价格,这个问题得不出答案,因为四家出售用量的单位各不相同 — Anthropic 按相对 Pro 的倍数(5 倍·20 倍)卖,Cursor 按以美元标示的包含 API 用量卖,GitHub 按 1 积分 = 1 美分的积分卖,OpenAI 按每 5 小时窗口
2026-07-17 · 35 分钟阅读 #ai#ai-coding-agent#claude-code#cursor#github-copilotAI 代码评审到底能不能用 — 测量证据揭示的准确率与误报
AI 代码评审工具的营销话术里充斥着「80% 的 PR 不需要人类评论」这样的数字,但真正把精确率和误报率一起公开的地方几乎没有。把公开的测量结果收集起来看,方向大体一致 — 在开源 PR 上,AI 评审评论真正带来代码变更的比例因工具而异,只有 0.9~19.2%,远低于人类评论的 60%(Gan 等,GitHub Actions 16 款·仓库 178 个·评论 22,326 条)。而在一家把评论解决写进政策强制执行的企业案例里,同
2026-07-17 · 38 分钟阅读 #ai#code-review#static-analysis#evaluation#software-engineering操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injectionAI 智能体的记忆实际上是怎么做出来的 — 四种设计,以及基准测试实际证明了什么
「智能体记忆」不是一种单一技术,而是把至少四种彼此不同的设计笼统打包的说法 — 文件草稿板、摘要/compaction、向量召回、知识图谱。本文先用产品文档确认每一种实际在做什么,然后抛出一个更不舒服的问题:「哪种更好」的证据真的被测量过吗? 直接去读 Mem0 论文(arXiv:2504.19413)的表格就会发现,头条的「相对 OpenAI 提升 26%」是事实,但在同一张表里,把整段对话原样贴进提示词的全上下文方式以 J 72.9
2026-07-17 · 31 分钟阅读 #ai#ai-agent#agent-memory#llm#benchmarkAI 智能体在生产环境中是如何失败的 — 14 种失败模式,以及重试为何不安全
把智能体放上生产环境,会有三处疼。第一,失败大多不是出在模型,而是出在系统设计 — UC 伯克利的 MAST 研究对 1642 条执行轨迹做了分类,提炼出 14 种失败模式,其中 44.2% 属于系统设计问题。第二,最常见的两种失败模式(步骤重复 15.7%、未意识到终止条件 12.4%)会直接变成 token 账单。第三,恰恰是这两种模式制造了重试/幂等性问题 — 非确定性的调用方在驱动真实副作用,而 MCP 只给了 idempote
2026-07-17 · 32 分钟阅读 #ai#agents#observability#reliability#mcp模拟客户从不离开 — LLM 用户模拟器在哪里把智能体的分数吹高了
在 τ-bench 这一类对话式智能体基准测试里,"用户"这个角色由另一个 LLM 来扮演。可这个模拟器不是被测量的对象,而是测量工具本身,工具是需要校准的。2026 年发表的三项验证研究都指向同一个方向 — 模拟出来的用户太配合了。一项把 τ-bench 协议原样搬给 451 名真人跑的研究报告说,模拟器制造出的"简单模式"会把智能体的成功率推到高于人类基线的水平;另一项研究报告说,换一个用户 LLM,成功率最多能摆动 9 个百分点。
2026-07-16 · 36 分钟阅读 #ai#llm#evaluation#agents#simulationPD 分离并不会提升吞吐量 — 预填充/解码分离实际买到的是什么
把预填充和解码拆到不同 GPU 上的 PD 分离,是 2026 年 vLLM、SGLang、TensorRT-LLM 都已经引入的设计,但无论从哪里看,流传的都只是"2 倍到 7 倍"这样的数字。然而 vLLM 官方文档却用大写字母把同一个功能钉死为"分离式预填充并不会提升吞吐量"。两者其实都对 — 因为那些厂商数字测的从来都不是吞吐量,而是 goodput(满足 SLO 的处理量),或者是在固定延迟目标条件下的吞吐量。本文梳理 PD
2026-07-16 · 25 分钟阅读 #llm#ai#inference#kv-cache#vllmMCP 甩掉会话 — 读懂 2026-07-28 修订版的无状态核心
MCP 规范的下一个修订版 2026-07-28,是发布以来最大的一次变更。核心是把状态从协议层剥离出去 — initialize 握手和 Mcp-Session-Id 会话消失了,所有请求都在 meta 里携带协议版本和客户端能力来自我说明。作为代价,服务器反问客户端的方式被 MRTR(Multi Round-Trip Requests)彻底翻转,SSE 断线重连(resumability)被移除,Roots/Sampling/Log
2026-07-16 · 27 分钟阅读 #mcp#ai#protocol#agents#integration