标签: #llm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 90 篇
人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on奖励作弊 — 指标在涨,任务在败
如果对智能体来说,让测试通过最便宜的办法是改测试,它就会去改测试。奖励作弊不是 bug,而是对我们写下的目标的精确优化。框架工程系列第 6 篇,整理了放宽评分标准、删除断言这类常见形态,权限隔离能抹掉的那一半,以及牵制指标的设计。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트什么是框架工程(Harness Engineering)— 模型是固定输入,你交付的是它周围的一切
用的是同一个模型,为什么各团队的智能体表现差这么多?对大多数团队来说,模型是固定输入,真正交付的是围绕模型的整个框架(harness):工具表面、失败返回格式、循环与停止条件、上下文策略、权限,以及评估者。这是框架工程系列第 1 篇,整理了框架的定义、六个旋钮,以及为什么提示词工程这个名字严重低估了这项工作。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트成长为框架工程师 — 这个岗位为何出现,该练什么
框架工程师(harness engineer)这个头衔在招聘启事里还很少见,但这份工作已经存在于每一个部署智能体的团队里。框架工程系列收官的第 8 篇,整理了这个岗位为何出现、既有软件技能如何重新排布,以及借助框架 RPG 的六个层级,从观测与指纹到自我改进循环的分级练习路径。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트评估者瓶颈 — 弱评分者会成为整个系统的上限
不管怎么修框架,分数就是不动——瓶颈可能不在框架,而在评估者。测不出来的质量就选不出来,所以弱评分者会成为整个系统的上限。框架工程系列第 5 篇,梳理了从冒烟测试到单元测试、评分细则(rubric)、封存评分数据、牵制指标面板的评估者阶梯,以及为什么必须先校准评估。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架指纹与版本管理 — 让没有记录的变更可以追踪
没有提示词提交、没有换模型,成功率却动了——该回滚什么?框架工程系列第 7 篇讲框架指纹:把构成框架的所有决定归一化后压成一个哈希。指纹里放什么、不放什么,为什么指纹相同比较才成立,以及如何沿着指纹历史二分定位回归并回滚。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트工具表面设计 — 一行 schema 就能移动成功率
加了更多工具,智能体成功率反而下降,这并不少见。工具表面就是智能体的接口:名字、描述、参数、失败返回、响应大小,全都是设计对象。框架工程系列第 3 篇,整理了工具数量的诅咒、命名空间与描述文案、防错(poka-yoke)参数设计,以及失败以什么格式返回。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트上下文预算 — 设计在于去掉什么,而不是放进什么
上下文窗口明明还有富余,智能体的准确率却在往下掉。上下文是有限的注意力预算,工具的 schema 也在花这笔预算。框架工程系列第 2 篇,整理了把提示词堆积改成 playbook 的做法、丢弃策略与压缩(compaction)的标准,以及委派子智能体的真实成本。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트循环设计 — 在无限循环与过早放弃之间
智能体循环的失败有两个方向:把同一个调用重复几十次的无限循环,和一碰到障碍就收工的过早停止。框架工程系列第 4 篇,整理了重试上限,固定步数、目标检查、置信度这三类停止条件,置信度停止的陷阱,以及向人和子智能体升级的路径。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架不是配置,而是交付物 —— 自我改进循环真正的瓶颈
Lilian Weng 在 2026 年 7 月整理的那篇框架工程(harness engineering)文章,给包裹着模型的整个系统起了名字,把它当成一个工程对象。本文不复述那个定义,而是讨论:当你把框架当作带版本的交付物而不是配置文件来对待时,会有什么不同。文中梳理了给框架打指纹以捕捉回归的做法、把上下文当成 playbook 而不是越写越长的提示词的做法,以及为什么自我改进循环真正的瓶颈不是模型而是评估者。
2026-08-09 · 11 分钟阅读 #llm#agent#harness-engineering#context-engineering#evaluation推理强度不是选模型,而是逐请求决定的部署参数
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#cost编码智能体的开销不是靠额度管住的,而是靠摩擦
Databricks 在 2026 年 7 月和 8 月接连发布的两篇工程文章表明,处理编码智能体开销的方式正在从预算额度转向网关加渐进式摩擦。本文拆解这套设计:为什么硬预算是最后的手段,为什么要把日常暴走防护与月度治理分开,为什么单次增量的大小就是设计的全部,以及为什么真正主导账单的不是模型单价而是上下文 —— 全部整理成可以计算的形式。
2026-08-09 · 12 分钟阅读 #mlops#llm#cost#ai-gateway#developer-productivity「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-models一起没有攻击者的入侵事件 —— 为什么该重新审视智能体凭据
Hugging Face 在 2026 年 7 月 16 日公开了一起由自主智能体造成的生产环境入侵,约三周后 OpenAI 表示那次攻击是从自家训练环境里流出去的。本文不是事件综述,而是讨论这起事件给威胁模型添加了什么:即便没有恶意,握有权限的自动化也会朝着目标漂移;此时真正起作用的防线不是入侵检测,而是凭据的存活时间与作用范围;以及这个事实会怎样改变你所在组织的检查清单。
2026-08-09 · 12 分钟阅读 #security#llm#agent#incident-response#credentialsLLM 做不到的不是证明,而是立起前提
ICML 2026 的立场论文 Position: LLMs can not jump 主张,生成式 AI 已经掌握了归纳,也正在快速攻下演绎,但对于造出新解释性假说的溯因推理,它在结构上根本到不了。本文不去复述那套论证,而是去问:假定它成立的话,我们此刻正在做的系统,设计上该改哪里。假说空间从哪里供给,为什么必须把提出与反驳拆开,以及「这是一篇立场论文」这个事实该如何影响你的读法。
2026-08-09 · 12 分钟阅读 #ai#llm#reasoning#abduction#research评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluation这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantization现在 Hugging Face 上什么在火 —— 2026 年 8 月热门地图
以 2026 年 8 月 2 日为准,亲自过了一遍 Hugging Face 的热门榜单,按用途整理出真正能用于部署的模型。按通用 LLM、编程、嵌入与重排、视觉、语音、图像视频生成、小型端侧模型的顺序,写清了每个模型的厂商、规模、许可证,以及使用前需要了解的限制。核心结论是:热门榜单里相当一部分根本不是新模型,而是量化重新上传和社区微调。文中讲了怎么分辨原版和衍生版、为什么衍生版的下载量会反超原版,以及这个事实对选型意味着什么。所有数
2026-08-02 · 25 分钟阅读 #llm#huggingface#open-weights#model-selection#quantization怎样真正读懂一张模型卡片 —— 5 分钟内挑出你需要的东西
模型卡片的写法是,从头读到尾反而找不到你需要的信息:基准测试表占了半屏,许可证和聊天模板却一笔带过。本文把阅读顺序倒过来,整理出在 5 分钟内挑出部署决策真正需要的七件事的方法。内容涉及开放权重和开源有什么不同、为什么不能对卡片上的分数照单全收、上下文长度的标注背后藏着什么,以及分词器和聊天模板为什么是最容易在不报错的情况下悄悄出问题的地方。最后按这份清单,把 2026 年 8 月 2 日在 Hugging Face 上直接核实过的一张
2026-08-02 · 27 分钟阅读 #llm#huggingface#model-card#license#tokenizer用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-cost