标签: #ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 110 篇
人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字
我们用111万参数做了一个条件扩散模型:输入 "zero" 就画出 0。加噪的 forward 只是一行公式,还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题,以及为什么模型被训练去预测噪声而不是图像。
2026-08-24 · 11 分钟阅读 #ai#diffusion#ddpm#generative#pytorch人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on什么是 FDE(Forward Deployed Engineer)— 驻扎在客户现场的工程师
Palantir 发明了这个头衔,如今 OpenAI 和 Anthropic 正在争相招聘:Forward Deployed Engineer,简称 FDE。本文把这个职位讲清楚——一名坐标系在客户环境里的工程师,用代码打通产品与客户系统之间的最后一公里;用一张对照表把它与解决方案架构师、售前工程师、咨询顾问、支持工程师区分开;再用一个结构性逻辑解释它为何在 AI 产品时代急速升温:平台越是半成品,现场工程就越是产品本身的一部分。这是
2026-08-12 · 10 分钟阅读 #career#fde#forward-deployed-engineer#ai#job-search同一家公司的两个项目,为什么在 AI 贡献上得出了完全相反的结论
OpenJDK 在 2026 年 4 月全面禁止了由生成式 AI 产出的贡献,而同属甲骨文旗下的 GraalVM 在同一时期明确允许使用 AI 编码助手。两个项目用的是同一份贡献者协议。本文把三份文档并排来读:OpenJDK 的原文、GraalVM 的政策文件,以及两者都参考过的 Linux 内核文档。结论是:这个差异并不是对 AI 的态度差异,而是「把评审负担记到谁头上」的设计差异;知道了这根轴,你也就能写出自家仓库的政策。
2026-08-09 · 12 分钟阅读 #culture#open-source#ai#policy#code-review「代码从来就不是难的那部分」这句话,为什么那么招人上火
2026 年 8 月冲上 Hacker News 首位的一篇随笔主张:说「代码从来就不是难的那部分」是对所有程序员的侮辱。本文认同这份反驳,但把原因归到别处。那句话之所以招人上火,不是因为它错,而是因为它在半路上把「代码」这个词的含义偷换掉了。把代码切成三层,就能看清双方各自在哪里成立,也能量出你们团队实际上把时间花在了哪一层。
2026-08-09 · 11 分钟阅读 #career#craft#ai#engineering-culture#skills摩擦消失后留下的不是眼光,而是养出眼光的那条路消失了
2026 年 8 月引发热议的随笔 Taste Is All That Is Left 说:随着「做东西」变便宜,唯一还稀缺的能力就是判断什么值得做。本文认同这份诊断,并再往里走一步。眼光是「努力」这台过滤器的副产品;过滤器一旦被拿掉,留下的并不是眼光,而是养出眼光的那条路一起消失了。所以真正需要的是一套刻意恢复摩擦的具体习惯,本文整理了个人与团队各自该改变什么。
2026-08-09 · 11 分钟阅读 #career#craft#ai#code-review#mentoringLLM 做不到的不是证明,而是立起前提
ICML 2026 的立场论文 Position: LLMs can not jump 主张,生成式 AI 已经掌握了归纳,也正在快速攻下演绎,但对于造出新解释性假说的溯因推理,它在结构上根本到不了。本文不去复述那套论证,而是去问:假定它成立的话,我们此刻正在做的系统,设计上该改哪里。假说空间从哪里供给,为什么必须把提出与反驳拆开,以及「这是一篇立场论文」这个事实该如何影响你的读法。
2026-08-09 · 12 分钟阅读 #ai#llm#reasoning#abduction#research评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluation工具还是对象 — 把意识问题悬置之后,仍然能说的事情
人们面对AI时最先抓住的问题是"这东西有没有意识"。这是最难的问题,大概也不是最有用的问题。本文把这个问题悬而不决地放在一旁,从可以观察到的东西讲起:工具开始用句子回答之后,究竟改变了什么;为什么拟人化是关于我们自己的事实,而不是关于系统的证据;"伊莉莎效应"证明了什么、又没能证明什么;以及无论答案倒向哪一边都不会改变的一种不对称性。
2026-08-02 · 21 分钟阅读 #humanities#ai#philosophy#cognition#technology外包所失去的 — 自动化削弱能力的方式并不均匀
没有人会因为用计算器而感到内疚,但大多数人在发送一份AI代笔的文档之后,多少都会觉得不太踏实。这种不对称正是本文要问的问题。文章把"外包纯属受益"的领域、"确实被测量出会削弱能力"的领域,以及当下大多数知识工作所处的那片暧昧中间地带分开来看。航空领域关于自动化依赖的研究发现了与常识相反的结果,而自动化偏差研究表明,培训并不能阻止它发生。文章还讨论了为什么"外包无聊"和"外包判断"是两种性质不同的决定,以及关于这一代人正在交出去的能力,我
2026-08-02 · 23 分钟阅读 #humanities#ai#cognition#automation#skill机器给的安慰是真的吗 — 为什么需要换一个问题
人们在和AI对话之后,心情真的会变好。把这一点一口断定为错觉,不仅无礼,而且不准确。本文探讨响应性为什么会让人感到被关照,并深入到临床试验的设计层面,看基于聊天机器人的心理健康研究究竟证明了什么、又没能证明什么。文章提出,真正该问的问题不是"这种安慰是真的吗",而是"它替代了什么"——因为作为补充的安慰和作为替代的安慰,虽是同一种行为,却是截然不同的两回事。
2026-08-02 · 23 分钟阅读 #humanities#ai#psychology#loneliness#relationships重构的经济学:什么时候能回本 — 用变更频率计算
2026年7月30日发布在martinfowler.com上的The Economic Benefit of Refactoring一文,对一个约1.7万行的模块进行了15步重构,每一步都重新执行同一个变更请求,测得输入token从159,564个降到27,360个,减少了83%。这是个有意思的实验,但作者本人明确指出这只是单次实验,而且只针对一个绿地(greenfield)应用。本文把这个实验和既有证据(Tornhill与Borg针对
2026-07-31 · 22 分钟阅读 #refactoring#engineering#technical-debt#ai#metrics用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-cost一篇挂着假作者的论文被接收为口头报告 —— AI 时代同行评审的系统性失败分析
2026 年 7 月 30 日,两位审稿人公开表示,他们今年夏天审的 22 篇机器学习会议投稿中,有 15 篇存在伪造引用、虚构作者,或明显的 LLM 生成痕迹。其中两篇把真实论文的作者姓名换成了假名字,尽管给出了拒稿意见并向组委会举报,这两篇论文最终仍以"只需修正幻觉参考文献"为条件被接收为口头报告。本文不把这件事当成一个值得愤怒的八卦来读,而是当作一次系统性失败来分析:标记流程实际抓住了什么,投稿量激增和强制互审如何挤压整条流水线,
2026-07-31 · 22 分钟阅读 #ai#peer-review#research-integrity#llm#academia用提示词生成 3D CAD 这件事 —— 网格与 B-rep 之别,以及约束条件这个瓶颈
GeekNews 的 Show GN 板块上出现了一个叫 CAID 的工具,能用提示词生成 3D CAD 模型。作者自己坦承的局限,恰好精准概括了整个领域的现状 —— 没有自动尺寸校验,无法判断公差、DFM 和可加工性,而且明确说明输出只是一个已验证的原型,不能直接用于制造。从工程角度看,问题只有一个:CAD 是参数化、基于约束的系统,"生成一个网格"和"生成一个带有可编辑特征、真正可制造的模型"是完全不同的两件事。本文梳理 B-rep
2026-07-31 · 19 分钟阅读 #ai#cad#llm#manufacturing#geometry26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeGPT-5.6 与性价比的极限 — 如何在曲线上找到自己负载的位置
OpenAI 在 2026 年 7 月 30 日把 GPT-5.6 Luna 降价 80%、Terra 降价 20%。距离 7 月 9 日正式发布只有三周,而最顶端的 Sol 价格不变。Luna 从每 100 万 token 输入 1 美元、输出 6 美元,变成输入 0.20 美元、输出 1.20 美元。本文不介绍降价幅度,而是计算这条曲线 — 降价后三个档位的单价比在两个轴上都恰好锁定为 25 比 10 比 1,因此在同一系列内部 t
2026-07-31 · 17 分钟阅读 #ai#llm#openai#inference-cost#prompt-caching