博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
2026年自托管部署平台怎么选 —— 划分 Coolify、Dokploy、CapRover、Kamal、Openship 的五个维度
Openship —— 一款自带 CI/CD 的自托管部署平台 —— 登上 GeekNews,老问题又被带回来了:要不要离开托管式 PaaS,自己运维?本文用真正决定结果的五个维度 —— 控制平面归属、回滚路径、密钥处理方式、多节点行为、运维负担 —— 来比较 Coolify、Dokploy、CapRover、Kamal 2、Openship,以及纯 compose 组合。文中给出每款工具的实际命令与配置,并算一算自托管到底是用什么换掉
2026-07-31 · 19 分钟阅读 #self-hosting#deployment#paas#kamal#coolify平均值什么也说明不了——如何用分布调试延迟
2026 年 7 月 27 日发布、登上 Hacker News 榜首的 Farid Zakaria 文章《The mean means nothing》,讨论了这样一种情形:部署缓存层之后,平均延迟从 112ms 恶化到 122ms,上升了 9%。而在同一份数据中,p50 从 99ms 改善到 54ms,下降了 46%;p99 则从 309ms 恶化到 678ms,上升了 119%。同一份数据之所以能同时支持两个截然相反的结论,是因为
2026-07-31 · 22 分钟阅读 #observability#latency#performance#histogram#percentile重构的经济学:什么时候能回本 — 用变更频率计算
2026年7月30日发布在martinfowler.com上的The Economic Benefit of Refactoring一文,对一个约1.7万行的模块进行了15步重构,每一步都重新执行同一个变更请求,测得输入token从159,564个降到27,360个,减少了83%。这是个有意思的实验,但作者本人明确指出这只是单次实验,而且只针对一个绿地(greenfield)应用。本文把这个实验和既有证据(Tornhill与Borg针对
2026-07-31 · 22 分钟阅读 #refactoring#engineering#technical-debt#ai#metrics用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-cost单体仓库 CI 缓存策略 — 别扩容缓存,要修的是缓存键
单体仓库 CI 慢,大多数时候不是因为缓存太小,而是因为缓存键错了。本文梳理 Turborepo、Nx、Bazel、GitHub Actions 各自的缓存都往哈希里塞了什么、收窄哈希输入的三个抓手、如何靠 affected 判定干脆不执行、CI 与开发者共享远程缓存时出现的信任边界,以及 2026 年一起真实的缓存投毒事故为什么本质上是个 hermeticity(封闭性)问题。最后讲讲怎么不掺水、老老实实地衡量命中率。
2026-07-31 · 21 分钟阅读 #monorepo#ci-cd#build-cache#turborepo#bazel一篇挂着假作者的论文被接收为口头报告 —— AI 时代同行评审的系统性失败分析
2026 年 7 月 30 日,两位审稿人公开表示,他们今年夏天审的 22 篇机器学习会议投稿中,有 15 篇存在伪造引用、虚构作者,或明显的 LLM 生成痕迹。其中两篇把真实论文的作者姓名换成了假名字,尽管给出了拒稿意见并向组委会举报,这两篇论文最终仍以"只需修正幻觉参考文献"为条件被接收为口头报告。本文不把这件事当成一个值得愤怒的八卦来读,而是当作一次系统性失败来分析:标记流程实际抓住了什么,投稿量激增和强制互审如何挤压整条流水线,
2026-07-31 · 22 分钟阅读 #ai#peer-review#research-integrity#llm#academia才能这个幻象 — 练习研究究竟说了什么,以及什么才真正以复利积累
2026年7月底,《才能这个幻象》登上了GeekNews的前列。光看标题像是一场关于才能与练习的科学争论,但原文其实是一篇讲初级开发者职业焦虑的个人随笔,全文没有引用任何一项研究。本文沿着真实的文献往下走:埃里克森1993年的论文主张了什么、又没有主张什么,麦克纳马拉元分析给出的方差解释率12%与2018年勘误改正后的14%,2019年重复实验的失败,以及瑞典双胞胎研究抛出的那个最令人不适的反证 — 全都用数字摆出来。在此之上,能够诚实
2026-07-31 · 22 分钟阅读 #career#deliberate-practice#expertise#psych-papers#mindset工程师该如何读懂 Go-to-Market 打法手册 —— 渠道胜过产品质量的地带
2026 年 7 月底,GeekNews 上出现了 NFX 的《升级版 Go-to-Market 打法手册》。这是一篇由 VC 撰写的观点文章,里面的数字是精心挑选的个案,而不是样本。本文把这份打法手册翻译给技术读者:渠道在哪些地带真正胜过产品质量、面向开发者的自助转化真实转化率是多少(面向开发者的产品,中位转化率只有非开发者产品的一半)、"time to first value" 与"文档即漏斗"这类说法是否有真实数据支撑、PLG 为
2026-07-31 · 21 分钟阅读 #startup#go-to-market#product-led-growth#developer-tools#career用提示词生成 3D CAD 这件事 —— 网格与 B-rep 之别,以及约束条件这个瓶颈
GeekNews 的 Show GN 板块上出现了一个叫 CAID 的工具,能用提示词生成 3D CAD 模型。作者自己坦承的局限,恰好精准概括了整个领域的现状 —— 没有自动尺寸校验,无法判断公差、DFM 和可加工性,而且明确说明输出只是一个已验证的原型,不能直接用于制造。从工程角度看,问题只有一个:CAD 是参数化、基于约束的系统,"生成一个网格"和"生成一个带有可编辑特征、真正可制造的模型"是完全不同的两件事。本文梳理 B-rep
2026-07-31 · 19 分钟阅读 #ai#cad#llm#manufacturing#geometry当开源治理崩溃时 — Ruby Central 之争与三根支柱
2026 年 7 月 30 日,André Arko 发布《Ruby Central 的破坏性遗产》,让始于 2025 年 9 月的 RubyGems 仓库访问权限之争,在十个月后再度浮出水面。本文将双方的第一手陈述并列呈现,梳理出一条可核实的时间线,然后从结构层面分析为什么同样形态的危机会在 core-js、event-stream、xz-utils、Nix、Redis、Terraform 身上反复出现。核心是三根支柱 —— 商标归谁
2026-07-31 · 24 分钟阅读 #open-source#governance#rubygems#supply-chain#licensing26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeGPT-5.6 与性价比的极限 — 如何在曲线上找到自己负载的位置
OpenAI 在 2026 年 7 月 30 日把 GPT-5.6 Luna 降价 80%、Terra 降价 20%。距离 7 月 9 日正式发布只有三周,而最顶端的 Sol 价格不变。Luna 从每 100 万 token 输入 1 美元、输出 6 美元,变成输入 0.20 美元、输出 1.20 美元。本文不介绍降价幅度,而是计算这条曲线 — 降价后三个档位的单价比在两个轴上都恰好锁定为 25 比 10 比 1,因此在同一系列内部 t
2026-07-31 · 17 分钟阅读 #ai#llm#openai#inference-cost#prompt-cachingGCC 的 AI 政策与开源世界的选择 —— 15 行这条边界线到底想守住什么
2026 年 7 月 29 日,GCC 指导委员会通过了 AI 政策工作组的建议。核心内容是:具有法律意义的贡献如果包含 LLM 生成内容或衍生自这类内容,将不予接受,判定基准线大致沿用 GNU 维护者指南里的约 15 行。不过测试用例是个例外,把 LLM 用于调研、分析、发现 bug、审查补丁本身并不受限制,只是 AI 辅助的工作需要附上 Assisted-by 标签。本文梳理这项政策实际要求了什么、其背后的版权转让与 DCO 问题、
2026-07-31 · 19 分钟阅读 #ai#open-source#gcc#licensing#governanceDeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moe在生产环境里运维 AI 智能体 — 幂等性、预算,以及自信满满的错误答案
把智能体从原型搬到生产环境时,有一片会被很晚才发现的运维表面:被重试的工具调用的幂等性、预算与步数上限、非确定性控制流的可观测性、按工具划分的权限边界,以及智能体自信满满地答错时的升级路径。最近发到 GeekNews Ask GN 上的一份分析,在 6,780 条基准测试轨迹里找到了 8,042 次重复工具执行,其中 159 次是改变状态的工具真的创建出了重复资源。本文以那份数据为起点,梳理该记录什么、该对什么设告警,以及在像第三方 A
2026-07-31 · 24 分钟阅读 #ai#agents#observability#reliability#mcpJava Value Objects(JEP 401)带来的改变 —— 放弃身份标识,得到什么、失去什么
2026 年 7 月 31 日 00:45 UTC,JEP 401 Value Objects 的实现被合并进了 OpenJDK 主线。它与 JEP 539(Strict Field Initialization)打包在同一个提交里,涉及 1,888 个文件、新增约 20.8 万行代码 —— 距离 Project Valhalla 于 2014 年启动,已经过去了 12 年。本文依据 JEP 原文,梳理没有身份标识的对象究竟是什么、性能
2026-07-31 · 22 分钟阅读 #java#jvm#valhalla#jep-401#performanceBun 把 Zig 重写成 Rust 的 11 天 — AI 大规模迁移里真正能带走的东西
本文用一手资料追踪 Bun 在 11 天内把 53.5 万行 Zig 代码迁到 Rust 的整个过程。2026 年 5 月 3 日到 14 日,动用了最多 64 个 Claude 实例、约 50 条工作流、6,502 个提交,按 API 标价折算约 16.5 万美元。本文关心的不是 11 天这个数字,而是让这个数字得以成立的条件 — 一套与语言无关的测试套件充当预言机、文件对文件一一对应的结构保持式翻译,以及编译器这第二位裁判。文章把
2026-07-31 · 19 分钟阅读 #ai#bun#rust#migration#testing蒸馏会迁移什么、不会迁移什么 — 把 DeepSeek 蒸馏进 GPT-OSS,审查没有跟过来
2026 年 7 月 30 日发到 Show HN 上的 CTGT 实验报告说,以 DeepSeek V4 Flash 为教师、GPT-OSS 为学生蒸馏金融推理能力,结果能力过来了,政治审查没有过来。在 152 组配对上,教师在敏感问题与对照组之间表现出 45.45 分的审查落差,而学生只有 0.43 分和 3.94 分,停在基线上。本文不把这一个实验放大,只把它当作起点 — 因为蒸馏复制的是教师的输出分布,所以本文立起一套框架:观测
2026-07-31 · 18 分钟阅读 #ai#llm#distillation#alignment#open-weightsGemini Robotics 2 与机器人基础模型 —— 全身控制真正改变了什么
2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2,宣布用一个视觉-语言-动作模型来控制人形机器人,从脚尖到指尖一以贯之。有意思的是,随之公布的数字读起来不像是炫耀,反而更像是对当前状态的诚实记录 —— 拧开灯泡的成功率是 92%,拧上去是 36%,从地板上捡东西是 45.7%。本文梳理 VLA 到底是什么、全身控制为什么比上肢操作更难、跨具身泛化为什么才是真正的瓶颈,以及该怎样正
2026-07-31 · 22 分钟阅读 #ai#robotics#vla#foundation-models#evaluationAI 如何在 6 月一个月内修复两年份的 Chrome 漏洞 —— 读懂 1,072 这个数字
根据谷歌在 2026 年 7 月 30 日发布的公告,仅 6 月发布的 Chrome 149 和 150 两个版本就修复了 1,072 个安全漏洞,超过了过去两年、23 个里程碑版本合计修复的 1,036 个。其中还包括一个在代码库里潜伏了 13 年以上的沙箱逃逸漏洞。本文不追热闹的标题数字,只看背后的机制 —— 从 2023 年基于 LLM 的模糊测试目标生成,到 2024 年的 Naptime、2025 年的 Big Sleep,再
2026-07-31 · 20 分钟阅读 #ai#security#chrome#fuzzing#vulnerability