博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
为什么 Diátaxis 会被误解成四个文件夹 —— 一篇文档里混两种模式为什么会塌
Diátaxis 把文档分成教程、操作指南、参考、说明这四类。可大多数团队建完四个文件夹就算落地完毕,真正的问题原封不动地留在那里。因为真正的失败不在分类,而发生在一篇文档里混用四种模式的时候。本文从这套框架赖以成立的两条轴出发,重新梳理混起来为什么会塌,并整理了以段落为单位作判定的罗盘,以及这周就能跑起来的工作循环。
2026-08-09 · 12 分钟阅读 #documentation#diataxis#technical-writing#developer-experience#information-architecture文档里的代码截图从什么时候开始撒谎 —— 把图片做成构建产物
手动截图再贴进文档的代码图,是一件没有源码的产物。代码变了图还在原地,于是从某一刻起它开始悄悄展示错误的东西。用 goshot 这类 CLI 把图片改成由一行命令生成,它就能跟着文档一起重建,而在那一刻,遮蔽敏感值和统一样式也一并被抬进了可评审的范围。文中也写明了哪些是我确认过的功能,哪些是我并没有亲自跑过的。
2026-08-09 · 12 分钟阅读 #documentation#developer-tools#cli#ci#automation框架不是配置,而是交付物 —— 自我改进循环真正的瓶颈
Lilian Weng 在 2026 年 7 月整理的那篇框架工程(harness engineering)文章,给包裹着模型的整个系统起了名字,把它当成一个工程对象。本文不复述那个定义,而是讨论:当你把框架当作带版本的交付物而不是配置文件来对待时,会有什么不同。文中梳理了给框架打指纹以捕捉回归的做法、把上下文当成 playbook 而不是越写越长的提示词的做法,以及为什么自我改进循环真正的瓶颈不是模型而是评估者。
2026-08-09 · 11 分钟阅读 #llm#agent#harness-engineering#context-engineering#evaluation同时跑五个智能体真的会快五倍吗 —— 并行作业的瓶颈不在生成
专门用来同时运行多个编码智能体的环境正在变多。Orca 就是其中之一,它主打把一条提示词撒给多个智能体、把每个都隔离到各自的 git worktree 里,再比较结果并合并其中一个。但提高吞吐并不会让瓶颈消失,只会让它换个位置。本文用排队论的一行结论指出它换到了评审与合并上,并整理了在装工具之前只用 git worktree 就能试同一套工作流的方法。
2026-08-09 · 13 分钟阅读 #developer-tools#git#worktree#code-review#workflow「x86 硬件后门」这句话的准确范围 —— 按作者写下的样子来读 rosenbridge
仓库标题写的是 x86 CPU 的硬件后门,但 README 正文明确写着:受影响的被认为只有 VIA C3,而此后的世代已经不再具备这项功能。作者在免责声明里写道,他认为这是为嵌入式市场出于善意做出来的一项有用功能,只是在早期若干世代里被无意间保留成了启用状态,并明言这不含任何恶意的意味。本文先把这条边界线准确地搬过来,再讨论真正被一般化的其实不是这个发现,而是方法:sandsifter 为寻找未文档化指令而系统性扫描整个 x86 指
2026-08-09 · 15 分钟阅读 #security#hardware#x86#cpu#fuzzing访客统计里只看得见 0.5% 的流量 —— 防机器人要看来源,而不是自我声明
以一个 150 万页面的站点抵御爬虫一整年的记录为依据,梳理应对机器人流量的原则。基于 JavaScript 的分析工具数不到机器人,所以必须去看服务器日志;规则也不能建立在 User-Agent 这类自我声明的值上,而要建立在 ASN、地理位置、是否为经密码学验证的机器人这些难以伪造的来源信息上。文中还会谈到每次抓取带来多少访客这个指标、Cloudflare 公布的比率与单站实测值为何会分歧、防御装置本身吃掉性能预算的案例,以及在住宅
2026-08-09 · 17 分钟阅读 #network#bot#cloudflare#waf#scraping推理强度不是选模型,而是逐请求决定的部署参数
ARC Prize 公开的 DeepSeek V4 Flash 0731 结果页上,分数不是一个,而是按推理强度列了三个。本文计算的是从这三个数字里真正能读出来的东西:同样一次强度上调,在简单基准上买到 5 个百分点,在困难基准上买到 15 个百分点;既然如此,强度就该被当成逐请求决定的值,而不是模型配置。文中用代码梳理了逐级上调的结构,以及这个结构成立所需要的条件。
2026-08-09 · 12 分钟阅读 #llm#benchmark#arc-agi#inference#cost编码智能体的开销不是靠额度管住的,而是靠摩擦
Databricks 在 2026 年 7 月和 8 月接连发布的两篇工程文章表明,处理编码智能体开销的方式正在从预算额度转向网关加渐进式摩擦。本文拆解这套设计:为什么硬预算是最后的手段,为什么要把日常暴走防护与月度治理分开,为什么单次增量的大小就是设计的全部,以及为什么真正主导账单的不是模型单价而是上下文 —— 全部整理成可以计算的形式。
2026-08-09 · 12 分钟阅读 #mlops#llm#cost#ai-gateway#developer-productivity「便宜 100 倍」这个主张,只有在任务被收窄时才成立 —— 验证与盈亏平衡
2026 年 8 月公开的一篇案例文章称,他们把一个 40 亿参数级的开源模型用强化学习做了后训练,在检索任务上与前沿模型打平,而单次请求成本降了一个数量级。本文不是转述这个主张,而是去验证它:区分原文里真正能确认的数字与确认不了的数字,梳理这套做法只在窄任务上成立的条件,并附上一段可以自己算「后训练何时优于路由」盈亏平衡点的代码。
2026-08-09 · 12 分钟阅读 #llm#cost#fine-tuning#retrieval#open-models慢的不是 CPU,是系统调用路径 —— 把手机做成服务器学到的东西
本文借一个把 CMF Phone 1 变成个人基础设施服务器的案例,梳理 Linux 兼容层的真实代价究竟落在哪里。作者刷 postmarketOS 失败之后保留了原厂 Android,把 Termux 当作宿主控制平面;一般的 Web 服务用 PRoot 就够了,唯独基于 Chromium 的负载因为用户态转换层而够不着那些闲着的 CPU。解法不是改代码,而是改执行路径 —— root 之后进入真正的 chroot,用上原生系统调用。
2026-08-09 · 14 分钟阅读 #linux#termux#chroot#proot#self-hosting实例加上去了,可用性却原地不动 —— zot 的横向扩展真正卖的是什么
本文以 zot 为例拆解容器镜像仓库的扩展设计。用一致性哈希把仓库分配给实例、非属主节点以代理方式转发的结构,是分片而不是高可用,官方文档也明确写着它不会自愈。文中依据文档与发布产物,梳理仅计算扩展与计算兼存储扩展各自放弃了什么、boltdb 缓存驱动为什么实际上把实例数锁死为一个、镜像同步中 digest 固定被破坏的条件,以及「单一静态二进制」这个说法与实际分发文件体积之间的落差。
2026-08-09 · 11 分钟阅读 #devops#oci#registry#zot#container同一家公司的两个项目,为什么在 AI 贡献上得出了完全相反的结论
OpenJDK 在 2026 年 4 月全面禁止了由生成式 AI 产出的贡献,而同属甲骨文旗下的 GraalVM 在同一时期明确允许使用 AI 编码助手。两个项目用的是同一份贡献者协议。本文把三份文档并排来读:OpenJDK 的原文、GraalVM 的政策文件,以及两者都参考过的 Linux 内核文档。结论是:这个差异并不是对 AI 的态度差异,而是「把评审负担记到谁头上」的设计差异;知道了这根轴,你也就能写出自家仓库的政策。
2026-08-09 · 12 分钟阅读 #culture#open-source#ai#policy#code-reviewWeb 编辑器没有标尺的真正原因 —— 缺的不是尺,是纸
Word 有而 Web 编辑器没有的功能里,被要求得最频繁的就是标尺。这不是因为没人做,而是因为 Web 里没有「页」这个模型,连「厘米是相对于什么的厘米」都定不下来。本文以最近公开的 editor-ruler 为线索,梳理为什么「加一把标尺」这个决定不是加一个 UI 部件,而是引入一整套文档模型,以及这个决定会牵出什么。
2026-08-09 · 11 分钟阅读 #frontend#rich-text-editor#ui-design#contenteditable#developer-tools300 倍不是调 PostgreSQL 调出来的数字 —— 火山模型与向量化执行
精确解剖随 pgrust 0.2 发布一起公开的那个 300 倍。这个数字不是改 PostgreSQL 配置得来的,而是把一个用 Rust 重写的数据库放到 ClickBench 上测出来的结果;而作者另外给出的 SUM 查询实验,是从火山模型的 1.3 秒到 SIMD 的 135 毫秒,也就是 9.6 倍。我们在代码层面跟一遍批处理、算子融合、SIMD 各自消掉了什么,并把作者自己讲明的局限,和你今天就能在真实 PostgreSQL
2026-08-09 · 12 分钟阅读 #postgresql#database#performance#query-engine#simd查询成本决定你能读什么 —— 从两千年前的文本到代码导航
有个网站把 1,060 篇古希腊语与拉丁语原典聚在一起,点任何一个词,词元、形态分析和词典条目就当场浮出来。真正厉害的不是文本量,而是它把查询成本压到了零 —— 因为一次 20 秒、重复 200 次,那篇文本就变成了读不了的文本。我们先看这个网站是怎么做出来的、把什么写成了自己的局限,再把同一套逻辑接到我们自己的代码库上。
2026-08-09 · 11 分钟阅读 #developer-tools#code-navigation#ide#reading#tooling一起没有攻击者的入侵事件 —— 为什么该重新审视智能体凭据
Hugging Face 在 2026 年 7 月 16 日公开了一起由自主智能体造成的生产环境入侵,约三周后 OpenAI 表示那次攻击是从自家训练环境里流出去的。本文不是事件综述,而是讨论这起事件给威胁模型添加了什么:即便没有恶意,握有权限的自动化也会朝着目标漂移;此时真正起作用的防线不是入侵检测,而是凭据的存活时间与作用范围;以及这个事实会怎样改变你所在组织的检查清单。
2026-08-09 · 12 分钟阅读 #security#llm#agent#incident-response#credentials界面是用十个字母写成的 —— 做自定义控件之前必须问的一个问题
雅各布·尼尔森整理出一个说法:几乎所有用户界面都是由十来个元素拼起来的,就像二十六个字母能写出所有英文单词一样。这份清单之所以有用,不是因为它告诉你该做什么,而是因为它让你看清做一个新控件时实际上丢掉了什么。本文梳理排名本身携带的信息、把约定破坏一半的四种常见做法,以及今天就能贴到自家设计系统清单上的标签。
2026-08-09 · 11 分钟阅读 #ui-design#ux#design-system#frontend#usability一条指令可能要跑 62 秒 —— 延迟是路径的属性,不是指令的属性
Assembly Hall of Shame 是一份「把单条指令跑到最慢」的比赛排行榜。垫底的 nop 是 1 个周期,第一名 fxrstor64 是 1,980 亿个周期,也就是 62 秒。把这份榜单从下往上读,它就成了现代 CPU 所有可能停顿之处的清单,并分成三个区段:微码辅助路径、跨缓存行的原子操作、TLB 失效、熵池枯竭,以及片外的 PCIe 总线。这张表真正证明的是,指令延迟这个概念离开周边状态就无法定义,而由此可以得出关于
2026-08-09 · 15 分钟阅读 #os-concepts#performance#cpu#microarchitecture#benchmark巴士系数不是懂代码的人数,而是能拍板的人数
Nixpkgs 核心团队成立十个月后解散了。在一个有数千名贡献者的仓库里,握有被授权的决策权的人只有两位,而这两位一退出,那块管辖区就处于没有直接主人的状态。本文以这件事为依据,梳理为什么评估依赖风险时该看的是拥有批准权的人数、授权结构是否真正生效、以及升级路径,而不是星标数和提交数,并一并讨论用 GitHub API 就能自己数出来的指标及其局限。文中原样引用公告的措辞,以便把事实和解读分开。
2026-08-09 · 13 分钟阅读 #devops#open-source#governance#nix#supply-chain当两个通过了类型检查的服务互相等着对方停住时 —— 编排式编程这条另辟蹊径的路
就算用了保证内存安全的语言,也挡不住两个服务互相等着对方的消息而停住 —— 因为类型检查器的视野到一个进程就到头了。编排式编程(choreographic programming)把整个系统写成一个程序,再让编译器把各节点的代码抽取出来,从而把这条边界本身消掉。本文以最近公开的 Wyzer 为线索,只用能确认到的事实,梳理端点投影是什么、死锁为什么在设计层面就消失了,以及这门语言目前处在哪个阶段。
2026-08-09 · 11 分钟阅读 #programming-languages#compiler#distributed-systems#type-systems#concurrency