博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
"日本式走路"的流行与真正的科学:间歇快走训练(IWT)的依据与局限
2026年在社交媒体上流行起来的"日本式走路",其实是信州大学的研究团队打磨了近20年的间歇快走训练(Interval Walking Training,IWT)换了个新名字包装而成。方案很简单:快走3分钟、慢走3分钟,重复五次左右凑成30分钟,每周4天以上。2007年发表在 Mayo Clinic Proceedings 上、以约246名中老年人为对象的研究报告称,与相同总运动时间的普通步行相比,间歇快走在腿部肌力、最大摄氧量和血压上
2026-07-11 · 7 分钟阅读 #fitness#health#walking#exercise#cardio2026年依然没有闰秒 — 以及无人经历过的负闰秒
2026年7月6日,IERS 通过 Bulletin C 72 宣布"2026年12月底没有闰秒"。表面上看是条平静的消息,但地球自转从2016年起反而开始加快,史上第一次需要插入负闰秒的可能性变成了现实。本文梳理闰秒是什么、为什么 POSIX 时间无法表达它、2012年和2017年的真实故障给了我们什么教训,以及在这条从未被执行过的负闰秒处理路径面前,工程师现在应该确认些什么。
2026-07-11 · 9 分钟阅读 #leap-second#utc#ntp#distributed-systems#posix-time好工具是隐形的 — gingerBill 的主张与“过于隐形”的工具陷阱
读 Odin 语言作者 gingerBill 的文章《Good Tools Are Invisible》,梳理其论点后再补上来自一线的注脚。他认为好工具应当毫无摩擦地隐入背景,并批评把缺陷当作“解起来有趣的谜题”来兜售的话术。我认同“感觉到的生产力与实际生产力”这一区分,但认为界面看不见和内部运作不透明是两回事。像构建系统和 Kubernetes Operator 那样过于安静的工具,会把失败藏起来。好工具在使用时应当隐形,一旦出故障就
2026-07-11 · 12 分钟阅读 #tools#developer-experience#kubernetes#build-systems#editors解读 Microsoft Flint — 让智能体绘制图表的可视化语言
Microsoft Research 公开的 Flint 并不是可视化智能体的语言,而是让 AI 智能体能够从数据中稳定地生成美观图表的中间语言。编译器会代替我们,从数据与语义类型中推导出比例尺、坐标轴、颜色、布局等低层决策,并把同一份规格编译为 Vega-Lite、ECharts、Chart.js。本文诚实地探讨 Flint 究竟是什么、解决了什么问题,以及智能体专用的可视化语言究竟是真正必要的构想,还是过度设计。
2026-07-11 · 9 分钟阅读 #ai#agents#data-visualization#llm#microsoftMac mini 为何成为端侧 AI 机器 — Apple Silicon 高管访谈说了什么、没说什么
Apple Silicon 高级产品经理道格·布鲁克斯(Doug Brooks)在 The Deep View 的访谈中谈到了 Mac mini 与 Mac Studio 的需求以及端侧 AI 的走向。开发者和小型团队为何选择这台小小的台式机作为本地 LLM 与智能体机器、统一内存架构的真正优势是什么,以及 CUDA 生态差距与近期涨价这一诚实的取舍 — 本文原样引用高管的发言,同时剥离营销话术加以梳理。
2026-07-11 · 9 分钟阅读 #apple-silicon#on-device-ai#local-llm#mac-mini#inferenceGhostLock:潜伏在 Linux rtmutex 中长达 15 年的栈上 use-after-free(CVE-2026-43499)
GhostLock(CVE-2026-43499)是 Linux 内核实时互斥锁(rtmutex)代码中的一个栈上 use-after-free。根据 nebusec.ai 的 IonStack 第二部分分析,这个缺陷从 2011 年的 2.6.39-rc1 一直留在主线,直到 2026 年 4 月的修复,前后约 15 年。成因很小——removewaiter() 始终假定正在清理的 waiter 就是当前线程,而 requeue-PI
2026-07-11 · 10 分钟阅读 #linux-kernel#security#use-after-free#privilege-escalation#rtmutex让退役的 DDR4 重获新生 — Meta 的 CXL 桥接芯片 Vistara
DDR5 价格上涨的同时,从退役服务器上拆下来、本该还能用的 DDR4 却在仓库里越堆越多。Meta 在 ISCA 2026 上公开的 Vistara,用自研的 CXL 桥接芯片把这些旧 DDR4 接进最新的 DDR5 服务器,让它作为更慢但便宜得多的第二层内存重获新生。本文梳理 CXL 与内存分层是什么、为何在超大规模场景中重要,Vistara 芯片和 MemServer 实际是如何构成的(DDR5 768GB + 再利用 DDR4
2026-07-11 · 11 分钟阅读 #cxl#infrastructure#memory#hardware#sustainabilityK-pop 的"系统"能否与国籍分离 — 名为 KATSEYE 的实验
KATSEYE 是 HYBE 与格芬唱片(Geffen Records)用与韩国偶像相同的练习生流水线打造的、以洛杉矶为据点的六人女子组合,但成员们明确表示自己"不是 K-pop,而是全球组合"。2026 年,这个组合入围了两项格莱美提名——最佳新人,以及凭《Gabriela》入围最佳流行组合演唱,并登上了颁奖礼舞台。本文把 KATSEYE 看作一次自然实验:训练、制作、粉丝机制这套 K-pop 的"系统",能否从韩国这一国籍中剥离出来
2026-07-11 · 10 分钟阅读 #kpop#katseye#music-industry#culture#globalizationKubeVirt GPU 直通 VM 为何 112 天无法被调度 — 一次真实集群的尸检
一个用 Rust 写的 Operator 下达了"4 个 GPU 节点全部 NotReady"的诊断后,我在真实的 8 节点集群(GPU Operator v25.3.0、KubeVirt v1.7.0)里把这场死亡的病因追查到底。gpu-fedora 与 rhel9-gpu-vm 卡在 ErrorUnschedulable 长达 112 天,真正的原因不是花哨的 GPU 配置,而是 kubelet 的一行错误——"running wi
2026-07-11 · 7 分钟阅读 #kubevirt#gpu#kubernetes#nvidia#devops管理精力,而非时间 — 冷静解读 2026 年健康趋势
2026 年的自我提升与健康话语,正把重心从时间管理转向精力管理、神经系统调节和情绪健身。但这套框架其实是个老想法,源自 2007 年的《哈佛商业评论》文章。本文区分趋势报告的观察与真正的证据,剔除夸张,只挑出真正好用的部分。
2026-07-11 · 11 分钟阅读 #self-improvement#wellness#productivity#energy#recovery把预训练检查点变成长上下文混合模型 — HyLo 的升级改造配方
混合序列模型(注意力 + 线性·SSM 块)在长上下文上更有优势,但迄今为止大多需要从头重新预训练。2026 年 4 月的预印本 HyLo 提出了一份配方:只用廉价的后处理训练,就把已经训练好的 Transformer 检查点"升级改造"成混合模型 — 混入 MLA(潜在注意力)和 Mamba2、Gated DeltaNet 这类线性块,再叠加分阶段的长上下文训练与教师蒸馏。作者报告称,在把上下文最多拉长到 32 倍的同时,KV 缓存内
2026-07-11 · 9 分钟阅读 #ai#llm#long-context#architecture#efficiency乔丹·彼得森的三本书 — 写给审慎读者的指南
乔丹·彼得森是临床心理学家,也是一位充满争议的公众人物。本文关注的不是政治争论,而是他的三本代表作 — 人生十二法则(2018)、超越秩序(2021)、意义的地图(1999) — 的实际内容。文章梳理了每本书讲了什么、责任与意义、秩序与混沌这些核心观念是什么,以及谁能从中获益。许多读者确实获得了切实的帮助,而他也受到严肃的批评,这两点都被一并写下,不向任何一方过度倾斜。
2026-07-11 · 11 分钟阅读 #books#self-improvement#psychology#jordan-peterson#philosophyWeb 智能体把网页文字当作命令来读 — 跨站提示注入与 Prismata 的围堵
2026 年 7 月 9 日发布于 arXiv 的 Prismata 论文(Villa、Ozdarendeli、Tan、Popa)探讨了自主 Web 智能体最古老的弱点。由于智能体把自然语言解释为命令,混入页面的第三方内容与用户生成内容就能直接劫持智能体。作者们把这看作 Cross-Site Scripting 的重现。Prismata 提出一种"上下文最小权限"防御:从页面结构中导出信任、遮蔽不可信内容、并限制智能体的行动权限。文章也
2026-07-11 · 9 分钟阅读 #prompt-injection#web-agents#ai-security#least-privilege#browser-agentsKV 缓存降到 4 比特 — SAW-INT4 与系统感知的 INT4 量化
在长上下文 LLM 服务中,真正的内存瓶颈不是权重,而是 KV 缓存。直接把它降到 INT4 会让精度崩溃,但 2026 年 4 月的预印本 SAW-INT4 报告说,在逐 token 的 INT4 量化之上再叠加块对角阿达玛旋转,就能几乎追回朴素 INT4 丢掉的精度。这篇论文真正的角度不只是精度,而是吞吐量 — 通过直接集成进分页 KV 缓存布局的融合旋转·量化内核,作者们称没有可测量的端到端开销,吞吐量与纯 INT4 相同。向量量
2026-07-11 · 11 分钟阅读 #ai#llm#quantization#inference#kv-cache在慢速电脑上跑 GLM-5.2 — colibrì 如何从磁盘流式加载 744B 模型
colibrì 是一个用纯 C 写成、约 1,300 行的推理引擎,能在内存 25GB 的消费级 PC 上运行 744B(7,440 亿)参数的 MoE 模型 GLM-5.2。关键在于 MoE 稀疏性与磁盘流式加载 — 只把约 9.9GB 的密集层常驻内存,约 370GB 的路由专家放在 NVMe SSD 上,每个 token 只读取需要的部分。代价是诚实地慢:冷启动约 0.05–0.1 tok/s,实际上每段落要花几分钟。它靠学习缓存
2026-07-11 · 7 分钟阅读 #ai#llm#local-inference#moe#quantization编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarks欧盟聊天管制 1.0:实际通过的内容,与客户端扫描这一争议焦点
2026年7月9日,欧洲议会尽管在参与表决的议员中反对票多于赞成票,仍通过了消息扫描规则。在"聊天管制"这一名称之下,混杂着允许自愿扫描的 1.0 与规定强制性检测的 2.0(CSAR)提案,因而引发了不少误解。本文从开发者的视角,梳理实际通过的内容、二读的绝对多数规则这一程序,以及客户端扫描与端到端加密之间的技术冲突。文中会区分规则所强制的内容、批评者所担忧的内容与支持者所主张的内容。
2026-07-11 · 10 分钟阅读 #privacy#encryption#eu-regulation#client-side-scanning#messaging构建高效的 AI 智能体 — 五种工作流模式与智能体参考指南
把 Anthropic 的工程指南《Building Effective Agents》整理成了一份实战参考。文中厘清工作流与智能体的准确区分,介绍作为一切基础的增强型 LLM(检索·工具·记忆),并逐一讲解五种工作流模式(提示链·路由·并行化·编排者-工作者·评估者-优化者)各自的适用场景与示例。同时坦诚地写下自主智能体究竟是什么、何时该用智能体取代工作流,以及过度设计·失控循环·成本/延迟等失败模式。目标是为开发者和 AI 智能体提
2026-07-11 · 14 分钟阅读 #ai#agents#llm#engineering#anthropic为每一步选择该思考多少 — Ares 的自适应推理努力路由
本文从实践角度梳理了 Ares(2026 年 3 月的预印本)。这篇论文把推理努力当作以步骤为单位的成本杠杆,而不是任务整体层面的选择。一个轻量级路由器查看交互历史,预测每一步所需的最低推理级别,从而减少让所有步骤都以最大努力运行的浪费。作者报告称,在 TAU-Bench、BrowseComp-Plus、WebArena 上,推理 token 最多削减了 52.7%,而成功率下降甚微——但这是未经独立验证的作者自报数值。本文一并讨论路由
2026-07-11 · 7 分钟阅读 #ai#agents#llm#efficiency开发者离开 GitHub 转向 Codeberg 的原因 — 以及离开时真正失去的东西
离开 GitHub 转向 Codeberg、Forgejo、自托管的文章突然多了起来。背景是 Ghostty、Zig、Gentoo 的出走、频发的故障、微软将其并入 CoreAI,以及 2026 年 4 月 AI 训练默认值的反转。本文基于真实的一手资料,均衡地梳理是什么在推动人们、Codeberg 与 Forgejo 实际能带来什么,以及离开 GitHub 时真正失去的东西(网络效应、CI、可发现性)是什么。这不是对 GitHub 的
2026-07-11 · 9 分钟阅读 #github#codeberg#forgejo#self-hosting#open-source