博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
Keycloak 26.7 — SCIM 升级为预览版,无需外部 Infinispan 的多集群 v2,以及升级中容易踩的坑
2026 年 7 月 9 日发布的 Keycloak 26.7.0,把一个悬而未决近四年的诉求 —— SCIM API —— 升级为预览版,并推出了预览版的多集群 v2,它无需外部 Infinispan 集群,仅靠数据库就能构建多集群高可用。Organizations(组织)功能新增了专属管理角色和按组织划分的细粒度权限委托,让多租户运维更进了一步。不过,SCIM 目前只实现了接收方(即 Keycloak 作为 SCIM 服务器)这一侧
2026-07-17 · 25 分钟阅读 #security#keycloak#sso#iam#scim用一张图片生成视频 — Kling·Veo·Sora vs Wan·HunyuanVideo,何时选哪个
在挑选「一张图片加一段提示词生成视频」的模型时,真正左右决定的不是演示片的画质,而是每秒价格、输入图像限制、许可证这三件事。本文以 2026 年 7 月为基准,只依据各厂商的官方价目表和文档直接核对整理。托管一侧,sora-2 为 720p 每秒 0.10 美元,Veo 3.1 Fast 为含音频 720p 每秒 0.10 美元;Kling 则不按秒、而按 5 秒·10 秒的片段为单位计费,「每秒价格」根本不存在。开放权重一侧,Wan2
2026-07-17 · 31 分钟阅读 #ai#video-generation#image-to-video#open-weights#licensingDMARC 时隔 11 年终于成为标准 — RFC 9989 的树遍历、pct 的废除,以及 p=reject 的警告
自 2015 年 3 月起就一直是电子邮件认证事实标准的 DMARC(RFC 7489),其实是一份从未经过 IETF 工作组共识程序的 Informational 文档。2026 年 5 月,IETF 用三份 Standards Track 文档 — RFC 9989(核心规范)、RFC 9990(汇总报告)、RFC 9991(失败报告) — 取代了它,DMARC 时隔 11 年才成为正式的互联网标准。组织域的判定方式从 Public
2026-07-17 · 23 分钟阅读 #email#dmarc#dns#security#rfcLLM API 成本如何真正降下来 — 「缓存 90% 折扣」到了账单上为什么只有 25%
提示词缓存的缓存读取只有输入价格的十分之一。但这并不会把账单砍掉 90%。照着 Anthropic 放在自家文档里的计算示例走一遍:即便缓存完全命中,总额也只是从 0.705 美元降到 0.525 美元,减少 25.5%。原因很简单 — 折扣只按该项目在账单中的花钱比例缩减账单,而输出 token 已经吃掉了成本的 60%。所以本文不罗列折扣率,而是直接把账单算出来。缓存的盈亏平衡点(要读几次才回本)、缓存完全不生效的最小 token
2026-07-17 · 32 分钟阅读 #llm#cost-optimization#prompt-caching#api#aiOpenBao 到底比 Vault 分叉了多少 — 从发布说明看分歧点,直到 v2.6 的命名空间封印
距离 OpenBao v2.0.0 GA(2024-07-17)正好过去两年,而三天前 v2.6.0 才刚发布。本文抛开「BUSL 背叛」对「可持续性」这类阵营论调,只用两个项目自己发布的发布说明、变更日志和提交记录,来确认这个分叉到底在哪里真正分道扬镳。OpenBao 把曾经 Vault Enterprise 专属的命名空间在 v2.3.1 开源了出来,又在 v2.6.0 加上了上游没有的、按命名空间划分的加密封印。反过来,存储后端、
2026-07-17 · 16 分钟阅读 #security#open-source#devops#licensingNeo4j 日历版本时代中期盘点 — 块格式、Cypher 25,以及 GQL 落地引擎的方式
Neo4j 在 2025 年初转向日历版本号(CalVer)以来,大约 17 个月里发布了 18 个功能版本,而每个版本的热修复支持在下一个版本发布的那一刻就结束。截至本文撰写的 2026 年 7 月,CalVer 系列仍然没有 LTS,如果需要稳定支持,就得停留在 5.26 LTS(热修复维护到 2028 年 6 月),代价是放弃 Cypher 25、VECTOR 类型和新的 GQL 语法。本文不谈图 RAG,而是用一手资料(官方更新
2026-07-17 · 23 分钟阅读 #database#neo4j#graph-database#cypher#gql在本地跑 LLM 到底需要多少 VRAM — 别查表,用公式算
「8B 模型需要几 GB」这个问题的正确答案不是一张表,而是两个公式。权重是参数量乘以 bpw 除以 8;KV 缓存是 2 乘以层数乘以 KV 头数乘以 headdim 乘以字节数乘以 token 数。本文把这两个公式直接对照 llama.cpp 的源代码与官方表格来验证 — 从 ggml 块结构体推导出的 Q80 的 8.5 bpw,与 llama.cpp 发布的 8.5008 吻合到小数点后第三位;用同样的方式反推出的参数量为 8.
2026-07-17 · 34 分钟阅读 #llm#quantization#kv-cache#local-llm#gpuGraphQL 规范,时隔近 4 年的发布 — September 2025 版本与 GraphQL.js 17 GA 里都有什么,还差什么
GraphQL 规范自 October 2021 以来,时隔近 4 年更新到了 September 2025 版本,参考实现 GraphQL.js 也在经历了超过 4 年的 alpha 阶段后,于 2026 年 6 月 15 日发布了 v17 GA。本文直接对照规范原文、npm 注册表与 RFC 追踪器,梳理这两次发布里真正落地的内容 — OneOf 输入对象、Schema Coordinates、执行器分离、AbortSignal —
2026-07-17 · 19 分钟阅读 #graphql#graphql-js#api-design#federationcurl 8.21.0 的 18 个 CVE — 漏洞赏金终结之后迎来的「高质量混乱」
2026 年 6 月 24 日,curl 8.21.0 在单个版本中发布了 18 个 CVE,刷新了项目记录。不过这 18 个全部是 Low 或 Medium,High 级别自 2023 年 10 月以来一个都没有出现过。这个数字背后,是一个被 AI 劣质报告折腾到 2026 年 1 月底废除了漏洞赏金的项目,从 3 月起却反过来迎来了「几乎全用 AI 写、但质量很高」的报告洪流。本文用 curl 自己公开的机器可读数据 vuln.js
2026-07-17 · 23 分钟阅读 #network#security#curl#cve#open-sourceDart 宏取消一年半后 — 承诺的三件事真的交付了吗
宏是 Dart 团队在 2024 年 Google I/O 上最重推的功能,却在 2025 年 1 月 29 日被正式取消。原因不是功能本身不好,而是语义内省(semantic introspection)的编译期成本拖慢了 Flutter 的核心资产——stateful hot reload。取消公告转而承诺了三件事——面向数据的定制语言特性、buildrunner 的改进、以及 augmentations 独立交付。本文以 2026
2026-07-17 · 16 分钟阅读 #flutter#dart#macros#code-generation#metaprogrammingContent-Encoding: zstd — Safari 26.3 补齐三大引擎,下一步是 RFC 9842 压缩字典
2026年2月,Safari 26.3 支持了 Content-Encoding: zstd,继 Chrome 123(2024-03)、Firefox 126(2024-05) 之后,三大浏览器引擎现在都能接收 zstd 响应了。由于是基于协商的,采用风险很低,但服务器端仍然不对称 — nginx 和 Apache httpd 都没有官方 zstd 模块,现实可行的路径是 CDN(如 Cloudflare)、Caddy,或者 Node
2026-07-17 · 17 分钟阅读 #performance#web#network#browserJPEG XL 的回归到底有多真实 — Chromium 反转决定8个月后,从源头核实的现状
2022年10月,Chromium 以生态系统关注度不足为由移除了 JPEG XL 代码,这个决定在三年多的时间里,一直是图像格式争论中的代表案例。2025年11月22日,Chrome 的 ATL 在四年前的那条 blink-dev 帖子里反转了立场 — 但附带条件是"性能良好、内存安全的解码器贡献"以及"为默认启用做出长期维护承诺"。本文追踪的不是新闻报道,而是这次反转之后到底有什么真正进入了代码 — 直接查阅 Chromium Ge
2026-07-17 · 20 分钟阅读 #multimedia#jpeg-xl#chromium#browser#web-performance通向 47 天 TLS 证书的时间表 — 从 SC-081v3 原文核实的分阶段日期、Let's Encrypt 的 45 天过渡计划,以及 ACME ARI
从 2026 年 3 月 15 日起,公开信任(publicly-trusted)TLS 证书的最长有效期已经从 398 天降到 200 天,而按照 CA/B Forum 投票(SC-081v3)敲定的时间表,还会继续降 — 2027 年 3 月降到 100 天,2029 年 3 月降到 47 天。真正更痛的不是有效期本身,而是域名验证的复用期限 — 从 2029 年 3 月起降到 10 天,实际上意味着几乎每次续期都要重新验证。本文不
2026-07-17 · 25 分钟阅读 #security#tls#certificates#webpki#automationHome Assistant Matter 服务器 9.0 — 为什么放弃官方 C++ SDK,改用 matter.js 重写
2026 年 6 月 23 日,Home Assistant 的 Matter 服务器升级到 9.0,基于 Python + 官方 C++ SDK(connectedhomeip)的实现被整体替换为用 TypeScript 从零重写的 matter.js 服务器。这次升级带来了实打实的改善 — 重启和重连变快(局部询问/partial interview)、OTA 更新被整合进控制器、测试证书设备的入网(commissioning)改为
2026-07-17 · 17 分钟阅读 #iot#smart-home#home-assistant#matter#threadAI 编程智能体,哪个用来干什么 — 仅凭四家厂商官方文档确认的选择标准
在 Claude Code · Cursor · GitHub Copilot · OpenAI Codex 之间做选择时,被问得最多的问题是「哪个最便宜」。然而只靠四家公司公开的价格,这个问题得不出答案,因为四家出售用量的单位各不相同 — Anthropic 按相对 Pro 的倍数(5 倍·20 倍)卖,Cursor 按以美元标示的包含 API 用量卖,GitHub 按 1 积分 = 1 美分的积分卖,OpenAI 按每 5 小时窗口
2026-07-17 · 35 分钟阅读 #ai#ai-coding-agent#claude-code#cursor#github-copilotDeno 2.9 — deno desktop 实验、原样迁移锁文件,以及 24 小时供应链默认值
2026 年 6 月 25 日发布的 Deno 2.9,可以归纳为三件事。用 Web 技术栈构建原生桌面应用的实验功能 deno desktop(默认使用 OS 自带 webview,可选打包 CEF);直接读取现有 npm、pnpm、yarn、Bun 锁文件来播种 deno.lock 的迁移路径;以及 min-release-age 的默认启用 — 拒绝安装刚发布 24 小时内的 npm 包。在此之上还叠加了 Node 26 兼容目标
2026-07-17 · 21 分钟阅读 #javascript#deno#javascript-runtime#node-compatibility#supply-chainAI 代码评审到底能不能用 — 测量证据揭示的准确率与误报
AI 代码评审工具的营销话术里充斥着「80% 的 PR 不需要人类评论」这样的数字,但真正把精确率和误报率一起公开的地方几乎没有。把公开的测量结果收集起来看,方向大体一致 — 在开源 PR 上,AI 评审评论真正带来代码变更的比例因工具而异,只有 0.9~19.2%,远低于人类评论的 60%(Gan 等,GitHub Actions 16 款·仓库 178 个·评论 22,326 条)。而在一家把评论解决写进政策强制执行的企业案例里,同
2026-07-17 · 38 分钟阅读 #ai#code-review#static-analysis#evaluation#software-engineering操控浏览器与计算机的 AI 智能体,如今走到了哪一步 — 基准测试数字实际衡量的是什么
「计算机使用智能体在 OSWorld 上拿到了 83.5%」和「最强的智能体也只能做完 20.6%」都是 2026 年出现的事实,而且都是对的。前者是 OSWorld 1.0,后者是同一个团队做的 OSWorld 2.0。本文顺着原始论文和基准作者的自测,追踪这道鸿沟从何而来:Epoch AI 的独立分析指出 OSWorld 近一半的任务几乎不用 GUI、靠终端就能解决;作者重测显示同一个 o3 只改步数预算就会从 9.1% 摇到 23
2026-07-17 · 37 分钟阅读 #ai#computer-use#browser-agents#benchmark#prompt-injectionAI 智能体的记忆实际上是怎么做出来的 — 四种设计,以及基准测试实际证明了什么
「智能体记忆」不是一种单一技术,而是把至少四种彼此不同的设计笼统打包的说法 — 文件草稿板、摘要/compaction、向量召回、知识图谱。本文先用产品文档确认每一种实际在做什么,然后抛出一个更不舒服的问题:「哪种更好」的证据真的被测量过吗? 直接去读 Mem0 论文(arXiv:2504.19413)的表格就会发现,头条的「相对 OpenAI 提升 26%」是事实,但在同一张表里,把整段对话原样贴进提示词的全上下文方式以 J 72.9
2026-07-17 · 31 分钟阅读 #ai#ai-agent#agent-memory#llm#benchmark上下文工程取代了提示词工程吗 — 哪些被测量过,哪些没有
「提示词工程已死」这句话,在创造这个术语的任何一手来源里都不存在。Karpathy 把 few-shot 示例和任务描述列为上下文工程的组成部分,Anthropic 则写道这是「提示词工程的自然演进(natural progression)」。也就是说,不是替代,而是包含。尽管如此,「这确实是一件不同的工作」是有证据的 — Chroma 的 LongMemEval 实验把问题和措辞原样保留,只把周围上下文从 300 token 增加到
2026-07-17 · 30 分钟阅读 #llm#context-engineering#prompt-engineering#long-context#ai-agent