博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
交付物变便宜之后,评价会挪到哪里 —— 丹麦为什么选择了口头答辩
丹麦教育部推出了一揽子即时措施,要求在家完成的考试作业必须经过口头答辩。当写作成本趋近于零,光看交付物就什么都判断不了,评价便从产出物挪向了作者身份的证据。本文先按原文如实梳理这项公告到底宣布了什么、三项措施各自瞄准什么,再区分清楚把这套逻辑挪到招聘作业和代码评审上时,哪些地方成立、哪些地方会断。
2026-08-09 · 12 分钟阅读 #assessment#hiring#code-review#education#engineering-culture「代码从来就不是难的那部分」这句话,为什么那么招人上火
2026 年 8 月冲上 Hacker News 首位的一篇随笔主张:说「代码从来就不是难的那部分」是对所有程序员的侮辱。本文认同这份反驳,但把原因归到别处。那句话之所以招人上火,不是因为它错,而是因为它在半路上把「代码」这个词的含义偷换掉了。把代码切成三层,就能看清双方各自在哪里成立,也能量出你们团队实际上把时间花在了哪一层。
2026-08-09 · 11 分钟阅读 #career#craft#ai#engineering-culture#skills摩擦消失后留下的不是眼光,而是养出眼光的那条路消失了
2026 年 8 月引发热议的随笔 Taste Is All That Is Left 说:随着「做东西」变便宜,唯一还稀缺的能力就是判断什么值得做。本文认同这份诊断,并再往里走一步。眼光是「努力」这台过滤器的副产品;过滤器一旦被拿掉,留下的并不是眼光,而是养出眼光的那条路一起消失了。所以真正需要的是一套刻意恢复摩擦的具体习惯,本文整理了个人与团队各自该改变什么。
2026-08-09 · 11 分钟阅读 #career#craft#ai#code-review#mentoring数据驻留不是一个下拉框,而是一套复制拓扑
本文以 Fastmail 在 2026 年 8 月 3 日开放欧盟数据区时公开的文档为教材,讲清楚数据所在地为什么不是选一次区域就能定下来的。主副本、副本、灾备备份、全局复制的元数据、日志、第三方集成,以及故障时的回退路径,各自可以在不同的位置 —— 而且实际上就在不同的位置。Fastmail 明确写出欧盟账号的副本在美国、备份在费城、日志汇总在美国,并说明自家是澳大利亚法人,因此无论数据在哪里,对合法请求的响应都一样。以这份披露程度作
2026-08-09 · 13 分钟阅读 #architecture#data-residency#gdpr#replication#complianceLLM 做不到的不是证明,而是立起前提
ICML 2026 的立场论文 Position: LLMs can not jump 主张,生成式 AI 已经掌握了归纳,也正在快速攻下演绎,但对于造出新解释性假说的溯因推理,它在结构上根本到不了。本文不去复述那套论证,而是去问:假定它成立的话,我们此刻正在做的系统,设计上该改哪里。假说空间从哪里供给,为什么必须把提出与反驳拆开,以及「这是一篇立场论文」这个事实该如何影响你的读法。
2026-08-09 · 12 分钟阅读 #ai#llm#reasoning#abduction#research塞进照片的二维码,代价是什么 —— 纠错是一笔预算
把「往二维码里塞照片」这门技法拆开看,会发现它不是一个设计决策,而是一个预算分配决策 —— 因为用来把它做好看的那点余量,本来是留给褶皱的纸和糟糕的照明的。把一个模块切成九格的做法、由此产生的九分之一噪点,以及把误差扩散跑两遍、既不花预算又能得到更干净画面的思路,全部沿着原始资料的讲解整理下来。
2026-08-09 · 12 分钟阅读 #algorithm#qr-code#error-correction#dithering#image-processing发布本身就是压测 —— 不为「把缓存填满」设计成本会发生什么
拆解 Canva 把网关的内存态会话吊销缓存从 MySQL 迁到 S3 的过程。问题不在稳态的查询成本,而在每次发布时几百个 Pod 同时填缓存、把数据库砸穿的启动成本;解法也不是再叠一层缓存,而是换掉数据的表示方式。把 12 小时的滑动窗口切成 30 分钟的片段,再把一条吊销压进 16 字节做成有序数组,网关就能对下载下来的字节不做任何转换直接做二分查找。文中还理清了条件式 PUT 与领导者选举里,哪一个是正确性、哪一个是优化。
2026-08-09 · 12 分钟阅读 #architecture#caching#s3#scalability#deployment评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluation把观测数据放进 ClickHouse 意味着什么 — schema、rollup、TTL 与职责划分
当 trace 和日志每天膨胀到数 TB 规模,单靠一个搜索引擎或时序数据库就很难撑住了。本文从列式存储、压缩与排序键的角度,梳理 ClickHouse 为什么适合观测数据,并用真实的 DDL 设计 trace 表和日志表。文中讲清属性该用 Map 还是 JSON 类型的判断标准、如何用物化视图做 rollup、如何用分区和 TTL 控制成本。最后整理在已经用着 Prometheus 和 OpenSearch 的前提下,三者的职责该怎么
2026-08-02 · 22 分钟阅读 #observability#clickhouse#opentelemetry#data-modeling#cost怎样读完一本难啃的书——比读完更重要的五个判断
一本难啃的书读不进去,原因通常不是生词,而是论证的结构。这篇文章以艾德勒的读书法、以及阅读研究实际支持的结论为依据,梳理了与其慢读一遍不如快读两遍的方法、导读从帮助变成拐杖的那条界线、合上书之后还能留下来的笔记、诚实地读一本译本的态度,以及好好放弃一本书的方法。文中也标出了大众读书建议跑到证据前面去的那些地方。
2026-08-02 · 21 分钟阅读 #storytelling#reading#books#learning#culture经典电影入门指南——25 部佳作,该按什么顺序看
经典电影片单到处都是,告诉你先后顺序的却很少见。这篇文章不按排名排列 25 部佳作,而是按新手观众实际会撞上的问题来分类:黑白画面看不下去时、感觉什么都没发生时、想知道某个类型片的原型时、形式本身就是内容时,以及想填补世界电影地图上的空白时。每一部都标注了导演、年份、片长,并写明什么样的人会觉得这部片子难以忍受,也说明了什么时候可以直接关掉。
2026-08-02 · 28 分钟阅读 #storytelling#film#classics#world-cinema#culture多 GPU 训练的四种并行方式 —— 拆分什么,通信什么
用数字梳理了数据并行、张量并行、流水线并行、上下文并行各自拆分什么,又为此付出什么通信代价。首先搭建 Adam 混合精度训练中每参数 16 字节的账本,再计算 ZeRO 1 到 3 阶段分别把账本中的哪一项按 GPU 数量切分。接着用激活内存公式说明检查点技术为何能把 100GB 变成 1GB,并把各种并行方式的通信量换算成每步字节数,说明 NVLink 内部与节点之间的带宽差距为何决定批次配置。最后给出按模型规模和 GPU 数量选择组
2026-08-02 · 19 分钟阅读 #mlops#distributed-training#multi-gpu#fsdp#deepspeedExcel 快捷键,真正省时间的那些 —— 不要死记,要理解规则
与其罗列 200 个 Excel 快捷键,不如按实际在做的工作把它们归类。一旦理解了方向键家族为什么总能准确知道数据到哪里结束、绝对引用的循环是按什么顺序转的,就不再需要死记组合键。本文分成移动与选择、编辑与粘贴、公式、表格与筛选、格式、工作表管理六个部分,每处都同时给出 Windows 和 Mac 按键,并区分标注了哪些是从微软官方文档核实过的,哪些没有。
2026-08-02 · 23 分钟阅读 #excel#shortcuts#productivity#office#keyboard从公开的训练案例中学习 —— 试过什么,又是什么失败了
挑选了七份公开的大规模训练技术报告与日志本,只抽取失败与应对,而不是成绩单。从 Llama 3 405B 54 天内 419 次中断的统计里反推出检查点周期,比较 DeepSeek-V3 与 Kimi K2 分别在哪一层消灭了损失尖峰。也讨论了 Olmo 系列为什么把稳定性修复留在了架构里、OPT-175B 与 BLOOM 日志本留下的失败记录原型,以及 SmolLM3 与 Marin 公开的数据混合实验笔记。每个案例都附上出处链接,并
2026-08-02 · 20 分钟阅读 #mlops#llm-training#case-study#training-stability#scaling值得花时间的30本小说,以及前50页法则
小说推荐片单到处都是,可真正需要的信息却常常缺席:这本书到底有多少页,有多难,前50页读不下去的时候,这本书是该硬撑还是该放弃。这篇文章按这个标准,整理了30本书——经典、20世纪现代小说、最近二十来年、类型小说、韩国文学,以及非西方世界,最后单列出一批需要读者主动挑选译本的翻译敏感作品。
2026-08-02 · 32 分钟阅读 #storytelling#novels#reading#world-literature#culture用 AI 搭建博客写作流水线 —— 瓶颈不是初稿,是核实
本文把用 AI 写博客文章的过程拆成从选题收集到复盘效果的七个阶段,区分出每个阶段模型真正帮得上忙的地方,以及绝对不能放手的地方。这条流水线的重心不在初稿,而在事实核查。文章配合可运行的脚本,讲清楚如何让模型只引用它真正读过的内容、如何区分"写得很自信的句子"和"已核实的句子",以及发布前要跑一遍的检查清单。自动化流程图特意保留了人必须停下来的那些环节。
2026-08-02 · 25 分钟阅读 #ai-writing#content-pipeline#fact-checking#automation#blogging这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantizationWord・PowerPoint 快捷键 —— 文档按样式处理,幻灯片按对象处理
Word 和 PowerPoint 用的是同一套功能区,但肌肉记忆完全不同,因为 Word 处理的是流动的文本和样式,PowerPoint 处理的是画布上的对象。本文把两个应用分别按各自的性格分组,每一组都先讲支配这一组的规则,而不是逐个讲按键,并且把"重复应用格式刷"和"用样式统管整份文档"这类会改变工作方式本身的条目放在前面重点讲。同一个组合键在两个应用里做相反的事的地方,放在了最后单独整理。全文同时给出 Windows 和 Mac
2026-08-02 · 31 分钟阅读 #word#powerpoint#shortcuts#office#productivity会被读的仪表盘与值得呼人的告警 — 定义问题、组织变量、SLO 与告警疲劳
仪表盘的价值不在于好看,而在于能按顺序回答一组固定的问题。本文讲在动手做面板之前先写下要回答的问题,再讲数据源和变量该怎么组织,才能让一个仪表盘在多个环境里复用。文中用案例说明为什么告警该挂在症状而不是原因上,并把 SLO、错误预算、多窗口燃烧率告警写成真实的规则。最后整理出减少告警疲劳的规则,以及把仪表盘当作代码来管理的方法。内容以 Grafana 12 系列和 Prometheus 3.13 LTS 为准。
2026-08-02 · 21 分钟阅读 #observability#grafana#alerting#slo#dashboards设计能回答问题的 Prometheus 指标 —— 类型选择、基数预算,以及 rate 和分位数的陷阱
指标不是越多越好,能回答问题才有价值。本文先讲清楚 Counter、Gauge、Histogram 各自回答什么问题,选错了会让哪些计算在原理上变得不可能。接着讲怎么用数字而不是直觉给标签基数定预算,rate 和 histogramquantile 在什么条件下会悄悄给出错误答案,以及什么时候该建 recording rule、该起什么名字。最后留下五个在做面板之前应该问自己的问题。内容以 Prometheus 3.13 LTS 为准验
2026-08-02 · 24 分钟阅读 #observability#prometheus#promql#metrics#cardinality