博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
三行配置文件让 4 张 GPU 死了一周 — containerd drop-in 合并的真相
节点不再广告 GPU。配置文件里 nvidia 运行时明明写得好好的,containerd config dump 里却没有。真凶是一周前加进去的三行 registry 配置,原因在于 containerd 的 imports 合并不是按字段合并,而是按插件整块替换。我把两次误诊的过程,以及最后给出答案的那个实验,原样记在这里。
2026-08-26 · 16 分钟阅读 #kubernetes#containerd#gpu#nvidia#troubleshooting人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字
我们用111万参数做了一个条件扩散模型:输入 "zero" 就画出 0。加噪的 forward 只是一行公式,还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题,以及为什么模型被训练去预测噪声而不是图像。
2026-08-24 · 11 分钟阅读 #ai#diffusion#ddpm#generative#pytorch人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch用家里的服务器搭一个实操型学习平台 — 如何把 Kubernetes 塞进没有特权的 Pod 里
学员按下按钮,专属容器随即启动,在浏览器终端里操作真实的 Linux shell,每一步点击评分后由服务器检查 Pod 内的实际状态来判定通过与否 — 这是把这样一个学习平台搭在家里 7 节点 Kubernetes 集群之上的记录。最难的问题不是功能,而是隔离。既然是实操,就必须把 root 交给学员,但这个 root 绝不能跑到家庭网络里去。解法是三层:把 Cilium 网络策略拆成按实验区分的三档配置,Linux capabilit
2026-08-20 · 22 分钟阅读 #kubernetes#cilium#security#homelab#kwokLabHub — 我做了一个在浏览器里操作真实服务器来学习的实操平台
有些东西光靠读是学不会的。连上服务器敲命令、敲错、再弄清楚为什么错了 — 这个过程没有任何替代办法。LabHub 就是把这个过程搬进浏览器里的学习平台。点下开始实验,专属的 Linux 容器立刻启动,用浏览器终端连上去解题,每一步由服务器检查实际状态并告诉你是否通过。里面有学习路径 12 条、课程 73 门、实验 261 个共 2058 步、测验 1876 题、理论 319 篇。从 IT 基础和 Linux 起步,一路延伸到容器、Kub
2026-08-20 · 10 分钟阅读 #labhub#kubernetes#devops#education#hands-on人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on小习惯的力量 — 21天的神话、66天的中位数、18到254天的现实
习惯21天就能养成这句话,没有习惯研究的依据。那个数字来自1960年一位整形外科医生的观察。实际上被引用最多的拉利团队的习惯形成研究,报告的是自动化平均需要66天,个体差异从18天到254天这样一个宽阔的范围。本文整理了情境稳定性与摩擦设计、缺一天并不等于失败的原因,以及习惯类书籍越过依据的那个地点。
2026-08-16 · 18 分钟阅读 #mindset#habits#psychology#self-improvement#2026-08专家不是知道得更多,而是看到的东西不一样
1973年的棋盘实验是专业性研究的起点。高手对真实对局局面的记忆远远更好,但在随机撒开的排列上,这份优势大部分都消失了。这意味着靠的不是记忆容量而是模式知觉。本文梳理从国际象棋出发、经由体育的视线研究一直延伸到语言的成块处理的证据,并看看这个发现对练习方法提出了什么要求。
2026-08-16 · 19 分钟阅读 #mindset#learning#expertise#chunking#perception把事情做好的结构 — 自我评估、反馈、窄范围
想把事情做好的心谁都很大,可是做得好这件事究竟由什么构成,反倒很少有人问。本文用校准过的自我评估、快速的反馈回路、先窄范围这三根柱子,把实力的结构整理成一张地图。每根柱子更深的内容接到刻意练习、元认知、从乒乓球里学到的东西那几篇,最后还写了这套建议不适用的情况。
2026-08-16 · 15 分钟阅读 #mindset#growth#deliberate-practice#self-improvement#2026-08人不容易改变,而人会改变 — 性格变化的证据与速度
人不会变这句话和人可以变这句话都是真的,而这份张力就是本文的主题。整个成年期都维持着的大五名次稳定性,随年龄移动的成熟原理,用执行意图去尝试性格变化的哈德森的那些实验,通过智能手机干预连观察者都看得见的变化,以及治疗前后的性格变化综述。本文把性格重新定义为缓慢变化的一束习惯,并老实写下了可以期待的速度与幅度。
2026-08-16 · 18 分钟阅读 #mindset#personality#psychology#self-improvement#2026-08从乒乓球里学到的14件事:实力造就关系,头衔挡住成长
把长年打乒乓球得来的十四条原则整理出来,看看它们怎么迁移到工作和生活里。实力成为关系入场券的结构、只图打得开心为什么不会进步,以及自己的头衔挡住学习的那一刻。迁移不过去的部分也一并写了。
2026-08-16 · 16 分钟阅读 #mindset#growth#deliberate-practice#sports#career聪明的定义:什么被测量了,什么没有被测量
智力这个词里混着三样彼此不同的东西:作为统计规律的一般因子、心理测量学的主流模型CHC,以及日常评价一个人时使用的社会用法。本文把这三样分开,梳理多元智能和学习风格为什么被广泛教授却依据薄弱,以及测量到的能力的预测力为什么在两个方向上都被夸大。测量到的能力不是人的价值。
2026-08-16 · 20 分钟阅读 #mindset#intelligence#psychometrics#expertise#evidence元认知 — 知道的感觉与真的知道之间的间隔
元认知在变成流行语的过程中丢掉了定义。本文回到监控与控制这个原本的定义,梳理知道的感觉如何从流畅性这个代理信号里被造出来、看着答案就觉得自己会了的再认与回忆的混淆,以及自我测验如何矫正重读所制造的错觉。邓宁-克鲁格效应不按大众版处理,而是连统计学批评一起老实地讲,最后以自我测验、先预测再打分、出声解释这三件便宜的工具收尾。
2026-08-16 · 18 分钟阅读 #mindset#metacognition#learning#psychology#2026-08目的不确定的时候 — 明确并不是出发的条件
在不知道自己为了什么而活的状态里,等目的变明确了再说这个策略为什么会失败。目的不是在计划的上游、而是在积累的下游被发现的这一视角,用罗盘而不是坐标来移动的方向的语言,没有确信也能行动的小赌注的技术,以及等待热情的陷阱。这是一篇写作时就言明了自己不是研究梳理、而是用结构来论证的随笔。
2026-08-16 · 17 分钟阅读 #mindset#purpose#career#self-improvement#2026-08练习的结构:做起来顺的练习和留得下来的练习为什么不一样
拉开间隔、提取练习、混合起来练。学习研究中依据相对结实的三件事,连同效应量一起梳理了出来。然后处理这个领域的核心悖论:让练习过程中的表现最好的条件,和让后来留下最多的条件,是互相不同的。自己安排的练习感觉良好却不太见长,原因就在这里。
2026-08-16 · 20 分钟阅读 #mindset#learning#practice#retrieval#spacing不降低标准的方法 — 这是结构问题,不是意志问题
标准不是因为你下定决心放弃才崩塌的。它通过没有名字的例外、疲惫时的重新谈判、向周围中位数的收敛,安静地往下滑。本文梳理标准崩塌的五种机制以及各自的应对结构,区分守住标准与惩罚自己,也诚实地写出降低标准才正确的情况。
2026-08-16 · 11 分钟阅读 #mindset#standards#discipline#growth#2026-08所谓努力 — 努力不是美德,而是分配问题
让你努力一点的建议里没有方向。把努力当成预算而不是总量来处理,图景就变了。工作时长与产出的非线性关系,综合60万人、关于每周55小时以上劳动与心血管风险的元分析,恢复经验研究所说的心理脱离,以及组织里看不见的努力得不到评价的结构问题。本文整理的是如何设计可持续的分配,而不是英雄式的猛冲。
2026-08-16 · 18 分钟阅读 #mindset#productivity#burnout#self-improvement#2026-08学习好和运动好之间的共同点,比想象的要窄
学习和运动之间、编程和乐器之间,真的存在会迁移过去的能力吗。认知训练迁移研究的结论与大众期待相反:近迁移可以观察到,远迁移实际上观察不到。本文梳理了下棋能让脑子变好这类主张为什么失败、即便如此仍然能跨越领域迁移的那份很窄的清单是什么,以及为什么用勤奋或一般能力来解释并不够,并附上元分析的依据。
2026-08-16 · 19 分钟阅读 #mindset#learning#expertise#transfer#evidence