博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
AI 写的文章会在哪里崩掉 —— 六种失败模式与对应的护栏
AI 写的文章,是在句子依然流畅的情况下出错的。本文把六种失败模式 —— 编造的出处、截止日期之后就过时的信息、被拉长重复同一个意思的段落、没有依据的断言、只为搜索排名而堆砌的重复表达,以及抄袭与版权问题 —— 按检测方法和修正方法逐一梳理。能自动化的检查配了可运行的脚本,不能自动化的地方也明确说清楚。文章还讨论了读者和搜索引擎真正会惩罚的是什么,以及一份未经核实的初稿会暴露出哪些句子模式。
2026-08-02 · 23 分钟阅读 #ai-writing#content-quality#hallucination#seo#editing2026 年 LLM 训练技术栈地图 —— 每一层替你做了什么,又藏起了什么
把 LLM 训练框架分成三层来梳理谱系。最底层是 PyTorch 分布式、DeepSpeed、Megatron-Core 这类执行引擎;中间层是 torchtitan、Megatron-Bridge 这类训练循环;最上层是 TRL、Axolotl 这类靠一份配置文件就能跑起微调的工具。文中记录了每一层替你做了什么、又用这个换来了藏起什么,以及上层框架反而会碍事的那些地方。所有版本号与日期均于 2026 年 8 月 2 日直接在 PyPI
2026-08-02 · 19 分钟阅读 #mlops#llm-training#pytorch#trl#framework用 Slurm 跑 GPU 集群 —— 比提交更重要的是知道为什么不跑
整理了在 GPU 集群上实务使用 Slurm 所需的一切。先建立分区、QoS、账户这套坐标系,再讲在 sbatch 脚本里申请 GPU、CPU、内存的方法,以及其间的绑定陷阱。用两段真正能跑起来的脚本,给出通过 srun 和 rendezvous 启动多节点训练的两种模式,还讲了如何用数组作业和依赖链把参数扫描和续训交给调度器去管。后半部分全是失败案例:按代码解读 PENDING 原因的方法、区分主机内存 OOM 与 GPU OOM 的
2026-08-02 · 20 分钟阅读 #mlops#slurm#hpc#gpu-cluster#distributed-training让日志可搜索,同时别把公司搜穷 — 结构化、映射爆炸、保留期与真实成本
日志成本超过计算成本的那一天,会降临在大多数组织身上。真正决定这一天能推迟多久的,不是压缩率,而是「把什么定义成字段」这个决策。本文讲结构化日志的字段设计、OpenSearch 映射爆炸拖垮集群的真实路径、用索引模板和 ISM 控制生命周期的方法,以及有原则的采样和保留分层。最后用数字算一算,用日志去模拟指标到底要付出多大代价。内容以 OpenSearch 3.5 和 OpenTelemetry Collector v0.157.0 为
2026-08-02 · 21 分钟阅读 #observability#logging#opensearch#elasticsearch#cost现在 Hugging Face 上什么在火 —— 2026 年 8 月热门地图
以 2026 年 8 月 2 日为准,亲自过了一遍 Hugging Face 的热门榜单,按用途整理出真正能用于部署的模型。按通用 LLM、编程、嵌入与重排、视觉、语音、图像视频生成、小型端侧模型的顺序,写清了每个模型的厂商、规模、许可证,以及使用前需要了解的限制。核心结论是:热门榜单里相当一部分根本不是新模型,而是量化重新上传和社区微调。文中讲了怎么分辨原版和衍生版、为什么衍生版的下载量会反超原版,以及这个事实对选型意味着什么。所有数
2026-08-02 · 25 分钟阅读 #llm#huggingface#open-weights#model-selection#quantization工具还是对象 — 把意识问题悬置之后,仍然能说的事情
人们面对AI时最先抓住的问题是"这东西有没有意识"。这是最难的问题,大概也不是最有用的问题。本文把这个问题悬而不决地放在一旁,从可以观察到的东西讲起:工具开始用句子回答之后,究竟改变了什么;为什么拟人化是关于我们自己的事实,而不是关于系统的证据;"伊莉莎效应"证明了什么、又没能证明什么;以及无论答案倒向哪一边都不会改变的一种不对称性。
2026-08-02 · 21 分钟阅读 #humanities#ai#philosophy#cognition#technology编写核函数的三个层次 — 用同一个问题比较 CUDA C++、Triton 与 CUTLASS
比较在编写同一个 GPU 核函数时,手写 CUDA C++、用 Python 按瓦片编写 Triton、用模板拼装 CUTLASS 与 CuTe 这三种方式各自带来的变化。我们实际用 CUDA C++ 和 Triton 分别编写一个按行 softmax 核函数,并排测量代码量与性能,并从编译流水线的层面解释这种差异从何而来。文章还具体说明了 Triton 为何成为自定义注意力核函数事实上的标准,以及 Triton 不擅长的具体领域。内容
2026-08-02 · 25 分钟阅读 #triton#cuda#cutlass#gpu-kernel#compilerAMD 与 NVIDIA 有何不同 — 问题不在硬件,而在软件栈
把 AMD GPU 与 NVIDIA GPU 的差异,按硬件结构、软件栈、移植路径、生态成熟度这四个层面拆开,不带感情地梳理一遍。从 SM 与 CU、Tensor Core 与 Matrix Core 的对应关系讲起,具体说明 warp 32 与 wavefront 64 到底会在代码里制造出什么样的 bug。区分 HIPIFY 能自动搬过去的部分和必须手动修改的部分,并解释在 cuBLAS 与 rocBLAS 这类库对应表中,为什么
2026-08-02 · 22 分钟阅读 #amd#rocm#hip#nvidia#cuda把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#scheduler机械臂究竟由什么构成:连杆、关节,以及真正驱动关节的东西
想做一条机械臂,买了六个舵机,结果臂多半会在自重下垮掉。这篇文章从连杆、关节、末端执行器的精确定义讲起,解释自由度到底数的是什么、为什么以 6 为基准,并按厂商公布的规格比较驱动关节的三种真实选择——舵机、步进电机、无刷直流电机(BLDC)。文章按角分为单位算清楚减速器把扭矩放大多少倍、又带来多少背隙,以及谐波减速器为什么会用在机器人上。最后直接从臂长和负载算出各关节的静态扭矩,用真实数字说明为什么肩部电机要比腕部大九倍。
2026-08-02 · 39 分钟阅读 #robotics#hardware#electronics#arduino#math外包所失去的 — 自动化削弱能力的方式并不均匀
没有人会因为用计算器而感到内疚,但大多数人在发送一份AI代笔的文档之后,多少都会觉得不太踏实。这种不对称正是本文要问的问题。文章把"外包纯属受益"的领域、"确实被测量出会削弱能力"的领域,以及当下大多数知识工作所处的那片暧昧中间地带分开来看。航空领域关于自动化依赖的研究发现了与常识相反的结果,而自动化偏差研究表明,培训并不能阻止它发生。文章还讨论了为什么"外包无聊"和"外包判断"是两种性质不同的决定,以及关于这一代人正在交出去的能力,我
2026-08-02 · 23 分钟阅读 #humanities#ai#cognition#automation#skill亲手改一个 GPU kernel 到底意味着什么 —— 把一个转置 kernel 提速 5 倍
从线程、warp、内存层级讲起,梳理亲手修改 GPU kernel 到底意味着什么。从 roofline 的视角解释为什么占用率是症状而不是目标,以及为什么大多数 kernel 受限于内存带宽而不是计算。把一个矩阵转置 kernel 从 naive 一路改到合并访问、共享内存分块、消除存储体冲突这四个阶段,并提供了在每个阶段实测有效带宽的基准测试工具。最后梳理了在 Nsight Compute 里具体该打开哪些 section、该看什么
2026-08-02 · 26 分钟阅读 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performanceGPU 编译器与框架全景图 — 接收计算图、产出核函数,同一个问题,每一层给出不同的答案
本文把 NVCC 与 PTX、LLVM、MLIR、Triton、torch.compile、XLA、IREE、TVM 全部放到同一张地图上。它们名字不同、所属组织也不同,但解决的是同一个问题:接收计算图,产出可执行的核函数。文章梳理了每一层切走了这个问题的哪一部分、层为什么会变得这么多,以及工程师在什么情况下需要下探到哪一层。内容基于 2026 年 8 月 2 日核实的版本与官方文档写成,未能核实之处也如实标出。
2026-08-02 · 32 分钟阅读 #gpu#compiler#mlir#triton#pytorch2025-2026美国影视全盘点 — 奥斯卡选中的与观众选中的
整理了2025年到2026年上半年真正引发热议的17部美国电影与剧集。涵盖了拿下第98届奥斯卡最佳影片的《One Battle After Another》、创下奥斯卡史上最多16项提名纪录的《Sinners》、成为Netflix历代观看次数最多电影的《K-Pop猎魔女团》,以及横扫艾美奖的《The Pitt》和《The Studio》。每部作品都标注了导演与主演、已确认的观看渠道,以及谁会喜欢、谁可能不喜欢。
2026-08-02 · 25 分钟阅读 #culture#american-film#tv-series#movie-recommendation#oscars2025-2026华语影视全盘点 — 内地、香港、台湾三份不同的成绩单
整理了2025年到2026年上半年真正引发热议的17部华语电影与剧集,按内地、香港、台湾分类呈现。涵盖了成为全球动画票房冠军的《哪吒之魔童闹海》、拿下金马奖最佳剧情长片的台湾电影《大濛》、拿下香港电影金像奖最佳电影的《再见UFO》,以及用潮汕方言拍摄、豆瓣评分高达9分的《给阿嬷的情书》。每部作品都标注了出品地与导演、已确认的观看渠道。
2026-08-02 · 25 分钟阅读 #culture#chinese-film#hong-kong-cinema#taiwan-cinema#movie-recommendation2025-2026日本影视动画全盘点 — 被刷新的两项纪录,以及它们投下的阴影
整理了2025年到2026年上半年真正引发热议的18部日本电影、剧集与动画。涵盖了刷新日本影史票房纪录的剧场版《鬼灭之刃》无限城篇、成为真人电影历代票房冠军的《国宝》、拿下洛迦诺电影节金豹奖的《旅与日々》,以及时隔25年首次有三位日本导演同时入围戛纳主竞赛单元的2026年。每部作品都标注了导演与制作方、已确认的观看渠道,以及谁会喜欢、谁可能不喜欢。
2026-08-02 · 27 分钟阅读 #culture#japanese-film#anime#j-drama#movie-recommendationLLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registry怎样真正读懂一张模型卡片 —— 5 分钟内挑出你需要的东西
模型卡片的写法是,从头读到尾反而找不到你需要的信息:基准测试表占了半屏,许可证和聊天模板却一笔带过。本文把阅读顺序倒过来,整理出在 5 分钟内挑出部署决策真正需要的七件事的方法。内容涉及开放权重和开源有什么不同、为什么不能对卡片上的分数照单全收、上下文长度的标注背后藏着什么,以及分词器和聊天模板为什么是最容易在不报错的情况下悄悄出问题的地方。最后按这份清单,把 2026 年 8 月 2 日在 Hugging Face 上直接核实过的一张
2026-08-02 · 27 分钟阅读 #llm#huggingface#model-card#license#tokenizer机器给的安慰是真的吗 — 为什么需要换一个问题
人们在和AI对话之后,心情真的会变好。把这一点一口断定为错觉,不仅无礼,而且不准确。本文探讨响应性为什么会让人感到被关照,并深入到临床试验的设计层面,看基于聊天机器人的心理健康研究究竟证明了什么、又没能证明什么。文章提出,真正该问的问题不是"这种安慰是真的吗",而是"它替代了什么"——因为作为补充的安慰和作为替代的安慰,虽是同一种行为,却是截然不同的两回事。
2026-08-02 · 23 分钟阅读 #humanities#ai#psychology#loneliness#relationships机器人学所需的数学,按顺序学:以及哪些可以先放一放
这是「做机械臂到底要把数学学到什么程度」这个问题的答案。按线性代数、三角学与旋转表示、微积分与多变量方法、微分方程与控制理论、概率与估计、优化的顺序,整理成六条分支。每条分支都写清楚三件事:在机械臂的哪个环节被用到、学到什么程度算够用、以及哪些可以放到后面再学。之所以要明确写出「可以放后面」,正是因为那里是大多数人卡住不前的地方。文章用 numpy 直接确认雅可比矩阵的 SVD 在奇异点附近是如何崩溃的,并把六条分支收进一张学习顺序表里
2026-08-02 · 38 分钟阅读 #robotics#math#electronics#linear-algebra#control