博客
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 829 篇
#2026-03 168#ai 110#llm 90#ai-papers 62#career 60#kubernetes 54#mindset 51#ai-platform 48#devops 42#security 41#deep-learning 35#performance 33#psychology 32#mlops 30#observability 29#2026-04 26#database 23#linux 22#robotics 22#rust 22#ai-agent 21#mcp 20#productivity 20#culture 19#evaluation 19#gpu 18#transformer 18#electronics 17#paper-review 17#pytorch 17#developer-tools 16#distributed-systems 16#engineering 16#learning 16#open-source 16#rag 16#fundamentals 15#network 15#postgresql 15#2026-08 14
2026年机器人企业地图 — 人形机器人混战与VLA模型,以及工程师的入场路径
2026年是人形机器人出货量同比跃升7倍(预计达5万台)的转折点。从估值390亿美元、拥有自研VLA模型Helix的Figure,到即将于夏季进入量产的Tesla Optimus Gen 3,再到已售出5,500台的价格破坏者Unitree,以及出售机器人通用大脑的Physical Intelligence(π0) — 本文按硬件、大脑、市场三条轴线梳理主要企业,追溯从RT-2到GR00T N2的VLA(Vision-Language-
2026-07-09 · 10 分钟阅读 #robotics#ai#vla#trends#careerLLM 训练数据预处理完全指南 — 从网页抓取到 Token 打包,附最新论文
好模型来自好数据,好数据来自预处理流水线。本文逐步讲解预训练数据要经过的全部工序 — 网页抓取采集 → 正文抽取 → 语言识别 → 启发式规则与分类器结合的质量过滤 → 精确去重与近似(MinHash)去重 → PII·毒性处理 → 基准测试污染清除 → 分词与序列打包,并介绍 SFT 数据整理的要点、datatrove、Dolma、NeMo Curator 等工具,以及从 The Pile 到 FineWeb、DCLM 这些改变了这一
2026-07-09 · 12 分钟阅读 #ai#llm#data-engineering#preprocessing#trainingGPU Operator × KubeVirt 完全整理 — 组件、配置、版本,从部分 MIG 到手动 MIG
把 Kubernetes GPU 基础设施的两大支柱整理在一页里。涵盖 GPU Operator 的 operand 构成、ClusterPolicy 配置与版本体系,同时讲解只对节点上部分 GPU 应用 MIG 的自定义配置,以及用 nvidia-smi 手动创建、删除 MIG 的方法。接着介绍在 Kubernetes 上运行虚拟机的 KubeVirt 的四大组件(virt-operator、controller、handler、la
2026-07-09 · 12 分钟阅读 #kubernetes#gpu#kubevirt#mig#nvidia打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D)
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-vision多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowDocker 到 Podman — 无守护进程容器引擎迁移完全指南
Podman 以无守护进程(fork-exec)方式运行、且默认 rootless,这一点从架构哲学上就与 Docker 不同。本文梳理了内部工作原理(conmon·crun)、配置文件的位置与含义、使用 GPU 所需的 CDI 设置、原样使用 compose.yaml 的两种方法(podman 套接字 + docker compose vs podman-compose)、SELinux 卷标签之类的迁移陷阱,以及版本与社区的比较 —
2026-07-08 · 13 分钟阅读 #docker#podman#containers#devops#linuxLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationFDE(Forward Deployed Engineer)完全拆解 — 现在 AI 行业最炙手可热的岗位
正如「企业 GenAI 试点中 95% 拿不出可衡量成果」这项调查所示,如今 AI 的瓶颈不是模型,而是部署。填补这道缝隙的职位就是 FDE — 被派驻到客户环境中、亲手构建生产级 AI 的工程师。本文梳理这个诞生于 Palantir、如今 OpenAI 与 Anthropic 正押上数十亿美元复制的职位 — 从起源、实际工作内容、所需能力、薪酬、权衡取舍到准备方法,全部整理在内。
2026-07-07 · 13 分钟阅读 #career#fde#ai#palantir#roles所有权的反击与AI现实核查 — 本周HN与GeekNews热门话题
本周贯穿 Hacker News 与 GeekNews 排行榜前列的潮流分为两股。一股是从开源地图、开放硬件蔓延到可更换电池的「所有权的反击」,另一股是由开源权重模型的价格压力与 AI 智能体减速论所引领的「AI 现实核查」。本文用七个热门话题,梳理这两股看似无关的潮流为何都收敛到同一个问题 — 控制权。
2026-07-07 · 9 分钟阅读 #trends#hackernews#geeknews#ai#opensourceNVIDIA GPU Operator 完全指南 — 从安装部署到 MIG 分区配置
在 Kubernetes 里手动搭建 GPU 节点的时代已经结束。本文梳理了 NVIDIA GPU Operator 如何用 Operator 模式把驱动、设备插件、监控这一整套栈全部管起来的原理,以及 Helm 安装与验证方法;还有把一张 A100/H100 切分成多个硬件隔离 GPU 来用的 MIG——它的概念、single/mixed 两种策略、基于节点标签的配置、自定义 Profile、以及运维注意事项,配合实际命令从头到尾讲清
2026-07-07 · 12 分钟阅读 #kubernetes#gpu#nvidia#mig#devopsAI 模型开发,从头到尾 — 从数据到部署的现实生命周期
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#trainingOh My OpenCode 使用指南 — 把 OpenCode 变成多代理团队
Oh My OpenCode 是叠加在 OpenCode 之上的编排层,用它组建一支异步子代理团队。本文以实战指南的方式,梳理从安装、配置到成本安全的完整流程。
2026-07-06 · 25 分钟阅读 #oh-my-opencode#opencode#ai-coding-agent#cli#developer-toolsOpenRouter 使用指南 — 用一个 API 调用 300+ 个 LLM
如何用 OpenRouter 一个入口,以兼容 OpenAI 的方式调用来自 60+ 家供应商的 300+ 个模型 — 从申请密钥、发出第一个 curl 请求,到 SDK 无缝替换、路由与回退、流式输出,按实务标准梳理一遍。
2026-07-06 · 11 分钟阅读 #openrouter#llm#ai-gateway#api#openai-compatibleLiteLLM 实战指南 — 用一个接口调用 100+ 个 LLM
一份实战速成指南:用同一套 OpenAI 格式调用 OpenAI、Anthropic、Gemini、Bedrock、OpenRouter 以及本地模型。从安装到流式输出、Router、Proxy Server,快速梳理一遍 LiteLLM。
2026-07-06 · 13 分钟阅读 #litellm#llm#ai-gateway#python#openai-compatible技术面试准备手册 — 编程·系统设计·行为面试
技术面试是实力的考验,也是一项独立的技能。本文整理了编程面试的模式学习法、系统设计面试的5步框架、用STAR技巧搭建行为面试故事库的方法、各岗位的常见问题,以及8周倒推计划 — 全部以面试官实际关注的信号为基准梳理而成。是与《岗位知识地图》篇、《AI学习法》篇相连的三部曲第2篇。
2026-07-06 · 12 分钟阅读 #career#interview#skills#preparation大多数争论争的不是想法,而是自我
争论的时候,我们相信自己在争的是想法,但实际上往往触碰到的是对方的自我。本文通过认知失调、身份保护性认知、逆火效应等心理学,梳理为什么正确的论证反而会让对方更加固执,以及与其争赢,我们该做些什么。
2026-07-06 · 9 分钟阅读 #communication#psychology#thinking#career2026 新兴职位知识地图 — 到底该学什么
AI/LLM 工程师、平台·DevOps/SRE、安全工程师、数据工程师、前端 — 用清单的方式梳理当下需求最高的五个职位各自需要什么知识。也涵盖贯穿各职位的通用能力,以及能在浏览器里直接练习每项知识的工具与权威参考资料。这是三部曲的第 1 篇,后续还有面试准备篇、AI 学习法篇。
2026-07-06 · 12 分钟阅读 #career#roadmap#skills#learning用 AI 学习的方法 — 把 LLM 变成最好的私教的 8 种技法
只是接过 AI 给的答案去读,留下的只是"学过了"的感觉,实力并不会长进。布卢姆的 2 西格玛问题揭示了 1:1 私教的力量,本文讲的是如何用 LLM 把这种力量重现出来 — 苏格拉底式导师、费曼角色扮演、出题生成、错题分析、难度阶梯,一直到模拟面试 — 整理了 8 种基于学习科学(检索练习、间隔重复)的实战技法,并附上可以直接拿去用的提示词。这是三部曲的最后一篇。
2026-07-06 · 14 分钟阅读 #ai#learning#study#productivityPalantir 有何不同 — 真正的护城河不是 AI,而是本体论
Palantir 这个名字常被提起,但它究竟是一家做什么的公司却始终模糊。本文梳理 Gotham、Foundry、AIP、Apollo 产品线,指出 Palantir 真正的竞争力不在于华丽的 AI,而在于把数据与现实世界的对象和行动连接起来的本体论(ontology)。同时也一并讨论批判性的视角。
2026-07-05 · 12 分钟阅读 #palantir#data#ai#enterprise