标签: #ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 110 篇
想得更多不等于答得更对:测试时计算与过度思考
2026年4月,Shu Zhou 等6人在 "When More Thinking Hurts" 中,对一味增加推理 token 的潮流正面提出质疑。据作者们报告,计算预算越大,额外推理 token 的边际效用就下降得越多,而从某个点开始,模型会陷入"过度思考",亲手推翻自己此前已经答对的答案。最优思考长度因问题难度而各不相同,因此给所有问题相同预算的做法并不高效。摘要并未给出具体的模型名称或数值,所以我只谨慎地带回方向性。
2026-07-11 · 10 分钟阅读 #ai#llm#reasoning#inference#test-time-compute扩散 LLM 会写 CUDA 内核 — DICE,以及并行生成为何可能有效
DICE 是 2026 年 2 月的一篇预印本,它主张扩散(diffusion)大语言模型在 CUDA 内核生成上超越了同规模的自回归(autoregressive)模型,创下了新的最高性能(SOTA)。核心思路是:与其把 token 从左到右逐个写出,不如并行生成整个序列,并可以在任意位置非顺序地改写 — 这一性质似乎很适合全局结构至关重要的代码任务。作者用一个名为 CuKe 的 SFT 数据集和两阶段强化学习(BiC-RL)训练了
2026-07-11 · 10 分钟阅读 #ai#llm#diffusion#cuda#gpu生产级 RAG 模式 — 朴素 RAG 为何失败,以及真正管用的技法
演示版 RAG 半小时就能做出来,但在生产环境中悄然崩坏的地方,大多不是生成,而是检索。本文把分块、嵌入与混合检索(BM25 + 向量)、重排序、上下文检索、查询改写以及评估逐一梳理,讲清每一项各自是什么、何时有用、又要付出什么代价。只引用像 Anthropic 上下文检索数值那样有出处的数字,并坦率地指出 RAG 并非魔法、最终终究要用自己的数据来评估。
2026-07-11 · 15 分钟阅读 #ai#rag#llm#retrieval#embeddings2026年机器人企业地图 — 人形机器人混战与VLA模型,以及工程师的入场路径
2026年是人形机器人出货量同比跃升7倍(预计达5万台)的转折点。从估值390亿美元、拥有自研VLA模型Helix的Figure,到即将于夏季进入量产的Tesla Optimus Gen 3,再到已售出5,500台的价格破坏者Unitree,以及出售机器人通用大脑的Physical Intelligence(π0) — 本文按硬件、大脑、市场三条轴线梳理主要企业,追溯从RT-2到GR00T N2的VLA(Vision-Language-
2026-07-09 · 10 分钟阅读 #robotics#ai#vla#trends#careerLLM 训练数据预处理完全指南 — 从网页抓取到 Token 打包,附最新论文
好模型来自好数据,好数据来自预处理流水线。本文逐步讲解预训练数据要经过的全部工序 — 网页抓取采集 → 正文抽取 → 语言识别 → 启发式规则与分类器结合的质量过滤 → 精确去重与近似(MinHash)去重 → PII·毒性处理 → 基准测试污染清除 → 分词与序列打包,并介绍 SFT 数据整理的要点、datatrove、Dolma、NeMo Curator 等工具,以及从 The Pile 到 FineWeb、DCLM 这些改变了这一
2026-07-09 · 12 分钟阅读 #ai#llm#data-engineering#preprocessing#training打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D)
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-vision多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimizationFDE(Forward Deployed Engineer)完全拆解 — 现在 AI 行业最炙手可热的岗位
正如「企业 GenAI 试点中 95% 拿不出可衡量成果」这项调查所示,如今 AI 的瓶颈不是模型,而是部署。填补这道缝隙的职位就是 FDE — 被派驻到客户环境中、亲手构建生产级 AI 的工程师。本文梳理这个诞生于 Palantir、如今 OpenAI 与 Anthropic 正押上数十亿美元复制的职位 — 从起源、实际工作内容、所需能力、薪酬、权衡取舍到准备方法,全部整理在内。
2026-07-07 · 13 分钟阅读 #career#fde#ai#palantir#roles所有权的反击与AI现实核查 — 本周HN与GeekNews热门话题
本周贯穿 Hacker News 与 GeekNews 排行榜前列的潮流分为两股。一股是从开源地图、开放硬件蔓延到可更换电池的「所有权的反击」,另一股是由开源权重模型的价格压力与 AI 智能体减速论所引领的「AI 现实核查」。本文用七个热门话题,梳理这两股看似无关的潮流为何都收敛到同一个问题 — 控制权。
2026-07-07 · 9 分钟阅读 #trends#hackernews#geeknews#ai#opensourceAI 模型开发,从头到尾 — 从数据到部署的现实生命周期
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#training用 AI 学习的方法 — 把 LLM 变成最好的私教的 8 种技法
只是接过 AI 给的答案去读,留下的只是"学过了"的感觉,实力并不会长进。布卢姆的 2 西格玛问题揭示了 1:1 私教的力量,本文讲的是如何用 LLM 把这种力量重现出来 — 苏格拉底式导师、费曼角色扮演、出题生成、错题分析、难度阶梯,一直到模拟面试 — 整理了 8 种基于学习科学(检索练习、间隔重复)的实战技法,并附上可以直接拿去用的提示词。这是三部曲的最后一篇。
2026-07-06 · 14 分钟阅读 #ai#learning#study#productivityPalantir 有何不同 — 真正的护城河不是 AI,而是本体论
Palantir 这个名字常被提起,但它究竟是一家做什么的公司却始终模糊。本文梳理 Gotham、Foundry、AIP、Apollo 产品线,指出 Palantir 真正的竞争力不在于华丽的 AI,而在于把数据与现实世界的对象和行动连接起来的本体论(ontology)。同时也一并讨论批判性的视角。
2026-07-05 · 12 分钟阅读 #palantir#data#ai#enterpriseAI 代码审查工具的兴起 — 自动化审查正在改变团队
AI 代码审查工具正以开源形式大量涌现,重塑着开发工作流。本文从 Git diff 分析、缺陷检测、规约强制,到与人工审查的角色分工、误报管理、CI 集成,做一次实务视角的梳理。
2026-06-29 · 33 分钟阅读 #devops#ai#code-review#ci-cd#developer-tools深度学习时间序列分析完全指南:LSTM、Transformer、PatchTST、TimesFM
用深度学习完全掌握时间序列数据的指南。从时间序列预处理、ARIMA、LSTM,到 Temporal Fusion Transformer、PatchTST、Mamba、TimesFM 等最新基础模型,通过实战示例学习。
2026-03-17 · 28 分钟阅读 #time-series#lstm#transformer#forecasting#deep-learning深度学习推荐系统完全指南:从协同过滤到基于 LLM 的推荐
从推荐系统基础到最新深度学习技术的完全精通指南。通过实战代码,掌握协同过滤、Matrix Factorization、NCF、Two-Tower 模型、序列推荐、基于 GNN 的推荐,直至 LLM 推荐。
2026-03-17 · 30 分钟阅读 #recommendation-system#collaborative-filtering#deep-learning#two-tower#llm面向 AI/ML 的 Python 完全指南:精通 NumPy、Pandas、Matplotlib、Scikit-learn
面向 AI 与机器学习的 Python 生态系统完全精通指南。通过实战示例掌握 NumPy 数组运算、Pandas 数据处理、Matplotlib/Seaborn 可视化,直至用 Scikit-learn 完成机器学习。
2026-03-17 · 35 分钟阅读 #python#numpy#pandas#scikit-learn#matplotlib自然语言处理(NLP)完全指南:从零到精通 - 从文本处理到LLM
一份从 NLP 基础到最新 LLM 的完全指南。通过实战代码逐步学习文本预处理、Word2Vec、RNN/LSTM、Attention、Transformer、BERT、GPT。
2026-03-17 · 46 分钟阅读 #nlp#natural-language-processing#transformer#bert#gptAI/ML 数学完全指南:线性代数、微积分与概率统计
一份帮你彻底掌握理解 AI 与机器学习所需核心数学的指南。涵盖线性代数(向量、矩阵、特征值)、微积分(偏导数、链式法则)、概率统计(概率分布、最大似然估计、贝叶斯),并配合直观讲解。
2026-03-17 · 34 分钟阅读 #mathematics#linear-algebra#calculus#probability#statistics