标签: #quantization
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 11 篇
这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantization现在 Hugging Face 上什么在火 —— 2026 年 8 月热门地图
以 2026 年 8 月 2 日为准,亲自过了一遍 Hugging Face 的热门榜单,按用途整理出真正能用于部署的模型。按通用 LLM、编程、嵌入与重排、视觉、语音、图像视频生成、小型端侧模型的顺序,写清了每个模型的厂商、规模、许可证,以及使用前需要了解的限制。核心结论是:热门榜单里相当一部分根本不是新模型,而是量化重新上传和社区微调。文中讲了怎么分辨原版和衍生版、为什么衍生版的下载量会反超原版,以及这个事实对选型意味着什么。所有数
2026-08-02 · 25 分钟阅读 #llm#huggingface#open-weights#model-selection#quantization26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeLLM 推理显存计算法 — 比权重先爆的是 KV cache
整理了用几次乘法回答“这个模型能装进我们的 GPU 吗”的方法。权重内存用参数量乘以每参数字节数就算完了,但真正挡住部署的是随序列长度和批大小一起长大的 KV cache。本文用数字讲清 KV cache 公式、GQA 把它压到几分之一的原理、预填充激活与框架开销的量级、PagedAttention 消除的碎片损失,以及 4bit 量化并不免费的理由,并附上一个从现有显存反推可并发序列数的计算器函数。
2026-07-26 · 16 分钟阅读 #llm#inference#vram#kv-cache#quantization在本地跑 LLM 到底需要多少 VRAM — 别查表,用公式算
「8B 模型需要几 GB」这个问题的正确答案不是一张表,而是两个公式。权重是参数量乘以 bpw 除以 8;KV 缓存是 2 乘以层数乘以 KV 头数乘以 headdim 乘以字节数乘以 token 数。本文把这两个公式直接对照 llama.cpp 的源代码与官方表格来验证 — 从 ggml 块结构体推导出的 Q80 的 8.5 bpw,与 llama.cpp 发布的 8.5008 吻合到小数点后第三位;用同样的方式反推出的参数量为 8.
2026-07-17 · 34 分钟阅读 #llm#quantization#kv-cache#local-llm#gpu为什么向量索引的默认值从 HNSW 变成了磁盘 — Elasticsearch bbq_disk 的权衡
从 Elasticsearch 9.4(2026-05-05)开始,float 向量的默认索引类型变成了 bbqdisk,也就是基于磁盘的 IVF。不到一年时间里,默认值从 int8hnsw 变成 bbqhnsw,又第二次变成了根本不是图结构的磁盘索引 — 这次迁移背后的判断是:向量检索真正昂贵的资源不是算力,而是 RAM。本文梳理了 HNSW 的内存悬崖在厂商基准测试里体现为怎样的数字、BBQ 从原始论文 RaBitQ 那里拿走了什么
2026-07-16 · 35 分钟阅读 #vector-database#elasticsearch#ann-index#quantization#hnswKV 缓存降到 4 比特 — SAW-INT4 与系统感知的 INT4 量化
在长上下文 LLM 服务中,真正的内存瓶颈不是权重,而是 KV 缓存。直接把它降到 INT4 会让精度崩溃,但 2026 年 4 月的预印本 SAW-INT4 报告说,在逐 token 的 INT4 量化之上再叠加块对角阿达玛旋转,就能几乎追回朴素 INT4 丢掉的精度。这篇论文真正的角度不只是精度,而是吞吐量 — 通过直接集成进分页 KV 缓存布局的融合旋转·量化内核,作者们称没有可测量的端到端开销,吞吐量与纯 INT4 相同。向量量
2026-07-11 · 11 分钟阅读 #ai#llm#quantization#inference#kv-cache在慢速电脑上跑 GLM-5.2 — colibrì 如何从磁盘流式加载 744B 模型
colibrì 是一个用纯 C 写成、约 1,300 行的推理引擎,能在内存 25GB 的消费级 PC 上运行 744B(7,440 亿)参数的 MoE 模型 GLM-5.2。关键在于 MoE 稀疏性与磁盘流式加载 — 只把约 9.9GB 的密集层常驻内存,约 370GB 的路由专家放在 NVMe SSD 上,每个 token 只读取需要的部分。代价是诚实地慢:冷启动约 0.05–0.1 tok/s,实际上每段落要花几分钟。它靠学习缓存
2026-07-11 · 7 分钟阅读 #ai#llm#local-inference#moe#quantization最新 LLM 量化技术全解 — 从 GPTQ、AWQ 到 FP8、MXFP4、KV 缓存量化
量化是把模型的数值用更少的比特表示,从而降低内存和成本的技术。比特减少后质量为何依然能撑住(离群值与缩放)、GPTQ 与 AWQ 在思路上的差异、llama.cpp GGUF 的 k-quant、QLoRA 的 NF4,以及 2026 年的核心轴 — FP8 与微缩放 FP4(MXFP4、NVFP4),直到下一个瓶颈 KV 缓存量化 — 连同 W4A16 这类记法的读法,以及按硬件与目的划分的选型指南,在一篇里整理出最新的量化版图。还收
2026-07-08 · 13 分钟阅读 #ai#llm#quantization#inference#optimization深度学习模型量化完全指南:精通 INT8、INT4、GPTQ、AWQ、GGUF
一份让你彻底掌握深度学习模型量化的指南。通过实战示例,完整理解从 FP32 到 INT8、INT4 的量化原理,以及 GPTQ、AWQ、GGUF、bitsandbytes、AutoGPTQ、llama.cpp 的用法。
2026-03-17 · 35 分钟阅读 #quantization#model-compression#gptq#awq#ggufBitNet 论文解析:1-Bit LLM 的时代 — 从三值权重到 CPU 推理
Microsoft Research 的 BitNet 系列(v1、b1.58、a4.8、2B4T)论文解析,从三值权重训练原理到 bitnet.cpp 推理框架、实战基准测试的综合指南。
2026-03-06 · 33 分钟阅读 #ai-papers#bitnet#1-bit-llm#quantization#model-efficiency