标签: #local-llm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
在本地跑 LLM 到底需要多少 VRAM — 别查表,用公式算
「8B 模型需要几 GB」这个问题的正确答案不是一张表,而是两个公式。权重是参数量乘以 bpw 除以 8;KV 缓存是 2 乘以层数乘以 KV 头数乘以 headdim 乘以字节数乘以 token 数。本文把这两个公式直接对照 llama.cpp 的源代码与官方表格来验证 — 从 ggml 块结构体推导出的 Q80 的 8.5 bpw,与 llama.cpp 发布的 8.5008 吻合到小数点后第三位;用同样的方式反推出的参数量为 8.
2026-07-17 · 34 分钟阅读 #llm#quantization#kv-cache#local-llm#gpuMac mini 为何成为端侧 AI 机器 — Apple Silicon 高管访谈说了什么、没说什么
Apple Silicon 高级产品经理道格·布鲁克斯(Doug Brooks)在 The Deep View 的访谈中谈到了 Mac mini 与 Mac Studio 的需求以及端侧 AI 的走向。开发者和小型团队为何选择这台小小的台式机作为本地 LLM 与智能体机器、统一内存架构的真正优势是什么,以及 CUDA 生态差距与近期涨价这一诚实的取舍 — 本文原样引用高管的发言,同时剥离营销话术加以梳理。
2026-07-11 · 9 分钟阅读 #apple-silicon#on-device-ai#local-llm#mac-mini#inference