标签: #apple-silicon
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeMac mini 为何成为端侧 AI 机器 — Apple Silicon 高管访谈说了什么、没说什么
Apple Silicon 高级产品经理道格·布鲁克斯(Doug Brooks)在 The Deep View 的访谈中谈到了 Mac mini 与 Mac Studio 的需求以及端侧 AI 的走向。开发者和小型团队为何选择这台小小的台式机作为本地 LLM 与智能体机器、统一内存架构的真正优势是什么,以及 CUDA 生态差距与近期涨价这一诚实的取舍 — 本文原样引用高管的发言,同时剥离营销话术加以梳理。
2026-07-11 · 9 分钟阅读 #apple-silicon#on-device-ai#local-llm#mac-mini#inference