标签: #colibri
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
在慢速电脑上跑 GLM-5.2 — colibrì 如何从磁盘流式加载 744B 模型
colibrì 是一个用纯 C 写成、约 1,300 行的推理引擎,能在内存 25GB 的消费级 PC 上运行 744B(7,440 亿)参数的 MoE 模型 GLM-5.2。关键在于 MoE 稀疏性与磁盘流式加载 — 只把约 9.9GB 的密集层常驻内存,约 370GB 的路由专家放在 NVMe SSD 上,每个 token 只读取需要的部分。代价是诚实地慢:冷启动约 0.05–0.1 tok/s,实际上每段落要花几分钟。它靠学习缓存
2026-07-11 · 7 分钟阅读 #ai#llm#local-inference#moe#quantization