タグ: #local-inference
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
遅いパソコンでGLM-5.2を動かす — colibrìが744Bモデルをディスクからストリーミングする仕組み
colibrìは純粋Cで約1,300行の推論エンジンで、744B(7,440億)パラメータのMoEモデルであるGLM-5.2を、RAM 25GBのコンシューマPCで動かします。鍵はMoEの疎性とディスクストリーミングです。約9.9GBの密なレイヤーだけをRAMに常駐させ、約370GBのルーテッドエキスパートはNVMe SSDに置いてトークンごとに必要な分だけ読み込みます。代償は正直に遅く、コールド状態で約0.05〜0.1 tok/s、実
2026-07-11 · 8 分で読めます #ai#llm#local-inference#moe#quantization