タグ: #quantization
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 30 件
Qwen3.8-27Bのハイブリッドアテンション — 64層のうちKVキャッシュを積むのは16層だけ
27Bのモデルが26万トークンのコンテキストをノートパソコンで扱える理由は、パラメータ数ではなく層の構成にあります。Qwen3.8-27Bは64層のうち48層を線形アテンション(Gated DeltaNet)に、16層だけを通常のアテンションに配置し、KVキャッシュが伸びる層そのものを4分の1に減らしました。この構造が何を節約して何を失うのか、FP8ブロック量子化はどこに効くのか、そしてローカル推論を検討するとき実際に計算すべき値は何か
2026-08-14 · 13 分で読めます #llm#inference#quantization#local-llm#attentionライセンスと配備: 類型の読み方と量子化配布物の出所確認
オープンモデルのlicenseフィールドに書かれた短い識別子は目次にすぎず、実際の条件は全文にあります。この記事は2026-08-12に実際に出会ったライセンス類型を整理し、コミュニティライセンスと非商用条件が何を求めるのか、ゲートの掛かったリポジトリが配備パイプラインでなぜ問題になるのか、そしてGGUFのような量子化配布物の出所をどう確認すべきかを説明します。オープンモデルガイドシリーズ最終回の第8回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#licensevLLM 内部構造 (7) — デプロイのチューニングとよくある落とし穴、OOM の切り分け順
vLLMのデプロイを実際にチューニングする手順を整理する。gpumemoryutilizationが何を決めるのか、テンソル並列とパイプライン並列をいつ使うのか、量子化とKVキャッシュのデータ型をどう選ぶのか、そしてOOMが起きたときに起動段階と運用段階を分けて診断する手順まで、公式ドキュメントを基準に確認して整理した。vLLM内部構造シリーズ最終回。
2026-08-12 · 16 分で読めます #vllm#gpu#quantization#tensor-parallel#llmこれらのモデルはどう作られたのか — 2026年オープンウェイトパイプライン解剖
2026年8月時点でHugging Faceの上位に並ぶオープンウェイトモデルのカードと技術レポートを読み、データ収集から量子化デプロイまでの制作パイプラインを順番に整理しました。MoEのスパース性が20倍を超えた理由、グローバルアテンションを減らす四つのアプローチ、事前学習のトークン予算と安定化技法、SFT後の選好最適化と強化学習、そして蒸留と低ビットデプロイまでを実際のモデルを例に扱います。重要な前提を先に明かすと、ほとんどのオープ
2026-08-02 · 31 分で読めます #llm#pretraining#moe#post-training#quantization今Hugging Faceで何が伸びているか — 2026年8月トレンディングマップ
2026年8月2日時点でHugging Faceのトレンディング一覧を実際に洗い、用途別に実務で使えるモデルを整理しました。汎用LLM、コーディング、埋め込みとリランカー、ビジョン、音声、画像・動画生成、小型オンデバイスの順で、作り手と規模とライセンス、そして使う前に知っておくべき制約を一緒に書きました。核心は、トレンディング一覧の相当数が新規モデルではなく量子化再アップロードとコミュニティのファインチューンだという点です。原本と派生版
2026-08-02 · 28 分で読めます #llm#huggingface#open-weights#model-selection#quantization26Bモデルを2GBのRAMで動かす原理 — 常駐メモリとワーキングセットは同じ数字ではない
2026年7月29日にShow HNへ上がったTurboFieldfareは、Gemma 4 26B-A4BをMシリーズのMacで約2GBのRAMで動かすと主張しています。ディスクには14.3GBが入り、RAMに常駐するのは1.35GBの共有コアだけで、トークンごとに必要なエキスパートの重みをSSDから読み込みます。この記事はその数字たちを自分で導出して検証します — 4ビットのグループ64量子化がなぜ重みあたり4.5ビットになって14
2026-07-31 · 20 分で読めます #ai#llm#quantization#apple-silicon#moeLLM推論のVRAM計算 — 重みより先にKVキャッシュが溢れます
「このモデルはうちのGPUに載りますか」という質問に、掛け算を数回するだけで答える方法をまとめました。重みのメモリはパラメータ数×バイト数で終わりますが、実際にデプロイを止めるのはシーケンス長とバッチに比例して育つKVキャッシュです。KVキャッシュの公式とGQAがそれを何分の一かに減らす原理、プリフィル活性化とフレームワークオーバーヘッドの大きさ、PagedAttentionが消した断片化の損失、そして4bit量子化がタダではない理由を
2026-07-26 · 20 分で読めます #llm#inference#vram#kv-cache#quantizationローカルでLLMを動かすにはVRAMがどれだけ必要か — 表ではなく数式で計算する
「8Bモデルには何GB必要ですか」の正解は表ではなく2つの数式です。重みはパラメータ数 × bpw ÷ 8、KVキャッシュは2 × レイヤー数 × KVヘッド数 × headdim × バイト数 × トークン数です。本稿はこの2つの式をllama.cppのソースと公式の表に直接照らして検証します — ggmlのブロック構造体から導いたQ80の8.5 bpwはllama.cppが公表した8.5008と小数第3位まで一致し、同じやり方で逆算
2026-07-17 · 43 分で読めます #llm#quantization#kv-cache#local-llm#gpuなぜベクトルインデックスの既定値はHNSWからディスクへ変わったのか — Elasticsearch bbq_diskのトレードオフ
Elasticsearch 9.4(2026-05-05)から、floatベクトルの既定インデックスタイプがbbqdisk、つまりディスクベースのIVFに変わりました。1年足らずの間に既定値はint8hnswからbbqhnswへ、さらにグラフではないディスクインデックスへと二度移り変わったわけですが、この移行はベクトル検索の本当のコストが計算ではなくRAMにあるという判断を含んでいます。本稿では、HNSWのメモリ崖がベンダーベンチマーク
2026-07-16 · 40 分で読めます #vector-database#elasticsearch#ann-index#quantization#hnswKVキャッシュを4ビットへ — SAW-INT4とシステムを踏まえたINT4量子化
長文脈のLLMサービングで本当のメモリのボトルネックは、重みではなくKVキャッシュです。これを素朴にINT4へ落とすと精度が崩れますが、2026年4月のプリプリントSAW-INT4は、トークン単位のINT4量子化にブロック対角アダマール回転を組み合わせ、素朴なINT4が失った精度をほぼ取り戻すと報告します。この論文の本当の狙いは精度だけでなくスループットです — ページド型KVキャッシュのレイアウトに直接組み込む融合回転・量子化カーネル
2026-07-11 · 12 分で読めます #ai#llm#quantization#inference#kv-cache遅いパソコンでGLM-5.2を動かす — colibrìが744Bモデルをディスクからストリーミングする仕組み
colibrìは純粋Cで約1,300行の推論エンジンで、744B(7,440億)パラメータのMoEモデルであるGLM-5.2を、RAM 25GBのコンシューマPCで動かします。鍵はMoEの疎性とディスクストリーミングです。約9.9GBの密なレイヤーだけをRAMに常駐させ、約370GBのルーテッドエキスパートはNVMe SSDに置いてトークンごとに必要な分だけ読み込みます。代償は正直に遅く、コールド状態で約0.05〜0.1 tok/s、実
2026-07-11 · 8 分で読めます #ai#llm#local-inference#moe#quantization最新LLM量子化技術の総まとめ — GPTQ・AWQからFP8・MXFP4・KVキャッシュ量子化まで
量子化はモデルの数値をより少ないビットで表現し、メモリとコストを削る技術です。ビットを減らしても品質が持ちこたえる理由(外れ値とスケーリング)、GPTQとAWQのアプローチの違い、llama.cpp GGUFのk-quant、QLoRAのNF4、そして2026年の中心軸であるFP8とマイクロスケーリングFP4(MXFP4・NVFP4)、次のボトルネックであるKVキャッシュ量子化まで — W4A16のような表記の読み方とハードウェア・目的
2026-07-08 · 13 分で読めます #ai#llm#quantization#inference#optimizationKVキャッシュとPagedAttention — 推論メモリのすべて
LLM推論でメモリを最も消費する張本人であるKVキャッシュを深く掘り下げます。KVキャッシュとは何か、なぜメモリを消費するのか、メモリの計算と断片化の問題、PagedAttentionのブロック管理、prefix共有とKV量子化まで、開発者の視点で整理します。
2026-06-26 · 21 分で読めます #kv-cache#paged-attention#inference#gpu-memory#quantizationメモリウォールとHBM — AI性能を分ける本当のボトルネック
演算が安くなりデータ移動が高くなった時代、AI性能の本当のボトルネックはメモリです。メモリウォールの概念からHBM世代、rooflineモデルと算術強度、KVキャッシュ、量子化による帯域幅削減まで開発者目線で整理します。
2026-06-16 · 41 分で読めます #memory-wall#hbm#bandwidth#roofline#inference推論を速く — 量子化、スパース性、Dataflow のハードウェア視点
推論コストの構造をメモリウォールの観点から解きほぐし、量子化(INT8/FP8/FP4)、構造化スパース性(2:4)、dataflow アーキテクチャ、演算子融合、バッチングと KV キャッシュまでをハードウェアとソフトウェアの協調設計として一枚の絵にまとめます。2026 年の Blackwell FP4 と Vera Rubin の流れを反映し、実務での適用ポイントを示します。
2026-06-16 · 32 分で読めます #inference#quantization#sparsity#dataflow#gpuエッジ AI と NPU — オンデバイス推論アクセラレータ
推論をクラウドではなく機器で直接回すエッジ AI の理由(遅延・プライバシー・コスト)と、それを可能にする NPU の概念を整理します。Apple Neural Engine、Qualcomm、Edge TPU、ARM Ethos からモデル軽量化、オンデバイス LLM、ランタイム(TFLite/ONNX/CoreML)、クラウド-エッジのハイブリッドまで、開発者の始め方ガイドを収めました。
2026-06-16 · 38 分で読めます #edge-ai#npu#on-device#inference#quantizationローカルLLM推論最適化 — 量子化からVRAM限界の突破まで
プライバシーとコスト、そしてビッグテック疲れの中でローカルLLMが再び盛り上がっています。VRAM中心のハードウェア選択、GGUFとAWQの量子化、llama.cppとvLLMとOllamaの比較、KV cacheのメモリ計算、VRAMをスワップとして使う逆転の発想ハックまで、ローカル推論最適化の全体地図を描きます。
2026-06-12 · 26 分で読めます #llm#inference#quantization#llama-cpp#vllmローカルAI & オンデバイスLLM 2026 完全ガイド — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 徹底解説
2026年5月、ローカルAIはもはや「趣味」ではない。M4 Max MacBook ProがLlama 4 Scout 109B MoEを毎秒24トークンで動かす時代だ。Ollama、LM Studio、Jan、MstyのようなデスクトップランタイムがGUI/CLIを統一し、Open WebUI、AnythingLLM、LibreChatがChatGPT級のインターフェースを提供する。バックエンドはllama.cpp、MLX-LM、vL
2026-05-16 · 28 分で読めます #local-ai#on-device-llm#ollama#lm-studio#janLLM サービング & ローカル推論 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 徹底比較
2026 年の LLM サービング・推論フレームワークの地図を描く。データセンター陣営(vLLM・SGLang・TGI・Triton・TensorRT-LLM)、ローカル陣営(llama.cpp・MLX・llamafile・Ollama・LM Studio・GPT4All)、新興陣営(KTransformers・MLC LLM・Modular MAX)、そしてクラウドサービング SaaS(Together・Fireworks・Groq・
2026-05-16 · 34 分で読めます #llm#model-serving#inference#vllm#llama-cppLLM推論最適化完全ガイド2025:vLLM、TensorRT-LLM、KV Cache、Speculative Decoding
LLM推論最適化のすべて!vLLM(PagedAttention)、TensorRT-LLM(FP8/INT4)、KV Cache管理、Speculative Decoding、Continuous Batching、FlashAttention、量子化(GPTQ/AWQ/GGUF)、モデルサービング(Triton/vLLM/TGI)、GPUメモリ最適化、コスト分析。
2026-04-14 · 31 分で読めます #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decoding