タグ: #local-llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
Qwen3.8-27Bのハイブリッドアテンション — 64層のうちKVキャッシュを積むのは16層だけ
27Bのモデルが26万トークンのコンテキストをノートパソコンで扱える理由は、パラメータ数ではなく層の構成にあります。Qwen3.8-27Bは64層のうち48層を線形アテンション(Gated DeltaNet)に、16層だけを通常のアテンションに配置し、KVキャッシュが伸びる層そのものを4分の1に減らしました。この構造が何を節約して何を失うのか、FP8ブロック量子化はどこに効くのか、そしてローカル推論を検討するとき実際に計算すべき値は何か
2026-08-14 · 13 分で読めます #llm#inference#quantization#local-llm#attentionローカルでLLMを動かすにはVRAMがどれだけ必要か — 表ではなく数式で計算する
「8Bモデルには何GB必要ですか」の正解は表ではなく2つの数式です。重みはパラメータ数 × bpw ÷ 8、KVキャッシュは2 × レイヤー数 × KVヘッド数 × headdim × バイト数 × トークン数です。本稿はこの2つの式をllama.cppのソースと公式の表に直接照らして検証します — ggmlのブロック構造体から導いたQ80の8.5 bpwはllama.cppが公表した8.5008と小数第3位まで一致し、同じやり方で逆算
2026-07-17 · 43 分で読めます #llm#quantization#kv-cache#local-llm#gpuMac mini がオンデバイス AI マシンになった理由 — アップル半導体幹部インタビューが語ること、語らないこと
Apple Silicon のシニアプロダクトマネージャー、ダグ・ブルックス氏が The Deep View のインタビューで Mac mini と Mac Studio の需要とオンデバイス AI の方向性を語りました。開発者や小規模チームがなぜこの小さなデスクトップをローカル LLM・エージェント機として選ぶのか、統合メモリ構成の本当の利点は何か、そして CUDA エコシステムの差と直近の値上げという正直なトレードオフまで — 幹部
2026-07-11 · 10 分で読めます #apple-silicon#on-device-ai#local-llm#mac-mini#inferenceMLX 徹底解剖 — Apple Silicon 専用 ML フレームワーク、統合メモリ・遅延グラフ・Mac ネイティブのワークフロー (2026 ハンズオン)
MLX は、PyTorch と JAX を作った Apple の ML チームが、今度は Apple Silicon だけのために書き直した配列フレームワークだ。中核となる命題はひとつ — M シリーズの GPU は CPU と同じ RAM を使う、つまりホストとデバイスの間に複製がない (統合メモリ)。本記事は、その統合メモリ命題、遅延 (lazy) 計算グラフ、mlx-lm・mlx-vlm・mlx-data サブパッケージ、Pyth
2026-05-14 · 28 分で読めます #mlx#apple-silicon#ml-framework#unified-memory#metal2026 AI デスクトップアプリのスナップショット — Granola・Cleft・Lex・Highlight・Raycast AI・Ollama、そして静かに立ち上がった「Ambient AI」カテゴリ
2026 年春、日常の AI 利用の重心はチャットボットのタブから「デスクトップに住んでいるアプリ」へと静かに移った。会議ノートの Granola、ローカル文字起こしの Cleft・Superwhisper・MacWhisper、AI ネイティブ執筆ツール Lex、システムワイドアシスタントの Highlight、ランチャー AI の Raycast AI、ローカルモデルとチャットする AnythingLLM・Jan・GPT4All・L
2026-05-14 · 61 分で読めます #ai-desktop#granola#cleft#lex-app#highlight-ai