タグ: #llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 208 件
PD分離はスループットを増やさない — プリフィル/デコード分離が実際に買うもの
プリフィルとデコードを別々のGPUに分けるPD分離は、2026年にvLLM・SGLang・TensorRT-LLMすべてに入った設計ですが、どこを見ても「2倍から7倍」という数字ばかりが出回っています。ところがvLLM公式ドキュメントは同じ機能について「分離プリフィルはスループットを改善しない」と大文字で明記しています。実は両方とも正しいのです — そのベンダー数値はすべて、スループットではなくgoodput(SLOを守った処理量)か、
2026-07-16 · 29 分で読めます #llm#ai#inference#kv-cache#vllmドキュメントから知識グラフへ — 正直な構築パイプライン
「ドキュメントから知識グラフを抽出する」はデモでは LLM 呼び出し一回のように見えます。しかし顧客のドキュメントを実際にクエリ可能なグラフに変える仕事は6段階のパイプラインであり、コストと苦痛の大半は抽出ではなくエンティティ解決にあります。この記事では、スキーマ(オントロジー)を先に決める理由、LLM ベースのスキーマ制約抽出(LangChain の LLMGraphTransformer、LlamaIndex の Simple/Sc
2026-07-15 · 17 分で読めます #knowledge-graph#ai#llm#data-engineeringGraph RAG とは何か — ベクトルRAGが行き詰まる場所と、コストに見合う瞬間
RAGの標準レシピ(チャンク→埋め込み→上位k件の検索)は、答えが一つのチャンクに収まっているときはよく効きますが、マルチホップの質問や、コーパス全体を貫くグローバルな「センスメイキング」質問では構造的に行き詰まります。MicrosoftのGraphRAGはこの2つの死角を狙い、LLMでコーパスから知識グラフを抽出し、Leidenアルゴリズムでコミュニティを検出して要約を事前生成します。そのうえでグローバルな質問はコミュニティ要約のマッ
2026-07-15 · 15 分で読めます #rag#graph-rag#knowledge-graph#ai#llmRTX 5090 一枚で小さなモデルたちを直接動かしてみる — microGPT・OCR・音楽生成
RTX 5090(Blackwell、32GB)一枚に SSH で接続し、小さなモデル三つを直接動かしてみました。char-level GPT をゼロから 28 秒で学習させ(10.75M パラメータ、117 万 tokens/s)、専用 OCR(TrOCR)と小型 VLM(Qwen2-VL-2B)を同じ画像に当てて CER で対決させ、MusicGen で 8 秒の音楽を 1.9 秒(実時間の 4.2 倍)で生成しました。その過程で出
2026-07-11 · 12 分で読めます #pytorch#gpu#llm#ocr#hands-onAIがコードを保守する時代でも、人間のために書く
2026年7月10日、Scott Robinson は古い格言を一ひねりして蘇らせました。LLM はあなたのコードベースをスタイルガイドのように読むため、あなたがマージしたあらゆる近道は、モデルが機械の規模で返してくる学習データになります。重複したアクセスチェックの例と、「LLM はスポンジだ」という彼の一文を追ったうえで、より難しい問いを立てます。次の保守者が機械であるときも、人間のために書くことは依然として重要か。重要です。人間は依
2026-07-11 · 12 分で読めます #ai#llm#code-quality#maintainability#craft2026 年の良いエージェントベンチマークとは — UniClawBench、ライブコンテナ、隠れた監督者
HKU MMLab が 2026 年 7 月に arXiv へ投稿した UniClawBench は、「能力駆動(capability-driven)」を掲げるプロアクティブエージェント向けのベンチマークです。あらかじめ記録された静的な正解と照合する代わりに、ライブの Docker コンテナ内でエージェントを動かし、きめ細かなステップ単位のチェックポイントで採点します。実行者・隠れた監督者・ユーザーエージェントからなる閉ループで多ターン
2026-07-11 · 9 分で読めます #ai#agents#evaluation#benchmark#llmTencent Hy3: 295B オープンウェイト MoE を冷静に読む
Tencent は2026年7月6日、Hy3 を Apache 2.0 で公開しました。総計295Bのうち21Bだけが活性化する MoE の推論・エージェント言語モデルです。何が実際に新しいのか、中国系オープンウェイトの流れの中でどこに位置するのか、そしてベンダーが自ら出したベンチマーク数値をどこまで信じるべきかを整理します。
2026-07-11 · 9 分で読めます #hy3#tencent#hunyuan#open-weights#moeMicrosoft Flint を読む — エージェントがチャートを描くための可視化言語
Microsoft Research が公開した Flint は、エージェントを可視化する言語ではなく、AI エージェントがデータから見栄えの良いチャートを安定して作れるようにする中間言語です。コンパイラがスケール・軸・色・レイアウトといった低レベルの決定をデータとセマンティック型から代わりに導き、ひとつの仕様を Vega-Lite・ECharts・Chart.js へコンパイルします。この記事では Flint が実際に何でどんな問題を
2026-07-11 · 10 分で読めます #ai#agents#data-visualization#llm#microsoftRLHF モデルはなぜ報酬をハックするのか — リワードハッキングの仕組み・症状・緩和
Xiaohua Wang ほか 23 名が 2026 年 4 月に arXiv へ投稿した「Reward Hacking in the Era of Large Models」は、RLHF で整列された大型モデルがなぜ、どのように報酬信号をゲーミングするのかを整理したサーベイです。中心的な提案は、リワードハッキングを目標圧縮・最適化増幅・評価者–方策の共進化という三つの力で読む「プロキシ圧縮仮説(PCH)」です。冗長さバイアス、おべっか
2026-07-11 · 11 分で読めます #ai#llm#alignment#rlhf#safetyModel Context Protocol(MCP)リファレンス — AIを外部世界につなぐ開かれた標準
Model Context Protocol(MCP)は、アプリケーションがLLMにコンテキストを提供する方法を標準化した開かれたプロトコルです。この記事はMCPが実際に何であるかを公式ドキュメントに基づいて整理したエンジニア向けリファレンスです — なぜM×N統合問題を解くのか、ホスト・クライアント・サーバー構造と2つの層(データ/トランスポート)、3つのサーバープリミティブ(ツール・リソース・プロンプト)、stdioとStreama
2026-07-11 · 11 分で読めます #mcp#ai#agents#llm#protocolもっと考えれば正解に近づく、とは限らない: テストタイム計算と過剰思考
2026年4月、Shu Zhou ら6名は "When More Thinking Hurts" で、推論トークンをただ増やし続ける流れに正面から問いを立てます。著者らの報告によれば、計算予算が大きくなるほど追加の推論トークンの限界効用は大きく減り、ある地点からモデルは「過剰思考」に陥って、いったん正解していた答えを自ら覆します。最適な思考の長さは問題の難易度ごとに異なるため、すべてに同じ予算を与える方式は無駄が多い、というわけです。ア
2026-07-11 · 13 分で読めます #ai#llm#reasoning#inference#test-time-computeKVキャッシュを4ビットへ — SAW-INT4とシステムを踏まえたINT4量子化
長文脈のLLMサービングで本当のメモリのボトルネックは、重みではなくKVキャッシュです。これを素朴にINT4へ落とすと精度が崩れますが、2026年4月のプリプリントSAW-INT4は、トークン単位のINT4量子化にブロック対角アダマール回転を組み合わせ、素朴なINT4が失った精度をほぼ取り戻すと報告します。この論文の本当の狙いは精度だけでなくスループットです — ページド型KVキャッシュのレイアウトに直接組み込む融合回転・量子化カーネル
2026-07-11 · 12 分で読めます #ai#llm#quantization#inference#kv-cacheLLM バーンアウト — 仕事が「作る」から「レビューする」へ静かに変わるとき
開発者 Alec Scollon のエッセイ「I Think I Have LLM Burnout」が Hacker News で話題になりました。一日が、コードを「書く」仕事から、モデルが書いたものを「レビューする」仕事へと静かに変わったという感覚を、的確に言い当てたからです。本稿はその主張を忠実にまとめ、バランスの取れた見方を添えます。生成は安くなりましたが検証はそのままで、AI の出力をレビューすることは実際の認知的な労働です。道
2026-07-11 · 13 分で読めます #llm#developer-experience#burnout#ai-tooling#code-review事前学習済みチェックポイントを長文脈ハイブリッドへ — HyLoのアップサイクリング
ハイブリッド型のシーケンスモデル(アテンション+線形・SSMブロック)は長文脈に有利ですが、これまでは多くがゼロから事前学習し直す必要がありました。2026年4月のプリプリントHyLoは、すでに学習済みのTransformerチェックポイントを安価な後処理学習だけでハイブリッドへ「アップサイクリング」するレシピを提案します — MLA(潜在アテンション)とMamba2・Gated DeltaNetのような線形ブロックを混ぜ、段階的な長文
2026-07-11 · 10 分で読めます #ai#llm#long-context#architecture#efficiency遅いパソコンでGLM-5.2を動かす — colibrìが744Bモデルをディスクからストリーミングする仕組み
colibrìは純粋Cで約1,300行の推論エンジンで、744B(7,440億)パラメータのMoEモデルであるGLM-5.2を、RAM 25GBのコンシューマPCで動かします。鍵はMoEの疎性とディスクストリーミングです。約9.9GBの密なレイヤーだけをRAMに常駐させ、約370GBのルーテッドエキスパートはNVMe SSDに置いてトークンごとに必要な分だけ読み込みます。代償は正直に遅く、コールド状態で約0.05〜0.1 tok/s、実
2026-07-11 · 8 分で読めます #ai#llm#local-inference#moe#quantization拡散 LLM が CUDA カーネルを書く — DICE と、なぜ並列生成が効きうるのか
DICE は 2026 年 2 月のプリプリントで、拡散(diffusion)大規模言語モデルが CUDA カーネル生成において同規模の自己回帰(autoregressive)モデルを上回り、新たな最高性能(SOTA)を打ち立てたと主張します。核心は、トークンを左から右へ一つずつ書く代わりに、系列全体を並列に生成し、どの位置でも非逐次的に書き直せることです。大域構造が重要なコードという課題に合いそうな性質です。著者らは CuKe という
2026-07-11 · 12 分で読めます #ai#llm#diffusion#cuda#gpuステップごとにどれだけ考えるかを選ぶ — Ares の適応的な推論努力ルーティング
Ares(2026年3月のプレプリント)を実務の視点から整理しました。この論文は、推論努力をタスク全体ではなくステップ単位のコストレバーとして扱います。軽量なルーターが相互作用履歴を見て、各ステップに必要な最も低い推論レベルを予測し、すべてのステップを最大努力で回す無駄を減らします。著者はTAU-Bench・BrowseComp-Plus・WebArenaで推論トークンを最大52.7%まで削減し、成功率の低下はわずかだったと報告していま
2026-07-11 · 8 分で読めます #ai#agents#llm#efficiency効果的なAIエージェントを作る — 5つのワークフローパターンとエージェントのリファレンス
Anthropicのエンジニアリングガイド「Building Effective Agents」を実務リファレンスとして整理しました。ワークフローとエージェントの正確な区別、すべての土台となる増強されたLLM(検索・ツール・メモリ)、そして5つのワークフローパターン(プロンプトチェイニング・ルーティング・並列化・オーケストレーター/ワーカー・エバリュエーター/オプティマイザー)を、それぞれの使いどころと具体例とともに扱います。自律エージ
2026-07-11 · 16 分で読めます #ai#agents#llm#engineering#anthropicHybrid SWA による長コンテキスト推論の最適化 — Xiaomi MiMo v2.5 が実際に行ったこと
スライディングウィンドウアテンション(SWA)とフルアテンションを層ごとに交互配置するハイブリッド SWA は、長コンテキスト推論の KV キャッシュメモリと計算量を同時に削減する最近の主流設計です。Xiaomi が公開した MiMo v2.5 推論最適化の記事を根拠に、ハイブリッド SWA とは何でなぜ重要か、MiMo v2.5 が実際にどんなアーキテクチャとシステムエンジニアリングを行ったか(70 層中 10 層のみフルアテンション
2026-07-11 · 14 分で読めます #ai#llm#inference#attention#optimizationプロダクション RAG パターン — 素朴な RAG が失敗する理由と、実際に効く技法
デモ用の RAG は半日で作れますが、プロダクションで静かに壊れる場所は、たいてい生成ではなく検索です。本稿はチャンキング、埋め込みとハイブリッド検索(BM25 + ベクトル)、リランキング、コンテキスチュアル・リトリーバル、クエリ書き換え、そして評価を、それぞれ何であり・いつ効き・何を代償に払うのかで整理します。Anthropic のコンテキスチュアル・リトリーバルの数値のように出典のある数字だけを引用し、RAG は魔法ではないこと、
2026-07-11 · 18 分で読めます #ai#rag#llm#retrieval#embeddings