タグ: #llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 208 件
26Bモデルを2GBのRAMで動かす原理 — 常駐メモリとワーキングセットは同じ数字ではない
2026年7月29日にShow HNへ上がったTurboFieldfareは、Gemma 4 26B-A4BをMシリーズのMacで約2GBのRAMで動かすと主張しています。ディスクには14.3GBが入り、RAMに常駐するのは1.35GBの共有コアだけで、トークンごとに必要なエキスパートの重みをSSDから読み込みます。この記事はその数字たちを自分で導出して検証します — 4ビットのグループ64量子化がなぜ重みあたり4.5ビットになって14
2026-07-31 · 20 分で読めます #ai#llm#quantization#apple-silicon#moe500ドルでファインチューニングした9Bがフロンティアに勝った条件 — そしてその条件がどれだけ狭いか
2026年7月28日、Hacker Newsで336点を獲得した記事があります。FermisenseがQwen3.5-9BをGRPOで約500ドル分のGPU時間だけ学習させ、同じツールと同じ採点器を使った五つのフロンティア構成を電子商取引カタログ検収の課題で上回ったという報告です。達成可能スコアの87.3%対、最高フロンティア76.9%。1,000件の処理コストは約0.50ドル対、19ドルから172ドルでした。この記事はその結果を否定も
2026-07-31 · 19 分で読めます #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6とコストパフォーマンスの限界 — 曲線の上で自分のワークロードの位置を見つける方法
OpenAIが2026年7月30日にGPT-5.6 Lunaの価格を80%、Terraを20%下げました。7月9日の正式リリースから3週間後で、最上位のSolの価格は据え置きです。Lunaは100万トークンあたり入力1ドル・出力6ドルから、入力0.20ドル・出力1.20ドルになりました。この記事は値下げ幅を紹介する代わりに曲線を計算します — 値下げ後の三つのティアの単価比が両軸ともちょうど25対10対1に固定され、系列の中ではトークン
2026-07-31 · 20 分で読めます #ai#llm#openai#inference-cost#prompt-caching偽の著者名を持つ論文が口頭発表に採択された — AI時代のピアレビューにおけるシステム的失敗の分析
2026年7月30日、二人のレビュアーが今夏担当した機械学習系学会の投稿22本のうち15本で、捏造された引用、実在しない著者、または明白なLLM生成の痕跡を見つけたと公開しました。うち二本は実在する論文の著者名を架空の名前に差し替えて引用しており、リジェクト意見と組織委員会への直接通報にもかかわらず、「幻覚の参考文献だけ直せばよい」という条件で口頭発表に採択されました。この記事は怒りではなくシステムの失敗としてこの事件を読みます。フラグ
2026-07-31 · 25 分で読めます #ai#peer-review#research-integrity#llm#academia蒸留で転移するものとしないもの — DeepSeekをGPT-OSSに蒸留したら検閲は付いてこなかった
2026年7月30日にShow HNへ上がったCTGTの実験は、DeepSeek V4 Flashを教師、GPT-OSSを生徒として金融推論能力を蒸留したところ、能力は移ってきたのに政治的検閲は移ってこなかったと報告しています。対応ペア152組で教師はセンシティブな質問と対照群のあいだに45.45点の検閲ギャップを示しましたが、生徒は0.43点と3.94点でベースラインにとどまりました。この記事はその実験ひとつを拡大せず、出発点としてだ
2026-07-31 · 22 分で読めます #ai#llm#distillation#alignment#open-weightsプロンプトで3D CADを作るということ — メッシュとB-rep、そして制約条件というボトルネック
GeekNewsのShow GNに、プロンプトで3D CADモデルを作るツールCAIDが投稿されました。作った本人が自ら明かした限界がこの分野全体の状態を正確に要約しています — 寸法の自動検証がなく、公差とDFMと加工性を判断できず、出力物をそのまま製造に使ってはいけない検証済みプロトタイプにすぎないということです。エンジニアリングの視点からの問いは一つです。CADはパラメトリックで制約ベースなのに、メッシュを生成することと編集可能な
2026-07-31 · 22 分で読めます #ai#cad#llm#manufacturing#geometry社内ナレッジベースをLLMで作るということ — 権限認識検索、鮮度、そして公開前の評価セット
Cerebrasが2026年7月15日に公開した社内ナレッジベース構築記は、1日15,000件を超える問い合わせを人間と自動化とエージェントが一緒に投げるシステムの内部構造を明らかにしています。しかし社内ナレッジベースでチームが実際に過小評価しがちなのは、チャンキングやリランキングではなく、権限、鮮度、削除伝播、そして真実源の衝突です。HR文書を漏らす検索はないほうがましで、すでに廃止されたランブックを自信満々に引用する検索はウィキより
2026-07-31 · 26 分で読めます #ai#rag#enterprise-search#llm#platform-engineeringDeepSeek V4 Flashが実際に変えるもの — リーダーボードではなく能力あたり単価の問題
2026年7月31日、DeepSeekがV4-Flash APIを公開ベータに切り替えました。アーキテクチャは4月のプレビューと同じ284Bの総パラメータ・13BアクティブのMoEに1Mコンテキストで、変わったのはポストトレーニングだけです。公式チェンジログが公開したスコアはTerminal Bench 2.1で82.7、Toolathlon verifiedで70.3ですが、これらの数字はDeepSeekが自社ハーネスで測ったベンダー
2026-07-31 · 19 分で読めます #ai#llm#deepseek#inference-cost#moeRAGが的外れな答えを返すとき — 検索の失敗と生成の失敗を切り分けるデバッグ手順
RAGが誤った答えを出すと、たいていはプロンプトから直しにかかりますが、実際の原因の多くは検索段階にあります。正解チャンクを手で入れてみるという一度の実験で検索の失敗と生成の失敗を切り分ける手順から始め、チャンキングがなぜ最もよくある犯人なのか、埋め込み類似度が意味的類似度と分かれる地点とBM25の混合がしばしば勝つ理由、リランキングが値打ちを出す条件、チャンクに文書タイトルとメタデータを付けたときの効果を整理しました。最後にゴールデン
2026-07-26 · 23 分で読めます #llm#rag#retrieval#chunking#evaluationLLM APIのコスト最適化 — 出力トークン、プロンプトキャッシング、ルーティングの損益分岐計算
LLM APIの請求書を半分にする作業は勘ではなく算数です。出力トークンの単価が入力の数倍という構造のせいで、最大のレバーはほぼ常に出力長の制御であり、その次がプロンプトキャッシングです。キャッシングが接頭辞しか捕まえられないという制約がプロンプトの配置順をどう強制するのか、RAGと全文投入の損益分岐がどこにあるのか、モデルルーティングの削減率の公式とそれに伴う精度の損失を同じ単位でどう測るのかを整理しました。月額コストをシミュレーショ
2026-07-26 · 21 分で読めます #llm#cost-optimization#prompt-caching#rag#model-routingLLM評価を勘でやらない方法 — 標本サイズ、審査者バイアス、CI回帰テスト
プロンプトを直して「良くなった気がする」でデプロイするチームには、静かに積み上がる回帰を見る方法がありません。評価をアサーション、ゴールデンデータセット、LLM-as-judge、人手評価の四層に分けてそれぞれのコストと信頼度を整理し、審査者モデルの位置バイアスと長さ選好をどう相殺するかを扱います。例20個で出した結論の信頼区間が実際どれだけ広いのかを計算し、ペア比較が必要標本を何分の一に減らすのかをコードで示します。温度0でも完全には
2026-07-26 · 20 分で読めます #llm#evaluation#llm-as-judge#statistics#regression-testingLLM推論のVRAM計算 — 重みより先にKVキャッシュが溢れます
「このモデルはうちのGPUに載りますか」という質問に、掛け算を数回するだけで答える方法をまとめました。重みのメモリはパラメータ数×バイト数で終わりますが、実際にデプロイを止めるのはシーケンス長とバッチに比例して育つKVキャッシュです。KVキャッシュの公式とGQAがそれを何分の一かに減らす原理、プリフィル活性化とフレームワークオーバーヘッドの大きさ、PagedAttentionが消した断片化の損失、そして4bit量子化がタダではない理由を
2026-07-26 · 20 分で読めます #llm#inference#vram#kv-cache#quantizationLLMの構造化出力を安定させる — パース失敗をなくす四重の防御
JSONをくれと頼んだのにマークダウンのフェンスに包まれて来たり、後ろに説明文が付いたり、トークン上限で切れて来たりする問題を、階層ごとに解決する方法をまとめました。まず失敗の類型を分類し、プロンプトの指示から関数呼び出しスキーマ、制約デコーディングまで防御を重ねて積みますが、制約デコーディングが文法的な妥当性だけを保証し意味的な正確性は保証しないという区別を明確にします。フィールド名と順序が精度を変える理由、エラーメッセージを返してや
2026-07-26 · 21 分で読めます #llm#structured-output#json-schema#constrained-decoding#validationRAG・ファインチューニング・ロングコンテキスト — 自分の問題には何を使うべきか:論文が実際に測ったもの、そして誰も測っていないもの
LLMアーキテクチャで最も頻繁に出る質問ですが、大半の答えは出典のない意思決定ツリーです。本稿は測定されたものだけで答えます。ファインチューニングが新しい知識の注入に失敗することは複数の論文で繰り返し測定されており(Ovadiaら、Gekhmanら)、正反対に見える農業のケーススタディは実は別の介入(教師なし継続事前学習 vs 教師ありQ&Aチューニング)を測ったものなので、矛盾ではありません。ロングコンテキストは位置・長さ・語彙という
2026-07-17 · 43 分で読めます #rag#llm#fine-tuning#long-context#aiLLM APIコストを実際に下げる方法 — 「キャッシング90%割引」が請求書ではなぜ25%なのか
プロンプトキャッシングのキャッシュ読み取りは入力価格の10分の1です。しかし、それが請求書を90%削ってくれるわけではありません。Anthropicが自社ドキュメントに載せている計算例をそのまま追うと、キャッシュが完全に効いた状態でも総額は0.705ドルから0.525ドルへ、25.5%しか減りません。理由は単純です — 割引はその項目に使うお金の割合の分だけしか請求書を減らさず、出力トークンがすでにコストの60%を食っているからです。こ
2026-07-17 · 38 分で読めます #llm#cost-optimization#prompt-caching#api#aiローカルでLLMを動かすにはVRAMがどれだけ必要か — 表ではなく数式で計算する
「8Bモデルには何GB必要ですか」の正解は表ではなく2つの数式です。重みはパラメータ数 × bpw ÷ 8、KVキャッシュは2 × レイヤー数 × KVヘッド数 × headdim × バイト数 × トークン数です。本稿はこの2つの式をllama.cppのソースと公式の表に直接照らして検証します — ggmlのブロック構造体から導いたQ80の8.5 bpwはllama.cppが公表した8.5008と小数第3位まで一致し、同じやり方で逆算
2026-07-17 · 43 分で読めます #llm#quantization#kv-cache#local-llm#gpuコンテキストエンジニアリングはプロンプトエンジニアリングを置き換えた言葉なのか — 測定されたものと、そうでないもの
「プロンプトエンジニアリングは死んだ」という文は、この用語を生んだどの一次出典にもありません。Karpathyはfew-shotの例とタスク説明をコンテキストエンジニアリングの構成要素として列挙し、Anthropicは「プロンプトエンジニアリングの自然な進展(natural progression)」と書きました。つまり代替ではなく包含です。それでも、これが本当に別の仕事だという根拠はあります — ChromaのLongMemEval実
2026-07-17 · 37 分で読めます #llm#context-engineering#prompt-engineering#long-context#ai-agentAIエージェントのメモリは実際にどう作られているのか — 4つの設計と、ベンチマークが実際に証明したこと
「エージェントメモリ」は単一の技術ではなく、少なくとも4つの異なる設計をひとまとめにした言葉です — ファイルスクラッチパッド、要約/コンパクション、ベクトル回収、知識グラフ。本稿はまず、それぞれが実際に何をするのかを製品ドキュメントで確認し、その後もっと不都合な質問を投げかけます: どちらが優れているという根拠は、実際に測定されたことがあるのか? Mem0論文(arXiv:2504.19413)の表を直接読むと、ヘッドラインの「Ope
2026-07-17 · 38 分で読めます #ai#ai-agent#agent-memory#llm#benchmarkシミュレーションされた顧客は絶対に離脱しない — LLMユーザーシミュレーターがエージェントのスコアを水増しする場所
τ-bench系の対話型エージェントベンチマークでは、「ユーザー」役はもう一つのLLMが務めます。ところがこのシミュレーターは測定対象ではなく測定器具であり、器具は校正を受けなければなりません。2026年に出た3本の検証研究は同じ方向を指しています — シミュレーションされたユーザーは協調的すぎるのです。実在の人間451人でτ-benchプロトコルをそのまま回した研究は、シミュレーターが作る「イージーモード」がエージェントの成功率を人間
2026-07-16 · 41 分で読めます #ai#llm#evaluation#agents#simulationLoRAのrankを変えたら学習率も変えるべきか — μA(2026)が分けた二つのレジーム、そしてその測定の限界
LoRAでrankを変えると最適学習率を探し直す必要があるという通念と、「1/rスケーリングを使えば学習率はrankと無関係になる」という通念が、実務では同時に流通しています。2026年2月にarXivへ投稿されたμA(Maximal-Update Adaptation)論文は、この二つがどちらも正しいと言います — ただし、どのα規約とどの初期化を使うかによって。本稿では、μAが導いた二つのレジーム(ηがrankの-1/2乗に比例する
2026-07-16 · 33 分で読めます #llm#lora#fine-tuning#peft#training