タグ: #model-routing
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
LLM APIのコスト最適化 — 出力トークン、プロンプトキャッシング、ルーティングの損益分岐計算
LLM APIの請求書を半分にする作業は勘ではなく算数です。出力トークンの単価が入力の数倍という構造のせいで、最大のレバーはほぼ常に出力長の制御であり、その次がプロンプトキャッシングです。キャッシングが接頭辞しか捕まえられないという制約がプロンプトの配置順をどう強制するのか、RAGと全文投入の損益分岐がどこにあるのか、モデルルーティングの削減率の公式とそれに伴う精度の損失を同じ単位でどう測るのかを整理しました。月額コストをシミュレーショ
2026-07-26 · 21 分で読めます #llm#cost-optimization#prompt-caching#rag#model-routing