タグ: #prompt-caching
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
GPT-5.6とコストパフォーマンスの限界 — 曲線の上で自分のワークロードの位置を見つける方法
OpenAIが2026年7月30日にGPT-5.6 Lunaの価格を80%、Terraを20%下げました。7月9日の正式リリースから3週間後で、最上位のSolの価格は据え置きです。Lunaは100万トークンあたり入力1ドル・出力6ドルから、入力0.20ドル・出力1.20ドルになりました。この記事は値下げ幅を紹介する代わりに曲線を計算します — 値下げ後の三つのティアの単価比が両軸ともちょうど25対10対1に固定され、系列の中ではトークン
2026-07-31 · 20 分で読めます #ai#llm#openai#inference-cost#prompt-cachingLLM APIのコスト最適化 — 出力トークン、プロンプトキャッシング、ルーティングの損益分岐計算
LLM APIの請求書を半分にする作業は勘ではなく算数です。出力トークンの単価が入力の数倍という構造のせいで、最大のレバーはほぼ常に出力長の制御であり、その次がプロンプトキャッシングです。キャッシングが接頭辞しか捕まえられないという制約がプロンプトの配置順をどう強制するのか、RAGと全文投入の損益分岐がどこにあるのか、モデルルーティングの削減率の公式とそれに伴う精度の損失を同じ単位でどう測るのかを整理しました。月額コストをシミュレーショ
2026-07-26 · 21 分で読めます #llm#cost-optimization#prompt-caching#rag#model-routingLLM APIコストを実際に下げる方法 — 「キャッシング90%割引」が請求書ではなぜ25%なのか
プロンプトキャッシングのキャッシュ読み取りは入力価格の10分の1です。しかし、それが請求書を90%削ってくれるわけではありません。Anthropicが自社ドキュメントに載せている計算例をそのまま追うと、キャッシュが完全に効いた状態でも総額は0.705ドルから0.525ドルへ、25.5%しか減りません。理由は単純です — 割引はその項目に使うお金の割合の分だけしか請求書を減らさず、出力トークンがすでにコストの60%を食っているからです。こ
2026-07-17 · 38 分で読めます #llm#cost-optimization#prompt-caching#api#aiプロンプトキャッシング実践ガイド: エージェントアプリのコストとレイテンシーを同時に下げる
エージェントアプリでプロンプトキャッシングが重要な理由、OpenAIとAnthropicの違い、プロンプト構成パターン、ROIの見方、よくある失敗、移行チェックリストを実務向けに整理します。
2026-04-12 · 13 分で読めます #prompt-caching#latency#cost-optimization#ai-agent#llmopsGPT-5 開発者向け実践ガイド: エージェントコーディング、ツール活用、コスト最適化
2025年8月7日に公開されたGPT-5を基準に、開発者のワークフローがどう変わるのか、どのサイズと制御値を選ぶべきか、そしてエージェント型のコーディングをどう運用するかを実務目線で整理します。
2026-04-12 · 12 分で読めます #openai#gpt-5#coding#agentic-coding#tool-use