タグ: #inference-cost
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
500ドルでファインチューニングした9Bがフロンティアに勝った条件 — そしてその条件がどれだけ狭いか
2026年7月28日、Hacker Newsで336点を獲得した記事があります。FermisenseがQwen3.5-9BをGRPOで約500ドル分のGPU時間だけ学習させ、同じツールと同じ採点器を使った五つのフロンティア構成を電子商取引カタログ検収の課題で上回ったという報告です。達成可能スコアの87.3%対、最高フロンティア76.9%。1,000件の処理コストは約0.50ドル対、19ドルから172ドルでした。この記事はその結果を否定も
2026-07-31 · 19 分で読めます #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6とコストパフォーマンスの限界 — 曲線の上で自分のワークロードの位置を見つける方法
OpenAIが2026年7月30日にGPT-5.6 Lunaの価格を80%、Terraを20%下げました。7月9日の正式リリースから3週間後で、最上位のSolの価格は据え置きです。Lunaは100万トークンあたり入力1ドル・出力6ドルから、入力0.20ドル・出力1.20ドルになりました。この記事は値下げ幅を紹介する代わりに曲線を計算します — 値下げ後の三つのティアの単価比が両軸ともちょうど25対10対1に固定され、系列の中ではトークン
2026-07-31 · 20 分で読めます #ai#llm#openai#inference-cost#prompt-cachingDeepSeek V4 Flashが実際に変えるもの — リーダーボードではなく能力あたり単価の問題
2026年7月31日、DeepSeekがV4-Flash APIを公開ベータに切り替えました。アーキテクチャは4月のプレビューと同じ284Bの総パラメータ・13BアクティブのMoEに1Mコンテキストで、変わったのはポストトレーニングだけです。公式チェンジログが公開したスコアはTerminal Bench 2.1で82.7、Toolathlon verifiedで70.3ですが、これらの数字はDeepSeekが自社ハーネスで測ったベンダー
2026-07-31 · 19 分で読めます #ai#llm#deepseek#inference-cost#moe