タグ: #cost
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
トレースが費用になるとき — Langfuseの保持、サンプリング、マスキング
トレーシングはトラフィックが少ないうちは無料のように見え、ある時点から保存費用と個人情報の問題として戻ってきます。本記事はLangfuseで量が費用に変わる地点を四つに分けて整理し、公式ドキュメントを基準にサンプリングがtrace単位で決まるという事実とそれが実務で何を意味するか、PythonとJSそれぞれのマスキング方式がデータをどの時点で隠すのかを確認します。保持ポリシーの既定値が削除しないであること、最小の保持期間と削除の基準にな
2026-08-14 · 16 分で読めます #observability#langfuse#cost#sampling#data-retentionコーディングエージェントのコストは上限ではなく摩擦で抑える
Databricksが2026年7月と8月に相次いで公開した二本のエンジニアリング記事は、コーディングエージェントの支出を扱う方法が予算上限からゲートウェイと段階的な摩擦へ移りつつあることを示しています。この記事はその設計を分解します。なぜハード予算が最後の手段なのか、なぜ日次の暴走防止と月次のガバナンスを分けるのか、なぜ増分ひとつの大きさが設計のすべてなのか、そして実際にコストを支配するのがモデル単価ではなくコンテキストなのはなぜかを
2026-08-09 · 15 分で読めます #mlops#llm#cost#ai-gateway#developer-productivity推論強度はモデル選択ではなくリクエスト単位のデプロイパラメータです
ARC Prizeが公開したDeepSeek V4 Flash 0731の結果ページには、スコアがひとつではなく推論強度別に三つ載っています。この記事はその三つの数字から実際に読み取れることを計算します。同じ強度の引き上げが、易しいベンチマークでは5ポイントを、難しいベンチマークでは15ポイントを買ってくれるという事実と、ならば強度はモデル設定ではなくリクエストごとに決める値として扱うべきだという結論です。はしごを上る構造と、その構造が
2026-08-09 · 15 分で読めます #llm#benchmark#arc-agi#inference#cost100倍安いという主張は課題を狭めたときにだけ真です — 検証と損益分岐
2026年8月に公開されたある事例記事は、40億パラメータ級のオープンモデルを強化学習で後学習し、検索課題でフロンティアモデルと肩を並べながらリクエストあたりのコストを桁単位で下げたと述べます。この記事はその主張を紹介するのではなく検証します。原文で実際に確認できる数字と確認できない数字を区別し、狭い課題でだけ成立する条件が何かを整理し、後学習がルーティングより有利になる損益分岐を自分で計算できるコードを付けました。
2026-08-09 · 14 分で読めます #llm#cost#fine-tuning#retrieval#open-modelsログを検索可能に、そして破産しないように — 構造化、マッピング爆発、保持、そして本当のコスト
ログのコストがコンピュートのコストを上回る瞬間は、たいていの組織に訪れます。その瞬間を遅らせるのは圧縮率ではなく、何をフィールドにするかという判断です。構造化ログのフィールド設計から、OpenSearchのマッピング爆発が実際にクラスタを殺す経路、インデックステンプレートとISMでライフサイクルを制御する方法、原則のあるサンプリングと保持階層までを扱います。最後にログでメトリクスを真似したときにかかるコストを数字で計算します。OpenS
2026-08-02 · 23 分で読めます #observability#logging#opensearch#elasticsearch#cost観測データをClickHouseに入れるということ — スキーマ、ロールアップ、TTL、そして役割分担
トレースとログが一日数TB規模に膨らむと、検索エンジンや時系列DBひとつでは持ちこたえられなくなります。ClickHouseが観測データに合っている理由をカラム指向ストレージと圧縮、ソートキーの観点から整理し、トレースとログのテーブルを実際のDDLで設計します。属性をMapで持つかJSON型で持つかの判断基準、マテリアライズドビューでロールアップを作る方法、パーティショニングとTTLでコストを制御する方法を扱います。最後に、Promet
2026-08-02 · 25 分で読めます #observability#clickhouse#opentelemetry#data-modeling#cost