タグ: #latency
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
Cerebras Ultrafastとエージェントループのボトルネック — 毎秒750トークンでも減らない時間
CerebrasとOpenAIが毎秒最大750トークンを出す推論ティアを公開しました。発表文が挙げる原理は演算量ではなくデータ移動であり、重みをウェハ上のSRAMに置く方式です。なぜバッチ1のデコードがメモリ帯域に縛られるのか、公開された倍率が何を測り何を測っていないのか、そしてトークン生成が速くなっても減らない時間が自分のエージェントループで何パーセントかを計算する方法を整理します。
2026-08-14 · 13 分で読めます #llm#inference#hardware#latency#performance平均は何も語らない — レイテンシを分布でデバッグする方法
2026年7月27日に公開されHacker Newsのトップに立ったFarid Zakariaの記事「The mean means nothing」は、キャッシュ層をロールアウトした後、平均レイテンシが112msから122msへ9%悪化した事例を扱います。同じデータでp50は99msから54msへ46%改善し、p99は309msから678msへ119%悪化しました。一つのデータが正反対の結論を同時に支持する理由は、分布が単峰から二峰に分
2026-07-31 · 25 分で読めます #observability#latency#performance#histogram#percentile推論を速く — Speculative Decodingとスループット最適化
LLMのdecodeが遅い根本的な理由から、speculative decodingで速度を引き上げる原理、MedusaやEAGLEのような変種、chunked prefillとprefill/decodeの分離、遅延とスループットのトレードオフ、そしてTTFTやTPOTのような測定指標まで、推論高速化の核心を整理します。
2026-06-26 · 23 分で読めます #speculative-decoding#throughput#inference#mlops#latencyプロンプトキャッシング実践ガイド: エージェントアプリのコストとレイテンシーを同時に下げる
エージェントアプリでプロンプトキャッシングが重要な理由、OpenAIとAnthropicの違い、プロンプト構成パターン、ROIの見方、よくある失敗、移行チェックリストを実務向けに整理します。
2026-04-12 · 13 分で読めます #prompt-caching#latency#cost-optimization#ai-agent#llmopsSpeculative DecodingでLLM推論を2〜3倍高速化:原理から実践実装まで
Speculative Decodingの数学的原理、Draft-Verifyパイプライン、受容確率分析、vLLM/TensorRT-LLMでの実践的な適用方法、そしてAppleのMirror Speculative Decodingまでを深層分析する。
2026-03-02 · 11 分で読めます #llm#speculative-decoding#inference#optimization#vllm