タグ: #llm-inference
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
vLLMメトリクス — 何をダッシュボードに載せ何でアラートを張るか
vLLMが公開する時系列は、GPUメトリクスが答えられない問いに答えます。今いくつ実行中でいくつ待機中か、KVキャッシュがどれだけ埋まっているか、最初のトークンまで何秒かかるか、といったことです。本記事ではvLLM公式ドキュメントとリポジトリのメトリクスロガーのソースを直接読み、スケジューラ状態のゲージ、キャッシュ系カウンタ、遅延ヒストグラムの正確な名前と意味を整理し、カウンタ名の接尾辞の違いのようにバージョン間で人をつまずかせる箇所を
2026-08-12 · 12 分で読めます #gpu#kubernetes#vllm#prometheus#observabilityvLLMを速くする — 設定、内部構造、そしてコードに手を入れるべき場所
vLLMの性能を上げる作業を、コードを触らずにできることから順に整理します。バッチ関連の引数とプレフィックスキャッシュ、チャンクドプリフィル、量子化の選択をまず扱い、そのあとPagedAttentionと連続バッチングスケジューラが内部で何を決めているのかを、実際のソースを根拠に説明します。実際にコードを触る価値のある三箇所、カスタムロジットプロセッサ、カスタムアテンションバックエンド、スケジューラポリシーとその代償も押さえます。何を固
2026-08-02 · 33 分で読めます #vllm#llm-inference#paged-attention#benchmark#schedulerllama.cppがブラウザに来た — WebGPUバックエンドが16台の実機で測った天井
UC Santa Cruzのチームが2026年5月に公開したLlamaWebは、llama.cppのWebGPUバックエンドであり、8ベンダーの実機16台でブラウザLLM推論を実測した、これまでで最も広いデータセットを残しました。結果は両面的です。既存のブラウザフレームワーク(WebLLM、Transformers.js)よりメモリを29〜33%少なく使い、デコードのスループットは45〜69%高い一方で、prefillはWebLLMの4
2026-07-16 · 29 分で読めます #webgpu#llm-inference#llama-cpp#on-device-ai#browserAI 推論エンジン 2026 完全ガイド - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 徹底解剖
2026 年の LLM エンジニアリングはもうモデル選定の問題ではなく、エンジン選定の問題になった。vLLM V1、SGLang 0.4、TensorRT-LLM、TGI 3.x、llama.cpp、MLX-LM、mistral.rs、DeepSpeed-MII、Aphrodite、CTranslate2、ExLlamaV3、OpenVINO、AWS Neuron、Triton — 10 以上のエンジンを PagedAttention・
2026-05-16 · 26 分で読めます #llm-inference#vllm#sglang#llama-cpp#tgiLLM推論最適化完全ガイド2025:vLLM、TensorRT-LLM、KV Cache、Speculative Decoding
LLM推論最適化のすべて!vLLM(PagedAttention)、TensorRT-LLM(FP8/INT4)、KV Cache管理、Speculative Decoding、Continuous Batching、FlashAttention、量子化(GPTQ/AWQ/GGUF)、モデルサービング(Triton/vLLM/TGI)、GPUメモリ最適化、コスト分析。
2026-04-14 · 31 分で読めます #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingvLLMを超えた新たな王座:SGLangがLLM推論の勢力図を変える5つの理由
SGLangのRadixAttentionベースKVキャッシュ管理、29%スループット優位のハイパースペシャライズド設計、4000行Python Zero-Overheadスケジューラ、Prefill-Decode Disaggregation、Compressed FSMベース構造化生成まで――vLLMを超えて次世代LLM推論標準として浮上したSGLangの5つの革新を深層分析する。
2026-03-01 · 48 分で読めます #sglang#llm-inference#vllm#radix-attention#model-serving