タグ: #triton
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 12 件
カーネルを書く三つの層 — CUDA C++、Triton、CUTLASSを同じ問題で比較する
同じGPUカーネルを、手で書くCUDA C++、Pythonでタイル単位に書くTriton、テンプレートで組み立てるCUTLASSとCuTeでそれぞれ書いたとき、何が変わるのかを比較します。行単位のsoftmaxをCUDA C++とTritonで実際に書いてコード量と性能を並べて測り、その差がどこから来るのかをコンパイルパイプラインのレベルで説明します。Tritonがカスタムアテンションカーネルの事実上の標準になった理由とあわせて、Tr
2026-08-02 · 28 分で読めます #triton#cuda#cutlass#gpu-kernel#compilerGPUコンパイラとフレームワークの地形図 — グラフからカーネルを作るという一つの問題、層ごとに違う答え
NVCCとPTXからLLVM、MLIR、Triton、torch.compile、XLA、IREE、TVMまでを一枚の地図に載せました。名前も所属も違いますが、これらはすべて同じ問題を解いています。演算グラフを受け取り、実行可能なカーネルを作るという仕事です。各層がその問題のどの部分を切り取ったのか、なぜ層がこれほど増えたのか、そしてエンジニアがどんな状況でどの層まで降りるべきかを整理しました。2026年8月2日に確認したバージョンと公
2026-08-02 · 38 分で読めます #gpu#compiler#mlir#triton#pytorchTriton Gluon — コンパイラが隠していたレイアウトを手で書く言語
Gluonは、Tritonと同じコンパイラスタックの上に載る下位レベルGPU言語で、Tritonが隠していたレイアウト・共有メモリ・ワープ特殊化をカーネル作成者にそのまま渡します。存在理由は明快です — Tritonコンパイラがうまくコードを出せない場面に出会ったとき、今まで打つ手がなかったからです。本稿ではGluonが何を露出するか、BlockedLayoutが実際に何を意味するか、そして上流のチュートリアルがGB200で記録した測定
2026-07-16 · 32 分で読めます #gpu#triton#kernel#compiler#performanceリバースエンジニアリングツール 2026 — Ghidra / IDA Pro / Binary Ninja / radare2 / Frida / x64dbg / angr 徹底解説
2026年のリバースエンジニアリングツール地図を、ディスアセンブラ(Ghidra / IDA Pro / Binary Ninja / radare2+Cutter / Hopper)、デバッガ(x64dbg / OllyDbg / WinDbg / Pwndbg / GEF)、動的計装(Frida / Cheat Engine / Wireshark)、シンボリック実行(angr / Triton / KLEE)、そしてエンジン層(C
2026-05-16 · 32 分で読めます #reverse-engineering#ghidra#ida-pro#binary-ninja#radare2MLOps 完全ガイド — Model Serving・Feature Store・Drift・A/B Test・GPU Economics (Season 2 Ep 7, 2025)
モデルを学習することと本番で運用することは全く別のゲームである。Serving (TorchServe・Triton・vLLM・TGI)、Feature Store (Feast・Tecton)、Training Infra (Ray・Determined)、Experiment Tracking (MLflow・W&B)、Data/Concept Drift 検知、Model A/B Test と Shadow Deployment、
2026-04-15 · 15 分で読めます #mlops#model-serving#feature-store#drift-detection#ab-testingトスバンク ML Engineer(MLOps)完全合格ガイド:MLFlowからLLMプラットフォームまで技術スタック総整理
トスバンク ML Platform TeamのMLOps Engineer JDを完全分析。MLFlow、Airflow、JupyterHub、Kubeflow、Triton Inference Server、ScyllaDB Feature Store、LLMプラットフォームまで — 面接予想質問30選と8ヶ月学習ロードマップ。
2026-03-21 · 56 分で読めます #mlops#ml-platform#tossbank#kubernetes#mlflowAIモデルのデプロイとサービング完全ガイド:Triton、vLLM、BentoML、Kubernetes
Docker GPUコンテナ、Kubernetes HPA、NVIDIA Triton、vLLM LLMサービング、BentoML、Ray Serveを活用したAIモデルの本番スケールデプロイを網羅した実践ガイドです。
2026-03-17 · 15 分で読めます #modelserving#triton#vllm#bentoml#kubernetesAIモデルサービングと推論最適化完全ガイド: vLLM、TensorRT、Triton、Ollama
本番環境でAIモデルを効率的にサービングするための完全ガイド。vLLM、TensorRT、NVIDIA Triton推論サーバー、Ollama、量子化(INT8/INT4)、バッチ処理、レイテンシ最適化を実例とともに完全習得。
2026-03-17 · 22 分で読めます #mlops#model-serving#vllm#tensorrt#tritonCUDA GPU プログラミング上級編: Warp最適化、Tensor Core、Tritonカーネル作成まで
CUDAメモリ階層、Warp最適化、Tensor Core WMMA API、Flash Attention実装、Tritonカスタムカーネル作成まで、AIモデル学習高速化のためのGPUプログラミング上級ガイドです。
2026-03-17 · 23 分で読めます #cuda#GPUプログラミング#tensorcore#triton#flash-attentionPyTorch 内部構造 & 高度な最適化: autograd、torch.compile、FSDP、Tritonまで
PyTorch autograd エンジン、torch.compile() と TorchInductor 最適化、FSDP 分散学習、gradient checkpointing、カスタム CUDA 演算まで、PyTorch 完全攻略ガイドです。
2026-03-17 · 14 分で読めます #pytorch#torch-compile#fsdp#triton#混合精度NVIDIA Triton Inference Server プロダクションガイド:GPUモデルサービング最適化戦略
NVIDIA Triton Inference Serverを活用したGPUモデルサービング最適化ガイド。Dynamic Batching、Model Ensemble、TensorRT統合、マルチモデルサービング、Kubernetesデプロイ、パフォーマンスプロファイリングとプロダクショントラブルシューティングまで解説します。
2026-03-08 · 44 分で読めます #ai-platform#triton#inference-server#gpu#model-servingKubernetes ML モデルサービング:KServe と NVIDIA Triton 完全分析
KServe と NVIDIA Triton の公式ドキュメントに基づき、Kubernetes 環境における ML モデルサービングアーキテクチャを体系的に分析する。
2026-03-01 · 29 分で読めます #mlops#kubernetes#model-serving#kserve#triton