タグ: #cuda
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 24 件
カーネルを書く三つの層 — CUDA C++、Triton、CUTLASSを同じ問題で比較する
同じGPUカーネルを、手で書くCUDA C++、Pythonでタイル単位に書くTriton、テンプレートで組み立てるCUTLASSとCuTeでそれぞれ書いたとき、何が変わるのかを比較します。行単位のsoftmaxをCUDA C++とTritonで実際に書いてコード量と性能を並べて測り、その差がどこから来るのかをコンパイルパイプラインのレベルで説明します。Tritonがカスタムアテンションカーネルの事実上の標準になった理由とあわせて、Tr
2026-08-02 · 28 分で読めます #triton#cuda#cutlass#gpu-kernel#compilerAMD と NVIDIA、何が違うのか — ハードウェアよりスタックが問題である理由
AMD GPU と NVIDIA GPU の違いを、ハードウェア構造・ソフトウェアスタック・移植経路・エコシステムの成熟度という 4 つの層に分けて、感情抜きに整理します。SM と CU、Tensor Core と Matrix Core の対応関係から、ワープ 32 とウェーブフロント 64 が実際のコードにどんなバグを生むのかまで具体的に扱います。HIPIFY が自動で移植してくれる部分と必ず手で直すべき部分を切り分け、cuBLAS
2026-08-02 · 27 分で読めます #amd#rocm#hip#nvidia#cudaGPUカーネルを自分の手で直すということ — 転置カーネルを5倍速くするまで
GPUカーネルを直接修正するとは実際どういうことか、スレッド・ワープ・メモリ階層から押さえます。占有率がなぜ目標ではなく症状なのか、そしてほとんどのカーネルが演算ではなくメモリ帯域幅に律速されているという事実をルーフラインの観点から説明します。行列転置カーネルひとつをnaiveからコアレッシング、シェアードメモリタイリング、バンクコンフリクト除去まで四段階で直しながら、各段階の有効帯域幅を実際に測るハーネスも提供します。最後にNsigh
2026-08-02 · 31 分で読めます #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performanceRust 1.97 が Volta 以前の GPU を切り捨てた — nvptx64 ベースライン引き上げの内幕
Rust 1.97(2026年7月9日)は、nvptx64-nvidia-cuda ターゲットの最小要件を PTX ISA 7.0(CUDA 11 ドライバー以上)と SM 7.0(Volta 以上)に引き上げました。Maxwell・Pascal 世代の GPU と CUDA 10 以下のドライバーは、もはや対象外です。本稿では、実際に変わった数字、コンパイラチームが根拠として挙げた三つの具体的な欠陥(デバッグシンボル・アトミック順序・
2026-07-16 · 21 分で読めます #rust#cuda#gpu#compiler#nvidia拡散 LLM が CUDA カーネルを書く — DICE と、なぜ並列生成が効きうるのか
DICE は 2026 年 2 月のプリプリントで、拡散(diffusion)大規模言語モデルが CUDA カーネル生成において同規模の自己回帰(autoregressive)モデルを上回り、新たな最高性能(SOTA)を打ち立てたと主張します。核心は、トークンを左から右へ一つずつ書く代わりに、系列全体を並列に生成し、どの位置でも非逐次的に書き直せることです。大域構造が重要なコードという課題に合いそうな性質です。著者らは CuKe という
2026-07-11 · 12 分で読めます #ai#llm#diffusion#cuda#gpuCUDA アーキテクチャを図解する — スレッドからテンソルコアまで
CUDA の実行モデルと GPU ハードウェア構造を図で一望できるようにまとめます。グリッド・ブロック・ワープ・スレッドの階層、SM の内部構造、メモリ階層、ワープスケジューリングと占有率、テンソルコア、ストリームまで、図とカーネル例で解説します。
2026-06-27 · 27 分で読めます #cuda#gpu#tensor-core#warp#memory-hierarchyGPU vs TPU vs ASIC — 2026年の推論戦争
2026年の推論ワークロードをめぐるGPU・TPU・ASICの競争を比較します。Google TPU v6 TrilliumとIronwood、急成長するクラウド自社推論ASIC、スループット・遅延・コスト・電力のトレードオフ、そしてCUDAとXLAに分かれるコンパイラスタックまで扱います。
2026-06-16 · 42 分で読めます #gpu#tpu#asic#inference#ai-hardware分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayCUDA GPUプログラミングモデル Deep Dive — SIMT、メモリ階層、Tensor Core、カーネル最適化完全ガイド (2025)
ChatGPT、Stable Diffusion、Soraを動かすエンジン、NVIDIA GPUとCUDA。本稿ではCUDAプログラミングモデルをゼロから解剖する。GPUハードウェアアーキテクチャ (SM、Warp、CUDA Core)、SIMT vs SIMD、スレッド階層 (Grid/Block/Thread)、メモリ階層 (Global/Shared/Constant/Register)、なぜMemory Coalescingが最
2026-04-15 · 21 分で読めます #cuda#gpu#nvidia#ai#machine-learning半導体徹底解説 -- CPU、GPU、RAM、ASIC、CUDAアーキテクチャ完全ガイド
CPUはどのように命令を実行し、RAMはどのようにデータを保存し、GPU/CUDAはなぜAIに不可欠なのか?半導体の原理からASICカスタムチップまで深く掘り下げます。
2026-04-10 · 18 分で読めます #ai#semiconductor#cpu#gpu#cudaLG U+ GPU Software Engineer完全合格ガイド:CUDA・vGPU・InfiniBandからK8s GPUスケジューリングまで
LG U+ GPU技術TFのGPU Software Engineer JDを完全分析。GPU演算構造、メモリ階層、vGPU/MIG仮想化、InfiniBand/RDMA、KubeVirt、Triton Inference Server、分散学習最適化まで — 面接予想質問30選と8ヶ月学習ロードマップ。
2026-03-23 · 66 分で読めます #gpu#cuda#system-software#virtualization#vgpuNVIDIA GPUとCUDAの完全解剖:なぜGPUがAIを支配するのか
H100のハードウェア仕様からTensor Core WMMA APIまで。SIMTの実行モデル、共有メモリタイリング、Warp Divergenceを実際のCUDAコードとともに完全解剖する。
2026-03-18 · 20 分で読めます #cuda#gpu#nvidia#行列演算#並列コンピューティングCUDAプログラミング完全ガイド: GPU並列コンピューティング入門から応用まで
CUDAプログラミングの完全ガイド。GPUアーキテクチャ、カーネル記述、メモリ最適化、混合精度トレーニング、cuDNN/cuBLASの使い方を実践例とともに解説。
2026-03-17 · 36 分で読めます #cuda#gpu#gpu-cuda#parallel-computing#nvidiaCUDA GPU プログラミング上級編: Warp最適化、Tensor Core、Tritonカーネル作成まで
CUDAメモリ階層、Warp最適化、Tensor Core WMMA API、Flash Attention実装、Tritonカスタムカーネル作成まで、AIモデル学習高速化のためのGPUプログラミング上級ガイドです。
2026-03-17 · 23 分で読めます #cuda#GPUプログラミング#tensorcore#triton#flash-attentionAI向けGPUハードウェア完全ガイド: アーキテクチャから選定基準まで
AI研究とトレーニングのためのGPUハードウェア完全ガイド。NVIDIA GPUアーキテクチャ(Hopper、Blackwell)、テンソルコア、NVLink、HBMメモリ、A100/H100/H200/B200の比較、クラウドGPUオプションを詳しく解説。
2026-03-17 · 32 分で読めます #gpu#hardware#nvidia#cuda#gpu-cudaAI向けGPUハードウェア完全ガイド:アーキテクチャから選定基準まで
AI研究と学習のためのGPUハードウェアを網羅したガイドです。NVIDIAのGPUアーキテクチャ(Hopper、Blackwell)、Tensor Core、NVLink、HBMメモリ、A100/H100/H200/B200の比較、クラウドGPUオプションを詳しく解説します。
2026-03-17 · 32 分で読めます #gpu#hardware#nvidia#cuda#gpu-cudaディープラーニング向け Linux GPU サーバー完全構築ガイド
NVIDIA 公式ドキュメントに基づき、ディープラーニング開発のための Linux GPU サーバーを NVIDIA ドライバーから Docker GPU 環境まで段階的に構築するガイドをまとめる。
2026-03-01 · 27 分で読めます #linux#gpu#cuda#nvidia-driver#deep-learningNVIDIA GPU Operator完全ガイド:コンポーネント、インストール、KubeVirt GPUパススルーまで総まとめ
NVIDIA GPU Operatorのアーキテクチャと7大コアコンポーネント(Driver、Container Toolkit、Device Plugin、DCGM、MIG Manager、Node Feature Discovery、GFD)の役割を詳細に分析し、Helmベースのインストール、KubeVirtとのGPU/vGPUパススルー統合、MIGパーティショニング、モニタリング、トラブルシューティングまで実践ガイドを総まとめする
2026-03-01 · 12 分で読めます #gpu-operator#nvidia#kubernetes#kubevirt#gpuマルチGPU分散学習完全ガイド: DDP、FSDP、DeepSpeed
PyTorch公式ドキュメントに基づき、DDP、FSDP、DeepSpeed ZeROなどマルチGPU分散学習のコアコンポーネントを体系的に分析し、実践的なセットアップ手順を解説します。
2026-03-01 · 33 分で読めます #gpu#cuda#distributed-training#deep-learning#pytorchSlurm 完全攻略:HPC/AI クラスター ワークロードマネージャー実践ガイド
Slurm ワークロードマネージャーを完全攻略する。アーキテクチャ(slurmctld/slurmd/slurmdbd)、中核概念(パーティション/QoS/Fairshare)、必須コマンド(sbatch/srun/salloc)、GPU スケジューリング(GRES/MIG/MPS)、マルチノード分散学習(PyTorch DDP/DeepSpeed/Horovod)、コンテナ統合(Singularity/Enroot+Pyxis)、設定
2026-03-01 · 18 分で読めます #slurm#hpc#gpu#distributed-training#cluster