タグ: #pytorch
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 23 件
みんなのためのAI 第6回 — 111万パラメータの拡散モデルで単語から数字を描く
"zero" と書けば0を描く条件付き拡散モデルを111万パラメータで作りました。ノイズを混ぜる forward は数式1行、復元する reverse はその1行を400回逆にたどるだけです。第5回で L1 損失が色を褪せさせた問題を拡散がどう回避するのか、そしてなぜモデルがノイズを予測するよう学習されるのかを、実際の生成結果で確認します。
2026-08-24 · 15 分で読めます #ai#diffusion#ddpm#generative#pytorchみんなのためのAI 第5回 — 47万パラメータの U-Net で白黒写真に色をつける、そしてなぜ色が褪せたのか
シリーズ最小の47万パラメータ U-Net で CIFAR-10 の白黒画像をカラーに復元しました。形は正確に保たれましたが色が目に見えて褪せています。これはモデルの容量の問題ではなく L1 損失を選んだ結果です。skip connection が何を運ぶのか、そして回帰損失がなぜ彩度を殺すのかを実際の結果画像で確認します。
2026-08-23 · 14 分で読めます #ai#computer-vision#unet#colorization#pytorchみんなのためのAI 第4回 — 137万パラメータで画像に文をつける、そして第3回のバグがここになかった理由
CNN エンコーダとトランスフォーマーデコーダをつないで、Fashion-MNIST の画像にキャプションをつけるモデルを作りました。137万パラメータ、10分の学習でラベル的中率91%です。エンコーダ・デコーダ構造で cross-attention が何をするのか、そして第3回で正解率を7.5%に落とした EOS バグがなぜこのコードになかったのかを、2つの関数を並べて確認します。
2026-08-22 · 12 分で読めます #ai#captioning#multimodal#transformer#pytorchみんなのためのAI 第3回 — 損失0.0017なのに正解率7.5%、犯人はパディング1マスだった
画像と質問を一緒に受け取って答える VQA モデルを148万パラメータで作りました。学習損失は0.0017まで落ちたのに正解率は7.5%。ランダムより悪い数値です。原因はモデルではなく正解を作るコード1行で、直したら99.5%になりました。なぜ低い損失が良いモデルを保証しないのか、その罠をどう見抜くのかを実際の出力で確認します。
2026-08-21 · 14 分で読めます #ai#vqa#multimodal#debugging#pytorchみんなのためのAI 第1回 — 1600万パラメータの言語モデルを15分でゼロから学習させる
GPU 1枚で言語モデルをゼロから学習させます。TinyStories データセットと1600万パラメータのデコーダ専用トランスフォーマーで、15分で読める英語の童話を生成しました。因果マスクがなぜ必要か、重み共有が何を節約するのか、perplexity 8 が実際にどんな文章を意味するのかを、実際の学習ログと生成結果で確認します。RTX 3090 実測。
2026-08-19 · 15 分で読めます #ai#llm#transformer#pytorch#hands-on2026年のLLM学習スタック地図 — 各層が何を代わりにやってくれて、何を隠すか
LLM学習フレームワークを三つの層に分けて系譜を整理しました。下の層はPyTorch分散、DeepSpeed、Megatron-Coreのような実行エンジンで、真ん中はtorchtitanやMegatron-Bridgeのような学習ループ、上の層はTRLやAxolotlのように設定ファイルでファインチューニングを回してくれる道具です。各層が何を代わりにやってくれて、代わりに何を隠すのか、そして上位フレームワークがむしろ邪魔になる地点はど
2026-08-02 · 21 分で読めます #mlops#llm-training#pytorch#trl#frameworkGPUコンパイラとフレームワークの地形図 — グラフからカーネルを作るという一つの問題、層ごとに違う答え
NVCCとPTXからLLVM、MLIR、Triton、torch.compile、XLA、IREE、TVMまでを一枚の地図に載せました。名前も所属も違いますが、これらはすべて同じ問題を解いています。演算グラフを受け取り、実行可能なカーネルを作るという仕事です。各層がその問題のどの部分を切り取ったのか、なぜ層がこれほど増えたのか、そしてエンジニアがどんな状況でどの層まで降りるべきかを整理しました。2026年8月2日に確認したバージョンと公
2026-08-02 · 38 分で読めます #gpu#compiler#mlir#triton#pytorchPyTorch 2.13のtorchcomms — c10dを置き換えにきた新しい分散通信バックエンド
2026年7月8日にリリースされたPyTorch 2.13のハイライトのうち、最も構造的な変化はtorchcomms — PyTorch Distributedの新しい通信バックエンドが、コアのCIとDeviceMeshの経路に統合され始めたことです。torchcommsは2025年10月にMetaが発表した実験的な通信APIで、グローバル状態ベースのc10d ProcessGroupの技術的負債(NCCL中心の設計、lazy init
2026-07-17 · 18 分で読めます #pytorch#distributed-training#nccl#deep-learningRTX 5090 一枚で小さなモデルたちを直接動かしてみる — microGPT・OCR・音楽生成
RTX 5090(Blackwell、32GB)一枚に SSH で接続し、小さなモデル三つを直接動かしてみました。char-level GPT をゼロから 28 秒で学習させ(10.75M パラメータ、117 万 tokens/s)、専用 OCR(TrOCR)と小型 VLM(Qwen2-VL-2B)を同じ画像に当てて CER で対決させ、MusicGen で 8 秒の音楽を 1.9 秒(実時間の 4.2 倍)で生成しました。その過程で出
2026-07-11 · 12 分で読めます #pytorch#gpu#llm#ocr#hands-onVision モデル開発・fine-tuning 完全ガイド 2026 — CNN、ViT、DETR、SAM 2、VLM の実戦 decision tree
2026 年の vision モデル開発はもう ResNet を 1 行で持ってきて学習する時代ではない。CNN、ViT、DETR、SAM 2、そして LLaVA・Qwen-VL・Gemini Vision・Claude Vision のような VLM まで — 同じ写真 1 枚に対しても、どのモデルを使うかで cost が 100 倍、accuracy が 30 pp 変わる。この記事は classification・detectio
2026-05-14 · 26 分で読めます #computer-vision#vision-model#cnn#vit#detr[深層強化学習] 03. PyTorchディープラーニング基礎:テンソルからニューラルネットワークまで
PyTorchのテンソル演算、自動微分、ニューラルネットワーク構成要素を学習し、TensorBoardモニタリングとAtari画像を活用したGAN例題を実装します。
2026-03-19 · 27 分で読めます #reinforcement-learning#deep-learning#ai#pytorchスクラッチからLLMを構築する: コードでGPTを理解する完全ガイド
ゼロから大規模言語モデル(LLM)を構築・理解するための完全ガイド。トークナイザーからTransformer、事前学習、ファインチューニングまで、PyTorchで完全なGPTアーキテクチャを実装します。
2026-03-17 · 24 分で読めます #llm#gpt#transformer#from-scratch#deep-learningTorch-Titan完全ガイド:PyTorchによる大規模分散学習のすべて
PyTorch Titan(torchtitan)を使った大規模LLM分散学習の完全ガイド。FSDP2、パイプライン並列、テンソル並列、4D並列、Flash Attention、混合精度を実践的な例とともに解説します。
2026-03-17 · 25 分で読めます #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 内部構造 & 高度な最適化: autograd、torch.compile、FSDP、Tritonまで
PyTorch autograd エンジン、torch.compile() と TorchInductor 最適化、FSDP 分散学習、gradient checkpointing、カスタム CUDA 演算まで、PyTorch 完全攻略ガイドです。
2026-03-17 · 14 分で読めます #pytorch#torch-compile#fsdp#triton#混合精度PyTorch高度なテクニック完全ガイド: torch.compile、カスタムOps、メモリ最適化
PyTorchの高度なテクニックを完全解説。torch.compile、カスタムオペレータ、メモリ最適化、Gradient Checkpointing、torch.vmap、functorch、PyTorch Profilerを実践例とともに網羅。
2026-03-17 · 21 分で読めます #pytorch#advanced#torch-compile#memory-optimization#custom-operatorsDeepSpeed完全ガイド:ZeRO最適化と大規模モデル訓練
Microsoft DeepSpeedを完全マスターするための包括的ガイド。ZeRO-1/2/3最適化、Offload、パイプライン並列、混合精度、MoE、DeepSpeed Inferenceを実践的な設定とコード例と共に学ぶ。
2026-03-17 · 20 分で読めます #deepspeed#zero-optimization#distributed-training#llm#pytorchPyTorch完全ガイド: ゼロからヒーローへ — テンソルから分散学習まで
PyTorchの基礎から応用まで完全網羅するガイド。テンソル操作、自動微分、CNN/RNN/Transformerの実装、分散学習まで実践的なコード例と共にステップバイステップで解説。
2026-03-17 · 25 分で読めます #pytorch#deep-learning#ai#python#neural-networkディープラーニングデバッグ完全ガイド:学習失敗の診断から性能最適化まで
ディープラーニング学習失敗を体系的に診断・解決する完全ガイド。Loss NaN、勾配消失・爆発、過学習、収束遅延、メモリ不足エラーを実践コード例とともに解説。
2026-03-17 · 25 分で読めます #deep-learning#debugging#pytorch#training#optimizationtorchaudio完全ガイド — オーディオ処理から音声認識、TTS、音楽分析まで
torchaudioでオーディオ読み込み、スペクトログラム変換、Melフィルタバンク、MFCC、音声認識(Wav2Vec2/Whisper)、TTS、話者分離、ノイズ除去まで。オーディオAIのすべてをPyTorchで扱います。
2026-03-02 · 11 分で読めます #ai-platform#pytorch#torchaudio#audio#speech-recognitiontorchvision完全ガイド — 画像分類からObject Detection、Segmentationまで
torchvisionのtransforms v2、事前学習済みモデル(ResNet〜ViT)、データセット、Object Detection(Faster R-CNN, YOLO)、Segmentation、そして実践的なファインチューニングまで。コンピュータビジョンの実務をPyTorchで攻略します。
2026-03-02 · 10 分で読めます #ai-platform#pytorch#torchvision#computer-vision#cnn