タグ: #deep-learning
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 73 件
PyTorch 2.13のtorchcomms — c10dを置き換えにきた新しい分散通信バックエンド
2026年7月8日にリリースされたPyTorch 2.13のハイライトのうち、最も構造的な変化はtorchcomms — PyTorch Distributedの新しい通信バックエンドが、コアのCIとDeviceMeshの経路に統合され始めたことです。torchcommsは2025年10月にMetaが発表した実験的な通信APIで、グローバル状態ベースのc10d ProcessGroupの技術的負債(NCCL中心の設計、lazy init
2026-07-17 · 18 分で読めます #pytorch#distributed-training#nccl#deep-learningマルチモーダルAIの学習法 — 複数の感覚を一つのモデルへ
画像・テキスト・音声・動画を一つのモデルで扱うマルチモーダルAIの学習原理を整理します。モダリティの整列と対照学習、融合方式、共有埋め込み空間、事前学習と微調整、データと評価、そしてハルシネーションなどの限界まで、学習パイプラインをコードとともに見ていきます。
2026-06-26 · 30 分で読めます #ai-papers#multimodal#clip#vision-language#contrastive-learningLLMをゼロから作ってみる — スタンフォードCS336流の学習ロードマップ
スタンフォードのCS336(Language Modeling from Scratch)がHacker Newsの上位に登場し続け、ゼロからのLLM構築が再び話題になっています。トークナイザーからアテンション、分散学習、スケーリング則、アライメント、推論最適化までカリキュラム全体を解剖し、20週間の学習プランとミニプロジェクトのアイデアをまとめました。
2026-06-12 · 24 分で読めます #llm#transformer#cs336#deep-learning#tokenizerDiffusion Models Deep Dive — DDPM、Latent Diffusion、Classifier-Free Guidance、DDIM、Stable Diffusion 完全攻略 (2025)
Stable Diffusion、DALL-E、Midjourney、Soraの基盤となるdiffusion model。本記事ではDiffusion Modelをゼロから解剖します。Forward/Reverse diffusion process、DDPMとvariational lower bound、Score-basedの視点、DDIMによる加速sampling、U-Netアーキテクチャとcross-attention、Lat
2026-04-15 · 36 分で読めます #diffusion#generative-ai#stable-diffusion#ddpm#machine-learning[深層強化学習] 20. 深層強化学習総まとめ:アルゴリズム比較と選択ガイド
価値ベース、方策ベース、Actor-Critic、モデルベースなど深層強化学習アルゴリズムの体系的比較と選択基準
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 18. AlphaGo Zero:自己対局で学ぶAI
AlphaGo Zeroの核心原理:MCTSと自己対局(self-play)、そしてConnect4ボットの実装
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 17. モデルベース強化学習:Imagination-Augmented Agent
モデルベースRLの原理とI2A(Imagination-Augmented Agent):環境モデルを学習し想像の中で計画するエージェント
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 15. Trust Region手法:TRPO、PPO、ACKTR
方策更新の安定性を保証するTrust Region技法:PPOのクリッピング目的関数、TRPOの制約最適化、ACKTR
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 14. 連続行動空間:DDPGと分布方策
連続行動空間を扱う方法:A2Cの拡張、DDPGの決定的方策勾配、分布方策勾配
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 12. 強化学習でチャットボットを訓練する
Seq2Seqモデルと強化学習を組み合わせたチャットボット訓練:RNNの基礎からSelf-Critical Sequence Training(SCST)まで
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai#nlp[深層強化学習] 11. A3C: 非同期Advantage Actor-Critic
A2Cの相関問題を非同期並列学習で解決するA3Cアルゴリズムの原理とデータ/勾配並列化の実装
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 09. Policy Gradient:方策ベースの強化学習
価値ベースの方法と方策ベースの方法の違いを理解し、Policy Gradientの数学的導出過程とREINFORCEアルゴリズムをCartPoleとPongに適用します。
2026-03-19 · 9 分で読めます #reinforcement-learning#deep-learning#ai#policy-gradient[深層強化学習] 08. 強化学習で株式トレーディングを作る
株式トレーディングを強化学習問題として定義し、カスタム取引環境を設計した後、フィードフォワードおよびCNNモデルでトレーディングエージェントを学習させます。
2026-03-19 · 29 分で読めます #reinforcement-learning#deep-learning#ai#finance[深層強化学習] 06. Deep Q-Network:DQNの原理と実装
テーブルベースQ学習の限界を克服するDQNの核心アイデア(経験リプレイ、ターゲットネットワーク)を理解し、Pong環境で実装します。
2026-03-19 · 12 分で読めます #reinforcement-learning#deep-learning#ai#dqn[深層強化学習] 03. PyTorchディープラーニング基礎:テンソルからニューラルネットワークまで
PyTorchのテンソル演算、自動微分、ニューラルネットワーク構成要素を学習し、TensorBoardモニタリングとAtari画像を活用したGAN例題を実装します。
2026-03-19 · 27 分で読めます #reinforcement-learning#deep-learning#ai#pytorch[深層強化学習] 05. ベルマン方程式と価値反復
状態価値と行動価値の概念を理解し、ベルマン最適方程式に基づく価値反復法とQ学習をFrozenLakeに適用します。
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 02. OpenAI Gymで始める強化学習
OpenAI Gymの構造とAPIを理解し、CartPole環境でランダムエージェントとラッパーを活用した実習を行います。
2026-03-19 · 13 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 19. 深層強化学習の実践的な応用事例
ロボット制御、自律走行、リソース管理、推薦システム、NLP、ゲームAIなど深層強化学習の多様な実践活用
2026-03-19 · 9 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 16. Black-Box最適化:進化戦略と遺伝的アルゴリズム
勾配なしで方策を最適化する方法:進化戦略(ES)と遺伝的アルゴリズム(GA)の原理と実装
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 13. ウェブナビゲーションと強化学習
ブラウザ自動化と強化学習の融合:Mini World of BitsベンチマークとOpenAI Universeを活用したウェブエージェントの実装
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai