タグ: #dit
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
基盤モデルのアーキテクチャ 2026 — Transformer の次へ / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 徹底ガイド
2026 年の基盤モデル界隈はもはや Transformer 一色ではない。Vaswani 2017 「Attention is All You Need」は今も標準だが、その隣に Mamba/Mamba 2 のような状態空間モデル、RWKV/RetNet/Griffin の線形 RNN 復活組、AI21 Jamba と Falcon Mamba のハイブリッド、Sepp Hochreiter の xLSTM、Test-Time Tra
2026-05-16 · 30 分で読めます #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaAI動画生成 2026 — Sora 2 / Veo 3 / Kling 2 / Hailuo / Runway Gen-4 / Luma Ray 2 / HunyuanVideo 徹底ガイド
2024年2月のSora 1デモが映像業界をひっくり返してから2年。Sora 2が正式リリースされ、Veo 3が音声と会話を同期生成し、Kling 2が中国発の最強動画モデルとなり、HunyuanVideoがオープンウェイトの初の競合になった。2026年5月時点のAI動画生成の地形 — クローズド/オープン/音声・音楽連携/日韓研究まで14章で整理。
2026-05-15 · 36 分で読めます #ai-video#video-generation#sora#veo#klingDiffusion Model論文サーベイ: DDPMからStable Diffusion·DiT·SDXLまで画像生成モデルの進化
DDPM/DDIMの拡散・逆拡散理論からScore-basedモデル、Latent Diffusion(Stable Diffusion)のVAE+U-Netアーキテクチャ、Classifier-free Guidance、DiT(Diffusion Transformer)のadaLN-Zero、SDXLのデュアルテキストエンコーダーとRefinerパイプライン、ControlNetの条件付き制御、学習パイプライン、推論最適化まで、画
2026-03-12 · 23 分で読めます #ai-papers#diffusion-model#ddpm#stable-diffusion#ditDiffusion Transformer(DiT)アーキテクチャ分析:U-NetからTransformerへの転換
Scalable Diffusion Models with Transformers(DiT)論文を分析します。U-Netベースの拡散モデルの限界を超えてTransformerバックボーンへ転換した背景、adaLN-Zero条件付け、スケーリング則、SORA/DALL-E 3への影響まで解説します。
2026-03-03 · 14 分で読めます #ai-papers#diffusion-transformer#dit#generative-ai#image-generationHunyuanVideoとLTX-2の完全分析:オープンソース動画生成モデルのアーキテクチャ・性能・実践ガイド
Tencent HunyuanVideo(13B)とLightricks LTX-2(19B)のアーキテクチャ、学習手法、性能ベンチマークを詳細に分析。Wan 2.1、CogVideoX、Mochiを含むオープンソース動画生成エコシステムの包括的比較と実践的な使用ガイド。
2026-03-01 · 38 分で読めます #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-video