タグ: #diffusion-transformer
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
画像生成・理解の技術レポート、何を読むか — サンプル画像ではなく設計を読む
画像生成と理解の技術レポート11本を、arXivの原文アブストラクトで直接確認して整理しました。整流フロートランスフォーマーとVAR、Emu3、SANA、Janus-Pro、FLUX.1 Kontext、Qwen-Image系列、Seedream 4.0、Z-ImageとMage-Flow、InternVL3、そして評価側のQwen-Image-Benchまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。領域別
2026-08-12 · 14 分で読めます #ai-papers#paper-review#technical-report#image-generation#diffusion-transformer動画生成・理解の技術レポート、何を読むか — デモではなく制約を読む
動画生成と理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。CogVideoX、Movie Gen、HunyuanVideo、LTX-Video、Wan、Seedance 1.0と2.0、そして理解側のQwen2.5-VL、VideoLLaMA 3、HY-Himmelまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱わず、長さ・解像度・トークン予算といった実際の制約を見ます。領域別・最
2026-08-12 · 12 分で読めます #ai-papers#paper-review#technical-report#video-generation#diffusion-transformerSOTA画像生成モデル分析 — 拡散モデルからFLUXまで
テキスト画像生成の最前線を、拡散モデルの原理からラテント拡散、DiT、rectified flow、そしてFLUX系まで系譜を中心に整理します。アーキテクチャの原理と比較表、図解でSOTAモデルの共通構造と違いを分析します。
2026-06-30 · 17 分で読めます #ai-papers#diffusion-models#text-to-image#latent-diffusion#rectified-flowSOTA動画生成モデル分析 — 時空間拡散トランスフォーマー
動画生成の根本的な難題である時間的一貫性と計算コストを、時空間潜在パッチと拡散トランスフォーマーの観点から整理します。Soraが提示した概念と後続モデル系列、条件付け・評価・物理的一貫性の限界をアーキテクチャ中心に分析します。
2026-06-30 · 16 分で読めます #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-video基盤モデルのアーキテクチャ 2026 — Transformer の次へ / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 徹底ガイド
2026 年の基盤モデル界隈はもはや Transformer 一色ではない。Vaswani 2017 「Attention is All You Need」は今も標準だが、その隣に Mamba/Mamba 2 のような状態空間モデル、RWKV/RetNet/Griffin の線形 RNN 復活組、AI21 Jamba と Falcon Mamba のハイブリッド、Sepp Hochreiter の xLSTM、Test-Time Tra
2026-05-16 · 30 分で読めます #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaDiffusion Transformer(DiT)アーキテクチャ分析:U-NetからTransformerへの転換
Scalable Diffusion Models with Transformers(DiT)論文を分析します。U-Netベースの拡散モデルの限界を超えてTransformerバックボーンへ転換した背景、adaLN-Zero条件付け、スケーリング則、SORA/DALL-E 3への影響まで解説します。
2026-03-03 · 14 分で読めます #ai-papers#diffusion-transformer#dit#generative-ai#image-generationHunyuanVideoとLTX-2の完全分析:オープンソース動画生成モデルのアーキテクチャ・性能・実践ガイド
Tencent HunyuanVideo(13B)とLightricks LTX-2(19B)のアーキテクチャ、学習手法、性能ベンチマークを詳細に分析。Wan 2.1、CogVideoX、Mochiを含むオープンソース動画生成エコシステムの包括的比較と実践的な使用ガイド。
2026-03-01 · 38 分で読めます #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-video