标签: #text-to-video
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
SOTA 视频生成模型解析 — 时空扩散 Transformer
从时空潜在补丁与扩散 Transformer 的视角,梳理视频生成的根本难题 — 时间一致性与计算成本。本文围绕 Sora 提出的概念与后续模型系列,以架构为中心分析条件化、评估与物理一致性方面的局限。
2026-06-30 · 13 分钟阅读 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-video