标签: #generative-ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
打造 3D 的两条路径 — 重建(NeRF・高斯泼溅)与生成(TRELLIS・Hunyuan3D)
"制作 3D 模型"这句话里,其实藏着两个完全不同的问题。重建(reconstruction)是从多张照片中,把真实存在的场景复原成 3D;生成(generation)则是从一段文字或一张图像里,凭空造出并不存在的东西。本文沿着重建的谱系,从 SfM 到 NeRF,再到改变格局的 3D 高斯泼溅与前馈式重建(Meta MapAnything)一路梳理;又沿着生成的谱系,从 DreamFusion 的 SDS 蒸馏到原生 3D 扩散,再到
2026-07-09 · 13 分钟阅读 #3d#ai#gaussian-splatting#nerf#computer-visionSOTA 视频生成模型解析 — 时空扩散 Transformer
从时空潜在补丁与扩散 Transformer 的视角,梳理视频生成的根本难题 — 时间一致性与计算成本。本文围绕 Sora 提出的概念与后续模型系列,以架构为中心分析条件化、评估与物理一致性方面的局限。
2026-06-30 · 13 分钟阅读 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoSOTA 音乐·音频生成分析 — 神经编解码器与生成模型
从音频表示方式(波形·频谱图·神经编解码器)到自回归音频语言模型、基于扩散的音频、文本-音乐条件化,以谱系为中心进行梳理。从架构角度分析 EnCodec、MusicGen、AudioLM 系列的原理,以及商用模型、评估与著作权争议。
2026-06-30 · 13 分钟阅读 #ai-papers#audio-generation#music-generation#neural-codec#audio-language-model生成式 AI 与 Diffusion 模型完全指南:从 Stable Diffusion、ControlNet 到视频生成
从 DDPM 数学、Stable Diffusion 结构、ControlNet、LoRA fine-tuning 到 Sora 视频生成,一份生成式 AI 完全技术指南。
2026-03-17 · 16 分钟阅读 #generative-ai#diffusion-model#stable-diffusion#controlnet#비디오생성把 Gemini API 送上生产环境需要的 Prompt、Guardrails、Evaluation
从运维视角梳理把 Gemini API 接入实际服务时所需的提示词设计、structured output、safety 策略、评估循环、成本控制方法的一份指南。
2026-03-17 · 7 分钟阅读 #gemini#generative-ai#ai#llmops#prompt-engineering生成式AI完全指南:精通 GAN、VAE 与扩散模型
彻底掌握生成式AI核心架构的指南。通过数学公式与 PyTorch 代码,完整理解 VAE(变分自编码器)、GAN(生成对抗网络)、DDPM(扩散模型)直至 Stable Diffusion。
2026-03-17 · 30 分钟阅读 #generative-ai#gan#vae#diffusion-model#stable-diffusionDiffusion Transformer(DiT)架构分析:从 U-Net 到 Transformer 的转变
本文分析 Scalable Diffusion Models with Transformers(DiT)论文。内容涵盖突破 U-Net 扩散模型局限、转向 Transformer 骨干网络的背景、adaLN-Zero 条件化机制、缩放定律,以及对 SORA、DALL-E 3 的影响。
2026-03-03 · 11 分钟阅读 #ai-papers#diffusion-transformer#dit#generative-ai#image-generation