タグ: #generative-ai
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 13 件
3Dを作る2つの道 — 復元(NeRF・ガウシアンスプラッティング)と生成(TRELLIS・Hunyuan3D)
「3Dモデルを作る」という言葉には、まったく異なる2つの問題が隠れています。実際に存在するシーンを複数枚の写真からよみがえらせる復元(reconstruction)と、存在しないものをテキストや画像1枚から作り出す生成(generation)です。復元の系譜をSfMからNeRF、そして流れを変えた3Dガウシアンスプラッティングとfeedforward復元(Meta MapAnything)まで追い、生成の系譜をDreamFusionのS
2026-07-09 · 14 分で読めます #3d#ai#gaussian-splatting#nerf#computer-visionSOTA動画生成モデル分析 — 時空間拡散トランスフォーマー
動画生成の根本的な難題である時間的一貫性と計算コストを、時空間潜在パッチと拡散トランスフォーマーの観点から整理します。Soraが提示した概念と後続モデル系列、条件付け・評価・物理的一貫性の限界をアーキテクチャ中心に分析します。
2026-06-30 · 16 分で読めます #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoSOTA音楽・オーディオ生成の分析 — ニューラルコーデックと生成モデル
オーディオ表現(波形・スペクトログラム・ニューラルコーデック)から自己回帰オーディオ言語モデル、拡散ベースのオーディオ、テキスト音楽条件付けまで、系譜を中心に整理します。EnCodec、MusicGen、AudioLM系列の原理と商用モデル、評価・著作権の論点をアーキテクチャの観点から分析します。
2026-06-30 · 14 分で読めます #ai-papers#audio-generation#music-generation#neural-codec#audio-language-modelAI画像生成 2026 完全ガイド - Midjourney v7 · DALL·E 4 · Imagen 3 · FLUX · Stable Diffusion 3.5 · Ideogram · Recraft 徹底分析
2026年のAI画像生成は、1つのモデルが何でもこなす時代を終えた。Midjourney v7が美的感覚、DALL·E 4がマルチモーダル統合、Imagen 3がリアリズム、FLUXがオープンウェイトのフォトリアル基準、Stable Diffusion 3.5がコミュニティのベース、Ideogramが画像内テキスト、Recraft V3がベクター・デザインのカテゴリを開き、Adobe Firefly 3がライセンス安全な学習で追随する。
2026-05-16 · 39 分で読めます #ai-image-generation#midjourney#dall-e#imagen#fluxAI画像生成 2026 — Flux・Imagen 4・Midjourney v7・Ideogram・Recraft・Firefly・DALL-E・Stable Diffusion 正直比較
AI音楽・AIビデオと並ぶ画像編。2025-2026年の本当の変化は二つ — オープンウェイトのFluxがSD-XLの座を奪い、Midjourneyがv7でコンシューマ美学の基準を再び引き上げた。Imagen 4のGA、Ideogram v3のタイポ、Recraftのデザイナーワークフロー、Fireflyのライセンス明瞭性、gpt-image-1の再浮上、ComfyUI/Forgeの現在地、Stability AI訴訟とGetty争いの
2026-05-14 · 34 分で読めます #ai-image#flux#imagen#midjourney#ideogramDiffusion Models Deep Dive — DDPM、Latent Diffusion、Classifier-Free Guidance、DDIM、Stable Diffusion 完全攻略 (2025)
Stable Diffusion、DALL-E、Midjourney、Soraの基盤となるdiffusion model。本記事ではDiffusion Modelをゼロから解剖します。Forward/Reverse diffusion process、DDPMとvariational lower bound、Score-basedの視点、DDIMによる加速sampling、U-Netアーキテクチャとcross-attention、Lat
2026-04-15 · 36 分で読めます #diffusion#generative-ai#stable-diffusion#ddpm#machine-learningGemini API を本番に載せるための Prompt、Guardrails、Evaluation
Gemini API を本番サービスで扱うために必要なプロンプト設計、structured output、安全性ポリシー、評価ループ、コスト制御を整理した実践ガイドです。
2026-03-17 · 7 分で読めます #gemini#generative-ai#ai#llmops#prompt-engineering生成AI完全ガイド: GAN・VAE・拡散モデルをマスターする
生成AIのコアアーキテクチャを完全解説。VAE・GAN・DDPM拡散モデル・Stable Diffusionを数学的な導出とPyTorchの完全実装とともに基礎から理解する。
2026-03-17 · 29 分で読めます #generative-ai#gan#vae#diffusion-model#stable-diffusionDiffusion Transformer(DiT)アーキテクチャ分析:U-NetからTransformerへの転換
Scalable Diffusion Models with Transformers(DiT)論文を分析します。U-Netベースの拡散モデルの限界を超えてTransformerバックボーンへ転換した背景、adaLN-Zero条件付け、スケーリング則、SORA/DALL-E 3への影響まで解説します。
2026-03-03 · 14 分で読めます #ai-papers#diffusion-transformer#dit#generative-ai#image-generationWan Text-to-Video/Image-to-VideoとZ Image Turbo完全分析:次世代ビデオ・画像生成モデルのアーキテクチャと活用
Wanビデオ生成モデルとZ Image Turboの完全分析。アーキテクチャ、性能、実践活用ガイド。
2026-03-01 · 54 分で読めます #wan#text-to-video#image-to-video#z-image-turbo#video-generationText-to-Imageモデル学習方法論完全ガイド: GANからFlow Matchingまで
GAN、VAE、Diffusion、Flow Matchingに至るText-to-Image生成モデルアーキテクチャの学習方法論を論文ベースで詳細に分析します。Stable Diffusion、DALL-E、Imagen、Fluxなどの主要モデルの学習戦略とファインチューニング手法を包括的に解説します。
2026-03-01 · 64 分で読めます #deep-learning#text-to-image#diffusion#stable-diffusion#generative-aiHunyuanVideoとLTX-2の完全分析:オープンソース動画生成モデルのアーキテクチャ・性能・実践ガイド
Tencent HunyuanVideo(13B)とLightricks LTX-2(19B)のアーキテクチャ、学習手法、性能ベンチマークを詳細に分析。Wan 2.1、CogVideoX、Mochiを含むオープンソース動画生成エコシステムの包括的比較と実践的な使用ガイド。
2026-03-01 · 38 分で読めます #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-videoACE-Step:AI音楽生成の新パラダイム — アーキテクチャ・学習手法・実践応用の完全分析
ACE-Step音楽生成モデルのアーキテクチャ、学習方法論、テキストから音楽への生成原理を徹底分析。MusicGen、Suno、Udoioなどの競合モデルとの比較を通じて、AI音楽生成の現在と未来を考察する。
2026-03-01 · 52 分で読めます #ace-step#music-generation#ai-music#deep-learning#diffusion