LabHub

ブログ

AI動画生成 2026 完全ガイド — Sora 2 · Veo 3 · Runway Gen-4 · Pika · Luma Dream Machine · Kling · Hailuo · Hunyuan Video 徹底解剖

한국어English日本語

プロローグ — SoraプレビューからSora 2アプリへ、2年の圧縮

2024年2月15日、OpenAIがSoraプレビューを公開したとき、映像業界は一瞬止まった。60秒の1080pクリップが「プロンプトだけで」出てきたという事実が衝撃だった。だがそのSoraは1年経っても一般公開されなかった。

そして2025年9月30日、OpenAIはSora 2を発表すると同時に、iOS専用のSoraアプリをローンチした。4K · 25秒 · ネイティブオーディオ · Cameos(自分の顔と声をモデルに登録)、ソーシャルフィードまで。ChatGPT Proサブスクライバーには専用枠が付いた。並行してGoogleはVeo 2(2024-12)、Veo 3(2025-05 I/O)の順でGemini AppとVertex AIに統合し、RunwayはGen-3 Alphaを経てGen-4(2025-03)で映画制作ワークフローに深く踏み込んだ。

その間、中国陣営ではKuaishou Kling、MiniMax Hailuo、Tencent Hunyuan Video、Alibaba Wan 2.1が一気にギャップを詰めた。そしてオープンソース側 — Genmo Mochi 1(2024-10, Apache 2.0)、Lightricks LTX-Video(2024-11, リアルタイム2B)、CogVideoX(清華) — がComfyUIワークフローの上に載り、RTX 4090一枚でもcinematicな映像が可能になった。

本稿はその2年の圧縮を — クローズドとオープン、価格とライセンス、そして日本と韓国の市場まで — 一息に整理する。


第1章 · テキスト、画像、動画 — 三つの入力分岐

AI動画モデルを選ぶときに最初に問うのは「何を入力に取るか」だ。三つの分岐がある。

ほとんどのプロのワークフローはこの三つを混ぜる。T2Vで初稿 → I2Vでキャラ固定 → V2Vでスタイル統一 → リップシンクツールで口形同期。最後にPremiere/DaVinciで切って繋ぐ。


第2章 · OpenAI Sora 2 — 4K · 25秒 · Cameos · iOSアプリ

2025-09-30、OpenAIはSora 2を発表すると同時に、モデルとアプリの二つを解放した。

Sora 2の真の差別化点は二つ。第一に、他モデルが無音動画を出力してElevenLabs/Sunoで別途音を付けるのに対し、Sora 2はネイティブで同期したオーディオを一緒に出す。第二に、Cameos機能は事実上「ディープフェイク同意モデル」を標準化した — 本人が明示登録した顔のみ、しかも友人に共有権を与えた場合のみ使える。


第3章 · Google Veo 2 · Veo 3 — GeminiとVertex AIの二本立て

GoogleのビデオモデルはVeoシリーズに統合された。

Veo 3の強みはGoogleインフラ — DeepMindの音声モデルと結合したネイティブサウンド — とエンタープライズチャネル(Vertex AI)だ。Sora 2がソーシャルフィード中心なら、Veo 3は制作パイプラインに近い。


第4章 · Runway Gen-4 — 映画制作ワークフローへの浸透

Runwayの道は最初から明確だった。「映像編集会社が作るAI動画ツール」。

Gen-4のReferences機能は映画制作者が最も望んでいた機能だ。キャラシート、衣装リファレンス、環境ムードボードを入力に入れると、その一貫性を保ったまま複数ショットを作れる。


第5章 · Pika 2.2 · 2.5 — Pikadditions · Pikaffects · Pikaframes

Pikaの戦略は「機能名を覚えやすくする」ことだ。

Pikaの魅力は映画的一貫性よりも「一行で説明できるエフェクト」にある。Pikaffectsは広告 · ソーシャル制作者にとって非常に強力だ。


第6章 · Luma Dream Machine · Ray 2 — 速くてループ型

Luma AIのDream Machineは「速くて日常的」というポジションを取った。

Lumaの強みは二つ。第一に、Image-to-Videoの品質が非常に高い — 静止画から自然なモーションを作る。第二に、Loop機能(切れ目なく繰り返すクリップ)がソーシャルGIFや背景映像に強い。


第7章 · Kling 1.6 · 2.0 — Kuaishouのグローバル進出

中国Kuaishou(快手、TikTokのグローバル競合)が2024-06に公開したKlingは、急速にグローバルユーザーを集めた。

Klingの差別化点はMotion Brush — 映像内の特定領域を選んで動きの方向を指定できる。例:「この人物の髪だけ風で揺らす」。


第8章 · MiniMax Hailuo — 高速テキスト-動画

MiniMaxのHailuo(海螺)は2024-09公開。初期は無料、その後有料化された。

Hailuoは英語プロンプトに非常に強く、推論時間が速い(短いクリップで約30秒~1分)のが利点。ただし25秒まで伸びるSora 2と比べると尺は短い。


第9章 · Tencent Hunyuan Video — 13Bオープンソースの夜明け

2024-12-03、TencentがHunyuan Videoを公開した。13Bパラメータ、事実上のオープンライセンス(商用利用可、一部制限あり)。オープンソース動画モデルの版図を変えた事件だ。

Hunyuan Videoの登場は、オープンソース動画陣営を「実用可能」領域に引き上げた。それまでのオープンモデルはデモレベルだった。


第10章 · Alibaba Wan 2.1 — 14Bのオープンライセンス

2025-01、AlibabaがWan 2.1を公開した。

Wan 2.1の本当の魅力は1.3B版にある。Apache 2.0で完全に自由、コンシューマGPU一枚で回る。ただし品質は14BあるいはHunyuanには及ばない。


第11章 · Genmo Mochi 1 — Apache 2.0 10Bの登場

2024-10、GenmoがMochi 1をApache 2.0で公開した。

Mochi 1は「完全に自由なオープン動画モデル」という枠を初めて埋めた。ライセンスの観点からはHunyuanよりクリーンだ。


第12章 · Lightricks LTX-Video — リアルタイム2Bモデル

2024-11、Lightricks(Facetune · Videoleapを作る会社)がLTX-Videoを公開した。

LTX-Videoは「品質 vs 速度」のバランスを速度側に寄せた。高速プロトタイピング · 反復作業に強い。


第13章 · CogVideoX 5B — 清華のオープンベース

2024-09、清華大学KEG LabとZhipuAIがCogVideoXを公開した。

CogVideoXはModelScope · Hugging Faceで配布されており、速やかにComfyUIワークフローに統合された。


第14章 · Stable Video Diffusion · その前の遺産

動画モデルの「前史」を一段落で整理する。

これらがなければComfyUIエコシステムも、オープンソース動画モデルも今のような姿にはなっていない。


第15章 · ComfyUIワークフロー — Wan · Hunyuan · Mochiを一つに

ComfyUIはノードベースのワークフローエディタで、オープン動画モデルの標準インターフェースになった。

代表的なノードパッケージ:

典型的なワークフローはこのように流れる。

[Text Prompt]
   |
   v
[CLIP/T5 Text Encoder] --+
                          |
[Empty Latent Video] -----+--> [Diffusion Model (Hunyuan/Wan/Mochi)] --> [Latent Video]
                          |                                                  |
[Negative Prompt] --------+                                                  v
                                                                    [VAE Decode]
                                                                              |
                                                                              v
                                                                       [Video Output]

I2VワークフローはここにImage EncoderノードとConditioningノードを追加する。V2Vは入力動画をlatentに再エンコードして起点として使う。

ComfyUIの本当の長所はノード単位でLoRA · ControlNet · IPAdapter · アップスケーラを差し込めることだ。クローズドモデルでは出来ない細粒度の制御が可能になる。


第16章 · リップシンク — HeyGen · Synthesia · D-ID · Hedra

動画生成とリップシンクは別問題だ。リップシンクツールは別カテゴリを成す。

Sora 2 · Veo 3は動画とオーディオを一緒に生成するが、既存映像に別の音声を乗せる作業は依然として上記ツールの領域だ。


第17章 · 絵コンテ · 長尺 — LTX Studio · Showrunner · Wonder

5秒~25秒のクリップを束ねてもっと長い映像を作るツールは別にある。

これらの共通点は「単一クリップではなくシーケンス」を作ることだ。なのでSora 2 · Veo 3 · Runway Gen-4をAPIで引っ張ってきて上に載せるケースが多い。


第18章 · ウォーターマークとC2PA — 真正性証明の新標準

2024-2025年に最も速く根を下ろした標準はC2PA(Coalition for Content Provenance and Authenticity)だ。

2026年時点の状況:

ウォーターマークはコンテンツ信頼の最後の防衛線だ。だがオープンソースで作られた映像にはC2PAが入らないため、この標準はクローズドエコシステム内でのみ作動する。


第19章 · 韓国 — VARCO · HyperCLOVA X 動画

韓国陣営の状況はテキスト · 画像モデルに比べて動画は一拍遅いが、急速に追い上げている。

韓国市場の特殊性はKコンテンツ IPだ。ドラマ · K-POP · ウェブトゥーンのキャラ一貫性を保ったまま動画を生成するワークフロー(LoRA学習 + Runway References + リップシンク)が急速に実験されている。


第20章 · 日本 — NTT Tsuzumi · Pikalmer · Sakana

日本陣営も動画モデルの直接開発は少ないが、隣接分野は活発だ。

日本はIP一貫性と労働組合の問題から、クローズドモデルよりもコントロール可能なオープンソースワークフローに重みが乗っている。


第21章 · コスト — クリップ1本の本当の価格

比較可能な価格表を一段落にまとめる。

最も安く作る道は二つ。一つはオープンソースモデル + 自前のGPU。もう一つはPika · Lumaの低価格サブスク + 無理しないクリップ数。


第22章 · 限界 — モーション一貫性、物理、テキスト

2026年の動画モデルは強いが、弱点も明確だ。

これらの限界が消える速度は世代ごとに違う。テキストレンダリングは速く改善されたが、物理はゆっくり改善中だ。


第23章 · 活用事例 — 広告 · ソーシャル · 絵コンテ · R&D

2026年現在で最も活発な4つの活用:

本格的な長編映画 · ドラマ制作にはまだ到達していない。ただし短編 · MV · 広告 · 予告編にはすでに入り込んでいる。


第24章 · 意思決定ツリー — どのモデルを使うか

最後に、状況別のおすすめを1ページにまとめる。

このツリーは半年以内に更新される可能性が高い。AI動画は依然として最も速く動く分野の一つだ。


エピローグ — 次の1年の問い

2年で60秒1080pから25秒4K同期オーディオまで来た。2027年の動画モデルは何を解くべきか。

答えを持っている人はまだいない。だが2024-2026の速度ならば、その答えはさらに2年以内に出てくる可能性が高い。


参考資料

コメント

まだコメントはありません。

ログインするとコメントできます