AI動画生成の仕組みとは。ノイズから映像へ、テキストプロンプトが描く30秒の現実
要約
AI動画生成は、テキストまたは画像プロンプトからフレームを生成する反復的なデノイジングプロセスだ。モデルはランダムノイズから始まり、20〜50ステップで段階的にノイズを除去し、一貫した映像を作り出す。この技術の核は拡散トランスフォーマー(DiT)であり、8〜20秒の「一貫性の崖」を境に性能が急低下する。ワールドビルディングに最適なエンジンを選ぶには、テキスト→画像→映像の入力モード、計算コスト、インタラクティブ性の違いを理解することが欠かせない。
AI動画生成の仕組みとは
AI動画生成は、テキストまたは画像プロンプトをフレームに変換する。その仕組みは反復的なデノイジングだ。モデルはまず純粋なノイズから始まり、20〜50ステップ毎にノイズを段階的に除去する。フレームを順番にアニメートするのではなく、数千のピクセルをプロンプトの指示に従って同時にデノイズする。
この動作原理は、インタラクティブワールドを構築する際に重要な違いをもたらす。
ここ1ヶ月、ウォーキングシムプロジェクト向けに3つのエンジンで12のバリエーション環境を試した。実際のエンジン動作から得た学びを、以下にまとめた。
プロンプトが実際に引き起こす処理
テキストプロンプトは直接カメラに送られるのではない。まず数値表現(条件ベクトル)に変換され、この数値がデノイジングプロセス全体を操舵する。
言語エンコーダーがプロンプトを意味的埋め込みに変換する。この埋め込みが拡散モデルを条件付けし、ランダムガウスノイズのフィールドから始まり、20〜50ステップをかけて段階的にノイズを除去する。各ステップで最終映像がどうあるべきかの予測が少しずつ改善される。
動画はこのプロセス全体を通じて、いきなり高解像度で生成されない。最新のエンジンは圧縮された潜在空間で先に処理を行い、その後ピクセル空間に展開する。この工程で計算コストが劇的に低減される。変分オートエンコーダが最終段階で潜在空間の動画をピクセルに戻す。
このアーキテクチャが意味することは、30秒クリップは3秒クリップと同じプラットフォーム上で約10倍のコストがかかるということだ。時間が長くなると潜在空間が拡大し、モデルの処理負荷も比例する。
別の重要なポイント:プロンプトの単語は指示ではなく確率だ。モデルは数百万の訓練映像から言語と視覚パターンの統計的相関を学習している。「霧の中の1920年代デトロイト、ジャズバーの無人オーダーシステム」と書くと、これは設計図ではなく学習された相関クラスタを啓動する。同じプロンプトを2回実行しても異なる出力が得られる。これはバグではなく、デノイジング確率性が設計通りに機能している証だ。

なぜ拡散モデルが業界標準になったのか
AI動画生成の覇権を巡って、3つのアプローチが競合していた:自己回帰モデル、GAN、拡散モデルだ。
自己回帰モデルは動画を1トークン単位で予測し、言語モデルがテキストを生成するのと同じ方式だった。原理的には一貫性が保たれるはずだが、推論が遅く、スケーリング時の空間的一貫性を維持するのが難しかった。GANは生成器と識別器を敵対的学習ループで対抗させた。推論は高速だったが、学習が不安定で、モード崩壊が常の問題だった。拡散モデルはノイズから出発してそれを反復的に除去することを学ぶ。初期段階ではGANより推論が遅かったが、計算コストとともに予測可能にスケーリングした。この拡張性が勝負を決めた。
現世代を定義した建築的進化は2023年に起きた。U-Net主体の潜在拡散の代わりにパッチ単位で動作するトランスフォーマーを採用した論文だ。この論文はVeo 3、Sora 2、Kling 2.6を含むすべての本気度の高い動画モデルの建築的祖先になった。
拡散トランスフォーマー(DiT)は動画を時空間パッチに分割し、それらをフラット化してシーケンスにした後、そのシーケンス全体でトランスフォーマーアテンションを実行する。アテンションがすべてのパッチに同時に作用するため、モデルはコンボリューション的アプローチよりはるかに優れた空間的一貫性を保つ。代償は二次的コスト:フレーム数を2倍にするとアテンション計算が4倍必要になる。これが単一のDiTが追加的建築的変更なしに10分動画を生成できない構造的制約だ。
このアーキテクチャの実践的成果:条件が整えば、8〜20秒の物理的に説得力のある、照明が一貫した、運動が一貫した動画。2年前のAI動画は、手が溶け、ジオメトリがドリフトする5秒クリップだった。建築的転換がこの状況を変えた。
テキストイン、画像イン、映像イン:3つの異なるベット
ほとんどのエンジンは現在3つの入力モードを受け入れている。ワールド環境を構築する者にとって、これらは意味を異にする結果をもたらす。
テキスト→動画は最大の創造的自由度と最小のコントロールを提供する。シーンを説明すればモデルがすべてを生成し、小さなプロンプト変更で大きく異なる出力が得られる。視覚スタイル探索や概念環境の迅速生成に良い。複数ショット間で一貫性を保つのは難しい。
画像→動画は静止画を視覚的アンカーとして使う。モデルがそのリファレンスから前方にアニメートし、ソースの厳密な見た目を保持する。今日利用可能な最もコントロール可能なパスだ。ワークフローは実践的:高品質画像モデルでキーフレームを生成し、それをアニメートする。一貫した視覚言語、コントロールされた構図、そしてその上に層状された運動を得る。
映像→映像は既存クリップを変換し、スタイル、運動強度、環境詳細を変えながら元の構造を保持する。生成ベースではなく後処理で環境を改良する際に有用。
インタラクティブ環境を構築する者にとって:画像→動画が反復可能な結果への最速パスだ。テキスト→動画は探索フェーズ、視覚言語にコミットする前の段階向け。

誰も警告しない「一貫性の崖」
すべてのDiTベースのモデルには一貫性の上限がある。8〜20秒のどこかに現れる。それまでは物理が成立し、被写体が一貫性を保ち、カメラ運動が意図的に見える。それを超えると、時間的アーティファクトが起こる:運動中に形が変わる手、フレーム間でシフトする背景、構造が変わるフェイス。
これは品質の失敗ではなく、二次的アテンションの構造的限界だ。時間的文脈全体を保つのが、時間が増えるほど指数関数的に高くなる。現在の本番環境モデルは、高品質で10〜20秒レンジのクリップの一貫性を維持できる。その上限を超えると、ウィンドウアテンションのようなスライディングのような建築的回避策が必要になり、全時間的文脈をオーバーラップのあるチャンクに分割する代わりに、全体的一貫性を失う。
ワールドビルディング・パイプラインにとって、含意は直接的だ:短いクリップを生成し意図的に接合し、ショット間で視覚的継続性を保つために一貫したリファレンス画像を使う。単一のプロンプトは一貫した2分環境シーケンスを与えられない。そう主張するモデルは見ない多くの失敗試行で平均化している。
本番環境で機能する回避策:生成されたクリップを大きなモザイクの1タイルとして扱う。キーフレーム画像を視覚的アンカーとして定義し、そのアンカーから5〜8秒クリップを生成し、それらを集約する。単一生成より遅い。また、ドリフトアーティファクトではなく一貫したゲームシーンを産出する唯一のアプローチだ。
ワールド生成が平坦な映像と分岐する地点
標準的なAI動画生成は受動的映像を産出する。つまり、見るだけのフレームシーケンス。インタラクティブワールド生成はそれとは異なる質問を出す:そのスペースはプレイヤーの行動に応答できるか?
その差異は建築的だ。平坦な映像モデルは固定されたフレームテンサーを生成する。ワールドモデルは、ナビゲート可能、フォーク可能、プレイヤー入力に応答可能な潜在空間を生成する必要がある。
これはまったく異なるデータで学習することを要する。平坦な映像モデルは映画、テレビ、キャプチャされたフッテージで学習する。ワールドモデルはゲームプレイフッテージ、物理シミュレーション、一人称ナビゲーションデータで学習する。GoogleのGenieやMetaのWorldGenのような研究プロジェクトはこのアプローチを取り、環境を映像予測の問題ではなく強化学習の意味でのワールドモデルとして扱う。
実際の違いは具体的だ。平坦な映像ツールでは、生成されたカメラが右に移動するとき左に歩けない。ワールド生成エンジンでは、左も右も同じモデル状態の有効な継続だ。エンジンはあなたの行動の結果を生成し、単なる次フレーム予測ではない。
ナビゲート可能なスペースが必要なら平坦な映像ツールはスキップすべき。それらはワールドに見えるフッテージを生成する。そのように振る舞わないだろう。
オープンウェイト、クローズドAPI、そのコストの現実
AI動画生成を中心に2つのエコシステムが形成された。クリエイターのタイプによって異なるニーズに応える。
Sora 2、Veo 3、Kling、Runwayなどのクローズドな商用APIは、ハイエンドではより良い品質と秒単位の価格での直接アクセスを提供する。WAN 2.0、HunyuanVideo、CogVideoXなどのオープンウェイト・リリースは完全なコントロールと繰り返しコストがない代わりに、実際のGPUインフラストラクチャで実行することが必要。
2つの層間の品質差は2025年初めから大幅に縮小している。データセンターを持たない単独クリエイターにとって、クローズドAPIは最終出力で実用的に有意義だ。オープンウェイトは特定のワールド美学でのファインチューニング、または大規模で実行するパイプラインで秒単位価格が急速に実収予算問題に化けるときに有意義。
パイプラインへのコミット前に追跡すべき1つの数字がある:生成可能秒あたりのコスト。クローズドAPIは現在、解像度とモデルに応じて生成秒あたり$0.05〜$0.20を平均する。短いゲーム用に5秒のタイルあたり40タイル、つまり生成コストだけで$10〜$40の前に品質基準を満たさない生成失敗から30パーセント失敗率を含めると現実的な数字は上昇する。
コストベースで生成を始める。映像生成のコスト構造は画像生成のようではない。失敗試行は安くないのだ。

今晩あなたが構築するものに最適なエンジンは
映像生成パイプラインを試したことがないなら:画像→動画から始めよう。強力な画像モデルで単一のキーフレームをあなたのワールド向けに生成し、それをアニメートする。失敗したテキスト→動画試行にクレジットを浪費することなく、運動品質への即座フィードバックが得られる。
プレイ可能なゲーム向けに環境パイプラインを構築するなら:高品質画像モデルをフレーム生成とビデオモデルを運動用にペアにしよう。テキスト→動画は探索用。画像→動画は本番用。2つのフェーズは異なり、混在させると時間と予算の両方が無駄になる。
プレイヤー入力に応答するスペースが必要なら、それを描くフッテージではなく:平坦な映像ツールはそこに到達できない。ワールドに見える映像とあなたが動き回れるワールドの間のギャップはプロンプトの問題ではなく、モデル建築の問題だ。インタラクティブ出力向けに特に構築されたエンジンはフッテージではなくナビゲーションデータで学習し、固定フレームではなく応答的状態を生成する。
あなたのプロンプトはすでに場所だ。それが静止していてもそれとも動き続けるか否かは、どのエンジンに通すかという問題。