Yapay Zeka Video Üretimi Nasıl Çalışır: Teknik Rehber
Summary
AI video üretimi, gürültüden başlayıp adım adım temizleyerek frame üretir. Text-to-video yaratıcıdır ama kontrol edilemez; image-to-video stabildir. DiT mimarisi 10-20 saniye tutarlılık sağlar ama bu bir mimari sınırdır. İndie dünya inşaasında kısa klipleri birleştirmek ve key frame'leri kullanmak en güvenli yoldur.
Yapay zeka video üretimi nasıl çalışır? Bir metin ya da görüntü promptunu, yinelemeli bir gürültü kaldırma (denoising) işlemi aracılığıyla videoya dönüştürür. Model saf gürültüyle başlar, sonra gürültüyü adım adım kaldırır, ta ki tutarlı video ortaya çıkana kadar. Sırayla frame frame animasyon yapmaz. Bunun yerine binlerce pikseli aynı anda, promptunuz tarafından yönlendirilen 20 ila 50 adım boyunca gürültüden arındırır. Eğer bunun üstüne etkileşimli dünyalar inşa ediyorsanız bu ayrım çok önemlidir, çünkü performans ve sonuç kalitesi bu teknik anlayışa bağlıdır.
Geçen ay üç farklı motordan on iki ortam varyasyonunu yürüyüş simülasyonu projesi için işlettim. Motorun gerçekte nasıl çalıştığını ve hangi seçeneklerin hangi sonuçları verdiğini öğrendiklerim burada detaylı şekilde bulunuyor.
Prompt aslında ne tetikler
Metin promptunuz bir kameraya verilmez. Bunu gürültü kaldırma işlemi boyunca yönlendiren "conditioning vector" adında sayısal bir temsiline dönüştürülür. Bu dönüşüm kritiktir çünkü modelin promptu nasıl yorumladığı sonuç kalitesini belirler.
Bir dil kodlayıcısı ilk olarak promptunuzu semantik gömmelere ayrıştırır. Bu gömmeler bir diffusion modelini şartlandırır, bu da rastgele Gauss gürültüsü alanını alır ve 20 ila 50 gürültü kaldırma adımı boyunca kademeli olarak kaldırır. Her adım, son videonun ne gibi görünmesi gerektiğine dair biraz daha temiz bir tahmini üretir. Bu iteratif yaklaşım, video kalitesinin adım adım iyileşmesini sağlar.
Video bu işlem boyunca tam çözünürlükte oluşturulmaz. Modern motorlar sıkıştırılmış latent space'te, videonun daha düşük boyutlu temsilinde çalışır ve bu hesaplama maliyetini dramatik şekilde azaltır. Bir değişken otoenkoder, latent videoyu en sonunda piksel uzayına geri genişletir. Bu mimari tasarımı önemli verimlilik sağlar.
Bu mimari tasarımı, aynı platformda 30 saniyelik bir klip yaklaşık 10 kat daha pahalı olan 3 saniyelik bir klip oluşturur. Süre latent uzayı ölçeklendirir ve modelin işi onunla ölçeklendirir. Bütçe planlaması yaparken bu ilişkiyi anlamak kritiktir.
İkinci sonuç: prompt kelimeleriniz talimat değil, olasılıklardır. Model dil ile görsel kalıplar arasındaki istatistiksel ilişkileri milyonlarca eğitim videosundan öğrenmiştir. "İstanbul'da bulanık bir 1920'ler caz kulübü, barista bir robottur" yazdığınızda, bir şema değil, öğrenilmiş korelasyonlar kümesini etkinleştirir. İki aynı prompt, iki farklı çıktı üretecektir. Bu davranış bir hata değildir; gürültü kaldırma stokastiğinin tasarım gereği çalışmasıdır.

Neden diffusion diğer herşeyi yenmiş
AI video üretiminde standart olmak için üç yaklaşım rekabet etti: autoregressive modeller, GAN'lar ve diffusion modelleri. Her birinin avantajları ve dezavantajları vardır.
Autoregressive modeller videoyu tıpkı bir dil modeli metin oluşturması gibi, bir kez bir token tahmin etti. Prensipte tutarlı ama yavaş, ve mekansal tutarlılık ölçekte korunması zordu. Başarısızlık hızı yüksekti. GAN'lar bir üreteciyi bir ayırıcı ile karşılaştırdı, bir düşmanca eğitim döngüsünde. Hızlı çıkarım ama eğitimi istikrarsız ve mod çöküşüne eğilimli oldu. Başarılı eğitim üretim ortamında sorunlu. Diffusion modelleri gürültüden başladı ve yinelemeli olarak onu kaldırmayı öğrendi. İlk başta GAN'lardan daha yavaş çıkarım vardı ama hesapla öngörülebilir şekilde ölçeklendirildi. O ölçeklenebilirlik tartışmayı kazandı ve günümüze kadar hâkim kalıyor.
2023'te araştırmacılar latent diffusion'daki U-Net omurgasını patch'lerde çalışan bir transformatörle değiştirdiklerinde, günümüzün tanımlandığı mimari yükseltmesi gerçekleşti. O makale, Veo 3, Sora 2 ve Kling 2.6 dahil üretimde çalışan her ciddi video modelinin mimari atasıdır. Bu gelişme endüstriyi dönüştürdü.
Bir Diffusion Transformer veya DiT, videoyu uzamsal-zamansal patch'lere böler, bunları bir diziye düzleştirir ve o dizi üzerinde global olarak transformatör dikkatini çalıştırır. Dikkat tüm patch'lere aynı anda çalıştığından, model evrişimsel yaklaşımlardan çok daha iyi mekansal tutarlılığı korur. Ödünleşme ikinci dereceden maliyet: iki kat daha fazla frame işlemek dört kat dikkat hesaplaması gerektirir. Bu, tek bir DiT'nin ek mimari değişiklikler olmadan on dakikalık videolar oluşturmasını engelleyen yapısal kısıtlamadır.
Bu mimarinin pratik çıktısı: koşullar uygun olduğunda 8 ila 20 saniye, fiziksel anlamda tutarlı, tutarlı aydınlatmalı ve tutarlı hareketle video. İki yıl önce, AI video erimeli eller ve sürüklenen geometri ile beş saniyelik klip demekti. Mimari kayma bunun neden değiştiğini açıklar.
Metin gir, görüntü gir, video gir: üç farklı bahis
Çoğu motor artık üç giriş modunu kabul eder. Dünya ortamları inşa edenler için anlamlı şekilde farklı sonuçlar üretirler.
Metin-videoya (text-to-video) maksimum yaratıcı aralık ve minimum kontrol sağlar. Bir sahneyi tanımlarsınız, model her şeyi oluşturur ve küçük prompt varyasyonları çılgınca farklı çıktılar üretebilir. Görsel stilleri keşfetmek ya da kavram ortamları hızlı oluşturmak için iyi. Birden fazla şekilde tutarlılığı korumak zor, çünkü model her üretimde farklı yorumlamalar yapabilir.
Görüntü-videoya (image-to-video) görsel çapa olarak durgun bir çerçeveden başlar. Model o referanstan ileri canlanır, kaynağın tam görünüşünü korur. Bu bugün mevcut olan en kontrol edilebilir yoldur. İş akışı pratiktir: yüksek kaliteli görüntü modeli ile anahtar çerçeve oluşturun, sonra onu canlandırın. Tutarlı görsel dil, kontrollü bileşim ve kararlı taban üzerine katmanlanmış hareket elde edersiniz. Profesyonel iş için bu yaklaşım tercih edilir.
Video-videoya (video-to-video) mevcut bir klipte stil, hareket şiddeti ya da çevresel detaylar değiştirilirken orijinal yapı korunur. Sıfırdan üretmek yerine oluşturulan ortamları post-işlemlemek için yararlı. Efekt ve dekorasyon için idealdir.
Etkileşimli ortamlar inşa edenler için: image-to-video, tekrarlanabilir sonuca ulaşmanın en hızlı yoludur. Text-to-video keşif aşaması içindir, görsel dile yatırım yapmadan önce yapılır. İşin planlaması bu ayrımı göz önüne almalıdır.

Kimse seni uyarmıyor tutarlılık uçurumu
Her DiT tabanlı modelin bir tutarlılık tavanı vardır. 8 ila 20 saniye oluşturulan videonun bir yerinde ortaya çıkar. Bundan önce fizik tutulur, özne tutarlı kalır, kamera hareketi kasıtlı olarak okunur. Bundan sonra zamansal artefaktlar ortaya çıkar: hareket ortasında şekil değiştiren bir el, frameler arasında kaymış arka plan, farklı bir yapıya sürüklenen yüz. Bu artefaktlar, AI video üretiminde en büyük rahatsızlıklardan biri.
Bu bir kalite başarısızlığı değildir. İkinci dereceden dikketin yapısal sınırlamasıdır. Global zamansal bağlam koruma, süre arttıkça katlanarak pahalılaşır. Mevcut üretim modelleri yüksek kalitede 10 ila 20 saniye aralığında klipler için tutarlılığı sürdürebilir. Bu tavanın ötesinde, en iyi motorlar bile kayan pencere dikkati gibi mimari geçici çözümler gerektirir ki bu tam zamansal bağlamı çakışan parçalara böler.
Dünya inşası boru hatları için çıkarım doğrudan: kısa klipleri oluşturun, onları kasıtlı olarak birleştirin ve kliplar arasında görsel sürekliliği korumak için tutarlı bir referans görüntüsü kullanın. Tek bir prompt, tutarlı iki dakikalık ortam dizisi vermeyecektir. Bu iddiada bulunmuş modeller, görmediğiniz birçok başarısız denemeler üzerinde ortalama alır.
Üretimde birbirine uyan geçici çözüm: her oluşturulan klibi daha geniş bir mozaikte bir döşeme olarak ele alın. Görsel çapa olarak anahtar çerçeve görüntüsü tanımlayın, o çapadan 5-8 saniyelik klipleri oluşturun ve birleştirin. Tek üretimden daha yavaş. Aynı zamanda bir sürükleme artefaktı yerine tutarlı oyun sahne üreten tek yaklaşım.
Dünya üretimi düz videodan nereden ıraklaşır
Standart AI video üretimi pasif video üretir: izleyebileceğiniz bir çerçeve dizisi. Etkileşimli dünya üretimi, düz videonun boru hatı için tasarlanmayan bir şey sorar: yer oyuncunun ne yaptığına yanıt verebilir mi? Bu çoğu yaratıcı için unutulan kritik fark.
Boşluk mimari. Düz video modeli sabit bir frame tensörü üretir. Dünya modeli, navigasyon yapılabilir, forklayan ve oyuncu girişine yanıt veren bir latent uzay oluşturmalıdır. Bu temel olarak farklı bir problemdir.
Bu tamamen farklı verilerle eğitim gerektirir. Düz video modelleri film, televizyon ve çekilen görüntülerde eğitilir. Dünya modelleri oyun görüntüsü, fizik simülasyonları ve birinci şahıs navigasyon verilerinde eğitilir. Google'ın Genie ve Meta'nın WorldGen gibi araştırma projeleri ikisi de bu yaklaşımı alır, ortamı video tahmin sorunu yerine pekiştirmeli öğrenme anlamında dünya modeli olarak ele alarak.
Praktik fark somut. Düz video aracında, oluşturulan kamera sağa hareket ettiğinde sola yürüyemezsiniz. Dünya üretim motorunda sol ve sağ, aynı model durumunun geçerli devamları. Motor, sonraki tahmin edilen çerçeve değil, eyleminizin sonucunu oluşturur. Oyuncu deneyimi tamamen değişir.
Navigasyon yapılabilir bir alan gerekiyorsa düz video aracını atlayın. Çiftlik çekti görünüyor ama davranmaz. Gerçek etkileşim ihtiyaçları bu mimarilerle karşılanamaz.
Açık ağırlıklar, kapalı API'ler ve bu boşluğun gerçekte malı
AI video üretimi etrafında iki ekosistem oluştu ve farklı yaratıcı türlerine hizmet ederler. Seçim finansal olarak önemlidir.
Sora 2, Veo 3, Kling ve Runway dahil kapalı ticari API'ler üst uçta daha iyi kalite ve saniye başına fiyatlandırmada basit erişim sunarlar. Teknik destek ve güncellemeler sağlanır. WAN 2.0, HunyuanVideo ve CogVideoX dahil açık ağırlık sürümleri tam kontrol ve tekrarlayan maliyet sunamazlar ama çalıştırmak için gerçek GPU altyapısı gerektirir. Başlangıç yatırımı yüksek.
İki seviye arasındaki kalite boşluğu 2025 başından bu yana önemli ölçüde daralmıştır. Veri merkezi olmayan solo yaratıcı için kapalı API'ler son çıktı için mantıklı. Açık ağırlıklar belirli bir dünya estetik üzerinde ince ayar için ya da saniye başına fiyatlandırması hızla gerçek bütçe sorununa bileşen ölçekte çalışan boru hatları için mantıklı.
Bir boru hattına yatırım yapmadan önce takip etmeye değer bir sayı: kullanılabilir saniye başına üretim malı. Kapalı API'ler şu anda çözünürlük ve modele bağlı olarak üretilen saniye başına 0,05 ila 0,20 dolar arasında ortalama alıyor. Ortam döşemesi başına 5 saniye ve kısa oyun için 40 döşeme, üretim öncesi 10 ila 40 dolar. Kalite standartlarını karşılamayan üretimler için %30 başarısızlık oranını ekleyin ve gerçek sayı tırmanır.
Üretmeden önce bütçe koy. Video üretiminin maliyet yapısı görüntü üretimi gibi değildir, başarısız denemeler ucuz. Her kötü çekim gerçek kredi malı. Parasal planlama yapmak önemli.

Hangi motor bu gece inşa ettiğine uygun
Eğer hiç video üretim boru hattı çalıştırmadıysanız: image-to-video ile başlayın. Dünyanız için güçlü bir görüntü modeli ile tek bir anahtar çerçeve oluşturun, sonra onu canlandırın. Bu başarısız text-to-video denemelerine kredi harcamadan hareket kalitesi hakkında anlık geri bildirim verir. İlk denemeler önemli.
Eğer oynanabilir oyun için bir ortam boru hattı inşa ediyorsanız: çerçeve üretimi için yüksek kaliteli bir görüntü modeli video modeli ile eşleştirin. Text-to-video keşif içindir. Image-to-video üretim içindir. İki aşama farklı ve karıştırmak hem zaman hem bütçe israfı. Disipliner yaklaşım önemli.
Eğer oyuncu girişine yanıt veren bir alan istiyorsanız biri yerine çekişi tasvir eden: düz video araçları sizi oraya ulaştırmayacaktır. Dünya gibi görünen video ile hareket ettiğiniz bir dünya arasındaki boşluk bir prompt sorunu değildir. Bu bir model mimari sorunudur. Etkileşimli çıktı için özel olarak inşa edilen motorlar çekişten ziyade navigasyon verilerinde eğitilir ve sabit çerçeve yerine duyarlı durum oluşturur.
Promptunuz zaten bir yer. Durur mu yoksa hareket etmeye devam mi eder, hangi motoru içinden geçirdiğiniz sorusudur.