# Prompts de video IA: estructura para coherencia visual

URL: https://auxworld.app/es/journal/prompts-video-ia-coherencia-mundo
Type: blog
Locale: es
Published: 2026-07-28
Updated: 2026-08-09

---

> Prompts de video IA: clave del mundo, cinco capas, Veo vs Kling. Evita hábitos que desperdician créditos de generación.

La mayoría de los prompts de video IA están escritos para un clip. Los míos tienen que sobrevivir seis. Ese es el desafío cuando tu prompt también describe un mundo jugable: la luz del clip uno tiene que coincidir con la del clip cuatro, o todo el conjunto se lee como continuidad rota en lugar de un lugar coherente. Aquí está la estructura exacta que uso para prompts de video IA en Veo, qué cambia cuando ejecuto el mismo concepto a través de Kling, y los hábitos que estaban gastando silenciosamente un tercio de mis créditos de generación.

## Por qué la mayoría de los prompts de video IA se desmorona después del clip dos

Tenía seis tomas cinematográficas que generar para un mundo: un plano general de establecimiento, un paneo de nivel medio, un primer plano del agua, tres momentos de personaje. Seis prompts separados, escritos desde cero cada vez, como te dicen todos los tutoriales.

En el clip tres, la niebla se había disipado. En el clip cinco, la luz había cambiado de azul anochecer a algo más cercano al mediodía. Nadie le dijo al modelo que cambiara el clima. Solo lo describí ligeramente diferente cada vez, y esas diferencias pequeñas, multiplicadas seis veces, suman un planeta completamente diferente.

La solución no fue un prompt mejor. Fue un bloque fijo que pego en la parte superior de cada clip en la secuencia, sin cambios:

`Clave del mundo (reutiliza exactamente igual en cada clip):
valle montañoso brumoso, atardecer, luz azul-violeta fría, niebla baja en el terreno,
silueta de montaña distante, corrección de color restringida, sin destellos de lente`Todo después de esa línea es libre de cambiar: sujeto, acción, cámara. La clave del mundo no. Una vez que empecé a tratar la continuidad como un activo fijo en lugar de una esperanza, mi tasa de clips inutilizables en una secuencia de seis pasó de aproximadamente 4 de cada 10 a alrededor de 1 de cada 10.

Suena pequeño hasta que cuentas créditos. Una secuencia de seis clips con una tasa de fallo del 40 por ciento significa regenerar dos o tres tomas cada vez, además de las seis por las que ya pagaste. Con una tasa de fallo del 10 por ciento, la mayoría de las secuencias se terminan limpias en el primer intento. El prompt se hizo más corto. El resultado fue más predecible. Esas dos cosas sucediendo juntas es lo que vale la pena notar.

## Los cinco niveles que Veo realmente recompensa

[La propia guía de prompting de Google para Veo 3.1](https://cloud.google.com/blog/products/ai-machine-learning/ultimate-prompting-guide-for-veo-3-1) divide un prompt fuerte en cinco partes: sujeto y acción, cámara, entorno e iluminación, estilo y atmósfera, y audio (esto incluye diálogos, efectos de sonido y sonido ambiente), cada uno escrito como su propia línea. Omite la capa de audio y obtienes un clip silencioso que se lee como inacabado incluso cuando lo visual está correcto.

Aquí hay un prompt construido sobre esa estructura, describiendo una escena que realmente generé:

`Cámara: dolly lento hacia adelante, a la altura de la cintura, profundidad de campo superficial
Sujeto: un camarero robot puliendo un vaso detrás de una barra de madera desgastada
Acción: pone el vaso y levanta la vista cuando la puerta se abre
Entorno: un club de jazz de Detroit de los años 1920 brumoso, luces de cuerda cálidas, neblina fina
Estilo: corrección de color film noir de los años 1940, grano suave
Audio: sonido ambiente, conversación murmurante y una trompeta apagada`Eso no es una lista de palabras clave. Son cinco instrucciones cortas sobre las que el modelo puede actuar de forma independiente, lo cual importa más de lo que parece. Google cita a un cliente, la aplicación de audio Pocket FM, que reporta un aumento del 30 al 40 por ciento en la retención después de incorporar video generado por Veo estructurado y por capas en su producto. No puedo verificar ese número yo mismo, pero la afirmación subyacente, que la estructura vence a una pila de adjetivos más larga, coincide con lo que veo clip tras clip.

![Fotograma cinematográfico generado por IA de un club de jazz de los años 1920 brumoso con un camarero robot](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/auxworld/2026-08/204f21-inline1-jazzclub.webp)

## Escribir diálogos de PNJ sin romper la escena

La capa de audio es donde la mayoría de los prompts centrados en mundos se desmoronan, porque el diálogo necesita sonar como si perteneciera a un personaje, no a un lector de texto sintetizado.

Las comillas importan aquí más que en ningún otro lugar del prompt. Atribuye la línea al personaje, describe la entrega, y mantenla corta:

`Audio: el camarero dice, "No recibimos muchos extranjeros por aquí",
en un tono plano e indiferente. Sonido ambiente: trueno distante, vidrios tintineando.`Dos líneas, no un párrafo. Una sola línea larga de diálogo tiende a ser destrozada o cortada. Dos intercambios cortos, cada uno con su propia nota de entrega, salen más cerca de lo que realmente imaginaste. Si una escena necesita una tercera línea de diálogo, eso suele ser una señal de que debería ser dos clips en lugar de uno, volviendo a la regla de dos elementos nuevos de la clave del mundo.

## El lenguaje de cámara es la palanca, no los adjetivos

Cambia "cinematográfico" por "impresionante" en un prompt y casi nada cambia en el resultado. Cambia "plano general estático" por "dolly lento hacia adelante" y el registro emocional completo del clip se desplaza, porque el modelo realmente está analizando esa instrucción como un movimiento de cámara físico, no como decoración.

Los verbos que funcionan consistentemente en Veo y Kling: dolly hacia dentro o hacia afuera, paneo, grúa, seguimiento steadicam, mano alzada, aéreo o dron. La selección de lentes importa también. Un 16mm se lee como ancho y ligeramente distorsionado, bueno para escala. Un 85mm comprime el fondo y favorece un sujeto cercano. Ninguno necesita tres adjetivos apilados enfrente para hacer su trabajo.

Kling maneja esto diferente a Veo de una forma específica que vale la pena saber antes de elegir una herramienta: es notablemente más fuerte en movimiento suave de personajes y humanos sobre clips más largos, donde Veo tiende a ganar en iluminación natural y fidelidad de prompts en tomas ambientales. Si tu mundo tiene mucho movimiento de estilo PNJ en el encuadre, ese es el compromiso a probar por ti mismo en lugar de asumir.

Ejecuto tomas de establecimiento y ambientales a través de Veo y momentos centrados en personajes a través de Kling, luego hago coincidir la clave del mundo en ambos. Es más configuración que elegir una herramienta y quedarse allí, pero las costuras se notan menos de lo que esperarías una vez que el lenguaje de iluminación está bloqueado.

![Toma aérea de dron de un cañón desértico en hora dorada, generada a partir de un prompt de video IA](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/auxworld/2026-08/556588-inline2-canyon.webp)

## Qué omitir: los hábitos que desperdician tus créditos

Tres cosas que dejé de hacer, en orden de cuánto me estaban costando.

Prompts de sopa de palabras clave. Un montón separado por comas como "épico, cinematográfico, 8k, tendencia, obra maestra" hace menos que una oración clara sobre lo que sucede en el encuadre. El modelo no tiene nada sobre lo que actuar en una palabra como "épico". Tiene mucho sobre lo que actuar en "la cámara se eleva mientras el puente viene a la vista".

Prompts negativos vagos. "Sin mala calidad" le dice al modelo nada útil. "Sin destellos de lente, sin desenfoque de movimiento en el sujeto del primer plano" le dice exactamente qué suprimir. Los negativos específicos funcionan. Los vagos queman una generación y no cambian nada.

Reescribir el mundo completo desde cero cada clip. Este es el mismo error que el problema de continuidad anterior, solo mostrándose como gasto desperdiciado en lugar de deriva visible. Cada reescritura completa es una oportunidad fresca para que el modelo desvíe la paleta, y cada clip desviado es una generación que tirarás.

Apilar más de dos elementos nuevos por toma. Añade un nuevo personaje, una nueva condición climática y un nuevo movimiento de cámara en el mismo prompt, y el modelo tiene que adivinar cuál te importa más. Cambia una cosa, mira qué sucede, luego cambia la siguiente.

![Un monitor mostrando una representación de video IA borrosa y sobreprocesada con colores lavados](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/auxworld/2026-08/a159e5-inline3-failedrender.webp)

## Mantener un mundo coherente en seis clips

El truco de la clave del mundo funciona, pero es un parche manual para un problema que la industria está construyendo herramientas para solucionar activamente. La función Soul de Higgsfield, por ejemplo, está construida específicamente para mantener constante la identidad visual de un personaje en generaciones separadas, una versión más difícil del mismo problema de continuidad que estoy resolviendo manualmente con un bloque de texto pegado.

Aún no he encontrado una herramienta que bloquee la continuidad del entorno como me gustaría para un mundo completo, seis clips, un lugar coherente. Hasta que exista una, la disciplina está en el escritor de prompts: misma clave del mundo, mismo lenguaje de iluminación, misma moderación en cuántos elementos nuevos introduces por clip. Máximo dos elementos nuevos por toma. Introduce un tercero y algo más suele romperse.

Hay una versión de esto que escala más allá de seis clips también. Cuando un fork de un mundo es recogido por alguien más, un colaborador, un segundo creador remixando tu base, la clave del mundo viaja con el fork. Heredan el lenguaje de iluminación ya sea que conozcan el término o no, porque está sentado justo allí en la parte superior de cada prompt en la secuencia. Ese es el valor real de escribirlo en lugar de mantenerlo en tu cabeza: alguien más puede retomar exactamente donde lo dejaste, sin una llamada para sincronizarse sobre lo que se supone que "la luz" debe parecer.

![Tres monitores mostrando el mismo mundo de valle generado por IA desde diferentes ángulos de cámara](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/auxworld/2026-08/c1699f-inline4-threemonitors.webp)

## Editar lo que generas: la parte que nadie solicita en prompts

Ningún prompt arregla el ritmo. Una vez que tienes seis clips que se mantienen unidos, aún tienes que cortarlos en algo que se pueda ver, agregar subtítulos si la pieza va a cualquier lugar social, y recortar el medio segundo donde el movimiento del modelo se vuelve inquietante antes de que se asiente.

Esa es una habilidad separada del prompting, y es la que la mayoría de las guías omiten porque sucede después de que la parte interesante técnicamente está hecha. Es también donde un conjunto áspero de clips se convierte en una secuencia real, subtítulos adentro, fotogramas muertos afuera, el medio segundo incómodo de movimiento recortado antes de que se asiente en algo inquietante.

## Tu primer borrador es un corte áspero, no un diagnóstico

La primera vez que un clip sale mal, el instinto es reescribir todo el prompt. No lo hagas. Cambia la única línea que es realmente responsable, el verbo de cámara, la frase de iluminación, el único elemento nuevo que agregaste, y regenera. La mayoría de lo que parece un fallo de prompt es una palabra haciendo el trabajo equivocado.

Escribe la clave del mundo primero. Luego escribe seis instrucciones cortas y específicas que vivan dentro de ella, no seis mundos que resulten compartir un nombre. Haz fork del clip que esté más cerca, cambia una línea, y mira qué se rompe antes de decidir que el prompt estaba mal.

## FAQ

### ¿Qué es la clave del mundo y por qué es importante?

La clave del mundo es un bloque fijo de descripción visual que reutilizas sin cambios en cada clip de una secuencia. Define el entorno, la iluminación y el estado del mundo. Es importante porque evita que el modelo derive la atmósfera, los colores y el clima entre clips, manteniendo la coherencia visual en toda la secuencia.

### ¿Cuál es la estructura de cinco capas de Veo?

Google recomienda cinco capas para prompts efectivos: (1) Sujeto y acción, (2) Cámara y movimiento, (3) Entorno e iluminación, (4) Estilo y atmósfera, (5) Audio (diálogos, efectos, ambiente). Escribir cada capa en su propia línea mejora la fidelidad del modelo respecto a tu intención.

### ¿Cuándo debo usar Veo y cuándo Kling?

Usa Veo para tomas ambientales, de establecimiento y con énfasis en iluminación natural. Usa Kling para clips centrados en personajes y movimiento humano suave. Puedes combinar ambos en la misma secuencia si mantienes la clave del mundo constante en todos los clips.

### ¿Qué hábitos desperdician más créditos de generación?

Los cuatro principales: (1) Sopas de palabras clave sin instrucciones claras, (2) Prompts negativos vagos, (3) Reescribir completamente cada clip en lugar de cambiar un elemento, (4) Apilar más de dos elementos nuevos en un mismo prompt.

### ¿Cómo escribo diálogos que no se corten en los clips?

Mantén los diálogos cortos (máximo dos líneas), atribuye cada línea a un personaje, describe la entrega, y usa comillas claras. Evita párrafos largos de diálogo en un solo clip; mejor divide la conversación en dos clips separados.

### ¿Qué importancia tiene el lenguaje de cámara en los prompts?

El lenguaje de cámara (dolly in/out, paneo, grúa, steadicam) es más efectivo que los adjetivos para definir el tono emocional de un clip. El modelo interpreta estos verbos como instrucciones físicas reales, no como decoración decorativa.

### ¿Puedo compartir la clave del mundo con otros creadores?

Sí, cuando alguien hace un fork de tu mundo, la clave del mundo viaja con el fork. Eso permite que otros creadores continúen exactamente donde lo dejaste, heredando automáticamente tu lenguaje de iluminación y coherencia visual, sin necesidad de sincronización adicional.