AI 영상 프롬프트 일관성: 여섯 클립에 걸쳐 한 세계 유지하는 법
요약
한 클립을 위한 AI 영상 프롬프트는 쉽다. 여섯 클립이 같은 세계를 묘사하도록 하는 것이 실제 기술이다. 이 가이드는 다섯 계층 Veo 프롬프트 구조, 형용사보다 중요한 카메라 동사, 그리고 한 indie 개발자의 쓸모없는 클립 비율을 40퍼센트에서 10퍼센트로 줄인 world key 트릭을 설명한다.
AI 영상 프롬프트 일관성: 여섯 클립에 걸쳐 한 세계를 유지하는 법
AI 영상 프롬프트 일관성이란 여섯 클립이 모두 같은 세계에서 온 것처럼 보이도록 만드는 기술이다. 대부분의 AI 영상 프롬프트는 한 클립만 고려해서 쓰이는데, 여러 클립이 필요하면 얘기가 달라진다. 첫 번째 클립의 빛이 네 번째 클립의 빛과 맞아야 하지 않으면 전체가 연속성이 끊긴 것처럼 보인다. 여기 Veo와 Kling에서 AI 영상 프롬프트를 쓸 때 나는 정확하게 뭐를 쓰는지, Kling에서는 뭐가 다른지, 그리고 조용히 크레딧의 삼분의 일을 낭비하게 하는 습관들을 설명한다.
왜 대부분의 AI 영상 프롬프트는 두 번째 클립 이후 붕괴되는가
한 세계를 위해 여섯 개의 영화 같은 쇼트를 생성해야 했다. 넓은 롱샷으로 여는 장면, 중간 높이의 팬, 물을 클로즈업한 장면, 캐릭터 비트 셋. 여섯 개의 분리된 프롬프트, 매번 새로 쓴 것. 모든 가이드가 너에게 그렇게 하라고 말하는 방식으로.
세 번째 클립에서 안개가 옅어졌다. 다섯 번째 클립에서 빛이 황혼 파란색에서 정오에 가까운 뭔가로 변했다. 아무도 모델에게 날씨를 바꾸라고 하지 않았다. 나는 그냥 매번 약간 다르게 묘사했을 뿐이고, 그렇게 여섯 번 반복하다 보니 완전히 다른 행성이 되었다.
해결책은 더 나은 프롬프트가 아니었다. 시퀀스의 매 클립 맨 앞에 붙여 넣는 고정된 블록이었다. 수정하지 않은:
World key (모든 클립에서 그대로 반복):
안개 자욱한 고산지 계곡, 황혼, 시원한 청자주색 빛, 얇은 지면 안개,
먼 산 실루엣, 절제된 색감, 렌즈 플레어 없음그 줄 이후로는 모두 자유롭게 바뀐다. 주체, 액션, 카메라. World key는 안 바뀐다. 연속성을 희망이 아니라 고정 자산으로 취급하기 시작했을 때, 여섯 쇼트 시퀀스에서 내 쓸모없는 클립 비율이 대략 10개 중 4개에서 10개 중 1개로 떨어졌다.
작다고 생각할 수도 있지만 크레딧으로 계산해 보면 다르다. 40퍼센트 실패율의 여섯 클립 시퀀스는 매번 이미 지불한 여섯 개 위에 두세 개 쇼트를 재생성한다는 뜻이다. 10퍼센트 실패율에서는 대부분의 시퀀스가 첫 번째 패스에서 깨끗하게 마무리된다. 프롬프트는 더 짧아졌다. 아웃풋은 더 예측 가능해졌다. 그 두 일이 함께 일어나는 것이 주목할 가치 있는 부분이다.
Veo가 정말 보상하는 다섯 개 계층
Veo 3.1을 위한 Google의 자체 프롬프팅 가이드는 강한 프롬프트를 다섯 부분으로 쪼갠다. 주체와 액션, 카메라, 환경과 조명, 스타일과 무드, 오디오는 대사와 사운드 이펙트, 앰비언트 노이즈를 뜻하고, 각각 자기 줄에 쓴다. 오디오 계층을 건너뛰면 비주얼이 맞아도 미완성으로 읽히는 무음 클립을 얻는다.
그 구조로 만들어진 프롬프트가 여기 있다. 내가 실제로 생성한 장면을 묘사하는:
카메라: 느린 달리 인, 허리 높이, 얕은 초점거리
주체: 낡은 나무 바 뒤에서 잔을 닦는 로봇 바텐더
액션: 잔을 내려놓고 문이 열리자 고개를 든다
환경: 안개 자욱한 1920년대 디트로이트 재즈 클럽, 따뜻한 스트링 라이트, 가는 안개
스타일: 1940년대 필름누아르 색감, 부드러운 그레인
오디오: 앰비언트 노이즈, 중얼거리는 대화, 둔한 트럼펫이건 키워드 리스트가 아니다. 모델이 독립적으로 실행할 수 있는 다섯 개의 짧은 지시사항이고, 이게 들리는 것보다 훨씬 더 중요하다. Google은 한 고객, 오디오 앱 Pocket FM을 인용하며 계층화되고 Veo로 생성한 비디오를 제품에 구축한 후 체류율이 30~40퍼센트 상승했다고 보고한다. 나는 그 수치를 직접 확인할 수 없지만, 구조가 형용사 더미보다 낫다는 기본 주장은 내가 클립마다 보는 것과 맞다.

NPC 대사를 장면을 깨지 않으면서 쓰는 법
오디오 계층은 세계 중심의 프롬프트가 대부분 무너지는 곳이다. 대사가 텍스트-투-스피치 리더처럼이 아니라 캐릭터에 속한 것처럼 들려야 하기 때문이다.
여기서 따옴표가 프롬프트의 어디보다도 중요하다. 대사를 캐릭터에 귀속시키고, 전달을 묘사하고, 짧게 유지해라:
오디오: 바텐더가 "우리는 낯선 사람을 자주 안 봐"라고 말한다,
무관심한, 담담한 톤으로. 앰비언트: 먼 천둥소리, 잔이 부딪히는 소리.한 문단이 아니라 두 줄. 한 줄의 긴 대사는 망가지거나 잘릴 경향이 있다. 두 짧은 교환, 각각 자기 전달 노트와 함께, 네가 실제로 그림그린 것에 더 가깝게 나온다. 장면이 대사의 세 번째 줄이 필요하다면 그건 대개 한 클립이 아니라 두 클립이어야 한다는 신호인데, world key의 두 개 신규 엘리먼트 규칙으로 돌아간다.
카메라 언어가 레버고, 형용사가 아니다
프롬프트에서 "영화 같은"을 "숨막힐 정도로"로 바꾸면 거의 아무것도 아웃풋이 바뀌지 않는다. "고정 와이드 샷"을 "느린 달리 인"으로 바꾸면 클립의 전체 감정적 레지스터가 바뀐다. 모델이 실제로 그 지시사항을 장식이 아니라 물리적 카메라 무브로 파싱하기 때문이다.
Veo와 Kling 모두에서 일관되게 작동하는 동사들. 달리 인 또는 아웃, 팬, 크레인, 스테디캠 팔로우, 핸드헬드, 에어리얼 또는 드론. 렌즈 선택도 중요하다. 16mm는 와이드하고 약간 왜곡된 것처럼 읽힌다. 스케일에 좋다. 85mm는 배경을 압축하고 클로즈 주체를 좋게 한다. 둘 다 자기 일을 하려고 그 앞에 세 개의 형용사가 쌓여 있을 필요가 없다.
Kling은 Veo와 한 가지 구체적으로 다르게 다룬다. 더 긴 클립에서 부드러운 인간과 캐릭터 모션에 눈에 띄게 더 강한 반면, Veo는 자연스러운 조명과 환경 쇼트에서 프롬프트 준수에 승리한다. 너의 세계가 프레임에서 NPC 스타일의 많은 움직임을 가지고 있다면, 그것이 너가 직접 테스트해야 할 트레이드오프지 당연히 가정하면 안 된다.
나는 Veo로 확립 및 환경 쇼트를 돌리고 캐릭터 집중 비트를 Kling으로 돌린 다음 양쪽에서 world key를 맞춘다. 한 도구를 고르고 거기 머무는 것보다 더 많은 셋업이지만, 조명 언어가 잠기면 솔기가 예상보다 덜 보인다.

건너뛸 것들: 크레딧을 낭비하는 습관들
내가 그만둔 세 가지, 얼마나 비용이 드는지 순서대로.
키워드 샐러드 프롬프트. "epic, cinematic, 8k, trending, masterpiece" 같은 쉼표로 구분된 더미는 프레임에서 벌어지는 것에 대한 한 문장보다 덜 한다. 모델은 "epic" 같은 단어에서 실행할 것이 없다. "카메라가 다리가 보이자 올라간다"에서는 plenty가 있다.
모호한 네거티브 프롬프트. "bad quality 없음"은 모델에게 유용한 것을 말하지 않는다. "lens flare 없음, foreground subject의 motion blur 없음"은 정확히 뭘 억제할지 말한다. 구체적인 네거티브는 작동한다. 모호한 것들은 생성을 태우고 뭐도 바꾸지 않는다.
매번 전체 세계를 처음부터 다시 쓰기. 이건 위의 연속성 문제와 같은 실수인데 낭비된 지출로 보일 뿐이다. 모든 전체 재작성은 모델이 팔레트를 드리프트할 신선한 기회고, 매 드리프트된 클립은 버릴 생성이다.
한 쇼트당 두 개 이상의 신규 엘리먼트를 쌓기. 새 캐릭터, 새로운 날씨 조건, 그리고 같은 프롬프트의 새 카메라 무브를 추가하면 모델은 어디를 가장 신경써야 하는지 추측해야 한다. 한 가지를 바꾸고 뭐가 부서지는지 보고, 그 다음을 바꿔.

여섯 클립에서 한 세계를 일관성 있게 유지하는 법
World key 트릭은 작동하지만, 업계가 적극적으로 도구를 만들고 있는 문제의 수동 패치다. 예를 들어 Higgsfield의 Soul 기능은 별도의 생성에서 캐릭터의 시각적 정체성을 일정하게 유지하도록 특별히 만들어졌는데, 내가 붙여넣은 텍스트 블록으로 손으로 풀고 있는 같은 연속성 문제의 더 어려운 버전이다.
나는 아직 전체 세계, 여섯 클립, 한 일관된 장소처럼 환경 연속성을 잠그는 도구를 찾지 못했다. 그런 도구가 존재할 때까지, 훈련은 프롬프트 저자에게 있다. 같은 world key, 같은 조명 언어, 매번 너가 소개하는 신규 엘리먼트 개수에 대한 같은 절제. 쇼트당 최대 두 개의 신규 엘리먼트. 셋째를 소개하면 뭐가 보통 깨진다.
여섯 클립을 넘어 스케일하는 버전도 있다. 세계의 포크가 누군가 다른, 협력자, 기본을 리믹싱하는 두 번째 크리에이터가 집어들 때, world key가 포크와 함께 이동한다. 그들은 그 용어를 알든 안 알든 조명 언어를 물려받는다. 왜냐하면 시퀀스의 매 프롬프트 맨 앞에 앉아 있기 때문이다. 그게 그것을 머릿속에만 두는 대신 적어 두는 실제 가치다. 누군가 다른이 너가 멈춘 정확히 여기에서 집을 수 있다, 무엇을 "light"가 보이는 것처럼 보아야 하는지 동기화하는 전화 없이.

생성한 것 편집하기: 아무도 프롬프트하지 않는 부분
아무도 페이싱을 고칠 수 없다. 한 번 여섯 클립이 함께 지탱하면, 너는 여전히 그것들을 뭔가 볼 수 있게 자르고, 조각이 어디든 소셜로 갈 경우 캡션을 추가해야 하고, 모델의 움직임이 부자연스러워지기 전에 정착되는 반 초 자른다.
그건 프롬프팅과는 다른 기술이고, 흥미로운 부분이 기술적으로 끝나기 때문에 대부분의 가이드가 건너뛴다. 그것도 거친 클립 세트가 실제 시퀀스가 되는 곳이다. 캡션이 들어가고, 죽은 프레임이 나가고, 부자연스러워지기 전에 움직임의 부자연스러운 반 초가 정착되는 것 전에 자른다.
너의 첫 드래프트는 진단이 아니라 러프 컷이다
클립이 처음 잘못 나올 때, 본능은 전체 프롬프트를 다시 쓰는 것이다. 하지 마. 실제로 책임 있는 한 줄을 바꿔. 카메라 동사, 조명 구절, 너가 추가한 하나의 신규 엘리먼트, 그리고 재생성해. 프롬프트 실패처럼 보이는 대부분은 한 단어가 잘못된 일을 하는 것이다.
World key를 먼저 쓴다. 그 다음 세 개 이름을 공유하는 여섯 세계 대신에 그것 안에 사는 여섯 개의 짧은, 구체적인 지시사항을 쓴다. 가장 가깝다고 생각되는 클립을 포크해, 한 줄을 바꾸고, 뭐가 부서지는지 보기 전에 프롬프트가 잘못되었다고 결정하기.