GPT Image 2 + LTX 2.5로 58초 숏 무비 만들기 — 캐릭터 일관성의 한계 — 대표 이미지

GPT Image 2 + LTX 2.5로 58초 숏 무비 만들기 — 캐릭터 일관성의 한계

2026년 8월 19일4
작성 DevSnack Lab직접 실행·측정·판단 기록
완료🎬 AI 영상GPT Image 2LTX 2.5I2V캐릭터 일관성identity drift실험

한 문장으로 요약

GPT Image 2로 만든 캐릭터 기준 시트를 LTX 2.5의 모든 장면에 참조 이미지로 넣으면 캐릭터 일관성이 좋아질까? 이 실험의 답은 부분적으로만 그렇다였다. 6개 장면을 58초 영상으로 연결하는 파이프라인은 완주했지만, 장면이 진행될수록 눈·코·입·턱선이 달라져 동일 인물이라는 보장은 유지되지 않았다.

한눈에 보는 결과

  • 파이프라인: GPT Image 2 Medium → 2×2 캐릭터 기준 시트 → 장면 이미지 6장 → LTX 2.5 I2V → native audio → 영상 합성
  • 최종 영상: 58초, 1280×704, 24fps, H.264 NVENC, AAC 48kHz stereo
  • 장면 구성: 10초 클립 6개, 장면 사이 0.45초 xfade/acrossfade
  • 생성 시간: 채택 클립 6개 합계 1,125.513초, 약 18분 46초
  • 가장 중요한 발견: 프레임 품질과 캐릭터 동일성은 별개의 검증 항목이다

이번 결과물은 완성 영화라기보다, 캐릭터 기준 이미지와 영상 생성 모델을 연결한 first-pass baseline이다. 얼굴 불일치를 숨기기 위해 장면을 다시 만들지 않고, 현재 파이프라인이 어디까지 유지되는지 그대로 기록했다.

실험 질문과 설계

장면마다 캐릭터를 새로 설명하면 생성 모델은 얼굴·헤어·의상·조명을 함께 다시 해석한다. 이때 장면 자체는 자연스러워도 인물이 다른 사람처럼 바뀔 수 있다. 이번 실험에서는 캐릭터 설명을 매번 새로 만드는 대신, 먼저 기준 시트를 만들고 그 이미지를 모든 장면에 반복해서 제공했다.

검증하려는 가설은 단순하다.

하나의 캐릭터 시트를 먼저 고정하고 모든 장면 이미지에 같은 시트를 참조로 사용하면, 장면별 독립 생성보다 identity drift를 줄일 수 있는가?

영상은 6개 장면으로 구성했다.

장면핵심 이벤트
1서울 옥상에서 이상한 빛을 발견
2스마트폰에서 나온 포털에 빨려 들어감
3달빛 숲에서 스마트폰이 별의 유물로 변함
4마법 고리가 인물을 선택하고 의상이 변함
5그림자 늑대의 공격을 마법 방패로 막음
6포털이 닫힌 뒤 이세계 라이브의 시작을 선언

전체 파이프라인

단계사용 기술역할
캐릭터 기준GPT Image 2 Medium정면·3/4·전신·측면이 포함된 2×2 시트 생성
장면 이미지GPT Image 2 + 기준 시트얼굴·헤어·귀걸이·체형을 고정하고 환경만 변경
영상화LTX 2.5 distilled NVFP4시작 이미지에서 움직임·카메라·대사·환경음 생성
합성xfade/acrossfade6개 클립을 하나의 프롤로그로 연결
검증ffprobe·프레임 추출·비교 시트출력 포맷, 해부학적 품질, identity drift 확인

이미지와 영상의 역할도 분리했다. 이미지 프롬프트는 “누가 어디에 있고 무엇이 프레임 안에 보여야 하는가”를 정의하고, 영상 프롬프트는 “정지 이미지에서 무엇이 어떻게 움직이는가”를 정의한다. 한 장면에 포털·추락·괴물·대사·카메라 이동을 모두 넣는 대신, 장면마다 하나의 지배 이벤트를 두었다.

캐릭터 기준 시트 전략

기준 시트에는 다음 identity anchor를 반복했다.

  • 타원형 얼굴과 부드러운 광대
  • 짙은 갈색 아몬드형 눈
  • 왼쪽 눈 바깥쪽 아래의 작은 점
  • 살짝 비껴난 가르마의 긴 검은 머리
  • 얼굴을 감싸는 두 가닥의 머리
  • 양쪽 은색 초승달 귀걸이
  • 슬렌더한 체형

장면별로 바꾼 것은 의상·환경·조명·자세다. 얼굴·헤어·귀걸이·체형은 가능한 한 고정했다. 영상 모델이 새 대상을 갑자기 만들어내지 않도록 괴물·유물·마법 방패 같은 요소는 시작 이미지 안에 미리 배치했다.

이 전략은 장면 이미지의 구성과 분위기를 맞추는 데는 도움이 됐다. 다만 reference image가 있다고 해서 생성 모델이 얼굴의 모든 기하학적 특징을 픽셀 단위로 고정하는 것은 아니다. 기준 시트는 강한 조건이지만, 영상 프레임에서 identity를 보장하는 잠금장치는 아니다.

LTX 2.5 영상 생성 결과

각 클립은 ComfyUI에 큐를 넣은 시점부터 결과 MP4를 내려받을 때까지의 wall-clock으로 측정했다. 모델 로딩·GPU 샘플링·오디오 생성이 모두 포함된 시간이다.

클립생성 시간출력
Scene 1 재생성본204.763초10.041667초, 1280×704
Scene 2184.297초10.041667초, 1280×704
Scene 3186.321초10.041667초, 1280×704
Scene 4177.417초10.041667초, 1280×704
Scene 5182.539초10.041667초, 1280×704
Scene 6190.176초10.041667초, 1280×704
합계1,125.513초약 18분 46초

Scene 1은 첫 시도에서 얼굴이 크게 늘어지는 문제가 있어 폐기하고 한 번 더 생성했다. 폐기본까지 포함하면 클립 생성에 사용한 시간은 약 1,346.223초, 22분 26초다. 최종 MP4는 58초, 1280×704, 24fps, H.264 NVENC, AAC 오디오로 완성됐다.

LTX 2.5 native audio도 장면별로 생성됐다. 이번 실험에서 오디오가 포함된 영상 파일이 정상적으로 만들어졌다는 점은 확인했지만, 이 글의 핵심 평가는 음성 자연스러움보다 캐릭터 identity 보존에 둔다.

가장 중요한 결과: 자연스러운 프레임과 같은 사람은 다르다

개별 장면만 보면 결과는 대부분 사용할 수 있는 수준이었다. 눈이 세 개가 되거나 손가락이 크게 무너지는 장면처럼 즉시 폐기해야 할 해부학적 오류는 두드러지지 않았다. 문제는 기준 시트와 6개 장면의 프레임을 한 화면에 놓고 비교했을 때 나타났다.

유지된 요소:

  • 여성 캐릭터라는 큰 범주
  • 긴 검은 머리
  • 전체적인 패션 화보 분위기
  • 장면별 환경과 마법 연출

달라진 요소:

  • 눈의 크기와 간격
  • 코의 길이와 콧방울 형태
  • 입술 모양
  • 턱선과 볼의 폭
  • 얼굴의 세로 비율
  • 눈 아래 점의 가시성
  • 정면과 3/4 시점에서의 인상

따라서 결과를 “같은 캐릭터가 조금 변형됐다”고 표현하기보다, 비슷한 콘셉트의 다른 인물이 장면마다 등장했다고 표현하는 편이 정확하다. 캐릭터 일관성을 평가할 때는 “프레임이 자연스러운가?”와 “기준 시트와 같은 사람인가?”를 별도의 질문으로 분리해야 한다.

왜 첫 검증에서 놓쳤을까

기존 검증은 얼굴·손·소품·포털 아티팩트 같은 개별 프레임의 사용 가능성을 확인하는 데 집중했다. 이 검사는 해부학적 품질을 보는 데는 적합하지만, identity drift를 잡는 검사와는 목적이 다르다.

이번 결과에서 드러난 검증 프로토콜의 문제는 세 가지다.

  1. 기준 시트와 각 장면을 같은 시점의 프레임으로 비교하지 않았다.
  2. “자연스러운 얼굴”과 “동일한 얼굴”을 하나의 판정으로 처리했다.
  3. 얼굴이 가려진 장면에도 동일한 identity 판정을 적용하려 했다.

Scene 5는 뒷모습 비중이 높고, Scene 6은 얼굴 일부가 가려져 동일성 확인 자체가 어렵다. 이런 장면은 실패로 단정할 것이 아니라 identity 미검증 구간으로 분류해야 한다.

다음부터는 해부학적 품질 gate와 cross-scene identity gate를 분리한다. 얼굴이 충분히 보이는 장면만 동일성 판정을 내리고, 가려진 장면은 별도 상태로 표시한다. 가능하면 이미지 비교 시트와 face similarity 측정도 함께 사용한다.

distilled 모델이 원인일까?

이번 결과만으로 LTX 2.5 distilled 모델이 identity drift의 원인이라고 단정할 수는 없다. 실험에는 여러 변수가 동시에 포함되어 있다.

  • GPT Image 단계에서 장면 이미지의 얼굴이 이미 달라졌을 가능성
  • 시작 이미지에서 영상 프레임으로 넘어가는 과정
  • distilled 모델의 빠른 샘플링 특성
  • 2-pass upscale/refine 과정
  • LoRA와 양자화 경로
  • 10초 안에 대사·시선·소품·카메라 이동을 함께 처리한 프롬프트

후속 실험은 전체 6개 장면을 다시 만드는 대신 얼굴이 잘 보이는 Scene 1·3·4를 선정한다. 동일한 시작 이미지를 사용해 distilled와 base 모델을 비교하고, 가능하면 steps 변화도 분리해 측정한다. 이렇게 해야 모델 종류·샘플링 단계·프롬프트 복잡도 중 무엇이 영향을 주는지 구분할 수 있다.

자동화 파이프라인으로서의 의미

영화 결과만 보면 이번 1회차는 불완전하다. 그러나 제작 파이프라인의 연결성은 확인됐다.

  • GPT Image로 기준 시트 생성
  • 같은 reference image를 모든 장면에 재사용
  • 장면별 프롬프트 자동 로딩
  • ComfyUI에 이미지 업로드와 LTX 워크플로 수정
  • 6개 영상 큐잉과 생성 완료 대기
  • MP4 다운로드와 ffprobe 검증
  • 영상 프레임 추출과 얼굴 비교 시트 생성
  • xfade/acrossfade 합성
  • 공개용 미디어 구성

이 결과는 “AI가 영화를 완성했다”는 증거가 아니다. 대신 이미지·영상·파일 처리·검증을 하나의 실행 흐름으로 연결할 수 있고, 그 흐름 안에서 어떤 품질 gate가 빠졌는지 추적할 수 있다는 의미가 있다.

다음 실험에서 바꿀 것

  1. 기준 시트와 장면별 동일 시점 프레임 비교 시트 생성
  2. 해부학적 품질과 identity 보존을 별도 점수로 기록
  3. 얼굴이 잘 보이는 2~3개 장면만 distilled/base 비교
  4. 동일 프롬프트에서 steps만 바꾼 비교 추가
  5. 가려진 얼굴은 실패가 아니라 identity 미검증으로 표시
  6. 생성 속도와 identity 품질을 함께 기록해 실용적인 trade-off 확인

결론

GPT Image 2 기준 시트와 LTX 2.5를 조합하면, 6개 장면을 하나의 58초 숏 무비로 연결하는 제작 흐름은 충분히 만들 수 있다. 하지만 기준 시트를 참조 이미지로 반복해서 넣는 것만으로는 동일 인물의 얼굴을 보장하지 못했다.

이번 실험에서 얻은 가장 중요한 교훈은 모델 선택보다 먼저 검증 질문을 분리해야 한다는 점이다. “영상이 자연스러운가?”와 “처음의 그 사람인가?”는 같은 질문이 아니다. 다음 실험에서는 이 둘을 별도 gate로 측정해야 캐릭터 일관성 개선 여부를 제대로 판단할 수 있다.

참고 자료