AI 영상 23개를 같은 조건으로 뽑았다—싼 모델이 더 정확한 순간

동일한 장면 프롬프트를 19개 모델에 넣어 23개 결과를 만든 Viralance의 실제 파일 측정표 에서는 PixVerse V6가 4크레딧, 약 0.72달러로 요청한 720×1280 세로 화면과 5초 길이, 오디오 트랙을 모두 전달했다. 가장 싼 Hailuo 2.3은 3크레딧, 약 0.54달러였지만 세로 요청과 달리 1366×768 가로 파일을 냈고, 같은 4크레딧인 Kling 2.5 Turbo Pro와 LTX-2 19B도 요청한 화면비를 지키지 못했다.
따라서 저가 모델이 더 정확해지는 순간은 ‘가장 아름다운 영상’을 고를 때가 아니라 정해진 화면비·길이·오디오가 포함된 납품 파일을 요구할 때다. 다만 제목의 ‘같은 조건’은 동일한 장면 문장을 뜻한다. 생성 방식과 요청 길이, 해상도, 화면비는 결과별로 달랐으므로 23개 파일을 완전히 통제된 화질 토너먼트로 해석해서는 안 된다.
화질 순위와 파일 실측은 다른 질문에 답한다
AI 영상 모델을 고를 때는 사람이 판단하는 품질표와 파일에서 확인하는 규격표를 분리해야 한다. 전자는 장면의 설득력과 움직임, 지시 이행을 비교하고, 후자는 결과물이 편집·게시·납품 조건을 충족하는지 판정한다.
Creative AI News의 6개 모델 비교 는 Runway Gen-4.5 Turbo, Kling 3.0, Veo 3.1, Pika 2.2, Hailuo 2.3, LTX Video 2.3을 세 가지 표준 프롬프트와 시각 품질·움직임 일관성·프롬프트 충실도·생성 속도·비용 효율의 다섯 축으로 평가했으며, Hailuo 2.3에는 총점 42.0점, Runway에는 시각 품질과 프롬프트 충실도 각각 9.5점, Kling에는 움직임 일관성 9.5점을 부여했다.
이 점수는 한 제작자가 같은 환경에서 여섯 모델의 결과를 직접 블라인드 채점한 값이 아니다. 해당 매체는 공개 리더보드, 자동 벤치마크, 공식 문서와 기존 비교 자료를 종합했다고 밝힌다. 상대적인 강점을 탐색하는 참고표로는 쓸 수 있지만, 특정 계정과 설정에서 같은 결과가 재현된다는 보장은 없다.
23개 파일이 보여 준 것은 납품 적합성이다

파일 실측은 주관적인 영상미 대신 실제 해상도, 재생 시간, 오디오 스트림 유무와 생성 비용을 기록했다. 화면에 표시된 설정이나 제품 소개 문구가 아니라 내려받은 MP4를 ffmpeg로 검사했다는 점이 핵심이다. 덕분에 세로를 요청했는데 가로 파일이 도착하거나, 선택한 길이 대신 모델의 고정 길이가 적용되는 문제를 구분할 수 있다.
반대로 해상도가 높다고 털의 질감이나 달리는 동작까지 더 자연스럽다는 뜻은 아니다. 프롬프트 충실도 역시 두 층으로 나뉜다. 강아지와 초원, 조명 같은 장면 내용을 따르는지와 세로 화면비·재생 시간·음향처럼 전달 규격을 지키는지는 별도로 판정해야 한다.
또한 텍스트 투 비디오와 이미지 투 비디오가 섞여 있고 요청 옵션도 동일하지 않으므로, 모델 사이의 절대 화질 차이를 이 표만으로 단정할 수 없다. 이 자료가 강하게 말해 주는 것은 어떤 구성에서 요청과 실제 파일이 일치했는지, 그리고 불일치가 후반 작업을 늘릴 수 있는지다.
‘싼 모델이 더 정확하다’는 규격 조건부 결론이다

PixVerse V6 사례의 장점은 최저가 자체가 아니라 저비용 구간에서 화면비와 오디오를 함께 맞췄다는 데 있다. 더 싼 결과가 세로 요청을 지키지 못했고, 비슷한 비용의 다른 결과도 가로나 4:3에 가까운 파일을 반환했다. 세로 숏폼 초안에서는 픽셀 수가 조금 높은 가로 영상보다 바로 편집 타임라인에 올릴 수 있는 세로 파일이 더 정확한 선택일 수 있다.
하지만 이 결론을 전체 화질로 확대하면 안 된다. 저렴해도 화면비를 어길 수 있고, 비싼 모델은 더 높은 해상도나 긴 재생 시간, 복잡한 움직임에서 비용을 정당화할 수 있다. ‘정확하다’는 말은 프로젝트가 먼저 정한 실패 조건을 얼마나 잘 피했는지에 관한 판단이다.
가격 비교에도 범위가 있다. 실측표의 달러 금액은 Viralance의 대용량 크레딧 팩 단가를 적용한 값이어서 각 모델 개발사의 직접 구독료나 API 요금과 같지 않다. 플랫폼, 요금제, 해상도와 오디오 옵션이 바뀌면 동일 모델의 실제 제작비도 달라진다.
길이와 오디오는 모델명보다 생성 모드가 중요하다
요청한 재생 시간을 모델이 지원하지 않으면 짧은 결과를 다시 만들거나 편집에서 늘려야 한다. 이때 화면에 보이는 1회 생성 가격은 싸더라도 승인 가능한 한 컷의 비용은 올라간다. 고정 길이인 모드와 길이를 선택할 수 있는 모드는 같은 모델 계열 안에서도 구분해야 한다.
오디오 역시 ‘모델이 지원한다’와 ‘다운로드 파일에 실제 트랙이 있다’가 다르다. 무음 옵션을 선택해 트랙이 없는 결과는 오류가 아니지만, 음향이 필요한 작업이라면 선택 상태와 추가 비용을 생성 전에 확인해야 한다. 립싱크나 대사 자연스러움은 트랙 존재 여부만으로 판단할 수 없으므로 별도의 청취 평가가 필요하다.
Google의 Gemini API 영상 문서 는 Veo 3.1을 네이티브 오디오와 영상 확장, 특정 프레임 제어를 지원하는 모델로 설명한다. 이는 공식 기능 범위이며, 중개 플랫폼에서 특정 모드로 받은 파일의 길이와 가격을 보장하는 문구는 아니다. 같은 Veo 계열이라도 API와 중개 서비스, 텍스트·이미지 입력 방식이 다르면 전달 조건을 다시 봐야 한다.
화질 우선 작업에서는 주관 평가가 다시 중요해진다

최종 광고나 시네마틱 장면은 규격 통과만으로 결정하기 어렵다. 인물과 물체의 형태가 프레임 사이에서 유지되는지, 복잡한 동작이 무너지지 않는지, 재질과 조명이 제품 지시를 따르는지를 사람이 봐야 한다. 이 단계에서는 공개 품질 비교에서 강점을 보인 Runway나 Kling 계열이 저가 규격 시험보다 유용한 후보가 될 수 있다.
다만 종합점수 1위도 모든 품질 항목의 1위를 뜻하지 않는다. 비용 효율을 크게 반영한 총점은 고품질 한 컷을 위한 순위와 대량 시안 제작용 순위를 섞을 수 있다. 제작팀은 시각 품질, 움직임, 프롬프트 충실도의 가중치를 프로젝트에 맞게 다시 정해야 한다.
비용 단위도 통일해야 한다. Runway의 공식 요금표 에서 Gen-4.5는 5초당 60크레딧, 즉 생성 영상 1초당 12크레딧을 사용한다. 월정액에 포함된 크레딧과 다른 플랫폼의 환산 달러를 바로 비교하기보다, 재생성 횟수를 포함해 승인된 완성 컷 하나에 필요한 크레딧을 계산해야 한다.
콘텐츠에 따라 통과 조건부터 달라진다
- 세로 숏폼: 9:16 출력, 필요한 재생 시간과 오디오 트랙을 필수 조건으로 두고, 이를 통과한 후보끼리 움직임과 비용을 비교한다.
- 제품 광고: 제품 형태와 재질, 반사, 로고 영역의 안정성이 우선이다. 파일 규격을 통과한 뒤 제품 촬영 프롬프트의 시각적 충실도를 따로 평가해야 한다.
- 시네마틱 액션: 해상도보다 시간적 일관성과 물리 표현에 높은 가중치를 줄 수 있다. 실패한 생성까지 포함한 승인 컷당 비용이 1회 가격보다 중요하다.
- 오디오 포함 영상: 네이티브 오디오 지원 여부, 실제 파일의 오디오 스트림, 대사와 립싱크 품질을 서로 다른 항목으로 본다.
- 저예산 콘티: 최고 해상도보다 화면비와 구도, 주요 동작 지시를 안정적으로 재현하는지가 후반 수정량을 좌우한다.
보편적 1위 대신 두 개의 평가표가 필요하다
첫 번째 표에는 시각 품질, 움직임 일관성, 장면 프롬프트 충실도를 넣고 사람이 결과를 평가한다. 두 번째 표에는 실제 해상도와 화면비, 재생 시간, 오디오 트랙, 생성 비용을 기록한다. 서로 다른 성격의 점수를 하나의 총점으로 합치지 않는 것이 중요하다.
프로젝트의 필수 규격을 두 번째 표로 먼저 거른 뒤, 남은 후보를 첫 번째 표에서 비교하면 제목의 역전이 설명된다. 세로 화면과 오디오가 절대 조건인 작업에서는 저가 모델이 더 정확할 수 있고, 복잡한 움직임과 질감이 핵심인 장면에서는 더 비싼 모델이 합리적일 수 있다. 23개 파일이 보여 준 것은 저가 모델의 승리가 아니라, 가격·화질·지시 이행·파일 사양이 서로 다른 선택 축이라는 사실이다.
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.