For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ko/articles/vidu-q4-preview-review-4k-ai-video-16s-cl-b7ef8d69.md.
AI 동영상은 일반적으로 생성 실패 한 번의 비용도 부담스러울 만큼 비쌉니다.

AI 동영상은 일반적으로 생성 실패 한 번의 비용도 부담스러울 만큼 비쌉니다.
원문 작성자는 ShengShu Technology의 최신 플래그십 동영상 생성 모델인 Vidu Q4 Preview를 테스트했고, 매우 다른 비용 구조를 확인했습니다.
Vidu의 기간 한정 웹 제품 프로모션을 이용하면 GTA 6 스타일의 배경에서 약 1분 분량의 “악당 할머니” 동영상을 제작하는 데 약 다음과 같은 비용이 들었습니다.
총 ¥5.4
≈ 생성된 초당 ¥0.09
이 시작 가격이 실험을 흥미롭게 만드는 요소입니다.
다만, 한 가지 중요한 조건을 명확히 해야 합니다.
초당 ¥0.09는 프로모션 SaaS 가격이며, Vidu의 일반 API 요금이 아닙니다.
Vidu의 공식 API 플랫폼에는 현재 Q4 Preview가 더 높은 해상도별 크레딧 요율로 책정되어 있습니다.
모델 자체는 단순한 저비용 생성기 그 이상입니다.
Vidu Q4 Preview는 다음을 지원합니다.

원문은 벤치마크 수치보다 제작자가 즉시 확인할 수 있는 요소, 즉 연기, 카메라 언어, 시각 효과, 일관성, 그리고 저렴한 재시도가 창작 과정에 미치는 변화에 더 초점을 맞춥니다.
테스트 작업 흐름은 간단합니다.
Vidu의 레퍼런스-동영상 페이지에서 다음 단계를 수행합니다.
원문에는 이 설정 인터페이스의 스크린샷이 포함되어 있었지만, 준비 과정에서 해당 원본 이미지를 안정적으로 가져올 수 없었기 때문에 여기에는 재현하지 않았습니다.
Vidu의 공식 문서는 기본 레퍼런스-동영상 변환 매개변수를 다음과 같이 확인합니다.
| 설정 | 지원 값 |
|---|---|
| 모델 | viduq4-preview |
| 레퍼런스 이미지 | 1~15개 |
| 레퍼런스 오디오 | 0~3개 |
| 재생 시간 | 3~16초 |
| 화면 비율 | 1:1, 9:16, 16:9, 3:4, 4:3 |
| 해상도 | 540p, 720p, 1080p, 2K, 4K |
| 오디오-동영상 출력 | 지원 |
각 레퍼런스 오디오 클립은 3~12초 길이일 수 있으며, 현재 MP3 입력으로 문서화되어 있습니다.
첫 번째 실용 테스트는 연기 표현에 초점을 맞췄습니다.
도입부 예시에 사용된 “악당 할머니” 캐릭터 대신, 작성자는 영어로 대화하는 외국인 남성과 여성을 사용했습니다.
결과에서 유용했던 부분은 극적인 울음이나 과장된 움직임이 아니었습니다.
오히려 더 조용한 영화 언어 테스트였습니다.
작성자는 한 번의 생성만으로도 안정적인 숄더 리버스 숏 구조를 유지할 수 있었다고 평가했습니다.
이는 대화 장면이 AI 동영상의 약점을 빠르게 드러내기 때문에 중요합니다.
큰 얼굴 움직임은 때때로 작은 불일치를 감출 수 있습니다.
하지만 말없이 멈춰 있는 장면에서는 그렇지 않습니다.
캐릭터는 여전히 같은 사람처럼 보여야 하고, 동일한 감정 상태를 유지해야 하며, 카메라가 바뀌는 동안에도 공간적으로 일관성을 유지해야 합니다.
두 번째 예시는 대화에서 전투로 전환했습니다.
“Spark 279”라는 Vidu 사용자는 약 10초 분량의 만화 스타일 전투 장면을 제작했습니다.
원문은 다음 요소를 강조합니다.
액션은 대화와는 다른 실패 양상을 보입니다.
빠른 전투 장면에서 모델은 다음을 계속 추적해야 합니다.
캐릭터의 정체성
+
신체 위치
+
카메라 위치
+
움직임의 방향
+
환경의 기하 구조
+
효과의 타이밍
이 중 하나라도 어긋나면 클립은 즉시 인공적으로 느껴지기 시작합니다.
원문 작성자는 Q4 Preview가 가격대에 비해 이러한 관계를 이례적으로 잘 유지했다고 평가했습니다.
이는 표준화된 벤치마크가 아니라 정성적 테스트입니다. 그러나 생성형 동영상을 실제로 평가하는 방식과 맞닿아 있습니다.
다음 테스트에서는 거대한 공상과학 환경으로 이동했습니다.
구성은 구름 바다 위에 거대한 매달린 구조물이 있고, 관측 플랫폼 위의 우주비행사가 그 구조물을 바라보는 장면이었습니다.
가장 중요한 세부 요소는 구조물 자체가 아니었습니다.
조명이었습니다.
기계가 빛을 발하자 따뜻한 주황색 빛이 다음 요소에도 나타났습니다.
구조물의 밝기가 낮아지자 장면은 다시 차가운 색조로 돌아왔습니다.
원문은 이를 통해 유용한 차이를 설명합니다.
시각 효과가 프레임의 한 부분에 단순히 “칠해진” 것이 아니라면 더 설득력 있게 느껴집니다.
주변 환경도 함께 변해야 합니다.
예를 들면 다음과 같습니다.
폭발
→ 주변 표면이 더 밝아짐
→ 연기가 움직임을 따라감
→ 입자가 장면에 반응함
→ 캐릭터의 움직임이 동기화된 상태를 유지함
Q4 Preview는 더 강력한 영화적 효과, 장면 상호작용, 카메라 역동성을 중심으로 명시적으로 포지셔닝되어 있습니다.
작성자는 커피 광고도 시도했습니다.
이런 종류의 클립은 액션 시퀀스보다 덜 극적이지만, 상업적 AI 동영상 활용을 더 잘 대표합니다.
제품 동영상에는 다음이 필요합니다.
원문은 결과를 간단히 매끄럽고 사용할 만하다고 설명합니다.
이러한 작업은 Q4 Preview와 같은 모델의 가장 강력한 상업적 근거 중 하나일 수 있습니다.
제작자는 다음과 같은 여러 버전을 생성할 수 있습니다.
모든 재시도를 중요한 예산 결정으로 여기지 않고도 제작할 수 있습니다.
이 부분은 원문에서 가장 중요한 사실관계상의 설명입니다.
원문은 다음과 같이 말합니다.
초당 약 ¥0.09
또한 총 약 110초 분량의 클립 6개를 제작하는 데 ¥10 미만이 들었다고 전합니다.
이 계산은 기간 한정 SaaS 시작 가격과 일치합니다.
110 × ¥0.09 ≈ ¥9.90
하지만 Vidu의 표준 API 가격은 다릅니다.
Vidu의 공식 중국 API 플랫폼에는 현재 다음과 같이 표시되어 있습니다.
크레딧 1개 = ¥0.03125
Q4 Preview의 사용량은 다음과 같습니다.
| 해상도 | 초당 크레딧 | 대략적인 초당 위안화 비용 |
|---|---|---|
| 540p | 9 | ¥0.28125 |
| 720p | 19 | ¥0.59375 |
| 1080p | 24 | ¥0.75 |
| 2K | 38 | ¥1.1875 |
| 4K | 78 | ¥2.4375 |
따라서 API에서 10초 분량을 생성하는 비용은 대략 다음과 같습니다.
| 해상도 | 10초 비용 |
|---|---|
| 540p | ¥2.81 |
| 720p | ¥5.94 |
| 1080p | ¥7.50 |
| 2K | ¥11.88 |
| 4K | ¥24.38 |
원문에서 API 720p는 “초당 약 ¥0.6”, 1080p는 “초당 약 ¥0.75”라고 설명한 것은 정확합니다.
해당 사례는 표준 API 과금이 아니라 웹 제품 프로모션을 사용했기 때문입니다.
Vidu는 Q4 Preview를 프로모션 SaaS 가격으로 출시했으며, 일부 생성 모드의 비용을 몇 자오 수준까지 낮출 수 있었습니다. 가장 낮게 광고된 경우에는 초당 ¥0.09였습니다.
중요한 원칙은 다음과 같습니다.
Vidu의 가격이 SaaS 프로모션 사용, API 크레딧, 해상도, 요금제 할인 또는 일시적인 출시 혜택 중 무엇을 가리키는지 항상 확인해야 합니다.
이 수치들은 서로 바꿔 사용할 수 없습니다.
실제 테스트 이후 원문은 모델 자체로 초점을 옮깁니다.
Vidu는 Q4를 표현력 있는 동영상 성능에 초점을 맞춘 차세대 플래그십으로 포지셔닝합니다.
Preview 출시는 다음 세 영역을 강조합니다.
이 영역들은 AI 생성 동영상에서 자주 발생하는 실패 양상과 밀접하게 연결됩니다.
많은 생성 캐릭터는 이미 사실적인 외형을 보여줍니다.
더 어려운 문제는 캐릭터가 실제로 연기하고 있는 것처럼 보이지 않는다는 점입니다.
일반적인 실패는 다음과 같습니다.
무표정
→ 갑작스러운 미소
→ 갑작스러운 슬픔
상태 사이의 감정적 전환이 거의 없습니다.
원문은 Q4 Preview가 다음 요소의 미세한 변화를 눈에 띄게 더 잘 표현한다고 주장합니다.
이 때문에 작성자는 폭발과 액션만이 아니라 대화 장면에 많은 시간을 할애했습니다.
미묘한 연기는 종종 더 어려운 테스트입니다.
목소리 역시 연기의 일부입니다.
레퍼런스-동영상 변환은 최대 다음을 지원합니다.
레퍼런스 오디오 클립 3개
Vidu의 공식 제품 페이지는 이를 생성된 장면 전반에서 캐릭터의 목소리를 유지하는 데 도움을 주는 음성 레퍼런스로 설명합니다.
오디오는 단순히 무관한 사운드트랙이 아닙니다.
목표는 다음 요소를 시각적 연기와 일치시키는 것입니다.
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
이는 캐릭터가 서로 다른 감정으로 여러 장면에 등장할 때 중요합니다.
모델은 동일한 음성 정체성을 사용하면서 전달 방식을 바꿀 수 있습니다.
두 번째 초점은 촬영 기법입니다.
원문은 다음과 같은 움직임을 강조합니다.
공식 Q4 페이지 역시 멀티 샷 스토리텔링과 매끄러운 카메라 움직임을 강조합니다.
개선된 부분 중 유용한 요소는 이러한 움직임 중에도 피사체의 일관성이 유지된다는 점입니다.
더 어려운 문제는 카메라를 움직이는 것이 아닙니다.
카메라가 움직이는 동안 다음을 보존하는 것입니다.
피사체의 정체성
+
공간적 관계
+
장면의 기하 구조
Q4 Preview는 한 번의 생성 안에서 더 넓은 시야와 더 좁은 시야를 오갈 수도 있습니다.
단일 클립의 최대 재생 시간은 다음과 같습니다.
16초
이는 짧은 액션 비트나 멀티 샷 장면을 구현하기에 충분한 시간을 제공합니다.
세 번째 초점은 시각 효과입니다.
원문은 다음과 같은 핵심을 짚습니다. 폭발을 묘사하는 것은 쉽습니다.
폭발 주변의 모든 요소가 올바르게 반응하도록 만드는 일은 더 어렵습니다.
완성도 높은 결과에는 다음이 필요합니다.
공상과학 테스트는 이러한 통합된 효과 동작의 사례로 제시됩니다.
다시 말해, 이는 공식 벤치마크가 아니라 주관적인 제작자 테스트입니다.
하지만 제작 방식에 가까운 생성형 동영상의 실용적 평가 기준이 될 수 있습니다.
Vidu Q4 Preview는 다음 해상도로 직접 생성할 수 있습니다.
540p
720p
1080p
2K
4K
이는 Vidu 제품 페이지와 API 모두에 문서화되어 있습니다.
Q4 Preview의 이미지-동영상 변환 및 레퍼런스-동영상 변환 인터페이스에 적용됩니다.
이는 AI 동영상 제품에서 “4K 지원”이 여러 의미를 가질 수 있기 때문에 중요합니다.
여기서 4K는 별도의 서드파티 업스케일 작업만을 의미하는 것이 아니라, 공식 생성 API에서 선택할 수 있는 기본 출력 해상도로 제시됩니다.
대신 비용이 높아집니다.
표준 API 요율에서 4K는 다음을 사용합니다.
초당 78크레딧
≈ 초당 ¥2.4375
따라서 제작자는 초당 ¥0.09라는 프로모션 광고가 4K API 생성에도 적용된다고 가정해서는 안 됩니다.
마지막 기술적 초점은 레퍼런스 용량입니다.
Q4 Preview는 레퍼런스-동영상 모드에서 다음을 지원합니다.
레퍼런스 이미지 1~15개
이를 통해 제작자는 에셋을 분리해 구성할 수 있습니다.
예를 들면 다음과 같습니다.
레퍼런스 1:
주인공
레퍼런스 2:
두 번째 캐릭터
레퍼런스 3:
의상
레퍼런스 4:
소품
레퍼런스 5:
장소
레퍼런스 6:
시각적 스타일
그런 다음 프롬프트에서 이러한 레퍼런스가 어떻게 상호작용하는지 설명할 수 있습니다.
이는 같은 캐릭터가 다음 장소 사이를 이동하는 스토리에 유용합니다.
장면이 바뀔 때마다 외형이 달라지지 않도록 하는 것입니다.
레퍼런스 용량이 완벽한 일관성을 보장하는 것은 아닙니다. 하지만 모델이 참고할 수 있는 명시적 정보를 더 많이 제공합니다.
원문의 마지막 주요 섹션은 실제로 반복 작업에 관한 내용입니다.
AI 동영상 생성에는 이미 게임에서 말하는 “카드를 뽑는 것”과 유사한 개념이 있습니다.
여러 버전을 생성한 뒤 그중 하나가 적합하기를 기대하는 것입니다.
이는 반드시 실패를 의미하지는 않습니다.
변형은 생성형 창작 작업의 일부입니다.
문제는 비용입니다.
시도할 때마다 비용이 많이 들면 제작자는 탐색을 멈춥니다.
저렴한 재시도 루프는 과정을 바꿉니다.
생성
→ 검토
→ 프롬프트 수정
→ 재시도
→ 비교
→ 가장 좋은 결과 유지
생성 버튼을 누르기 전에 프롬프트를 완벽하게 만들려고 하기보다, 제작자는 여러 해석을 테스트할 수 있습니다.
이것이 프로모션 가격인 초당 ¥0.09가 갖는 진정한 의미입니다.
장기 가격이나 API 가격이 더 높더라도 생성 비용이 낮아지면 실험에 따르는 부담이 줄어듭니다.
원문은 이러한 경험을 다음과 같이 요약합니다.
“같은 비용으로 5배 더 많은 영상을 살 수 있습니다.”
이는 모든 경쟁 모델과 비교한 보편적인 가격 비교가 아닙니다.
프로모션 Q4 Preview 가격이 자신의 테스트 예산을 어떻게 바꿨는지에 대한 작성자의 설명입니다.
각 숏을 두세 번씩 생성한다면, 테이크당 비용이 낮은 것이 큰 차이를 만들 수 있습니다.
제작자에게 유용한 지표는 단순히 다음이 아닙니다.
생성된 초당 비용
다음과 같은 지표가 더 중요합니다.
사용 가능한 초당 비용
모델이 저렴하더라도 10번의 재시도가 필요하다면 실질적인 제작 비용은 여전히 높을 수 있습니다.
일관성과 연기 표현이 충분히 개선되어 재시도가 줄어든다면 경제성은 두 가지 측면에서 좋아집니다.
더 낮은 생성 가격
+
창작 실패 테이크 감소
원문은 Vidu의 SaaS 제품과 MaaS/API 플랫폼을 모두 언급하지만, 두 제품은 서로 다른 작업 흐름을 지원합니다.
다음 작업을 원하는 제작자에게 적합합니다.
다음이 필요한 팀에 적합합니다.
API에서 사용하는 공식 모델 ID는 다음과 같습니다.
viduq4-preview
이미지-동영상 변환 엔드포인트:
POST /ent/v2/img2video
레퍼런스-동영상 변환 엔드포인트:
POST /ent/v2/reference2video
이 엔드포인트 이름은 참고용으로 포함했습니다. 원문에는 API 코드 예시가 포함되어 있지 않았습니다.
| 기능 | 공식 Q4 Preview 지원 여부 |
|---|---|
| 모델 ID | viduq4-preview |
| 이미지-동영상 변환 | 지원 |
| 레퍼런스-동영상 변환 | 지원 |
| 텍스트-동영상 변환 | 현재 Q4 Preview 모델 맵에서는 미지원 |
| 시작/종료 프레임 모드 | 현재 Q4 Preview 모델 맵에서는 미지원 |
| 해상도 | 540p~4K |
| 프레임 속도 | 24fps |
| 재생 시간 | 3~16초 |
| 레퍼런스 이미지 | 최대 15개 |
| 레퍼런스 오디오 | 최대 3개 |
| 오디오-동영상 생성 | 지원 |
| 자동 카메라 전환 | 지원 |
| 레퍼런스 오디오 길이 | 각각 3~12초 |
| 레퍼런스 오디오 형식 | MP3 |
| 화면 비율 | 1:1, 9:16, 16:9, 3:4, 4:3 |
이 표는 현재 Vidu 문서를 반영한 것으로, 모든 Vidu 제품 기능이 모든 Q4 Preview 생성 모드에서 지원된다고 보는 것보다 정확합니다.
Vidu Q4 Preview는 표현력 있는 캐릭터 연기, 영화적인 카메라 움직임, 시각 효과를 위한 ShengShu Technology의 새로운 플래그십 AI 동영상 생성 모델입니다. 동기화된 오디오와 함께 이미지-동영상 및 레퍼런스-동영상 생성을 지원합니다.
네. Vidu의 공식 제품 페이지와 API 문서에는 Q4 Preview의 출력 해상도로 540p, 720p, 1080p, 2K 및 4K가 기재되어 있습니다.
공식 API는 3~16초 클립을 지원합니다. Vidu의 제품 페이지 역시 멀티 샷 스토리텔링을 최대 16초까지 지원한다고 안내합니다.
레퍼런스-동영상 변환은 1~15개의 이미지를 허용합니다. 캐릭터, 의상, 소품, 장소 또는 스타일을 설정하는 데 사용할 수 있습니다.
레퍼런스-동영상 변환은 최대 3개의 레퍼런스 오디오 파일을 지원합니다. Vidu는 이를 캐릭터의 목소리, 감정 전달, 입 모양과 동기화된 오디오의 일관성을 유지하는 데 사용하는 음성 레퍼런스로 설명합니다.
해당 수치는 기간 한정 SaaS 출시 프로모션을 가리키며, 프로모션 시작 가격으로 보아야 합니다. 표준 API 가격은 더 높고 해상도에 따라 달라집니다. 예를 들어 공식 중국 API 가격은 720p에서 초당 약 ¥0.59375, 1080p에서 초당 ¥0.75입니다.
Vidu 중국 API는 4K Q4 Preview에 생성된 초당 78크레딧을 부과합니다. 표준 표시 크레딧 요율인 ¥0.03125를 적용하면 요금제별 할인 전 기준으로 초당 약 ¥2.4375입니다.
네. Vidu는 Open Platform API를 통해 이미지-동영상 및 레퍼런스-동영상 생성에 viduq4-preview를 사용할 수 있다고 문서화하고 있습니다.
Vidu Q4 Preview는 제작자가 일반적으로 서로 맞바꿔야 하는 여러 요소를 함께 제공합니다. 더 높은 해상도의 출력, 다중 레퍼런스 일관성, 음성 레퍼런스, 동기화된 오디오, 더 긴 멀티 샷 클립, 비교적 낮은 생성 비용이 그것입니다.
원문의 실사용 결과는 완성된 동영상에서 가장 중요한 영역, 즉 연기, 멈춤, 카메라 컷, 액션 일관성, 환경 조명, 상업적 스타일의 완성도에 초점을 맞춥니다. 이러한 관찰은 정성적이지만, 4K 출력, 16초 재생 시간, 이미지 레퍼런스 15개, 레퍼런스 오디오 클립 3개와 같은 기본 기능은 Vidu의 공식 문서로 확인됩니다.
가격에 관한 가장 중요한 교훈은 초당 ¥0.09라는 수치가 표준 API 가격이 아니라 프로모션 SaaS 시작 가격이라는 점입니다. API 사용자는 해상도별 크레딧을 기준으로 비용을 계산해야 하며, 웹 제품 사용자는 프로젝트 비용을 추정하기 전에 현재 프로모션 요금제를 확인해야 합니다.
Q4 Preview의 가장 강력한 실용적 장점은 더 나은 일관성과 저렴한 재시도가 실험의 부담을 줄여준다는 점입니다. 따라서 제작자는 모든 생성 크레딧을 아끼는 대신 가장 좋은 결과를 선택하는 데 더 많은 시간을 쓸 수 있습니다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.