서론
비디오 생성 모델은 빠르게 발전하고 있지만, 대부분은 여전히 소재 생성기의 수준에 머물러 있습니다. 이들은 클립 하나를 생성하고, 크리에이터는 다른 편집 앱에서 자막, 타이포그래피, 전환, 색보정, 음악, 리듬, 시각 효과를 직접 처리해야 합니다.
MiniMax H3는 바로 이러한 작업 흐름을 바꾸기 위해 설계되었습니다.
H3는 2026년 7월 31일에 출시된 범용 멀티모달 비디오 모델로, 동일한 컨텍스트에서 텍스트, 이미지, 비디오, 오디오 입력을 모두 수용할 수 있습니다. 4~15초 길이의 동기화된 스테레오 음향이 포함된 비디오를 생성할 수 있으며, 출력 해상도는 768p 또는 최대 2K까지 지원합니다.
MiniMax는 이 모델이 단순히 원본 소재를 생성하는 것이 아니라 전체 콘텐츠 제작 프로세스에 참여하도록 설계되었다고 밝혔습니다. 주요 적용 분야로는 광고, 브랜드 프로모션, 전자상거래, 제품 디자인, UI/UX, 게임, 모션 포스터, 타이틀 시퀀스, 소셜 미디어 콘텐츠 등이 있습니다.

MiniMax는 H3를 오픈소스 가중치를 가진 범용 멀티모달 비디오 모델로 포지셔닝했습니다.
원본 리포트는 이러한 변화를 비디오 생성의 '프로그래밍 순간'이라고 표현했습니다. 이 비유는 문자 그대로의 의미는 아니지만, 그 아이디어 자체는 가치가 있습니다. 크리에이터는 이제 원하는 결과물을 설명하고, 참고 자료를 제공하고, 출력물을 확인하고, 자연어 지시를 통해 반복 작업을 수행할 수 있습니다. 매 레이어를 수동으로 구축할 필요 없이 말이죠.
오픈소스 가중치 상태: MiniMax는 처음에 가중치가 며칠 내로 공개될 것이라고 밝혔습니다. 공식 H3-Base 체크포인트는 현재 Hugging Face에서 MiniMax H3 커뮤니티 라이선스에 따라 제공되고 있습니다. 그러나 H3-Context-IR, H3-Regenerate-2K 및 희소 어텐션 구현은 초기 가중치 공개에 모두 포함되지 않았습니다.
MiniMax H3, 엔드투엔드 비디오 제작 모델로 등장
처음 등장한 인상적인 예시들은 단순한 영화적 장면이 아니었습니다. 여기에는 다이내믹 타이포그래피, 손으로 그린 효과, 제품 그래픽, 애니메이션 타이틀 시퀀스, 음악, 대화, 전환 효과가 포함되어 있었습니다.
이러한 요소들은 일반적으로 별도의 후반 제작 작업으로 간주됩니다.
전통적인 작업 흐름은 다음과 같을 수 있습니다:
- 원본 소재 생성 또는 촬영
- 클립을 편집 소프트웨어로 가져오기
- 사용 가능한 장면 선별
- 컷과 전환 추가
- 타이틀과 자막 디자인
- 음악과 음향 효과 추가
- 리듬과 색감 조정
- 최종 버전 내보내기
H3는 이러한 여러 결정 사항을 하나의 모델로 통합하려고 시도합니다.
단일 프롬프트로 시각적 스타일, 장면 순서, 리듬, 화면 속 텍스트, 연기 지시, 사운드스케이프, 전환 효과를 설명할 수 있습니다. 참조 파일은 캐릭터, 제품, 동작, 카메라 스타일, 사운드, 배경 음악, 편집 리듬을 제공할 수 있습니다.

초기 테스터들은 H3를 사용해 스타일화된 캐릭터 비디오와 정교한 제품 광고를 제작했습니다.
전문 편집 소프트웨어가 곧바로 구식이 된다는 의미는 아닙니다. 더 긴 프로젝트는 여전히 정밀한 타임라인 제어, 자산 관리, 수정, 법무 검토, 다양한 형식의 전달이 필요합니다.
중요한 변화는 모델이 이제 한 번의 생성으로 완성품에 더 가까운 짧은 비디오 콘텐츠를 만들어낼 수 있다는 점입니다.
홍보 영상과 빠른 멀티샷 프롬프트로 H3 테스트하기
원저자는 MiniMax의 Hailuo 인터페이스를 통해 H3를 테스트했습니다.
첫 번째 실험은 AI 업계의 유명 인사들이 등장하는 가상의 보이그룹 비하인드 영상이었습니다. 텍스트 프롬프트는 의도된 톤과 편집 스타일을 설명했고, H3가 시각적 시퀀스를 생성했습니다.
이어서 저자는 애플 스타일 프레젠테이션 미학을 가진 출시 비디오를 테스트했습니다. 짧은 스타일 태그만 추가했을 뿐인데, 생성 결과에는 반투명 유리 효과, 그라데이션, 모션 그래픽, 프레젠테이션과 같은 리듬이 포함되어 있었습니다.
더 도전적인 테스트는 6개 샷으로 구성된 티저를 설명하는 긴 프롬프트를 사용하는 것이었습니다. 각 샷에는 각자의 감정적 방향, 연기 지시, 리듬이 있었습니다.
리포트에 따르면, H3는 샷 순서를 밀접하게 따르며, 지시를 하나의 모호한 클립으로 압축하는 대신 장면이 뚜렷하게 구분되는 빠른 몽타주를 생성했습니다.
이러한 작업은 여러 가지 능력을 동시에 테스트합니다:
- 멀티샷 플래닝
- 캐릭터 및 장면 일관성
- 프롬프트 준수도
- 감정 연기
- 카메라 움직임
- 편집 리듬
- 전환 디자인
- 음화 동기화
결과는 여전히 주관적인 데모이지 통제된 벤치마크 테스트는 아닙니다. 소셜 미디어에서 성공한 사례 하나가 모든 긴 프롬프트가 한 번에 성공한다는 것을 보장하지는 않습니다.
그럼에도 불구하고, 이 모델은 짧은 시각적 설명만 기대했던 기존의 비디오 시스템보다 구조화된 창의적 지시를 훨씬 잘 처리할 수 있음이 분명합니다.
텍스트 렌더링, H3의 가장 상업적 가치가 높은 기능 중 하나
텍스트는 역사적으로 AI 생성 비디오에서 가장 취약한 요소 중 하나였습니다.
이미지 모델은 단 한 프레임에서 단어 하나를 올바르게 렌더링하면 됩니다. 그러나 비디오 모델은 카메라, 표면, 조명, 주변 장면이 계속 움직이는 동안 수많은 프레임에서 동일한 글리프를 유지해야 합니다.
한 프레임의 작은 오류도 깜빡임, 오타, 불안정한 타이포그래피로 이어질 수 있습니다.
원본 테스트에 따르면, H3는 다음 분야에서 실사용 가능한 수준에 도달했습니다:
- 애니메이션 타이틀
- 홍보용 타이포그래피
- 가사 비디오
- 브랜드 이름
- 제품 라벨
- 자막
- 다이내믹 텍스트 그래픽
- UI 및 웹 비주얼
MiniMax 공식 출시 자료에서도 정밀한 텍스트 및 브랜드 렌더링을 핵심 기능으로 언급하고 있습니다.
이 모델이 모든 생성에서 완벽한 텍스트를 보장하는 것은 아닙니다. 작은 글꼴 크기, 긴 문장, 특수 서체, 복잡한 움직임에서는 여전히 실패할 수 있습니다.
H3의 더 큰 가치는 텍스트와 장면 간의 관계를 모델링할 수 있다는 점에 있습니다.
한 예시에서 다이아몬드 목걸이와 연관된 텍스트는 단순한 평면 오버레이가 아니라 반사광과 깊이감을 표현했습니다. 이는 일반적인 자막 배치에 가깝기보다는 시각적 합성에 더 가깝습니다.
상업 팀에게는 화려한 영화적 카메라 움직임보다 신뢰할 수 있는 타이포그래피가 더 가치 있는 경우가 많습니다. 광고, 제품 출시, 소셜 미디어 콘텐츠 등은 모두 읽을 수 있는 정보에 의존합니다.
네이티브 오디오: 음성, 음향 효과, 음악의 연결
H3는 오디오와 비디오를 공동 생성합니다.
공식 모델 카드의 설명은 다음과 같습니다:
- 32kHz 스테레오 오디오
- 11개 언어의 대화 안정적 지원
- 음성, 음악, 음향 효과의 네이티브 모델링
- 별도의 후반 오디오 처리 단계가 아닌 공동 시청각 생성
MiniMax가 지원 언어로 명시한 대화 언어는 다음과 같습니다:
- 아랍어
- 중국어
- 영어
- 프랑스어
- 독일어
- 이탈리아어
- 일본어
- 한국어
- 포르투갈어
- 러시아어
- 스페인어
다른 언어도 사용할 수 있지만 품질 차이가 있을 수 있습니다.
원문에서는 사용자가 오디오를 참조로 제공할 수 있다고도 언급했습니다. H3는 이미지와 비디오 참조와 함께 음성 클립, 음악 또는 기타 오디오 소재를 결합할 수 있습니다.
현재 API에서는 오디오를 유일한 참조 입력으로 사용할 수 없으며, 이미지 또는 비디오가 반드시 함께 제공되어야 합니다.
이 통합은 생성된 음성이 장면의 리듬과 감정에 맞아야 하기 때문에 매우 중요합니다. 비디오 후반에 추가된 더빙은 소리상 정확해 보일 수 있지만 얼굴 움직임, 리듬 또는 장면 전환과 여전히 어긋날 수 있습니다.
H3의 네이티브 시청각 설계는 이러한 요소들이 정렬되도록 하는 데 목적이 있습니다.
가격: 2K 비디오 초당 0.13달러
MiniMax는 생성된 비디오의 길이에 따라 H3의 가격을 책정합니다.
현재 글로벌 종량제 요금은 다음과 같습니다:
| 출력 | 가격 |
|---|---|
| 2K 비디오 | 초당 0.13달러 |
| 768p 비디오 | 초당 0.08달러 |
| 768p~2K 재생성 | 출력 초당 0.05달러 |
| H3-Context-IR 입력 | 백만 토큰당 0.90달러 |
| H3-Context-IR 출력 | 백만 토큰당 3.60달러 |
현재 요금 기준으로 10초 직접 생성 비용은 대략 다음과 같습니다:
| 해상도 |
| 근사 출력 비용 |
|-|-|
| 768p | 0.80달러 |
| 2K | 1.30달러 |
참조 입력의 과금은 별도의 규칙을 따릅니다.
- 오디오 참조는 무료입니다.
- 처음 5장의 이미지 참조는 무료입니다.
- 직접 생성 시 처음 5장 이후의 이미지마다 0.04달러가 부과됩니다.
- 참조 비디오는 길이와 선택한 출력 해상도에 따라 과금됩니다.

출처 기사는 H3의 초기 입력素材 및 출력 가격을 발췌한 것입니다.
위 스크린샷은 768p 생성 가격이 초당 0.09달러임을 보여줍니다. MiniMax의 현재 글로벌 가격 페이지에는 초당 0.08달러로 표시되어 있으므로, 실시간 공식 문서를 현재 정보의 출처로 삼아야 합니다.
MiniMax는 2K 해상도에서 H3의 비용이 주류 경쟁 제품의 3분의 1 미만이고, 768p 해상도에서는 주류 720p 모델 비용의 절반 미만이라고 주장합니다.
이 비교는 MiniMax가 선택한 경쟁 제품과 설정에 기반합니다. 유효한 비디오 한 개의 실제 비용은 재시도 횟수, 참조素材, 클립 길이, 재생성, 그리고 첫 출력이 바로 사용 가능한지 여부에 따라 달라집니다.
Artificial Analysis 비디오 편집 순위에서 H3 1위
Artificial Analysis는 현재 MiniMax H3를 오디오 포함 비디오 편집 순위에서 1위로 선정하고 있습니다.
본 문서 작성 시점 기준, 순위는 다음과 같습니다.
| 순위 | 모델 | Elo | API 가격 |
|---|---|---|---|
| 1 | MiniMax H3 | 1,129 | 7.80달러/분 |
| 2 | Gemini Omni Flash | 1,122 | 6.00달러/분 |
| 3 | HappyHorse-1.0 | 1,096 | 27.04달러/분 |
| 4 | Wan 2.7 | 1,080 | 16.90달러/분 |
| 5 | Dreamina Seedance 2.0 720p | 1,037 | 5.57달러/분 |

출처 기사는 H3를 Artificial Analysis 비디오 편집 순위 1위로 소개했습니다.
H3는 텍스트-비디오 및 이미지-비디오 테스트에서도 상위권을 기록하고 있습니다.
순위 결과는 새로운 모델과 투표가 추가됨에 따라 변동됩니다. 이는 특정 프롬프트 세트에 대한 집단 선호도를 측정한 것이며, 특정 모델이 모든 제작 워크플로에 적합하다는 증거로 간주해서는 안 됩니다.
그럼에도 이 결과는 주목할 만합니다. H3가 강력한 편집 점수와 함께 공개된 기본 가중치를 결합하고 있기 때문입니다. 반면 많은 선도적인 비디오 모델은 여전히 비공개 상태로 유지되고 있습니다.
통합 멀티모달 입력 시스템
H3는 텍스트, 이미지, 비디오, 오디오를 서로 무관한 입력 모달리티로 취급하지 않습니다.
이를 하나의 통합된 멀티모달 컨텍스트로 받아들이고, 이러한素材와 요청된 출력 간의 관계를 이해하려고 시도합니다.
예를 들어, 프롬프트는 H3에게 다음을 요청할 수 있습니다.
- 특정 비디오의 카메라 움직임 사용
- 이미지에 표시된 인물 유지
- 오디오 참조의 음성 사용
- 다른 클립의 리듬 따라가기
- 지정된 타이틀 스타일 적용
- 이러한 모든 관계를 포함한 새로운 장면 생성
공식 API는 현재 다음을 지원합니다.
| 참조 유형 | 제한 |
|---|---|
| 이미지 | 최대 9장 |
| 비디오 클립 | 최대 3개 |
| 오디오 클립 | 최대 3개 |
| 혼합 파일 총개수 | 최대 12개 |
참조 비디오 및 오디오 클립 길이는 2초에서 15초 사이여야 하며, 각 미디어 유형의 최대 총 길이는 15초입니다.
프롬프트는 7,000자로 제한됩니다.

해루 인터페이스는 프롬프트, 멀티모달 참조, 해상도, 길이, 화면 비율을 하나로 통합합니다.
이러한 설계 덕분에 참조素材는 초장문 프롬프트 작성보다 더 중요해졌습니다.
텍스트로 원하는 조명 효과를 설명할 수 있지만, 참조 이미지 한 장이 동일한 시각적 효과를 더 직접적으로 전달할 수 있습니다. 텍스트로 동작을 설명할 수 있지만, 참조 비디오는 정확한 타이밍을 보여줄 수 있습니다.
이 모델의 가치는 이러한 참조를 단순히 복사하는 것이 아니라 어떻게 재조합해야 하는지를 해석하는 데 있습니다.
최근素材로 재업로드 감소
출처 기사는 작지만 실용적인 제품 기능을 강조했습니다. 업로드한素材가 최근 사용 패널에 표시된다는 점입니다.

이전에 업로드한 이미지와 참조素材는 최근素材 패널에서 재사용할 수 있습니다.
이 기능은 동일한 캐릭터, 제품, 로고, 브랜드 색조, 음성, 비주얼 스타일, 장소 또는 모션 참조를 반복적으로 사용하는 워크플로에서 매우 실용적입니다.
매번 생성할 때마다 동일한 파일을 업로드하고 정리해야 하는 필요성을 줄여줍니다.
H3가 창의적 의도를 이해하는 방식
MiniMax는 H3를 독립적인 전문 모델의 집합이 아닌 작업 일반화를 중심으로 구축된 시스템으로 설명합니다.
초기 생성 시스템은 일반적으로 텍스트-비디오, 이미지-비디오, 첫·끝 프레임 생성, 캐릭터 참조, 스타일 참조, 모션 전이, 음성 참조, 비디오 편집, 음향 효과 생성, 음악 생성과 같은 고립된 작업으로 창의적 작업을 분할했습니다.
H3는 단일 멀티모달 시스템 내에서 자연어를 통해 이러한 관계를 표현하도록 훈련되었습니다.
완전한 온라인 H3 워크플로는 세 가지 주요 모듈로 구성됩니다.
멀티모달 입력
↓
H3-Context-IR
↓
H3-Base(768p)
↓
H3-Regenerate-2K
↓
최종 비디오(스테레오 오디오 포함)
H3-Context-IR
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
H3-Context-IR은 관리형 전처리 및 오케스트레이션 시스템입니다.
텍스트, 이미지, 비디오, 오디오 간의 관계를 분석한 후 H3-Base가 사용할 수 있는 구조화된 중간 표현을 생성합니다.
이 시스템은 명령 파싱, 크로스모달 연관 분석, 시간 분석, 장면 분해, 오디오-비디오 관계 모델링, 누락된 세부 정보에 대한 프롬프트 보완, 복잡한 논리 추론을 수행할 수 있습니다.
MiniMax의 기술 블로그에 따르면, 일부 소스 자료는 평균 약 4,000토큰의 컨텍스트 표현으로 정제되기 전에 약 100,000토큰의 추론 계산이 필요합니다.
H3-Context-IR은 여러 관리형 모델과 서비스에 의존하기 때문에 초기 오픈소스 가중치 버전에는 포함되지 않습니다.
MiniMax는 API를 통해 이 기능을 제공하며, 자체 전처리 시스템을 구축하려는 팀을 위해 프롬프트 가이드를 공개했습니다.
H3-Base
H3-Base는 768p 해상도로 비디오와 스테레오 오디오를 생성합니다.
서로 다른 입력 모달리티는 각각의 인코더 또는 VAE를 통해 인코딩되어 통합된 멀티모달 시퀀스로 패키징된 후 H3-Omni Transformer로 전달됩니다.
공개된 모델은 두 가지 작업별 체크포인트를 제공합니다:
| 체크포인트 | 주요 작업 |
|---|---|
| H3-Base-FL2VA | 텍스트-투-비디오 및 첫/끝 프레임-투-비디오 |
| H3-Base-Ref2VA | 참조 기반 오디오-비디오 생성 |
두 체크포인트 모두 BF16 정밀도를 사용합니다.
H3-Regenerate-2K
H3의 2K 워크플로우는 전통적인 초해상도 업스케일링 도구가 아닙니다.
768p 결과물과 원본 멀티모달 컨텍스트가 H3로 다시 피드백되어, 모델이 더 높은 해상도로 출력을 재생성할 수 있게 합니다.
MiniMax는 이를 컨텍스트 내 재생성이라고 부릅니다.
전통적인 초해상도 시스템은 저해상도 비디오에서 누락된 디테일을 추론하려고 시도합니다. H3는 원본 프롬프트와 참조 정보를 재사용할 수 있어, 작은 텍스트, 제품 디테일, 장면 정보를 더 정확하게 복원하는 데 도움이 될 수 있습니다.
H3-Regenerate-2K는 초기 오픈소스 가중치 릴리스에는 포함되지 않습니다. 현재는 MiniMax의 호스팅 워크플로우와 API를 통해 사용할 수 있습니다.
H3의 핵심 기술 구성 요소
MiniMax는 시스템의 기반이 되는 네 가지 주요 기술을 확인했습니다.
컨텍스트 전체 모달리티 표현
전통적인 비디오 프롬프트에서는 텍스트 설명이 대상 클립을 묘사합니다.
반면 H3에서는,
자막은 각 참조와 출력 간의 관계, 참조 간의 상호 관계, 어떤 동작이 어떤 비디오에서 와야 하는지, 어떤 소리가 어떤 캐릭터에 속하는지, 오디오가 여러 컷 사이에서 어떻게 변하는지, 그리고 어떤 콘텐츠를 유지하거나 편집해야 하는지를 설명해야 합니다.
언어는 이러한 멀티모달 관계를 연결하는 다리입니다.
MiniMax는 이러한 표현을 생성하기 위해 전용 모델과 전체 모달리티 이해 파이프라인을 구축했습니다.
H3-VAE
H3는 별도의 시각 및 오디오 잠재 공간을 사용합니다.
시각 VAE는 시간 인과적 비디오 오토인코더로, 16배 공간 압축, 4배 시간 압축, 24개 잠재 채널을 가지며 Transformer 이전에 추가 청크 처리를 수행합니다.
MiniMax는 새로운 VAE가 이전 방식 대비 유효 시퀀스 길이에서 4배 향상을 제공하여 학습 및 추론 비용을 낮추면서 네이티브 2K 생성을 지원하는 데 도움이 된다고 밝혔습니다.
오디오 VAE는 먼저 좌우 스테레오 채널을 독립적으로 처리한 후 다시 결합합니다. 32kHz 오디오를 채널당 40Hz 잠재 토큰으로 압축합니다.
H3-Omni Transformer
H3-Omni Transformer는 밀집 단일 스트림 Transformer입니다.
공식 모델 카드에는 다음과 같이 명시되어 있습니다:
- 총 330억 개 파라미터
- AdaLN 관련 브랜치에 약 130억 개 파라미터
- 비디오 및 오디오 잠재 변수에 대한 공동 예측
- 3D 멀티모달 회전 위치 임베딩
- 모달리티 전용 모듈이 없는 통합 어텐션 메커니즘 및 피드포워드 레이어
MiniMax는 AdaLN 변조 출력을 사전 계산하여 캐시할 수 있으므로, 추론 전용 배포는 이러한 파라미터를 로드할 필요가 없다고 밝혔습니다.
이 모델은 학습 중 이해와 생성 작업을 분리하여 멀티모달 시퀀스 길이의 큰 변동을 더 잘 처리합니다. MiniMax는 이를 통해 엔드투엔드 학습 처리량이 약 30% 향상되었다고 보고했습니다.
희소 어텐션
H3는 긴 멀티모달 시퀀스의 비용을 줄이기 위해 네이티브 희소 어텐션으로 학습됩니다.
초기 오픈 가중치 릴리스는 현재 추론에 전체 어텐션을 사용합니다. MiniMax는 희소 어텐션 구현이 향후 업데이트에서 공개될 것이라고 밝혔습니다.
이 차이는 로컬 배포에 중요합니다. 현재 사용 가능한 구현은 MiniMax의 내부 최적화 서비스 스택보다 더 많은 계산 리소스가 필요할 수 있기 때문입니다.
오픈 가중치: 실제 공개 내용
MiniMax는 Hugging Face에 MiniMax H3 커뮤니티 라이선스로 H3-Base 가중치를 공개했습니다.
이 저장소에는 H3-Base-FL2VA, H3-Base-Ref2VA, 프로세서 파일, 토크나이저 파일, 텍스트 인코더, Omni Transformer 가중치, 시각 및 오디오 VAE, 예제 스크립트, 배포 지침, 재현 가능한 768p 예제가 포함되어 있습니다.
체크포인트는 Qwen3-VL-32B의 전체 사전 학습 가중치를 H3 인코더로 사용하며, 해당 50번째 레이어의 히든 스테이트가 H3-Omni Transformer로 제공됩니다.
모델은 다음 명령어로 다운로드할 수 있습니다:
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3
MiniMax는 SGLang, vLLM, Diffusers 및 ComfyUI를 지원 또는 권장 추론 프레임워크로 나열합니다.
SGLang 예제는 4개의 GPU를 사용합니다:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
이는 공식 예제일 뿐이며, 보편적인 최소 요구 사항이 아닙니다. 실제 메모리와 성능은 체크포인트, 길이, 해상도, 구현 방식 및 하드웨어에 따라 달라집니다.
전체 온라인 시스템은 아직 완전히 공개되지 않음
H3를 단순히 "완전 오픈소스"라고 부르는 것은 오해를 불러일으킬 수 있습니다.
공개된 H3-Base 가중치는 상당하며 로컬 768p 생성을 지원합니다. 그러나:
- H3-Context-IR은 여전히 호스팅 시스템입니다.
- H3-Regenerate-2K는 아직 공개되지 않았습니다.
- 희소 어텐션 추론은 첫 번째 릴리스에 포함되지 않았습니다.
- 이 모델은 Apache 2.0과 같은 표준 허용 라이선스가 아닌 MiniMax 커뮤니티 라이선스를 사용합니다.
팀은 상업적 배포를 계획하기 전에 라이선스와 아키텍처 설명을 신중히 검토해야 합니다.
자체 브랜드 자산의 경우, 이번 릴리스는 여전히 의미 있는 선택지를 제공합니다. 기업은 라이선스 조건 내에서 소스 자산을 제3자 생성 인터페이스로 보낼 필요 없이 기본 모델을 연구하고, 미세 조정하고, 배포할 수 있습니다.
API를 통한 MiniMax H3 사용
공식 API는 세 가지 주요 생성 모드를 지원합니다:
- 텍스트-투-비디오
- 첫 프레임/마지막 프레임 이미지-투-비디오
- 멀티모달 참조 생성
생성 워크플로우는 비동기 모드입니다:
- 작업을 제출하고
task_id를 수신합니다. - 작업 상태를 폴링합니다.
- 작업 성공 후 비디오 URL을 가져옵니다.
- 결과를 다운로드하여 저장합니다.
개발자는 공식 MiniMax CLI도 사용할 수 있습니다:
npm install -g mmx-cli
mmx auth login
mmx video generate \
--model MiniMax-H3 \
--prompt "A polished product commercial with animated typography"
멀티모달 참조 워크플로우의 경우:
mmx video generate \
--model MiniMax-H3 \
--prompt "Keep the same character and follow the reference motion" \
--reference-image character.png \
--reference-video motion.mp4
프로덕션 환경에서 사용하기 전에 CLI 및 API 문서를 확인해야 합니다. 입력 제한, 과금, 지원되는 파라미터가 변경될 수 있기 때문입니다.
H3가 비디오 제작에 주는 의미
H3가 모든 후반 제작 작업을 없애는 것은 아닙니다.
전문 마케팅 프로젝트는 여전히 프레임 단위 정밀 편집, 클라이언트 리뷰, 라이선스 음악, 법적 및 저작권 검토, 정확한 브랜드 컴플라이언스, 장편 연속성, 다양한 화면 비율 내보내기, 실사 연기 지도, 컬러 관리 딜리버리가 필요할 수 있습니다.
H3가 바꾸는 것은 출발점입니다.
크리에이터는 더 이상 무성의 원본 푸티지를 받지 않고, 편집, 사운드, 타이포그래피, 내레이션, 특수 효과, 식별 가능한 시각적 방향이 포함된 짧은 자산을 얻을 수 있습니다.
이로 인해 이 모델은 특히 다음 용도에 적합합니다:
- 소셜 미디어 광고
- 제품 프로모션 영상
- 이커머스 비디오
- 뮤직 비주얼
- 모션 포스터
- 브랜드 컨셉 테스트
- 빠른 캠페인 변형
- 게임 및 UI
콘셉트 영상
이 모델은 또한 비디오 생성이 점점 더 특정 작업에 국한되지 않고 있음을 보여준다. 단일 시스템이 점점 더 다양한 창의적 자산을 해석하고 보다 완전한 크리에이티브 브리프를 수행할 수 있다.
자주 묻는 질문
MiniMax H3란 무엇인가요?
MiniMax H3는 범용 멀티모달 비디오 생성 및 편집 시스템입니다. 텍스트, 이미지, 비디오, 오디오 입력을 받아들이며 동기화된 스테레오 사운드가 포함된 4초에서 15초 분량의 비디오를 생성할 수 있습니다.
사운드.
MiniMax H3는 2K 비디오를 생성할 수 있나요?
네, 가능합니다. 호스팅 API는 2K 출력을 지원합니다. 전체 프로세스는 먼저 H3-Base로 768p 결과물을 생성한 다음, H3-Regenerate-2K를 사용하여 원본 컨텍스트를 유지한 채 더 높은 해상도로 비디오를 다시 생성합니다.
MiniMax H3는 오픈소스인가요?
MiniMax는 커뮤니티 라이선스에 따라 H3-Base 가중치를 공개했습니다. 전체 온라인 시스템은 완전히 오픈소스화되지 않았습니다. H3-Context-IR, H3-Regenerate-2K 및 희소 어텐션 추론이 초기 버전에 모두 포함되지 않았기 때문입니다.
MiniMax H3를 로컬에서 실행할 수 있나요?
네, 가능합니다. 공개된 H3-Base 체크포인트를 로컬에 배포하여 768p 생성이 가능합니다. MiniMax는 SGLang 예시를 제공하고 vLLM, Diffusers 및 ComfyUI 워크플로 링크도 제공하지만, 이 모델은 상당한 GPU 리소스가 필요합니다.
MiniMax H3 API 비용은 얼마인가요?
현재 글로벌 표준 가격은 2K 해상도 초당 0.13달러, 768p 해상도 초당 0.08달러입니다. 처음 5장을 초과하는 참조 이미지, 참조 비디오, 재생성 및 H3-Context-IR은 추가 비용이 발생할 수 있습니다.
H3는 비디오와 함께 오디오도 생성하나요?
네, 그렇습니다. H3는 비디오와 함께 네이티브 32kHz 스테레오 오디오(대사, 음악, 음향 효과 포함)를 공동 생성합니다.
H3는 몇 개의 참조 파일을 받을 수 있나요?
API는 최대 9개의 이미지, 3개의 비디오, 3개의 오디오 클립을 지원하며 최대 12개의 혼합 파일을 처리할 수 있습니다. 또한 재생 시간과 파일 크기 제한도 있습니다.
H3는 상업용 비디오 제작에 적합한가요?
MiniMax는 H3를 광고, 브랜딩, 전자상거래, 제품 디자인, UI 및 UX 등 상업적 용도로 설계했습니다. 팀은 여전히 출력 콘텐츠를 검토하고, 모든 입력 자료의 권리를 확인하며, 커뮤니티 라이선스와 플랫폼 약관을 검토해야 합니다.
관련 도구
- Hailuo AI: MiniMax가 H3로 비디오를 제작하는 글로벌 웹 애플리케이션.
- Hugging Face의 MiniMax H3: 공식 H3-Base 가중치, 모델 카드, 아키텍처 설명 및 로컬 배포 예시.
- MiniMax API: API를 통해 H3 비디오를 생성하는 공식 글로벌 플랫폼.
- MiniMax CLI: 비디오, 이미지, 음성, 음악 및 텍스트 생성을 위한 공식 커맨드라인 도구.
- SGLang: MiniMax H3 로컬 배포 예시를 지원하는 추론 서비스 프레임워크.
- ComfyUI: 노드 기반 비주얼 워크플로 환경으로, 공식 H3 비디오 생성 튜토리얼 제공.
- Artificial Analysis Video Arena: 비디오 편집 모델 비교를 위한 블라인드 평가 투표 리더보드.
관련 링크
- MiniMax H3 공식 기술 블로그: MiniMax의 출시 기사로, 기능, 설계 철학, 아키텍처, 가격 제안 및 로드맵을 다룹니다.
- MiniMax H3 모델 카드: 공개된 체크포인트, 라이선스, 지원 작업 및 시스템 모듈에 대한 공식 상세 정보.
- MiniMax 비디오 생성 문서: 공식 API 모드, 입력 제한, 워크플로 및 코드 예시.
- MiniMax 종량제
가격: 현재 H3 세대, 참조 입력, 재생성 및 Context-IR 가격.
- MiniMax CLI GitHub 저장소: H3 생성을 위한 설치 및 명령어 예시.
- ComfyUI H3 튜토리얼: 로컬 및 API 기반 H3 생성을 위한 공식 ComfyUI 워크플로.
- Artificial Analysis 비디오 편집 리더보드: 현재 크라우드소싱된 비디오 편집 결과 순위 및 API 가격 비교.
요약
MiniMax H3는 AI 비디오를 단순한 단일 클립 생성에서 더 높은 수준으로 끌어올려, 하나의 시스템 내에서 시각 생성, 편집 로직, 자막 레이아웃, 대사, 음향 효과, 음악 및 멀티모달 참조를 통합했습니다.
호스팅 버전은 네이티브 스테레오 오디오가 포함된 4초에서 15초 분량의 비디오를 생성할 수 있으며, 출력 해상도는 최대 2K입니다. 현재 이 버전은 Artificial Analysis 비디오 편집 리더보드에서 1위를 차지하고 있으며, MiniMax 글로벌 API를 통해 생성 초당 0.13달러의 가격으로 2K 출력을 제공합니다.
MiniMax는 현재 H3-Base 체크포인트를 공개하여 로컬 768p 생성 및 후속 개발을 지원하고 있습니다. 그러나 Context-IR, 2K 재생성 및 희소 어텐션 추론이 완전히 오픈소스화되지 않았기 때문에 전체 호스팅 워크플로는 여전히 부분적으로 폐쇄되어 있습니다.
H3의 핵심 변화는 단순히 더 나은 화면을 생성하는 것이 아니라, 하나의 클립을 생성하는 것에서 완전한 단편 비디오 제작 브리프를 이해하고 실행하는 것으로 진화한 것입니다.



