Введение
MiniMax официально представила MiniMax H3 — универсальную мультимодальную модель генерации видео, способную понимать текст, изображения, видео и аудио в рамках единого рабочего процесса генерации.
Этот релиз знаменует отказ от подхода, при котором генерация видео из текста, генерация видео из изображений, генерация по эталонному видео, синхронизация аудио и редактирование рассматривались как независимые задачи. Вместо этого H3 спроектирована так, чтобы одновременно принимать несколько типов контекста и использовать инструкции на естественном языке для описания того, как эти эталонные материалы должны взаимодействовать между собой.
По данным MiniMax, H3 поддерживает нативный вывод видео со стереозвуком, генерирует клипы длительностью до 15 секунд и обеспечивает разрешение 2K через текущий API.
Компания позиционирует модель для коммерческого создания контента, включая рекламу, продвижение брендов, электронную коммерцию, дизайн продуктов, UI/UX и игры.

В рамках релиза также особо подчёркивается стоимость генерации. MiniMax заявляет, что H3, сохраняя возможности мультимодальных эталонов и вывода высокого разрешения, обеспечивает более низкую стоимость за секунду генерации по сравнению со многими主流 системами генерации видео.
H3: от специализированных видеозадач к унифицированной мультимодальной генерации
Ранние видеомодели часто были организованы вокруг независимых рабочих процессов.
Создатели могли выбирать одну модель или интерфейс для генерации видео из текста, другую — для анимации изображений, и использовать отдельные процессы для редактирования эталонного видео или синхронизации аудио.
H3 пытается объединить эти сценарии использования в общем мультимодальном контексте.
В текущей документации API MiniMax описаны три основных режима генерации:
| Режим генерации | Входные данные | Типичное применение |
|---|---|---|
| Генерация видео из текста | Текстовый промпт | Создание нового видео по текстовому описанию |
| Генерация видео из первого/последнего кадра | Промпт + первый и/или последний кадр | Оживление изображений или управление началом и концом видеоклипа |
| Эталонная генерация | Промпт + изображения, видео и/или аудио | Сохранение объекта, движения, стиля съёмки, звука или ритма монтажа |
Таким образом, модель не ограничивается преобразованием одного предложения в видео.
Она также может использовать эталонные медиаматериалы как часть контекста генерации.
Для эталонной генерации API MiniMax поддерживает следующие комбинации:
- до 9 эталонных изображений
- до 3 эталонных видео
- до 3 эталонных аудиофайлов
- в общей сложности до 12 медиафайлов
Общая длительность эталонных видео может достигать 15 секунд, при этом аудио должно сопровождаться как минимум одним изображением или видео в качестве эталона.
Такая структура позволяет создателям описывать взаимосвязи между различными входными данными без необходимости обрабатывать каждую модальность вручную как отдельный этап.
Естественный язык как мост между модальностями
Источники AIBase описывают одну из ключевых концепций H3 как контекстуальное всеобъемлющее представление (Contextual Omni Representation).
Идея заключается в использовании естественного языка для связи различных типов медиа.
Пользователи могут одновременно предоставлять несколько эталонных материалов и описывать на повседневном языке ожидаемые взаимосвязи между ними.
Например, концептуально рабочий процесс может требовать от H3:
- сохранить манеру движения камеры из эталонного видео;
- сохранить персонажа с эталонного изображения;
- следовать ритму или звуку из аудиоэталона;
- применить все эти ограничения одновременно к вновь создаваемой сцене.
Это принципиально отличается от простого текстового промпта для генерации видео.
Модель должна понимать не только содержание каждого медиавхода, но и то, какую роль каждый вход должен играть в конечной генерации.
Публичный API MiniMax отражает этот подход через ролевые мультимодальные входы, например:
first_frame(первый кадр)last_frame(последний кадр)reference_image(эталонное изображение)reference_video(эталонное видео)reference_audio(эталонное аудио)
Пользователям по-прежнему необходимо предоставлять текстовый промпт, но теперь он может выступать в качестве слоя инструкций поверх нескольких медиаисточников.
H3 поддерживает нативный стереозвук и вывод 2K длительностью до 15 секунд
MiniMax заявляет, что H3 может напрямую генерировать видео с нативным стереозвуком без необходимости последующего использования отдельного процесса генерации аудио.
Текущая документация для разработчиков содержит следующую информацию:
- Название модели:
MiniMax-H3 - Разрешение вывода: 2K
- Длительность вывода: до 15 секунд
- Стандартные соотношения сторон: поддерживаются
- Адаптивные соотношения сторон: применимы для подходящих эталонных рабочих процессов
Справочник API в настоящее время принимает целочисленные значения длительности от 4 до 15 секунд, тогда как расширенное руководство для разработчиков описывает стандартный диапазон вывода от 5 до 15 секунд.
Это небольшое расхождение в документации стоит учитывать при разработке на основе API: разработчикам следует руководствоваться текущей схемой конечных точек, соответствующей их аккаунту и SDK.
Для чисто текстовой генерации необходимо явно указывать соотношение сторон.
Поддерживаемые соотношения сторон в текущем справочнике API включают:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
Эталонные рабочие процессы также могут использовать адаптивные размеры.
Раннее тестирование ориентировано на коммерческое создание контента
MiniMax заявляет, что раннее тестирование продемонстрировало высокую производительность в нескольких практических областях применения.
К таким областям относятся:
- следование инструкциям;
- представление брендов и текста;
- перенос движения в формате «видео-в-видео»;
- мультимодальная генерация;
- контролируемое редактирование;
- коммерческое креативное производство.
Компания особо выделила следующие сценарии применения:
- реклама;
- построение бренда;
- электронная коммерция;
- дизайн продуктов;
- UI/UX (пользовательский интерфейс/пользовательский опыт);
- игры.
Эти описания производительности исходят от самой MiniMax и соответствующих релизных публикаций, а не от независимых публичных бенчмарков.
Это различие важно.
Качество генерации видео сложно оценить одним показателем. Модель может превосходно справляться с переносом движения, но уступать в детализации лиц, типографике, долгосрочной идентичности персонажей или сложных взаимодействиях множества объектов.
Поэтому наиболее надёжный способ оценить пригодность H3 для производственного использования — протестировать её на том контенте, который команде действительно необходимо создавать.
H3 использует новую мультимодальную технологическую архитектуру
Материалы AIBase и публикации MiniMax описывают ряд технологий, лежащих в основе H3:
- контекстуальное всеобъемлющее представление (Contextual Omni Representation);
- H3-VAE;
- H3-Omni Transformer (всеобъемлющий трансформер);
- внутриконтекстная регенерация (In-Context Regeneration).
Публичная документация API в настоящее время больше сосредоточена на том, как использовать H3, а не на полном раскрытии технических деталей.
Исследовательские статьи по этим компонентам ещё не опубликованы, поэтому подробные описания архитектуры следует рассматривать как описания продукта от MiniMax, если только не появится технический отчёт с дополнительными воспроизводимыми деталями.
Контекстуальное всеобъемлющее представление
Этот компонент предназначен для совместного представления текста, изображений, видео и аудио в едином общем контексте.
Его задача — помочь H3 понимать взаимосвязи между несколькими эталонными источниками и инструкциями на естественном языке.
H3-VAE
H3-VAE описывается как часть стека представления и генерации видео модели.
Видео-VAE обычно сжимают высокоразмерную видеоинформацию в более управляемое латентное представление, используемое для генерации и декодирования.
В документации, изученной на момент написания данного текста, MiniMax ещё не опубликовала достаточного количества публичных технических деталей, чтобы можно было независимо описать точную конструкцию H3-VAE.
H3-Omni Transformer
H3-Omni Transformer позиционируется как компонент модели, отвечающий за унифицированную мультимодальную генерацию.
Его название отражает более широкую цель модели: одна система должна обрабатывать рассуждения по нескольким типам медиа, а не переключаться между различными независимыми экспертными моделями.
Внутриконтекстная регенерация
MiniMax также включает внутриконтекстную регенерацию в технологический стек H3.
Её предполагаемая роль — улучшать качество генерации, используя информацию, уже присутствующую в мультимодальном контексте.
Как и в случае с другими названиями архитектур, подробный процесс обучения и результаты абляционных экспериментов не были предоставлены в публичной документации API на момент выпуска.
Цены на H3 зависят от длительности видео
В статье AIBase подчёркивается соотношение цены и качества H3.
Текущие официальные тарифы MiniMax с оплатой по факту использования дают более чёткие числовые ориентиры.
| Разрешение | Официальная цена API |
|---|---|
| 2K | $0,13 за каждую секунду |
| 768P | $0,09 за каждую секунду |
Для входных справочных материалов действуют отдельные правила тарификации.
MiniMax в настоящее время указывает:
- Аудиореференс: бесплатно
- Первые 5 изображений-референсов: бесплатно
- Дополнительные изображения-референсы: $0,04 за каждое
- Видеореференс: тарифицируется в зависимости от длительности входного видео и целевого разрешения вывода
MiniMax заявляет, что в пересчёте на секунду стоимость H3 при разрешении 2K составляет менее трети стоимости ведущих конкурирующих моделей, а при 768P — менее половины стоимости популярных альтернатив с разрешением 720P.
Эти сравнительные заявления являются заявлениями производителя, поскольку результаты во многом зависят от включённых конкурирующих моделей, тарифных планов, разрешений и способов тарификации.
При планировании бюджета разработчикам следует в первую очередь опираться на опубликованные тарифы API H3, а затем проводить точное сравнение с реально используемыми альтернативами.
Почему стоимость за секунду важна для ИИ-видео
Стоимость генерации видео линейно растёт с увеличением длительности вывода, поэтому расходы могут быстро стать значительными.
Это меняет экономику итеративного подбора.
Авторам редко удаётся создать идеальный фрагмент с первой попытки.
Полный производственный процесс может включать:
- Многократные эксперименты с промптами
- Попытки сохранения идентичности персонажа
- Вариации движения камеры
- Различные соотношения сторон
- Исправления бренда или продукта
- Финальную генерацию в высоком разрешении
Даже небольшое снижение стоимости генерации за секунду приводит к значительной совокупной экономии, когда команды создают десятки и сотни вариантов.
Это особенно важно в таких сценариях, как——
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
в рекламе и электронной коммерции, где одна маркетинговая кампания может требовать:
- нескольких продуктов
- нескольких рынков
- разных языков
- горизонтального и вертикального форматов
- множества креативных вариантов
Поэтому позиционирование цены H3 учитывает не только стоимость отдельного итогового видео, но и экономику итераций.
Генерация с референсами — одна из ключевых возможностей H3
Текущий API MiniMax поддерживает генерацию с использованием смешанных референсов: изображений, видео и аудио.
Это обеспечивает следующие рабочие процессы:
- сохранение консистентности продукта или персонажа на основе изображения
- следование движению из референсного видео
- заимствование поведения камеры из другого видеосегмента
- использование референсной аудиодорожки для контроля времени или озвучки
- комбинирование различных типов референсных материалов в одном запросе
MiniMax заявляет, что H3 может сохранять характеристики референсного объекта или материала на протяжении всего генерируемого вывода.
Это особенно важно для коммерческой работы.
Обычный текстовый промпт может создать визуально привлекательный видеосегмент, но при этом изменить такие элементы, как:
- логотип
- пропорции продукта
- одежда
- идентичность персонажа
- упаковка
- фирменные цвета
Рабочие процессы с референсами обеспечивают больший контроль над этими переменными.
Однако это не гарантирует идеального сохранения идентичности, поэтому командам следует проверять каждый сгенерированный материал перед публикацией.
Управление первым и последним кадрами добавляет ещё один производственный сценарий
H3 также поддерживает использование первого кадра, последнего кадра или обоих одновременно.
Это полезно, когда создатели уже знают, как сцена должна начинаться или заканчиваться.
Типичные применения:
- оживление статичного изображения продукта
- создание переходов между двумя изображениями
- сопоставление начала одного кадра с концом другого
- контроль конечного состояния трансформации
- построение более предсказуемых монтажных последовательностей
API MiniMax рассматривает генерацию с первым/последним кадром и генерацию с референсами как два независимых режима.
Один запрос не может смешивать роли first_frame или last_frame с ролями reference_image, reference_video или reference_audio в одной задаче.
Это ограничение крайне важно для разработчиков, интегрирующих этот API.
MiniMax планирует опубликовать веса модели H3
Одним из самых примечательных аспектов анонса является план MiniMax раскрыть веса модели H3.
Компания сообщила, что веса планируется выпустить в ближайшие дни с соблюдением применимых законов и нормативных требований.
MiniMax считает, что публикация весов будет способствовать:
- расширению экосистемы открытых моделей
- поддержке кастомизированных версий
- ускорению адаптации к различному оборудованию
- снижению зависимости от единого хостинг-сервиса
- стимулированию экспериментов в исследованиях и развёртывании
Компания также заявила, что совместимость с оборудованием учитывалась в H3 с самого начала проектирования, включая более широкую совместимость с ИИ-аппаратным обеспечением.
На момент написания статьи официальные страницы MiniMax на GitHub и Hugging Face были публично доступны, однако в рассмотренной официальной документации API H3 ссылки на подтверждённый публичный репозиторий весов H3 отсутствовали.
Это означает, что разработчикам следует дождаться официальных ссылок от MiniMax, а не скачивать веса из несанкционированных зеркал.
Уточнение к утверждению о «первой китайской видеомодели с открытыми весами»
AIBase
В статье утверждалось, что план выпуска H3 станет первым случаем, когда китайская базовая видеогенеративная модель открывает свои веса для сообщества.
В широком смысле это утверждение исторически неточно.
Alibaba опубликовала веса и код инференса своей видеогенеративной модели Wan2.1 в феврале 2025 года, а последующие варианты Wan2.1 также были публично выпущены.
Более обоснованным отличием H3 является её универсальная единая мультимодальная видеотекстура, включающая текстовые, графические, видео- и аудиореференсы, а также нативный вывод аудио и видео — а не то, что это первая китайская видеомодель с открытыми весами.
Открытые веса способствуют адаптации к оборудованию
Открытые веса моделей критически важны на рынках, где организации хотят больше контролировать свою инфраструктуру.
Хостинг-API обеспечивает более лёгкий старт, но открытые веса позволяют:
- развёртывание на частной инфраструктуре
- оптимизацию ядер под локальное оборудование
- квантизацию модели
- создание специализированных инференс-рантаймов
- тонкую настройку или адаптацию компонентов в рамках лицензии
- интеграцию с отечественными ускорителями
- сохранение чувствительных данных в контролируемой среде
Возможность фактического самостоятельного хостинга H3 будет зависеть от информации, ещё не раскрытой в исходной статье, включая:
- количество параметров
- требования к видеопамяти
- точность инференса
- требования к параллелизации
- минимальную конфигурацию оборудования
- условия лицензии
- поддержку обучения или дообучения
До публикации официальных весов и технической документации любые заявления о совместимости с потребительскими GPU или стоимости самостоятельного хостинга являются лишь предположениями.
MiniMax признаёт, что у H3 есть потенциал для улучшения
MiniMax также отметила, что эта модель не является финальной точкой серии H.
Компания указала на следующие направления:
- более детальная проработка изображений
- общий масштаб модели
- дальнейшее расширение возможностей
MiniMax заявила о планах продолжать расширение моделей серии H и в перспективе объединить возможности семейств H и M.
Семейство H в настоящее время ориентировано на мультимодальную генерацию, особенно видео.
Семейство M включает языковые и агентные модели MiniMax.
Будущая интеграция может указывать на систему, где одно семейство моделей сможет охватывать:
- языковые рассуждения
- выполнение действий агента
- понимание изображений
- понимание видео
- аудио
- создание видео
- редактирование
Это всё ещё перспективное направление, а не уже выпущенный единый продукт.
Как H3 меняет рабочие процессы генерации видео
Наиболее важный вклад H3 — не просто более высокое разрешение.
Более значительный сдвиг заключается в том, что ранее разрозненные творческие операции теперь могут выполняться в одном контексте.
Авторы могут перейти от:
Сгенерируйте видео по этому предложению.
к:
Используй этого человека, следуй движению в этом видео, сохраняй эту визуальную идентичность,
получи темп-подсказки из этого аудио и создай новую сцену на основе этого промпта.
Это меняет роль видеомоделей.
Она перестаёт быть узкофункциональным генератором и становится мультимодальным творческим движком.
Для коммерческих команд ценность будет определяться тем, насколько последовательно H3 сможет сохранять референсную консистентность, следовать сложным инструкциям, отображать брендовую атрибутику и оставаться экономически эффективной.
Это передаётся из поколения в поколение.
Часто задаваемые вопросы
Что такое MiniMax H3?
MiniMax H3 — это универсальная мультимодальная видеогенеративная модель от MiniMax. Она принимает текст, изображения, видео и аудио в качестве контекста и поддерживает генерацию видео из текста, из изображения, на основе референсных материалов и управляемое создание видео.
Какие разрешения поддерживает MiniMax H3?
Текущая документация API MiniMax указывает 2K как основное выходное разрешение H3. На странице тарифов также указан тарифный уровень 768P.
Какова максимальная длительность видео MiniMax H3?
Официальная документация H3 поддерживает вывод видео длительностью до 15 секунд. Справочник API в настоящее время принимает целочисленные значения длительности от 4 до 15 секунд.
Генерирует ли MiniMax H3 аудио?
Да. MiniMax описывает H3 как поддерживающую нативное стереофоническое аудио и видео на выходе, поэтому аудио может генерироваться как часть видеорабочего процесса, не полагаясь всегда на отдельную модель пост-продакшна.
Сколько стоит API MiniMax H3?
MiniMax в настоящее время оценивает H3 в 0,13 доллара за секунду для разрешения 2K и 0,09 доллара за секунду для 768P. Согласно опубликованным правилам биллинга, референсные видео и дополнительные изображения могут увеличивать стоимость входных материалов.
Может ли H3 одновременно использовать референсные изображения, видео и аудио?
Да. Официальный API поддерживает референсные изображения, видео и аудио в одном рабочем процессе референсной генерации, при соблюдении ограничений на количество файлов, длительность, размер и комбинации входных данных.
Является ли MiniMax H3 открытым исходным кодом?
MiniMax объявила о планах выпустить веса модели H3 в ближайшие дни с учётом применимых нормативных требований. На момент написания статьи официальный API уже доступен, но в официальной документации, изученной в ходе подготовки, ссылка на публичный репозиторий весов H3 ещё не подтверждена.
Является ли H3 первой китайской видеомоделью с открытыми весами?
Нет, в широком историческом смысле это не так. Alibaba выпустила веса видеогенеративной модели Wan2.1 в 2025 году. H3 более примечательна тем, что объединяет мультимодальные референсы и нативную генерацию аудио и видео в одной универсальной видеомодели.
Связанные инструменты
- MiniMax H3 API: Официальная документация для рабочих процессов text-to-video, image-to-video и референсной генерации H3.
- Открытая платформа MiniMax: Платформа разработчика MiniMax с API-ключами, доступом к моделям, биллингом и ресурсами для разработчиков.
- MiniMax GitHub: Официальная GitHub-организация компании для публичных проектов кода и моделей.
- MiniMax Hugging Face: Официальная организация MiniMax на Hugging Face для публичных ресурсов моделей.
- Wan2.1: Серия открытых видеогенеративных моделей Alibaba — исторический ориентир для видеомоделей с открытыми весами.
Связанные ссылки
- Официальный сайт MiniMax: Официальный сайт MiniMax, где H3 указана как новая модель генерации видео.
- Руководство по генерации видео MiniMax H3: Документация по официальным спецификациям модели, поддерживаемым режимам, ограничениям входных данных и рабочим процессам.
- Справочник API MiniMax H3: Официальная спецификация конечной точки V2 для создания задач генерации видео H3.
- Цены API MiniMax: Текущие официальные тарифы pay-as-you-go для H3 и правила биллинга для референсных медиа.
- Официальный GitHub MiniMax: Официальная организация для отслеживания опубликованного кода и ресурсов моделей.
- Alibaba: модель открытого видео Wan 2.1: Официальное историческое подтверждение, что китайские видеомодели с открытыми весами существовали до H3.
- Репозиторий Wan 2.1 на GitHub: Опубликованный код инференса и веса раннего семейства открытых видеогенеративных моделей Alibaba.
Итоги
MiniMax H3 объединяет текст, изображения, видео и аудио в единый универсальный видеогенеративный процесс. Она поддерживает вывод 2K до 15 секунд, нативное стереофоническое аудио, контроль первого/последнего кадра и референсную генерацию с использованием нескольких типов медиа.
Её коммерческая привлекательность сосредоточена на двух аспектах: контроле и стоимости. MiniMax заявляет, что H3 хорошо справляется со следованием инструкциям, передачей фирменного стиля и переносом движений, а официальный API в настоящее время оценивает генерацию 2K в 0,13 доллара за секунду и 768P в 0,09 доллара за секунду.
MiniMax также планирует выпустить веса модели, хотя на момент публикации в изученной официальной документации не было ссылок на подтверждённый репозиторий весов H3.
Ключевой сдвиг в H3 — это не просто видео 2K, а движение к единой мультимодальной генеративной системе, которая понимает, как текст, изображения, видео и аудио должны работать вместе.



