MiniMax официально представила MiniMax H3 — универсальную мультимодальную модель генерации видео, способную понимать текст, изображения, вид...

MiniMax официально представила MiniMax H3 — универсальную мультимодальную модель генерации видео, способную понимать текст, изображения, видео и аудио в рамках единого рабочего процесса генерации.
Этот релиз знаменует отказ от подхода, при котором генерация видео из текста, генерация видео из изображений, генерация по эталонному видео, синхронизация аудио и редактирование рассматривались как независимые задачи. Вместо этого H3 спроектирована так, чтобы одновременно принимать несколько типов контекста и использовать инструкции на естественном языке для описания того, как эти эталонные материалы должны взаимодействовать между собой.
По данным MiniMax, H3 поддерживает нативный вывод видео со стереозвуком, генерирует клипы длительностью до 15 секунд и обеспечивает разрешение 2K через текущий API.
Компания позиционирует модель для коммерческого создания контента, включая рекламу, продвижение брендов, электронную коммерцию, дизайн продуктов, UI/UX и игры.

В рамках релиза также особо подчёркивается стоимость генерации. MiniMax заявляет, что H3, сохраняя возможности мультимодальных эталонов и вывода высокого разрешения, обеспечивает более низкую стоимость за секунду генерации по сравнению со многими主流 системами генерации видео.
Ранние видеомодели часто были организованы вокруг независимых рабочих процессов.
Создатели могли выбирать одну модель или интерфейс для генерации видео из текста, другую — для анимации изображений, и использовать отдельные процессы для редактирования эталонного видео или синхронизации аудио.
H3 пытается объединить эти сценарии использования в общем мультимодальном контексте.
В текущей документации API MiniMax описаны три основных режима генерации:
| Режим генерации | Входные данные | Типичное применение |
|---|---|---|
| Генерация видео из текста | Текстовый промпт | Создание нового видео по текстовому описанию |
| Генерация видео из первого/последнего кадра | Промпт + первый и/или последний кадр | Оживление изображений или управление началом и концом видеоклипа |
| Эталонная генерация | Промпт + изображения, видео и/или аудио | Сохранение объекта, движения, стиля съёмки, звука или ритма монтажа |
Таким образом, модель не ограничивается преобразованием одного предложения в видео.
Она также может использовать эталонные медиаматериалы как часть контекста генерации.
Для эталонной генерации API MiniMax поддерживает следующие комбинации:
Общая длительность эталонных видео может достигать 15 секунд, при этом аудио должно сопровождаться как минимум одним изображением или видео в качестве эталона.
Такая структура позволяет создателям описывать взаимосвязи между различными входными данными без необходимости обрабатывать каждую модальность вручную как отдельный этап.
Источники AIBase описывают одну из ключевых концепций H3 как контекстуальное всеобъемлющее представление (Contextual Omni Representation).
Идея заключается в использовании естественного языка для связи различных типов медиа.
Пользователи могут одновременно предоставлять несколько эталонных материалов и описывать на повседневном языке ожидаемые взаимосвязи между ними.
Например, концептуально рабочий процесс может требовать от H3:
Это принципиально отличается от простого текстового промпта для генерации видео.
Модель должна понимать не только содержание каждого медиавхода, но и то, какую роль каждый вход должен играть в конечной генерации.
Публичный API MiniMax отражает этот подход через ролевые мультимодальные входы, например:
first_frame (первый кадр)last_frame (последний кадр)reference_image (эталонное изображение)reference_video (эталонное видео)reference_audio (эталонное аудио)Пользователям по-прежнему необходимо предоставлять текстовый промпт, но теперь он может выступать в качестве слоя инструкций поверх нескольких медиаисточников.
MiniMax заявляет, что H3 может напрямую генерировать видео с нативным стереозвуком без необходимости последующего использования отдельного процесса генерации аудио.
Текущая документация для разработчиков содержит следующую информацию:
MiniMax-H3Справочник API в настоящее время принимает целочисленные значения длительности от 4 до 15 секунд, тогда как расширенное руководство для разработчиков описывает стандартный диапазон вывода от 5 до 15 секунд.
Это небольшое расхождение в документации стоит учитывать при разработке на основе API: разработчикам следует руководствоваться текущей схемой конечных точек, соответствующей их аккаунту и SDK.
Для чисто текстовой генерации необходимо явно указывать соотношение сторон.
Поддерживаемые соотношения сторон в текущем справочнике API включают:
Эталонные рабочие процессы также могут использовать адаптивные размеры.
MiniMax заявляет, что раннее тестирование продемонстрировало высокую производительность в нескольких практических областях применения.
К таким областям относятся:
Компания особо выделила следующие сценарии применения:
Эти описания производительности исходят от самой MiniMax и соответствующих релизных публикаций, а не от независимых публичных бенчмарков.
Это различие важно.
Качество генерации видео сложно оценить одним показателем. Модель может превосходно справляться с переносом движения, но уступать в детализации лиц, типографике, долгосрочной идентичности персонажей или сложных взаимодействиях множества объектов.
Поэтому наиболее надёжный способ оценить пригодность H3 для производственного использования — протестировать её на том контенте, который команде действительно необходимо создавать.
Материалы AIBase и публикации MiniMax описывают ряд технологий, лежащих в основе H3:
Публичная документация API в настоящее время больше сосредоточена на том, как использовать H3, а не на полном раскрытии технических деталей.
Исследовательские статьи по этим компонентам ещё не опубликованы, поэтому подробные описания архитектуры следует рассматривать как описания продукта от MiniMax, если только не появится технический отчёт с дополнительными воспроизводимыми деталями.
Этот компонент предназначен для совместного представления текста, изображений, видео и аудио в едином общем контексте.
Его задача — помочь H3 понимать взаимосвязи между несколькими эталонными источниками и инструкциями на естественном языке.
H3-VAE описывается как часть стека представления и генерации видео модели.
Видео-VAE обычно сжимают высокоразмерную видеоинформацию в более управляемое латентное представление, используемое для генерации и декодирования.
В документации, изученной на момент написания данного текста, MiniMax ещё не опубликовала достаточного количества публичных технических деталей, чтобы можно было независимо описать точную конструкцию H3-VAE.
H3-Omni Transformer позиционируется как компонент модели, отвечающий за унифицированную мультимодальную генерацию.
Его название отражает более широкую цель модели: одна система должна обрабатывать рассуждения по нескольким типам медиа, а не переключаться между различными независимыми экспертными моделями.
MiniMax также включает внутриконтекстную регенерацию в технологический стек H3.
Её предполагаемая роль — улучшать качество генерации, используя информацию, уже присутствующую в мультимодальном контексте.
Как и в случае с другими названиями архитектур, подробный процесс обучения и результаты абляционных экспериментов не были предоставлены в публичной документации API на момент выпуска.
В статье AIBase подчёркивается соотношение цены и качества H3.
Текущие официальные тарифы MiniMax с оплатой по факту использования дают более чёткие числовые ориентиры.
| Разрешение | Официальная цена API |
|---|---|
| 2K | $0,13 за каждую секунду |
| 768P | $0,09 за каждую секунду |
Для входных справочных материалов действуют отдельные правила тарификации.
MiniMax в настоящее время указывает:
MiniMax заявляет, что в пересчёте на секунду стоимость H3 при разрешении 2K составляет менее трети стоимости ведущих конкурирующих моделей, а при 768P — менее половины стоимости популярных альтернатив с разрешением 720P.
Эти сравнительные заявления являются заявлениями производителя, поскольку результаты во многом зависят от включённых конкурирующих моделей, тарифных планов, разрешений и способов тарификации.
При планировании бюджета разработчикам следует в первую очередь опираться на опубликованные тарифы API H3, а затем проводить точное сравнение с реально используемыми альтернативами.
Стоимость генерации видео линейно растёт с увеличением длительности вывода, поэтому расходы могут быстро стать значительными.
Это меняет экономику итеративного подбора.
Авторам редко удаётся создать идеальный фрагмент с первой попытки.
Полный производственный процесс может включать:
Даже небольшое снижение стоимости генерации за секунду приводит к значительной совокупной экономии, когда команды создают десятки и сотни вариантов.
Это особенно важно в таких сценариях, как——
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
в рекламе и электронной коммерции, где одна маркетинговая кампания может требовать:
Поэтому позиционирование цены H3 учитывает не только стоимость отдельного итогового видео, но и экономику итераций.
Текущий API MiniMax поддерживает генерацию с использованием смешанных референсов: изображений, видео и аудио.
Это обеспечивает следующие рабочие процессы:
MiniMax заявляет, что H3 может сохранять характеристики референсного объекта или материала на протяжении всего генерируемого вывода.
Это особенно важно для коммерческой работы.
Обычный текстовый промпт может создать визуально привлекательный видеосегмент, но при этом изменить такие элементы, как:
Рабочие процессы с референсами обеспечивают больший контроль над этими переменными.
Однако это не гарантирует идеального сохранения идентичности, поэтому командам следует проверять каждый сгенерированный материал перед публикацией.
H3 также поддерживает использование первого кадра, последнего кадра или обоих одновременно.
Это полезно, когда создатели уже знают, как сцена должна начинаться или заканчиваться.
Типичные применения:
API MiniMax рассматривает генерацию с первым/последним кадром и генерацию с референсами как два независимых режима.
Один запрос не может смешивать роли first_frame или last_frame с ролями reference_image, reference_video или reference_audio в одной задаче.
Это ограничение крайне важно для разработчиков, интегрирующих этот API.
Одним из самых примечательных аспектов анонса является план MiniMax раскрыть веса модели H3.
Компания сообщила, что веса планируется выпустить в ближайшие дни с соблюдением применимых законов и нормативных требований.
MiniMax считает, что публикация весов будет способствовать:
Компания также заявила, что совместимость с оборудованием учитывалась в H3 с самого начала проектирования, включая более широкую совместимость с ИИ-аппаратным обеспечением.
На момент написания статьи официальные страницы MiniMax на GitHub и Hugging Face были публично доступны, однако в рассмотренной официальной документации API H3 ссылки на подтверждённый публичный репозиторий весов H3 отсутствовали.
Это означает, что разработчикам следует дождаться официальных ссылок от MiniMax, а не скачивать веса из несанкционированных зеркал.
AIBase
В статье утверждалось, что план выпуска H3 станет первым случаем, когда китайская базовая видеогенеративная модель открывает свои веса для сообщества.
В широком смысле это утверждение исторически неточно.
Alibaba опубликовала веса и код инференса своей видеогенеративной модели Wan2.1 в феврале 2025 года, а последующие варианты Wan2.1 также были публично выпущены.
Более обоснованным отличием H3 является её универсальная единая мультимодальная видеотекстура, включающая текстовые, графические, видео- и аудиореференсы, а также нативный вывод аудио и видео — а не то, что это первая китайская видеомодель с открытыми весами.
Открытые веса моделей критически важны на рынках, где организации хотят больше контролировать свою инфраструктуру.
Хостинг-API обеспечивает более лёгкий старт, но открытые веса позволяют:
Возможность фактического самостоятельного хостинга H3 будет зависеть от информации, ещё не раскрытой в исходной статье, включая:
До публикации официальных весов и технической документации любые заявления о совместимости с потребительскими GPU или стоимости самостоятельного хостинга являются лишь предположениями.
MiniMax также отметила, что эта модель не является финальной точкой серии H.
Компания указала на следующие направления:
MiniMax заявила о планах продолжать расширение моделей серии H и в перспективе объединить возможности семейств H и M.
Семейство H в настоящее время ориентировано на мультимодальную генерацию, особенно видео.
Семейство M включает языковые и агентные модели MiniMax.
Будущая интеграция может указывать на систему, где одно семейство моделей сможет охватывать:
Это всё ещё перспективное направление, а не уже выпущенный единый продукт.
Наиболее важный вклад H3 — не просто более высокое разрешение.
Более значительный сдвиг заключается в том, что ранее разрозненные творческие операции теперь могут выполняться в одном контексте.
Авторы могут перейти от:
Сгенерируйте видео по этому предложению.
к:
Используй этого человека, следуй движению в этом видео, сохраняй эту визуальную идентичность,
получи темп-подсказки из этого аудио и создай новую сцену на основе этого промпта.
Это меняет роль видеомоделей.
Она перестаёт быть узкофункциональным генератором и становится мультимодальным творческим движком.
Для коммерческих команд ценность будет определяться тем, насколько последовательно H3 сможет сохранять референсную консистентность, следовать сложным инструкциям, отображать брендовую атрибутику и оставаться экономически эффективной.
Это передаётся из поколения в поколение.
MiniMax H3 — это универсальная мультимодальная видеогенеративная модель от MiniMax. Она принимает текст, изображения, видео и аудио в качестве контекста и поддерживает генерацию видео из текста, из изображения, на основе референсных материалов и управляемое создание видео.
Текущая документация API MiniMax указывает 2K как основное выходное разрешение H3. На странице тарифов также указан тарифный уровень 768P.
Официальная документация H3 поддерживает вывод видео длительностью до 15 секунд. Справочник API в настоящее время принимает целочисленные значения длительности от 4 до 15 секунд.
Генерирует ли MiniMax H3 аудио?
Да. MiniMax описывает H3 как поддерживающую нативное стереофоническое аудио и видео на выходе, поэтому аудио может генерироваться как часть видеорабочего процесса, не полагаясь всегда на отдельную модель пост-продакшна.
MiniMax в настоящее время оценивает H3 в 0,13 доллара за секунду для разрешения 2K и 0,09 доллара за секунду для 768P. Согласно опубликованным правилам биллинга, референсные видео и дополнительные изображения могут увеличивать стоимость входных материалов.
Да. Официальный API поддерживает референсные изображения, видео и аудио в одном рабочем процессе референсной генерации, при соблюдении ограничений на количество файлов, длительность, размер и комбинации входных данных.
MiniMax объявила о планах выпустить веса модели H3 в ближайшие дни с учётом применимых нормативных требований. На момент написания статьи официальный API уже доступен, но в официальной документации, изученной в ходе подготовки, ссылка на публичный репозиторий весов H3 ещё не подтверждена.
Нет, в широком историческом смысле это не так. Alibaba выпустила веса видеогенеративной модели Wan2.1 в 2025 году. H3 более примечательна тем, что объединяет мультимодальные референсы и нативную генерацию аудио и видео в одной универсальной видеомодели.
MiniMax H3 объединяет текст, изображения, видео и аудио в единый универсальный видеогенеративный процесс. Она поддерживает вывод 2K до 15 секунд, нативное стереофоническое аудио, контроль первого/последнего кадра и референсную генерацию с использованием нескольких типов медиа.
Её коммерческая привлекательность сосредоточена на двух аспектах: контроле и стоимости. MiniMax заявляет, что H3 хорошо справляется со следованием инструкциям, передачей фирменного стиля и переносом движений, а официальный API в настоящее время оценивает генерацию 2K в 0,13 доллара за секунду и 768P в 0,09 доллара за секунду.
MiniMax также планирует выпустить веса модели, хотя на момент публикации в изученной официальной документации не было ссылок на подтверждённый репозиторий весов H3.
Ключевой сдвиг в H3 — это не просто видео 2K, а движение к единой мультимодальной генеративной системе, которая понимает, как текст, изображения, видео и аудио должны работать вместе.
Начните с одной фразы и получите полноценный сайт за считанные минуты.