For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ru/articles/minimax-h3-on-metaso-768p-ai.md.
MiniMax H3 только что выпущен, и обсуждения вокруг него уже сместились с качества модели на более практические вопросы: по какой минимальной...

MiniMax H3 только что вышел, а обсуждения вокруг него уже сместились с качества модели на более практичный вопрос: насколько дёшево и удобно реально использовать его обычным создателям контента?
Модель привлекла внимание благодаря унифицированному управлению условиями для текста, изображений, видео и аудио, нативному стереозвуку, редактированию видео, генерации на основе референсов и выходу до 2K. При этом у неё открытые веса, и разработчики могут развернуть её самостоятельно.
Однако открытый исходный код не означает, что локальное развертывание будет простым.
Запуск большой мультимодальной видеомодели по-прежнему требует работы с файлами модели, фреймворками инференса, видеопамятью GPU, зависимостями, настройкой окружения и задержками генерации. В официальной документации MiniMax для развертывания рекомендуются SGLang, vLLM, Diffusers и ComfyUI, а пример развертывания SGLang использует четыре GPU.
Для создателей, которые просто хотят превратить идею в видео, это совершенно не то же самое, что «сделать видео».
В исходной статье основное внимание уделяется стороннему пути: MetaSo (Mita AI) уже интегрировала MiniMax H3 в свой браузерный продукт для генерации видео. В интерфейсе, показанном в исходной статье, пользователи могут использовать H3 напрямую, без настройки локального окружения.
Наиболее примечательны показанные при тестировании цены, специфичные для платформы:
Это цены, представленные на MetaSo в исходной статье, а не общие официальные API-цены MiniMax. Сторонние цены могут включать акции, субсидии или корректироваться в будущем, поэтому перед производственным использованием обязательно перепроверьте их.

MiniMax H3 — это мощная видеомодель с открытыми весами, но «открытый исходный код» и «простота запуска» — не одно и то же.
В официальном репозитории MiniMax H3 описывается как универсальная всёмодальная система генерации, способная понимать контекст, состоящий из:
Она может генерировать синхронизированное видео и нативный стереозвук для клипов продолжительностью от 4 до 15 секунд.
Текущая открытая версия предлагает два основных базовых варианта модели:
| Вариант модели | Основное назначение | Входные данные |
|---|---|---|
| H3-Base-FL2VA | Генерация видео из текста и по первому/последнему кадру | Текст плюс ноль, одно или два изображения |
| H3-Base-Ref2VA | Мультиреференсная генерация аудио и видео | Текст плюс референсные изображения, видео и/или аудио |
Модель с референсами поддерживает до:
MiniMax также задокументировала полный рабочий процесс для 2K, объединяющий H3-Base с H3-Context-IR и H3-Regenerate-2K.
В исходной статье упоминается, что MiniMax H3 возглавил рейтинг редактирования видео, опубликованный на платформе Artificial Analysis вскоре после её запуска.
Это утверждение можно проверить по текущему снимку состояния, просмотренному 7 августа 2026 года.
В Artificial Analysis MiniMax H3 указан как первая модель в рейтинге редактирования видео с аудио — в этом представлении он опережает Gemini Omni Flash. Поскольку это рейтинги в реальном времени, основанные на предпочтениях пользователей, точный порядок может меняться по мере поступления новых образцов.

Это веское доказательство конкурентоспособности H3 в качестве редактирования, но не следует распространять это утверждение на более широкую трактовку, что H3 навсегда занимает первое место во всех категориях генерации видео.
Генерация видео из текста, из изображения, референсная генерация и редактирование видео — это отдельные задачи, и рейтинги зависят от выбранных фильтров, даты, аудионастроек и голосов пользователей.
В исходной статье поднимается тезис, который часто упускается в обсуждениях открытых моделей: многие создатели не хотят становиться инженерами по инференсу, чтобы проверить творческую идею.
Самостоятельное развертывание H3 может включать:
В официальном репозитории MiniMax приведён пример SGLang, выглядящий примерно так:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Вариант для референсной генерации использует тот же пример с четырьмя GPU, отличаясь только вариантом модели и портом.
Это не означает, что все возможные развертывания H3 обязаны использовать ровно четыре GPU. Требования к оборудованию зависят от фреймворка, точности, степени параллелизма, разрешения, длительности видео и методов оптимизации.
Но это явно показывает, что эталонное развертывание не рассчитано на типичный потребительский ноутбук.
Веса модели доступны, но инференс по-прежнему требует значительных вычислительных ресурсов.
Создателям, использующим локальное оборудование, необходимо учитывать:
В исходном материале есть сообщение из сообщества: один пользователь после локальной загрузки H3 столкнулся с ошибкой нехватки памяти.
Этот анекдот не следует воспринимать как универсальный аппаратный ориентир, но более важная мысль верна: возможность скачать модель не означает возможность плавно её запускать.
В исходном материале сообщается, что локальная генерация короткого ролика длительностью около 10 секунд
на некоторых конфигурациях оборудования может занимать от 20 до 40 минут.
Это неофициальные спецификации задержки от MiniMax — фактическое время будет существенно различаться в зависимости от аппаратной и программной конфигурации.
Несмотря на это, для творческой работы задержки по-прежнему имеют решающее значение.
Генерация видео — это итеративный процесс. Пользователю может потребоваться несколько попыток, чтобы исправить следующие проблемы:
Если каждая попытка занимает очень много времени, то даже при том, что саму модель можно скачать бесплатно, экспериментировать и исследовать становится гораздо сложнее.
В рабочем процессе, описанном в источнике, опущена большая часть шагов по локальному развертыванию.
На главной странице MetaSo рядом с существующими продуктами для поиска и повышения производительности появился новый раздел генерации видео.
Согласно тестам из источника, базовый процесс выглядит следующим образом:
Вам не нужно скачивать репозиторий H3 или настраивать среду CUDA перед созданием первого видео.
Интерфейс, показанный в статье, включает основные рабочие процессы, которые создатели ожидают от H3:
На скриншоте также показана опция H3 Context IR, что соответствует официальной архитектуре MiniMax.
H3-Context-IR — это размещенная система предварительной обработки и оркестрации от MiniMax, предназначенная для интерпретации свободных мультимодальных инструкций. Она анализирует взаимосвязи между текстом, изображениями, аудио и референсными видео, а затем преобразует этот контекст в представление, которое H3-Base может использовать более эффективно.
MiniMax не включает полную размещенную систему H3-Context-IR в веса с открытым исходным кодом. Вместо этого предоставляется API для воспроизведения официального рабочего процесса.
Это различие помогает объяснить, почему размещенный сервис может быть проще в освоении, чем чистая локальная установка с открытыми весами.
Автор источника протестировал H3 через MetaSo, используя короткую концепцию поиска сокровищ в стиле вестерн.
Сгенерированный видеоклип включал:
Автор сообщает, что весь процесс — от открытия страницы генерации до получения готового 15-секундного результата — занял около трех минут.
Это единичный результат теста, а не гарантированная задержка обслуживания.
Фактическое время генерации может варьироваться в зависимости от:
Реальное отличие заключается в том, что пользователю не нужно самостоятельно управлять инфраструктурой инференса.
Для многих создателей это важнее, чем то, являются ли веса модели технически открытыми.
Согласно источнику, продвинутые пользователи могут подключить сервис к рабочим процессам ComfyUI.
Это обеспечивает полезный промежуточный вариант между универсальным веб-генератором и полностью самостоятельно размещаемой моделью.
ComfyUI — это открытая система рабочих процессов генеративного ИИ на основе узлов. Официальный репозиторий MiniMax H3 также перечисляет ComfyUI как один из рекомендуемых вариантов для инференса/рабочих процессов H3.
А также ссылку на шаблоны для H3.
Узловые рабочие процессы дают пользователям больше контроля над:
На практике разделение труда выглядит так:
| Тип пользователя | Подходящий рабочий процесс |
|---|---|
| Создатели, тестирующие идеи | Интерфейс промпта в браузере |
| Создатели, использующие референсы | Мультиреференсный рабочий процесс в браузере |
| Продвинутые пользователи | Рабочие процессы ComfyUI или API |
| Инфраструктурные команды | Локальное или облачное развертывание открытых весов |
Это одна из причин, почему размещенный доступ и открытые веса дополняют друг друга, а не являются взаимоисключающими.
Вторая половина статьи сосредоточена на ценах.
На момент тестирования автором MetaSo показывал:
| Разрешение | Цена, указанная MetaSo в источнике |
|---|---|
| 768p | 0,09 юаня/сек |
| 2K | 0,15 юаня/сек |

Эти тарифы приводят к очень низкой стоимости одного видео.
| Длительность | Стоимость из расчета 0,09 юаня/сек |
|---|---|
| 5 секунд | 0,45 юаня |
| 10 секунд | 0,90 юаня |
| 15 секунд | 1,35 юаня |
| Длительность | Стоимость из расчета 0,15 юаня/сек |
|---|---|
| 5 секунд | 0,75 юаня |
| 10 секунд | 1,50 юаня |
| 15 секунд | 2,25 юаня |
Вот почему в исходной статье говорится, что ИИ-видео в пересчете на юани вступает в эпоху «нескольких центов» (фыней).
Точнее, это цены стороннего хостинга на конкретный момент времени, и их не следует обобщать на всю экосистему H3.
Собственный API MiniMax и другие провайдеры могут использовать другие цены, валюты, разрешения, логику биллинга и рекламные скидки.
Artificial Analysis в настоящее время в своих сравнительных таблицах указывает цену API для создателей H3 как около 7,80 долларов США за минуту видео 1080p в настройках по умолчанию. Это отличается от базиса ценообразования на скриншоте MetaSo и подчеркивает, почему важно четко указывать конкретные тарифы каждого провайдера.
ИИ-видео редко получается идеальным с первой попытки.
Создатель может сгенерировать видео, обнаружить проблему, изменить промпт и попробовать снова.
Это означает, что реальная стоимость — это не:
Цена одного видео
а скорее:
Стоимость каждой попытки × количество попыток, необходимых для получения приемлемого результата
Предположим, создателю нужно 8 попыток, чтобы сгенерировать 10-секундное видео 768p и выбрать из них один рабочий вариант.
По цене MetaSo, указанной в источнике:
10 секунд × 0,09 юаня × 8 попыток = 7,20 юаня
Когда стоимость каждой попытки достигает десятков юаней, тот же базовый творческий процесс становится гораздо более сложным.
Более низкая цена может изменить поведение пользователей.
Создатели могут позволить себе тестировать:
Ценность заключается не только в экономии на финальном продукте.
Она также снижает психологическую стоимость попыток.
Стоимость генерации текста достаточно низка, поэтому пользователи редко колеблются, прежде чем попросить еще один вариант черновика.
С видео все иначе.
Каждая генерация требует гораздо больше вычислительных мощностей, а результат может содержать несколько аспектов, которые одновременно могут пойти не так:
Это делает повторную выборку обычным делом.
Поэтому практический производственный показатель:
Общие затраты
──────────────
Количество пригодных к использованию видео
Если модель имеет низкую стоимость генерации в секунду, но при этом производит достаточно пригодных результатов, чтобы стоимость каждого принятого фрагмента оставалась низкой, то она ценна.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Создателям следует оценивать как цену, так и процент удачных результатов.
Цена важна, потому что H3 — это не упрощенная модель генерации видео из текста.
Официальный репозиторий MiniMax подтверждает поддержку H3:
Архитектура также совместно предсказывает скрытые переменные видео и аудио через H3-Omni-Transformer.
Это означает, что одна генерация может одновременно содержать визуальную и аудиоструктуру, без необходимости отдельного этапа озвучивания.
Официальный репозиторий H3 описывает полную систему следующим образом:
H3-Base генерирует выходное разрешение 768p.
Затем H3-Regenerate-2K принимает базовый результат вместе с исходным контекстом и повторно генерирует фрагмент в более высоком разрешении.
Это отличается от простого масштабирования пикселей.
Управляемый API может скрывать эти этапы от пользователей.
В исходной статье также показана панель API H3 в MetaSo.

Скриншот содержит пример запроса с использованием собственного API-хоста MetaSo и имени модели MiniMax-H3.
Упрощённая версия показанной структуры выглядит следующим образом:
curl --request POST \
--url https://metaso.cn/api/minimax/v2/video_generation \
--header 'Authorization: Bearer ' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-H3",
"content": [
{
"type": "text",
"text": "Опишите видео, которое вы хотите сгенерировать."
}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}'
Этот код отражает форму запроса, видимую на исходном скриншоте. Перед развёртыванием в производственной среде разработчикам следует использовать актуальную документацию MetaSo или встроенную панель API, поскольку конечные точки, поля, форматы аутентификации и ограничения могут меняться.
для повторяющихся рабочих процессов
Программный доступ полезнее браузера, когда командам требуются:
Управляемый инференс позволяет приложениям вызывать H3 без управления собственным стеком обслуживания моделей.
Экосистема H3 теперь предлагает разработчикам несколько способов работы.
Лучше всего подходит для:
Преимущества:
Компромиссы:
Лучше всего подходит для:
Преимущества:
Компромиссы:
Лучше всего подходит для:
Преимущества:
Компромиссы:
Правильный выбор больше зависит от экономики рабочего процесса, чем от идеологии.
Открытые модели всё равно могут достигать максимального удобства через управляемые сервисы.
Для тех, кто хочет протестировать H3 без локального развёртывания, разумный процесс выглядит так:
Используйте режим с более низкой стоимостью при изучении промптов и сцен.
Не вкладывайте средства в высокое разрешение, пока концепция не подтверждена.
Меняйте только одну переменную за раз:
Так проще понять, что именно улучшает результат.
Фиксируйте успешные комбинации.
Повторно используемый промпт может оказаться ценнее однократной удачной генерации.
Как только композиция и движение приемлемы, генерируйте или перегенерируйте на более высоком разрешении.
Если один и тот же рабочий процесс повторяется часто, перенесите его в нодовый граф или конвейер приложения.
Для коммерческого использования проверьте:
AI-генерацию следует рассматривать как часть производственной цепочки, а не как единственный этап проверки.
Разработчикам следует отделять доступ к модели от бизнес-логики.
Простая архитектура может выглядеть так:
Приложение
↓
Сервис генерации
↓
Адаптер провайдера
↓
MetaSo H3 API / MiniMax API / Самостоятельно размещённый H3
↓
Статус задачи + URL результата
↓
Хранилище / Проверка / Публикация
Адаптер провайдера упрощает последующую смену бэкенда инференса.
Можно сохранять следующие поля:
Это позволяет построить эффективный датасет для сравнения реальной стоимости каждого доступного фрагмента.
Эта броская цифра привлекательна, но есть несколько пограничных вопросов, которые стоит учитывать.
¥0.09/сек и ¥0.15/сек — это цены MetaSo, показанные в исходной статье.
Их не следует цитировать как стандартное глобальное API-ценообразование MiniMax.
Сторонние провайдеры могут корректировать цены по следующим причинам:
Обязательно сверяйтесь с актуальным интерфейсом в реальном времени.
Рабочий процесс с большим количеством неудачных генераций всё равно может стать дорогим.
Измеряйте показатель принятия результатов.
MetaSo берёт на себя инфраструктуру для пользователей.
Самостоятельное размещение даёт больше контроля, но также переносит вычислительную и эксплуатационную нагрузку на пользователя.
Самая примечательная часть источника — не просто низкая цена у одного из провайдеров.
А слияние двух тенденций.
Во-первых, высококачественные видеомодели становятся более открытыми.
MiniMax выпустила веса H3 и поддерживает множество фреймворков для инференса, включая ComfyUI.
Во-вторых, управляемые платформы превращают эти открытые модели в сервисы «в один клик».
Отсюда — более широкая аудитория:
Сами модели проще не становятся.
Инфраструктура становится невидимой для пользователя.
MiniMax H3 — это открытая по весам полимодальная система генерации видео от MiniMax. Она принимает текст, изображения, видео и аудио в качестве контекста и генерирует синхронизированные видеоролики длительностью до 15 секунд с нативным стереозвуком.
В исходной статье указано, что во время тестирования MetaSo взимала ¥0,09 за секунду генерации для 768p и ¥0,15 за секунду для 2K. Это цены платформы MetaSo, а не общие официальные тарифы API MiniMax, и они могут меняться.
Да, если вы используете управляемый сервис, например собственный API/приложение MiniMax или сторонние платформы вроде MetaSo. Провайдеры запускают модель на своей инфраструктуре, поэтому вашему локальному устройству нужен только доступ к сервису.
MiniMax опубликовала веса модели и код H3 по своей лицензии для сообщества. Полная управляемая оркестровка H3-Context-IR не входит в открытый релиз, однако MiniMax предоставляет API и руководства по промптам для этого этапа.
Да. Официальный репозиторий MiniMax H3 указывает ComfyUI как один из рекомендуемых рабочих процессов и предоставляет ссылки на шаблоны H3. MetaSo также заявляет, что её управляемый доступ к H3 совместим с рабочими процессами ComfyUI.
Рабочие процессы.
Конкретные требования зависят от фреймворка инференса, точности, длительности и целей производительности. Официальная справочная команда SGLang от MiniMax использует четыре GPU, поэтому пользователям не стоит рассчитывать, что обычный потребительский ноутбук легко запустит полную модель.
По состоянию на снимок от 7 августа 2026 года, рассмотренный в этой статье, H3 занимает первое место в рейтинге видеоредактирования с аудио на Artificial Analysis. Рейтинги динамичны и не означают, что H3 является лучшим во всех категориях генерации видео.
Во время экспериментов обычно разумнее начинать с более дешёвого разрешения, поскольку большинство концепций требуют множества итераций. Когда движение, композиция и референсный контент стабилизируются, идеальные результаты можно перенести в рабочий процесс с более высоким разрешением.
MiniMax H3 имеет открытые веса, но локальное развёртывание по-прежнему связано с немалыми требованиями к оборудованию и инженерными затратами. Официальный справочный пример обслуживания от MiniMax использует конфигурацию SGLang с несколькими GPU, что отчасти объясняет, почему многие видеокреаторы предпочитают управляемый маршрут.
Исходная статья показывает, как MetaSo превращает H3 в браузерный сервис, предлагающий генерацию из текста, из изображения, многореференсную генерацию, доступ через API и рабочие процессы для ComfyUI. На момент тестирования MetaSo показывала цены ¥0,09 за секунду для 768p и ¥0,15 за секунду для 2K.
Эти низкие сторонние тарифы важны, потому что AI-видео по своей сути — итеративный процесс. Более дешёвые попытки позволяют креаторам тестировать больше направлений съёмки, промптов, сцен и монтажей, прежде чем финализировать результат в высоком разрешении.
Настоящий сдвиг не только в том, что H3 имеет открытый исходный код, — а в том, что видеомодели с открытыми весами становятся такими же доступными, как обычные веб-сервисы.
Начните с одной фразы и получите полноценный сайт за считанные минуты.