MiniMax H3: видео 1440p с синхронным звуком

MiniMax H3

MiniMax H3 — мультимодальная видео-модель с нативным синхронным звуком. Принимает текст, изображения, видео и аудио (до 9 reference-изображений, 3 видео, 3 аудио), генерирует ролики от 5 до 15 секунд в 768p и 1440p. First/last frame, reference-условие на персонажа и голос, video-to-video и редактирование по инструкции. В отличие от версии Max здесь есть 1440p, видео- и аудио-референсы.

Категория
Видео
Модальность
Текст → Видео
Контекст
5-15 сек · 1440p · 9 ref · 3 видео
Релиз
Jul 2026
Сильные стороны

Для чего эта модель — лучший выбор

  • Нативная синхронная озвучка: речь, эмбиент и эффекты рождаются вместе с картинкой
  • Пять режимов в одной модели: text-to-video, image-to-video, video-to-video, audio-to-video и редактирование по инструкции
  • До 9 reference-изображений, 3 видео и 3 аудиодорожек для контроля персонажа, движения и голоса
  • Первый и последний кадр как опорные точки управляемого перехода
  • 1440p в шести соотношениях сторон, ролики от 5 до 15 секунд
  • До четырёх вариантов за запрос и фиксируемый сид для повторяемого результата
Ограничения

Где другую модель лучше взять

  • Максимум 15 секунд за одну генерацию, длительность только целыми секундами
  • Негативный промпт не поддерживается: описывать нужно только то, что должно попасть в кадр
  • Опорные кадры first и last нельзя совмещать с reference-изображениями, видео и аудио
  • Пресет разрешения работает только при наличии входного медиа; для чистого text-to-video ширина и высота задаются числами
  • Рендер в 1440p и на длинных роликах заметно дольше, чем у версии Max
Где используют

Четыре сценария, в которых она окупает себя

01
Кинематографичные ролики
Многокадровые сцены до 15 секунд с синхронным звуком и одним героем на все планы
02
Реклама и соцсети
Вертикальные и горизонтальные видео в 1440p под Reels, TikTok и Shorts
03
Говорящие головы
Артикуляция подстраивается под готовую аудиодорожку через reference-аудио
04
Переработка отснятого
Video-to-video и редактирование по текстовой инструкции без пересъёмки
О модели

Подробнее о MiniMax H3

MiniMax H3: нейросеть для видео с нативной озвучкой

MiniMax H3 — мультимодальная видео-модель от компании MiniMax, вышедшая 30 июля 2026 года. Она собирает ролик и его звуковую дорожку за один проход: речь, эмбиент и эффекты синтезируются вместе с картинкой, а не накладываются отдельным дубляжом. Попробовать MiniMax H3 можно онлайн в браузере на NetRoom без VPN.

Что умеет MiniMax H3

Пять режимов в одной модели. Text-to-video, image-to-video с опорой на первый и последний кадр, video-to-video, audio-to-video и редактирование готового видео по текстовой инструкции. Режимы комбинируются в одном запросе, отдельные пайплайны собирать не нужно.

Мультимодальные референсы. К промпту длиной до 7000 символов можно приложить до 9 изображений-референсов, до 3 видео и до 3 аудиодорожек длительностью от 2 до 15 секунд. Изображения удерживают внешность персонажа и обстановку сцены, видео задаёт кадрирование и характер движения, аудио — голос и тайминг реплик, под который подстраивается артикуляция.

Продолжение сцен. Модель продолжает существующий клип или звуковой фрагмент так, чтобы стык был незаметен. Это удобно для многокадровых роликов, где через все планы нужно провести одного и того же героя.

Разрешения, длительность и форматы

Доступны два пресета качества, 768p и 1440p, каждый в шести соотношениях сторон: 16:9, 9:16, 1:1, 4:3, 3:4 и 21:9. Крупнейшие кадры — 2560×1440 в 16:9 и 2944×1248 в широком формате. Длительность задаётся целым числом секунд от 5 до 15, за один запрос можно получить до четырёх вариантов с разными сидами. Готовое видео скачивается в MP4, WEBM или MOV, качество компрессии настраивается в диапазоне от 20 до 99.

Чем H3 отличается от H3 Max

Версия Max настроена на скорость и работает только с текстом и изображениями в 480p и 768p. Базовая H3 рендерит дольше, но снимает ограничения: 1440p, видео- и аудио-референсы, режим video-to-video и редактирование по инструкции. Max имеет смысл брать для быстрых итераций и черновиков, H3 — когда нужен финальный кадр и точный контроль над персонажем и голосом.

Когда брать MiniMax H3

Модель хорошо ложится на кинематографичные многокадровые сцены, рекламные ролики с закадровым голосом, говорящие головы с синхронизацией по готовой аудиодорожке и переработку уже отснятого материала. Запусти первую генерацию на NetRoom.

Последние изменения

Что менялось MiniMax H3

  • + Добавлена видеомодель MiniMax H3 (MiniMax): разрешение до 1440p, видео- и аудиореференсы, редактирование готового ролика.
Весь changelog →

Подключите MiniMax H3 по API

Тот же движок — из вашего кода: один ключ и один баланс на текст, картинки, видео и звук. Оплата только за фактические запросы.

curl
curl https://netroom.ai/api/v1/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "minimax/h3", "input": {"prompt": "A cinematic mountain sunrise"}}'

Id модели уже подставлен в пример. Полный справочник параметров и цены — в GET /api/v1/models и в документации.

Документация API Получить ключ

Попробуйте MiniMax H3
прямо сейчас

Бесплатный доступ к базовым моделям. Без карты, без обязательств.