Девять новых моделей: видео 4K, апскейл и GPT-6 — NetRoom
← В блог
НОВОСТИ 7 сентября 2026 г. 8 мин чтения

Девять моделей в каталоге: видео до 4K, апскейл, голоса и GPT-6

Шесть видеомоделей, голосовой синтез и два GPT-6. Omni Flash обновился до 1.1 с 4K и продлением сцены, появился апскейлер готового видео, а Fish Audio клонирует голос по одному образцу.

Коротко

Девять моделей за один заход: шесть для видео, одна голосовая и две текстовые. Плюс Gemini Omni Flash обновился до версии 1.1, а предыдущая версия ушла с витрины. Ниже что появилось, чем отличается и когда что брать. Цены не дублируем — они живут на карточках моделей, там же калькулятор.

Видео

Gemini Omni Flash 1.1 — теперь 4K и продление сцены

Gemini Omni Flash 1.1 — обновление модели Google, которая генерирует видео сразу со звуком. Против прежней версии выросло почти всё.

  • Разрешения: было только 720p, стало 360p, 720p, 1080p и 4K. Младший режим удобен как черновой: посмотреть композицию, прежде чем платить за большой кадр
  • Продление ролика шагами по 3-10 секунд, суммарно до 30 секунд — сцена больше не обрывается на десятой секунде
  • Переход между первым и последним кадром: задаёте две картинки, модель строит движение между ними
  • Референсные видео, до трёх штук, и их можно сочетать с референсными картинками — так переносится и персонаж, и манера съёмки

Предыдущая версия отключена: держать в каталоге две Omni Flash смысла нет, новая умеет всё то же и больше.

MiniMax H3 и H3 Max — две разные модели, а не старшая с младшей

Названия сбивают с толку, поэтому по порядку. MiniMax H3 Max — про скорость: ролики до 15 секунд из текста или картинки, 480p и 768p, контроль первого и последнего кадра. Ни редактирования, ни работы с готовым видео.

MiniMax H3 — про возможности: разрешение до 1440p, до девяти референсных картинок, три видео и три аудио на входе, переработка готового ролика и редактирование. Секунда дороже, зато сценариев больше.

Правило простое: нужен быстрый ролик по описанию — Max. Нужно опереться на свой материал или переделать существующее видео — обычная H3.

Wan3.0 Video и Wan3.0 Prime — про длинную сцену

Wan3.0 Video от Alibaba берёт длительностью и объёмом входа: до 30 секунд, до десяти картинок, пяти видео и пяти аудио одновременно, синхронный звук, три разрешения вплоть до 1080p. На вход принимает даже документы — до пятидесяти страниц.

Wan3.0 Prime — та же модель, запущенная быстрее. Качество кадра то же самое, отличается только задержка и цена секунды. Брать имеет смысл, когда ролик нужен сейчас: правки при клиенте, перебор вариантов, горящий дедлайн. Если результат может подождать — берите базовую, переплата ничего не добавит к картинке.

FLUX Video Upscale — единственный в каталоге, кто не генерирует

FLUX Video Upscale от Black Forest Labs поднимает разрешение уже готового ролика: от полутора до трёх раз, до 1080p, 2K или 4K. Длительность и соотношение сторон остаются как в источнике, оригинальная звуковая дорожка сохраняется.

Ограничения жёсткие, их стоит знать заранее: исходник не длиннее 20 секунд, не тяжелее 50 мегабайт и не крупнее примерно 2560 на 1440. Промпт опциональный и только подсказывает, какую детализацию усиливать.

Практический смысл — вытянуть материал, который уже есть: старую съёмку, результат дешёвой модели, архивную запись. Генерировать заново дороже, чем поднять готовое.

Звук

Fish Audio S2.1 Pro — голоса и диалоги

Fish Audio S2.1 Pro — синтез речи с поддержкой более восьмидесяти языков и автоопределением языка по тексту.

  • Клонирование голоса по одному образцу длиной от секунды до полутора минут, к образцу нужна расшифровка
  • Многоголосые диалоги: реплики размечаются тегами, каждому говорящему свой голос
  • Управление подачей прямо в тексте — пометками вроде смеха, вздоха или короткой паузы
  • Форматы на выходе: MP3, WAV, FLAC, OGG

За одну генерацию берётся до трёх тысяч символов, длинный текст придётся резать на части.

Текст

GPT-6 Astra и Astra Pro

GPT-6 Astra — новое поколение OpenAI с контекстом больше миллиона токенов и ответом до 128 тысяч. На вход принимает текст, изображения и файлы, поддерживает вызов инструментов, структурированный вывод и управление глубиной рассуждений.

GPT-6 Astra Pro — та же модель, запущенная в режиме углублённых рассуждений. Отдельно обученной Pro-версии не существует: контекст, потолок ответа и набор параметров у них совпадают до последней цифры, и тариф за токен тоже одинаковый.

Разница не в прайсе, а в расходе. Pro тратит заметно больше токенов на обдумывание и отвечает дольше, поэтому фактический чек за одну и ту же задачу выходит выше. Практическое правило: начинайте с обычной Astra, переключайтесь на Pro там, где цена ошибки выше цены ожидания — разбор большого репозитория, инцидент по логам, сверка договора, длинная агентная цепочка. На переписке, черновиках и суммаризации разницы вы не увидите, а токены потратите.

Что брать под задачу

Ролик со звуком и высоким разрешением — Omni Flash 1.1. Быстрое короткое видео по описанию — MiniMax H3 Max. Работа с собственным материалом и переделка готового — MiniMax H3. Длинная сцена с большим набором референсов — Wan3.0 Video, а если горит — Prime. Поднять разрешение того, что уже снято — FLUX Video Upscale. Озвучка и диалоги — Fish Audio S2.1 Pro. Текст и агенты — GPT-6 Astra, с переключением на Pro на сложных задачах.

Все модели уже в каталоге и работают с общего баланса, отдельная подписка не нужна.

Попробовать все нейросети на одном балансе

Текст, изображения, видео и звук — один кабинет NetRoom вместо десятка подписок.

Начать бесплатно

Ещё в блоге