Пять новых моделей: картинки с текстом и видео со звуком — NetRoom
← В блог
НОВОСТИ 11 августа 2026 г. 6 мин чтения

В каталог приехали пять моделей: картинки с текстом и видео со звуком

Три модели для картинок и две для видео с нативным звуком. Qwen уверенно рисует кириллицу, Seedance держит ролик до 30 секунд, FLUX 3 Video монтирует склейки внутри одной генерации.

Что приехало

За неделю в каталоге прибавилось пять моделей: три рисуют картинки, две снимают видео со звуком. Ниже — что каждая умеет и когда её имеет смысл брать. Актуальные цены всегда на карточке модели, здесь их не дублируем.

Grok Imagine Image 2.0 — генерация и правка в одной модели

Grok Imagine Image 2.0 — новое поколение картиночной модели xAI. Работает в двух режимах: рисует с нуля по тексту и правит уже готовое изображение по промпту, без отдельного инструмента редактирования.

Что важно знать:

  • Два разрешения на выбор, 1K и 2K, и по тринадцать соотношений сторон в каждом — от квадрата и 16:9 до вытянутых 20:9 и 1:2 под сторис и баннеры
  • До двадцати вариантов за один запрос
  • На вход принимается ровно один референс-снимок, мульти-референса нет
  • Негативный промпт не поддерживается — что не нужно в кадре, придётся формулировать через сам промпт

Модель у xAI пока в статусе Preview: поведение может меняться на стороне вендора.

Qwen-Image-3.0 — текст на картинке без сюрпризов

Qwen-Image-3.0 от Alibaba — тот случай, когда модель одинаково уверенно и генерирует, и редактирует. Главное, ради чего её стоит попробовать русскоязычной аудитории, — кириллица. Она рисует читаемый текст на изображении, а не привычную кашу из похожих на буквы символов.

Из полезного:

  • До трёх референс-картинок на вход
  • Негативный промпт и фиксированный seed — можно воспроизвести удачный кадр
  • Промпт до 32 000 символов, есть авто-расширение короткого описания
  • Позиционируется как баланс качества и скорости внутри семейства

Типичные задачи: постеры и афиши с заголовком, обложки, карточки для соцсетей, превью для статей.

Qwen-Image-3.0 Pro — плотные макеты и мелкий шрифт

Qwen-Image-3.0 Pro — старшая версия того же семейства. Её берут там, где в кадре много всего сразу: сложная вёрстка, мелкий текст, композиция «картинка внутри картинки», многоязычная типографика.

Второе, за что её берут, — фотореалистичная детализация. На портретах видно текстуру кожи, отдельные волосы, фактуру ткани и материалов. Это заметно дороже обычной 3.0, особенно в 2K, так что для простых задач разумнее оставаться на младшей версии.

Профильные сценарии: постеры, меню, раскадровки, макеты интерфейсов, брендовая графика.

FLUX 3 Video — видео со звуком и склейками внутри одной генерации

FLUX 3 Video от Black Forest Labs — мультимодальная видеомодель с нативным синхронным звуком. Три режима на одной архитектуре: из текста, из картинки и из готового видео.

Что она умеет такого, чего не умеют соседи по каталогу:

  • Клипы от 5 до 20 секунд, при необходимости цепочка продолжений для сцены длиннее
  • Мультишот: несколько планов с монтажными склейками внутри одной генерации
  • Контроль ключевых кадров — можно закрепить стартовый кадр или задать до десяти опорных кадров с привязкой к таймкоду
  • Многоязычные диалоги и читаемая типографика в кадре для титров
  • Стилевой диапазон от любительской съёмки и анимации до кинематографичного фотореализма

Ограничения честные: негативного промпта и фиксированного seed нет, 1080p дороже 720p, а переработка готового видео дороже генерации с нуля.

Seedance 2.5 — тридцать секунд одним куском

Seedance 2.5 от ByteDance — старшая мультимодальная видеомодель для продакшена. Главная цифра — тридцать секунд нативной генерации в одном ролике, без сшивки кусков.

Вторая сильная сторона — объём референсов. На вход можно отдать до тридцати картинок, до десяти видео и до десяти аудио, а потом ссылаться на них прямо в тексте промпта. Плюс точечные правки: можно переделать участок кадра, не пересобирая остальную сцену.

Из ограничений: максимум 720p, выше модель не поднимается, а длинные ролики считаются заметно дольше коротких.

Что проверили руками

Перед тем как открыть модели всем, мы прогнали по тестовой генерации на каждой и посмотрели результат глазами.

  • Qwen-Image-3.0 нарисовал вертикальный постер с заголовком на русском. Буквы читаемые, без сползающих засечек и выдуманных символов — для картиночной модели это до сих пор редкость
  • Qwen-Image-3.0 Pro на портрете керамистки вытянул текстуру кожи, отдельные седые волосы и глиняную пыль на фартуке, фон с полками остался в мягком расфокусе
  • Grok Imagine Image 2.0 отработал один и тот же ночной кадр в 1K и в 2K — разница в детализации мокрого асфальта и неоновых отражений видна сразу
  • FLUX 3 Video выдал пятисекундный клип с наездом камеры и живым саксофоном поверх шума дождя
  • Seedance 2.5 снял пролёт над прибрежным шоссе с ветром и шумом океана в звуковой дорожке

Все эти примеры лежат на карточках моделей в блоке «Как отвечает» — вместе с промптами, по которым они сделаны.

Что брать под задачу

Быстрая картинка или правка готовой — Grok Imagine Image 2.0. Постер с русским заголовком — Qwen-Image-3.0. Плотная вёрстка, мелкий текст и портретная детализация — Qwen-Image-3.0 Pro. Короткий ролик с диалогом и монтажом — FLUX 3 Video. Длинная сцена или работа с большим набором референсов — Seedance 2.5.

Все пять уже в каталоге и доступны с общего баланса, отдельная подписка не нужна.

Попробовать все нейросети на одном балансе

Текст, изображения, видео и звук — один кабинет NetRoom вместо десятка подписок.

Начать бесплатно

Ещё в блоге