В каталог приехали пять моделей: картинки с текстом и видео со звуком
Три модели для картинок и две для видео с нативным звуком. Qwen уверенно рисует кириллицу, Seedance держит ролик до 30 секунд, FLUX 3 Video монтирует склейки внутри одной генерации.
Что приехало
За неделю в каталоге прибавилось пять моделей: три рисуют картинки, две снимают видео со звуком. Ниже — что каждая умеет и когда её имеет смысл брать. Актуальные цены всегда на карточке модели, здесь их не дублируем.
Grok Imagine Image 2.0 — генерация и правка в одной модели
Grok Imagine Image 2.0 — новое поколение картиночной модели xAI. Работает в двух режимах: рисует с нуля по тексту и правит уже готовое изображение по промпту, без отдельного инструмента редактирования.
Что важно знать:
- Два разрешения на выбор, 1K и 2K, и по тринадцать соотношений сторон в каждом — от квадрата и 16:9 до вытянутых 20:9 и 1:2 под сторис и баннеры
- До двадцати вариантов за один запрос
- На вход принимается ровно один референс-снимок, мульти-референса нет
- Негативный промпт не поддерживается — что не нужно в кадре, придётся формулировать через сам промпт
Модель у xAI пока в статусе Preview: поведение может меняться на стороне вендора.
Qwen-Image-3.0 — текст на картинке без сюрпризов
Qwen-Image-3.0 от Alibaba — тот случай, когда модель одинаково уверенно и генерирует, и редактирует. Главное, ради чего её стоит попробовать русскоязычной аудитории, — кириллица. Она рисует читаемый текст на изображении, а не привычную кашу из похожих на буквы символов.
Из полезного:
- До трёх референс-картинок на вход
- Негативный промпт и фиксированный seed — можно воспроизвести удачный кадр
- Промпт до 32 000 символов, есть авто-расширение короткого описания
- Позиционируется как баланс качества и скорости внутри семейства
Типичные задачи: постеры и афиши с заголовком, обложки, карточки для соцсетей, превью для статей.
Qwen-Image-3.0 Pro — плотные макеты и мелкий шрифт
Qwen-Image-3.0 Pro — старшая версия того же семейства. Её берут там, где в кадре много всего сразу: сложная вёрстка, мелкий текст, композиция «картинка внутри картинки», многоязычная типографика.
Второе, за что её берут, — фотореалистичная детализация. На портретах видно текстуру кожи, отдельные волосы, фактуру ткани и материалов. Это заметно дороже обычной 3.0, особенно в 2K, так что для простых задач разумнее оставаться на младшей версии.
Профильные сценарии: постеры, меню, раскадровки, макеты интерфейсов, брендовая графика.
FLUX 3 Video — видео со звуком и склейками внутри одной генерации
FLUX 3 Video от Black Forest Labs — мультимодальная видеомодель с нативным синхронным звуком. Три режима на одной архитектуре: из текста, из картинки и из готового видео.
Что она умеет такого, чего не умеют соседи по каталогу:
- Клипы от 5 до 20 секунд, при необходимости цепочка продолжений для сцены длиннее
- Мультишот: несколько планов с монтажными склейками внутри одной генерации
- Контроль ключевых кадров — можно закрепить стартовый кадр или задать до десяти опорных кадров с привязкой к таймкоду
- Многоязычные диалоги и читаемая типографика в кадре для титров
- Стилевой диапазон от любительской съёмки и анимации до кинематографичного фотореализма
Ограничения честные: негативного промпта и фиксированного seed нет, 1080p дороже 720p, а переработка готового видео дороже генерации с нуля.
Seedance 2.5 — тридцать секунд одним куском
Seedance 2.5 от ByteDance — старшая мультимодальная видеомодель для продакшена. Главная цифра — тридцать секунд нативной генерации в одном ролике, без сшивки кусков.
Вторая сильная сторона — объём референсов. На вход можно отдать до тридцати картинок, до десяти видео и до десяти аудио, а потом ссылаться на них прямо в тексте промпта. Плюс точечные правки: можно переделать участок кадра, не пересобирая остальную сцену.
Из ограничений: максимум 720p, выше модель не поднимается, а длинные ролики считаются заметно дольше коротких.
Что проверили руками
Перед тем как открыть модели всем, мы прогнали по тестовой генерации на каждой и посмотрели результат глазами.
- Qwen-Image-3.0 нарисовал вертикальный постер с заголовком на русском. Буквы читаемые, без сползающих засечек и выдуманных символов — для картиночной модели это до сих пор редкость
- Qwen-Image-3.0 Pro на портрете керамистки вытянул текстуру кожи, отдельные седые волосы и глиняную пыль на фартуке, фон с полками остался в мягком расфокусе
- Grok Imagine Image 2.0 отработал один и тот же ночной кадр в 1K и в 2K — разница в детализации мокрого асфальта и неоновых отражений видна сразу
- FLUX 3 Video выдал пятисекундный клип с наездом камеры и живым саксофоном поверх шума дождя
- Seedance 2.5 снял пролёт над прибрежным шоссе с ветром и шумом океана в звуковой дорожке
Все эти примеры лежат на карточках моделей в блоке «Как отвечает» — вместе с промптами, по которым они сделаны.
Что брать под задачу
Быстрая картинка или правка готовой — Grok Imagine Image 2.0. Постер с русским заголовком — Qwen-Image-3.0. Плотная вёрстка, мелкий текст и портретная детализация — Qwen-Image-3.0 Pro. Короткий ролик с диалогом и монтажом — FLUX 3 Video. Длинная сцена или работа с большим набором референсов — Seedance 2.5.
Все пять уже в каталоге и доступны с общего баланса, отдельная подписка не нужна.