Gemini Omni Flash: видео со звуком и правками по диалогу — уже на NetRoom
Google выпустила Gemini Omni Flash — преемника Veo 3.1: ролики до 10 секунд в 720p с нативным звуком, фото-в-видео по референсам и правки диалогом. На NetRoom — около 10,9 рубля за секунду.
Коротко
30 июня 2026 года Google открыла разработчикам доступ к Gemini Omni Flash — первой модели нового семейства Gemini Omni, отвечающего за генерацию и редактирование видео. Пользователи приложения Gemini увидели её раньше: консьюмерский запуск прошёл на Google I/O 19 мая, где модель заменила Veo 3.1. Gemini Omni Flash делает ролики длиной от 3 до 10 секунд в 720p с нативным звуком, собирает видео из фотографий-референсов и — главное — умеет править уже готовый ролик в диалоге, без пересоздания с нуля. На NetRoom модель уже подключена: страница — Gemini Omni Flash, цена — около 10,9 рубля за секунду видео.
Что это за модель
Omni — новое семейство видеомоделей Google DeepMind, и Flash в нём первая. От линейки Veo она отличается подходом: Veo генерировала ролик по промпту, и если результат не устраивал, приходилось переписывать промпт и запускать генерацию заново. Omni Flash задумана как разговорная модель: первый результат — это черновик, который дальше доводится репликами. Попросили — она поменяла свет, добавила дождь, приблизила камеру, заменила фон, а остальное оставила как было.
Модель принимает на вход текст, изображения и видео, поэтому один и тот же инструмент закрывает сразу несколько задач: генерацию с нуля, оживление фотографий, переработку существующих роликов и итеративные правки.
Характеристики
- Длительность — от 3 до 10 секунд, по умолчанию 8.
- Разрешение — 720p, горизонтальный формат 16:9 и вертикальный 9:16 для Shorts и Reels.
- Звук генерируется всегда: реплики персонажей, фоновый шум, эффекты. Отдельно включать его не нужно — и выключить тоже нельзя, это часть модели.
- Форматы на выходе — MP4, WEBM и MOV.
- До четырёх вариантов ролика за один запрос — удобно, чтобы выбрать лучший дубль.
Четыре режима работы
Текст в видео
Классический режим: описываете сцену словами — получаете ролик со звуком. Работает и с диалогами: если в промпте есть прямая речь, персонажи её проговорят.
Фото в видео
Два варианта. Первый — задать стартовый кадр: модель оживит фотографию и продолжит движение. Второй — референсы: загружаете до семи изображений (персонаж, товар, локация, стиль), и модель соберёт сцену с этими объектами. Это рабочий способ удержать одного и того же героя или продукт в серии роликов.
Видео в видео
Загружаете собственный ролик и описываете, что поменять: перекрасить объект, заменить фон, поменять погоду или время суток. Модель перерабатывает исходник, сохраняя композицию кадра.
Multi-turn: правки диалогом
Главная фича модели. Каждая генерация получает свой идентификатор, и следующий запрос можно адресовать к ней: «теперь ближе камеру и добавь туман» — и модель правит именно этот ролик, а не генерирует новый по мотивам. Итераций может быть несколько подряд, как в обычном чате. Для рабочих задач это меняет экономику: вместо пяти полных генераций «вслепую» — одна генерация и несколько точечных правок.
Кому это пригодится
Десять секунд со звуком — это формат короткой рекламы, продуктовой заставки и вертикального ролика для соцсетей. Несколько сценариев, где связка режимов работает особенно хорошо:
- Карточки товаров и промо. Загружаете несколько фото товара как референсы — получаете живой ролик с тем же самым товаром, а не с похожим. Не понравился фон — правите репликой, без повторной генерации с нуля.
- Вертикальный контент. Формат 9:16 с готовым звуком закрывает Shorts, Reels и клипы для ВК: озвучивать и накладывать шумы отдельно не нужно.
- Сторибординг и превиз. Режиссёру или дизайнеру проще показать заказчику десятисекундный черновик сцены, чем описывать её словами. Правки по ходу обсуждения вносятся прямо в диалоге.
- Оживление архива. Старые фотографии и статичные баннеры превращаются в короткие анимированные ролики по одному стартовому кадру.
Единственное жёсткое ограничение, о котором стоит помнить, — 720p: для большого экрана и презентаций высокого разрешения модель пока не вариант, её стихия — веб и мобильные ленты.
Сколько стоит
У провайдера Runware модель тарифицируется токенами, как текстовые LLM: $1.50 за миллион входных токенов и $17.50 за миллион токенов видеовыхода. Секунда готового 720p-видео со звуком весит 5792 токена, то есть выходит примерно $0.10 за секунду — сама Google называет ту же цифру и сравнивает её с Veo 3.1 Fast.
На NetRoom всё считается проще — по секундам: около 10,9 рубля за секунду видео. Восьмисекундный ролик по умолчанию обойдётся примерно в 88 рублей, максимальные десять секунд — около 109 рублей. Оплата с баланса, списывается только за фактически сгенерированные секунды.
Как попробовать
Модель уже работает: откройте страницу Gemini Omni Flash или выберите её в списке видеомоделей в чате NetRoom. Дальше — как обычно: пишете промпт или прикладываете фото, выбираете длительность и формат кадра, ждёте генерацию. Никакого VPN, зарубежной карты и подписки Google AI не нужно — пополняете баланс в рублях и генерируете из браузера.
Как и остальные видеомодели Google, ролики маркируются невидимым водяным знаком SynthID — на глаз он не заметен и на качество не влияет.
Если вы уже работали с Veo 3.1 на NetRoom, самый быстрый способ почувствовать разницу — сгенерировать ролик и тут же попросить модель что-нибудь в нём поменять. Именно в этой связке «генерация плюс правки» Omni Flash сильнее всего.