Gemini Omni Flash — видеомодель Google на NetRoom — NetRoom
← В блог
НОВОСТИ 22 июля 2026 г. 6 мин

Gemini Omni Flash: видео со звуком и правками по диалогу — уже на NetRoom

Google выпустила Gemini Omni Flash — преемника Veo 3.1: ролики до 10 секунд в 720p с нативным звуком, фото-в-видео по референсам и правки диалогом. На NetRoom — около 10,9 рубля за секунду.

Коротко

30 июня 2026 года Google открыла разработчикам доступ к Gemini Omni Flash — первой модели нового семейства Gemini Omni, отвечающего за генерацию и редактирование видео. Пользователи приложения Gemini увидели её раньше: консьюмерский запуск прошёл на Google I/O 19 мая, где модель заменила Veo 3.1. Gemini Omni Flash делает ролики длиной от 3 до 10 секунд в 720p с нативным звуком, собирает видео из фотографий-референсов и — главное — умеет править уже готовый ролик в диалоге, без пересоздания с нуля. На NetRoom модель уже подключена: страница — Gemini Omni Flash, цена — около 10,9 рубля за секунду видео.

Что это за модель

Omni — новое семейство видеомоделей Google DeepMind, и Flash в нём первая. От линейки Veo она отличается подходом: Veo генерировала ролик по промпту, и если результат не устраивал, приходилось переписывать промпт и запускать генерацию заново. Omni Flash задумана как разговорная модель: первый результат — это черновик, который дальше доводится репликами. Попросили — она поменяла свет, добавила дождь, приблизила камеру, заменила фон, а остальное оставила как было.

Модель принимает на вход текст, изображения и видео, поэтому один и тот же инструмент закрывает сразу несколько задач: генерацию с нуля, оживление фотографий, переработку существующих роликов и итеративные правки.

Характеристики

  • Длительность — от 3 до 10 секунд, по умолчанию 8.
  • Разрешение — 720p, горизонтальный формат 16:9 и вертикальный 9:16 для Shorts и Reels.
  • Звук генерируется всегда: реплики персонажей, фоновый шум, эффекты. Отдельно включать его не нужно — и выключить тоже нельзя, это часть модели.
  • Форматы на выходе — MP4, WEBM и MOV.
  • До четырёх вариантов ролика за один запрос — удобно, чтобы выбрать лучший дубль.

Четыре режима работы

Текст в видео

Классический режим: описываете сцену словами — получаете ролик со звуком. Работает и с диалогами: если в промпте есть прямая речь, персонажи её проговорят.

Фото в видео

Два варианта. Первый — задать стартовый кадр: модель оживит фотографию и продолжит движение. Второй — референсы: загружаете до семи изображений (персонаж, товар, локация, стиль), и модель соберёт сцену с этими объектами. Это рабочий способ удержать одного и того же героя или продукт в серии роликов.

Видео в видео

Загружаете собственный ролик и описываете, что поменять: перекрасить объект, заменить фон, поменять погоду или время суток. Модель перерабатывает исходник, сохраняя композицию кадра.

Multi-turn: правки диалогом

Главная фича модели. Каждая генерация получает свой идентификатор, и следующий запрос можно адресовать к ней: «теперь ближе камеру и добавь туман» — и модель правит именно этот ролик, а не генерирует новый по мотивам. Итераций может быть несколько подряд, как в обычном чате. Для рабочих задач это меняет экономику: вместо пяти полных генераций «вслепую» — одна генерация и несколько точечных правок.

Кому это пригодится

Десять секунд со звуком — это формат короткой рекламы, продуктовой заставки и вертикального ролика для соцсетей. Несколько сценариев, где связка режимов работает особенно хорошо:

  • Карточки товаров и промо. Загружаете несколько фото товара как референсы — получаете живой ролик с тем же самым товаром, а не с похожим. Не понравился фон — правите репликой, без повторной генерации с нуля.
  • Вертикальный контент. Формат 9:16 с готовым звуком закрывает Shorts, Reels и клипы для ВК: озвучивать и накладывать шумы отдельно не нужно.
  • Сторибординг и превиз. Режиссёру или дизайнеру проще показать заказчику десятисекундный черновик сцены, чем описывать её словами. Правки по ходу обсуждения вносятся прямо в диалоге.
  • Оживление архива. Старые фотографии и статичные баннеры превращаются в короткие анимированные ролики по одному стартовому кадру.

Единственное жёсткое ограничение, о котором стоит помнить, — 720p: для большого экрана и презентаций высокого разрешения модель пока не вариант, её стихия — веб и мобильные ленты.

Сколько стоит

У провайдера Runware модель тарифицируется токенами, как текстовые LLM: $1.50 за миллион входных токенов и $17.50 за миллион токенов видеовыхода. Секунда готового 720p-видео со звуком весит 5792 токена, то есть выходит примерно $0.10 за секунду — сама Google называет ту же цифру и сравнивает её с Veo 3.1 Fast.

На NetRoom всё считается проще — по секундам: около 10,9 рубля за секунду видео. Восьмисекундный ролик по умолчанию обойдётся примерно в 88 рублей, максимальные десять секунд — около 109 рублей. Оплата с баланса, списывается только за фактически сгенерированные секунды.

Как попробовать

Модель уже работает: откройте страницу Gemini Omni Flash или выберите её в списке видеомоделей в чате NetRoom. Дальше — как обычно: пишете промпт или прикладываете фото, выбираете длительность и формат кадра, ждёте генерацию. Никакого VPN, зарубежной карты и подписки Google AI не нужно — пополняете баланс в рублях и генерируете из браузера.

Как и остальные видеомодели Google, ролики маркируются невидимым водяным знаком SynthID — на глаз он не заметен и на качество не влияет.

Если вы уже работали с Veo 3.1 на NetRoom, самый быстрый способ почувствовать разницу — сгенерировать ролик и тут же попросить модель что-нибудь в нём поменять. Именно в этой связке «генерация плюс правки» Omni Flash сильнее всего.

Ещё в блоге