Устали от видеомонтажа? Gemini Omni от Google меняет сцены по вашему запросу
Приложения и софтGemini Omni может заставить традиционные приложения для видеомонтажа выглядеть устаревшими.

Что нужно знать
- Google представила Gemini Omni — новую мультимодальную ИИ-модель, созданную для генерации и редактирования видео с использованием текстовых, визуальных, аудио- и видеовходных данных.
- Модель обладает контекстной осведомленностью и пониманием законов физики, что помогает генерируемым видео выглядеть более реалистично и последовательно в ходе длительных творческих сессий.
- Gemini Omni запоминает предыдущие инструкции при многоэтапном редактировании, что может сделать итеративный процесс создания видео значительно более плавным.
Gemini скоро станет гораздо большим, чем просто чат-бот. На сегодняшнем мероприятии I/O компания анонсировала новую мультимодальную модель искусственного интеллекта под названием Gemini Omni, которая призвана помочь вам создавать и редактировать видео практически из любых предоставляемых вами данных.
По заявлению компании, Gemini Omni может объединять текстовые, графические, аудио- и видеореференсы в полностью готовые ролики, разработанные с учетом сохранения согласованности между сценами и правками. Это означает, что ИИ больше не полагается исключительно на традиционные текстовые запросы.
До сих пор инструменты для работы с видео на базе ИИ казались в основном разрозненными. Некоторые из них отлично справляются с визуалом, но ужасны в повествовании, в то время как другие не могут сохранить постоянство персонажей или окружения между правками. Google позиционирует Gemini Omni как решение этой проблемы. Omni спроектирована с учетом контекста и законов физики, а также способна поддерживать преемственность на протяжении долгих творческих сессий.
Начиная с прошлого года, Google неуклонно внедряет Gemini в рабочие процессы создания контента — вспомнить хотя бы появление Nano Banana, привлекшего всеобщее внимание к генерации и редактированию изображений на базе Gemini. В своем блоге Google называет Omni следующим большим шагом в этой стратегии, описывая его как переход Gemini от простого осмысления контента к его непосредственному созданию.
Одной из ключевых особенностей Gemini Omni является ее способность к разговорному редактированию. С помощью Gemini Omni пользователи могут просто указать системе на естественном языке, что именно нужно изменить, вместо того чтобы запускать запутанный пакет для монтажа и возиться с клипами кадр за кадром.
Компания также заявляет, что модель запоминает предыдущие команды при многоэтапных правках, что может сделать процесс итеративного монтажа гораздо менее хаотичным.
Google утверждает, что Omni лучше понимает такие концепции, как гравитация, кинетическая энергия и динамика жидкостей, чем предыдущие системы, что означает генерацию более убедительных сцен. Модель объединяет знания Gemini об окружающем мире с визуальной генерацией, позволяя создавать обучающие материалы, образовательный визуальный контент и более сюжетные сцены на основе кратких запросов.
Комбинируйте любые типы данных

Еще одно серьезное изменение касается гибкости исходных данных. Gemini Omni может объединять в рамках одного рабочего процесса изображения, рисунки, видео, текстовые запросы и аудиореференсы. По словам Google, авторы могут начать с грубых набросков или существующего материала, а затем доработать их до более отполированных кинематографических клипов. Система также предоставляет референсы стиля и движения, которые дают пользователям больше контроля над реальным восприятием финального видео.
Google также тестирует создание цифровых аватаров с помощью ИИ в рамках своего проекта Omni. Эти аватары выглядят и звучат так же, как сами пользователи, поэтому люди могут создавать кастомный видеоконтент без необходимости постоянно появляться перед камерой.
Это, конечно, вызывает вполне закономерные опасения по поводу неправомерного использования и дипфэйков, поэтому Google сразу же делает акцент на функциях безопасности. Все созданные с помощью Omni видео будут содержать водяной знак благодаря технологии SynthID, которая невидимым образом маркирует сгенерированный ИИ материал в целях верификации.
Gemini Omni Flash на данный момент становится первой публичной версией модели. Google сообщает, что она распространяется по всему миру среди подписчиков Google AI Pro и Ultra через приложение Gemini и Google Flow, а пользователи YouTube Shorts и YouTube Create также начнут получать к ней доступ на этой неделе без дополнительной платы. Доступ к API для корпоративных клиентов и разработчиков появится в ближайшие несколько недель.
Мнение Android Central
Google может сколько угодно рассуждать о физическом реализме, преемственности и защите SynthID, но ничто из этого автоматически не решает более глобальную проблему: когда каждый сможет за считанные секунды генерировать бесконечные отполированные видео, оригинальность станет разглядеть гораздо труднее. Gemini Omni действительно выглядит мощно, и это может стать одним из важнейших ИИ-запусков Google на сегодняшний день. Но если все платформы внезапно заполнятся идеально сгенерированными говорящими аватарами и искусственными историями, пользователи могут тратить столько же времени на выяснение того, что реально, сколько и на потребление самого контента.


