Google представила мультимодальную модель Gemini Omni для генерации видео
В рамках конференции Google I/O компания представила Gemini Omni — новую нейросетевую модель, способную обрабатывать любые типы входных данных для создания видеоконтента. Первым представителем линейки стала модель Gemini Omni Flash, которая уже доступна в приложении Gemini, сервисе Google Flow и инструменте YouTube Shorts.
Расширенные возможности генерации
Gemini Omni позиционируется как следующий этап эволюции после моделей Nano и Veo 3.1. Новая технология объединяет изображения, аудио, видео и текстовые запросы для создания качественных видеороликов, опирающихся на глубокие знания нейросети о физическом мире. Ключевой особенностью является редактирование видео через естественный диалог: каждая последующая команда учитывает предыдущие, что позволяет сохранять целостность персонажей и окружения.
- Возможность изменения сюжета существующего видеоролика.
- Редактирование отдельных элементов, включая персонажей, объекты, углы обзора и стиль оформления.
- Улучшенное понимание физических процессов, таких как гравитация и динамика жидкостей, для повышения реалистичности сцен.
- Интеграция исторических и научных знаний для создания осмысленного повествования.
Цифровые аватары и безопасность
Пользователи получили возможность создавать персональные цифровые аватары, копирующие внешность и голос. В связи с вопросами конфиденциальности, компания подчеркнула наличие строгих политик безопасности, регулирующих использование инструментов искусственного интеллекта. Для защиты от подделок все сгенерированные материалы снабжаются невидимой цифровой маркировкой SynthID, подтверждающей использование Gemini Omni.
Доступность и перспективы
Основной задачей разработчиков остается борьба с эффектом «зловещей долины» — визуальным несоответствием, которое часто вызывает отторжение у зрителей при просмотре сгенерированных видео. Насколько успешно модель справляется с реалистичностью картинки, станет ясно в ближайшее время по мере массового использования технологии.
Смотрите также:
Масштабная утечка данных в системе здравоохранения Нью-Йорка затронула 1,8 миллиона человек http://stroybud.com/masshtabnaya-utechka-dannyih-v-sisteme-zdravoohraneniya-nyu-yorka-zatronula-1-8-milliona-chelovek/.
Интересности на тему: Google: Gemini 3.5 Flash повысит эффективность ИИ-агентов
Классные советы в статье "Отказ от наследства с долгами: как законно защитить свое имущество" здесь.
На текущий момент Gemini Omni Flash доступна всем подписчикам тарифов Google AI Plus, Pro и Ultra по всему миру. С этой недели функционал также начинает внедряться в YouTube Shorts и приложение YouTube Create.
* — деятельность компании запрещена на территории РФ
