Компания Google представила Veo 3, свою новейшую модель для генерации видео. Она способна генерировать качественные видео длиной более 5 секунд с музыкальным сопровождением, речью или целыми диалогами между персонажами.
Veo 3 стала лучше понимать текстовые и визуальные запросы по сравнению с предыдущей версией нейросети. Алгоритм точно передает физику реального мира и обеспечивает реалистичную синхронизацию движения губ персонажей с речью.
Доступ к Veo 3 уже открыт для подписчиков плана Ultra в приложении Gemini на территории США, а также для корпоративных пользователей через платформу Vertex AI. Это свидетельствует о стремлении Google сделать передовые ИИ-инструменты доступными для широкого круга создателей контента.
Параллельно с запуском Veo 3, существующая популярная модель Veo 2 также получила важные обновления, разработанные в сотрудничестве с кинематографистами. Среди них – возможность использования референсных изображений для точного контроля стиля и внешности персонажей, продвинутые элементы управления камерой для создания сложных кинематографических эффектов, а также функцию outpainting, которая позволяет расширять кадр и адаптировать видео под различные форматы экранов.
Обновления Veo 2 также включают интеллектуальные функции добавления и удаления объектов из видео. Модель понимает масштаб, взаимодействия между объектами и тенями и использует эти знания для создания естественных и реалистично выглядящих сцен. В ближайшие недели все новые функции Veo 2 станут доступны через API Vertex AI, а в последующие месяцы появятся и в других продуктах компании.
Инструменты для создания видео с использованием искусственного интеллекта, такие как Sora и Pika, способны генерировать крайне реалистичные фрагменты видео. При достаточных усилиях их можно связать в короткометражный фильм. Однако эти модели не могут одновременно создавать аудио и видео. Новая модель Google Veo 3 обещает изменить правила игры.
Анонсированная во вторник на выставке Google I/O 2025, Veo 3 представляет собой третье поколение мощной модели Gemini для генерации видео. Она способна автоматически создавать видеоролики, включающие звуковые эффекты, фоновые шумы и диалоги — всё в одном процессе.
Google кратко продемонстрировала эту возможность на примере анимационного CGI-клипа, изображающего говорящих животных в лесу. Звук и изображение были идеально синхронизированы, что подчеркивает потенциал новой технологии.
Эта разработка может значительно расширить возможности автоматического создания контента и открыть новые горизонты для видеопроизводства с минимальными затратами времени и ресурсов.
