Перейти к содержимому
Медиа Про Айти
Меню
  • Зеленые технологии
  • Технологии
  • Гаджеты
  • Нейросети
  • Роботы
  • Интернет
Меню

Alibaba разрабатывает универсальную ИИ-модель VACE для генерации и редактирования видео

Опубликовано в 23.04.2025 от Редакция

Исследователи из Alibaba Group представили новую универсальную ИИ-модель VACE, которая может как генерировать, так и редактировать видео. Оба процесса можно проводить в едином интерфейсе. Модель способна работать с различными данными, включая текстовые запросы и последовательности изображений. VACE анализирует полученные данные и обрабатывает их как единое целое.

Алгоритм использует маски для разделения изображения на области, которые можно изменять, и зоны, которые остаются нетронутыми. VACE выполняет четыре основные задачи: генерацию видео из текстовых запросов, создание роликов на основе эталонных изображений, редактирование видео и применение масок для целевого редактирования. Благодаря этому новая модель может быть использована в различных областях, от анимации персонажей до замены объектов и расширения фона.

Для оценки эффективности VACE исследователи разработали специальный бенчмарк из 480 примеров, охватывающих 12 задач редактирования видео. Согласно результатам, VACE превосходит специализированные модели с открытым исходным кодом как по количественным показателям, так и в тестировании людьми. Однако коммерческие модели, такие как Vidu и Kling, все еще имеют преимущество в генерации видео по эталонным изображениям.

Основой модели является усовершенствованная архитектура диффузионного трансформера, но ключевым моментом является новый формат входных данных — “Блок обработки видео” (VCU). Он принимает все, от текстовых подсказок до последовательностей изображений и пространственных масок. Команда разработала механизмы, чтобы эти разрозненные входные данные работали вместе и не конфликтовали.

VACE использует метод “развязки концепций” для разделения изображения на редактируемые и фиксированные области. Это позволяет модели точно контролировать, что нужно изменить, а что оставить без изменений. Для обеспечения последовательности сгенерированного видео VACE сопоставляет характеристики с латентным пространством, созданным в соответствии со структурой диффузионного преобразователя.

Инструментарий VACE охватывает создание видео на основе текстовых подсказок, синтез новых кадров, редактирование и целенаправленное редактирование. Такой подход открывает широкий спектр вариантов использования. Обучение модели началось с таких задач, как вставка и закрашивание, а затем продолжилось более сложными этапами редактирования.

Исследователи из Alibaba рассматривают VACE как важный шаг на пути к универсальным мультимодальным моделям для видео. Следующий этап будет связан со масштабированием с использованием больших наборов данных и вычислительных мощностей. Некоторые части модели будут доступны в виде открытого исходного кода на GitHub. VACE вписывается в амбиции Alibaba в области ИИ, наряду с недавними релизами больших языковых моделей, таких как Qwen. Другие компании, такие как ByteDance, также активно развивают технологии ИИ для видео.

Навигация по записям

← ActiveCloud расширяет SaaS-портфель с многофакторной аутентификацией Multifactor
Realme представила смартфон GT 7 с новым чипом MediaTek и уникальным дизайном →

Популярное за неделю

Учредитель ООО "Клуб регионов", ИНН 6685155934

Генеральный директор: Чернокоз Ольга Валерьевна

info@gosrf.ru

+7 (495) 920-51-49

Политика в отношении обработки персональных данных

Согласие на обработку персональных данных

© 2026 Медиа Про Айти
Мы используем куки для наилучшего представления нашего сайта. Если Вы продолжите использовать сайт, мы будем считать что Вас это устраивает.