Приложение чат-бота Gemini от Google теперь позволяет изменять как изображения, созданные искусственным интеллектом, так и изображения, загруженные с телефона или компьютера, сообщила компания Google в своем блоге в среду. Функция редактирования изображений в Gemini постепенно начнет внедряться сегодня, а в ближайшие недели станет доступна большему количеству пользователей на более чем 45 языках и в большинстве стран.
Запуск последовал за моделью редактирования изображений на основе AI, которую Google опробовала в своей платформе AI Studio в марте и которая стала вирусной из-за своей спорной способности удалять водяные знаки с любого изображения. Подобно недавно обновленному инструменту редактирования изображений ChatGPT, новомодный собственный редактор изображений Gemini теоретически может достигать лучших результатов, чем автономные генераторы изображений на основе AI.
Gemini теперь предлагает «многошаговый» поток редактирования, который обеспечивает то, что Google описывает как «более богатые, более контекстные» ответы на каждый запрос с интегрированным текстом и изображениями. Вы можете изменить фон в изображениях, заменить объекты, добавить элементы и многое другое в потоке платформы Gemini.
«Например, вы можете загрузить личную фотографию и попросить Gemini сгенерировать изображение того, как бы вы выглядели с разным цветом волос», — объясняет Google в сообщении в блоге. «Или вы можете попросить Gemini создать первый черновик сказки на ночь о драконах и предоставить изображения, которые будут сопровождать эту историю».
Если это звучит как риск deepfake, ну, это разумно. Чтобы развеять страхи, изображения, созданные или отредактированные с помощью собственной генерации изображений Gemini, будут включать невидимый водяной знак, согласно Google. Компания также «экспериментирует» с видимыми водяными знаками на всех изображениях, созданных Gemini.
Редактирование осуществляется с помощью естественных языковых запросов, при этом Gemini сохраняет контекст предыдущих изменений. Это позволяет поэтапно корректировать изображение: заменить фон, например, с газона на пляж; добавить или удалить объекты (например, шляпу на собаку); изменить стилистику или цветовые акценты.
Google называет эту систему «интуитивным пошаговым редактированием», и одна из её сильных сторон — комбинация визуального и текстового контента. Пример: можно попросить Gemini придумать сказку на ночь про драконов и сопроводить рассказ иллюстрациями к каждому фрагменту истории.
Это особенно ценно для учёбы, презентаций или создания контента в социальных сетях — теперь можно получить не только текст, но и визуальный материал в едином стиле, адаптированном под конкретный запрос.
Чтобы отличить изображения, созданные с помощью ИИ, Google автоматически добавляет на них невидимый цифровой водяной знак SynthID. Также компания тестирует видимый водяной знак — в виде маленькой метки «ai» в нижнем углу изображения.
Новая функция уже начала появляться у пользователей приложения Gemini. В течение ближайших недель она станет доступна в большинстве стран и на 45 языках. После активации появится встроенное предложение использовать редактор прямо в интерфейсе. Любая из текущих моделей Gemini будет поддерживать возможность редактирования изображений — включая генерацию, стилизацию и трансформацию по описанию.
