Стартап OpenAI улучшила нейросеть GPT-4o, добавив расширенные возможности генерации изображений. Теперь ИИ не только создает высококачественные визуальные объекты, но и точно передаёт текст, чего не могли добиться предыдущие модели.
Главная особенность обновления — динамическое редактирование изображений. Вместо создания с нуля при каждом новом запросе GPT-4o позволяет вносить пошаговые изменения, следуя инструкциям пользователя. Модель может манипулировать 10-20 объектами в сцене, интегрировать элементы из нескольких изображений и изменять загруженные фото.
Хотя GPT-4o ещё не идеален (проблемы с текстом, возможные артефакты), OpenAI уверена в его потенциале. Новый инструмент обещает стать ещё одним шагом к универсальной генерации изображений с детальной кастомизацией.
Напомним, что 25 марта OpenAI представила GPT-4o, мультимодальную модель, заменившую Dall-E 3 в ChatGPT. Модель генерирует изображения дольше, но намного качественнее, и лучше понимает запросы, учитывая сложные инструкции. GPT-4o легко справляется с запросами, содержащими 10–20 различных объектов (раньше было 5–8). Также умеет правильно отображать текст на изображениях и сохраняет последовательность между кадрами.
Модель вполне себе понимает абстракции, вплотную приблизившись к человеческому восприятию мира. Это показывает, что машины уже почти «поняли» физическую реальность и скоро будут с нами на одном уровне.
Правда, есть парочка минусов. Первый — скорее всего, все художники и дизайнеры скоро станут безработными. Второй — она пока доступна только по платной подписке, хотя первые несколько часов была бесплатной для всех.
Причем она это делает настолько хорошо, что пользователи тут же начали с помощью этой модели перерисовывать мемы, фотографии и даже трейлеры к фильмам.
