ChatGPT Images 2.5: лучший генератор из виденных
Содержание
Восьмого сентября OpenAI показали ChatGPT Images 2.5. Я прогнал его руками по своим задачам, и вывод такой: это лучший генератор картинок из виденных мной. По-моему, шаг вперёд тут ощущается весомее, чем последний апдейт флагманской текстовой модели. Прямого сравнения с Midjourney и Flux на одинаковых промптах я при этом не делал. Оценка по своим рабочим задачам, без турнирной таблицы.
Картинки мне нужны под конкретное: обложки, иконки, прототипы экранов для проектов, которые собирают агенты. Поэтому и смотрел я на прикладные вещи. Насколько послушно правится готовая картинка, насколько точно переезжает деталь с чужой фотографии, во что это обходится по лимитам. Ниже то, что получилось проверить руками, и то, где остались вопросы.
Точечная правка держит героя, фон подтекает
Главное, за что я готов платить в генераторе: поправить одну вещь и сохранить всё остальное. Тут это работает. Ставлю комментарий прямо на картинке, пишу, что поменять, и правка применяется по существу. Поза героя на месте, композиция на месте.
Мелкие детали фона при этом всё равно подтекают. Герой остался как был, а кусок заднего плана перерисовался по-своему. Для обложки или прототипа это терпимо. Для макета, где фон несёт смысл, придётся смотреть глазами каждый раз.
Сколько правок подряд картинка выдержит, я не мерил. OpenAI обещают, что новая правка достраивает предыдущие и качество от числа итераций не проседает. У меня столько итераций подряд просто не набралось, чтобы подтвердить или опровергнуть.
Одна дырка нашлась быстро. Когда модель выдала серию из нескольких картинок, комментарий прямо на картинке для них недоступен. Чтобы поправить одну штуку из серии, её надо скачать и загрузить обратно как новый вход. Мелочь, но ритм работы ломает.
Про сам подход, черновик сначала и результат потом, я писал отдельно. С точечной правкой он наконец стал удобным. Картинка ведёт себя как документ, который правится по кусочку, и черновик перестал быть одноразовым: его можно доводить, а он остаётся собой.
Деталь с референса переезжает на новую картинку
Второе, что проверил: загрузить фото и попросить сохранить героя. OpenAI заявляют, что с референс-фото субъект получается узнаваемее и отличительные черты переносятся чаще. На моём примере так и вышло. Деталь с фотографии переехала на новую картинку точно, без переизобретения по дороге.
Проверка честная ровно настолько, насколько честен один референс. У меня в работе была одна фотография. Десяток разных лиц и фактур я через это не прогонял, так что выборка тут крошечная.
Зато сравнение с прошлым поколением получилось наглядным. Тот же промпт, старая модель, и кепка на герое разворачивается козырьком в другую сторону. Новая держит. Вот такие мелочи и решают, будешь ты доделывать картинку руками или возьмёшь как есть.
Артефакты ослабли, скорости на глаз не прибавилось
Фрактальная каша на металлической сетке, старая болячка прошлого поколения, вылезает теперь на детализированных участках. В прошлом поколении она лезла в глаза сразу. Здесь её надо искать, и это уже уровень “заметил, потому что приглядывался”.
С обещанным ускорением у меня расхождение. В анонсе заявлено снижение задержки до 50% относительно Images 2.0. По ощущениям разницы я не поймал: даже когда в интерфейсе крутится счётчик времени, ожидание кажется прежним. Секундомер я не доставал, замера нет. Так что это моё впечатление, и вполне возможно, что в части прогонов у меня работала модель потяжелее. Для рабочей задачи это в любом случае мелочь: ждать чуть дольше или чуть меньше, разницы в дне никакой.
Полтора десятка картинок не стоят почти ничего
Сгенерил подряд полтора десятка картинок на топовом платном тарифе. Счётчик лимитов не сдвинулся ни на процент. Для рабочего дня это снимает главный тормоз: можно перестать считать попытки и гонять варианты, пока не получится.
Как ведут себя тарифы подешевле, я не знаю, там не проверял. Так что если сидишь на дешёвом плане, свои полтора десятка попыток лучше отсчитать самому и посмотреть на счётчик. Раскатка при этом широкая: все пользователи ChatGPT, ChatGPT Work и Codex, все тарифы, десктоп, мобильные, веб.
В API история отдельная. Там две модели: быстрая по умолчанию и вторая, для более точного контроля, которая генерирует дольше. Тариф за токены у них одинаковый и совпадает со ставками прошлого поколения. Зачем разделили, из официальных материалов не следует.
Генератор стоит рядом с проектом, и в этом весь смысл
Главная ценность для меня в размещении. Генератор живёт внутри той же подписки, в которой я и так работаю. Прототип дизайна, обложка, иконка, ассет для интерфейса: всё собирается прямо в проекте, без прыжка в отдельный сервис и без ещё одной оплаты.
Отсюда и оценка на глаз. Генератор в чате метит в нишу отдельных инструментов: креативные задачи, под которые брали Midjourney, и правки макета, под которые открывали Figma или Photoshop. Стоит за этим ощущение от анонса и своих прогонов: замеров я не проводил, одинаковые промпты по разным инструментам не гонял. Ощущение при этом держится.
Обложки для видео я и так собираю без графических редакторов, писал про это раньше. Новый генератор закрывает соседний кусок работы: сами картинки, которые раньше приходилось искать или заказывать.
Режим рисования наброска прямо в чате меня лично не убедил: мои каракули дают кривых персонажей, и мне проще зайти через загруженный референс. Тому, кто умеет рисовать, там наверняка откроется другая история. Это вопрос руки, а моя рука к такому не приспособлена.
Для вайбкодинга это складывается в простую вещь. Когда агенты собирают проект, картинки перестают быть отдельным этапом со своим сервисом, своим счётом и своим переключением контекста. Ассет запрашивается в том же окне, где обсуждается интерфейс.
Что с этим делать сегодня
Решение простое. Тем, у кого генерация картинок уже живёт внутри ChatGPT, я советую остаться: это лучший генератор из виденных мной на сегодня. Правки в нём наконец держатся. Если картинки делаешь в отдельном сервисе ради пары задач в неделю, попробуй перенести их сюда и посмотри, хватит ли качества.
Держи в голове две дырки. Фон при точечной правке живёт своей жизнью, и серию из нескольких картинок придётся править через скачивание. Обе обходятся руками, но знать про них лучше заранее, чтобы не удивляться в середине работы.
Гоняться за каждым новым флагманом я смысла не вижу. Для типовых задач хватает той модели, которая уже лежит в подписке, а разницу добирает настройка процесса. Мнение это спорное, и я сам его расшатываю: китайские модели последнее время выходят такие, что позицию придётся пересматривать.
Похожие штуки, генерацию ассетов и агентов под свои задачи, собираю в Personal Corp: подробнее.