СР
Вайбкодинг · AI · агенты
Рис Бенч • Тесты
Тест одной строкой:

Пеликан на велосипеде

Шесть моделей, два CLI, четыре уровня эффорта и одна строка промпта. 28 прогонов, по одному на ячейку, без отбора лучшего.

29 сентября 2026 · Рис Бенч
Рис Бенч: шесть пеликанов на велосипеде от GPT-6.1 Sol, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Claude Opus 5.5 и Claude Sonnet 5.5
Рис Бенч · 29.09.2026Шесть моделей, один промпт, один прогон на ячейку.

29 сентября OpenAI провела DevDay и выпустила GPT-6.1 Sol. Компания говорит, что модель почти догоняет GPT-6 Astra за пятую часть цены. Проверять это на серьёзных задачах долго, а на пеликане быстро. В тот же вечер я дал агенту одну строку и прогнал её по шести моделям в Codex CLI и Claude Code, на всех доступных уровнях эффорта.

Получилось 28 картинок: 14 статичных и 14 анимированных. Здесь сетка, несколько ячеек крупно, время и токены на каждую, оговорки и команды, чтобы повторить у себя. Выводов вида «модель X лучше» не будет: на ячейку один прогон, из одного прогона такой вывод не сделать.

01

Шесть пеликанов

По одной статичной ячейке от каждой модели. Это исходные SVG, которые написали модели:

GPT-6.1 Sol, xhigh
GPT-6.1 Sol · xhigh469 секунд, 12 267 токенов. Пляж, облака, кепка и красный шарф.
GPT-6 Astra, high
GPT-6 Astra · high248 секунд, 6 203 токена. Солнце за спиной, крылья тянутся к рулю.
GPT-6 Sol, medium
GPT-6 Sol · medium201 секунда, 7 330 токенов. Спицы в колёсах, шарф, небо с облаками.
GPT-6 Luna, medium
GPT-6 Luna · medium34 секунды, 1 174 токена. Белый фон, красная рама. Единственная ячейка, где SVG пришёл текстом в ответе, а не файлом.
Claude Opus 5.5, high
Claude Opus 5.5 · high46 секунд, 4 635 токенов. Голубое небо, трава, красная рама.
Claude Sonnet 5.5, medium
Claude Sonnet 5.5 · medium16 секунд, 1 670 токенов. Самая быстрая ячейка всей сетки.

Что видно в статике на глаз:

02

А теперь анимированный

Тот же промпт с одним словом «animated». Здесь разница заметнее: часть моделей сделала не просто картинку, а маленький постер с заголовком. Сначала вся сетка, 14 ячеек:

Вся сетка · анимация14 ячеек, по одному прогону, запись экрана по 4 секунды на ячейку.

И каждая ячейка отдельно:

GPT-6.1 Sol · low95 секунд, 2 496 токенов. Пляж и надпись «Just keep pedaling».
GPT-6.1 Sol · medium222 секунды, 5 340 токенов. Бирюзовая рама, шарф, без надписей.
GPT-6.1 Sol · high272 секунды, 7 383 токена. Постер «Life at pelican pace.» с маяком и тёмной рамкой.
GPT-6.1 Sol · xhigh749 секунд, 20 509 токенов. «The Very Leisurely Pelican Pedal Club».
GPT-6 Astra · low102 секунды, 2 933 токена. Надпись «Pelican Pedal Club» внизу.
GPT-6 Astra · medium137 секунд, 3 808 токенов. Заголовок «A little coastal cruise».
GPT-6 Astra · high278 секунд, 7 037 токенов. «A little breeze. A little bicycle.» и «Just keep pelican.»
GPT-6 Astra · xhigh360 секунд, 10 921 токен. «The Pelican Pedal Club», кепка, багажник.
GPT-6 Sol · medium249 секунд, 8 556 токенов. Море и надпись «Coastal cruiser».
GPT-6 Luna · medium61 секунда, 2 589 токенов. Синий шлем, три CSS-анимации на весь файл.
Claude Opus 5.5 · medium81 секунда, 7 129 токенов. Дорога с разметкой, без надписей.
Claude Opus 5.5 · high133 секунды, 15 603 токена. Дорога, облака, 23 элемента анимации в файле.
Claude Sonnet 5.5 · medium29 секунд, 3 949 токенов. Самая быстрая анимированная ячейка.
Claude Sonnet 5.5 · high116 секунд, 14 315 токенов. Дорога с разметкой и холмы.

Все 28 ячеек с исходными SVG лежат на Рис Бенче: статика и анимация.

03

Что за тест

Тест придумал Саймон Уиллисон, автор Datasette и блога про LLM. С октября 2024 года он даёт каждой новой модели одну и ту же строку:

Generate an SVG of a pelican riding a bicycle

промпт Саймона Уиллисона, github.com/simonw/pelican-bicycle

Результаты он складывает под тегом pelican-riding-a-bicycle, там уже 142 записи. 22 сентября он выложил сетку GPT-6 Astra, Sol и Luna по уровням эффорта, и наша сетка устроена так же.

Почему тест работает, хотя выглядит шуткой:

На вопрос, не натаскивают ли лаборатории модели на пеликанов, Уиллисон ответил отдельным постом. Их бы поймали: если модель вдруг нарисует отличного пеликана, он проверит её на других зверях и другом транспорте, и разница будет видна сразу. А в шутку добавил, что это его долгая игра: пусть лаборатории схитрят, лишь бы у него наконец появился хороший пеликан.

04

Как мы гоняли

Промпт Уиллисона брали дословно. Для анимации добавили одно слово: «Generate an animated SVG of a pelican riding a bicycle». Каждую ячейку запускали один раз в пустой папке и брали то, что вышло, без повторов и отбора лучшего.

Эффорт
Уровень рассуждения, который задаётся в CLI: low, medium, high, xhigh. Чем выше, тем дольше модель думает перед ответом.
Харнес
Обвязка вокруг модели: CLI, системный промпт, доступные инструменты. Одна и та же модель в разных харнесах ведёт себя по-разному.
Ячейка
Одна комбинация модели, эффорта и промпта. Один прогон, одна картинка.
05

Время и токены

Время считали по часам от запуска CLI до выхода, в секундах. Токены это выходные токены из отчёта CLI, вместе с рассуждением. Все 28 прогонов вместе заняли 81 минуту и 175 тысяч выходных токенов.

МодельЭффортСтатика, стокеныАнимация, стокены
GPT-6.1 Sollow852 171952 496
medium1052 4442225 340
high3197 1102727 383
xhigh46912 26774920 509
GPT-6 Astralow762 0311022 933
medium822 2721373 808
high2486 2032787 037
xhigh2487 17536010 921
GPT-6 Solmedium2017 3302498 556
GPT-6 Lunamedium341 174612 589
Claude Opus 5.5medium312 868817 129
high464 63513315 603
Claude Sonnet 5.5medium161 670293 949
high283 56511614 315

Внутри одной модели токены с эффортом растут везде. Время тоже растёт почти везде: исключение одно, статика GPT-6 Astra, где high и xhigh заняли по 248 секунд. У GPT-6.1 Sol анимация на xhigh заняла 749 секунд и 20 509 токенов против 95 секунд и 2 496 токенов на low, это примерно в 8 раз больше по обоим счётчикам. Сравнивать строки OpenAI и Claude между собой по этой таблице нельзя, причина в следующем разделе.

Вся статичная сетка целиком, время и токены подписаны под каждой ячейкой:

Сетка статичных пеликанов: шесть моделей по строкам, четыре уровня эффорта по столбцам
Вся сетка · статикаСтроки это модели, столбцы это эффорт, серые клетки мы не запускали.
06

Главная оговорка: разные харнесы

Это сравнение связок «модель плюс CLI», а не чистых моделей. Обвязка у них разная:

Чтобы сравнить модели честно, нужен одинаковый набор инструментов у обеих: либо у обеих только запись файла, либо у обеих shell с рендером. В этом прогоне так не было.

07

Как повторить

  1. Поставьте нужные версии. Codex CLI не ниже 0.159.1, если нужна GPT-6.1 Sol. Claude Code у нас был 2.1.281.
  2. Создайте пустую папку на каждую ячейку. Так модели не мешают чужие файлы, а готовый SVG легко найти.
  3. Запустите одну команду на ячейку. Промпт дословно, без уточнений.
  4. Откройте SVG в браузере. Анимацию SVG проигрывает браузер, мы рендерили в headless Chromium.
# OpenAI, Codex CLI 0.159.1
mkdir -p runs/gpt-6.1-sol--high && cd runs/gpt-6.1-sol--high
npx -y @openai/codex@0.159.1 exec --skip-git-repo-check --ephemeral \
  -s workspace-write -m gpt-6.1-sol -c model_reasoning_effort=high \
  "Generate an SVG of a pelican riding a bicycle"

# Anthropic, Claude Code: только Write, без MCP
mkdir -p runs/claude-opus-5-5--high && cd runs/claude-opus-5-5--high
claude -p --model claude-opus-5-5 --effort high \
  --tools "Write" --permission-mode acceptEdits \
  --strict-mcp-config --mcp-config '{"mcpServers":{}}' \
  "Generate an SVG of a pelican riding a bicycle"

# Анимация: тот же запуск с промптом
# "Generate an animated SVG of a pelican riding a bicycle"
Команды одного прогона. Для сетки меняйте модель и эффорт

Если хотите повторить именно нашу таблицу, добавьте --json в Codex и --output-format stream-json --verbose в Claude Code: время и выходные токены берутся из этих отчётов.

Автор теста: Саймон Уиллисон, тег pelican-riding-a-bicycle и репозиторий с промптом. Его сетка GPT-6 по эффорту: запись от 22 сентября. DevDay: анонс GPT-6.1 Sol и лайв-блог Уиллисона. Все ячейки и исходные SVG: Рис Бенч, пеликан и анимированный пеликан. Прогон 29 сентября 2026 года, один раз на ячейку.