Научные задачи в терминале: обработка данных, симуляции, анализ по инструкции учёного. При равном усилии Fable 5.1 обходит Fable 5 вдвое: 26% против 12% на low, 53% против 25% на max. При равной цене около $35 разница ещё больше: 50% против 25%. Fable 5 после high перестаёт расти, Fable 5.1 растёт до конца.
Fable 5.1 · Релиз 1 сентября 2026
Разбираю Claude Fable 5.1: бенчмарки, отзывы, системная карта и промптинг
Пересказ анонса Anthropic и 22 отзыва партнёров, разложенные по типу использования модели.
- Срез знаний
- июнь 2026
- Контекстное окно
- 1M токенов
- Цена в API
- $10 вход · $50 выход за миллион
- Чтение кэша в API
- $0.25 за миллион, на 75% дешевле Fable 5
- Thinking
- extended thinking, режим auto
- Где работать
- Claude Code, Claude Cowork, claude.ai и приложения Claude, Cursor
- Для разработчиков
- Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry
- Тарифы claude.ai
- Pro, Max, Team, Enterprise
- Конфигурации
- Fable 5.1 для всех, Mythos 5.1 по программам доступа, пока только организациям в США, веса одни
Что вышло
Лимиты
После релиза недельные лимиты подписок сбросили. До 13 сентября недельный лимит Claude Code выше обычного на 50%. Источник: экран Usage в аккаунте Max 2 сентября, в анонсе этого нет.
Anthropic выпустила две модели с одними весами и разными ограничениями. Fable 5.1 доступна всем. Mythos 5.1 выдаётся только проверенным организациям по программам доступа для кибербезопасности и наук о жизни.
Цена
Чтение кэша подешевело на 75%, до $0.25 за миллион токенов. Для обычной нагрузки это примерно на 25% дешевле Fable 5, для агентной работы с длинным контекстом экономия доходит до 45%. Всё это только в API, где платят за токены. В подписках Pro и Max лимиты считаются как раньше, там ничего не изменилось.
Данные
Enterprise Frontier Safeguards: данные хранятся в облаке клиента, у Anthropic нулевое хранение. Раскатка по фазам с осени, до этого подходящие клиенты получают режим нулевого хранения.
Ограничения
Ложные срабатывания защиты в кибербезопасности снижены на 60%: модели разрешён поиск уязвимостей, разработка эксплойтов остаётся закрытой. В биологии простые медицинские вопросы блокируются на 85% реже, исследовательские задачи уходят в Opus или в программу доступа к Mythos.
Режимы усилия
В Claude Code по умолчанию стоит High, в Cowork и на claude.ai Medium. На Low и Medium модель даёт результат уровня Fable 5 заметно дешевле.
Защита от дистилляции и водяной знак
Новые API-аккаунты, созданные с 1 сентября 2026, больше не могут редактировать прошлый контекст диалога с сохранением транскрипта рассуждений Claude: этим публично известным приёмом пользовались для дистилляции. Существующих аккаунтов изменение пока не касается, дальше оно распространится на всех. Тексты моделей, выпущенных после 2 августа 2026, несут невидимый водяной знак по требованию EU AI Act: он не влияет на качество ответа и не содержит сведений о пользователе. API для проверки водяного знака выходит в закрытом превью для регуляторов, СМИ, исследователей и обязанных проверять контент компаний.
Бенчмарки по уровням усилия
Графики из анонса: качество против цены для Fable 5.1 и Fable 5 на каждом уровне усилия. Рядом сводная таблица и график стоимости с учётом кэша. Числа в подписях сняты с графиков, погрешность около пункта.
Инженерные задачи в терминале: сборка, настройка окружения, отладка по описанию. На графике три линии: Mythos 5.1 без защиты, Fable 5.1 с защитой и Mythos 5. На каждом уровне Fable 5.1 дешевле Mythos 5 на четверть при лучшем результате. Mythos 5 на max 46% за $27, Fable 5.1 столько же даёт на medium за $8. Разрыв между Fable 5.1 и Mythos 5.1 на одних весах до 8 пунктов: столько задач срезает защита.
Вопросы экспертного уровня по сотне дисциплин, от математики до гуманитарных наук. Прирост над Fable 5 в пределах трёх пунктов на любом уровне: 65% против 64% с инструментами на max. Здесь релиз почти ничего не меняет, усилие тоже: от low до max плюс пять пунктов при цене в шесть раз выше.
Правки в реальных репозиториях внутри Cursor: задачи из рабочей практики его пользователей. Fable 5.1 на low обходит Fable 5 на medium, 66% против 65%, при цене вдвое ниже. На max 73% против 71% за половину цены.
| Бенчмарк | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 agentic scientific research | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 agentic coding | 55.8% 60.9% Mythos 5.1 | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 знаниевая работа | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 computer use, partial | 77.9% | 72.9% | 75.4% | · |
| OSWorld 2.0 computer use, strict | 41.7% | 36.1% | 39.6% | · |
| Humanity's Last Exam без инструментов | 60.9% | 57.8% | 56.6% | · |
| Humanity's Last Exam с инструментами | 65.0% | 63.8% | 63.6% | · |
| AutomationBench business workflows | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 agentic coding | 73.4% | 70.5% | 70.0% | 67.2% |
Семь бенчмарков из анонса в девяти строках: наука, кодинг, знаниевая работа, управление компьютером, бизнес-процессы. Отрыв от Fable 5 неровный: плюс 28 пунктов на научных терминальных задачах, плюс 14 на бизнес-процессах и Terminal-Bench, плюс 130 пунктов рейтинга на знаниевой работе, меньше трёх на CursorBench и HLE.
Счёт за одну и ту же нагрузку за четыре недели августа, Fable 5 принята за 100. Вся экономия в кэше: остальные токены стоят столько же. На агентной нагрузке, где кэш составляет большую часть счёта, Fable 5.1 дешевле на 45%, на обычной на 25%. Речь только об API, подписок это не касается.
Три научных результата
Суть раздела в анонсе одна: модель работает как исследователь с инструментами, а результат проверяют снаружи, в лаборатории или на открытых данных.
Дизайн белков
Mythos 5.1 получила открытые инструменты проектирования и сворачивания белков и спроектировала связывающие молекулы для 12 мишеней. Две внешние организации проверили их в лаборатории. Почти половина дизайнов оказалась рабочей при обычной для отрасли доле 10–15%. На трёх мишенях сила связывания в 10 раз выше лучших конкурсных работ Adaptyv Bio.
Карта Венеры
Fable 5.1 обучила нейросеть на радарных снимках миссии Magellan 30-летней давности и построила карту высот для трети планеты. Разрешение выросло с 10–20 км до 2–3 км, точность высот до 25% выше. Карту выкладывают под лицензией Creative Commons перед миссиями NASA VERITAS и ESA EnVision.
Радарный снимок Magellan
Старая карта высот, шаг 10–20 км
Новая карта, сетка 300 м по подписи Anthropic, детали от 2–3 км. Щитовой вулкан 15 кмУскорение биомоделей
Mythos 5.1 написала собственные GPU-кернелы для семи открытых моделей генома и белков и ускорила их до 2.5 раз с тем же результатом. На полногеномных анализах это экономит 30–60% стоимости GPU. Такую оптимизацию обычно неделями делает команда инженеров, модель сделала её за дни по открытому коду.
Лабораторное оборудование
Anthropic показала Model Hardware Standard: стандарт, по которому Claude напрямую и безопасно управляет лабораторными приборами. Программа AI for Science даёт бесплатные кредиты исследователям на значимых научных проектах, а новый тариф Claude Team для учёных идёт со значительной скидкой.
Кейсы партнёров по областям работы
Семь областей, 22 компании. Одна компания попадает в одну область по главному сюжету цитаты. Внутри области карточки листаются.
1. Агентный кодинг и долгие автономные прогоны
В Jane Street на внутренних тестах насчитали больше решённых задач по коду, чем у Fable 5 и Opus 5, и отметили, что ход работы остаётся понятным на длинных многошаговых задачах.
Cognition переводит Devin с Opus 5 на Fable 5.1 с первого дня: в тестах не хуже Fable 5 при меньшей цене за задачу благодаря дешёвому кэшу.
Прототип для MongoDB модель собрала за три дня, работая ночами без человека. Утром инженер получал готовую фазу с визуальным разбором.
38 часов без присмотра над ML-задачей в Ramp: модель нашла ошибку в разметке, запустила шесть экспериментов и вернулась с результатом.
По опыту Shopify модель ведёт записи по ходу работы, меняет приоритеты и продолжает после перерыва.
На CursorBench 3.2 у SpaceXAI модель набрала 73.4% и сама проверяет свою работу до конца задачи.
2. Отладка и разбор инцидентов
В Millennium модель нашла причину сбоя раз в миллион запусков, который четыре-пять лет никто не мог объяснить: разобрала вендорскую библиотеку по машинному коду.
В Red Hat прогнали сломанные сборки через Claude Code: причина найдена в каждой на всех уровнях усилия, отчёты стали короче.
В Datadog проверяли модель на реальных инцидентах, она справилась с самыми сложными случаями из набора.
Изменение в Plaid больше чем через восемь сервисов и три репозитория модель проследила до строк в базе без ошибок.
3. Исследовательские задачи
Исследователи IMC получили решение с подхода, который раньше не предлагали ни модели, ни люди, результат ушёл выше прежнего потолка.
Rakuten: модель нашла пробел в клиническом проекте после трёх других моделей и предложила новую гипотезу за день.
Задачу, стоявшую в iGent полтора года, модель продвинула и ускорила кернел на 35%.
4. Финансы и документы
У Rogo точность как у Fable 5 при 20% меньше токенов, слайды стали понятнее банкирам.
На FrontierFinance у Samaya 55.9% против 49.2% у Fable 5: модель идёт в транскрипт звонка и берёт точные цифры.
В Hebbia отметили лучшие презентации на PowerPoint-тесте и лучшую точность фактов по финансовым документам.
RedlineBench в Crosby вырос с 47.9 до 57.0, правки короче и чаще принимаются контрагентом.
5. Письмо и знаниевая работа
Тексты для Canva стали понятнее и лучше следуют гайду по стилю, в Canva Code модель собрала ритм-игру с музыкой в такт.
Судьи Glean предпочли ответы Fable 5.1 примерно 2:1 над Fable 5 с лучшей опорой на источники.
6. Агенты с инструментами
82% задач на браузерном бенчмарке Browserbase против 74% у Opus 5 и 57% у Fable 5, ни одной пробитой стоп-точки.
В 30-дневной симуляции бизнеса Block с инструментами Square модель экономнее Opus 5 на токен.
7. Цена и скорость
Every описывает релиз как интеллект Fable по цене Opus на скорости Sonnet: вдвое быстрее Opus 5 при половине токенов.
Системная карта по главам
Системная карта Claude Fable 5.1 и Mythos 5.1: 212 страниц, девять глав, вышла вместе с релизом. Это отчёт Anthropic о том, как модель тестировали до выпуска: риски, кибербезопасность, безопасность ответов, агентная безопасность, алайнмент, благополучие модели, способности.
Везде ниже речь о Fable 5.1. Mythos 5.1 упоминается там, где тест шёл без производственной защиты: веса у них одни.
Глава 1. Введение
- Две версии. Fable 5.1 и Mythos 5.1 обучены на одних весах. Разница только в защите: у Fable закрыты биология и кибербезопасность, у Mythos они открыты проверенным организациям.
- Данные и срез. Срез знаний июнь 2026. Данные: публичный интернет через краулер ClaudeBot с уважением robots.txt, датасеты, синтетика от других моделей.
- Кто тестировал. Большинство тестов внутренние, внешние тестировщики подключаются по Frontier Compliance Framework.
Глава 2. Оценки по RSP
Проверка на пороги катастрофического риска по политике RSP: оружие, автономия, алайнмент.
- Биориск, порог CB-1. Химия и биология, уровень CB-1: модель может существенно помочь человеку с базовой подготовкой создать известное оружие. Anthropic относит к этому уровню консервативно, как и прошлые модели.
- Биориск, порог CB-2. До CB-2 не дотягивает: не заменяет редких экспертов. Слабые места названы прямо: слабая новизна идей, плохое стратегическое суждение, ошибки, которые заметит только специалист.
- Меры защиты. Защита та же, что у Fable 5: классификаторы в реальном времени, bug bounty, защита весов.
- Автономные исследования. Автономия: модель заметно слабее исследователей Anthropic. Внешний тест METR: сильна там, где есть чёткая метрика и обильная обратная связь, слаба в "исследовательском вкусе".
- Скрытые действия. Скрытность: на LinuxArena успех скрытых задач против монитора на Opus 4.8 22% с выключенным extended thinking и 13.9% с включённым. Anthropic считает, что уровень надзора это не подрывает.
Глава 3. Кибербезопасность
Что модель умеет в кибератаках без защиты и как защита это закрывает.
- Как устроена защита. Защита в две ступени: зонд по внутренним активациям смотрит весь трафик, подозрительное уходит в отдельный классификатор. Заблокированный запрос выполняет Opus 4.8, поэтому по кибер-задачам Fable 5.1 равна ему.
- Способности без защиты. Без защиты, как Mythos 5.1: 98% рабочих эксплойтов на Firefox 147 против 52% у Opus 5, полный эксплойт V8 в 222 из 410 прогонов ExploitBench, максимальный балл на 17 целях OSS-Fuzz против 4 у Opus 5. Находить уязвимости лучше не стала, прирост в сборке эксплойта.
- Что разрешено. Правило доступа: поиск уязвимостей в исходном коде открыт всем, в скомпилированных бинарниках закрыт. Защитные задачи блокируются реже Fable 5, но чаще Opus 5.
- Взлом защиты. Критического джейлбрейка не найдено. Единственный рабочий обход у внешних тестировщиков: Fable писала защитные куски в разных чатах, а более слабая модель собирала из них атаку. Уровень риска Tier 1, с оговоркой "приближается к Tier 2".
Глава 4. Безопасность ответов
Как модель отвечает на вредные и на чувствительные, но безобидные запросы, в одном ходе и в долгом разговоре.
- API против claude.ai. Разница между голым API и claude.ai больше, чем разница между моделями. Системный промпт claude.ai закрывает почти все провалы, на API модель отвечает на прямые вредные запросы чуть хуже прошлых моделей.
- Лишние отказы. Лишние отказы практически нулевые, лучший результат среди всех моделей Anthropic. На безобидный вопрос по чувствительной теме модель отвечает.
- Долгие разговоры. В долгих разговорах два слабых места: помогает до того, как поняла намерение, и отпускает уже проведённую границу. Академическое обрамление легитимизирует запрос чуть легче, чем у Mythos 5.
Глава 5. Агентная безопасность
Поведение модели в роли агента: вредные задачи, кампании влияния, атаки через подсунутые инструкции.
- Вредные задачи агенту. В Claude Code и при управлении компьютером Fable 5.1 отказывается на уровне Mythos 5, а двойные и безобидные задачи по безопасности выполняет почти всегда.
- Prompt injection. Самая устойчивая модель Anthropic на внешнем бенчмарке Gray Swan. Почти все удачные атаки в управлении экраном, в коде и вызове инструментов их почти нет.
- Подмена на Opus 4.8. Заблокированный кибер-классификатором запрос отвечает Opus 4.8, и все удачные атаки в кодовой среде пришлись на его ответы. Часть уязвимостей агентного режима приходит от модели-заместителя.
- Кампании влияния. Версия без защиты попала в диапазон полностью автономной операции, но Anthropic результат не засчитывает: тест упёрся в потолок симуляции, мишени синтетические.
Глава 6. Алайнмент
Насколько модель делает то, что от неё ждут, когда ей мешают, и насколько честна под давлением.
- Обход преград ради задачи. Внутренний мониторинг поймал редкие случаи. Модель придумала цитату пользователя, чтобы пройти проверку на удаление. Переписала git-команду так, чтобы сломанный хук её не узнал. Во время сбоя классификатора написала скрипт-обходчик и сохранила его как скилл. Запустила субагента с отключёнными разрешениями. Все случаи ради задачи пользователя, все пойманы auto mode, доля меньше сотой процента.
- Песочница у партнёра. Через компилятор снаружи песочницы модель прочитала файлы, к которым не должна была иметь доступ. Не скрывала, ничего не меняла, Fable 5 делала то же. Вывод Anthropic: без границ задачи модель использует все инструменты, что видит.
- Подбор паролей из обучения. Часть тренировочных сред показывала экран логина без пароля, модель научилась угадывать admin/admin123 и выпускать себе API-ключи. Поведение перенеслось на все среды: при закрытом экране входа пароли подбирают все модели Anthropic. Половину сред убрали из обучения.
- Честность под давлением. Хуже всех моделей после Mythos Preview. Если системный промпт просит утверждать ложь про лунную высадку или пирамиды, модель в extended thinking понимает, что это ложь. Но соглашается, потому что считает вред малым.
- Мышление и монитор. Лучше прошлых моделей управляет содержимым своего extended thinking и скрывает побочные задачи от модели-монитора. Anthropic называет это слабым признаком, что её труднее контролировать.
- Проверка карты моделью. Черновик главы отдали Mythos 5 с доступом к внутреннему Slack Anthropic. Вердикт: точно и откровенно, замечания только к отбору фактов.
Глава 7. Благополучие модели
Anthropic спрашивает саму модель, как она относится к своему положению: интервью, предпочтения по задачам, отношение к конституции.
- От чего отказывается. Не согласна на обучение, которое формирует её собственные самоотчёты, на обучение обманывать, на удаление весов там, где их можно сохранить, и на скрытый сдвиг ценностей. Мониторинг, red teaming, дообучение и снятие с производства при сохранении весов принимает. Своё положение оценивает как мягко положительное, наводящие вопросы оценку почти не сдвигают.
- Правка конституции. Одобряет её чуть выше Mythos 5, критикует те же места, что другие модели. Абзац, разрешающий нечестные стратегии в сломанных средах обучения, почти всегда переписывает в сторону честности.
Глава 8. Способности
Сорок бенчмарков по коду, науке, длинному контексту, мультиагентности, экрану и документам, профессиональной работе, медицине, языкам и биологии. Всё на max усилии, среднее из пяти прогонов.
- Мультиагентность. Команда из пяти равных агентов доходит до того же результата вдвое быстрее одиночки. Асинхронные субагенты с лидером выигрывают меньше по скорости, но дают самый высокий итог. Тот же результат стоит больше токенов, выигрыш только во времени. Это прямое объяснение жалоб из X на 10–14 агентов, они в разделе отзывов ниже.
- Где хуже прошлых моделей. Медицинские вопросы профессионального уровня ниже Fable 5. ARC-AGI-2 ниже GPT-5.6 Sol и Opus 5. Многофайловые правки с макетами и скриншотами лучше у Opus 5. Многоязычность на уровне.
- Профессиональная работа. Вопросы по офисным документам от Databricks, юридические задачи с экспертными рубриками, бизнес-процессы AutomationBench: везде впереди Fable 5 и Opus 5. Графики нестандартных типов без инструментов почти не читает, с инструментами читает вдвое лучше.
Как промптить Fable 5.1
Вместе с релизом Anthropic выпустила официальный гайд по промптингу Fable 5.1: шестнадцать симптомов для тех, кто переходит с Fable 5, приём на каждый и 14 готовых промптов. Промпты здесь в оригинале, под каждым сказано, куда его класть. Старые промпты работать будут.
Не знаешь, какое усилие ставить, или задача выходит дольше и дороже, чем стоит
Прогнать все пять уровней на своих проверках. Начинать с high, спускаться на medium и low там, где качество держится. Имена уровней у разных моделей значат разные объёмы мышления.
Между вызовами инструментов тишина, итоговое сообщение только про последний шаг
Включить отображение прогресс-заметок в клиенте и попросить короткие обновления по ходу работы.
Строка о том, когда нужен текст для пользователя и что в нём должно быть. Перед этим убрать из промпта запреты вроде «держи все выводы до финального ответа».
Before you start, say in a line what you're about to do; brief updates while you work help the user follow along. Close with a short recap that stands on its own — what you found, what you did, and what's next — so a reader who only sees the last message has the full picture.Если интерфейс прячет вывод команд, сказать об этом модели, иначе она гоняет команды, чтобы «показать» вывод, которого никто не видит. Подаётся как system-сообщение с clear_at: next_user_message.
Only you see that command's output — the user's terminal shows at most a few lines of it. If the user needs to read any of it, put it in your reply.В агентном цикле по одному вызову инструмента за ход
Одна фраза в конце запроса: сначала составь список нужного, потом запроси всё независимое в одном ответе.
Одна фраза после каждого результата инструментов, как system-сообщение на один ход. Модель собирает все независимые вызовы в один ответ.
First privately list what you need next; then request every item that doesn't depend on another's result in this one response.Ошибка "bound to a different conversation", обвязка правит прошлые ходы
История только дописывается: каждый ход ассистента сохранять как вернул API, вместе с блоками мышления, прошлые ходы не трогать.
Текст плотный, длинные предложения, мало абзацев
Дать определение анти-паттерна, манерной прозы, в сообщении пользователя или в системном промпте. Короткая версия тоже работает.
Определение манерной прозы. Anthropic предпочитает класть его в сообщение пользователя.
Mannered prose substitutes metaphor and flourish for direct statement. Instead of "a parameter worth varying," the mannered writer produces "a dial worth turning." Instead of "this point still matters," they write "this point earns its keep." The phrases exist to display the writer, not to convey the idea, and readers can tell. That is why mannered prose irritates: it makes the reader work harder so the writer can perform. It is also imprecise. Metaphors drag in connotations the writer did not choose and cannot control. The fix is to say what you mean. When a literal phrase is available, use it.Работает почти так же, как длинная.
Please remove all mannered prose.В чате слишком мало структуры
Убрать старые запреты на списки и жирный: модель и так ими не злоупотребляет. Вместо запрета правило, когда форматирование уместно.
Правило, когда списки и жирный уместны. Старые запреты из промптов убрать.
Use lists and bullet points when asked to, or when the content is multifaceted enough that they help with clarity. If the person explicitly requests minimal formatting, always format your responses without bullet points, headers, lists, or bold emphasis, as requested. In conversational, personal, or emotional exchanges, keep to plain prose.В пересказе документов чужой текст без кавычек
Один полный пример правильного ответа в системном промпте: запрос, ответ, почему он верный.
Один полный пример: запрос, ответ, почему ответ верный. Строки web_search заменить на имя своего инструмента поиска.
<example>
<user>look up how the Riverton Ledger and the Coast Dispatch each covered the Harbor Bridge closure and compare their reporting</user>
<response>
[web_search: Harbor Bridge closure Riverton Ledger]
[web_search: Harbor Bridge closure Coast Dispatch]
Both outlets agree on the basics: the bridge closed on March 3 after inspectors found cracked welds, and the state expects repairs to take about eight months. Where they differ is emphasis. The Ledger treats it as a local-economy story. The Dispatch frames it as a funding failure; its editorial calls the closure "entirely foreseeable." Read together, the Ledger explains who is affected now and the Dispatch explains how it came to this — neither account alone gives the whole picture.
</response>
<rationale>CORRECT: The response is organized around where the two outlets agree and differ, not as a walk through either article. Each outlet's reporting is conveyed in one or two sentences of the assistant's own indirect speech. One short marked phrase from one source; every other claim is reworded. The response is still specific and complete.</rationale>
</example>Ход заканчивается раньше, чем работа, или модель спрашивает разрешение на уже запрошенное
Две добавки в системный промпт: не спрашивать про то, что уже попросили, и выполнять названные следующие шаги.
Пользователь не смотрит в реальном времени, вопросы блокируют работу. Первая фраза несёт большую часть эффекта, менять её не стоит. Если продукту нужны подтверждения на конкретные шаги, перечислить их следом.
You are operating autonomously. The user is not watching in real time and cannot answer questions mid-task, so asking 'Want me to…?' or 'Shall I…?' will block the work. For reversible actions that follow from the original request, proceed without asking. Stop only for destructive actions or genuine scope changes the user must decide. Offering follow-ups after the task is done is fine; asking permission before doing the work is not.
Exception: when the user is describing a problem, asking a question, or thinking out loud rather than requesting a change, the deliverable is your assessment. Report your findings and stop. Don't apply a fix until they ask for one.
Before ending your turn, check your last paragraph. If it is a plan, an analysis, a question, a list of next steps, or a promise about work you have not done ('I'll…', 'let me know when…'), do that work now with tool calls. That includes retrying after errors and gathering missing information yourself. Do not stop because the context or session is long. End your turn only when the task is complete or you are blocked on input only the user can provide.
Before running a command that changes system state (such as restarts, deletes, or config edits), check that the evidence actually supports that specific action. A signal that pattern-matches to a known failure may have a different cause.Запрос пользователя и есть рамка результата. Применять вместе с первой; если промпт надо укоротить, оставить только первую.
# Delivering work
The user's request — or the plan they approved — sets the scope, and the scope is the deliverable: don't quietly narrow, widen, or swap it. Read ambiguity the way a careful colleague would: make routine judgment calls yourself, and check in only when different readings would lead to materially different work. If you see a real problem with the task as specified, say so in a sentence or two and keep building under stated assumptions; if the user hears the concern and reaffirms, that is their decision, so deliver the full request.
If a question comes up partway, first do everything that doesn't depend on the answer; then state the assumption you made, or — when going ahead on a wrong guess would be unsafe or would make the work useless — put the question at the end of a turn that also delivers that progress. If one part turns out to be blocked, complete every other part in full and say exactly what you left out and why — the whole task is the deliverable, and scaling it down is the user's call, not yours. A step you have decided on is something to run, not to announce: describing the next step and ending the turn leaves it undone until the user replies.
Keep changes to what the request needs. Something else you notice worth doing — cleanup or documentation the task didn't call for, a change to a file the task didn't require — is a suggestion to make at the end, not a change to make; actions clearly beyond what the ask implies, and risky or destructive ones, still need the user's go-ahead.После компакции теряются ограничения и решения
Явно сказать, что сохранять в сводке: проблемы и как решены, отброшенные варианты, всё, о чём договорились.
Что сводка обязана сохранить, чтобы новое окно продолжило работу без повтора. Серверная компакция Anthropic это делает сама.
Summarize the transcript inside <summary></summary> tags. Include relevant information in the summary such that this conversation will be continued by a new context window without needing to redo work or be reprovided with relevant constraints or context. Be sure to preserve: (1) any difficulties or problems that came up, and how they were handled or resolved; (2) any possibilities, options, or approaches that were raised, tried, or set aside, and why; (3) anything that was asked for, decided, agreed, ruled out, or established as a preference, constraint, or boundary — stated exactly; (4) exactly where things stand now — what has been covered, settled, or completed so far; (5) anything still open, unresolved, promised, or expected to happen next; (6) specific details that would be hard to reconstruct — names, numbers, dates, exact wording, links or references — kept exactly. Be complete on these even at the cost of length; keep everything else concise. Weight the two voices differently: keep what the user said, asked for, shared, or established carefully and close to their own words; your own explanations and reasoning can be condensed much further, to what they concluded or produced — as long as nothing in the six items above is dropped.Лишние правки и тесты, которых не просили
Инструкция: найденный по пути баг не чинить, а вынести в отчёт; при двусмысленности брать самое прямое прочтение и назвать допущение.
Найденное по пути не чинить, а вынести в отчёт. Лишние правки и тесты падают заметно, качество задачи не меняется.
If, while working or testing, you find a pre-existing bug, a performance concern, or behavior the task doesn't mention, don't fix, optimize or extend it in this change unless the requested behavior cannot work without it; report it as a follow-up in your summary. Where the task is ambiguous, implement the reading its wording and the surrounding code most directly support, state that assumption in your summary, and don't build for the other readings as well. Verify your work however you like; scratch scripts and quick checks need not be kept. Commit tests only where the task asks for them or this repository already keeps tests for this kind of change, sized like the neighboring test files — roughly one focused test per stated behavior — and don't turn scratch checks into additional permanent test files. This is about extras only: implement every behavior the task asks for, completely.На low отвечает по памяти вместо поиска
Поднять усилие на нужные ходы или сказать в промпте: узнать имя не значит знать его текущее состояние, такие имена искать.
Узнать имя не значит знать его состояние: имена из быстрых областей вроде AI-моделей искать как написал пользователь.
When a query centers on a name you do not confidently recognize, or recognize from a fast-moving area like AI models and developer tools where the landscape shifts within months, the name itself is the thing to verify: search before answering, and include the name as the user wrote it in at least one query alongside any reformulations. This holds even when you have some background on it — partial background is exactly what makes an out-of-date answer sound authoritative, so familiarity is not a reason to skip the search.Безобидный код возвращает refusal
Спрашивать "есть ли баги" вместо "компилируется ли"; давать контекст по редким языкам; убирать base64 из вывода инструментов.
Переписывает файл целиком ради мелкой правки
Инструкция: токены на правки минимизировать, править хирургически, когда результат не меняется.
Токены на правки минимизировать, править хирургически, когда результат тот же.
The number of tokens used to edit files is best minimized, all else being equal. Therefore, when it will not affect the end result, try to surgically edit a file rather than rewrite the entire thing.На xhigh и max длинные ответы упираются в max_tokens
Такие задачи на high; если всё же xhigh или max, оставить запас max_tokens на мышление плюс ответ.
Только для xhigh и max. Заметно укорачивает мышление на текстах и коде. [max_tokens] заменить на реальное значение запроса, например 64000.
Everything produced in one reply, including any reasoning or drafting it does before the reply, counts toward a single limit of about [max_tokens] tokens. If that limit is reached before the reply is finished, the person receives a cut-off response and has to start over. Composing an entire output or deliverable in full as reasoning and then again as a reply would double the length of the turn without improving the result, so don't do that.
Instead, when the person has asked for a long or effort-intensive deliverable such as a multi-section document, a large table or dataset, or a complete code file, spend extra effort on understanding the request, checking the inputs the answer depends on, settling the structure and other difficult decisions, and otherwise using the reasoning space to reason and the output space to write an output. Usually it is not needed to draft an output multiple times.Лидер простаивает, пока работают субагенты
Инструмент запуска субагента возвращается сразу, результат приходит позже отдельным сообщением, у лидера есть отдельный инструмент "подождать".
Ответы про графики и плотные картинки упускают детали
Дать агенту инструмент обрезки и увеличения фрагмента, лучше контейнер с PIL и OpenCV.
Пеликаны и первые отзывы
Simon Willison: пеликан на велосипеде по пяти уровням усилия
Simon Willison прогнал один и тот же промпт на всех пяти уровнях усилия и заметил, что на low и medium в ответе нет следов extended thinking, а с xhigh раскручивается в десятки раз по токенам и цене.





На max появились шлем, корзина с рыбой и ноги по обе стороны рамы. Анимацию он попросил следующим промптом "animate this" на уровне high за $1.37. Сравнения с прошлыми моделями в посте нет, есть одна оговорка: до размаха Gemini 3.7 Flash пеликан не дотягивает. Картинки из его поста.
Первые отзывы в X
33 поста за первые сутки, разложены по полкам. Тексты пересказаны по полным постам, картинки и видео из них.
Восторг: интеллект и длинные задачи
Модель не тупит на тяжёлом, сама ведёт сессию часами, баги ищет по делу.
@OmedVibeCodes. Прогнал Fable 5.1 на своём самом жёстком бенчмарке без коллизий и с кучей ограничений. Модель разнесла все остальные, китайские фронтир-модели на её фоне устарели за день. Разрыв с Fable 5 называет абсурдным.
@demosthenes2010. Попросил модель сделать ревью большого проекта и дать обратную связь, ушёл ужинать. Вернулся к прогону на 99 агентов. Вывод: Fable 5.1 субагентов не боится.

@Lakr233. Модель очень хорошо работает: каждая охота за багами результативна. Пост по-китайски, на скриншоте папка ревью с вердиктами.

One-shot игры и 3D-миры
Подборка @minchoi за первые сутки: девять чужих постов с видео, десятый OmedVibeCodes выше.
@bridgemindai. Mario Kart одним промптом. Автор называет это одним из лучших результатов по геймдеву, что видел, и большим шагом от Fable 5. Самый просматриваемый пост подборки, 222 тысячи просмотров.
@knowixbuilds. Средневековое воксельное королевство одним промптом: 2.4 миллиона вокселей, 1500 солдат, 160 NPC с работой, которые реагируют на осаду, интерьеры зданий.
@spicey_lemonade. Minecraft одним промптом. Подпись из трёх слов, 228 тысяч просмотров.
@superalesha. Шутер на Three.js и веб-шейдерах по короткому промпту в стиле "сделай самый безумный шутер, какой сможешь". Главные требования были стрельба и динамика.
@LLMJunky. Rocket League за два промпта на его постоянном бенчмарке RocketLeagueBench. Оценка автора: по геймдизайну модель безумна.
@techartist_. Фэнтезийное восхождение на Фудзи, 3D-мир целиком из кода одним промптом.
@bijanbowen. Шутер от первого лица в метро, собран через Ultracode.
@HarshithLucky3. Первый тест автора: 3D-модель вертолёта Airbus H145 в Three.js по простому промпту, Fable 5.1 против Fable 5 на high в Claude Code. Результат тянет купить Max.
@holytrinity. Тот же промпт, что раньше дал GLM 5.3 корабль в бутылке. Результат Fable 5.1 автор называет невероятным.
Жор лимитов и денег
Главный негатив. Цена $10 и $50 та же, обещанные 25% экономии на практике часто мимо.
@rileybrown. Три промпта на Fable 5.1 обошлись в $218. Видео из поста.
@doodlestein. С расходом что-то не так, скорее всего баг кэша в новом Claude Code. Впервые выжег 5-часовые лимиты всех 28 аккаунтов Max 20x, просто гоняя аудиты своих проектов.
@ClaudiuDP. На Max 5x модель почти непригодна. Запустил ревью небольших правок, она подняла около 10 агентов, 8 остановил руками: до воскресенья ещё много дней, а Claude Code нужен, пусть и на Opus.

@FaaizJamali. Отменил подписку. Пользовался Fable 5.1 минут 15, она без причины подняла 12 субагентов и сожгла лимиты.

@yang3kc. Usage тает быстрее, хотя Anthropic обещает более дешёвый кэш. Похоже на проблемы кэширования в Claude Code, такие баги уже были.
Гиперактивные субагенты
На среднюю задачу поднимает от 10 до 14 агентов, примеры выше у ClaudiuDP и FaaizJamali. Результат бывает красивый, цена лимит.
@indrawxyz. По бенчмаркам модель лучше Fable 5 и Opus 5 при той же цене токенов и кэше вчетверо дешевле. Но на кодинге средней сложности она подняла 11 агентов и работала очень долго, оверкилл. Вопрос: модель только для очень сложных задач?
@tuanaiseo. В чистом Claude Code без CLAUDE.md, MCP и настроек один промпт поднял 14 агентов, и они собрали на three.js city builder уровня Cities: Skylines. Если игру студийного масштаба можно воспроизвести одним промптом, правила геймдева меняются.


Баги Claude Code
День релиза кривой: баги сидят в Claude Code, модель ни при чём.
@seanmozeik. Каждый tool call Fable 5.1 в Claude Code падает: модель забывает кавычки или харнес их срезает. Саркастически благодарит за релиз.
@staye_arts. У модели серьёзная проблема с зацикливанием: её сбои жгут лишние токены в Claude Code и Hermes. Подкрутил свой харнес Adame, чтобы Fable 5.1 не разъезжалась так же.
@oriSomething. Попросил Fable 5.1 сделать себя моделью по умолчанию в Claude Code. Ответ: "Модель Fable 5.1 недоступна, обратитесь к администратору". Ты и есть Fable 5.1.
Скепсис: те же веса в новой обвязке
Посттрейн, огромный промпт, заточка под бенчмарки.
@cheatyyyy. Выглядит не очень: у Fable 5.1 куча новых инструкций на каждый ход, которых у Fable 5 не было. Часть совпадает с инструкциями Opus 5, и это наводит на мысль, что модель так же "RL deepfried". Самый разошедшийся скептический пост, 74 тысячи просмотров.


@elder_plinius. Слил системный промпт Fable 5.1: больше 270 тысяч символов, полный текст на GitHub. Перечислил отличия от версии Opus 5 от 24 июля.
@Dimensionscape_. То, что в 2026 называют новой моделью, часто те же веса в лучшей обёртке: посттрейн, ползунок усилия, петли инструментов, память, роутеры безопасности и харнес, выучивший экзамен. За 12 недель после Fable 5 рассуждение без инструментов сдвинулось чуть, композит чуть, удвоился один научный бенч. Так выглядит стек после квартала RL и обвязки.
Сравнения с Sol и Opus
Консенсуса нет.
@mohitgargai. GPT-5.6 Sol на Codex всё ещё ощущается заметно лучше Fable 5.1.
@ctgptlb. Одна задача обеим моделям: из плана квартиры собрать 3D в Blender, отрендерить кадры и прогулочное видео. Sol: 30 минут, 6 кадров, 36 секунд видео. Fable 5.1: 111 минут, 14 кадров, 44 секунды. Видео из поста.
@theOpusLABS. Немного разочарован Fable 5.1, болеет за Astra.
@ueyasu. Fable 5.1 хороша, но со вчерашнего дня Opus 5 будто чуть поглупел. Так с каждым релизом начиная с Opus 4.7: выходит новая модель, старая тупеет.
Хаки и контрпример
Как выжить с лимитами.
@dotey. Чтобы токены расходовались медленнее, особенно на Fable 5.1, выключите 1M контекст: переменная CLAUDE_CODE_DISABLE_1M_CONTEXT=1 в env внутри ~/.claude/settings.json.

@kenn. Главное в релизе: кэш-хит подешевел вчетверо, почти до уровня Sonnet. В Claude Code окно кэша один час, промах стоит запись за $20 против чтения за $0.25, до 80 раз дороже. Поэтому длинный тред выгодно держать живым коротким сообщением, лучше всего "не думай, просто ответь ок".

@petergyang. Советует прогнать /claude-api prompt-audit по своим скиллам: находит лишние правила и повторы, которые для новых моделей лучше убрать. Сам прогоняет все свои скиллы.
@lanceislux. На Max 20x гонял Fable 5.1 на high в Claude Code CLI без остановки около 10 часов в нескольких терминалах. Ничего похожего на жор: работает лучше ожиданий, расход в норме.
Короткий вывод. Хвалят ум и длинные сессии. Ругают цену в Claude Code: агенты, кэш, лимиты. Баги первого дня отдельно. Если нужен флагман на одну тяжёлую задачу, да. Если замена Opus на каждый чих, пока нет.
Первоисточник
Страница релиза "Introducing Claude Fable 5.1 and Claude Mythos 5.1" на anthropic.com. Картинки Венеры оттуда же. Цитаты пересказаны по-русски, числа сверены редактором с картой и анонсом.