Claude Opus 5 вышел: что изменилось в API и почему это важно для AI-агентов
Основной чат
Чат для вайбкодеров: новости, гайды, поиск исполнителей, маркетплейс и разбор реальных кейсов.
24 июля 2026 года Anthropic выпустила Claude Opus 5. На уровне названия это следующий шаг после Opus 4.8, но главное изменение находится не в очередной строке таблицы бенчмарков. Модель стала заметно лучше работать в длинных цепочках: планировать, вызывать инструменты, проверять результат и продолжать задачу после промежуточных ошибок.
Opus 5 уже доступен через Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry. Базовая цена не изменилась: $5 за миллион входных токенов и $25 за миллион выходных. Поэтому обновление интересно не только тем, кому нужен максимальный результат, но и разработчикам, которые строят агентов с большим числом шагов.
Claude Opus 5 в цифрах
| Параметр | Значение |
|---|---|
| Дата релиза | 24 июля 2026 года |
| Идентификатор в Claude API | claude-opus-5 |
| Контекст | 1 млн токенов: это одновременно стандартный и максимальный размер |
| Максимальный вывод | 128 000 токенов |
| Цена входа | $5 за 1 млн токенов |
| Цена выхода | $25 за 1 млн токенов |
| Уровни усилия | low, medium, high, xhigh, max |
| Быстрый режим | Около 2,5 раза быстрее, $10/$50 за 1 млн токенов в API |
Быстрый режим пока относится к исследовательскому предпросмотру и доступен в Claude API. В документации Anthropic отдельно указано, что для Amazon Bedrock, Google Cloud и Microsoft Foundry он пока недоступен. Сам Opus 5 через эти платформы доступен.
Главный апгрейд — поведение агента
Для обычного вопроса разница между двумя версиями может быть незаметна: обе модели умеют писать текст, объяснять код и анализировать документы. Разрыв появляется, когда запрос превращается в рабочий процесс на десятки шагов.
Например, агенту нужно добавить функцию в существующий проект. Он должен найти связанные файлы, понять архитектуру, изменить несколько модулей, запустить тесты, разобрать ошибку, исправить реализацию и проверить результат в браузере. Слабый агент останавливается после первой удачной сборки и объявляет задачу выполненной. Opus 5 чаще продолжает работу до проверки поведения, а не только до появления правдоподобного диффа.
Anthropic описывает следующие наиболее заметные улучшения:
- более устойчивое рассуждение на длинных цепочках;
- агентная разработка и многофайловые изменения без оставленных заглушек;
- поиск реальных ошибок в коде с меньшим числом ложных срабатываний;
- работа с таблицами, документами, презентациями, диаграммами и интерфейсами;
- координация нескольких агентов;
- более сильный результат при увеличении уровня усилия, вплоть до
max.
Важный нюанс: модель чаще проверяет собственную работу сама. Поэтому старые инструкции вроде «в конце обязательно перепроверь всё через отдельного агента» могут привести к лишней повторной проверке и дополнительным расходам. В промпте лучше описывать критерий готовности, а не заставлять модель механически повторять один и тот же этап.
Что поменялось по сравнению с Opus 4.8
| Область | Opus 4.8 | Opus 5 |
|---|---|---|
| Рассуждение | Обычно включалось через thinking |
Включено по умолчанию, глубина управляется effort |
| Максимальный уровень усилия | Ниже, чем у новой версии | Доступен уровень max |
| Контекст | Большое окно | 1 млн токенов как стандартный и максимальный вариант |
| Кэширование промпта | Минимум 1024 токена | Минимум 512 токенов |
| Инструменты в середине диалога | Фиксированный набор в рамках сессии | Можно менять набор инструментов без сброса кэша, функция в бете |
| Цена | $5/$25 за миллион токенов | $5/$25 за миллион токенов |
Самое важное изменение для существующих интеграций — включённое по умолчанию рассуждение. На Opus 4.8 запросы без специального параметра обычно выполнялись без него. На Opus 5 модель сама выбирает, сколько рассуждать, а effort становится основным регулятором качества, задержки и расхода токенов.
Есть и несовместимое поведение. Если передать thinking: {"type": "disabled"} вместе с уровнем effort: "xhigh" или effort: "max", API вернёт ошибку 400. При отключённом рассуждении допустимы только high и более низкие уровни. Для агентных сценариев Anthropic рекомендует оставлять рассуждение включённым и снижать расход через low или medium, если качество на них сохраняется.
Как выглядит миграция в Claude API
Минимальное изменение — заменить идентификатор модели. Но для предсказуемого результата стоит одновременно явно выбрать уровень усилия и увеличить бюджет max_tokens: он ограничивает общий объём рассуждения и обычного ответа.
{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": {
"effort": "high"
},
"messages": [
{
"role": "user",
"content": "Проверь архитектуру проекта, внеси изменения, запусти тесты и объясни, что осталось проверить вручную."
}
]
}
В этом примере поле thinking не указано намеренно: для Opus 5 адаптивное рассуждение включается автоматически. Для относительно простых задач можно начать с medium, для долгого рефакторинга или сложного анализа — с high. Уровни xhigh и max стоит включать только после проверки на собственных задачах: они могут улучшить результат, но увеличат задержку и расход токенов.
Перед переключением модели проверьте три места в коде:
- Логику обработки блоков
thinkingиtool_useв ответе. - Ограничение
max_tokens, особенно если раньше рассуждение было выключено. - Обработку ошибок 400 и запасную модель для запросов, которые блокируются классификаторами безопасности.
Для запросов, где набор инструментов меняется по ходу диалога, Anthropic добавила бета-возможность mid-conversation tool changes. Она позволяет добавить или убрать инструмент между ходами, не отправляя заново фиксированный список и не теряя кэш промпта. Для включения используется заголовок mid-conversation-tool-changes-2026-07-01.
Ещё одна бета-возможность — режим автоматических запасных маршрутов. С заголовком server-side-fallback-2026-07-01 API может выбрать рекомендованную модель, если запрос Opus 5 остановлен классификатором безопасности. Это полезно для продакшн-агентов: отказ модели не обязательно превращается в полный отказ пользовательского сценария.
Что говорят бенчмарки
По данным Anthropic, Opus 5 показывает особенно сильный рост там, где важны не отдельные ответы, а завершение задачи целиком:
| Тест | Заявленный результат Opus 5 |
|---|---|
| Frontier-Bench v0.1 | Более чем вдвое выше результат Opus 4.8 при меньшей стоимости задачи |
| CursorBench 3.2 | На максимальном усилии результат находится в пределах 0,5% от пикового результата Fable 5 при примерно вдвое меньшей стоимости |
| ARC-AGI 3 | Результат примерно в три раза выше следующей модели |
| Zapier AutomationBench | Примерно в 1,5 раза выше проходной результат при той же стоимости задачи |
| OSWorld 2.0 | Выше остальных моделей при сопоставимой стоимости и выше лучшего результата Fable 5 при чуть более трети его стоимости |
Эти цифры полезны для понимания направления развития, но не заменяют собственные проверки. У результатов есть версия теста, конкретный уровень усилия, число попыток, настройки инструментов и возможные отклонения из-за защитных классификаторов. Модель, которая лучше проходит CursorBench, не обязательно дешевле или надёжнее в вашем Telegram-боте, CRM или внутреннем агенте.
Как проверить обновление в своём проекте
Безопасная миграция начинается не с замены строки model, а с набора контрольных задач. Возьмите 20–30 реальных запросов из логов и разделите их на несколько групп: код, документы, вызовы инструментов, ошибки и длинные цепочки.
Для каждой версии измерьте:
- долю задач, завершённых без ручного вмешательства;
- число ходов и вызовов инструментов;
- количество токенов и стоимость;
- время до первого ответа и время до финального результата;
- число исправлений после тестов;
- количество ложных утверждений о том, что задача уже выполнена.
Для агента с доступом к файловой системе и продакшн-сервисам добавьте ручные точки подтверждения. Более автономная модель не отменяет ограничений прав, песочницы, журналирования и отката. Особенно внимательно проверьте действия, которые могут изменить данные, отправить письмо, опубликовать код или выполнить финансовую операцию.
Стоит ли переходить на Opus 5
Переход выглядит оправданным, если агент регулярно работает с большими репозиториями, сложным код-ревью, многошаговыми исследованиями, таблицами, документами или браузером. В этих задачах стоимость одной генерации — только часть расходов: неудачная попытка, ручное исправление и повторный запуск могут стоить дороже разницы в тарифе.
Для простых вопросов, коротких текстов и задач, где важнее минимальная задержка, флагманская модель не всегда будет рациональным выбором. Начните с medium, сравните результат с текущей версией и оставьте Opus 5 только там, где рост качества перекрывает дополнительный расход.
Claude Opus 5 — это обновление, которое стоит оценивать как новую основу для долгих агентных процессов. Его сильная сторона не в том, что он «отвечает умнее» на любой вопрос, а в том, что он чаще удерживает цель через несколько действий, замечает собственные ошибки и доводит работу до проверяемого результата. Именно это делает релиз важным для разработчиков, которые используют Claude не как чат, а как участника рабочего процесса.