~/wiki / novosti / claude-opus-5-release

Claude Opus 5 вышел: что изменилось в API и почему это важно для AI-агентов

Основной чат

Чат для вайбкодеров: новости, гайды, поиск исполнителей, маркетплейс и разбор реальных кейсов.

$ cd раздел/ $ join vibe dev
Claude Opus 5 вышел: что изменилось в API и почему это важно для AI-агентов - обложка

24 июля 2026 года Anthropic выпустила Claude Opus 5. На уровне названия это следующий шаг после Opus 4.8, но главное изменение находится не в очередной строке таблицы бенчмарков. Модель стала заметно лучше работать в длинных цепочках: планировать, вызывать инструменты, проверять результат и продолжать задачу после промежуточных ошибок.

Opus 5 уже доступен через Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry. Базовая цена не изменилась: $5 за миллион входных токенов и $25 за миллион выходных. Поэтому обновление интересно не только тем, кому нужен максимальный результат, но и разработчикам, которые строят агентов с большим числом шагов.

Claude Opus 5 в цифрах

Параметр Значение
Дата релиза 24 июля 2026 года
Идентификатор в Claude API claude-opus-5
Контекст 1 млн токенов: это одновременно стандартный и максимальный размер
Максимальный вывод 128 000 токенов
Цена входа $5 за 1 млн токенов
Цена выхода $25 за 1 млн токенов
Уровни усилия low, medium, high, xhigh, max
Быстрый режим Около 2,5 раза быстрее, $10/$50 за 1 млн токенов в API

Быстрый режим пока относится к исследовательскому предпросмотру и доступен в Claude API. В документации Anthropic отдельно указано, что для Amazon Bedrock, Google Cloud и Microsoft Foundry он пока недоступен. Сам Opus 5 через эти платформы доступен.

Главный апгрейд — поведение агента

Для обычного вопроса разница между двумя версиями может быть незаметна: обе модели умеют писать текст, объяснять код и анализировать документы. Разрыв появляется, когда запрос превращается в рабочий процесс на десятки шагов.

Например, агенту нужно добавить функцию в существующий проект. Он должен найти связанные файлы, понять архитектуру, изменить несколько модулей, запустить тесты, разобрать ошибку, исправить реализацию и проверить результат в браузере. Слабый агент останавливается после первой удачной сборки и объявляет задачу выполненной. Opus 5 чаще продолжает работу до проверки поведения, а не только до появления правдоподобного диффа.

Anthropic описывает следующие наиболее заметные улучшения:

  • более устойчивое рассуждение на длинных цепочках;
  • агентная разработка и многофайловые изменения без оставленных заглушек;
  • поиск реальных ошибок в коде с меньшим числом ложных срабатываний;
  • работа с таблицами, документами, презентациями, диаграммами и интерфейсами;
  • координация нескольких агентов;
  • более сильный результат при увеличении уровня усилия, вплоть до max.

Важный нюанс: модель чаще проверяет собственную работу сама. Поэтому старые инструкции вроде «в конце обязательно перепроверь всё через отдельного агента» могут привести к лишней повторной проверке и дополнительным расходам. В промпте лучше описывать критерий готовности, а не заставлять модель механически повторять один и тот же этап.

Что поменялось по сравнению с Opus 4.8

Область Opus 4.8 Opus 5
Рассуждение Обычно включалось через thinking Включено по умолчанию, глубина управляется effort
Максимальный уровень усилия Ниже, чем у новой версии Доступен уровень max
Контекст Большое окно 1 млн токенов как стандартный и максимальный вариант
Кэширование промпта Минимум 1024 токена Минимум 512 токенов
Инструменты в середине диалога Фиксированный набор в рамках сессии Можно менять набор инструментов без сброса кэша, функция в бете
Цена $5/$25 за миллион токенов $5/$25 за миллион токенов

Самое важное изменение для существующих интеграций — включённое по умолчанию рассуждение. На Opus 4.8 запросы без специального параметра обычно выполнялись без него. На Opus 5 модель сама выбирает, сколько рассуждать, а effort становится основным регулятором качества, задержки и расхода токенов.

Есть и несовместимое поведение. Если передать thinking: {"type": "disabled"} вместе с уровнем effort: "xhigh" или effort: "max", API вернёт ошибку 400. При отключённом рассуждении допустимы только high и более низкие уровни. Для агентных сценариев Anthropic рекомендует оставлять рассуждение включённым и снижать расход через low или medium, если качество на них сохраняется.

Как выглядит миграция в Claude API

Минимальное изменение — заменить идентификатор модели. Но для предсказуемого результата стоит одновременно явно выбрать уровень усилия и увеличить бюджет max_tokens: он ограничивает общий объём рассуждения и обычного ответа.

json
{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": {
    "effort": "high"
  },
  "messages": [
    {
      "role": "user",
      "content": "Проверь архитектуру проекта, внеси изменения, запусти тесты и объясни, что осталось проверить вручную."
    }
  ]
}

В этом примере поле thinking не указано намеренно: для Opus 5 адаптивное рассуждение включается автоматически. Для относительно простых задач можно начать с medium, для долгого рефакторинга или сложного анализа — с high. Уровни xhigh и max стоит включать только после проверки на собственных задачах: они могут улучшить результат, но увеличат задержку и расход токенов.

Перед переключением модели проверьте три места в коде:

  1. Логику обработки блоков thinking и tool_use в ответе.
  2. Ограничение max_tokens, особенно если раньше рассуждение было выключено.
  3. Обработку ошибок 400 и запасную модель для запросов, которые блокируются классификаторами безопасности.

Для запросов, где набор инструментов меняется по ходу диалога, Anthropic добавила бета-возможность mid-conversation tool changes. Она позволяет добавить или убрать инструмент между ходами, не отправляя заново фиксированный список и не теряя кэш промпта. Для включения используется заголовок mid-conversation-tool-changes-2026-07-01.

Ещё одна бета-возможность — режим автоматических запасных маршрутов. С заголовком server-side-fallback-2026-07-01 API может выбрать рекомендованную модель, если запрос Opus 5 остановлен классификатором безопасности. Это полезно для продакшн-агентов: отказ модели не обязательно превращается в полный отказ пользовательского сценария.

Что говорят бенчмарки

По данным Anthropic, Opus 5 показывает особенно сильный рост там, где важны не отдельные ответы, а завершение задачи целиком:

Тест Заявленный результат Opus 5
Frontier-Bench v0.1 Более чем вдвое выше результат Opus 4.8 при меньшей стоимости задачи
CursorBench 3.2 На максимальном усилии результат находится в пределах 0,5% от пикового результата Fable 5 при примерно вдвое меньшей стоимости
ARC-AGI 3 Результат примерно в три раза выше следующей модели
Zapier AutomationBench Примерно в 1,5 раза выше проходной результат при той же стоимости задачи
OSWorld 2.0 Выше остальных моделей при сопоставимой стоимости и выше лучшего результата Fable 5 при чуть более трети его стоимости

Эти цифры полезны для понимания направления развития, но не заменяют собственные проверки. У результатов есть версия теста, конкретный уровень усилия, число попыток, настройки инструментов и возможные отклонения из-за защитных классификаторов. Модель, которая лучше проходит CursorBench, не обязательно дешевле или надёжнее в вашем Telegram-боте, CRM или внутреннем агенте.

Как проверить обновление в своём проекте

Безопасная миграция начинается не с замены строки model, а с набора контрольных задач. Возьмите 20–30 реальных запросов из логов и разделите их на несколько групп: код, документы, вызовы инструментов, ошибки и длинные цепочки.

Для каждой версии измерьте:

  • долю задач, завершённых без ручного вмешательства;
  • число ходов и вызовов инструментов;
  • количество токенов и стоимость;
  • время до первого ответа и время до финального результата;
  • число исправлений после тестов;
  • количество ложных утверждений о том, что задача уже выполнена.

Для агента с доступом к файловой системе и продакшн-сервисам добавьте ручные точки подтверждения. Более автономная модель не отменяет ограничений прав, песочницы, журналирования и отката. Особенно внимательно проверьте действия, которые могут изменить данные, отправить письмо, опубликовать код или выполнить финансовую операцию.

Стоит ли переходить на Opus 5

Переход выглядит оправданным, если агент регулярно работает с большими репозиториями, сложным код-ревью, многошаговыми исследованиями, таблицами, документами или браузером. В этих задачах стоимость одной генерации — только часть расходов: неудачная попытка, ручное исправление и повторный запуск могут стоить дороже разницы в тарифе.

Для простых вопросов, коротких текстов и задач, где важнее минимальная задержка, флагманская модель не всегда будет рациональным выбором. Начните с medium, сравните результат с текущей версией и оставьте Opus 5 только там, где рост качества перекрывает дополнительный расход.

Claude Opus 5 — это обновление, которое стоит оценивать как новую основу для долгих агентных процессов. Его сильная сторона не в том, что он «отвечает умнее» на любой вопрос, а в том, что он чаще удерживает цель через несколько действий, замечает собственные ошибки и доводит работу до проверяемого результата. Именно это делает релиз важным для разработчиков, которые используют Claude не как чат, а как участника рабочего процесса.

Источники

$ cd ../ ← назад к Новости