Переключить тему
~/wiki / novosti / gpt5-6

GPT‑5.6 вышла: бенчмарки Sol, Terra и Luna против GPT‑5.5

Основной чат

Чат для вайбкодеров: новости, гайды, поиск исполнителей, маркетплейс и разбор реальных кейсов.

$ cd раздел/ $ join vibe dev
GPT‑5.6 вышла: бенчмарки Sol, Terra и Luna против GPT‑5.5 - обложка

OpenAI открыла GPT‑5.6 в ChatGPT, Codex и API. Сравниваем Sol, Terra и Luna с GPT‑5.5 по коду, агентным задачам, цене и главным бенчмаркам.

9 июля OpenAI открыла общий доступ к семейству GPT‑5.6 в ChatGPT, Codex и API. На этот раз релиз состоит сразу из трёх моделей: флагманской Sol, сбалансированной Terra и более доступной Luna.

На первый взгляд выбор выглядит линейно: чем дороже модель, тем она умнее. Финальные таблицы OpenAI показывают более интересную картину. Terra во многих задачах обгоняет GPT‑5.5 при цене вдвое ниже. Тариф Luna составляет пятую часть тарифа Sol, но на сложном коде и длинном контексте она иногда уступает даже предыдущему поколению. Sol ставит несколько рекордов, однако тоже не выигрывает каждый тест.

До широкого запуска мы писали о GPT‑5.6 по данным ограниченного превью. Теперь OpenAI опубликовала полную страницу релиза с результатами по коду, работе в браузере, науке, кибербезопасности и длинному контексту. Ниже — сравнение на основе этих финальных данных.

Что именно выпустила OpenAI

Число в названии теперь обозначает поколение, а Sol, Terra и Luna — постоянные уровни возможностей. OpenAI планирует обновлять их в собственном темпе.

  • GPT‑5.6 Sol — флагман для сложного кода, профессионального анализа и длительной агентной работы. Короткий идентификатор gpt-5.6 в API ведёт именно на Sol.
  • GPT‑5.6 Terra — модель среднего уровня. По роли она ближе к прежним mini-моделям, но по многим тестам конкурирует с GPT‑5.5.
  • GPT‑5.6 Luna — самый дешёвый вариант для массовых запросов, классификации, извлечения данных и коротких автоматизаций.

Согласно актуальным карточкам моделей, у всех трёх версий контекстное окно 1,05 млн токенов и максимальный ответ 128 тысяч токенов. Дата среза знаний — 16 февраля 2026 года. У GPT‑5.5 окно и максимальный ответ такие же, но знания ограничены 1 декабря 2025 года.

Модель Вход за 1 млн токенов Кэшированный вход Выход за 1 млн токенов Контекст
GPT‑5.5 $5 $0,50 $30 1,05 млн
GPT‑5.6 Sol $5 $0,50 $30 1,05 млн
GPT‑5.6 Terra $2,50 $0,25 $15 1,05 млн
GPT‑5.6 Luna $1 $0,10 $6 1,05 млн

Номинальная цена Sol совпадает с GPT‑5.5. Terra дешевле вдвое, Luna — в пять раз. Для запросов длиннее 272 тысяч входных токенов действует повышенный тариф на весь запрос: вход стоит вдвое дороже, выход — в 1,5 раза. Запись нового кэша тарифицируется по коэффициенту 1,25, а чтение из кэша сохраняет скидку 90%.

Главные бенчмарки GPT‑5.6 против GPT‑5.5

В таблицу ниже вошли тесты из разных категорий. Это не попытка свести качество модели к одному числу, а быстрый способ увидеть характер обновления.

Бенчмарк Что проверяет Sol Terra Luna GPT‑5.5
Agents’ Last Exam Долгие профессиональные задачи 52,7% 50,4% 50,3% 46,9%
Coding Agent Index Работа кодового агента 80,0 77,4 74,6 76,4
SWE‑Bench Pro Исправление реальных репозиториев 64,6% 63,4% 62,7% 59,4%
Terminal‑Bench 2.1 Сложная работа в терминале 88,8% 87,4% 84,7% 85,6%
BrowseComp Поиск и исследование в интернете 90,4% 87,5% 83,3% 84,4%
OSWorld 2.0 Управление приложениями и компьютером 62,6% 50,2% 45,6% 47,5%
HealthBench Professional Профессиональные медицинские задачи 60,5% 57,7% 55,7% 49,5%
GeneBench Pro Долгий анализ геномных данных 28,7% 23,3% 10,8% 12,0%
SEC‑Bench Pro Рабочие примеры эксплуатации уязвимостей 71,2% 57,7% 48,9% 45,8%
MRCR 512K–1M Поиск фактов в очень длинном контексте 73,8% 72,5% 41,3% 74,0%
Toolathlon Использование разных инструментов 58,0% 53,1% 53,4% 55,6%

Сильнее всего Sol отрывается не в обычных вопросах, а там, где модель должна долго действовать: управлять компьютером, вести исследование, работать с уязвимостями или собирать результат из многих шагов. На OSWorld 2.0 прирост относительно GPT‑5.5 составляет 15,1 процентного пункта, на GeneBench Pro — 16,7, на SEC‑Bench Pro — 25,4.

В коде рост заметный, но не настолько драматичный. Sol прибавляет 5,2 пункта на SWE‑Bench Pro и 3,2 пункта на Terminal‑Bench 2.1. Главное изменение здесь — не только максимальный результат, но и плотность семейства: Terra находится совсем рядом с Sol, а на SWE‑Bench Pro даже Luna превосходит GPT‑5.5.

Sol: больше всего выросли агентные задачи

GPT‑5.6 Sol — самый безопасный выбор, когда ошибка модели обходится дороже самих токенов. Это сложные изменения в кодовой базе, исследование с десятками источников, анализ документов, работа с браузером и задачи, где агент должен несколько раз проверить собственный результат.

На Artificial Analysis Coding Agent Index модель получила 80 баллов против 76,4 у GPT‑5.5. На BrowseComp результат вырос с 84,4% до 90,4%, а на BenchCAD — с 44,4% до 70,6%. Последний тест особенно показателен: он проверяет работу с инженерными чертежами, где недостаточно написать правдоподобный текст — нужно правильно управлять инструментом и получить валидный артефакт.

OpenAI также заявляет о более высокой эффективности. В раннем тестировании Lovable сообщила примерно о 25% меньшем числе шагов, сокращении вызовов инструментов на 35–48% и снижении доли застрявших запусков на 15%. Это данные одного партнёра, а не универсальная гарантия, но они объясняют, почему одинаковая цена за токен ещё не означает одинаковую стоимость готовой задачи.

Terra выглядит главным обновлением для API

Sol собирает рекорды, но для продуктовых команд интереснее Terra. Она стоит ровно вдвое дешевле GPT‑5.5 и при этом обгоняет предыдущую модель на большинстве ключевых тестов из таблицы выше.

На SWE‑Bench Pro Terra получает 63,4% против 59,4% у GPT‑5.5. На Terminal‑Bench 2.1 — 87,4% против 85,6%. На BrowseComp — 87,5% против 84,4%. В профессиональных задачах Agents’ Last Exam разница составляет 50,4% против 46,9%.

Это делает Terra логичной отправной точкой для ботов, генерации контента, анализа документов, внутренних помощников и фоновых агентов. Раньше подобные маршруты часто приходилось отправлять на флагманскую модель, потому что mini-уровень слишком быстро терял качество. Теперь между Terra и Sol во многих тестах остаётся несколько пунктов, а разница в тарифе — двукратная.

Есть и исключения. Terra уступает GPT‑5.5 на Toolathlon, нескольких академических тестах и извлечении информации из контекста длиной 512 тысяч — 1 млн токенов. Поэтому менять модель во всех маршрутах одной строкой пока рано.

Luna дешёвая, но не универсальная

Luna стоит $1 за миллион входных и $6 за миллион выходных токенов. Она подходит для задач, которые легко проверить автоматически: классификации обращений, извлечения полей, маршрутизации, нормализации текста, коротких резюме и массовой обработки однотипных записей.

На SWE‑Bench Pro Luna показывает 62,7% — выше GPT‑5.5 с её 59,4%. На HealthBench Professional она набирает 55,7% против 49,5%. На SEC‑Bench Pro — 48,9% против 45,8%.

Но сложные агентные сценарии быстро обнаруживают пределы экономии. Luna уступает GPT‑5.5 на Coding Agent Index, Terminal‑Bench, BrowseComp и OSWorld. Особенно заметен провал на длинном контексте: 41,3% на MRCR 512K–1M против 74% у GPT‑5.5. Формально модель принимает 1,05 млн токенов, но размер окна не гарантирует, что она одинаково хорошо найдёт и свяжет нужные факты внутри него.

Практический вывод простой: Luna хороша как отдельный дешёвый маршрут, а не как глобальная замена старшей модели.

Что дают max и Ultra

В GPT‑5.6 появился новый уровень рассуждения max, стоящий выше xhigh. Он даёт модели больше времени на поиск вариантов, проверки и исправление результата. Базовые уровни none, low, medium, high и xhigh мы ранее описали в отдельном материале о reasoning effort. OpenAI не рекомендует включать max для каждого запроса: сначала стоит сравнить текущий уровень рассуждения с тем же уровнем на GPT‑5.6, а затем протестировать соседние настройки на реальных задачах.

Ultra идёт дальше и запускает несколько агентов параллельно. Стандартная конфигурация использует четыре агента, которые делят работу на независимые направления, а затем объединяют результаты.

Бенчмарк Sol Sol Ultra Прирост
Terminal‑Bench 2.1 88,8% 91,9% +3,1 п. п.
BrowseComp 90,4% 92,2% +1,8 п. п.
SEC‑Bench Pro 71,2% 74,3% +3,1 п. п.

Ultra расходует больше суммарных токенов, потому что оплачивается работа всех агентов, но независимые ветки выполняются одновременно. Поэтому режим рассчитан на задачи, где важны максимальная вероятность успеха и меньшее время ожидания, а не минимальный счёт за запрос.

В Codex Ultra доступен начиная с Plus. В ChatGPT Work он открыт пользователям Pro и Enterprise. Разработчики могут собирать похожие сценарии через бета-версию multi-agent в Responses API.

Где GPT‑5.5 всё ещё сильнее

Финальная таблица полезна ещё и тем, что не показывает идеальную победу нового поколения.

  • На MRCR с контекстом 512 тысяч — 1 млн токенов GPT‑5.5 получает 74%, Sol — 73,8%, Terra — 72,5%, Luna — 41,3%.
  • На Toolathlon GPT‑5.5 набирает 55,6 балла, Terra — 53,1, Luna — 53,4. Только Sol оказывается выше с результатом 58.
  • На GPQA Diamond GPT‑5.5 сильнее Terra и Luna: 93,6% против 92,9% и 92,3%. Sol получает 94,6%.
  • На MMMU Pro с инструментами GPT‑5.5 показывает 83,2%, Terra — 82%, Luna — 79,5%. Sol лидирует с 84,6%.
  • На FrontierMath Tier 4 Terra и Luna также уступают предыдущей модели: 68,3% и 58,5% против 72,5% у GPT‑5.5. Sol поднимается до 83%.

Это хороший аргумент против автоматической миграции. Название нового поколения ничего не говорит о конкретном маршруте: модель для короткого исправления кода, анализа PDF и поиска факта в миллионном контексте может быть разной.

Сколько стоит типовая задача

Представим агентный запуск с 20 тысячами входных и 5 тысячами выходных токенов. Без кэша и дополнительных инструментов его базовая стоимость будет такой:

Модель Один запуск 100 запусков
GPT‑5.5 $0,25 $25
GPT‑5.6 Sol $0,25 $25
GPT‑5.6 Terra $0,125 $12,50
GPT‑5.6 Luna $0,05 $5

Расчёт не учитывает скрытые токены рассуждения, повторные попытки, вызовы платных инструментов и разницу в количестве шагов. Поэтому сравнивать нужно не цену одного токена, а стоимость успешно завершённой задачи.

Для такого сравнения достаточно набора из 20–50 реальных примеров. На каждой модели стоит измерить долю принятых результатов, число повторных запусков, общее количество токенов, задержку и итоговую стоимость. Если Terra решает задачу с первой попытки, она действительно вдвое выгоднее Sol. Если Luna требует три исправления, её низкий тариф перестаёт быть преимуществом.

Другие изменения GPT‑5.6

Бенчмарки — только одна часть релиза. Семейство получило несколько новых механизмов для агентных приложений:

  • Programmatic Tool Calling позволяет модели написать небольшую программу, вызвать из неё разрешённые инструменты и сократить промежуточные результаты до того, как они вернутся в основной контекст.
  • Multi-agent в Responses API запускает параллельных субагентов и объединяет их работу в одном запросе.
  • Явное кэширование промпта позволяет отметить стабильные части контекста. Минимальное время жизни кэша — 30 минут.
  • Сохранение рассуждений между ходами помогает продолжать длинную работу без полного перезапуска логики на каждом запросе.
  • Pro-режим теперь включается параметром reasoning.mode: "pro" у выбранной модели, а не отдельным суффиксом в её названии.

Для обычного обновления приложения всё это включать не требуется. Самый безопасный порядок — сначала заменить модель с сохранением текущего уровня рассуждения, проверить поведение, а уже потом отдельно тестировать новый кэш, max, Pro или несколько агентов.

Доступность

OpenAI начала глобальное развёртывание GPT‑5.6 9 июля и отвела на него около суток.

  • В обычном ChatGPT пользователи Plus, Pro, Business и Enterprise получают Sol на среднем и более высоких уровнях рассуждения. Sol Pro доступна тарифам Pro и Enterprise.
  • В ChatGPT Work и Codex пользователи Free и Go получают Terra. Начиная с Plus можно выбирать Sol, Terra или Luna и менять уровень рассуждения.
  • В API доступны все три идентификатора: gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna. Короткий идентификатор gpt-5.6 направляет запросы на Sol.

Что в итоге

Самая важная часть релиза GPT‑5.6 — не новый рекорд Sol, а изменение цены рабочего уровня моделей. Terra стоит вдвое дешевле GPT‑5.5 и при этом превосходит её во многих задачах с кодом, браузером и профессиональным анализом. Для большинства API-продуктов именно она выглядит первым кандидатом на тестирование.

Sol нужна там, где модель долго действует сама, управляет инструментами и должна выдать готовый результат с минимальной вероятностью ошибки. Luna полезна для дешёвых массовых операций с понятной автоматической проверкой. GPT‑5.5 пока рано удалять из маршрутизатора: она сохраняет преимущество в отдельных тестах на длинный контекст, академическое рассуждение и работу с инструментами.

Переход на GPT‑5.6 лучше воспринимать не как замену одной строки, а как настройку маршрутов. Sol, Terra и Luna рассчитаны на разные роли, и финальные бенчмарки впервые дают достаточно данных, чтобы распределять эти роли не по маркетинговому описанию, а по измеримому результату.

Материал актуален на 10 июля 2026 года.

Источники

$ cd ../ ← назад к Новости