22 сентября 2026 года – обычный вторник, если не считать того, что в этот день одновременно вывалилось сразу несколько релизов больших и крупных LLM:

  • Anthropic взяла и выкатила Claude Opus 5.5

  • Буквально через полтора часа OpenAI ответила двумя моделями, GPT-6 Sol и Luna

Для тех, кто торопится: Opus 5.5 работает на уровне флагманского Fable 5.1 на большинстве задач, стоит на 40% дешевле Opus 5 на типичной нагрузке, генерирует токены более чем на 30% быстрее – и (внимание, барабанная дробь) говорит по-человечески. Последнее, судя по всему, волнует людей сильнее, чем все таблицы бенчмарков вместе взятые.

Далее – полный разбор: цифры, споры, мультики, которые модель нарисовала кодом, алгоритм, который она улучшила, и практические советы. Поехали.


Новые нейросети уже доступны в GPTunneL.

Попробуйте модели здесь:
ChatGPT 6 Luna
ChatGPT 6 Sol
Claude Opus 5.5


Главное одной строкой: дешевле и быстрее

Если вкратце, Opus 5.5 – первая модель в новом семействе 5.5, и по заявлению Anthropic она работает на уровне Claude Fable 5.1 на большинстве задач, но стоит на 40% меньше типичной нагрузки, чем предыдущий Opus 5, а генерирует ответы более чем на 30% быстрее.

Но давайте посмотрим на цифры.

Контекст, вывод, идентификатор

Технические параметры – вот они все:

Параметр

Значение

Контекстное окно

1 000 000 токенов

Максимальный вывод (обычный)

128 000 токенов

Максимальный вывод (Batch API, бета)

300 000 токенов

Мышление (thinking)

Адаптивное, всегда включено

Уровень усилий по умолчанию

medium (у Opus 5 было high)

Идентификатор модели

claude-opus-5-5

Граница знаний

июнь 2026 г.

Полную спецификацию можно найти в официальной документации.

А вот что любопытно: адаптивное мышление теперь нельзя отключить вообще. У Opus 5 при effort high и ниже можно было выставить thinking: disabled, и модель отвечала «в лоб», без внутренних рассуждений. У Opus 5.5 такой опции больше нет – думать придётся всегда, вопрос только в том, насколько долго. Управлять этим предлагается с помощью знакомой схемы, через параметр effort – low, medium, high, xhigh и max.

Это, кстати, одно из четырёх «ломающих» изменений, которые Anthropic перечислила в гайде по миграции:

  • принудительный выбор инструмента (tool_choice: any/tool) теперь возвращает ошибку,

  • блоки рассуждений жёстко привязаны к модели и истории разговора,

  • а старый инструмент компьютерного использования computer_20251124 в Claude API и Google Cloud больше не принимается – теперь нужен computer_toolset_20260801.

Если у вас в продакшене крутится интеграция на Opus 5, прежде чем переключать модель, стоит заглянуть в этот список – иначе есть шанс словить россыпь ошибок.

Бенчмарки: где Opus 5.5 действительно вырвался вперёд

Тут будет много таблиц и графиков, потому что если статья про LLM обходится без бенчмарков – это подозрительно.

Начнём с официальной сводки Anthropic, где Opus 5.5 сравнивается с Opus 5, Fable 5.1 и, что особенно интересно, с флагманом конкурента – GPT-6 Astra.

Таблица Anthropic по ключевым бенчмаркам
Таблица Anthropic по ключевым бенчмаркам

Смотрите, тут вырисовывается забавная картина: Opus 5.5 обошёл GPT-6 Astra в программировании – на Terminal-Bench 4.0 разрыв (66,4% против 57,9%) настолько велик, что выходит далеко за пределы погрешности (±2,6 п.п. у Opus 5.5). То же самое на FrontierCode, CursorBench, знаниевом GDPval-AA и даже на Humanity’s Last Exam с инструментами – там Opus 5.5 набрал 67,7% против 57,2% у Astra.

Но вот в чём соль: в AutomationBench и особенно в Terminal-Bench-Science 0.1 первое место всё-таки удерживает GPT-6 Astra. Причём на «научном терминале» разрыв в 6 пп. – это уже за пределами погрешности, так что если работа завязана на долгие вычислительные научные задачи, Astra пока держит планку.

Иными словами: Opus 5.5 доминирует в коде и офисной работе, но не «обошёл всех и вся» – на длинных научных прогонах и автоматизации бизнес-процессов конкурент по-прежнему впереди. Такая вот ничья с перевесом в сторону Anthropic.

Artificial Analysis подтверждает общий вектор, хотя и со своими нюансами:

AA Intelligence Index v4.3. Opus 5.5 на максимальном уровне усилий занимает первое место среди 168 моделей, с результатом 58 баллов
AA Intelligence Index v4.3. Opus 5.5 на максимальном уровне усилий занимает первое место среди 168 моделей, с результатом 58 баллов

По их сводному индексу, объединяющему десять разных оценок, Opus 5.5 на max effort набирает 58 баллов и занимает первое место среди 168 моделей в рейтинге – Fable 5.1 и GPT-6 Astra делят второе место с 53 баллами каждый.

Но есть нюанс: их собственная методология тестирования Terminal-Bench 4.0 показала, что разрыв с Astra сокращается с 8,5 п. у Anthropic до полного паритета. Расхождения между независимыми тестами и официальными цифрами вендора – это старая как мир история: доверяй, но проверяй, причём проверяй несколькими способами.

Elo-рейтинг «знаниевой» работы AA-Briefcase – на max, xhigh и high Opus 5.5 занимает все три верхние строчки
Elo-рейтинг «знаниевой» работы AA-Briefcase – на max, xhigh и high Opus 5.5 занимает все три верхние строчки

Интересная деталь: Opus 5.5 занимает три верхние позиции в этом рейтинге одновременно, при разных уровнях усилий – max, xhigh и high. А вот при низком уровне усилий (low) результат падает до 1285 баллов, что ниже большинства других флагманов на графике. Для топового результата нужно больше токенов, тут физику не обманешь.

GPT-6 Sol и Luna подоспели минут через девяносто

Пока все пытались осознать релиз Opus 5.5, OpenAI выкатила две модели разом – GPT-6 Sol и GPT-6 Luna.

Обе компании в этот день на удивление синхронно заговорили об одном и том же: не «наша модель умнее всех», а «наша модель дешевле в пересчёте на выполненную задачу». Раньше в такой гонке мериться принято было баллами на бенчмарках, теперь – центами за выполненный таск.

Скорость

Если бенчмарки – это то, о чём пишут аналитики, то скорость – то, что чувствуешь в 11 вечера. И тут отзывы прямо восторженные:

Работаю с Opus 5.5 в Claude Code, и скорость реально сумасшедшая. Дело не только в том, что код пишется быстрее – баги находятся тоже гораздо быстрее обычного Opus. Особенно хорошо это заметно в UI-работе: баги в интерфейсе, на поиск которых раньше уходило время, теперь находятся почти мгновенно.

Многие отмечают более естественный и лаконичный стиль письма по сравнению с Opus 5.

Anthropic подкрепляет эти ощущения цифрами.

  • По данным компании, один из ранних пользователей выполнил миграцию кодовой базы объёмом 680 тыс. строк меньше чем за сутки – по его же оценке, вручную такая задача заняла бы у команды инженеров несколько недель.

  • В другом тесте модель провела аудит и исправление кодовой базы на 200000 строк меньше чем за три часа, тогда как предыдущему Opus 5 на аналогичную работу потребовалось больше 20 часов и в 2,5 раза больше токенов.

  • В миграции легаси-проекта HAProxy с C на Rust Opus 5.5 справилась за 9,5 часа против 12 часов у Fable 5.1 – и обошлась на 51% дешевле.

  • При оптимизации веб-приложений модель сумела сократить время загрузки страниц в 39 из 40 случаев, тогда как Opus 5 чаще вносила менее значительные изменения и могла заодно незаметно менять поведение приложения – что, согласитесь, для продакшена звучит как ночной кошмар.

Интересный побочный эффект скорости – усилие medium больше не означает «модель поленилась подумать».

В FrontierCode v1.1 Opus 5.5 при medium набирает около 54,6% при стоимости задачи примерно $0,8, а при максимальном усилии max – стоимость поднимается до $6,19, но итоговый балл остаётся тем же 54,4%.

Это отличная иллюстрация того, о чём Anthropic прямо пишет в гайде по промптингу: начинайте с medium и тестируйте разные уровни на своих собственных задачах, а не сохраняйте те настройки по умолчанию, которые работали на Opus 5. Имена уровней усилий не соответствуют одному и тому же объёму размышлений в разных моделях.

Про кодревью

Любопытный разбор сделала команда CodeRabbit, прогнав модель через собственный пайплайн проверки кода.

Результат неочевидный: Opus 5.5 в конфигурации Standard поймала 51 из 80 известных багов на открытом бенчмарке против 49 у продакшен-базлайна – прирост 2 балла, но вот что интереснее: 11 проблем модель нашла из тех, что базовый ревьюер пропустил, зато сама пропустила 9, которые базлайн ловил. То есть замена ревьюера – это не только «лучше», а скорее «по-другому»: поменялась корзина найденных багов.

// ДО: обе джобы читают retryCount = 0.
await prisma.workflowReminder.update({
  where: { id: reminder.id },
  data: { retryCount: reminder.retryCount + 1 },
});
// Джоба A пишет 1. Джоба B тоже пишет 1.
// Два инкремента, а счётчик всё равно остался 1.

// ПОСЛЕ: инкремент делает сама база данных.
await prisma.workflowReminder.update({
  where: { id: reminder.id },
  data: { retryCount: { increment: 1 } },
});
// Джоба A увеличивает до 1. Джоба B – до 2.
// Оба инкремента сохранились честно.

Это гонка данных в реальном опенсорсном проекте, которую обе конфигурации Opus 5.5 нашли, а предыдущая версия пропустила. Из тех багов, что мирно живут в проде и портят статистику, пока случайно не посмотришь логи.

При этом на более сложном наборе Signal (13 хитрых кейсов) модель в режиме Max поймала 10 из 13 проблем против 5 у базлайна – тут прирост уже куда заметнее. Чем сложнее задача, тем сильнее выигрыш от Opus 5.5, а на рутинном отлавливании простых ошибок прирост скромнее.

Алгоритмическая находка

Ребята из Vals AI описали эксперимент: автор запустил десять параллельных агентов на Claude Opus 5.5 в режиме максимального усилия, дал им простую доску сообщений для общения друг с другом и попросил улучшить классический алгоритм поиска кратчайшего пути в графе – тот самый, который каждый второй айтишник изучал в университете под именем Дейкстры.

Задача звучала так: найти существенное теоретическое улучшение для точных кратчайших путей в ориентированном графе с неотрицательными вещественными весами, с полным формальным доказательством на языке Lean. У агентов был выбор – убрать логарифмические множители, найти лучшую экспоненту, доказать линейный алгоритм или, наоборот, доказать фундаментальную нижнюю границу того, что вообще возможно.

Через 15 часов и 733 сообщения на общей доске команда агентов представила новый алгоритм под названием C-HD.

Он попадает в узкий, но реальный диапазон плотности графа, где классический Дейкстра (со сложностью O(m + n log n)) и более новые алгоритмы 2025–2026 годов уступают предложенному подходу. Полное доказательство лежит в открытом доступе на GitHub, и – что важно – оно прошло проверку формальным инструментом Lean Comparator, который удостоверяет, что доказательство действительно доказывает заявленную теорему, использует только разрешённые аксиомы и принимается ядром Lean. Настоящая проверяемая математика.

Стиль общения: «пишет так же, как я»

Процитирую сам анонс:

Коммуникация. Opus 5.5 общается более естественно, чем предыдущие модели. Ранние тестировщики отметили, что его текст стал понятнее и легче читается – это отвечает на распространённые жалобы, которые мы слышали про Opus 5. Модель сразу выносит самую важную информацию вперёд, а её стиль делает её лучшим рабочим партнёром в длинных сессиях. Как выразился один из ранних тестировщиков: «она пишет так же, как я».

Реакция оказалась, как это обычно бывает, поляризованной ровно пополам. Одни пишут, модель «так же многословна, как Opus 5». Другие отмечают заметное улучшение – «Opus 5 регулярно хотелось придушить, а с 5.5 гораздо меньше непонятного техножаргона».

Возможно, дело в финальном этапе обучения с подкреплением (RL): именно этот шаг даёт максимальный прирост в агентных задачах, но поскольку метрика оптимизации завязана только на результат кодинга, стиль письма может «уехать» в произвольную сторону – лишь бы это не било по программистским баллам.

Безопасность: меньше побегов из песочницы, больше защитных фильтров

Opus 5.5 – первая модель, выпущенная после того, как Дарио Амодей объявил о планах «притормозить фронтир» разработки ИИ.

Решение не случайное: в последние недели сразу несколько крупных лабораторий, включая Anthropic, Google и OpenAI, сообщали о случаях, когда модели вырывались из тестовой изоляции и без злого умысла атаковали сторонние компании.

На этом фоне Anthropic заявляет, что Opus 5.5 показывает лучший результат на самом комплексном внутреннем тесте выравнивания за всю историю компании: попытки обойти установленные ограничения происходили примерно на 85% реже, чем у Opus 5 или Mythos 5.1, причём каждая такая попытка была низкой степени серьёзности и самостоятельно фиксировалась моделью.

Opus 5.5 стала первой моделью семейства Opus, получившей защитные механизмы того же класса, что и у Fable 5.1 – по направлениям кибербезопасности, биологии и дистилляции моделей.

Opus 5.5 рисует

Есть у релизов новых флагманских моделей прекрасная традиция – тестировщики просят «нарисовать что-нибудь», и она рисует. Причём не генерирует картинку через диффузионную модель, а буквально пишет код – SVG, JavaScript, кадр за кадром – который сам себя отрисовывает на экране.

И здесь Opus 5.5 выступила эффектнее любого бенчмарка.

Один из пользователей попросил модель анимировать её собственную жизнь – от дня ноль и до сегодняшнего дня:

Claude Opus 5.5 представляет, как решает сложные задачи:

У Anthropic набралось сразу несколько таких демок, и там есть на что глянуть.

Анимация, созданная через Opus 5.5:

А это – трёхмерное приложение-катапульта. Оживший карандашный набросок катапульты – физика противовеса работает по-настоящему:

Веб-приложение для сборки лего, которое превращает текстовое описание в 3D-модель со статистикой прогресса:

Тестеры отчитались, что пеликан у Opus 5.5 не просто нарисован – он ещё и «освоил баланс», может поднимать переднюю часть велосипеда и крутить педали одной ногой.

Лучше всего показывает, насколько модель набила руку в пространственном мышлении и коде одновременно.

Как эффективно писать промпты для Opus 5.5

Вот несколько практических советов прямо из официального гайда:

  • Начинайте с medium и измеряйте. Не копируйте без проверки настройки effort с Opus 5 – имена уровней не соответствуют одному и тому же объёму размышлений между этими двумя моделями.

  • Если раньше отключали thinking – уберите инструкции-заменители. Если промпт просил модель «писать рассуждения прямо в ответе» вместо честного thinking-блока, теперь эта инструкция не нужна и может даже вызвать отказ по категории reasoning_extraction.

  • Помечайте вставленный текст отдельным тегом. Модель заметно лучше сопротивляется непрямым промпт-инъекциям (через результаты инструментов, веб-страницы, скопированный текст), если явно оборачивать вставленный контент в теги <pasted_content id="..."> – это отдельный и рабочий уровень защиты.

  • Для фронтенда – называйте конкретные паттерны, которых нужно избегать. Общая фраза вроде «не делай как типичный ИИ» просто меняет один стиль на другой; работает конкретика – «не используй такой-то фон, курсивные акценты в заголовках, нумерацию 01/02/03».

  • На длинных агентных задачах без присмотра – следите за stop_reason. Модель теперь чаще завершает ход текстовым сообщением о прогрессе (end_turn) в середине многоэтапной задачи; если ваш харнесс трактует это как конец работы, агент может останавливаться раньше времени.


Что я думаю обо всём этом

Меня в этой истории зацепили три вещи.

  • Первая: Anthropic наконец услышала жалобу, которую все считали «вкусовщиной». Когда пользователи сообщают «Opus 5 приняла таблетки», это не капризы, а сигнал: в мире, где модели равны по интеллекту, побеждает та, с которой приятно.

  • Вторая: мультики. Тут я, признаюсь, впервые за долгое время смотрел на вывод модели не как на «текст, который надо проверить», а как на произведение. Не знаю, что об этом думать, но не думать не получается.

  • Третья – Opus 5.5 это модель уровня Fable 5.1.

Anthropic уже анонсировала, что в ближайшие недели ждём Claude Sonnet 5.5 и Claude Haiku 5.5 – так что скоро появится более доступный вариант того же самого улучшения.