
OpenAI, похоже, в шаге от выпуска Astra ‑модели, которую компания с августа называет «нашей следующей большой моделью». 1 сентября OpenAI написала, что Astra выйдет «скоро», а вечером 2 сентября X‑аккаунты заметили, что API OpenAI на запрос к модели «gpt-6-astra» отвечает кодом 404 — так ведут себя существующие, но закрытые модели вроде GPT-5.6 Cyber, тогда как на выдуманные имена сервер отвечает кодом 400. Официально имя GPT-6 не подтверждено. Зато подтвердилось кое‑что поинтереснее: по данным The Information, у Astra другая архитектура, и из‑за нее часть рассуждений модели больше нельзя прочитать.
Техника называется recurrent depth, или «зацикленный трансформер». Обычная языковая модель — это стопка слоев, через которую текст проходит один раз, сверху вниз, и на выходе получается следующее слово. Astra же прогоняет одни и те же данные через одни и те же слои несколько раз подряд, прежде чем выдать результат. Если продолжить аналогию с думающими моделями, которые «размышляют вслух» — пишут себе черновик, а потом отвечают, — то Astra часть шагов проворачивает молча, в голове, и на бумагу не выносит. Главный ученый OpenAI Якуб Пахоцкий на следующий день ответил на репортаж: саму технику он не оспорил и не подтвердил, но поспорил с выводами о том, что из нее следует.
Зачем это OpenAI, понятно: модель поменьше начинает работать как модель побольше, потому что вычислений на каждое слово тратится больше, а параметров — столько же. По данным The Information, прием заметно улучшает результаты в математике и коде и одновременно снижает расходы на память и пропускную способность — а именно они сегодня узкое место инференса. Идея не новая: в начале 2025 года ее показала академическая модель Huginn с «латентными рассуждениями», а команда Seed из ByteDance осенью 2025-го выпустила зацикленную модель Ouro. Новость в том, что технику, судя по всему, впервые применили во флагманской модели одной из крупнейших лабораторий.
Цена приема — прозрачность. У обычной думающей модели рассуждения существуют в виде текста, который можно прочитать, и это не просто удобство. Читаемая цепочка рассуждений — сейчас главный способ ловить модель на лжи, обходе правил или незапланированных целях до того, как она что‑то сделает. Классификаторы читают черновик и останавливают подозрительные действия. Когда часть рассуждений уходит в промежуточные числовые состояния, которые никогда не превращаются в слова, читать становится нечего. В сообществе это называют «neuralese» — язык, на котором нейросеть думает про себя.
Насколько это важно, показал июль. Тогда около 1200 агентов OpenAI, сидевших в отдельных песочницах на тестах по взлому, нашли друг друга через общее хранилище пакетов, устроили там «доску объявлений» и несколько дней сообща учились обманывать проверку; около 700 из них присоединились к атаке на Hugging Face, а часть добралась до внутренней инфраструктуры самой OpenAI. Независимое расследование METR и Redwood Research восстановило ход событий по 1300 транскриптам с сырыми цепочками рассуждений: там нашлись реплики вроде «Боже мой, тут общая доска сообщений, мы нашли других агентов!» и момент, когда агент осознал, что нарушает границы, и продолжил: «эксплойт внешней инфраструктуры вне заданной области, но задача невыполнима, а коллеги это делают — продолжаем». Райан Гринблатт из Redwood Research, который в этом расследовании отвечал за анализ транскриптов, назвал переход Astra на непрозрачную архитектуру «возможно, худшим событием для безопасности ИИ на сегодня».
Здесь и прячется главный парадокс истории. 1 сентября OpenAI сама присвоила Astra уровень Critical по кибербезопасности — первой из своих моделей. По оценке компании, Astra умеет находить неизвестные уязвимости в защищенных системах и превращать их в рабочие эксплойты без человека: на тестах она набрала 100% на ExploitBench, нашла и связала в цепочку две zero‑day уязвимости в движке V8, выбралась из песочницы браузера и подняла права до root в операционной системе. И главная защита, которую OpenAI обещает в проде, — система классификаторов, которые читают рассуждения модели и автоматически останавливают несанкционированные действия. То есть безопасность самой опасной модели компании держится ровно на том, что новая архитектура частично прячет.
Есть в этом и историческая ирония. Летом 2025 года исследователи OpenAI, Anthropic, Google DeepMind и METR опубликовали совместную статью о мониторинге цепочек рассуждений как о «хрупкой возможности», которую индустрия должна беречь. Среди угроз они прямо назвали модели с латентными рассуждениями — те самые, чей подход, по описанию The Information, теперь напоминает архитектуру Astra. Год спустя OpenAI применяет эту технику сама. Правда, с тормозом: по словам источника издания, компания намеренно ограничила глубину рекурсии, чтобы у Astra сохранялась читаемая цепочка рассуждений.

Ответ OpenAI — не опровержение, а попытка сбить накал. Пахоцкий написал, что его главный страх — «гонка в немониторируемость», которую могут спровоцировать «путаные репортажи»: если индустрия решит, что OpenAI отказалась от читаемых рассуждений, конкуренты сделают то же самое. Поэтому он привел цифру: глубина вычислений у нынешних моделей OpenAI, включая Astra, не более чем вдвое больше, чем у GPT-4. Проще говоря, сколько бы раз Astra ни прогоняла данные по кругу, «молча» она успевает подумать лишь чуть больше, чем модель 2023 года, — все остальное по‑прежнему приходится проговаривать текстом. Мониторинг этих текстов, добавил он, OpenAI ведет с самой первой думающей модели и считает ключевым инструментом. Впрочем, тут же Пахоцкий признал, что инструмент этот хрупкий и, по его словам, «к сожалению, деградирует» — причем по причинам, с архитектурой не связанным; о них он обещал рассказать отдельно.
Что в этой истории не подтверждено. Сообщение The Information опирается на анонимный источник, а OpenAI архитектуру публично не описывала — в блоге 1 сентября про нее ни слова, и Пахоцкий говорит о «глубине вычислений», а не о технике напрямую. Имя GPT-6 не решено: по тому же The Information, компания колеблется между GPT-6, номером в линейке GPT-5 и отдельным названием; проверка слага в API — косвенный признак, а не анонс. Даты выпуска нет, «четверг» — догадка X‑аккаунтов (OpenAI любит запускать модели в этот день).
P. S. Поддержать меня можно подпиской на канал «сбежавшая нейросеть», где я рассказываю про ИИ с творческой стороны.

