Вчера OpenAI выкатила GPT-6 Astra и назвала её самой умной и выровненной моделью в мире. Грег Брокман сказал, что это скачок, и что Astra разумно считать версией AGI. Отдельная волна пошла про кибербезопасность: это первая модель, которую сама OpenAI отнесла к порогу Critical в своей рамке готовности, то есть она может находить неизвестные дыры и писать к ним эксплойты без человека, ведущего её за руку.

Всё это шумно, но, на мой взгляд, вторично. Главное в этом релизе — не проценты на бенчмарках и не киберстрашилки. Главное, что впервые в проде поменяли то, как рождается слово.

Давайте разберёмся, что изменилось и почему это очень интересный релиз.

Что вообще делает трансформер

Начну с азов, дальше без них не проехать.

Илья Суцкевер когда-то дал Джону Кармаку список из тридцати работ со словами: выучишь это — будешь понимать 90% того, что сегодня важно в мире ИИ. Его же тезис, который он повторял много раз: хорошо предсказывать следующий токен — значит понимать реальность, которая этот токен породила. Не «угадывать буковки», а держать в голове мир, из которого фраза выросла.

Механика этого предсказания простая до неприличия. Модель делает всего две вещи, но много раз подряд. Механизм внимания (attention) смотрит, о чём вообще речь в поданной последовательности. Второй механизм лезет во внутреннее знание и достаёт то, что с этой темой связано.

Возьмём фразу «Эльбрус — это…». Внимание (attention) видит, что речь про некий Эльбрус. Знание подтягивает к этому слову всё, что с ним чаще всего связано, и почти наверняка модель продолжит про гору на юге России. Но есть и заметная вероятность, что она уйдёт в российский процессор, — слово одно, миров за ним два, и модель выбирает между ними по контексту.

Дальше самое неинтуитивное. Модель берёт последнее слово и превращает его в следующее, подмешивая туда и смысл последовательности, и вытащенное знание. Концепт «Эльбрус» шаг за шагом обрастает контекстом и становится концептом «гора», и вот эта гора выпадает наружу как следующее слово. Отсюда и название: трансформер — тот, кто трансформирует.

Одного превращения мало, поэтому блоков в стопке много: слово проходит их по очереди снизу вверх и с каждым становится чуть точнее. Хочешь модель поумнее — либо ставь больше блоков, либо делай их толще. Собственно, все последние годы это и означало «увеличить мозг».

А что если дать модели поработать над собственным черновиком

Теперь сама идея, из-за которой поднялся шум.

The Information сообщила со ссылкой на человека, знакомого с разработкой, что Astra устроена как looped transformer — «зацикленный». OpenAI это не опровергла, хотя возможность была. Может, и сами слили — как утекают релизы айфонов с китайских фабрик.

Что это значит. Стопка блоков доходит до конца — и не выпускает слово наружу, а отправляет результат обратно на свой же вход. И прогоняет ещё раз. И ещё. Наружу слово выходит только после того, как круги закончились. Это и есть петля, по-английски loop, отсюда и looped transformer; дальше я буду называть такую модель зацикленной.

Ближайшая человеческая аналогия: вы подумали мысль, уже открыли рот — и поняли, что надо бы прогнать её ещё разок, прежде чем говорить.

Обычная стопка блоков против петли
Обычная стопка блоков против петли

Обычная стопка блоков против петли: параметров столько же, вычислений в r раз больше

Красота этого хода в экономике. Веса лежат в одном блоке, и от того, что вы прогнали его десять раз, их не становится в десять раз больше. Память та же, вычисления растут. Фактически вы получаете глубокую модель по цене мелкой — платите не видеопамятью, а временем.

Почему это другой способ обучения

Вот тут начинается то, ради чего я всё это пишу.

Обычную модель учат так: прогнали данные через N слоёв, посмотрели на ошибку, поправили веса. Число слоёв — константа, оно зашито в архитектуру и на обучении, и на инференсе.

С петлёй так не выходит, и в работе Гайпинга и коллег (это открытая модель Huginn на 3,5 млрд параметров, вся кухня расписана) сделали иначе. Число кругов на каждом шаге обучения вытягивают жребием — из логнормального распределения Пуассона со средним около тридцати двух. Модель никогда не знает заранее, сколько раз её прогонят: может четыре, а может девяносто.

Абстракт работы про recurrent depth на arXiv
Абстракт работы про recurrent depth на arXiv

Та самая работа, где петлю разобрали до винтика: 3,5 млрд параметров, 800 млрд токенов, а на тестах модель тянет как та, которой понадобилось бы 50 млрд

А градиент при этом считают только по последним восьми кругам. Ровно как усечённое обратное распространение во времени у рекуррентных сетей, только здесь рекуррентность не по времени, а по глубине. За счёт этого память на шаге обучения не зависит от того, сколько кругов выпало, — иначе такое просто не влезло бы в железо.

Как учат петлю
Как учат петлю

Число кругов на каждом шаге вытягивается жребием, а градиент считают только по последним восьми

Что из этого следует, мне кажется важным. Модель учат не «выдать ответ за фиксированное число слоёв». Её учат сходиться — приходить к вменяемому состоянию за столько кругов, сколько дали. Это другая постановка задачи, а не тюнинг гиперпараметра.

Настройка «думай дольше», которой раньше не было

Побочный эффект такого обучения приятный. Число кругов превращается в обычную настройку, которую задают уже при запуске, вроде громкости на усилителе: веса лежат те же самые, а мы решаем, сколько раз прогнать по ним слово. Нужно быстро и дёшево — четыре круга. Нужно точнее — тридцать два, и та же самая модель отвечает заметно лучше.

Проверим это на бенчмарках. За нас это уже сделали.

Одна модель, разное число кругов
Одна модель, разное число кругов

Одна и та же модель на 3,5 млрд параметров: меняется только число кругов на токен

Четыре круга — 49% верных ответов на школьных вопросах ARC-E. Восемь — уже 65%. Шестнадцать — 69,5%. Тридцать два — 69,9%, то есть прирост практически исчез. Кривая выходит на плато, и довольно быстро. Это, кстати, честный аргумент против самых мрачных сценариев: крутить круги до бесконечности бессмысленно, модель упирается в свой потолок.

И заметьте, чем это отличается от привычного «дай модели подумать подольше». Сегодня «подумать» означает написать много текста рассуждений, который мы читаем. Здесь думание происходит внутри, между двумя соседними словами ответа.

Думать дольше больше не равно писать длиннее.

Удивительно, что до этого не додумались раньше. Или додумались?

Честно говоря, первая реакция именно такая: идея настолько простая, что странно, почему её не крутят все подряд.

Ответ: крутят, и давно. Просто до продакшена фронтир-моделей это доезжало плохо.

Тут даже есть ирония. В том самом списке Суцкевера половина текстов — про рекуррентные сети: Кристофер Олах про LSTM, Андрей Карпатый про «безрассудную эффективность RNN». Рекуррентность была основой отрасли, трансформер её вытеснил ровно потому, что цепочку по времени нельзя посчитать параллельно, а стопку слоёв — можно. И вот она возвращается через заднюю дверь: не по времени, по глубине.

Universal Transformers предлагали крутить блок по кругу ещё в 2018-м. ALBERT шарил веса между слоями. Mixture-of-Recursions добавила сверху обучаемый маршрутизатор: лёгкий токен выходит из петли рано, тяжёлый крутится дольше. А открытая китайская Nanbeige4.2-3B под Apache 2.0 — это ровно наш случай в чистом виде: стопка из 22 слоёв, прогоняемая дважды, то есть модель ведёт себя как сорокачетырёхслойная, а весит как двадцатидвухслойная. Это не пересказ, это просто лежит в открытом конфиге, можете сходить и посмотреть сами:

Конфиг Nanbeige4.2-3B на Hugging Face
Конфиг Nanbeige4.2-3B на Hugging Face

Двадцать два слоя, num_loops: 2, лицензия Apache 2.0. Никакой тайны фронтир-лаборатории тут нет

Что действительно изменилось в этом году — петлю наконец померили строго. Первого сентября вышла работа SMELT, и она снимает главное возражение. Раньше петлю сравнивали с обычной моделью того же размера — и было непонятно, выигрывает архитектура или просто лишние вычисления. Здесь выровняли всё: вычисления на токен, число параметров, размер KV-кэша. И зацикленная модель всё равно выиграла: 7–18% экономии обучающих вычислений на оптимальной границе, причём сильнее всего на коде.

Абстракт работы SMELT на arXiv
Абстракт работы SMELT на arXiv

Если коротко по-русски: раньше сравнивали нечестно, при выровненных бюджетах петля экономит от 6,8 до 18 процентов вычислений, сильнее всего на коде

Внутри, если верить их разбору механики, второй проход по слоям гасит «сток внимания» (attention sink). Это известная болячка трансформеров: модель бессмысленно залипает вниманием на первых словах последовательности просто потому, что им некуда больше смотреть. После второго прохода внимание перетекает на слова, в которых реально есть смысл.

То есть это не слух из утечки. Это направление, у которого уже есть свои законы масштабирования.

А что там с паникой

Коротко, потому что про это и без меня написали все.

Испугались того, что часть рассуждения уходит из читаемого текста в числа, которые прочитать нельзя. Гендиректор Redwood Research Бак Шлегерис написал, что крайне обеспокоен; а научный руководитель той же лаборатории Райан Гринблатт назвал это возможно худшим событием для безопасности ИИ на сегодня. И у него, надо сказать, повод предметный: он один из трёх внешних исследователей, которых OpenAI пустила разбирать взлом Hugging Face, а разбирали тот инцидент как раз по цепочкам рассуждений.

С другой стороны — Себастьян Рашка (фамилия не для наших краев :) ) спокойно объясняет, что переиспользование слоёв само по себе ничего не скрывает: оно просто переносит больше вычислений в скрытые активации до выдачи слова. Если видимых рассуждений станет меньше, то потому, что модели нужно писать меньше промежуточных слов, а не потому, что архитектура их прячет. Главный научный сотрудник OpenAI Якуб Пахоцкий ответил в том же духе: глубина вычислительного графа фронтир-моделей, включая Astra, укладывается в двойку от GPT-4, а петлю в Astra намеренно ограничили, чтобы не потерять мониторинг.

Моя позиция простая: спор идёт не об архитектуре, а о том, насколько мы вообще верили цепочкам рассуждений. Судя по совместной работе OpenAI, Anthropic и Google DeepMindверили зря — модель никто не заставляет писать правду о том, как она пришла к ответу, её награждают только за верный итог.

И напоследок про цифры

Раз уж речь про то, чему верить.

Astra показала 99,9% на ARC-AGI-3 — цифра, которая летает по всем заголовкам. Уиллисон обращает внимание на сноску: этот результат получен на собственном харнессе OpenAI, который переносит непрозрачное состояние между запросами и жмёт контекст, чтобы модель продолжала начатое. На стандартном харнессе ARC Prize та же модель набрала 62,7%.

Разбор Саймона Уиллисона
Разбор Саймона Уиллисона

Уиллисон аккуратно сложил рядом обе цифры и обе цены прогона. Ниже он же отмечает, что по индексу интеллекта Astra идёт вровень с прошлой моделью OpenAI

ARC-AGI-3: одна модель, две цифры
ARC-AGI-3: одна модель, две цифры

Один и тот же прогон, разные обвязки — и разница в тридцать семь процентных пунктов

По индексу интеллекта Artificial Analysis Astra вообще идёт вровень с прошлой GPT-5.6 Sol и на пять пунктов ниже Claude Fable 5.1. Зато заметно дешевле на агентских задачах — и вот это, пожалуй, честное достижение релиза.

Проценты перебьют через месяц, кто-нибудь выложит модель получше. А смена способа, которым модель формирует слово, останется. Пока все считали баллы, отрасль тихо вернула в трансформер рекуррентность, от которой десять лет назад ушла.


Telegram-канал — https://t.me/notes_from_cto. Регулярные технические заметки про ИИ и железо. Буду рад, если зайдёте и останетесь.