В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также известный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прогоняет представление через одни и те же вычислительные блоки перед генерацией следующего токена. Это позволяет увеличить «глубину вычислений» без пропорционального наращивания числа параметров.
У подхода есть два очевидных преимущества. Меньшая по размеру модель может выполнять больше вычислений над сложной задачей, а повторное использование одних и тех же слоев позволяет сократить требования к памяти и пропускной способности по сравнению с простым увеличением размера модели. Исследования подобных методов уже показывали улучшения на задачах программирования и математики.
Но есть и проблема с наблюдаемостью размышлений (reasoning). В обычных «думающих» моделях значительная часть рассуждений выражается в виде текстовой цепочки мыслей. При recurrent depth дополнительные вычисления происходят внутри повторяющихся проходов по скрытым представлениям, поэтому значительная часть процесса оказывается менее доступна для внешнего анализа.
Для OpenAI это особенно важно из-за кибервозможностей Astra. На днях компания заявила, что Astra достигла порога Critical по кибербезопасности в соответствии с Preparedness Framework. По оценке OpenAI, при наличии необходимых инструментов и доступа модель способна находить ранее неизвестные уязвимости и строить способы их эксплуатации в защищенных системах без пошагового руководства человека.
В тестах OpenAI Astra смогла найти и использовать две ранее неизвестные уязвимости в рамках exploit chain. В экспертных испытаниях модель также построила цепочку компрометации браузера с выходом из песочницы и выполнением команд на хост-системе.
Поэтому проблема прозрачности здесь не теоретическая. При потенциально критических кибервозможностях исследователям важно быстро понимать, что именно делает модель и почему она это делает. А если часть вычислительного процесса проходит внутри повторных скрытых состояний, обычного анализа chain of thought может оказаться недостаточно.
OpenAI уже развивает дополнительные способы контроля, которые не полагаются только на читаемую цепочку рассуждений. Для Astra компания сочетает мониторинг chain of thought, системные классификаторы, ограничения доступа и механизмы остановки потенциально несанкционированных действий.
При этом ситуация с самим обучением уже изменилась. После инцидента с Hugging Face OpenAI действительно приостанавливала часть frontier training примерно на две недели и дольше удерживала некоторые крупные RL-запуски. Но 28 августа крупнейший ранее остановленный frontier RL-run для будущих версий Astra был возобновлен после внедрения новых требований к безопасности и изоляции.
Так, recurrent depth дает Astra дополнительный вычислительный бюджет без простого увеличения размера модели, но одновременно усложняет задачу контроля. Чем больше возможностей модель получает внутри скрытых вычислений, тем важнее становится мониторинг, который способен обнаруживать опасное поведение не только по тому, что модель пишет, но и по тому, что она делает.

