Комментарии 3
Тут на хабре был школьник(sik), успешно реализовавший рекурентный форк llama.cpp https://github.com/cubetitled-ui/llama.cpp . До этого были слухи о наличии подобного в Mythos, и https://github.com/kyegomez/OpenMythos , идея очевидна, и её наверно действительно тормозили искусственно по соображением безопасности контроля - любопытно, что китайцы тоже соблюдали это ограничение.
То есть модель того же веса прибавляет +20 условных попугаев за счёт циклического пробегания по тем же слоям, тратя вычисления и время?
Мне всё же непонятно откуда прирост, ведь слой уже повлиял на вектор при первом пробеге. Пойду почитаю про рекуррентные сети.
Если я правильно понял объяснение автора, то в Astra реализовали циклы и обратную связь, которые мы все используем при агентной разработке, но только внутри самой модели?

Модель, которая думает по кругу: что на самом деле нового в GPT-6 Astra