Обновить

Модель, которая думает по кругу: что на самом деле нового в GPT-6 Astra

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.5K
Всего голосов 7: ↑6 и ↓1+7
Комментарии3

Комментарии 3

Тут на хабре был школьник(sik), успешно реализовавший рекурентный форк llama.cpp https://github.com/cubetitled-ui/llama.cpp . До этого были слухи о наличии подобного в Mythos, и https://github.com/kyegomez/OpenMythos , идея очевидна, и её наверно действительно тормозили искусственно по соображением безопасности контроля - любопытно, что китайцы тоже соблюдали это ограничение.

То есть модель того же веса прибавляет +20 условных попугаев за счёт циклического пробегания по тем же слоям, тратя вычисления и время?

Мне всё же непонятно откуда прирост, ведь слой уже повлиял на вектор при первом пробеге. Пойду почитаю про рекуррентные сети.

Если я правильно понял объяснение автора, то в Astra реализовали циклы и обратную связь, которые мы все используем при агентной разработке, но только внутри самой модели?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации