Комментарии 3
Отличная статья, спасибо!
Насколько я понял, применение теоремы Уитни к LLM предполагает, что мы работаем с непрерывными структурами. Но ведь словарь у модели конечен и, получается, мы как бы натягиваем гладкую топологию на дискретный граф совместных встречаемостей слов.
К тому же GPT-2 вроде бы не умеет решать day-math, т.е. фактически мы исследуем структуру, которая находится в латентном пространстве, но не используется самой моделью по прямому назначению (иначе бы GPT-2 могла в математику). Или я неправильно понял?
Не относитесь к этому как к придиркам, я для себя пытаюсь понять.
Привет! Спасибо и спасибо за вопросы!
1) Да, всё так. В статье как раз написано — у нас ни гладкости, ни инъективности.
2) Модель не умеет в day-math — это про то, что в GPT-2 данной нет circuit, который отвечает за 2pik/7 добавление ко дню.
Умение в задачу day-math не равно умение в задачу просто math и наоборот)
Надеюсь, помогла разобраться!

Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки