Обновить

Как модели упаковывают концепты в многообразия: смотрим на теорию, рушим идеальный мир и ищем кружочки

Уровень сложностиСложный
Время на прочтение18 мин
Охват и читатели7.7K
Всего голосов 6: ↑5 и ↓1+5
Комментарии3

Комментарии 3

Отличная статья, спасибо!

Насколько я понял, применение теоремы Уитни к LLM предполагает, что мы работаем с непрерывными структурами. Но ведь словарь у модели конечен и, получается, мы как бы натягиваем гладкую топологию на дискретный граф совместных встречаемостей слов.

К тому же GPT-2 вроде бы не умеет решать day-math, т.е. фактически мы исследуем структуру, которая находится в латентном пространстве, но не используется самой моделью по прямому назначению (иначе бы GPT-2 могла в математику). Или я неправильно понял?

Не относитесь к этому как к придиркам, я для себя пытаюсь понять.

Привет! Спасибо и спасибо за вопросы!

1) Да, всё так. В статье как раз написано — у нас ни гладкости, ни инъективности.

2) Модель не умеет в day-math — это про то, что в GPT-2 данной нет circuit, который отвечает за 2pik/7 добавление ко дню.

Умение в задачу day-math не равно умение в задачу просто math и наоборот)

Надеюсь, помогла разобраться!

Спасибо, теперь понял.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации