Обновить

Комментарии 4

Для исследования, как мне кажется, пока рановато. Конфигурация почти один в один совпадает с работой Nanda et al. 2023 (p=113, один слой, d_model=128, wd=1.0, 30% train), а сама постановка задачи пришла из Power et al. Ни одна из них в статье не упомянута, и непонятно, с чем сравниваются ваши 23–32 тысячи шагов.

Вопрос о том, что управляет моментом перехода, в литературе тоже уже разбирали: роль weight decay и доли train, Omnigrok, работы про эффективность цепей. Подавать его как открытый вопрос и не указывать ссылки на то, что фактически повторяет ваша статья немного странно.

Второе замечание касается проверки сохраненных моделей. По вашим же словам, replay выполнялся исходным кодом и сопоставлял артефакты, нового независимого forward pass не было. Поэтому нулевое расхождение ожидаемо и ничего не доказывает т. к. код сошелся сам с собой. Хеши подтверждают, что файлы не изменились, а не то, что результат верный.

И последнее: фазовый разрыв у вас выводится из порога по accuracy на пяти чекпоинтах, при этом между шагами 416 и 23 000 ничего не наблюдается (поправьте если не прав). Получается, что у вас accuracy быстро насыщается, хотя внутри модели переход, судя по тому же Nanda, идет постепенно. Без loss, weight norm и хотя бы Фурье-анализа это может быть просто эффектом выбранной метрики. Плюс три запуска при разбросе времени перехода около 40% и общем seed для инициализации и сплита не позволяют делать выводы о распределении.

Спасибо за внимательный разбор. Во многом согласен — прежде всего с замечанием о ссылках и границах выводов.

Я занимаюсь этим как независимый исследователь: собираю экспериментальный стенд, воспроизвожу известный эффект и учусь проверять собственные интерпретации. Нового объяснения grokking в этой статье у меня нет. Работы Power, Nanda и Omnigrok нужно было явно указать и объяснить связь с ними. Без этого текст действительно может создавать неверное впечатление о новизне. Исправлю.

23–32 тысячи шагов — это результаты наших запусков при выбранной конфигурации, а не показатель улучшения относительно других работ. Вопрос о моменте перехода корректнее сформулировать как следующий вопрос для наших экспериментов, с учётом уже существующих исследований.

По replay тоже принимаю замечание. При подготовке статьи я проверял целостность файлов и согласованность сохранённых отчётов с метриками, нового независимого forward pass не запускал. Нулевое расхождение здесь подтверждает согласованность артефактов, но не исключает общую ошибку в коде. В тексте это описано недостаточно последовательно.

Одно уточнение: пять checkpoints — это пять сохранённых состояний модели. Метрики между ними есть: 401 запись для seed 42 и по 403 для seed 43 и 44. Поэтому промежуток между 416 и 23 000 не был полностью без наблюдений. Но это не снимает вашего замечания: по одному порогу accuracy нельзя утверждать, что внутри модели произошёл резкий фазовый переход.

Три запуска также не дают оснований говорить о распределении времени перехода или отделять влияние сплита от инициализации. Для следующего этапа нужны раздельные seeds, анализ loss, норм весов и механизма, а не просто ещё несколько похожих прогонов.

Спасибо — такой комментарий помогает точнее понять, что уже сделано и что ещё предстоит проверить. Возьму на вооружение .

Спасибо за ответ.

Нового объяснения grokking в этой статье у меня нет.

Я по ошибке воспринял вашу статью как раз как новые данные по теме гроккинга. Подумал, ух ты! Полез разбираться и понял, что это по большей части независимое воспроизведение того, что есть. Это тоже хорошо, просто без источников немного ввело в заблуждение.

В любом случае, спасибо, что поделились, обязательно напишите, если что-нибудь нащупаете!

Хорошо, можете найти меня в телеграм- @IgorRybakoff , для удобства общения. Вопросы точно будут, посмотрел Ваши статьи. Интересно и не поверхностно.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации