Комментарии 2
Статья не понятно про что, пытается выдать очевидное за открытие. Да, модель вероятностная, да, сначала набрасывает грамматический каркас — это прямо следует из устройства трансформера и данных. Никакой двухстадийности тут нет, просто одни токены предсказываются с вероятностью почти 1 (артикли, окончания), другие с разбросом. Всё.
Про сигнал вообще смешно: не понятно какие функции активации были в скрытых слоя у твоих тестов, какая в выходном, например, слой softmax после себя имеет все значения в [0,1] — о какой неопределённости идет речь?
Возможно, что я не прав, но на мой взгляд идея не новая, подача — вода. Можно было бы написать короче и честнее: "Модель сначала определяет синтаксическую структуру, а потом конкретные слова". А вместо этого рассуждения про сигналы и маршруты
Статья интересная, и от части пересекается с тем экспериментом что я сейчас провел.
У людей есть чувство «что-то не то» — ты ещё не ошибся, но уже знаешь. Я хотел узнать: есть ли такое у нейросети? в числах.
Что нашел. Взял крошечную сетку, научил её решать задачки, и подсматривал её внутреннее состояние прямо во время работы. И да — за один шаг до ошибки у неё «дрожит» внутренний сигнал.
Потом подключил триггер: «просело — переделай шаг» Результат: +12.5% к точности

Структура, скрытая за написанием текста языковыми моделями