Обновить

Структура, скрытая за написанием текста языковыми моделями

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели9.1K
Всего голосов 3: ↑1 и ↓2-1
Комментарии2

Комментарии 2

​Статья не понятно про что, пытается выдать очевидное за открытие. Да, модель вероятностная, да, сначала набрасывает грамматический каркас — это прямо следует из устройства трансформера и данных. Никакой двухстадийности тут нет, просто одни токены предсказываются с вероятностью почти 1 (артикли, окончания), другие с разбросом. Всё.

Про сигнал вообще смешно: не понятно какие функции активации были в скрытых слоя у твоих тестов, какая в выходном, например, слой softmax после себя имеет все значения в [0,1] — о какой неопределённости идет речь?

Возможно, что я не прав, но на мой взгляд идея не новая, подача — вода. Можно было бы написать короче и честнее: "Модель сначала определяет синтаксическую структуру, а потом конкретные слова". А вместо этого рассуждения про сигналы и маршруты

Статья интересная, и от части пересекается с тем экспериментом что я сейчас провел.
У людей есть чувство «что-то не то» — ты ещё не ошибся, но уже знаешь. Я хотел узнать: есть ли такое у нейросети? в числах.
Что нашел. Взял крошечную сетку, научил её решать задачки, и подсматривал её внутреннее состояние прямо во время работы. И да — за один шаг до ошибки у неё «дрожит» внутренний сигнал.
Потом подключил триггер: «просело — переделай шаг» Результат: +12.5% к точности

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации