Comments 3
Статья интересная, и от части пересекается с тем экспериментом что я сейчас провел.
У людей есть чувство «что-то не то» — ты ещё не ошибся, но уже знаешь. Я хотел узнать: есть ли такое у нейросети? в числах.
Что нашел. Взял крошечную сетку, научил её решать задачки, и подсматривал её внутреннее состояние прямо во время работы. И да — за один шаг до ошибки у неё «дрожит» внутренний сигнал.
Потом подключил триггер: «просело — переделай шаг» Результат: +12.5% к точности
Статья не понятно про что, пытается выдать очевидное за открытие. Да, модель вероятностная, да, сначала набрасывает грамматический каркас — это прямо следует из устройства трансформера и данных. Никакой двухстадийности тут нет, просто одни токены предсказываются с вероятностью почти 1 (артикли, окончания), другие с разбросом. Всё.
Про сигнал вообще смешно: не понятно какие функции активации были в скрытых слоя у твоих тестов, какая в выходном, например, слой softmax после себя имеет все значения в [0,1] — о какой неопределённости идет речь?
Возможно, что я не прав, но на мой взгляд идея не новая, подача — вода. Можно было бы написать короче и честнее: "Модель сначала определяет синтаксическую структуру, а потом конкретные слова". А вместо этого рассуждения про сигналы и маршруты
Статья интересная, и от части пересекается с тем экспериментом что я сейчас провел.
У людей есть чувство «что-то не то» — ты ещё не ошибся, но уже знаешь. Я хотел узнать: есть ли такое у нейросети? в числах.
Что нашел. Взял крошечную сетку, научил её решать задачки, и подсматривал её внутреннее состояние прямо во время работы. И да — за один шаг до ошибки у неё «дрожит» внутренний сигнал.
Потом подключил триггер: «просело — переделай шаг» Результат: +12.5% к точности
Очевидно, что подобные модели, генерирующие вполне добротный и корректный текст, в своей внутренней механике оперируют словами, наборами слов (фразами), их связями и корреляциями установленными и зафиксированными при обучении. Интеллект же человека строит понятийные рассуждения оперируя предметными объектами, их свойствами, связями и отношениями с другими объектами из своей памяти и на основании этого анализа делает выводы и принимает решение выражая его на языке или в форме последующего физического или интеллектуального действия. То есть применительно к обсуждаемому, сначала предметно-понятийный анализ, а уже затем формирование выходного результата в форме текста на своем родном или другом языке. Поэтому возникает резонный вопрос: понимают ли подобные генеративные модели, как человек, смысл обрабатываемой информации и сформированного на выходе текста.
Структура, скрытая за написанием текста языковыми моделями