Комментарии 19
Представление становится несущим, когда хранить его дешевле, чем каждый раз пересчитывать.
Чем отличается “хранить” от “пересчитывать” в контексте нейросети? Когда модель дает ответ, хранящиеся веса в любом случае участвуют в вычислениях. Эти веса формируются при обучении, и если их нет, то “на лету” при обработке ответа они нигде не возникают. То есть насколько я понимаю, нельзя создать ситуацию, когда нейросеть отвечает правильно на сложные вычисления, но при этом не хранит в весах эти представления, она просто будет отвечать неправильно.
А вот когда пересчёт становится дорогим
Что означает “дорогой пересчет”? В чем измеряется цена пересчета? Из описания вашего эксперимента это непонятно. Насколько я понимаю, объем данных, которые приходят на вход нейросети, в обоих вариантах одинаковый - вход и результат, отклонение фактического результата от правильного. “Цена” получения результата при обработке отдельно взятого запроса нигде не фигурирует, и поэтому не может влиять на обучение.
Вы путаете веса и "оперативную" память сети в момент инференса (резидуальный поток).
Хранить значит, что на раннем слое сеть вычислила правило и записала его в резидуальный поток на позиции токена =. Следующие слои читают готовый знак.
Пересчитывать значит, что каждый потребитель (голова внимания) на поздних слоях вынужден сам обращаться к токену-источнику и тратить свои матрицы (емкость сети) на вычисление правила заново.
Цена пересчета измеряется в вычислительной ёмкости параметров. Градиентный спуск заставляет сеть искать самый оптимальный способ использования весов. Если логика сложная и потребителей много, выгоднее для loss-функции выделить один участок резидуального потока под буфер, чтобы один раз посчитать и раздать результат. Если правило примитивное, буфер не создается.
Я-то как раз не путаю, а указываю на это.
Цена вычисления измеряется в вычислительной ёмкости.
Извините, это не ответ, а тавтология. На входе есть данные, они задают правило. Где и как вычисляется цена этого правила?
Если логика сложная и потребителей много чтобы один раз посчитать и раздать результат
Я это понял. Вопрос был в том, что означает “сложная логика”, в чем именно измеряется cложность логики, в каким виде ее воспринимает или определяет нейросеть.
Потому что если нейросети подается только вход и ожидаемый выход, то единственный критерий, который ей доступен, это количество неправильных ответов при обучении.
Повторюсь. Нейросеть как субъект не сравнивает и не определяет цену:
Градиентный спуск заставляет сеть искать самый оптимальный способ использования весов
Например, размерности сети не хватает для минимизации лосса сложной задачи сразу для нескольких голов. То есть условно, одна голова отжимает 80% сети, и другие посчитать в том же проходе не могут. Лосс не падает. А если результат расчета провести в слоях пораньше и повесить на токен, то уже считать не надо и головы его используют как управляющий знак.
Как и почему градиентный спуск находит эту структуру, уже вопрос теории оптимизационных ландшафтов.
Чтобы сложность правила влияла на градиентный спуск, она должна существовать в каком-то виде в процессе обучения нейросети, где этот градиентный спуск работает.
размерности сети не хватает для минимизации лосса
Об этом я и говорю. Дело только в количестве неправильных ответов при обучении (и в уровне ошибки для одного ответа), нет критерия “это правило легче вычислять на лету”. Ситуацию “вычислять сложное правило на лету” создать принципиально невозможно, есть ситуации только “хранить в весах легкое правило” и “хранить в весах сложное правило”. Естественно, для легкого правила нужно меньше информационных элементов.
Вы опять путаете веса модели и резидуальный поток (активации в момент инференса).
Считать на лету или вынести в знак это маршрутизация данных по слоям, а не хранение в весах. Посмотрите контрольную группу H. В ней сеть каждый раз обращается к источнику и считает правило на лету, не формируя сохраненного знака.
Если вам не нравится "цена" ок, скажу так: Градиентный спуск не оценивает стоимость, он просто скатывается в решение с меньшим лоссом
это маршрутизация данных по слоям, а не хранение в весах
Я даже спросил LLM, и насколько я понял из ответа, веса как раз и определяют, появится ли знак в потоке заранее или потом. Так я и предполагал. Согласен, я наверно не совсем корректно сказал, но принципиально это ничего не меняет, связь с весами тут есть.
В ней сеть каждый раз обращается к источнику
Насколько я понимаю, случайно может оказаться так, что и для легкого правила появится знак в потоке. А если потребитель один, то и для сложного правила он может не появиться. Основной фактор тут weight_decay, который отдает предпочтение меньшему количеству информационных элементов, а не сложность самого правила. weight_decay это внутренний фактор, он не связан с внешней средой.
Кстати, феномен мышечной памяти, например при игре в приставку, показывает, что абстракция необязательно должна выноситься на более ранние шаги обработки. Абстракции “прыгнуть влево”, “прыгнуть вправо” уже есть, но мышцы формируют свою память.
ровно так работает интернализация знака у Выготского: внешнее действие сворачивается во внутреннее орудие тогда, когда его многократное исполнение становится дорогим
LLM мне подсказывает, что это высказывание неверно, Выготский не называл это причиной появления знака.
Иронично) Человек в комментариях к статье про конфабуляцию моделей в качестве аргумента приносит ответ от модели, которая галлюцинирует
Развитие начинается с мобилизации наиболее примитивных, заложенных от природы тенденций, их натурального использования, затем проходит через фазу учения, когда под давлением внешних условий процесс меняет свою структуру, начинает из натурального становиться сложным "культурным", когда строится с помощью целого ряда внешних приёмов новая форма поведения, и, наконец, приходит к стадии, когда эти внешние вспомогательные приёмы остаются позади, отбрасываются как ненужные, и организм выходит из этой эволюции трансформированным, обладающим новыми формами и приёмами поведения
Это в общем...

Это о появлении знака как способе решения сложных задач
Знак у Выготского не ускорение прямого решения, а переход к опосредованной операции. Через искусственный стимул, который субъект направляет на себя. В моём эксперименте это и есть два разных маршрута: дешёвое правило считается прямо, на лету, дорогое выносится в опосредующий знак на позиции =, и вычисление идёт через него. «Сложность» здесь — не трудность правила, а форма операции: прямая против опосредованной.
Согласен, моя интерпретация возможно излишне вольная и ближе к Гальперину (его последователю), именно в этом контексте, но не остальных.
Ну и ещё мнение Выготского об ассоциациях, кстати:

Речь не про веса, а про активации на конкретном слое. Модель решает, прокинуть ли промежуточный результат дальше или заставить следующие слои считать его с нуля
можно считать «настоящей» репрезентацией концепта, а не корреляционным артефактом
Репрезентации концептов у людей это вообще-то тоже корреляционный артефакт. Это механизм ассоциаций, а ассоциации как раз отражают ситуации вида “A часто появляется с B”.
Ассоциация, то что рядом. Хаски и снег, пиво и рыба. Это и есть корреляции. В статье же рассмотрен причинный механизм. Именно абляция и патчинг это показывают. Если убрать снег, хаски никуда не девается, а здесь девается.
Вообще-то нет, у термина “ассоциация” другое определение.
Ассоциация - закономерно возникающая связь между отдельными событиями, фактами, предметами или явлениями, отражёнными в сознании индивида и закреплёнными в его памяти.
Физиологической основой ассоциации является кратковременная нервная связь, а фундамент этого психологического явления покоится на условных рефлексах.
“Факты и явления” могут быть любыми, в том числе отдельными признаками.
Вы не поняли. Я говорю не про связь между высокоуровневыми концепциями, а про связь между низкоуровневыми. Связь “4 прямых угла часто появляются вместе” имеет ту же природу, что и “хаски и снег часто появляются вместе”. Потом она превращается в концепцию четырехугольника.
Что ж. Если мы говорим о разных вещах, то возможно это не имеет отношения к теме статьи.
Upd: честно говоря, вы опять путаете происхождение и функцию. Об этом был наш длинный и как я понял бесполезный в итоге диалог в комментариях к прошлой статье.
Ассоциация пассивна, знак активен.
Впрочем как и в прошлой дискуссии, вы не уточняете, а продвигаете свою точку зрения. Но к сожалению, вы не не можете её сформулировать и в результате я не могу понять, что вам ответить.
Если мы говорим о разных вещах, то возможно это не имеет отношения к теме статьи.
Я говорю о теме статьи. Если вам кажется, что нет, значит вы не понимаете и не хотите понять, что вам пишет собеседник. Вам удобнее необоснованно обвинить собеседника и уйти от ответа.
вы не уточняете, а продвигаете свою точку зрения
Естественно, если я с вами не согласен, то я высказываю свою точку зрения. Когда я хочу уточнить, я задаю вопрос, когда мне всё понятно и я не согласен, я пишу возражение. Зачем мне что-то уточнять, если мне всё понятно?
Но к сожалению, вы не не можете её сформулировать
Я сформулировал ее еще в первом комментарии - концепты работают на статистическом механизме. Куда еще проще-то? В случайном шуме на входе вы никакие концепты не выделите.
А вот вы не можете сформулировать вопрос, если вам что-то непонятно, что видно в первой строке этого комментария.
Согласен 4 угла, и хаски+снег выделяются статистически.
Но я ни в статье, ни в этой дискуссии не затрагиваю вопрос происхождения. Он не относится совершенно к теме. Я утверждаю другое и про другое. Рассматривается функция готового представления. И рассматривается операционально.
Корреляционная связь симметрична и пассивна: снег коррелирует с хаски, если убираем снег, хаски не исчезает. Связь не несёт хаски, речь только о сопровождении.
А в статье описаны представления, правка которых меняет вычисление.
Пассивную корреляцию так сдвинуть нельзя. И более того, есть представления, которые статистически считываются, но вычисление ими не управляется (H, E). То есть статистика и функция расходятся.
Значит происхождение не совпадает с функцией.
Корреляционная связь симметрична и пассивна: снег коррелирует с хаски, если убираем снег, хаски не исчезает
Я вам уже объяснил, “снег-хаски” аналогична связи “4 прямых угла”. Если вы уберете один угол, остальные 3 тоже не исчезнут.
У “снег-хаски” нет отдельного названия. А например у связи “холодно, снег” есть название “зима”. Если пошел снег, мы говорим “зима пришла”. Это 3 разные абстракции. Убираете “холодно”, “снег” не исчезает. Убираете “снег”, “холодно” не исчезает. Убираете “зима”, зима исчезает, и соотвтественно это повлияет на все ответы с этим понятием.
Спасибо за интересную статью! В похожем виде собирался препарировать J-space по возвращению из отпуска, но вы уже это сделали и сэкономили кучу времени, за что вам плюсы вовсе места куда дотянулся. Вместо этого, наверное, всуну спайковые слои в современную LLM и изучу практическое применение.
Самоотчёт модели о собственном рассуждении нельзя принимать как свидетельство того, что за отчётом стоит несущее вычисление.
Это следствие ограничения самой архитектуры модели, у генерации только одно направление и сама генерация одна в каждый момент времени.
Для прода это значит только одно - не верьте логам модели, если просите ее объяснить свое решение, она просто генерит правдоподобный текст поверх стейта...

J-space на микромоделях. Новая интерпретация открытия Anthropic