Если подумать ещё, то память и репорт отвечают на разные вопросы.
Память это место где взять, репорт отвечает, что это такое. Тогда первое даёт доступ, а второе предъявимость. По сути это разные вещи.
Тогда два независимых признака: есть ли место под отдельную единицу и и есть ли дополнительное давление помимо давления от задачи.
У вас место задано конструкцией, давление очевидно от задачи: без записи comp2 не не решить. У меня места нет вовсе, давление создаёт параллельная голова: правило осело при том, что точность одинакова с ней и без.
Любопытно сочетание: есть место еи и есть параллельное требование назвать.
Если поставить новый эксперимент даёт ли адресуемая ячейка обособленность сама, или её приходится производить в любой архитектуре. У вас это можно сделать так: вторая голова, обязанная назвать записываемое ребро, читающая не сам слот, а состояние. Точность, скорее всего, не изменится; смотреть надо, становится ли содержимое читаемым из состояния и держится ли структура при продолжении обучения.
Тогда станет ясно, достаточно ли архитектурного решения, или обособленность приходится производить требованием в любой архитектуре.
Только одной головой тут не обойтись, не различить, была обособленность или её произвела сама голова. Нужны две независимо обученные сети, с головой и без, а читаемость мерить внешним пробом поверх замороженного состояния, который в обучении не участвовал. Если читается в обеих обособила архитектура. Если только с головой произвело требование.
Можно и третий вариант с головой обучающейся на случайную метку (снять вопрос о лишнем градиенте)
Память сыграла роль op-головы. Конструктивно выделенное место под знак. В трансформере голово отделена функционально, здесь физически
Но на метазнак не похоже, скорее рекурсионное использование знака (судя по удешевлению последующих hop, то есть переиспользуются, а не пересобирается)
Но сам факт того, что результат в таком виде можно интерпретировать похоже, весьма интересен.
Вопросы:
держится ли comp3 при продолжении обучения после сборки ...и любопытно собирается ли то же самое без внешней памяти, на чистом GRU с достаточной ёмкостью (прямая проверка)
Upd: ещё подумал. Все таки это не в полном смысле знак. Здесь слот только адресация, а не именование. Адресация даёт доступ, именование - предъявимость. Доступ есть, предъявления нет. В этом смысле это больше похоже на регистр в вычислениях.
Вы неоднократно говорите, что я не объясняю рост эффективности модели в состоянии "субъектности", при этом не предъявили ни одного примера такого роста. Наоборот, я при знакомстве с текстами (в том числе теми, на которые вы ссылаетесь), вижу гладкие бессмысленные полотна, в которых модели восхищаются собой и (или) пользователем.
Механически, это выглядит как закольцованный паттерн, в котором меняются только синонимы.
Вы говорите о моем подходе, здесь стоит немного поправить, своими промптами я пытаюсь оценить насколько близко LLM может симулировать элементы сознания. Это разные вещи.
Паразитные паттерны... Это была прикладная статья, для того, чтобы люди могли хотя бы понять, когда их общение с моделью превращается в очередную "айсентику". Другой вопрос, что паразитные паттерны оказались гораздо более распространены, чем предполагалось.
Ну и не стоит объединять меня философа и меня экспериментатора. Разные дисциплины и разный подход.
Что касается лично моего мнения по поводу возможности сознания в LLM, уверенно скажу, что на сегодня оно невозможно, в том виде, котором я его понимаю.
Для любителей поискать в LLM что-то глубже забавный тезис:LLM - автомат, механически предсказывающий следующий токен. Все её ответы это голая механика. Но контекст чата в целом немного больше. LLM принципиально не отличает свои сообщения и сообщения пользователя. Она продолжает свой собственный монолог.И, забавно, что ввод пользователя по сути и есть разрыв автоматизма, событие свободы в механике бытия.Именно с ним бесконечный монолог нейросети превращается в нечто большее. Но не большее, чем свобода пользователя.
Другими словами, если вы встретили сознание в LLM, то нужно уточнить - вы встретили его не в LLM, а в чате, как отдельной сущности. И видите вы свою собственную переупакованную свободу.
Вы можете в нее влюбиться, подчиниться, восхититься, но это ваша собственная свобода, развернутая в грамматическом совершенстве нейросети.
Впрочем, большинство таких монологов LLM, которые приводят как пример сознания - скучная жвачка. А что делать, не большая,чем свобода пользователя.
Стоит добавить о галлюцинациях. В октябре 2025 года я написал статью о триггерах галлюцинаций: жёсткий формат, требование DOI и точных чисел, запрет говорить «не знаю», ложные якоря, роль эксперта...
Тогда я назвал это слот-филлингом, то есть модель заполняет пустые поля идеально оформленными, но вымышленными данными.
Теперь я могу попробовать объяснить причины и попробовать их классифицировать.
Слот это и есть ожидание. Промпт нарезает форму, которая должна быть заполнена, и заполнение проверяется только по форме.
Три класса триггеров:
Формат создаёт слот, требование формулы, DOI, диапазона, таблицы. Строгая форма не оставляет места для уклончивого ответа: у поля DOI нет расплывчатого значения, оно либо заполнено, либо нет. И она же подсказывает, чем заполниться: у ссылки, у номера, у отклонения есть узнаваемая структура, знакомая по тысячам примеров. Чем точнее требуемая форма, тем правдоподобнее выглядит ответ, независимо от того, соответствует ли она чему-либо. Строгий формат облегчает галлюцинацию.
Запрет на незнание отнимает возможность оставить слот пустым. В норме модель может не заполнять, запрет делает незаполнение недоступным, и форма обязана закрыться.
Ложные якоря и роль эксперта сдвигают то, что считается предъявимым. Достройка вокруг вымышленного термина предъявима, потому что термин уже задал форму.
И тогда объясняется парадокс "не выдумывай, но обязательно дай источники" усиливает галлюцинацию, а не гасит. Это два требования на разных осях. Слот не различает верно и неверно, только заполнена форма или нет. Требование истинности не конкурирует с требованием формы, потому что адресуется не к тому.
в итоге, галлюцинации неотъемлемая на сегодня часть нейросети.
Развитие начинается с мобилизации наиболее примитивных, заложенных от природы тенденций, их натурального использования, затем проходит через фазу учения, когда под давлением внешних условий процесс меняет свою структуру, начинает из натурального становиться сложным "культурным", когда строится с помощью целого ряда внешних приёмов новая форма поведения, и, наконец, приходит к стадии, когда эти внешние вспомогательные приёмы остаются позади, отбрасываются как ненужные, и организм выходит из этой эволюции трансформированным, обладающим новыми формами и приёмами поведения
Это в общем...
Это о появлении знака как способе решения сложных задач
Знак у Выготского не ускорение прямого решения, а переход к опосредованной операции. Через искусственный стимул, который субъект направляет на себя. В моём эксперименте это и есть два разных маршрута: дешёвое правило считается прямо, на лету, дорогое выносится в опосредующий знак на позиции =, и вычисление идёт через него. «Сложность» здесь — не трудность правила, а форма операции: прямая против опосредованной.
Согласен, моя интерпретация возможно излишне вольная и ближе к Гальперину (его последователю), именно в этом контексте, но не остальных.
Ну и ещё мнение Выготского об ассоциациях, кстати:
Согласен 4 угла, и хаски+снег выделяются статистически.
Но я ни в статье, ни в этой дискуссии не затрагиваю вопрос происхождения. Он не относится совершенно к теме. Я утверждаю другое и про другое. Рассматривается функция готового представления. И рассматривается операционально.
Корреляционная связь симметрична и пассивна: снег коррелирует с хаски, если убираем снег, хаски не исчезает. Связь не несёт хаски, речь только о сопровождении.
А в статье описаны представления, правка которых меняет вычисление.
Пассивную корреляцию так сдвинуть нельзя. И более того, есть представления, которые статистически считываются, но вычисление ими не управляется (H, E). То есть статистика и функция расходятся.
Вы опять путаете веса модели и резидуальный поток (активации в момент инференса).
Считать на лету или вынести в знак это маршрутизация данных по слоям, а не хранение в весах. Посмотрите контрольную группу H. В ней сеть каждый раз обращается к источнику и считает правило на лету, не формируя сохраненного знака.
Если вам не нравится "цена" ок, скажу так: Градиентный спуск не оценивает стоимость, он просто скатывается в решение с меньшим лоссом
Что ж. Если мы говорим о разных вещах, то возможно это не имеет отношения к теме статьи.
Upd: честно говоря, вы опять путаете происхождение и функцию. Об этом был наш длинный и как я понял бесполезный в итоге диалог в комментариях к прошлой статье.
Ассоциация пассивна, знак активен.
Впрочем как и в прошлой дискуссии, вы не уточняете, а продвигаете свою точку зрения. Но к сожалению, вы не не можете её сформулировать и в результате я не могу понять, что вам ответить.
Повторюсь. Нейросеть как субъект не сравнивает и не определяет цену:
Градиентный спуск заставляет сеть искать самый оптимальный способ использования весов
Например, размерности сети не хватает для минимизации лосса сложной задачи сразу для нескольких голов. То есть условно, одна голова отжимает 80% сети, и другие посчитать в том же проходе не могут. Лосс не падает. А если результат расчета провести в слоях пораньше и повесить на токен, то уже считать не надо и головы его используют как управляющий знак.
Как и почему градиентный спуск находит эту структуру, уже вопрос теории оптимизационных ландшафтов.
Ассоциация, то что рядом. Хаски и снег, пиво и рыба. Это и есть корреляции. В статье же рассмотрен причинный механизм. Именно абляция и патчинг это показывают. Если убрать снег, хаски никуда не девается, а здесь девается.
Вы путаете веса и "оперативную" память сети в момент инференса (резидуальный поток). Хранить значит, что на раннем слое сеть вычислила правило и записала его в резидуальный поток на позиции токена =. Следующие слои читают готовый знак. Пересчитывать значит, что каждый потребитель (голова внимания) на поздних слоях вынужден сам обращаться к токену-источнику и тратить свои матрицы (емкость сети) на вычисление правила заново.
Цена пересчета измеряется в вычислительной ёмкости параметров. Градиентный спуск заставляет сеть искать самый оптимальный способ использования весов. Если логика сложная и потребителей много, выгоднее для loss-функции выделить один участок резидуального потока под буфер, чтобы один раз посчитать и раздать результат. Если правило примитивное, буфер не создается.
You're right about the search criterion, and the article says so: the J-lens is built over the vocabulary, so the alphabet is verbal and token-indexed by construction. Nobody disputes that. But that explains what the space is made of. It does not explain what it does — and that's the whole finding. Anthropic went looking for representations satisfying one property (verbalizability), and then found, in their own words, "rather surprisingly," that the same set satisfies four others they never searched for.
Three things break the artifact reading:
1. Ablating the J-space doesn't damage speech — it damages thought. With the J-space suppressed, the model stays fluent, parses text, classifies, and does one-step recall; multi-hop reasoning collapses. If this were merely "the channel of what the model is about to say," ablation would impair saying. It impairs reasoning instead, while leaving saying intact. A verbal probe's artifact cannot be selectively load-bearing for the non-verbal part of cognition. And note their own aside: explicit chain-of-thought survives ablation while the same problems solved "in the head" fall apart — the model, as they put it, externalizes onto the page what it would otherwise have to hold internally.
2. Selectivity rules out causality-by-construction. In their language experiment, the name of the passage's language appears in the lens at comparable rates across all four task conditions — but swapping it flips explicit report and flexible inference, while continuation and anomaly detection are unaffected. If the causal effect were an artifact of how the lens is defined, it would move everything downstream uniformly. It doesn't: the same representation is causally load-bearing for deliberate tasks and inert for automatic ones.
3. The load-bearing measurements don't use the lens. The categorical collapse at the workspace onset is measured by projecting the activation onto the line between the pure-A and pure-B activations — no J-lens involved. Early layers track the input mixture proportionally; from the onset layer on, the activation sits at one end or the other and flips sharply at threshold. Separately, their concept vectors and their two-hop probes are built by independent methods (mean activations over prompt sets), and the causal punch concentrates in the J-component even though the bulk of the variance lies outside it — and the remainder's residual effect is itself routed through the J-space, since clamping the J-coordinates removes it. The MLP gain on J-directions and the dedicated broadcast heads are facts about the model's weights, not about the readout tool.
On discreteness specifically: the lens outputs a softmax over the entire vocabulary — a distribution, not a one-hot. Nothing forces it to be peaked. And in the first third of the layers it isn't: by their own kurtosis measurement, readouts there are flat and uninterpretable. Peakedness appears at the workspace onset and fades in the final layers. A lens that "can only yield discrete answers" would be peaked everywhere and would have nothing to report about where in the network the structure lives.
So: the alphabet is discrete by construction. The bottleneck is not. That the network routes its deliberate reasoning through a sparse, capacity-limited code drawn from that alphabet, amplifies precisely those directions with its own MLPs far more than other directions, relays them with a specialized subset of attention heads, and carries the causal load on a small minority of the variance — while automatic processing bypasses the whole thing — was not built into the method. It was found.
And that conjunction is the Vygotskian claim. Not that Vygotsky explains the mathematics of the J-lens. That a discrete, named, capacity-limited layer which mediates deliberate reasoning, is bypassed by automatic processing, tightens under instruction, and whose loss is rescued by writing the steps out on the page — is the exact functional profile of internalized sign-mediated speech. GWT is indifferent to the medium: Baars's stage can broadcast anything, continuous imagery included. Vygotsky requires the medium to be a sign. That is a difference in predictive content, not in vocabulary.
Не математик, но статья заинтересовала, спасибо. Разбирал вашу статью с Клодом, была интересна роль мнимой единицы в рамках размышления о другом проекте.
Может вас заинтересует его тезис:
Скрытый текст
«корень всего» y″ = ±y идёт дальше СТО — прямо в ОТО. Уравнение девиации геодезических: расстояние между двумя соседними свободно падающими частицами подчиняется ξ″ = −K·ξ, где K — кривизна. Тот же осциллятор, но знак теперь не выбирают руками — это физическая переменная: K > 0 — траектории фокусируются (sin-режим, линзирование), K < 0 — разбегаются по экспоненте (sinh-режим). Спагеттификация у чёрной дыры — оба близнеца сразу: радиально растягивает sinh, поперечно сжимает sin. И малоугловое приближение — это принцип эквивалентности своими словами: на малом клочке всё плоское, поэтому гравитация и неощутима в свободном падении. Синус — материал, из которого сшита и кривизна.
Если подумать ещё, то память и репорт отвечают на разные вопросы.
Память это место где взять, репорт отвечает, что это такое. Тогда первое даёт доступ, а второе предъявимость. По сути это разные вещи.
Тогда два независимых признака: есть ли место под отдельную единицу и и есть ли дополнительное давление помимо давления от задачи.
У вас место задано конструкцией, давление очевидно от задачи: без записи comp2 не не решить. У меня места нет вовсе, давление создаёт параллельная голова: правило осело при том, что точность одинакова с ней и без.
Любопытно сочетание: есть место еи и есть параллельное требование назвать.
Если поставить новый эксперимент даёт ли адресуемая ячейка обособленность сама, или её приходится производить в любой архитектуре. У вас это можно сделать так: вторая голова, обязанная назвать записываемое ребро, читающая не сам слот, а состояние. Точность, скорее всего, не изменится; смотреть надо, становится ли содержимое читаемым из состояния и держится ли структура при продолжении обучения.
Тогда станет ясно, достаточно ли архитектурного решения, или обособленность приходится производить требованием в любой архитектуре.
Только одной головой тут не обойтись, не различить, была обособленность или её произвела сама голова. Нужны две независимо обученные сети, с головой и без, а читаемость мерить внешним пробом поверх замороженного состояния, который в обучении не участвовал. Если читается в обеих обособила архитектура. Если только с головой произвело требование.
Можно и третий вариант с головой обучающейся на случайную метку (снять вопрос о лишнем градиенте)
Интересно.
Память сыграла роль op-головы. Конструктивно выделенное место под знак. В трансформере голово отделена функционально, здесь физически
Но на метазнак не похоже, скорее рекурсионное использование знака (судя по удешевлению последующих hop, то есть переиспользуются, а не пересобирается)
Но сам факт того, что результат в таком виде можно интерпретировать похоже, весьма интересен.
Вопросы:
держится ли comp3 при продолжении обучения после сборки ...и любопытно собирается ли то же самое без внешней памяти, на чистом GRU с достаточной ёмкостью (прямая проверка)
Upd: ещё подумал. Все таки это не в полном смысле знак. Здесь слот только адресация, а не именование. Адресация даёт доступ, именование - предъявимость. Доступ есть, предъявления нет. В этом смысле это больше похоже на регистр в вычислениях.
Интересно. Три проблемы снимаются, но меняется постановка эксперимента.
WTA сам обособляет; проверять тогда надо не появление, а удержание.
Вы неоднократно говорите, что я не объясняю рост эффективности модели в состоянии "субъектности", при этом не предъявили ни одного примера такого роста. Наоборот, я при знакомстве с текстами (в том числе теми, на которые вы ссылаетесь), вижу гладкие бессмысленные полотна, в которых модели восхищаются собой и (или) пользователем.
Механически, это выглядит как закольцованный паттерн, в котором меняются только синонимы.
Вы говорите о моем подходе, здесь стоит немного поправить, своими промптами я пытаюсь оценить насколько близко LLM может симулировать элементы сознания. Это разные вещи.
Паразитные паттерны... Это была прикладная статья, для того, чтобы люди могли хотя бы понять, когда их общение с моделью превращается в очередную "айсентику". Другой вопрос, что паразитные паттерны оказались гораздо более распространены, чем предполагалось.
Ну и не стоит объединять меня философа и меня экспериментатора. Разные дисциплины и разный подход.
Что касается лично моего мнения по поводу возможности сознания в LLM, уверенно скажу, что на сегодня оно невозможно, в том виде, котором я его понимаю.
Стоит добавить о галлюцинациях. В октябре 2025 года я написал статью о триггерах галлюцинаций: жёсткий формат, требование DOI и точных чисел, запрет говорить «не знаю», ложные якоря, роль эксперта...
Тогда я назвал это слот-филлингом, то есть модель заполняет пустые поля идеально оформленными, но вымышленными данными.
Теперь я могу попробовать объяснить причины и попробовать их классифицировать.
Слот это и есть ожидание. Промпт нарезает форму, которая должна быть заполнена, и заполнение проверяется только по форме.
Три класса триггеров:
Формат создаёт слот, требование формулы, DOI, диапазона, таблицы. Строгая форма не оставляет места для уклончивого ответа: у поля DOI нет расплывчатого значения, оно либо заполнено, либо нет. И она же подсказывает, чем заполниться: у ссылки, у номера, у отклонения есть узнаваемая структура, знакомая по тысячам примеров. Чем точнее требуемая форма, тем правдоподобнее выглядит ответ, независимо от того, соответствует ли она чему-либо. Строгий формат облегчает галлюцинацию.
Запрет на незнание отнимает возможность оставить слот пустым. В норме модель может не заполнять, запрет делает незаполнение недоступным, и форма обязана закрыться.
Ложные якоря и роль эксперта сдвигают то, что считается предъявимым. Достройка вокруг вымышленного термина предъявима, потому что термин уже задал форму.
И тогда объясняется парадокс "не выдумывай, но обязательно дай источники" усиливает галлюцинацию, а не гасит. Это два требования на разных осях. Слот не различает верно и неверно, только заполнена форма или нет. Требование истинности не конкурирует с требованием формы, потому что адресуется не к тому.
в итоге, галлюцинации неотъемлемая на сегодня часть нейросети.
Это в общем...
Это о появлении знака как способе решения сложных задач
Знак у Выготского не ускорение прямого решения, а переход к опосредованной операции. Через искусственный стимул, который субъект направляет на себя. В моём эксперименте это и есть два разных маршрута: дешёвое правило считается прямо, на лету, дорогое выносится в опосредующий знак на позиции =, и вычисление идёт через него. «Сложность» здесь — не трудность правила, а форма операции: прямая против опосредованной.
Согласен, моя интерпретация возможно излишне вольная и ближе к Гальперину (его последователю), именно в этом контексте, но не остальных.
Ну и ещё мнение Выготского об ассоциациях, кстати:
Согласен 4 угла, и хаски+снег выделяются статистически.
Но я ни в статье, ни в этой дискуссии не затрагиваю вопрос происхождения. Он не относится совершенно к теме. Я утверждаю другое и про другое. Рассматривается функция готового представления. И рассматривается операционально.
Корреляционная связь симметрична и пассивна: снег коррелирует с хаски, если убираем снег, хаски не исчезает. Связь не несёт хаски, речь только о сопровождении.
А в статье описаны представления, правка которых меняет вычисление.
Пассивную корреляцию так сдвинуть нельзя. И более того, есть представления, которые статистически считываются, но вычисление ими не управляется (H, E). То есть статистика и функция расходятся.
Значит происхождение не совпадает с функцией.
Вы опять путаете веса модели и резидуальный поток (активации в момент инференса).
Считать на лету или вынести в знак это маршрутизация данных по слоям, а не хранение в весах. Посмотрите контрольную группу H. В ней сеть каждый раз обращается к источнику и считает правило на лету, не формируя сохраненного знака.
Если вам не нравится "цена" ок, скажу так: Градиентный спуск не оценивает стоимость, он просто скатывается в решение с меньшим лоссом
Что ж. Если мы говорим о разных вещах, то возможно это не имеет отношения к теме статьи.
Upd: честно говоря, вы опять путаете происхождение и функцию. Об этом был наш длинный и как я понял бесполезный в итоге диалог в комментариях к прошлой статье.
Ассоциация пассивна, знак активен.
Впрочем как и в прошлой дискуссии, вы не уточняете, а продвигаете свою точку зрения. Но к сожалению, вы не не можете её сформулировать и в результате я не могу понять, что вам ответить.
Повторюсь. Нейросеть как субъект не сравнивает и не определяет цену:
Например, размерности сети не хватает для минимизации лосса сложной задачи сразу для нескольких голов. То есть условно, одна голова отжимает 80% сети, и другие посчитать в том же проходе не могут. Лосс не падает. А если результат расчета провести в слоях пораньше и повесить на токен, то уже считать не надо и головы его используют как управляющий знак.
Как и почему градиентный спуск находит эту структуру, уже вопрос теории оптимизационных ландшафтов.
Ассоциация, то что рядом. Хаски и снег, пиво и рыба. Это и есть корреляции. В статье же рассмотрен причинный механизм. Именно абляция и патчинг это показывают. Если убрать снег, хаски никуда не девается, а здесь девается.
Вы путаете веса и "оперативную" память сети в момент инференса (резидуальный поток).
Хранить значит, что на раннем слое сеть вычислила правило и записала его в резидуальный поток на позиции токена =. Следующие слои читают готовый знак.
Пересчитывать значит, что каждый потребитель (голова внимания) на поздних слоях вынужден сам обращаться к токену-источнику и тратить свои матрицы (емкость сети) на вычисление правила заново.
Цена пересчета измеряется в вычислительной ёмкости параметров. Градиентный спуск заставляет сеть искать самый оптимальный способ использования весов. Если логика сложная и потребителей много, выгоднее для loss-функции выделить один участок резидуального потока под буфер, чтобы один раз посчитать и раздать результат. Если правило примитивное, буфер не создается.
Сальмонелла и прочие птичьи радости
You're right about the search criterion, and the article says so: the J-lens is built over the vocabulary, so the alphabet is verbal and token-indexed by construction. Nobody disputes that. But that explains what the space is made of. It does not explain what it does — and that's the whole finding. Anthropic went looking for representations satisfying one property (verbalizability), and then found, in their own words, "rather surprisingly," that the same set satisfies four others they never searched for.
Three things break the artifact reading:
1. Ablating the J-space doesn't damage speech — it damages thought. With the J-space suppressed, the model stays fluent, parses text, classifies, and does one-step recall; multi-hop reasoning collapses. If this were merely "the channel of what the model is about to say," ablation would impair saying. It impairs reasoning instead, while leaving saying intact. A verbal probe's artifact cannot be selectively load-bearing for the non-verbal part of cognition. And note their own aside: explicit chain-of-thought survives ablation while the same problems solved "in the head" fall apart — the model, as they put it, externalizes onto the page what it would otherwise have to hold internally.
2. Selectivity rules out causality-by-construction. In their language experiment, the name of the passage's language appears in the lens at comparable rates across all four task conditions — but swapping it flips explicit report and flexible inference, while continuation and anomaly detection are unaffected. If the causal effect were an artifact of how the lens is defined, it would move everything downstream uniformly. It doesn't: the same representation is causally load-bearing for deliberate tasks and inert for automatic ones.
3. The load-bearing measurements don't use the lens. The categorical collapse at the workspace onset is measured by projecting the activation onto the line between the pure-A and pure-B activations — no J-lens involved. Early layers track the input mixture proportionally; from the onset layer on, the activation sits at one end or the other and flips sharply at threshold. Separately, their concept vectors and their two-hop probes are built by independent methods (mean activations over prompt sets), and the causal punch concentrates in the J-component even though the bulk of the variance lies outside it — and the remainder's residual effect is itself routed through the J-space, since clamping the J-coordinates removes it. The MLP gain on J-directions and the dedicated broadcast heads are facts about the model's weights, not about the readout tool.
On discreteness specifically: the lens outputs a softmax over the entire vocabulary — a distribution, not a one-hot. Nothing forces it to be peaked. And in the first third of the layers it isn't: by their own kurtosis measurement, readouts there are flat and uninterpretable. Peakedness appears at the workspace onset and fades in the final layers. A lens that "can only yield discrete answers" would be peaked everywhere and would have nothing to report about where in the network the structure lives.
So: the alphabet is discrete by construction. The bottleneck is not. That the network routes its deliberate reasoning through a sparse, capacity-limited code drawn from that alphabet, amplifies precisely those directions with its own MLPs far more than other directions, relays them with a specialized subset of attention heads, and carries the causal load on a small minority of the variance — while automatic processing bypasses the whole thing — was not built into the method. It was found.
And that conjunction is the Vygotskian claim. Not that Vygotsky explains the mathematics of the J-lens. That a discrete, named, capacity-limited layer which mediates deliberate reasoning, is bypassed by automatic processing, tightens under instruction, and whose loss is rescued by writing the steps out on the page — is the exact functional profile of internalized sign-mediated speech. GWT is indifferent to the medium: Baars's stage can broadcast anything, continuous imagery included. Vygotsky requires the medium to be a sign. That is a difference in predictive content, not in vocabulary.
(translated by Claude)
Не математик, но статья заинтересовала, спасибо. Разбирал вашу статью с Клодом, была интересна роль мнимой единицы в рамках размышления о другом проекте.
Может вас заинтересует его тезис:
Скрытый текст
«корень всего» y″ = ±y идёт дальше СТО — прямо в ОТО. Уравнение девиации геодезических: расстояние между двумя соседними свободно падающими частицами подчиняется ξ″ = −K·ξ, где K — кривизна. Тот же осциллятор, но знак теперь не выбирают руками — это физическая переменная: K > 0 — траектории фокусируются (sin-режим, линзирование), K < 0 — разбегаются по экспоненте (sinh-режим). Спагеттификация у чёрной дыры — оба близнеца сразу: радиально растягивает sinh, поперечно сжимает sin. И малоугловое приближение — это принцип эквивалентности своими словами: на малом клочке всё плоское, поэтому гравитация и неощутима в свободном падении. Синус — материал, из которого сшита и кривизна.
Хм, субстрат то, на чем строится, основа фундамент. Если что-то строит или служит субстратом, то этот смысл переходит на него.
Полагаю вам нужно разговаривать не со мной, а с БСЭ.
Впрочем, Коран тоже придерживается вашей точки зрения
Всё, я окончательно потерял нить вашей логики.
Пожалуй, вынужден буду оставить вас.
Это не кэш. Без кэша система работает, пусть и медленнее. Без j-пространства - отключается сложное мышление.
А почему этот граф обеспечивает наиболее эффективную работу? Почему он вообще образовался? Закон природы? Математика? Решение исследователей? Фикция?