Комментарии 30
Удивительный случай. Обычно, когда автор получает рецензию от LLM, приходится ее заставлять критиковать и искать слабые места. У вас же наоборот....
И второе, вашу концепцию вполне реально проверить на микросетях на домашнем компьютере.... Если ускорите обучение, повысите точность и прозрачность, то это будет убедительнее любой статьи
В общем - да, только LLM и корпоративный ИИ на разных принципах обучаются. LLM - в большей степени исследовательская модель, насколько понимаю. Мой бизнес это теоретическая физика и управленческий консалтинг, научные публикации, а не патенты. Публикации на Хабре не защищают авторские права, это другое. Хотя, и не менее важное.
Проверка заняла бы не так уж много времени.... С LLM меньше одной недели по вечерам... Например так:
Размер: 4 слоя, d_model = 256 или 512 (~20-50 млн параметров). Геометрия: Матрицы инициализируются в гиперболическом пространстве
Слои Attention: Заменены на блочно-циркулянтные проекции
Loss-функция: Включает классический Cross-Entropy + топологический регуляризатор на основе ρ , который следит за тем, чтобы число обусловленности v не коллапсировало
Проблемы решать по мере возникновения... Итерационно. Сравнивать с классическим трансформером того же размера.
Должна быть структура солитона в гиперболическом пространстве (u,v). Измерения (u,v) должны быть связаны. Тогда это будет честным учётом структуры в задаче оптимизации.
Ага, то есть уже есть хоть какие-то инженерные требования, тогда:
Через архитектуру (Явная параметризация), не обучаем матрицы весов напрямую. Делаем u и v базовыми обучаемыми параметрами сети и жестко связываем их вашим уравнением. А сами матрицы Attention математически разворачиваем из них на каждом шаге. Так сеть физически не сможет разорвать эту сцепку.
Через функцию потерь (Солитонный инвариант),не штрафуем параметры по отдельности, а прописываем уравнение жесткой связи u и v в Loss-функцию как физический инвариант. Оптимизатор будет получать огромный штраф за любую попытку сойти с гиперболической траектории солитона.
Через кастомный оптимизатор Стандартный Adam разорвет вашу связь, поэтому берем симплектический оптимизатор (или оптимизатор для римановых многообразий). Он пересчитывает веса так, чтобы шаг обучения скользил строго по заданной гиперболической поверхности, не нарушая баланс дисперсии и нелинейности.
любой из этих вариантов можно собрать на PyTorch за выходные и проверить теорию на практике.
Супер! Вы понимаете больше меня в этих делах. Мне кажется, варианты 1 и 3 перспективны и есть новизна.
Я бы посоветовал вам попробовать. Желательно использовать как помощников Claude Opus и Geminin 3.1 pro на Ai-studio (в официальном приложении она существенно тупее). Перекрестная проверка и брейн-шторминг резко ускоряет процесс.
Конечно может и не получиться, но это не отвергает теорию, всегда есть шанс, что требуется принципиально иная архитектура. Но вероятность такого исхода я оцениваю как низкую.
К Вашему варианту 1, в качестве возможного усиления. Инициализация и явная параметризация — это две стороны одной медали. Стандартные методы (Glorot, He) неявно приводят к тому, что v ≈ 1 и u ≈ 0. Сделаем это явным: объявить u и v обучаемыми параметрами и жестко связать их через гиперболическое уравнение.
Ещё бы попробовал ограничение снизу по модулю лямбда минимального для циркулянтных матриц - где-то в районе 0.25, отсекая пуассоновский шум.
Если жёстко связать (u,v) тождеством, оптимизатор увидит одну степень свободы вместо двух. Градиенты могут просто обнулиться, и структура зафиксируется. Может лучше использовать штраф в лоссе.
Здраво, но 0.25 это хардкод, в будущем стоит сделать его относительным.
Сначала стоит проверить самый минимум, обычный Adam + мягкий штраф солитона в лосс. Есть гроккинг - идея работает, можно накручивать остальное. Нет гроккинга, где-то ошиблись.
И моё мнение, чтобы доказать вашу теорию, мерить нужно не точность (accuracy), а появление новой степени свободы. Ваша идея про самоорганизующуюся критичность предсказывает появление дополнительного измерения. Значит, метрикой успеха должно быть увеличение эффективной размерности представлений под вашим топологическим давлением по сравнению с обычным трансформером.
Ваша статья удивительным образом концептуально пересеклась с моим проектом, поэтому и заинтересовался.
Ваш вариант метрики (разделение переменных) - это следствие, мой вариант (внутренняя структура, солитон) - это причина. Суть одна.
суть одна, согласен. Но это не причина и следствие, а структура и её единственное измеримое следствие. причём проверить можно только его, поэтому метрика не вторична. Пока не представляю, как измерить объективно кривизну. Метрика как отклонение от евклидовой геометрии представления, хм... Ну ваше право.
но 0.25 это хардкод ...
Не совсем так. Есть математическая база для циркулянтных матриц больших размерностях (Bose, Hazra и Saha). Кроме хардкода не существует других способов избавиться от пуассоновского шума.
Если для понимания требуется строить модель - ИИ сольётся. С тем же успехом можно у тумбочки спросить.
Либо ИИ прав, либо эти идеи выше моего понимания))
Понимаю, иначе статья не попала бы в Q1. Может LLM поможет? Даст варианты понимания с учётом Ваших профессиональных интересов, если загрузить текст этой статьи?
Еще раз попробовал вникнуть. Спросил мнение у chat gpt pro. И он ее не отмел. Разобрал плюсы, минусы, все достаточно обоснованно. Вот его сжатое мнение:
Статья выглядит как смелая и потенциально полезная математическая гипотеза, но не как доказательство физического нарушения причинности. Наиболее продуктивно читать её как предложение циклической, нелокальной по времени схемы самосогласования, а выражение violation of causality — пока как сильную интерпретацию этой схемы.
Как я понимаю, на основе некоторых предположений, предлагается улучшить оптимизаторы ML. Полностью согласен с @Kamil_GR - надо просто брать и проверять. Сейчас эти идеи довольно легко проверяются в домашних условиях. Даже простая LLM вполне себе создается на RTX 3090/4090/5090.
ллм не нужно... достаточно микротрансформера, математика должна работать на всех масштабах. У меня вообще древняя шести гигабайтная gforce справляется.
Да, конечно, это не доказательство физического нарушения причинности. Только в окрестности самоорганизации, когда почва уходит из под ног, появляется дополнительная степень свободы. В процессе обучения в нейросети возникает самоорганизация.
Я пошел еще дальше (интересно же) и загнал полную проверку в Kimi, вот результат который он получил не на словах
Всё, картина закрыта со всех сторон. Комбинация со «взрослым» регуляризатором дала последний, самый неожиданный результат. Итоговая таблица дня:
Финальная сводка эксперимента (задача (a+b) mod 24, циркулянтные слои, 30 000 шагов)
Train acc Test acc Гроккинг Эфф. размерность
Обычный Adam 1.0000. 14–0.27 нет 13–26
Adam + солитонный штраф (λ=10)1.000 0.18 (насыщение) нет 22
Adam + weight decay (контроль)1.000 1.000 да, шаг ~1100 8.2
Weight decay + солитонный штраф 0.083 0.038 коллапс 4.8
Постановка валидна. Weight decay даёт чистейший гроккинг на 1100-м шаге — задача, архитектура и бюджет обучения способны породить эффект самоорганизации. «Окрестность самоорганизации» здесь достижима, и мы знаем, как она выглядит: эффективная размерность падает до 8 (сеть находит низкоразмерное структурированное решение — это и есть гроккинг).
Солитонный штраф не воспроизводит этот эффект даже за 30 000 шагов — в 27 раз дольше, чем нужно контролю. Test‑точность насыщается на 0.18. Притом штраф исправно загоняет (u,v) в точку (0,1) — то есть «прибор» показывает идеальное «солитонное состояние», а обобщения не происходит. Связь между (u,v) и обучаемостью не обнаружена там, где она должна была проявиться ярче всего.
Хуже того: штраф несовместим с рабочим механизмом. Добавленный к weight decay, он разрушает обучение полностью (train acc = 0.083, уровень случайного угадывания) — «топологическое давление» блокирует тот самый путь к самоорганизации, который теория обещала открыть.
Косвенное наблюдение: реальный гроккинг сопровождается сжатием эффективной размерности (8.2), тогда как в комментариях предсказывался её рост как метрика успеха. Предсказание теории противоположно наблюдаемому.
Вердикт
После сегодняшнего: теория проверена в самой благоприятной для неё постановке — на её родном математическом объекте (циркулянты), на её родной циклической задаче, по протоколу, предложенному её сторонником в комментариях, с критериями успеха, которые он же и сформулировал. Результат отрицательный по всем критериям, при положительном контроле. Оговорка Kamil_GR «может, нужна принципиально иная архитектура» формально не опровергаема никогда — но научный долг автора теперь не в новых формулировках, а в демонстрации хотя бы одной постановки, где штраф работает лучше weight decay.
Отлично. Допущения неверны. В таких случаях не надо опускать руки, а оценить их и сформулировать новые гипотезы. Например, дополнительное измерение проявляется не как увеличение размерности, а сжатие к к ортогональной оси. В этом случае общая размерность падает, но растет целевая ось. И лосс гнал к фиксированной точке.
Сомнения в правильности теории растут. К сожалению, разбираться дальше пока нет времени.
Закончу свой проект, возможно вернусь.
Но я бы предположил, что мешает Адам. Нужен другой оптимизатор.
Заплатил бы 100 т.р. за публикацию на Хабре с инженерной реализацией. Самоорганизованная критичность нейросети - это факт.
Принял к сведению. Да и самому интересно...
Один вопрос.... А дискретность солитона рассматриваете? Есть одна мысль
Да, с sgd интересно было бы посмотреть, Адам довольно агресивный оптимизатор...
Неясно выглядит статья в "философских" выводах, как по мне ("математику" не трогаю). И слишком много недоказанных постулатов, тяготеющих к громкости в ущерб точности.
И он оказался прав
Прямого ответа, почему ИИ "оказался прав" нет. Возможно, потому, что заглавие немного хайповое.
Ключевая проблема не в том, что ИИ «глупый». Проблема в том, что он обучен на другой парадигме.
И в том, что "глупый" в контексте "современный ИИ, основанный на LLM, перебирает известное" - тоже. Он ценность истинно нового не сможет распознать.
бэконовское «знание — сила» уходит в историю
Идёт подмена того, что имел в виду Бэкон. Он говорил про проверенное понимание причин и закономерностей, а ту всё сводится к "информация - сила".
академические бенчмарки всё чаще не отражают условия реального мира
И
академическая наука теряет свою исключительную роль
Не равны друг другу. А в статье это приравнивается.
В эпоху всеобщей доступности к ИИ и нестабильного внешнего окружения - предсказание равно шарлатанству
Не равно. К разному ИИ есть доступ у разных людей. Не зря его ограничивают. И важно, как ставить вопросы. Есть и другие факторы. Кто ими лучше владеет, тот точнее в предсказаниях.
Модель ИИ сегодня – это инструмент для 5% когнитивной элиты по выявлению слабоформализованных (неявных) знаний. "
Постулирование без доказательства.
В этой новой парадигме центр тяжести управления смещается: от стратегических высот к уровню среднего звена. В эпоху общедоступного ИИ миддлы оказываются в самом эпицентре кризиса — и в самом центре возможностей.
Постулирование без доказательства.
Пока западные философы горели над вопросом – почему бог не уничтожил дьявола в евклидовом пространстве, восточная философия созерцала природную дихотомию Инь-Ян
Очень вольная интерпретация и теодицеи в западном понимании, и восточного подхода.


Корпоративный ИИ за $10 млн отмел статью Q1. И он оказался прав — но не так, как он думал