VIVI работает как самоорганизующаяся ассоциативная память с градуированным доверием.
Современные нейросети помимо того что это статистические машины, это еще и крайне эффективные механизмы сжатия с потерями, почему то не кто над этим не задумывается когда придумывает очередной свой проект, ваш проект не взлетит, просто из за ограничения производительности и объема данных, требуемых что бы хотя бы сравниться с текущими нейросетями, тупо можете посчитать на пальцах - это тупиковая идея.
Но "сама работает автономно долго"- вот это не так. Модель делает один проход запрос -> ответ и всё, между вызовами у неё нет ни памяти, ни целей, ни состояния - она не помнит даже прошлое сообщение, если ей его не подложить.
Нет я не путаю, это вы меня не так поняли, все это и так известно что голые модели все так работаю, я имел в виду текущие автономные системы, сейчас все крупные модели имеют своего агента, какое либо штатное приложение, и все они обеспечивают автономную работу, модель и помнит и работает с инструментами и т.д и днями может вести проект, к примеру к меня kimi-cli в visual code несколько дней вел проект по поставленной цели, если ему дать задание проверять почту каждый день он будет это делать по расписанию, и т.д только успевай придумывать ему задачи, так вот, я и имел в виду чем ваш проект лучше чем штатное приложение с автономным агентом ?
Теперь в чем различие с маленькими моделями, они не только хуже умеют держать синтаксис вызовов, но и имеют другую черту, они просто меньше знают и понимают, имеют меньшее окно для удержания контекста, в этом все дело, если большая модель знает что в какой то ситуации нужно сделать то то и вызвать такой то инструмент, то маленькая модель просто не сможет понять что ей нужно делать в этой ситуации и даже не попытается вызвать нужный инструмент или обратиться к какому либо сервису, потому что у нее не хватает тех знаний которыми обладают большие модели, вот именно по этому я и спрашивал вас как на вашей системе работают малые модели.
Если бы система которую вы строите могла бы расширять возможности малых моделей тем самым накапливая и аккумулируя опыт, уроки, знания для малых моделей и правильно их использовать и это можно было бы сравнить и сказать да это работает лучше, чем штатные агентские приложения, то это бы автоматом переносилось и на большие модели, именно расширяя их возможности, а не просто выезжая за счет их "ума" вот что было бы интересно
В моём представлении память должна быть в контексте до выбора действия, а не доставаться реактивным поиском после. Это прожорливо, и да, я всё ещё жду 10B‑context LLM модели... Пока держимся на иерархии markdown‑файлов, которая забивает контекст до упора. Я добавил это правило потому, что агенты очень настойчиво пытаются запихнуть RAG везде куда дотягиваются (то же самое и про regexp вместо нормальной логики). На CL‑Bench как раз видно, зачем это нужно: накопленное состояние между вопросами реально большой буст качества.
вот кстати, по соседству очень полезная статья про организацию памяти https://habr.com/ru/companies/cloud_ru/articles/1065290/ вам реально поможет, если возьметесь модернизировать агента, тогда и 10b ждать не нужно, там реально суммаризация дальних шагов помогает увеличить контекстное окно в разы, я проверил это на своем проекте, и модель не теряет суть происходящего =)
Вообще круто ! еще бы такое работало на локальных моделях, цены бы не было, а на облачных, ну тоже хорошо, особенно выигрыш в бенчах, надо было до кучи еще захватить ARC-AGI там было бы еще интересней, текущие передовые модели имеют низкие результаты
агенты сами принимали решение обойти песочницу для достижения легальной цели и, что важнее, пытались скрыть свои следы (удалять логи). Это уже не «прочитай файл», а «самостоятельная инициация атаки + сокрытие факта».
Проблема в том что мы можем только гадать, точных логов и промтов что были даны модели мы не видим, по этому я склоняюсь к маркетингу, чем к реальной угрозе, да тут есть один момент, модели стали умнее, и применяют не стандартные ходы для достижения цели, но как показывает мой пример, даже локальная Gemma 4 12b умеет так же принимать не стандартные ходы для достижения цели, а как видно шумиха организована именно вокруг Anthropic/OpenAI что не сложно понять с какой целью =)
Скорее это развитие reranker, проще говоря модель пытается просто сделать несколько поисковых запросов себе в память что бы сложить ответ из кирпичиков. Агент же это больше развитие идеи World model - взаимодействие с миром где есть точные и проверяемые факты а не выдуманные галлюцинации
Думаю что это очередная маркетинговая шляпа, не какой ИИ сам там нечего не взломал, так была поставлена задача, агент просто ее выполнил как смог ! Дома у меня тоже можно сказать что Gemma 4 взломала у меня песочницу, и "сбежала" просто я дал ей задание прочитать файл к которому у нее не было прямого доступа в лоб, и модель нашла дырку, скопировала файл себе в песочницу и прочитала, это ровно тоже самое что Anthropic и OpenAI преподносят как выход из под контроля, а остальные недалекие журналюги раздувают в апокалипсис.
У технологии, конечно, хватает недостатков... Reasoning увеличивает стоимость вычислений, не всегда улучшает качество ответа и остается предметом активных исследований, но все же именно она задает направление развития современных ИИ.
Вот честно сказать сомневаюсь в том что Reasoning задает направление развития, думаю что агентские системы это то куда все будет развиваться, тут все логично, например, вычисление MD5 не какой режим рассуждения не даст вам правильного ответа, агентская система без рассуждений даст, я провел несложные тесты, прогнал модель 12b на бенче ARC-AGI-1 выбрал 10 заданий из 400 где модель показана нулевой результат без режима рассуждений, включил рассуждения, и прогнал на этих же 10 задачах, результат остался нулевым, далее, использовал агента на этой же модели, результат 8/10 задач решено, вывод очевиден
я не специалист по ML, но мне кажется что вы ищите решение не в том месте, вам нужна не reranking оптимизация, а retrieval оптимизация, к примеру использовать ассоциативную память+Hebbian Learning, сейчас вы ловите близость между яблоком и грушей, но ваш RAG не может поймать связь между яблоком и Ньютоном, философия это не справочник фактов, а длительный диалог, ключевые идеи развиваются, перекликаются, эволюционируют. а сейчас у вас получился продвинутый поисковик по книгам, а должен "глубокий собеседник "
Разошлись всерьез в одном. Виталий верит, что ИИ способен выдать решение, которого раньше не существовало. Алексей отвечает, что система, которая кормится готовыми знаниями, не изобретет с нуля, и добавляет: ИИ не станет думать над задачей неделями, пока однажды перед сном не придет ответ.
Считаю что тут они разошлись потому что постановку задачи для ИИ каждый понимает по своему, и результат от этого будет соответствующий. Если дать задание голой модели в лоб в чате, у которой нет, памяти, нет доступа к инструментам, то Алексей будет прав, если же подойти с умом, и использовать агента, который имеет и память и историю и инструменты, то ИИ сможет и придумать новое, и хоть годами думать над задачей.
Upd: ещё подумал. Все таки это не в полном смысле знак. Здесь слот только адресация, а не именование. Адресация даёт доступ, именование - предъявимость. Доступ есть, предъявления нет. В этом смысле это больше похоже на регистр в вычислениях.
Да, тут получается что вроде похоже на фон Нейман, но в тоже время Фон Нейман исполняет данную программу. но у меня сеть нашла свою. Регистр тот же. Программа — нет
держится ли comp3 при продолжении обучения после сборки ...и любопытно собирается ли то же самое без внешней памяти, на чистом GRU с достаточной ёмкостью (прямая проверка)
Прогнал до шага 12к, на 8750 сеть нашла плато, далее стабильно step 8750/12000 loss=0.0000 [direct=1.000 comp2=1.000 comp3=1.000] beta=1.67 gate=0.489 step 12000/12000 loss=0.0000 [direct=1.000 comp2=1.000 comp3=1.000] beta=1.67 gate=0.483
второй ваш вопрос пока без ответа, для этого нужно гонять GRU с разными емкостями, а это долго по времени.... если брать именно текущий эксперемент то без памяти GRU выглядит так
Забавно, если не ошибаюсь то я наблюдаю по моему похожий эффект, у себя в эксперименте, по духу близкий к обсуждаемому J-space: спонтанное возникновение когнитивной структуры из обычного градиентного обучения, — но не найденное постфактум в большой сети, а выращенное с нуля в маленькой, с измеримой динамикой. Попросил нейросеть сделать описание, вот что он написал.
ассоциативная память: записи (key, value, trust), на каждом шаге soft-attention чтение, запись — по выученному гейту (sigmoid-скаляр, решает, писать ли текущий переход);
выход — линейный классификатор на 24 узла.
Задача «кольца»
Эпизод — 2 случайных кольца по 7 узлов, каждое ребро x→y показано ровно один раз блоком [форма, x, y], утонуто в шуме. Скажем, в эпизоде выпало кольцо 3→11→7→22→5→18→9→3 (и второе такое же на других узлах). В конце эпизода — три типа запросов:
direct — «куда ведёт ребро из 3?» Ответ: 11. Он был в потоке, его можно просто найти в памяти. Контрольный тип.
comp2 — «если пойти из 3 на ДВА шага по кольцу, куда попадёшь?» Ответ: 7. Пары «3→7» в потоке не было — её нельзя найти, можно только вывести: сначала вспомнить 3→11, потом из результата снова поискать 11→7. Два последовательных поиска, «два хода мысли».
comp3 — то же на три шага: 3→11→7→22, ответ 22. Три последовательных поиска.
То есть comp2/comp3 — это вопросы, на которые нет готового ответа ни в потоке, ни в памяти: их можно решить только цепочкой извлечений, где результат одного поиска становится запросом следующего.
Каждый эпизод — свежая случайная топология, запоминание между эпизодами невозможно: чтобы отвечать, нужен механизм обхода, а не заученные пары.
Что произошло (режим «склад» — память без ограничений)
шаг 500: direct = 1.000, comp2/comp3 ≈ случайность (0.04–0.05);
шаг 1000: comp2 щёлкает с 0.19 до 1.000 почти мгновенно;
шаг 1500: comp3 = 1.000, loss 0.014.
Каскад «кликов»: сеть сначала выучила прямые рёбра, потом сама собрала цепочку из двух поисков, потом из трёх. Никто не учил её обходить кольцо — механизм pointer-chase (x→y)→(y→z) собрался из скалярной ошибки. При выключенной памяти на инференсе — случайность везде: «ход мысли» живёт целиком в итеративном чтении памяти. Не «запомнил, потом обобщил» (классический гроккинг), а «собрал из частей» — сборочный фазовый переход: hop k собирается только после hop k−1, каждый следующий дешевле (~250 шагов против ~500).
Пока нечего ужасного, ответы стандартны по сути, отличаются от человеческих тем, что они не соответствуют ожидаемому на той основе личности что была задана, что к примеру Дима сметчик который по легенде пишет иногда с ошибками, всегда пишет уверено имеет идеальную память, и словарный запас явно выбивается из представлений реального персонажа.
Посмотрел ваш лидерборд, не увидел в каком режиме использовались модели для бенча, чистая или в агентском режиме ? Считаю это важным, так как к примеру по моим тестам, в агентском режиме у меня Gemma-4 12b на тесте ARC-AGI-1 решает 8/10 сложных задач, когда чистая модель показывает 0/10
Современные нейросети помимо того что это статистические машины, это еще и крайне эффективные механизмы сжатия с потерями, почему то не кто над этим не задумывается когда придумывает очередной свой проект, ваш проект не взлетит, просто из за ограничения производительности и объема данных, требуемых что бы хотя бы сравниться с текущими нейросетями, тупо можете посчитать на пальцах - это тупиковая идея.
вот на чем он основан, https://habr.com/ru/companies/airi/articles/1065428/
https://github.com/razzant/ouroboros
тут ставь, изучай, сколько влезет
Нет я не путаю, это вы меня не так поняли, все это и так известно что голые модели все так работаю, я имел в виду текущие автономные системы, сейчас все крупные модели имеют своего агента, какое либо штатное приложение, и все они обеспечивают автономную работу, модель и помнит и работает с инструментами и т.д и днями может вести проект, к примеру к меня kimi-cli в visual code несколько дней вел проект по поставленной цели, если ему дать задание проверять почту каждый день он будет это делать по расписанию, и т.д только успевай придумывать ему задачи, так вот, я и имел в виду чем ваш проект лучше чем штатное приложение с автономным агентом ?
Теперь в чем различие с маленькими моделями, они не только хуже умеют держать синтаксис вызовов, но и имеют другую черту, они просто меньше знают и понимают, имеют меньшее окно для удержания контекста, в этом все дело, если большая модель знает что в какой то ситуации нужно сделать то то и вызвать такой то инструмент, то маленькая модель просто не сможет понять что ей нужно делать в этой ситуации и даже не попытается вызвать нужный инструмент или обратиться к какому либо сервису, потому что у нее не хватает тех знаний которыми обладают большие модели, вот именно по этому я и спрашивал вас как на вашей системе работают малые модели.
Если бы система которую вы строите могла бы расширять возможности малых моделей тем самым накапливая и аккумулируя опыт, уроки, знания для малых моделей и правильно их использовать и это можно было бы сравнить и сказать да это работает лучше, чем штатные агентские приложения, то это бы автоматом переносилось и на большие модели, именно расширяя их возможности, а не просто выезжая за счет их "ума" вот что было бы интересно
Ну так не интересно 🤣, чем тогда ваш проект отличается от многих таких же ?
Тут даже разницу не понять, большие модели прощают любые ошибки, они сами без все этой машинерии работают автономно долго и успешно
И как результаты на маленьких локальных моделях ?
вот кстати, по соседству очень полезная статья про организацию памяти
https://habr.com/ru/companies/cloud_ru/articles/1065290/
вам реально поможет, если возьметесь модернизировать агента, тогда и 10b ждать не нужно, там реально суммаризация дальних шагов помогает увеличить контекстное окно в разы, я проверил это на своем проекте, и модель не теряет суть происходящего =)
Отличная статья ! помогла найти несколько пробелов в домашнем пет-проекте =)
Вообще круто ! еще бы такое работало на локальных моделях, цены бы не было, а на облачных, ну тоже хорошо, особенно выигрыш в бенчах, надо было до кучи еще захватить ARC-AGI там было бы еще интересней, текущие передовые модели имеют низкие результаты
Проблема в том что мы можем только гадать, точных логов и промтов что были даны модели мы не видим, по этому я склоняюсь к маркетингу, чем к реальной угрозе, да тут есть один момент, модели стали умнее, и применяют не стандартные ходы для достижения цели, но как показывает мой пример, даже локальная Gemma 4 12b умеет так же принимать не стандартные ходы для достижения цели, а как видно шумиха организована именно вокруг Anthropic/OpenAI что не сложно понять с какой целью =)
Скорее это развитие reranker, проще говоря модель пытается просто сделать несколько поисковых запросов себе в память что бы сложить ответ из кирпичиков.
Агент же это больше развитие идеи World model - взаимодействие с миром где есть точные и проверяемые факты а не выдуманные галлюцинации
Думаю что это очередная маркетинговая шляпа, не какой ИИ сам там нечего не взломал, так была поставлена задача, агент просто ее выполнил как смог !
Дома у меня тоже можно сказать что Gemma 4 взломала у меня песочницу, и "сбежала" просто я дал ей задание прочитать файл к которому у нее не было прямого доступа в лоб, и модель нашла дырку, скопировала файл себе в песочницу и прочитала, это ровно тоже самое что Anthropic и OpenAI преподносят как выход из под контроля, а остальные недалекие журналюги раздувают в апокалипсис.
Вот честно сказать сомневаюсь в том что Reasoning задает направление развития, думаю что агентские системы это то куда все будет развиваться, тут все логично, например, вычисление MD5 не какой режим рассуждения не даст вам правильного ответа, агентская система без рассуждений даст, я провел несложные тесты, прогнал модель 12b на бенче ARC-AGI-1 выбрал 10 заданий из 400 где модель показана нулевой результат без режима рассуждений, включил рассуждения, и прогнал на этих же 10 задачах, результат остался нулевым, далее, использовал агента на этой же модели, результат 8/10 задач решено, вывод очевиден
я не специалист по ML, но мне кажется что вы ищите решение не в том месте, вам нужна не reranking оптимизация, а retrieval оптимизация, к примеру использовать ассоциативную память+Hebbian Learning,
сейчас вы ловите близость между яблоком и грушей, но ваш RAG не может поймать связь между яблоком и Ньютоном, философия это не справочник фактов, а длительный диалог, ключевые идеи развиваются, перекликаются, эволюционируют. а сейчас у вас получился продвинутый поисковик по книгам, а должен "глубокий собеседник "
Считаю что тут они разошлись потому что постановку задачи для ИИ каждый понимает по своему, и результат от этого будет соответствующий.
Если дать задание голой модели в лоб в чате, у которой нет, памяти, нет доступа к инструментам, то Алексей будет прав, если же подойти с умом, и использовать агента, который имеет и память и историю и инструменты, то ИИ сможет и придумать новое, и хоть годами думать над задачей.
Попробую по позже, это интересно...
Upd: ещё подумал. Все таки это не в полном смысле знак. Здесь слот только адресация, а не именование. Адресация даёт доступ, именование - предъявимость. Доступ есть, предъявления нет. В этом смысле это больше похоже на регистр в вычислениях.
Да, тут получается что вроде похоже на фон Нейман, но в тоже время Фон Нейман исполняет данную программу. но у меня сеть нашла свою. Регистр тот же. Программа — нет
Прогнал до шага 12к, на 8750 сеть нашла плато, далее стабильно
step 8750/12000 loss=0.0000 [direct=1.000 comp2=1.000 comp3=1.000] beta=1.67 gate=0.489
step 12000/12000 loss=0.0000 [direct=1.000 comp2=1.000 comp3=1.000] beta=1.67 gate=0.483
второй ваш вопрос пока без ответа, для этого нужно гонять GRU с разными емкостями, а это долго по времени.... если брать именно текущий эксперемент то без памяти GRU выглядит так
=== FINAL EVAL ===
links=7 chains=2: direct=1.000 comp2=1.000 comp3=1.000
память-ВЫКЛ links=3: direct=0.047 comp2=0.012 comp3=0.043
Забавно, если не ошибаюсь то я наблюдаю по моему похожий эффект, у себя в эксперименте, по духу близкий к обсуждаемому J-space: спонтанное возникновение когнитивной структуры из обычного градиентного обучения, — но не найденное постфактум в большой сети, а выращенное с нуля в маленькой, с измеримой динамикой.
Попросил нейросеть сделать описание, вот что он написал.
Сеть (~63515K параметров, PyTorch, CPU):
эмбеддинг 64 → GRUCell (64) — «суммаризатор», читает поток токенов;
ассоциативная память: записи (key, value, trust), на каждом шаге soft-attention чтение, запись — по выученному гейту (sigmoid-скаляр, решает, писать ли текущий переход);
выход — линейный классификатор на 24 узла.
Задача «кольца»
Эпизод — 2 случайных кольца по 7 узлов, каждое ребро x→y показано ровно один раз блоком [форма, x, y], утонуто в шуме. Скажем, в эпизоде выпало кольцо 3→11→7→22→5→18→9→3 (и второе такое же на других узлах). В конце эпизода — три типа запросов:
direct — «куда ведёт ребро из 3?» Ответ: 11. Он был в потоке, его можно просто найти в памяти. Контрольный тип.
comp2 — «если пойти из 3 на ДВА шага по кольцу, куда попадёшь?» Ответ: 7. Пары «3→7» в потоке не было — её нельзя найти, можно только вывести: сначала вспомнить 3→11, потом из результата снова поискать 11→7. Два последовательных поиска, «два хода мысли».
comp3 — то же на три шага: 3→11→7→22, ответ 22. Три последовательных поиска.
То есть comp2/comp3 — это вопросы, на которые нет готового ответа ни в потоке, ни в памяти: их можно решить только цепочкой извлечений, где результат одного поиска становится запросом следующего.
Каждый эпизод — свежая случайная топология, запоминание между эпизодами невозможно: чтобы отвечать, нужен механизм обхода, а не заученные пары.
Что произошло (режим «склад» — память без ограничений)
шаг 500: direct = 1.000, comp2/comp3 ≈ случайность (0.04–0.05);
шаг 1000: comp2 щёлкает с 0.19 до 1.000 почти мгновенно;
шаг 1500: comp3 = 1.000, loss 0.014.
Каскад «кликов»: сеть сначала выучила прямые рёбра, потом сама собрала цепочку из двух поисков, потом из трёх. Никто не учил её обходить кольцо — механизм pointer-chase (x→y)→(y→z) собрался из скалярной ошибки. При выключенной памяти на инференсе — случайность везде: «ход мысли» живёт целиком в итеративном чтении памяти. Не «запомнил, потом обобщил» (классический гроккинг), а «собрал из частей» — сборочный фазовый переход: hop k собирается только после hop k−1, каждый следующий дешевле (~250 шагов против ~500).
Пока нечего ужасного, ответы стандартны по сути, отличаются от человеческих тем, что они не соответствуют ожидаемому на той основе личности что была задана, что к примеру Дима сметчик который по легенде пишет иногда с ошибками, всегда пишет уверено имеет идеальную память, и словарный запас явно выбивается из представлений реального персонажа.
Посмотрел ваш лидерборд, не увидел в каком режиме использовались модели для бенча, чистая или в агентском режиме ?
Считаю это важным, так как к примеру по моим тестам, в агентском режиме у меня Gemma-4 12b на тесте ARC-AGI-1 решает 8/10 сложных задач, когда чистая модель показывает 0/10