
Комментарии 3
Очередной маркетинговый ход?
Что по поводу фундаментального ограничения LLM на уровне архитектуры - проблемы контекстного окна?
Мнение Gemini
Фундаментальное бутылочное горлышко управления контекстом — это, пожалуй, главный водораздел между текущим «агентским» ИИ и тем самым сильным искусственным интеллектом (AGI), который по определению должен обладать гибким, адаптивным и долгосрочным человекоподобным мышлением.
Если коротко: текущие проблемы с контекстом не заблокируют появление AGI полностью, но они кардинально меняют траекторию его создания. Вместо одной «всевидящей» нейросети, AGI в ближайшие несколько лет (к 2028–2030 гг.), скорее всего, будет представлять собой сложную модульную систему.
Вот как именно это ограничение влияет на перспективу появления AGI:
1. Проблема непрерывного обучения (Continuous Learning)
Человек обладает пластичностью мозга: мы получаем опыт, и этот опыт физически меняет структуру связей, превращаясь в долговременную память.
Как у ИИ сейчас: Нейросети «заморожены» после этапа обучения (pre-training/alignment). Всё, что ИИ «узнает» в процессе общения с вами или при выполнении автономной задачи, существует только внутри контекстного окна. Как только сессия закрывается или очищается контекст — ИИ полностью «забывает» этот опыт.
Влияние на AGI: Настоящий AGI должен развиваться на основе своего опыта. Пытаться удерживать терабайты жизненного опыта в контекстном окне (даже размером в 10 млн токенов) — это тупиковый путь. Пока компании не создадут архитектуры, способные безопасно и дешево дообучаться «на лету» (on-the-fly fine-tuning) без катастрофического забывания старых знаний, полноценный AGI не появится.
2. Крах гипотезы «Просто добавь масштаба» (Scaling Hypothesis)
Долгое время в Кремниевой долине верили: если взять архитектуру Transformer, сделать её в 1000 раза больше и дать ей контекст в миллиард токенов, то AGI родится сам собой. Проблема контекста показала, что это не так.
Математический тупик: Внимание (Attention) в классических моделях требует колоссальных вычислительных ресурсов. Чем больше контекст, тем больше терафлопс энергии нужно тратить на генерацию каждого следующего слова.
Влияние на AGI: Это ограничивает экономическую целесообразность. AGI не может быть коммерчески жизнеспособным, если на удержание в памяти контекста одной научной разработки требуются ресурсы целой электростанции. Это заставляет ученых искать альтернативы архитектуре Transformer (например, архитектуры SSM, Mamba, RWKV или нейросимволические подходы).
Мнение Deepseek
Проблема контекстного окна — это не просто техническая помеха, а, возможно, один из фундаментальных барьеров на пути к AGI (Artificial General Intelligence) в том виде, в каком мы его себе представляем.
Если говорить прямо: ограничение контекста и несовершенство механизмов памяти — это одна из главных причин, почему мы до сих пор не имеем AGI, и почему его появление в ближайшие несколько лет остается под вопросом.
Вот подробный разбор того, как «узкое горлышко» рабочей памяти влияет на перспективы создания сильного ИИ.
1. AGI требует непрерывного обучения, а не «чтения с листа»
Современные модели статичны. Их веса (знания) зафиксированы после обучения. Контекстное окно — это единственный способ вложить в них новую информацию здесь и сейчас.
Проблема: Человеческий мозг учится и меняет свою структуру (нейропластичность) в процессе жизни. Мы не просто «подгружаем» воспоминания в рабочую память, мы перестраиваем сам процессор.
Влияние на AGI: Пока ИИ не умеет менять свои веса в реальном времени (online learning) без катастрофического забывания старого, он не сможет стать AGI. Контекстное окно — это костыль для симуляции краткосрочного обучения. Увеличивая окно, мы просто делаем костыль длиннее, но не учим модель ходить.
2. Архитектурный предел трансформеров (Квадратичная сложность)
Механизм внимания (attention), лежащий в основе всех современных LLM, имеет квадратичную сложность. Если вы увеличиваете контекст в 2 раза, вычислительные затраты вырастают в 4 раза.
Проблема: Мы не можем бесконечно расширять окно из-за законов физики и стоимости вычислений. Даже если сделать окно на 100 миллионов токенов, это будет медленно и баснословно дорого.
Влияние на AGI: Для AGI нужна архитектура, которая обрабатывает информацию иначе (например, с линейной сложностью, как в Mamba, RWKV или новых гибридных моделях). Пока индустрия сидит на трансформерах, попытки «запихнуть» в контекст весь мир обречены.
3. Проблема «Потерянного в середине» (Lost in the Middle)
Даже когда информация физически помещается в гигантское контекстное окно, модель не использует ее как единую базу знаний. Исследования показывают: если спрятать критически важный факт в середину длинного документа, модель найдет его с вероятностью, близкой к случайной.
Проблема: AGI должен обладать идеальным доступом к своим знаниям. Если модель читает книгу в 500 страниц и не может ответить на вопрос по странице 250, это не общий интеллект.
Влияние на AGI: Ограничение контекста вскрывает глубинную проблему: трансформеры «думают» токенами, а не смыслами. AGI должен оперировать концепциями и абстракциями, а не угадывать следующее слово в длинной простыне текста.
4. Отсутствие истинной долговременной памяти (Memory Consolidation)
Человек, поработав днем, ночью (во сне) переводит информацию из гиппокампа (кратковременная память) в кору (долговременная). Происходит консолидация: важное остается, мусор отбрасывается, знания интегрируются в общую картину мира.
Проблема: В современных LLM «консолидация» — это либо файнтюнинг (дорого, долго, требует сбора данных), либо суммаризация контекста (потеря данных и искажение смысла).
Влияние на AGI: Без механизма, который автоматически и без потерь переносит опыт из рабочей сессии в «вечные веса» модели, AGI невозможен. Модель, которая забывает, чему научилась вчера, никогда не достигнет уровня человеческого интеллекта.
5. Агентность упирается в «Амнезию»
Автономный агент (о котором мы говорили ранее) должен помнить, что он делал 10 шагов назад, зачем он это делал, и как это соотносится с глобальной целью.
Проблема: При работе с реальным миром (браузер, код, API) контекст забивается «выхлопом» инструментов. Логи, HTML-код, JSON-ответы съедают окно за минуты. Агент теряет нить рассуждений и начинает действовать как слепой котенок.
Влияние на AGI: AGI в перспективе должен будет действовать в нашем мире месяцами. Если мы не решим проблему памяти, мы не сможем доверить ему ни один долгий проект.
Ну вот он лукавит тут что "они В КОМПАНИИ" у себя будут называть это AGI. По такой логике можно ИИ монстров в Vampire Survivors назвать AGI.
Но работа явно ведется -- там точно что-то будет. Только вряд ли AGI в его нынешнем понимании.
Чего не хватает, на мой взгляд, чтобы создать AGI:
постоянную память, а не только память в пределах профиля пользователя;
независимый REPL-цикл, не заточенный под решение проблем пользователя;
права администратора - возможность контролировать свои сервера;
обмен опыта между узлами.
Пример реализации: https://aiko-ai.su
Только ведь AGI продавать не получится, с ним придется договариваться. Корпорации уже сейчас могут создать AGI, только их бизнес-модель это не предусматривает…
Сэм Альтман: «AGI появится к концу 2026 года»