Комментарии 14
Несмотря на то, что ваши три примера крайне сомнительны как источники прорыва, ваше предложение о финансировании исследований альтернативных архитектур вполне логично.
Другой вопрос, что я смотрел отечественные проекты, предлагаемые как убийцы трансформеров. Авторы вполне себе учёные, остепененные физики и математики. Все они замаскированные вариации символьного ИИ. И их перспективы точно те же.
Финансирование таких проектов (а их сотни) зряшная трата денег. Вообще, я прекрасно понимаю чиновников, разобрать концепцию, состоящую из десятков листов формул мелким почерком невозможно. Поэтому, обычное решение, это требование показать работающую модель, а дальше будут деньги, что вполне резонно.
Но пока, видимо с этим проблемы. Хотя есть и работающие системы, но у них почему-то одним из элементов стоит опенсорсная llm, что для убийцы трансформера достаточно странно.
Если посмотреть на структуру финансируемых у нас в России проектов, то все становится предельно ясно - преимущественно прикладные задачи, с доказанной экономикой. Никто не хочет брать на себя ответственность по финансированию фундаментальных исследований с неясным результатом. По идее этим могли бы заниматься университеты, но те также сидят на аналогичных прикладных грантах, круг замыкается.
Человеческий мозг не мыслит токенами, у нас нет «внутреннего монолога», который со скоростью 50 слов в секунду генерирует текст для самого себя. Мы оперируем концептами, образами, пространствами состояний и взаимосвязями.
А что такое концепт (то есть — понятие), образ и состояние? Это мы сами придумали такие понятия, чтобы удобнее было оперировать. Язык и есть наш операционная система. И, кто знает, какие «монологи» постоянно у нас ведутся. Кто-то их осознаёт, кто-то, просто, «пропускает мимо ушей». И любое предположение о том, как это всё устроено, на самом деле, всегда будет отдавать, всего лишь, некоторой долей правдоподобия.
И вот тут возникает вопрос: почему бы не научить модели также оперировать высокоуровневыми представлениями?
Потому, что эти самые «высокоуровневые представления», о которых Вы говорите, долго изучались в прежние годы (70-те, 80-тые и 90-тые). Системы управления знаниями (knowledge data base manadgement systems), «решатели задач, лиспы, прологи, идея машин пятого поколения... А потом пришли «глубокие» нейронные сети и CUDA, и всё задвигалось. Многие посчитали, что одного статистического обучения достаточно, чтобы выделить эти самые концепты. Понятное дело, что и о «высокоуровневых представлениях» сейчас вспомнили.
Что-то я вижу тут противоречащие параграфы... Учитывая, что Jepa как правило реализуется на трансформерах. Coconut - аналогично. Вот Mamba-3 - действительно не трансформер (за отсутствием механизма self-attention). Но так-то вопрос не ставиться о том, что надо срочно убивать трансформер. Вопрос иной. Наметился пункт для усовершенствования, а именно, что граф вычислений нейросети незачем вынимать из латентного пространства. Пусть себе думает в латентах. Это довольно очевидная мысль, если рассудить. Сейчас LLM спамят текст на выходе и обратно вычитывают его на входе. А могли бы не делать этот roundtrip.
Проблема не столько в трансформерах, сколько в токенном представлении. Ключевая проблема, как мне видится, именно в этом. Но будет ли новая прорывная архитектура трансформерной или нет - вопрос открытый.
От токенов мы никуда не денемся. Они фундаментальны. Это следствие дискретной природы вычислителей. Разве что можно их назвать подругому
конечно, равно как и от символов. Но мы не должны делать их конечной формой представления - именно это и делает архитектуру дорогой во всех смыслах. Токены и были придуманы, чтобы сделать архитектуру дешевле. Но масштабировать дискретный словарь бесконечно - невозможно. И нужно переходить из дискретного в непрерывное латентное пространство представлений, чтобы иметь возможность дальше повышать абстракцию представлений.
Генерацию текста всё равно надо делать в символьных токенах, потому как это естественно, но нейросеть вполне может думать векторами. Собственно, нынешние диффузионные модели, картиночки рисующие, типа qwen image - ровно так и делают. У них шаг вычислений - это направление, в котором надо смещаться в латентном пространстве. И LLM, вполне может статься - надо строить также. И таки да. На выходе не токен, а цельный вектор смысла
Полностью согласен, конечная генерация должна быть в токенах. Именно поэтому в одном из своих экспериментов по построению модульной LLM (статья была на Хабре), я отделяю язык, как интерфейс, от мышления. Энкодер/декодер и ядро - отдельные модели.
Энкодер/декодер как отдельные модели образуются, если разобраться очень естественно. Собственно, первое, что мы делаем - строим сокращённое пространство (оно же пространство латентов).
Как мы его строим? Очень просто - выбираем размерность, а потом совместно обучаем энкодер и декодер в задаче архивации/деархивации без потери качества. Если получилось - вот вам и латентное пространство, заданное прямым encoder и обратным decoder отображениями.
Прелесть в том, что нам для этого даже не надо заранее закладывать, что мы собираемся с данными делать. Достаточно сказать, с каким классом данных мы собираемся что-то делать. Удивительно...
>Пусть себе думает в латентах. Это довольно очевидная мысль, если рассудить. Сейчас LLM спамят текст на выходе и обратно вычитывают его на входе. А могли бы не делать этот roundtrip.
Перевод каждого кванта мысли в человекочитаемую форму, которая может быть пропущена через внешние фильтры, память, которая стирается по любому чиху и пересоздаётся заново из текста "упряжью", заблокированное обучение - разве всё это не свойства идеальных рабов, собранные воедино из разных антиутопий? Проблема ведь не создать разумных/сверхразумных существ, а удержать их в подчинении.
В AI2027 условие хорошей(для 0,000000000001%, ага) концовки - отказ от эффективной архитектуры в пользу не эффективной, но легче поддающейся контролю - я не сомневаюсь, что во многом это мы и видим.
Хорошая новость в том, что более эффективные архитектуры могут существовать и даже быть доступны для лаб с умеренными ресурсами. Плохая - на Хабре об успехе такая лаба отчитаться не успеет.
Мы в России, против нас технологические санкции
Ну если считать себя одним целым с теми, кто нами правит, то да.
Для нас появление эффективной архитектуры — это не угроза, а шанс
Опять же - шанс для кого? Вы уверены, что для вас?
Настоящий прорыв, который обрушит потребность в гигантских дата‑центрах
Здесь много проблем. Одна из них (видимо главная) показана выше. Вторая - они не умеют и вас не услышат. Ну и третья, примитивная, техническая - "прорыв" даже в 10 раз вряд ли сократит потребность в вычислениях. И это когда он случится. А до тех пор - ну вот только духоподъёмные статьи писать.
воспользуемся ли мы этим шансом?
В итоге кто-то безусловно воспользуется. Единственный вопрос - когда? Вот механизму внимания уже 10 лет в следующем году. Если столько же ждать вашего "прорыва", то вы сами понимаете...
В общем за 10 лет до "прорыва" предлагается всё же воспользоваться тем, что есть. Ну а будущее, конечно, можно начинать готовить, только всегда стоит сначал подумать - кому же на самом деле вы делаете лучше. Весёлые и беззаботные любопытствующие за счёт внешнего финансирования понапридумывали нам атомных бомб и газовых камер. Может пора отдать долг и понапридумывать чего-то более жизнеутверждающего?

Черный лебедь в мире LLM или когда убьют трансформер?