Обновить
61
Илья@proxy3d

нейробиология, нейронные сети, AR/VR

0,4
Рейтинг
25
Подписчики
Отправить сообщение

Это ладно. Она легко ломает уже рабочий код. Недавно решил задокументировать его, попросив написать к нему комментарии, описать параметры, что делает класс. Потом смотрю, класс перестал работать. Потратил кучу времени, на то, чтобы сопоставить что она сделала. Оказалось, что она внесла в код небольшие изменения сама (просил только комментарии) и все перестало работать, логика сломалась. А ещё может переименовывать переменные и объединить что то и все, ищи потом ошибку.

Это касается сложного кода. Хотя даже из простого может выкинуть что то, упростив код.

Плюс, заметил, что сетки не вникают в код, если рядом комментарий. Пофиг, что он старый и уже не отражает логику. Например, есть тензор [batch, num, hidden_dim, seq_len]. В коде в прежней строке мы к нему приводим. Но остался старый комментарий, что тут # [batch, dim, seq_len]. И сетке пофиг на логику, она считает что информация из комментария важнее и строит логику на этом.

Поэтому с ними надо аккуратнее. Пока они очень тупые. И не могут держать разные контексты (логика кода и комментарии например) и переключаться между ними.

Я выложил полностью новый механизм обучения.

Вы можете посмотреть его в папке backward

https://t.me/greenruff/2257

Он применим к любой архитектуре. Там есть все, от примера выше до реализации обучения по блокам глобальной ошибке с учётом обучения локальной ошибке

Граф памяти и слои = нейронные сети мозга:

В реальном мозге нет разделения на графы памяти в виде чётких слоёв. Ассоциативные зоны не являются базовым слоем памяти. Память распределена сложнее: участвуют кора, гиппокамп, миндалины и многие другие структуры. И связь между ними — это не просто "слоистый граф", а динамическая сеть с параллельными и перекрёстными путями, обратной связью. модуляциями.

Один нейрон = один элемент памяти ("нейрон бабушки")

Концепция «нейрона бабушки» — это уже давно опровергнутая гипотеза. рекомендую посмотреть лекции Роберта Сапольского, где где то с 15-23 лекцию рассказывается об истории бабушкиного нейрона. Память распределённая, иначе потеря одного нейрона стирала бы целую память.

Перемещение активности по графу

Вы упростили это понятие до примитивизации. Передача сигнала включают обратные связи, модуляцию, торможение и нейромодуляторы, ритмы.

Вы ввели КУ1, КУ2 — время воздействия/пропускная способность

В реальности время передачи между нейронами фиксировано и зависит от типа нейрона, а не от "суммарного времени воздействия".

Типы элементов — типы нейронов

Да, в ассоциативных зонах есть разные типы нейронов, но их классификация сложнее — интенсификаторы, модуляторы, тормозные клетки и так далее.

Про пирамидальные нейроны - это всего лишь один тип нейронов, и во многих областях их может не быть совсем или очень мало. Их задача связать соседние колонки или дальние колонки (другие области). В тех же ассоциативных областях есть звездчатые нейроны. А кроме ассоциативных областей, есть другие, которые так же обобщают сигналы и там могут преобладать другие типы клеток.

Миндалина = распознавание паттернов

Миндалевидное тело не занимается распознаванием паттернов в общем смысле. Оно участвует в оценке стимулов. Распознавание паттернов происходит в сенсорных и ассоциативных корковых зонах. А амигдала делает оценку этого распознанного стимула (от начальных рефлексов, до более сложных).

Инстинкты-паттерны, передача возбуждения

Нет такого понятия как "инстинкт-паттерн" в нейробиологии. К реальной модели мозга отношения не имеет.

Паттерновое привыкание как стабилизация синапса

Стабилизация синапса действительно происходит при долговременном потенцировании (LTP), но вы делаете из этого прямолинейные выводы о "выключении" из инстинктов, чего нейробиология не подтверждает.

Подкрепления = нейроны мезокортикального пути

Мезокортикальный путь, например дофаминергические нейроны, участвуют в обучении через подкрепление. Но "подкрепления появляются в результате срабатывания обучающих инстинктов" — вы путаете причины и следствия. На самом деле речь идёт о системах оценки вознаграждения (VTA, nucleus accumbens, PFC).

Дофаминовая яма

Депрессия включает множество факторов, не только дофамин. Посмотрите лекции Роберта Сапольского, там целые лекции посвящены этой теме

Как итог, вы используете термины нейробиологии, но смешивает их так, как вам удобно для построения своей модели, без соблюдения реальных функциональных связей. Делаете необоснованные аналогии типа "миндалина = распознавание паттернов", "один нейрон = один элемент памяти", "пропускная способность синапса" и т.д. Местами цепляетесь за реальные факты (пирамидальные нейроны, клетки места, дофамин), но выводите из них неправильные следствия.

Так сократите. Я вам просто описал, как работает нейрон. Посмотрите спайковые и другие модели. Они прекрасно описывают его работу. Разные типы нейронов просто отслеживают разные свойства сигнала - это и было описано выше.

Про PFC/MPFC/ACC я просто попытался кратко изложить то, что вы можете прочитать в научных исследованиях. Видимо мне не удалось упростить этот процесс для объяснения.

Сократите вашу модель до одного слайда, чтобы ее можно было понять. Сейчас я пока вижу набор множества противоречий.

Есть предпосылки, что развитие все равно приводит к одному и тому же сценарию. Может в разных формах.

Например, когда я исследовал градиенты речи (движение артикуляторов) у разных животных, птиц, пчел. То оказалось, что не смотря на то, что у них у всех разные формы издания звука (артикуляторы: язык, жужальце, мешочки дельфинов и так далее), фазовое пространство движения артикуляторов у всех одинаковое. Что наводит на мысль, что не смотря на разную форму и природу артикуляторов, закон сохранения энергии приводит их движения к одному и тому же фазовому пространству (разного масштаба и расположенного в на разных частотах).

Млекопитающие
Млекопитающие

Что заставляет задуматься, это из за земных условий (но дельфины в воде), или это следствие закона сохранения энергии.

Формально, у млекопитающих и птиц разная слуховая кора. Но фактически она одинаковая. В том плане, что отдельные слои хоть и называются по разному и в деталях могут немного отличаться, но фактически реализуют тебе функции. И что важно, реализуют и не по разному, а одинаково. На эту тему есть исследования слуховой коры зоны А1. Там разница минимальная.

У птиц нейроны очень плотно расположены. В плане многих зон, есть одна разница. У млекопитающих они более универсальные. У птиц, если я правильно помню, даже на уровне ДНК меньше мусорных, так как их ДНК оптимизированы. А у млекопитающих (человек к примеру), хранятся на все случаи жизни (старые редуцированные). Вроде как объяснение было (не помню доказанное или предположение), что это связано с их весом и полетом. Так как для полета, надо желательно как можно меньше вес.

Мне не хочется вас расстраивать, но отдельные нейроны не имеют ничего общего с "Я". Здесь все проще. Представьте у вас есть один типа универсального нейрона и через него проходят разные сигналы.

Сигналы могут иметь асимметрию. Именно ее мы и пытаемся выделить. Внешний сигнал это волна разной природы: звуковая, световая, осязание (вибрации) и так далее. Все это волны разной природы.

Нейроны начинают подстраиваться под эту асимметрию. В одной части это асимметрия амплитуды волны, в другой фазы или частоты. Так мы получаем в итоге разные классы нейронов. Одни специализируются на амплитуде, другие на ассиметрии частоты или фазы. Или даже по нескольким критериям.

Асимметрия амплитуды - это первичные признаки, границы у световой волны, уровень частоты у звуковой, и даже у обоняния так (чтобы выделить хим признаки). Они выделяют первичные признаки.

Асимметрия частоты - позволяет выделить ритмы, что важно для выделения пространственно-временных признаков. Это измените частоты тона, или направление линии в пространстве. Так как частота определяет скорость изменения сигнала.

Асимметрия фазы, позволяет синхронизировать сигналы. Она отражает признак смещение сигнала. Если он совпадает у разных сигналов, то он усиливается. Это характерно для отдельных зон мозга, которые синхронизируют тета ритмы и другие.

Нейронные клетки отвечают не за Я, или сознание или что то ещё. Они отвечают за то, чтобы выделять асимметрию в сигнале волны. Все, больше ничего. Их задача минимизировать затраты энергии, поэтому они накапливают состояние, чтобы с меньшими затратами энергии реагировать на асимметрию.

Звучит немного запутано. Чтобы было понятно. Допустим у вас есть шум, где вероятность роста и спада сигнала одинаковая. В этом случае скорость реакции на рост и спад будет одинаковой. Но если у вас чаще встречается рост, чем спад, то система адаптирует скорость роста и спада.

Что это значит? Если скорость спада выше скорости роста, то шум будет постоянно приводить к тому, что сигнал будет на 0. Но если сигналов роста будет больше, то он постепенно будет расти, и даже периодические спады не приведут к его полному сбросу в 0. Это и есть выделение признака.

Чтобы было понятнее. У вас есть монета, где одна сторона тяжелее. Это сместить вероятность выпадения одной стороны на некоторую асимметрию. Эта асимметрия - и есть признак. Он означает, что одна сторона монеты отличается от другой. Нейрон делает тоже самое. Он улавливает эту асимметрию. И таким образом выделяет признак.

Затем этот признак передается дальше. И уже следующий нейрона пытается уловить асимметрию в этом признаке и так по цепочке.

Все, это единственная задача нейронов. Выявить асимметрию амплитуды, частоты и фазы волны в сигнале. То есть какой то признак.

Вы можете рассматривать области и даже зоны мозга таким же образом как большие гистерезисы. Но только на уровне обобщенных сигналов.

Для примера, зоны PFC/MFPC/ACC. Если упростить для понимания, то пусть в PFC пришел текст (итоговая мысль, упростим до понятия текста для простоты понимания).

Мы должны помнить, что ACC это локальная ошибка (predict coding), которая считается как данные поданные на вход PFC минус данные на выходе из MPFC. ACC = PFC_in - MPFC_out.

По сути PFC ищет асимметрию в сигнале, а MPFC и ACC разделяют асимметричный сигнал на два. Один наиболее вероятный и один менее вероятный.

PFC / MPFC получают абстрактные сигналы, которые можно назвать аргументами.

Эти аргументы — обобщения, извлечённые из памяти (гиппокамп), текущего контекста (ассоциативная кора), и глобальной цели (вопрос или задача).

Аргументы бывают:

За: усиливают гипотезу (обобщение признака).

Против: сигнализируют о несоответствии (ошибка обобщения).

Формально, MPFC и ACC не являются точно сигналом за или сигналом против. Они являются наиболее вероятным при асимметрии сигнала, и менее вероятным. Так как если наиболее вероятным окажется сигнал "против", значит он пойдет через MPFC, а сигнал "за" пойдет через ACC. Поэтому тут нет жесткой привязки к "за" и "против". Есть привязка к асимметрии наиболее вероятного и менее вероятного сигнала в его асимметрии.

  • PFC находит асимметрию в сигналах (кандидат на обобщение).

  • MPFC выделяет наиболее вероятную часть сигнала — гипотезу.

  • ACC вычисляет разницу между ожиданием и гипотезой — менее вероятный аргумент.

  • Устойчивость признака оценивается через норму этой разницы.

Что это значит. Когда туда поступил текст, то сигнал там работает не на уровне первичного текста (слов), а на уровне аргументов (более абстрактного признака). И на выходе мы получаем наиболее вероятные признаки (аргументы) и менее вероятные. Менее вероятные это ACC, они ведут в таламус, чтобы подавить повторный менее вероятный сигнал (и таким образом усилить более вероятный). А MPFC выдает более вероятный (аргументы), которые идут в гиппокамп и затем через цепочку повторно попадают в таламус в ассоциативные ядра. И из этих ядер таламуса, повторно идут как зацикленная "мысль" на второй круг.

Что на уровне нейрона, что на уровне зон и областей, мы работаем исключительно с выделением асимметрии сигналы (свойств волны).

Тут тоже интересный момент, где граница "сознания". Например теменная область тесно связано с разделением себя (своего тела) и внешнего мира. Если ее блокировать (повреждена, болезнь, наркотики), то у человека перестает различать эту разницы и возникает ощущение что он и внешний мир это одно и тоже (не может различать границы себя и внешнего мира). Это уже не сознание?

А если повреждена область автобиографической памяти, которая отделяет события произошедшие с нами от событий вне нас. И человек не может различить с ним это произошло или нет. Это уже отсутствие сознания?

А если мы возьмем слепых и немых и с повреждением обоняния, но слышащих. То у нас уже остается основная главная петля слуховая. И саморефлексия будет по ней. То это еще сознание или нет? А если при этом повредим теменную область и к примеру туже автобиографическую для примера. Это сразу отсечет работу множества областей связанных с ними. И по сути остается не так много. Такой человек можно считать с сознанием или уже нет.

Боюсь что тут нет четкой границы, какой критерий мы будем считать сознанием, а какой нет. Саморефлексия она как раз обеспечивает внутренние мыслительные процессы, которые неосознанные и сразу идут по петле (из за области ACC которая находит конфликт/локальные ошибки в зонах PFC/MPFC) либо осознанный, когда мы решили подумать еще раз (петля тоже идет, но уже не за счет ACC, а самих зон PFC/MPFC).

Чем больше углубляешь в мозг за поиском эфемерного сознания, тем больше видишь, что не понятно какой критерий брать за границу - сознание есть или его нет.

10 шагов обучения
10 шагов обучения

Да я сделал функции и сейчас тестирую. Скоро выложу их вместе с моделью (урезанной немного) шестислойной модели неокортекса (области из которых состоят зоны мозга), как замена трансформерам.

Выше для примера внутри так же изменённая математика SSM, с учётом гистерезиса. Что позволило SSM блокам быстро обучаться.

Трансформер 10 шагов
Трансформер 10 шагов

А выше аналогично трансформер с теми же параметрами на 10 шагах (и то немного подкатил у него residual связь на выходе, иначе ещё уже результат).

Так что выложу, там и новые функции гистерезис, их можно использовать отдельно и функции активации (чтобы модель не переобучалась) и так далее.

Трансформер без правки residual в конце
Трансформер без правки residual в конце

Но можно считать этот вариант классического трансформера плохим примером. Так как выше правка была в нем незначительная, на выходе был учтён ещё один residual просто. А тут трансформер на 5000 шагах обучения.

Суть гистерезиса в том, что это определение вероятности асимметрии сигнала по амплитуде, частоте и фазе. Он улавливает эти асимметрии в процессе обучения (или начальной настройке), и работает как разные нейронные клетки. Когда один тип клеток специализируется на амплитуде для выделения признаков, другой улавливает частоту для ритмов (слуховые области например), третьи фазу чтобы синхронизировать тета ритмы к примеру.

При этом нам не нужно вводить дополнительно время , как в спайках. Вероятности асимметрии в сигнале и так улавливают эти аномалии в сигнале в волне.

Выше пример обучения гамматон фильтру. Сейчас доделываю примеры для выделения речи из аудио и простой LLM на базе модели. После этого опубликую. Мне главное, чтобы человек смог понять , откуда это взялось. Не очень хочется, чтобы люди бездумно использовали модель, не понимая на чем она была построена

Речь идёт про то какие области и что делают, как делают, какие клетки за что отвечают. Как и куда идёт сигнал, в чем его роль.

В общем случае да, изучен. На конкретном примере той же саморефлексии. Вопрос в деталях, как другие области влияют, что вносят, как их функции оказывают воздействие на итоговый сигнал. Например, какой точно вносит свой вклад теменная область, или как энториальная кора , моторная и лимбическая оказывает влияние на построение грамматики предложения (в разных культурах синтагма строится по разному, так как разные зоны имеют разный приоритет при свое развитии). Но вот детали, конкретные взаимодействия и так далее будут изучаться и постоянно находить что то новое для описания процесса.

Речь идёт про общий подход. Он изучен. Как копируется информация по время сна, как происходит саморефлексия, как формируется глобальная цель через базальные ганглии и множество всего. Каждая часть очень неплохо изучена.

Я не говорю, что ясно как работает весь мозг и все детали. Речь про общие механизмы. Их на сегодня очень хорошо изучили. Это как сказать физика в целом явления движения планет понятна. Но это не значит что она полностью изучена и все ясно. Речь про базовые механизмы.

Я не просто так выше привел ссылку на схему рефлексии. Вы можете взять и проверить каждое мое слово, прежде чем делать нападки. Я специально указал на фрагмент механизма, а не весь. Этот механизм обеспечивает круговорот "мысли" (сигналов). И рассмотрен только на коротком участке для текста(слуха) и не целиком. Но по нему уже понятно в целом, как происходит формирование контекста, связь с новым сигналом и так далее, круговорот сигнала через петли и так далее.

https://t.me/greenruff/2240?single

Это не случайность. Я даже специально описывал как вызвать и управлять таким поведением специально. Думаю если посмотрите причину по ссылке, то увидите что направили прогнозирование модели по другому пути предсказания.

Я на эту тему как раз делал механизм, когда несколько разных LLM сами выступают арбитрами друг друга.

https://t.me/greenruff/1757?single

Там как раз важный момент, что они оценивают не только сам ответ, но объяснение своего ответа. Чтобы не было так, что дала верный абстрактный ответ.

Это снизило галлюцинации и позволило вытаскивать ответы, которые до этого было сложно вытащить из слабых LLM моделей.

Минус такого подхода, что жрет это много ресурсов. А для 10 LLM (арбитров) время одного ответа 15-30 минут. Можно конечно оставить штуки 3 разных LLM, тогда быстрее.

Я сейчас как переписал код, чтобы можно было использовать известные LLM через их вам через данный механизм. Чтобы собрать датасет для обучения архитектуры саморефлексии. Где как раз важна оценка ответа. Позже, как буду обучать, выложу его код наверное. Так как это идеальный метод обучения языковых моделей на предмет рассуждений (не важно саморефлексии или как сейчас рассуждающих).

Так что пока вручную как вы описали использую подход объяснить свое решение и указать слабые места и описать свою интерпретацию. Тогда проще увидеть, где у нее ошибки в рассуждениях.

Кто вам сказал, что мы не знаем как человек думает? Нейробиология изучила каждый шаг.

https://habr.com/ru/articles/901086/comments/#comment_28199078

Это пример с текстом (слухом) при саморефлексии. Сложность пока составить полную картину. Например слух и зрение изучен хорошо, что как и куда идёт и за что отвечает. Сложности пока в обобщение других зон, теменная, моторная. При этом лимбическая изучена, но сложность с воспроизведением, так как неокортекс проще изучить он на поверхности, а лимбическую поковырять сложнее (она под множеством других зон). Поэтому электроды туда сложнее вживить не повредив другие зоны.

Вы можете найти много исследований на тему рефлексии мозга, которая и формулирует мысли и петли приводящие к рассуждениям.

Пока что все эти модели тупы, когда дело касается разработки нового, а не повтора того что уже было.

Недавно делал новую модель функции гистерезиса для нейронок, чтобы при обучении они могли выделять амплитудные , фазовые и частотные признаки в сигнале (не важно, текст, картинки, классификаторы и так далее). Так все модели несли чушь. Всегда соглашается и нормально делают, только если распишешь все.

То есть серьезный код так и не могут написать. Но вот выполнить рутину, когда описал формулы, логику - да могут сконвертировать в код. И то, без понимания что это, так как допускают ошибки даже в этом случае.

Так что производительность это хорошо, но для меня главная проблема пока при их использовании это их тупость, когда решение раньше не встречалось. Несут бред полный.

Именно, последнее время от приходили и обращались три разных HR. Особенно убило: "Сходил к старшему рекрутеру, она сказала, что позиция еще формируется и будут обсуждать задачи уже на финале). Но в любом случае это не единственный проект связанный с AI, на финалах можно будет рассмотреть 3-5 команд".

Я обычно на такое перечисляю свои исследования в ML. Затем указываю, что мне предлагают пройти стандартную процедуру собеседования с задачками и далее «на месте разобраться, куда пристроить». Это может быть оправдано для джунов или разработчиков на прод, но не для исследователя с опытом R&D.

Обязательно добавляя, что не вижу у Яндекса по-настоящему фундаментальных направлений в области ИИ. Всё, что я наблюдаю — это доработка готовых решений, пусть и с отличной инженерной реализацией.

А уже вариант «пристроим в одну из команд», вообще расцениваю как оскорбление.

Яндекс не компания с нужными мозгами, а алгоритмические задачи - это не тот фильтр, который позволит ей хотя бы не отставать от современных исследований.

Вот вообще железо и бюджет не играют роли для фундаментальных исследования. Вы думаете, что DeepMind тратит миллиарды долларов на свою команду и они требуют мощного железа? Это не так. Проблема подхода. Сбер и Яндекс, как и другие крупные рос компании построены на другой методологии и модели. Я работал в крупных - это когда каждое подразделение отдельный бизнес, KPI, сроки продукта, различные скрамы Agile Kanbana. Подход найма с собеседованиями, где в итоге ты ничего не будешь использовать по тому что собеседовали (алгоритмические задачи будут иметь 0 отношения , к тому что будешь подготавливать какую нибудь разметку текстовых файлов и править JSON). Каждое подразделение считает свох расходы, конкурирует с другим за время, ресурсы, показатели, оценку. Могут одну и туже задачу реализовать по кругу, когда одна команда сделала, затем другая делает иначе - так как сверху решили, что подход устарел или надо изменить все или передали в другое подразделение или ... причин 1000.

Как вы думаете, при данном подходе есть место реальным R&D? у R&D нет сроков, нет KPI, нет сторипоинтов, более того ты даже не знаешь точно какой результат получишь и возможно он будет совсем в другой части. Поэтому ни у Яндекса, ни у Сбера, ни у МТС, ни у Mail (VK) нет на данный момент ни каких шансов. 0 шансов на фундаментальные разработки.

Деньги сжигаются там нормально. У меня не было денег, но я сумер выстроить синтез управляемой эмоциональной речи на физиологической модели вдох-выдоха https://t.me/greenruff/1819

В то время пока Сбер просрал взял и дообучал модель распознавания эмоций, я им раскладывал почему это не работает и как правильно, тоже проводят исследования: https://t.me/greenruff/1855

Каким то образом у меня нашлись ресурсы для исследования речи с нуля, что позволило найти и сравнить фазовые пространства речи разных живых организмов https://t.me/greenruff/2008 и ввести новый инструмент анализа на основе градиентов. Который показал, как речь на каждом свое уровне стремиться к минимизации энергии, что помогло в дальнейшем. Хотя мне в том же сбере и так от ML разработчиков часто слышал, биология и сетки разные вещи и зачем вообще совмещать.

Или может нужно миллионы долларов, чтобы последовательно исследовать и выстроить классическую шести слойную модель неокортекса и ее архитектуру? Что в итоге показала результат гораздо лучше чем у трансформеров https://t.me/greenruff/2180 и более того, показало что сами трансформеры являются очень упрощенным вариантов этой модели для ассоциативных зон.

Или может нужны деньги, чтобы разработать новый подход обучения вместо метода обратного распространения? https://habr.com/ru/articles/900186/comments/#comment_28165598 Который показал результаты лучше чем классический метод обратного распространения, потому что построен на нейробиологии. Я ни чего не изобрел там в плане механизмов работы мозга, а после долгих исследования сумел перенести и совместить методы обучения градиентов на основе сразу локальной и глобальной ошибки.

Сейчас я делаю модель саморефликсии и модель гистерезиса (тоже большое и важное исследование об асимметрии вероятности сигнала волны по фазе, амплитуде и частоте, которые и приводят к выделению признаков) которую даже частично описывал для амплитуды. https://t.me/greenruff/2170 Тогда еще без понимания, ее физического смысла. И этот подход даже для учета асимметрии вероятности амплитуды в сигнале, значительно улучшил обучение сетки, так как позволил быстро находить устойчивые признаки в сигнале. Я что изобрел гистерезис и мне надо было миллионы долларов на это? Или надо исследовать и постараться перенести гомеостаз и гистерезис сигнала нейронов на сетки?

Поэтому ответ нет. Это такое нелепое оправдание, фигурировать бюджетом и железом.

А включением своих мозгов тоже заблокировали санкциями и к ним сейчас усложнился доступ на территории России?

Да вы правы, прочитал и вижу что GPT‑4o действительно обучили как мультимодальную модель. Здесь предполагается что она построена на базе Flamingo от DeepMind (https://medium.com/@amol-wagh/whats-new-in-gpt-4-an-overview-of-the-gpt-4-architecture-and-capabilities-of-next-generation-ai-900c445d5ffe). Но утверждать не буду, так как openAi не описывает свою внутреннюю архитектуру.

Но другие говорят, что у них ближе к Chameleon: Mixed-Modal Early-Fusion Foundation Models. https://huggingface.co/papers/2405.09818

Ее описание тут: https://arxiv.org/pdf/2405.09818.pdf

https://www.aimodels.fyi/papers/arxiv/chameleon-mixed-modal-early-fusion-foundation-models

Я не верю, что OpenAi разрабатывает архитектуры сам, а не адаптирует другие. Уверен инженеры у них отличные, которые могут хорошо оптимизировать новые архитектуры, и имеют доступ к множеству данных для обучения.

Но по пока что, я не нашел ни каких данных о том как именно работает их мульти модальность. Что лично для меня наводит на мысли, что раскрытие в общем ключе такой информации может поставить под сомнение их модель развития для инвесторов, так как окажется, что инноваций нет.

DeepMind плохо умеют воплощать на основе своих исследований продукты. Я не думаю, что их вообще волнует шумиха вокруг всего это. Они как занимались исследованиями, так и занимаются. Проверяя при этом на живых клетках, пересадках и совмещении работы искусственных сетей и реальных клеток. Поэтому их не особо волнует обучение на огромных массивах, реализация продуктовых решений. В этом плане безусловно они отстают. Вопрос только в том, что если завтра компании перестанут делиться решениями и исследованиями, то что будет делать OpenAI и множество других компания. И возможен ли такой сценарий.

Если такое возникнет, то Яндекс и Сбер сразу отстанут. Сбер сейчас использует DeepSeek https://huggingface.co/ai-sage/GigaChat-20B-A3B-base/blob/main/modelling_deepseek.py , Яндекс тоже не сам писал архитектуры. Поэтому я с этой позиции смотрю на лидерство в этой области. Ни как продукта, а как наработок фундаментальных исследований, которые позволяют компании развивать нейронные сети в правильном направлении.

Преимущества этих новых трендов и технологий - в новых возможностях, инструментах.

Когда например я хотел расширить возможности на нейронках, чтобы добавить их в свою линейку RVMedia - то писать с нуля или переносить логику уже готовых решений с python был не готов. А тем более работа с CUDA.

Другой момент кроссплатформерность. Я тогда много намучился с этим. Они поздно ее отладили, когда она уже есть у всех. А мне очень не хватало этого. чтобы перенести компоненты на Android, iOS, Mac, Linux для полноценного создания мультимедийных компонентов под разные ОС. Чтобы пользователь мог быстро сделать чат или аналог TeamViewer не только под Win и Lin, но и Apple технику и мобильники.

Далее куча разных вещей вроде обращений к Redis, Kafka и другим. Они появились - но с большим опозданием. Когда компании уже во всю использовали данные технологии в Delphi их еще не было, или они были глюченные. При этом упор был на то, чтобы наплодить кучу компонентов, которые просто глючили. А под капотом был дикий ужас, заглушки, циклы вывода отрисовки без оптимизаций и так далее.

С моменту ухода из DeepMind прошло много времени, и они далеко продвинулись в том, в чем другие даже не работали. Трансформеры сами по себе это лишь небольшой кирпичик, которого не достаточно. Я не говорю про руководство, речь про команду. Если посмотреть на руководство OpenAi, Antrophic стартапов то кроме их "руководства" они больше ни чем не отличились. Их стартапы и компании больше не выдают каких-то фундаментальных изменений. (Antrophic пытается копать в эту сторону - через латентное пространство матриц внимания).

Мне кажется вы плохо понимаете, что такое модультимодальные модели на уровне нейробиологии. Синтез и речь в OpenAi не мультимодальные. То есть там в основе все та же LLM, в которую распознается речь и подается текст и синтезируется обратно - это не мультимодальность. Это что-то вроде агентов. Можно конечно в рамках PR маркетинга назвать это мультимодальностью, но и курицу можно назвать страусов. Это не изменит ничего.

и вот

мультимодальность двух зон. Посмотрите разницу https://t.me/greenruff/2146 между мультимодальностью и привычным многим агентским системам.

Совсем другой принцип и связи. И это выше работы DeepMind. Так же как и их работы по разработке модели таламуса, гиппокампа (специальные модели трансформеров), ячеек места энторинальной коры. Проверенных на мышах. Эта компания сильна не руководством, а научной командой которую мы не видим. Я могу перечислить много фундаментально важных работ, которые они проделали. Именно они реализовали мультимодальные модели, и их новые модели явно ушли далеко.

Ни чего подобного нет ни у одной компании, кроме PR, расширения датасета, измерения очков бенчмарки и функционала продукта. Это все прекрасно. Но это как Яндекс или Сбера но в более крупном масштабе, которые делают отличный продуктовый продукт.

Тот же Илья Суцкевер не выдал ничего нового, он отличный инженер, но не нейробиолог в сочетании с инженером. Те же представители совета директоров OpenAi которые были - были связаны с AI очень условно, весь их треп был вокруг "безопасности ИИ и возможных последствий". Потому что больше они ничего родить не могли, так как не являются специалистами в этой теме. Хорошие инженеры и руководители? Да, вполне. Хорошие исследователи, способные фундаментально развить модель? Нет.

Чего конкретно потребовать и как легко общается?
Я говорил о двух вещах - саморефлексии и про разные контексты пользователей.
На низком уровне работы LLM это происходит так. Вы отправляете текст.
SYSTEM_PROMPOT: текст
USER: текст
ASSISTENT: текст
USER: текст
...
если вы сделаете
USER1: текст
USER2: текст
ASSISTENT: текст
USER2: текст
ни одна LLM не может справиться.

если же вы говорите о том. что описали текстов в сообщении. Вася сказал то то, Коля сказал то то, что сказал Вася? Просто как сообщение. Это не диалог, вы просто скормили один контекст - задачу. И как только модель выделит более важный контекст - этот будет менее значимым и не будет учитываться.

Поэтому уточните, что вы имеете ввиду. Выше я многократно тестировал - сетки не справляются и быстро теряют. Иногда уже на первом сообщении, когда добавляешь трех пользователей. Когда все друг с другом здороваются.

Информация

В рейтинге
2 438-й
Откуда
Москва, Москва и Московская обл., Россия
Зарегистрирован
Активность