Обновить
61
Илья@proxy3d

нейробиология, нейронные сети, AR/VR

0,4
Рейтинг
25
Подписчики
Отправить сообщение

Почему каждый раз читаю новости про технологические решения на хабре, это не разбор что конкретно было сделано?

Для начала стоило объяснить, что за архитектура OpenMythos и чем отличается. Архитектура состоит из трех ключевых этапов:

1. Prelude (Прелюдия)

Это входной блок стандартных слоев трансформера, которые выполняются ровно один раз. Его задача cформировать первичное латентное представление входного токена. Результат этого блока сохраняется и добавляется в каждый последующий цикл рекурсии, чтобы предотвратить "дрейф" или потерю контекста при глубоких вычислениях.

2. Recurrent Block (Рекурсивный блок)

Это основа OpenMythos. В нем данные входят в цикл (до 16 итераций). Используются одни и те же веса для каждой итерации. Это делает модель компактной, но «глубокой» с точки зрения вычислений. На каждом шаге t скрытое состояние h(t) обновляется с учетом исходного эмбеддинга из Prelude:

h(t+1) = TransformerBlock(h(t), e)

Внутри этого блока часто используется маршрутизация экспертов MoE, что дает возможность динамически выбирать нужные нейронные пути для решения конкретной подзадачи на каждой итерации.

3. Coda (Кода)

Финальный блок слоев, который также выполняется один раз, декодирует накопленное в циклах мышление в финальное распределение вероятностей токенов (логиты).

Как и в SSM, здесь главное рекуррентность. В классических трансформерах информация идет только вперед (feed-forward). В OpenMythos, как и в Mamba, текущее состояние зависит от предыдущего шага обработки.

Разница лишь в том, что в Mamba заменяет механизм внимания (Attention) на селективное сканирование (локальное внимание). OpenMythos оставляет Self-Attention внутри рекурсивного блока. То есть на каждом из 16 циклов модель заново смотрит на все остальные токены в контексте. Это дает точность и глобальное внимание трансформера, которых иногда не хватает рекуррентным сетям.

В обычной рекуррентной сети сигнал затухает. В OpenMythos на каждом цикле в блок подается не только результат предыдущего шага, но и исходный эмбеддинг из блока Prelude.

https://t.me/greenruff/2306

Это попытка сделать аналогию с мозгом. Хотя и очень ограниченная. В нем данные после таламуса поступают в область мозга аналогичную Recurrent Block. Затем поступают в MPFC (тут аналогии нет). Мы тут опускаем ACC и другие части. Главное что затем сигнал попадает в гиппокамп. При этом у рекуррентного блока слои 6 отдают сигнал ошибки так же таламус в ассоциативные ядра. Что я имею ввиду под аналогией?

  1. Сигнал ошибки из слоя 6 попавший в ассоциативные ядра затем смешивается с сигналом от сенсорных ядер.

  2. Сигнал из гиппокампа потом поступает в Recurrent Block и смешивается с сигналом от таламуса (который так же может быть смешан сенсорным и ассоциативным ядром). Механизм таламуса сложнее, но если грубо то так. Смысл в частичной аналогии, как в модели OpenMythos, входной сигнал смешивается со старым. По сути с памятью прежнего “размышления” и с ошибками, а так же с новой информацией. В OpenMythos это сделано более урезано, но само направление частично перекликается, но в более простой и ограниченной форме. Это можно было бы сравнить с чтением книги. Сенсорный сигнал - это информация прочтения абзаца. Затем обработанный сигнал через таламо-кортикальными петли снова идет на вход, где снова повторяется сигнал с прочитанного абзаца, словно пользователь прочитал и думает об этом не переходя дальше. Сравнение очень грубое и неточное, но сама идея частично перекликается.

Рекуррентный блок как раз в цикле ближе к гиппокамп (хотя без явного запоминания важных деталей - урезанная реализация). А вот аналога слоя 6 как ошибки, которая потом добавляется в начальные сенсорные данные, чтобы перестроить размышления (на альтернативные рассуждения) нет. Я вижу работы ассоциативные ядер от слоя 6 при смешивании с сенсорным сигналом, как усиление альтернативных направлений (если ошибка большая, то альтернативный маршрут может быть усилен). А в случае OpenMythos есть только смешивания сигнала с аналогом CoT, что ближе к гиппокампу, который снова идет на вход и смешивается с сигналом таламуса.

Рекуррентный блок в OpenMythos работает на удержание и уточнение контекста. Данные циркулируют, смешиваясь с «сенсорным» входом (Prelude), что функционально напоминает работу гиппокампа по поддержанию временных связей и формированию эпизодического кадра. Это похоже на внутренний монолог (Implicit CoT), где мы просто прокручиваем одну и ту же информацию. Но это пассивный процесс, он не меняет стратегию мышления на ходу.

В биологическом мозге слой 6 коры посылает проекции обратно в таламус. Если предсказание (Top-down) не совпадает с сенсорным входом (Bottom-up), возникает сигнал ошибки. В мозге высокая ошибка буквально переключает внимание таламуса на другие ассоциативные ядра. Это позволяет мгновенно сменить интерпретацию (например, когда ты понимаешь, что пятно в кустах это не тень, а тигр).

В OpenMythos этого нет. Там нет детектора рассогласования. Рекурсия идет по жестко заданному алгоритму. Если модель изначально начала с неверного рассуждения на первом цикле, она будет продолжать уточнять эту ошибку все 16 циклов, просто смешивая её с исходным сигналом. У неё нет механизма, чтобы определить что "Ошибка велика, забудь этот путь, попробуй альтернативную активацию экспертов (MoE)".

Я бы рекомендовал ознакомиться с этим исследованием тут

Автор видео хорошо разобрал его. Сами исследователи не делают громких выводов, они просто говорят о найденных признаках. Более того, это не гарантирует на 100%, что они их выделили, и те же Cap lock связан с ними, а не нарушением других близких связей.

Сам подход выделения признаков интересный. Сложно однозначно сказать, действительно результат изменения весов связан с ними или же связан с тем, что захватывает какие-то дополнительные связи.

Лучше не делать громких заявлений про эмоции, а более детально разбирать как и что было сделано в исследовании. Как выделялись признаки, примеры изменения весов и так далее. А громкие заголовки лучше оставить для желтой прессы.

Все это не решает главную проблему, разрыв контекста при разбиении на чанки. Я часто вижу извращённые решения построения графов с выделение сущностей NER чтобы сохранить контекст банков, или ведение дополнительных тегов или как в статье выше. Но это костыль, а не решение которое поломается на различных данных. Например на юридических документах.

В данном исследовании Late Chunking эта проблема решается. Основная идея это метод создания эмбеддингов для RAG, при котором сегментация текста на чанки происходит после того, как весь текст был передан через модель эмбеддингов с длинным контекстом. То есть:

1) Сначала весь документ, или большая часть текста, обрабатывается моделью эмбеддингов с длинным контекстом. Модель получает весь текст сразу и генерирует эмбеддинги для всех токенов с учётом глобального контекста.

2) Затем из полученных токеновых эмбеддингов формируются отдельные эмбеддинги чанков (например, с помощью среднего/mean‑pooling по токенам внутри каждого сегмента).
Таким образом каждый итоговый чанк наследует весь контекст документа, а не только локальный кусок текста.

Проблема классического RAG, что каждый чанк видит только свой локальный контекст и при запросах может теряться смысл, связанный с информацией, которая находится в других частях документа. Поэтому используют разные извращённые подходы в виде графов, дерева, меток и прочего нагромождения которое не решает полностью проблему и не работает на многих документах.

В видео есть пример со статьей из Вики, где:

Париж столица Франции.... (где то в середине текста) его население более 18 млн человек...

Если делать как описано в статье или других костылях, то мы получаем потерю связи про численность (чанк не связан) или он окажется близок и к Парижу и к Лондону и к Москве и т.д.
Это отлично видно, если мы возьмём сложные и длинные юридические документы, где будет много сущностной связанных друг с другом, и с учётом что они могут быть разные, то костыли  ломаются (какого только изврата не видел и не наслушался).

Это просто разложение цены через IMF на компоненты. Подобно как разложение Фурье, только Фурье тут не стабилен (хотя IMF тоже не идеален). Получаем несколько компонент, затем находим все пики колебаний у каждой компоненты и угол наклона (разница между пиками деленная на временной интервал между пиками). И затем выводим комбинацию (значение пика; угол наклона).

https://t.me/greenruff/2578

Тут выкладывал в комментариях код как разложить.

Я просто подобным образом анализировал раньше речь через форманты, когда нашел закономерности. И просто решил проверить это на финансовых графиках. Меня прежде всего интересовала плотность распределения углов наклона, а выше получился как побочный график. Проблема IMF в том, что ближе к концу данных она не очень стабильная и на молодых рынках (вроде Тинькофф) даёт скорее хаос, особенно на крипте (на ней колебания имеют огромную частоту и на дневных графиках вращение может сделать полный оборот). А вот там где рынок давно (евро доллар, золото, нефть..) там все более плавно вращается.

Я в свою очередь пробовал проверить, есть ли момента, когда все сильные колебания направлены в одну сторону. То есть все компоненты имеют одинаковый тренд. Оказалось что таких моментов практически нет.

Для примера евро доллар, колебания стабильные. Интересны только IMF больше 4, так как именно они вносят основной вклад в цену.

Но это если что не стратегия и я ни к чему не призываю и не утверждаю. Просто интересное наблюдение. Например, оссоциляции Nvidia совпадают с индексом чего то там (забыл индекс топ компаний), то есть Nvidia влияет так или это общий тренд , я не знаю. Мой интерес был исследовательский. Просто он меня немного ставит в тупик. Что первично, события и колебания отражают подготовку к ним, или колебания и какие-то события потом наступают как спусковой крючок.

Газпром
Газпром

Ну по сравнению с тем же Газпромом, NVidia более хаотичная. Малые IMF всегда колеблятся очень быстро. У газпрома на дневных графиках они превращаются фактически в линии (быстро вращение и от спирали видим только линию туда-обратно). Но в целом все российские, словно на ручном регулировании ходят по кругу (что сбер, тинькоф и остальные). А NVidia, Tesla это прям красивые колебания по спирали. Выше, что самое интересное, изображение для Газпрома делал до того как на ближнем востоке случилось. И сами изображения говорят, что дальше по спирали снова вверх на сильных осцилляциях. То ли рынок уже ждал этого, то я скоро начну верить что все события предрешены в какой-то форме. Я не могу объяснить, то что выше. Но интересно, что будет с Nvidia.

Насчет пузыря не знаю, но то что NVidia будет дешеветь, тут не нужно быть Нострадамусом.

NVidia
NVidia

Из любопытства делал разложение IMF, чтобы проверить плотность распределения вероятности динамики у фин инструментов и заодно просто смотрел разные интерпретации. Выше NVidia.

по оси X угол наклона, а по оси Y вклад в стоимость. Зеленым - текущее значение + аппроксимация
по оси X угол наклона, а по оси Y вклад в стоимость. Зеленым - текущее значение + аппроксимация

Так вот если мы посмотрим на них, то по своей природе они делают осцилляционные движения по спиралевидной форме, колебания. Самые большие IMF дают наибольше вклад и они самые медленные. Ну так вот, самые крупные сейчас на пике, дальше колебания все равно будет вести их вниз. А более мелкие хотя и сдерживают цену, но особо вклад не вносят.

Я не знаю что произойдет, то ли Китай выпустить карты новые, то ли модели удешевятся, то ли тема ИИ начнет сдуваться в плане покупки мощностей. Но явно что через год, это начнет потихоньку затихать, хотя бы для NVidia не оправдав ожиданий.

Я бы был немного аккуратнее с ожиданиями. Прогресс действительно быстрый, но говорить о том, что осталось совсем немного до систем, которые обобщают на порядки лучше человека, пока преждевременно.

Архитектуры вроде JEPA (включая V-JEPA), конечно важный шаг, но у них есть фундаментальное ограничение. Они оптимизируют расстояния в евклидовом латентном пространстве, тогда как реальная структура данных задаётся все таки вероятностной геометрией (через лог-вероятности и дивергенции типа KL). Локально это совпадает (через квадратичную аппроксимацию), но глобально нет. Как итог, такие модели сейчас требуют дополнительных трюков, типа регуляризаций и аккуратного обучения.

То есть идея в целом правильная, чтобы учиться в пространстве представлений, а не в пикселях или токенах. Но текущая реализация скорее приближение, а не полноценная реализация этой геометрии. Там еще работать и работать...

Так что прогресс есть, но точно не экспоненциальный без ограничений. Языковые модели не столько упёрлись в потолок, сколько вышли на стадию насыщения в базовой архитектуре. Поэтому сейчас основной рост сместился за счёт инженерных решений вроде специализированных моделей, мультимодальности, агентных систем и интеграция с разными инструментами.

Так что хотя движение есть, но фундаментальные ограничения (в том числе геометрические и статистические) пока никуда не делись. И до качественного скачка уровня, когда модель сильно превосходит человека в обобщении пока еще далековато.

Меня поражает, что в России так зациклены на трансформерах и агентах. Я слежу за исследованиями и работами в области нейронок и на западе сейчас усиленно развивают Jepa. Она сырая, в ней есть математические ошибки, но это следующий шаг. Так как проблема чистых llm или современных мультимодальных в том что они построены на трансформерах и не работают в пространстве обобщающих данных. Именно к этому стремиться Jepa. По этой причине, чисто языковые модели не могут обобщать данные в абстрактной форме. Они работают в одном пространстве текста или видео.

Если смотреть на развитие с точки зрения чисто языковых моделей или их расширений мультимодальных (которые все равно привязаны к тексту), то они не могут абстрагироваться. То есть обобщить данные. Это как недавно в статье про рентгеновские снимки, они учат шум и пытаются работать с пикселям. То же самое языковые модели на уровне кода, не обобщают код на уровне целостной системы.

У человека есть область в мозге, которая обобщает условно предсказания "текста/речи" , "зрения", моторики и другие. Обобщает эти сигналы в новом пространстве и уже дальше формируется целостная картина. И это минимум.

Поэтому пока что llm это инструмент. Мощный, удобный, который может работать на одном уровне абстракции, например текста в рамках дальних связей (на сколько они хорошо обучены). Но он не скажет вам, что внося измените в эту часть кода, вы поломаете другой модуль. Потому что это уже верхний уровень абстракция, которого у языковых моделей просто нет. Она узнает о поломке, только кода код в том месте выдачи ошибку.

Вообще-то все гораздо сложнее. Недавно попадалось видео с исследованиями про работа со снимками с рентгеновскими снимками и ультразвуковыми.

https://www.youtube.com/watch?v=dTKg-fA8ttU

Простые сетки в виде трансформеров или диффузионных моделей тут не подходят. Они обучаются шуму, а не абстрагированию. Поэтому они реконструируют шум. Задача же оценки снимках, как раз смотреть на это ни как на шум, а как на целостный объект.

Проблема в том, что эти снимки в отличии от обычных изображений построены на шуме.

И для работы с ними и распознавании на них, нужно работать не на уровне точек, а на уровне абстракций. Поэтому трансформеры и диффузионные модели тут бесполезные, так как они пытаются запомнить шум на уровне пикселей и работать с ним. Тут как раз авторы пробуют применить доработанный вариант Jepa.

Таким образом переходим от постановки задачи - какого цвета пиксель и что это за пиксель, а задаче что это за объект. Напомню, что данные снимки построены на стохастическом шуме. И авторы показывают, что привычные модели просто не могут нормально работать на данном уровне.

Как итог, трансформеры и диффузионные модели пытаются классифицировать и восстанавливать пиксели, которые являются шумом и поэтому для подобных снимков их качество очень низкое. В то время как подход с Jepa построен на абстрагировании модели.

Это я к тому, что просто взять снимки и скормить их сетке, лишено смысла. Так как мы получим в реальности плохое качество, можно конечно подогнать. Но в реальности результат подойдет только для инвесторов и PR-маркетинга. Человек в этом случае как раз абстрагируется, в этом разница. Собственно в видео делали это через Jepa, чтобы улучшить показатели.

Не заменит. Ниже визуализация дневных данных

Золото
Золото

Вот так выглядит вращение отдельных компонент у золота.

По X это угол наклона, по Y это значение пика. Это анализ динамики, через градиенты и пики.

Биткоин
Биткоин

А это биткоин. Говорить о том, что биткоин что то защищает, это как играть в русскую рулетку. Он вращается с огромной скоростью и сегодня вы защитили, через месяц уже наоборот все потеряли.

В комментариев выкладывал и другие графики от сырья, валют и акций:

https://t.me/greenruff/2579

Если мне память не изменяет, то например та же Nvidia сейчас на пике и дальше там идёт падение для крупных компонент, которые вносят основной вклад в оссоциляции. Так что видимо хайп по языковым моделям все таки будет утихать.

Сбер
Сбер

Что касается Сбера, как написали выше. То да, видно, что основные компоненты оссоциляции росли последним годы. Но дальше у них только падение. Так как это колебательные осцилляторы, которые вращаются по спиралевидной форме, и физически не могут сменить направление. Так что от Сбера явно лучше избавляться. Видимо проблемы в экономике сильно скажутся на нем.

Чтобы заниматься фундаментальными исследованиями для развития ИИ, миллиарды денег не нужно. Проблема тут не в деньгах, а в мышлении компаний. Я тщательно слежу за научными работами Сбера и Яндекс по ИИ и надо признать, что они слабые. Нет ни одной фундаментальной работы.

На сегодня в России к сожалению слабая школа в области нейронных сетей. Классический фундамент дают, но именно чтобы создать и изучать новое, нет.

Я много смотрю по другим работам, тех же импульсных нейронок в РФ, там не хватает мат базы.

Работы того же Фристона по FEP свободной энергии, изучают глубоко несколько человек, но изучают, а не развивают.

Те же работы Jepa, тесно связанные с EBM, в России вообще пока игнорируют и часто даже не понимают, сводя все к шутливому названию. Хотя там главное совсем в другом, так как они доказали что движутся в правильном направлении. И на западе это сейчас тема номер 1 в исследованиях.

И получается, вместо фундаментальной математики и развития научного направления, сейчас у нас все сводится к тому, чтобы взять открытые модели и дообучать их на русскоязычном датасете. Как бизнес подход это правильно, но в плане развития это значит, что мы отстали лет на 10.

Так что какой смысл выделять субсидии, чтобы просто сжигать их? Когда можно направить все усилия в научном направлении, чтобы сделать рывок. Это долго, но это единственный правильный реальный путь развития. Сейчас же Сбер и Яндекс это АвтоВАЗ, с той разницей что все автомобильные технологии, которые можно взять, есть в открытом доступе. Надолго ли такая тенденция продлится? И это всегда стратегия 10 ого места, не позволяющая даже приблизиться к лидерам.

Jepa на самом деле лишь косвенно связана с трансформерами. Ей без разницы, что там SSM или другое. Это близко к EBM модели Friston о свободной энергии. Текущие LLM это безусловно тупик, так как логика Jepa в том, что система ничего не знает что нужно обучить. Она "пытается" привести два разных распределения к одному общему, в этом и заключается обучение. В этом сильная сторона Jepa и правильная. Но конечно там проблем много, так как в отличии от EBM (работа с "энергией") в Jepa мы работаем с эмбеддингами. Даже если они описывают энергию, там нужно это учитывать в архитектуре. Так что основа Jepa (пусть и пересмотренная и измененная) в итоге придет на замену текущим LLM.

Опять у нас с отставанием смотрят на все это. В тех же Штатах, сейчас очень много внимание уделяется работам и исследованиям самой логики Jepa подхода и на развитию этого архитектурного подхода.

Немного не в тему МНК, но в тему прогнозирования. Google не давно выпустил модель TimesFM

https://github.com/google-research/timesfm

Они натренировали ее огромном массиве данных. Тут в виде разбирается эта работа

Ее идея аналогична LLM, но для time series. Обученная на огромном количестве разных временных рядов. Размерность около 200M параметров, обучение на 100 млрд точек временных рядов и разных доменах (Google Trends, Wikipedia, температура и все что смогли найти, включая синтетические данные). Поэтому может прогнозировать любой новый ряд без обучения.

Отличие в том, что обычные модели это t1 t2 t3 t4 t5 ... каждый временной шаг это токен. TimesFM разбивает временной ряд на patches [t1 t2 t3 t4] [t5 t6 t7 t8] [t9 t10 t11 t12] каждый patch это токен. Это дает меньше токенов, длинный контекст и главное лучше предсказание. Так как модель предсказывает сразу patche, то есть связанную последовательность шагов. Это снижает аккумуляцию ошибки.

Можно взять новый ряд и сразу прогнозировать, без обучения. Одна модель может работать с финансовыми рядами, продажами и другими данными. Patch decoding позволяет эффективно предсказывать длинные последовательности.

Из минусов только, что очень длинных прогнозов инференс может быть медленным и если в некоторых случаях обучить модель специально на одном датасете, она может обогнать TimesFM.

В виде это хорошо разобрано. Да, с МНК тут связь "слабая") но думаю что те кто пропустил модель и используют МНК для прогнозирования продаж, им это будет очень полезно.

Про статью, внесу небольшое уточнение:

если связь нелинейная, МНК может давать смещенные оценки

Это не совсем корректно. МНК остаётся корректным, если модель линейна по параметрам. Даже если зависимость сложная, например: y = β0​ + β1*​log(x) + β2*x^3. Тут можно переписать как y = X*β, где X=(1, ​log(x), x^3). Поэтому МНК применим.

Нелинейно, в правильном ключе она была бы при:

y = β0 + e^(β1*x)

или

y = β1*β2*x

или

y = x^β1

Интересно будет посмотреть, когда для запоминания встроят логику этого исследования Titans + Miras. Это не решает полностью проблему памяти, но является своего рода фильтром, того что из генерируемой информации стоит запомнить, там где у модели возникло "удивление", то есть в ее обучающей выборке этой информации не было.

https://youtu.be/MKHGE8yjsUM

Согласен, смотрел его работы, но кроме PR не видел ничего за что так пиарят. Что-то на уровне блогеров, которые делают примеры на Youtube, только с большим пиаром.

Если уже выше хотят пиарить, то лучше бы писали, что сказал к примеру Yann Lecun, который является одним из пионеров Jepa (в частности VL-Jepa). После того как ушел из Meta, чтобы развивать архитектуру и не зацикливаться на классических LLM. А ведь именно эта архитектура (пусть не в таком виде как сейчас) претендует на замену современным мультимодальным моделям. И полезно услышать аргументы тех, кто развивает архитектуры и ищет альтернативы, а не тот кто смог сделать красивый учебный пример (так как подобного и без него много).

Скепсис к статье оправдан. Когда читаешь такие статьи, то не можешь понять, кто преувеличил: журналисты или авторы работы.

Во первых импульсные сети как пока работали плохо, так и работают не особо. Там архитектурные проблемы, я бы даже сказал скорее не работают чем работают. Так как решают только очень простые задачи вроде фильтров и ни о какой иерархии данных там вообще нет речи. Это относится и к NeuroFEM. Собственно тут можно глянуть что это

https://github.com/sandialabs/NeuroFEM/blob/main/NeuroFEM.ipynb

Из описания NeuroFEM следует, что алгоритм переводит метод конечных элементов (FEM)

в форму, исполнимую на спайковой нейронной сети (SNN) и запускается на Loihi 2.

То есть речь не о том, что Loihi решает PDE, а о том, что классическая задача FEM (Ax = b) переписана в виде динамической нейронной системы, которая сходится к решению. Это известный подход и многие PDE после дискретизации дают линейную систему Ax=b. Её можно решать как градиентный спуск, релаксационную динамику, дифференциальную систему.

Самая сомнительная часть, что мозг решает PDE на экзафлопсах. Здесь сильное преувеличение, которое дурно пахнет. Про связь с моделью моторной коры 12-летней давности звучит как, была биологическая модель динамики и её переписали в вычислительную форму и поняли, что она реализует релаксационный решатель. Вот это вполне возможно, но явно это не равнозначно фразе "мозг как PDE-машины".

Ну и главное, в статье нет обучения сложной модели. Это даже не обученная SNN, а запрограммированный динамический решатель. По уровню сложности это ближе к линейному фильтру/релаксации, чем к элементарному распознаванию образов. Сеть почти наверняка не обучали.

В задачах типа NeuroFEM происходит следующее, берётся PDE и делается дискретизация методом конечных элементов. Получается линейная система Ax=b. Эта система переписывается как динамика x`=−Ax+b. Эта динамика реализуется через спайковые нейроны. Но это не обучение. Это жёстко заданная архитектура, соответствующая матрице A. Каждый нейрон соответствует узлу сетки. Связи соответствуют коэффициентам FEM. То есть сеть кодирует матрицу, а не обучается её аппроксимировать.

Например, FEM может решать уравнение Пуассона, теплопроводность, простые стационарные PDE и другие мат задачи. Похоже, что они сконфигурировали веса, задали матрицу и запустили динамику.

Это больше похоже на аппаратную реализацию метода Якоби или Гаусса-Зейделя, чем на обучение нейросети.

Какая проблема ввода? Вы понимаете что есть общая задач убрать выбросы из данных. Данные много много тысяч элементов. Данных множество. Мы можем визуализировать или все или участки приблизив. Я привел пример приближенного и в целом одного из наборов данных.

Конечно модель видела кучу данных, и изображений кучу и приближенные и просто наборы данных.

Я не говорю что задача не решается. Я ее решил самостоятельно достаточно успешно, выбрав компромисс. Модели не смогли сами.

Вы и в работе так получаете детально расписанное ТЗ, какие отклонения у него, куда детально вставить, что надо учесть и ли ваша задача проанализировать и исходя из опыта выбрать решение? Если вы детально распишите модели все проблемы, где они могут быть, какие они, и так далее - это и есть решение задачи. Написать 20-100 строк код не проблема вообще, проблема самостоятельно найти решение. Не подогнать решение, а найти решение. Это совершенно разный класс задач.

Если вы дадите задачу решить проблему модели через агентов или не понимая, что она делаете и какой результат будет. Когда это применимо и когда нет. То в итоге вы либо не решите проблему или потратите на нее кучу времени. Но еще хуже то, что вы возможно даже не будете знать о ней, так как "вроде работает" и вы не лезли и не разбирались в коде или не понимаете его. И вам в отчете совсем другие показали, рекомендации в поисковой системе выдают мусор и так далее.

Я уже написал, что в итоге сел и быстро решил эту задачу. Модель самостоятельно не может с ней справиться. Если бы она собирала реальный проект на реальных задах, то просто все запорола бы. Я не говорю про простые проекты, а про серьезные банковские проекты или в аналитические или любой инженерный софт и так далее.

Я не говорю, что LLM бесполезна. Удобная штука для поиска, быстрого wizard кода, когда быстрее описать чем сделать или набросать шаблон и затем его довести до ума. Но ни как самостоятельная система, которая способна написать правильный и серьезный код.

Речь о том, что глядя на глобальные рисунки (а модели их видели), они видят, анализируют их. Но все равно нужно огромное время и детальное описание, куча данных. Как вы себе это представляете, вручную искать все фрагменты и отдавать? Когда человек смотрит, быстро оценивает, продумает и решает. tukey тоже не будет работать нормально по ряду причин. В этом и заключается зада программиста, не написание строчек кода, а решение и код тут вторичен. В реальности решение в том, что надо реализовывать методы правильного подбора параметров для мат методов и модель сама до такого ни у меня, ни у вас сама не додумалась и человеку с опытом это очевидно и еще ряд вещей которые стоит учитывать при реализации. Это к тому что не агентские системы, ни просто LLM не могут решать задачи самостоятельно. Они ближе к Wizard или словесному коду, где ты все детально расписал и дал и она сделала и это допустимо в определенных случаях. То что вы показываете код, вопросы и решения - это на уровне Джуна, который не подумав быстро написал код который "вроде решает", и так и бегает по кругу дорабатывает под каждый чих.

Он ломается на других данных. Но да, я его использую, но только более хитро. Хотя сейчас переписываю на другой подход, так как он тоже не выдерживает.

То есть проблема не подобрать под конкретный интервал значений. Проблема в том, что это будет ломаться на других, когда они сломают нормальные данные.

Скрытый текст

[[-0.06696627 0.06516338]
[-0.03489703 -0.26608484]
[ 0.04749564 -0.39843422]
[ 0.10074646 -0.12782019]
[ 0.10338986 0.38532736]
[ 0.05373366 0.88471337]
[ 0.00474008 1.1177341 ]
[-0.01937724 1.12247418]
[-0.06348366 1.02324915]
[-0.09659275 0.68680767]
[-0.11325134 0.19304749]
[-0.11294483 -0.37577133]
[-0.09286917 -0.93361529]
[-0.05158771 -1.38051125]
[-0.01070006 -1.61036378]
[ 0.01432249 -1.62106384]
[ 0.06191423 -1.54072795]
[ 0.09954657 -1.20981633]
[ 0.11936263 -0.69943307]
[ 0.12048324 -0.09911078]
[ 0.09953754 0.49634622]
[ 0.04564962 0.97534513]
[ 0.01758727 1.1956814 ]
[-0.00218539 1.23085593]
[-0.06018518 1.20630136]
[-0.11794497 0.87041962]
[-0.13422892 0.2662691 ]
[-0.10773771 -0.39832407]
[-0.0365943 -0.90806878]
[ 0.00379152 -1.05444599]]

Скрытый текст

[[ 0.11547587 -3.51388294]
[ 0.12941082 -2.9291204 ]
[ 0.14057426 -2.27606886]
[ 0.1489268 -1.56858588]
[ 0.15303102 -0.82106067]
[ 0.15148317 -0.05583759]
[ 0.14547436 0.69907023]
[ 0.13623506 1.42230187]
[ 0.12379899 2.09773865]
[ 0.10816615 2.7093967 ]
[ 0.08945534 3.24129216]
[ 0.0692831 3.67856503]
[ 0.04938572 4.01490526]
[ 0.03033934 4.25218257]
[ 0.01214696 4.39465499]
[-0.00518489 4.44659248]
[-0.02161408 4.41231612]
[-0.03712702 4.29635149]
[-0.05153704 4.10330442]
[-0.06426933 3.83891352]
[-0.07375026 3.51226877]
[-0.07951361 3.14007816]
[-0.08155718 2.74092961]
[-0.06014731 2.33344058]
[-0.05727865 2.01423642]
[-0.06996945 1.71134728]
[-0.0609416 1.36571018]
[-0.04988847 1.06622498]
[-0.03681007 0.82301804]
[-0.014328 0.64621575]]

Скрытый текст

[[-7.27760962e-02 -6.86302929e+00]
[-7.07112410e-02 -7.22588903e+00]
[-6.85684812e-02 -7.57838554e+00]
[-6.63478168e-02 -7.92012930e+00]
[-6.40492480e-02 -8.25073078e+00]
[-6.16727746e-02 -8.56980047e+00]
[-5.92183966e-02 -8.87694884e+00]
[-5.66861141e-02 -9.17178637e+00]
[-5.40759271e-02 -9.45392353e+00]
[-5.13878355e-02 -9.72297080e+00]
[-4.86218393e-02 -9.97853867e+00]
[-4.57779387e-02 -1.02202376e+01]
[-4.28561335e-02 -1.04476781e+01]
[-3.98564237e-02 -1.06604706e+01]
[-3.67853531e-02 -1.08582256e+01]
[-3.36850466e-02 -1.10406047e+01]
[-3.05681826e-02 -1.12074740e+01]
[-2.74347611e-02 -1.13587506e+01]
[-2.42847820e-02 -1.14943519e+01]
[-2.11182455e-02 -1.16141951e+01]
[-1.79351515e-02 -1.17181972e+01]
[-1.47354999e-02 -1.18062756e+01]
[-8.88138750e-03 -1.18783475e+01]
[-6.94371445e-03 -1.19244247e+01]
[-6.33891670e-03 -1.19601623e+01]
[-3.07965812e-03 -1.19902297e+01]
[-4.60660988e-04 -1.20039926e+01]
[ 8.52988672e-04 -1.20049139e+01]
[ 3.49000658e-03 -1.20013679e+01]
[ 5.09914958e-03 -1.19822634e+01]]

Можно ли подобрать значения? коэф и прочие вещи под эти данные? ну в теории можно. Будет ли это работать на всей траектории? с агентами и просто ллм нет, потому что сам подход хитрее, чтобы работало корректнее. И LLM сама до него не догадывается, а просто пытается применить применить известные методы и меня их настройки. Ну и зачем такое решение, которое умеет считать только 2+2 и не умеет считать 50+22.

Вот пример полной траектории. Это сплайн траектории по сути (визуально). Зачем мне скармливать по каждой точке на куче данных? Зачем мне тогда вообще LMM? Я понимаю как решить задачу, так как в голове у меня есть опыт и я сразу представляю как решать. Но если я подробно опишу это все модели во всех деталях. то это уже будет больше чем самого кода. Смысл сетки, чтобы имея данные суметь решить задачу, а не узкий ее фрагмент. Естественно я пробовал всю задачу решать через сетку. Просто выше приводил ее фрагмент для наглядной визуализации. Какой пример данных скормить? Тысячи. и десятки тысяч данных? Да они в этом случае начинают ломаться, когда их просишь на большом массиве данных расставить их в таблицу, чтобы визуализировать внутри модели. И они легко терять их. Эту задачу можно самостоятельно решить гораздо быстрее.

Речь о том, что вы в проекте не знаете, где именно это произойдет. У вас будет например работа со счетами и аккредитивами, или электронными сообщения, Swift где нужно правильно убирать все. Гонять миллион данных в сетке для теста, чтобы они подобрала? Это так не работает.

Информация

В рейтинге
2 473-й
Откуда
Москва, Москва и Московская обл., Россия
Зарегистрирован
Активность