Что значит 32k на один вопрос? Речь про размер контекстного окна. У многих моделей он до 32k в целом. Есть больше как описал выше. Вы хоть 50 вопросов напишите, они все будут являться одной цепочкой ограниченной 32к или 128к или сколько возможно. Иначе это 50 новых чатов.
Вы видимо не поняли, как происходит рассинхронизация модуляции. Она измеряется не размером вопроса и не предложениями.
Речь идет про тип задачи. О том, что у моделей ни где не заложено понятие времени. У мозга под время есть отдельный участок в Энторинальной коре, где есть нейронные клетки времени. Это помогает нам отмерять события и сравнивать их, и вероятно как раз используется при решении временных задач, как например есть клетки места и другие. У сеток ничего подобного нет, только обобщение множества данных при обучении. Поэтому мы можем взять хоть супер продвинутую, решить задачу только в рамках данной архитектуры нельзя. Если только не натаскать ее отдельно на ней. Но это не позволит все равно решить ее при сильном изменении условий.
Тот же режим исследования в ChatGPT неплохо собирает и обобщает задачу, хотя и очень долго (по моему минут 15). Но не решает. Но в целом часто собирает не плохо, пока не посмотришь как он это делал и тогда все печальнее. В одном таком исследовании он прошелся по разным форумам, где были срачи уровня одна бабка нашептала (видны диалоги его анализа) и это тоже отражается на его результате. Мне бы в голову не пришло лезть для анализа на сайт уровня "woman.ru" при запросе про неокортекс, так как для меня там мусор. А OpenAI в режиме исследования нет разницы, он использует все эти материалы (по какому принципу он их ранжирует не знаю).
Но в целом вы правы, могут и что-то другое выдать. Просто пока что, все их пиар компании про reasoning, на деле оказывались гораздо слабее, чем обещано. Поэтому доверять на слово я бы не стал.
Сбер тоже пишет, что они лучше на русских бенчмарках. При чем тоже сделали рассуждающую модель взяв deepseek (в одной статье выкладывали ссылку на свой гитхаб). Но как была у них модель тупой, так и осталась. Только добавилось генерация тонны мусора как рассуждение. И что lite что их максимальная версия с рассуждениями не смогла решить элементарную задачу про размерности матриц при перемножении (выкладывал в комментариях).
А разработки Тинькофф ещё слабее Сбера в плане нейронок. Поэтому быстрее поверишь в макаронного монстра, чем в бечмарки от этих компаний.
У меня 1234545 бананов. Год назад я съел 343433 банана. Затем на прошлой недели купил 120 бананов. Сколько бананов у меня осталось?
Как было полное отсутствие понимания времени, так и осталось. Поэтому легко придумать математическую задачу, которую он не решит.
Что самое интересное, данная задача про бананы была в другой форме и гуляла в инете. Так openai обучили на ней и конкретно в ней он выдает правильный ответ. Но любой шаг в сторону и уже не справляется
Без конкретного примера до конца не понятно, зачем это нужно и как работает.
Надо было привести пример. Например, над написать статью о ракетах.
Например, у нас есть агенты:
Поисковый агент — ищет статьи и исследования.
Аналитический агент — анализирует источники и выделяет ключевые идеи.
Писательский агент — пишет черновик статьи.
Редактор — проверяет стиль и грамматику.
Фактчекер — проверяет утверждения на достоверность.
При обычной агентской системе мы должны вручную задать, как они взаимодействуют в рамках нашей задачи.
В случае AFlow это автоматизируется. Система методом MCTS (Monte Carlo Tree Search) делает дерево различных цепочек:
Поиск источников → Анализ → Написание → Фактчек → Результат
Другой вариант: Поиск → Написание → Фактчек → Редактор
И оценивает, насколько хорошо каждый рабочий процесс выполнил задачу:
Качество текста
Точность утверждений
Структура статьи
Ссылки на источники
Затем AFlow запоминает, какие структуры работают лучше, и фокусируется на них в следующих итерациях. Например, он может понять:
Если фактчек делается до написания , это помогает писать точнее.
Если анализ идёт после поиска , это улучшает структуру статьи.
То есть по итогу, он подбирает оптимальную последовательность выполнения агентами задания. А то по статье выше я например не понял сразу, что он делает. Пришлось смотреть в исходную статью.
Про новый чат вы правы. Только дело не в просто потере контекста. Это проблема вообще большого контекста в современных LLM. Там легко начинается рассинхрон модуляции, просто на длинных диалогах это лучше заметно. Так как они обучены на обобщении периода модуляции, а в реальном тексте он не обобщенный. Поэтому она не просто забывает прошлые детали, она не правильно выделяет связи/детали, что выглядит как забывание. В "вокруг пруд и красное яблоко..." вместо "красное яблоко" выделит "пруд, красное" и дальше пошло предсказание токенов по другому маршруту.
Когда мы создаем новый чат, то начинает с нуля. Когда еще нет рассинхрона. Вообще рассинхрон не сложно создать даже в первом сообщении и он будет виден на следующих. Но к обычным текстам это не относится, там это будет проявляться слабее.
Тут как раз описывал это на примере LLM и серотонина https://t.me/greenruff/2456 . В рамках нейронной сети, дело во временном окне, которое имеет разную чувствительность. А у LLM оно обобщено. Поэтому все эти контекста на 32к и 128к и более просто бессмысленные на современных архитектурах.
Сплошная вода. Эксперты в чем, в разработке внутренних продуктов своей компании? В области нейронок экспертов не увидел. Выражения суперпамять, супер агент, сверхинтеллект применяются тогда, когда значимых результатов нет или таким образом компенсируют некомпетентность в данном вопросе за счет эмоциональной вовлеченности слушателя.
Так теорема Лагранжа не основана на законах Ньютона. Посмотрите видео, там все начиналось с поиска кратчайшего пути при минимальных затратах энергии из точки A в точку B, без всяких гравитаций. И да, закон Ньютона сейчас можно вывести из нее (на момент жизни Ньютона эта математика была в начале пути).
Посмотрите видео, там показано как все началось с коэффициента преломления (если я правильно помню).
У LinOSS-IM частично это решено через комплексный оператор A с отрицательной вещественной частью, где A задается как diag(−softplus(Alog)+i⋅Aim) , где Re(A)<0.
Но конечно там надо следить за тем, чтобы из за дискретности другие параметры не привели к проблемам, вроде роста dt и других. Но если это грамотно учитывать, то все нормально. А так идеальных систем в нейронных сетях не бывает, особенно в динамических.
насчет bibo, то чистая SSM да не обладает. LinOSS-IM обладает, так как там затухание. Но, когда я расширял модель SSM (вывел ее через туже кинематику), то BIBO-устойчивость была проблемой связанной с дискретностью, так как затухание не успевало за ускорением и происходил рост. Но это решается, если правильно учесть этот момент, сейчас подобных проблем нет.
Поэтому с теоремой Винера-Леви все нормально, если учесть этот момент. Но да, надо быть к нему готовым, если использовать в чистом виде SSM/LinOSS/Mamba. Я не помню, чтобы в них это учитывалось и могут быть такие последовательности, где из-за дискретности состояния затухание будет расходится с ускорением и тогда взрыв градиентов. Так что этот момент вполне решается, если его учесть.
Все таки универсальная аппроксимация зависит от наличия нелинейностей в IMEX. И это верно если архитектура линейная, но разные разновидности SSM могут быть как линейными, так и не линейными.
Музыкальные композиции, не важно в Midi или спектрограммах это периодические данные, не важно с затуханием или с динамическим периодом. Поэтому тут в любом случае лучше использовать LinOSS-IM (это SSM с осцилляцией, через замену в уравнении матрицы A на комплексную, для описания колебаний)
Это конечно не панацея, но если нужно еще модуляция (механизм внимания), то выводил математически и дорабатывал ее. В комментариях выкладывал код. Оптимизацию пока не делал, но в целом это лучше, чем просто SSM/LinOSS-IM. Хотя в названии LinOSS-IM, но из нее была взято как раз комплексная составляющая для осцилляции. Так что для данных лучше использовать ее, для MIDI это точно.
Минус не ставил, но в вашем примере есть проблема, так как в вашем случае следовало бы использовать цепочку SMM или mamba или linoss-im или хотя бы гибрид с трансформерами. Когда речь заходит про генерацию музыки. Это даст более качественный результат, чем трансформеры. В вашем случае позиционирование разделяет временные участки.
Моторы от дронов, и в целом сборка выходит в 5000$, что не так уж и дешево.
У Института интеллектуальных систем Макса Планка и Калифорнийского университета уже был проект шагающего робота с open source BirdBot. Все такие проекты, требуют не дешевых моторов. У того же BirdBot (ноги) один мотор стоит ~70 тыс руб, а их надо 4.
Модели LLM и другие упираются не в невидимую стену. Это следствие того, что при увеличении объема данных, признаки обобщаются. Нельзя одновременно получить модель, которая будет улавливать детали и обобщать их. С ростом данных , детали неизбежно теряются. Тут поможет только множество специализированных LLM работающих вместе.
Это выводится из Лагранжа, из за минимизации энтропии
Но, в целом при этом энтропия всей системы продолжает расти.
https://t.me/greenruff/2306
Что касается саморефлексии, то рассуждающие модели не полноценно не реализуют. Выше небольшой фрагмент петли саморефлексии в мозге. Тут важно заметить, что при ней происходит определение ошибки, а не только конечного сигнала. Конечный сигнал через гиппокамп (память) повторно идёт на вход, но при этом остаточная ошибка (как минимум в ACC, хотя не только) тоже идёт обратно на вход через таламус и при этом модулирует повторно сигнал на входе и из памяти. У рассуждающие моделей этого нет, а и мультмодальных.
https://t.me/greenruff/2431?single
Ещё одним важным моментом, является рассинхрон модуляции. Это связано со временем. Все LLM и прочие, обобщают время. И поэтому модуляция признаков происходит обобщенно по времени. Но в тексте и речи, это не так. Разные фрагменты речи имеют разное время из за хотя бы эмоционального окраса. Это нарушает правильную синхронизацию модуляции признаков. Мозг, синхронизирует это, в llm нет такого механизма. Как итог, при длинных диалогов, происходит сильный рассинхрон, и вместо усиления связанных признаков "красное яблоко", модель усиливает "Маша яблоко", что приводит к ошибкам при дальнейшем предсказании токенов, так как усиливаются другие. Теряются детали, смысловые связи. Это отлично видно при генерации кода в программировании, там этот рассинхрон особенно заметен.
Кто вам сказал, про Мышление без слов? У очень многих животных уже определили, наличие сложной речи. Например летучие мыши. Кроме того, откуда вы взяли что саморефлексия должна быть построена только на словах? Возьмите например глухих от рождения, у них так же присутствует "внутренний голос", только он не речевой а с помощью образов. Более того, было исследование, что у многих обычных людей (врать не будут, по-моему было указано 20-25%) нет внутренней речевой саморефлексии. Но она может быть через зрительные или другие сенсорные образы (тактильные, запахи).
Из современных про Бонобо, пример. В «языке» диких бонобо смысл фраз не сводится к сумме смыслов слов
Ну основа речи, артикуляция не зависит от ее формы и у всех животных сводится к одной форме. В общем имеет одинаковое фазовое пространство градиентов речи, которые отражают артикуляцию. При этом, как оказалось нет разницы какая форма артикуляторов: язык с гортанью, Melon с мешочками как у дельфинов, или две гортани верхнюю (larynx) и нижнюю (syrynx) как у многих птиц, или жужжальца у пчел или пузо/лапки при трении у муравьев - все они из общих принципов минимизации энергии стремятся к одной форме (разного масштаба и расположения). Конечно артикуляция это еще не речь, но смысл в том, что разные формы реализации приводят к одинаковым формам фазового пространства из-за стремления системы минимизировать энергетические затраты. Поэтому, разная форма зрения, речи в итоге все равно должно стремится к минимизации энтропии (одинаковому фазовому пространству).
Не понятно, откуда вы взяли такие выводы? Можно источники? Или четкое обоснование и факты, которые можно проверить?
Это сложно назваться полноценной игрой. Скорее удобный вариант изучения программирования или движка.
Скрытый текст
Некоторые скриншоты
Я так тоже пробовал варианты написал игру за неделю только с помощью нейронок. Увы, на первых шагах мне пришлось подключаться самому и включать мозг и делать самостоятельно уже на уровне взаимодействия сцен и работы элементов (делал на юнити).
Дальше стало ещё хуже. Сетка пересматривала структуру данных, ломала код, не могла решить множество простых проблем (тут нужен опыт).
В итоге, я понял что в реальности мне приходиться больше исправлять за сеткой, чем пользы от нее. В итоге эксперимент написать нормальную игру за неделю только с помощью сеток провалился. Все руки не доходят сесть и доделать самому, хотя в играх код всегда примитивный. В них гораздо важнее связи элементов, из структуры и продуманность.
Как по мне, практика показывает, что может в самом начале и можно накидать сеткой, но дальше все равно надо править самому все и забить на них.
Так же, если ты не знаешь язык на котором делаешь игру, тонкости движка, его проблемы, то игру не напишешь. Демку да, полноценную игру нет. С учётом полноценной загрузки сцен, оптимизации и так далее.
Дополню к прошлому ответу, до этого для подобных вещей использовался другой подход. Основанный на согласовании поведения моделей с человеческими ценностями через обучение с подкреплением (RLHF). В OpenAI им занимался к примеру Дэниэл Леви (Daniel Levy), сейчас по моему ушел с Суцкевером.
Например эти исследования и подходы
"Aligning Language Models to Human Values" (OpenAI, 2021) — исследование методов согласования поведения моделей с человеческими ценностями через обучение с подкреплением (RLHF).
Работы по детектированию вредоносного использования ИИ, такие как "Forecasting transformative AI governance challenges" (OpenAI, 2023).
ну и в частности
"Fine-Tuning Language Models from Human Preferences" (2019) — использование RL для настройки моделей под человеческие предпочтения.
RLHF решает задачу «согласования» (alignment) через три этапа:
Сбор человеческой обратной связи Люди оценивают ответы модели на запросы, сравнивая несколько вариантов и выбирая наиболее предпочтительный. Например, два ответа на вопрос: один вежливый и безопасный, другой — грубый или спорный. Такие сравнения формируют обучающий набор для модели вознаграждения.
Обучение модели вознаграждения (Reward Model) На основе собранных данных создается модель, которая предсказывает, какой ответ человек сочтет лучшим. Эта модель выступает в роли «вознаграждения» для обучения самой языковой модели.
Файн-тюнинг языковой модели с помощью RL Используя модель вознаграждения, языковая модель обучается генерировать ответы, которые максимизируют это вознаграждение. Таким образом, модель учится адаптироваться к человеческим предпочтениям.
Но этот подход плохо масштабируется, так как стоит огромных денег. OpenAI использовала его в 2019 году и явно использует сейчас. Но, он слишком затратный и имеет много проблем при оценке. Кто-то оценивает краткость, а кто детализацию ответа. И получается сильный разброс.
Собственно это одна из причин почему перешли на MAS на основе Deep CFR. Он более гибкий, дешевле и легче масштабируем. Так как в MAS агентов могут обучить на разных правилах, по которым они потом оценивают ответы, чтобы дать оценку вопросу пользователя или для тюнинга модели.
Как пример, есть два подхода (в реальности их больше), где MAS на основе DeepCFR хорошо масштабируется и очень удобен:
Constitutional AI : Модель обучается на правилах (например, правах человека) вместо прямой обратной связи.
Debate : Две модели спорят между собой, а третья оценивает их аргументы.
Так что DeepCFR просто более качественный, универсальный, экономически более выгодный и легче масштабируется. Так как можно обучить агента под конкретные правила. Завтра поменялись правила, заменили какого то из агентов. Чем переобучать/fine-tuning всю модель.
Что значит 32k на один вопрос? Речь про размер контекстного окна. У многих моделей он до 32k в целом. Есть больше как описал выше. Вы хоть 50 вопросов напишите, они все будут являться одной цепочкой ограниченной 32к или 128к или сколько возможно. Иначе это 50 новых чатов.
Вы видимо не поняли, как происходит рассинхронизация модуляции. Она измеряется не размером вопроса и не предложениями.
Речь идет про тип задачи. О том, что у моделей ни где не заложено понятие времени. У мозга под время есть отдельный участок в Энторинальной коре, где есть нейронные клетки времени. Это помогает нам отмерять события и сравнивать их, и вероятно как раз используется при решении временных задач, как например есть клетки места и другие. У сеток ничего подобного нет, только обобщение множества данных при обучении. Поэтому мы можем взять хоть супер продвинутую, решить задачу только в рамках данной архитектуры нельзя. Если только не натаскать ее отдельно на ней. Но это не позволит все равно решить ее при сильном изменении условий.
Тот же режим исследования в ChatGPT неплохо собирает и обобщает задачу, хотя и очень долго (по моему минут 15). Но не решает. Но в целом часто собирает не плохо, пока не посмотришь как он это делал и тогда все печальнее. В одном таком исследовании он прошелся по разным форумам, где были срачи уровня одна бабка нашептала (видны диалоги его анализа) и это тоже отражается на его результате. Мне бы в голову не пришло лезть для анализа на сайт уровня "woman.ru" при запросе про неокортекс, так как для меня там мусор. А OpenAI в режиме исследования нет разницы, он использует все эти материалы (по какому принципу он их ранжирует не знаю).
Но в целом вы правы, могут и что-то другое выдать. Просто пока что, все их пиар компании про reasoning, на деле оказывались гораздо слабее, чем обещано. Поэтому доверять на слово я бы не стал.
Сбер тоже пишет, что они лучше на русских бенчмарках. При чем тоже сделали рассуждающую модель взяв deepseek (в одной статье выкладывали ссылку на свой гитхаб). Но как была у них модель тупой, так и осталась. Только добавилось генерация тонны мусора как рассуждение. И что lite что их максимальная версия с рассуждениями не смогла решить элементарную задачу про размерности матриц при перемножении (выкладывал в комментариях).
А разработки Тинькофф ещё слабее Сбера в плане нейронок. Поэтому быстрее поверишь в макаронного монстра, чем в бечмарки от этих компаний.
Этот же openai.
У меня 1234545 бананов. Год назад я съел 343433 банана. Затем на прошлой недели купил 120 бананов. Сколько бананов у меня осталось?
Как было полное отсутствие понимания времени, так и осталось. Поэтому легко придумать математическую задачу, которую он не решит.
Что самое интересное, данная задача про бананы была в другой форме и гуляла в инете. Так openai обучили на ней и конкретно в ней он выдает правильный ответ. Но любой шаг в сторону и уже не справляется
Без конкретного примера до конца не понятно, зачем это нужно и как работает.
Надо было привести пример. Например, над написать статью о ракетах.
Например, у нас есть агенты:
Поисковый агент — ищет статьи и исследования.
Аналитический агент — анализирует источники и выделяет ключевые идеи.
Писательский агент — пишет черновик статьи.
Редактор — проверяет стиль и грамматику.
Фактчекер — проверяет утверждения на достоверность.
При обычной агентской системе мы должны вручную задать, как они взаимодействуют в рамках нашей задачи.
В случае AFlow это автоматизируется. Система методом MCTS (Monte Carlo Tree Search) делает дерево различных цепочек:
Поиск источников → Анализ → Написание → Фактчек → Результат
Другой вариант: Поиск → Написание → Фактчек → Редактор
И оценивает, насколько хорошо каждый рабочий процесс выполнил задачу:
Качество текста
Точность утверждений
Структура статьи
Ссылки на источники
Затем AFlow запоминает, какие структуры работают лучше, и фокусируется на них в следующих итерациях. Например, он может понять:
Если фактчек делается до написания , это помогает писать точнее.
Если анализ идёт после поиска , это улучшает структуру статьи.
То есть по итогу, он подбирает оптимальную последовательность выполнения агентами задания. А то по статье выше я например не понял сразу, что он делает. Пришлось смотреть в исходную статью.
Про новый чат вы правы. Только дело не в просто потере контекста. Это проблема вообще большого контекста в современных LLM. Там легко начинается рассинхрон модуляции, просто на длинных диалогах это лучше заметно. Так как они обучены на обобщении периода модуляции, а в реальном тексте он не обобщенный. Поэтому она не просто забывает прошлые детали, она не правильно выделяет связи/детали, что выглядит как забывание. В "вокруг пруд и красное яблоко..." вместо "красное яблоко" выделит "пруд, красное" и дальше пошло предсказание токенов по другому маршруту.
Когда мы создаем новый чат, то начинает с нуля. Когда еще нет рассинхрона. Вообще рассинхрон не сложно создать даже в первом сообщении и он будет виден на следующих. Но к обычным текстам это не относится, там это будет проявляться слабее.
Тут как раз описывал это на примере LLM и серотонина https://t.me/greenruff/2456 . В рамках нейронной сети, дело во временном окне, которое имеет разную чувствительность. А у LLM оно обобщено. Поэтому все эти контекста на 32к и 128к и более просто бессмысленные на современных архитектурах.
Сплошная вода. Эксперты в чем, в разработке внутренних продуктов своей компании? В области нейронок экспертов не увидел. Выражения суперпамять, супер агент, сверхинтеллект применяются тогда, когда значимых результатов нет или таким образом компенсируют некомпетентность в данном вопросе за счет эмоциональной вовлеченности слушателя.
Так теорема Лагранжа не основана на законах Ньютона. Посмотрите видео, там все начиналось с поиска кратчайшего пути при минимальных затратах энергии из точки A в точку B, без всяких гравитаций. И да, закон Ньютона сейчас можно вывести из нее (на момент жизни Ньютона эта математика была в начале пути).
Посмотрите видео, там показано как все началось с коэффициента преломления (если я правильно помню).
Мне кажется автору следует посмотреть теорему Лагранжа или как постепенно она приняла свою форму (прошла путь в ~400-500 лет)
https://youtu.be/C2tL1A3B3cY?si=Wf8tLprelZMplGDR
Также посмотреть про точки Лагранжа (видео на эту тему много) и задачу трех тел.
У LinOSS-IM частично это решено через комплексный оператор A с отрицательной вещественной частью, где A задается как diag(−softplus(Alog)+i⋅Aim) , где Re(A)<0.
Но конечно там надо следить за тем, чтобы из за дискретности другие параметры не привели к проблемам, вроде роста dt и других. Но если это грамотно учитывать, то все нормально. А так идеальных систем в нейронных сетях не бывает, особенно в динамических.
насчет bibo, то чистая SSM да не обладает. LinOSS-IM обладает, так как там затухание. Но, когда я расширял модель SSM (вывел ее через туже кинематику), то BIBO-устойчивость была проблемой связанной с дискретностью, так как затухание не успевало за ускорением и происходил рост. Но это решается, если правильно учесть этот момент, сейчас подобных проблем нет.
Поэтому с теоремой Винера-Леви все нормально, если учесть этот момент. Но да, надо быть к нему готовым, если использовать в чистом виде SSM/LinOSS/Mamba. Я не помню, чтобы в них это учитывалось и могут быть такие последовательности, где из-за дискретности состояния затухание будет расходится с ускорением и тогда взрыв градиентов. Так что этот момент вполне решается, если его учесть.
Все таки универсальная аппроксимация зависит от наличия нелинейностей в IMEX. И это верно если архитектура линейная, но разные разновидности SSM могут быть как линейными, так и не линейными.
"и" случайно попало в текст ссылки
https://openreview.net/pdf?id=GRMfXcAAFh
Музыкальные композиции, не важно в Midi или спектрограммах это периодические данные, не важно с затуханием или с динамическим периодом. Поэтому тут в любом случае лучше использовать LinOSS-IM (это SSM с осцилляцией, через замену в уравнении матрицы A на комплексную, для описания колебаний)
Статья про них: https://openreview.net/pdf?id=GRMfXcAAFhи
GitHub : https://github.com/tk-rusch/linoss/tree/main
По классу у них разделение:
S5 : Как пружина, которая быстро затухает.
LinOSS-IM : Как маятник, который колеблется, но со временем останавливается.
LinOSS-IMEX : Как маятник без трения — колебания продолжаются бесконечно.
Это конечно не панацея, но если нужно еще модуляция (механизм внимания), то выводил математически и дорабатывал ее. В комментариях выкладывал код. Оптимизацию пока не делал, но в целом это лучше, чем просто SSM/LinOSS-IM. Хотя в названии LinOSS-IM, но из нее была взято как раз комплексная составляющая для осцилляции. Так что для данных лучше использовать ее, для MIDI это точно.
Минус не ставил, но в вашем примере есть проблема, так как в вашем случае следовало бы использовать цепочку SMM или mamba или linoss-im или хотя бы гибрид с трансформерами. Когда речь заходит про генерацию музыки. Это даст более качественный результат, чем трансформеры. В вашем случае позиционирование разделяет временные участки.
Эта новость уже ранее была на Habr еще в апреле. Автор не стал искать ее заранее.
Что касается ссылки на сборку: Berkeley Humanoid Lite Docs
https://berkeley-humanoid-lite.gitbook.io/docs
Моторы от дронов, и в целом сборка выходит в 5000$, что не так уж и дешево.
У Института интеллектуальных систем Макса Планка и Калифорнийского университета уже был проект шагающего робота с open source BirdBot. Все такие проекты, требуют не дешевых моторов. У того же BirdBot (ноги) один мотор стоит ~70 тыс руб, а их надо 4.
Модели LLM и другие упираются не в невидимую стену. Это следствие того, что при увеличении объема данных, признаки обобщаются. Нельзя одновременно получить модель, которая будет улавливать детали и обобщать их. С ростом данных , детали неизбежно теряются. Тут поможет только множество специализированных LLM работающих вместе.
Это выводится из Лагранжа, из за минимизации энтропии
https://t.me/greenruff/2368
Но, в целом при этом энтропия всей системы продолжает расти.
Что касается саморефлексии, то рассуждающие модели не полноценно не реализуют. Выше небольшой фрагмент петли саморефлексии в мозге. Тут важно заметить, что при ней происходит определение ошибки, а не только конечного сигнала. Конечный сигнал через гиппокамп (память) повторно идёт на вход, но при этом остаточная ошибка (как минимум в ACC, хотя не только) тоже идёт обратно на вход через таламус и при этом модулирует повторно сигнал на входе и из памяти. У рассуждающие моделей этого нет, а и мультмодальных.
Ещё одним важным моментом, является рассинхрон модуляции. Это связано со временем. Все LLM и прочие, обобщают время. И поэтому модуляция признаков происходит обобщенно по времени. Но в тексте и речи, это не так. Разные фрагменты речи имеют разное время из за хотя бы эмоционального окраса. Это нарушает правильную синхронизацию модуляции признаков. Мозг, синхронизирует это, в llm нет такого механизма. Как итог, при длинных диалогов, происходит сильный рассинхрон, и вместо усиления связанных признаков "красное яблоко", модель усиливает "Маша яблоко", что приводит к ошибкам при дальнейшем предсказании токенов, так как усиливаются другие. Теряются детали, смысловые связи. Это отлично видно при генерации кода в программировании, там этот рассинхрон особенно заметен.
и заодно, стоит вспомнить старый советский док фильм "Думают ли животные". До сих пор те эксперименты актуальны.
Кто вам сказал, про Мышление без слов? У очень многих животных уже определили, наличие сложной речи. Например летучие мыши. Кроме того, откуда вы взяли что саморефлексия должна быть построена только на словах? Возьмите например глухих от рождения, у них так же присутствует "внутренний голос", только он не речевой а с помощью образов. Более того, было исследование, что у многих обычных людей (врать не будут, по-моему было указано 20-25%) нет внутренней речевой саморефлексии. Но она может быть через зрительные или другие сенсорные образы (тактильные, запахи).
Из современных про Бонобо, пример. В «языке» диких бонобо смысл фраз не сводится к сумме смыслов слов
https://elementy.ru/novosti_nauki/434331/V_yazyke_dikikh_bonobo_smysl_fraz_ne_svoditsya_k_summe_smyslov_slov
Источник: https://www.science.org/doi/10.1126/science.adv1170
Аналогичный пример про шимпанзе. «Язык» шимпанзе позволяет из десятка элементов строить сотни фраз с разными смыслами
https://elementy.ru/novosti_nauki/433972/Yazyk_shimpanze_pozvolyaet_iz_desyatka_elementov_stroit_sotni_fraz_s_raznymi_smyslami
Источник: https://www.nature.com/articles/s42003-022-03350-8
Ну основа речи, артикуляция не зависит от ее формы и у всех животных сводится к одной форме. В общем имеет одинаковое фазовое пространство градиентов речи, которые отражают артикуляцию. При этом, как оказалось нет разницы какая форма артикуляторов: язык с гортанью, Melon с мешочками как у дельфинов, или две гортани верхнюю (larynx) и нижнюю (syrynx) как у многих птиц, или жужжальца у пчел или пузо/лапки при трении у муравьев - все они из общих принципов минимизации энергии стремятся к одной форме (разного масштаба и расположения). Конечно артикуляция это еще не речь, но смысл в том, что разные формы реализации приводят к одинаковым формам фазового пространства из-за стремления системы минимизировать энергетические затраты. Поэтому, разная форма зрения, речи в итоге все равно должно стремится к минимизации энтропии (одинаковому фазовому пространству).
Не понятно, откуда вы взяли такие выводы? Можно источники? Или четкое обоснование и факты, которые можно проверить?
Это сложно назваться полноценной игрой. Скорее удобный вариант изучения программирования или движка.
Скрытый текст
Некоторые скриншоты
Я так тоже пробовал варианты написал игру за неделю только с помощью нейронок. Увы, на первых шагах мне пришлось подключаться самому и включать мозг и делать самостоятельно уже на уровне взаимодействия сцен и работы элементов (делал на юнити).
Дальше стало ещё хуже. Сетка пересматривала структуру данных, ломала код, не могла решить множество простых проблем (тут нужен опыт).
В итоге, я понял что в реальности мне приходиться больше исправлять за сеткой, чем пользы от нее. В итоге эксперимент написать нормальную игру за неделю только с помощью сеток провалился. Все руки не доходят сесть и доделать самому, хотя в играх код всегда примитивный. В них гораздо важнее связи элементов, из структуры и продуманность.
Как по мне, практика показывает, что может в самом начале и можно накидать сеткой, но дальше все равно надо править самому все и забить на них.
Так же, если ты не знаешь язык на котором делаешь игру, тонкости движка, его проблемы, то игру не напишешь. Демку да, полноценную игру нет. С учётом полноценной загрузки сцен, оптимизации и так далее.
Дополню к прошлому ответу, до этого для подобных вещей использовался другой подход. Основанный на согласовании поведения моделей с человеческими ценностями через обучение с подкреплением (RLHF). В OpenAI им занимался к примеру Дэниэл Леви (Daniel Levy), сейчас по моему ушел с Суцкевером.
Например эти исследования и подходы
"Aligning Language Models to Human Values"(OpenAI, 2021) — исследование методов согласования поведения моделей с человеческими ценностями через обучение с подкреплением (RLHF).Работы по детектированию вредоносного использования ИИ, такие как"Forecasting transformative AI governance challenges"(OpenAI, 2023).ну и в частности
"Fine-Tuning Language Models from Human Preferences"(2019) — использование RL для настройки моделей под человеческие предпочтения.RLHF решает задачу «согласования» (alignment) через три этапа:
Сбор человеческой обратной связи
Люди оценивают ответы модели на запросы, сравнивая несколько вариантов и выбирая наиболее предпочтительный. Например, два ответа на вопрос: один вежливый и безопасный, другой — грубый или спорный. Такие сравнения формируют обучающий набор для модели вознаграждения.
Обучение модели вознаграждения (Reward Model)
На основе собранных данных создается модель, которая предсказывает, какой ответ человек сочтет лучшим. Эта модель выступает в роли «вознаграждения» для обучения самой языковой модели.
Файн-тюнинг языковой модели с помощью RL
Используя модель вознаграждения, языковая модель обучается генерировать ответы, которые максимизируют это вознаграждение. Таким образом, модель учится адаптироваться к человеческим предпочтениям.
Но этот подход плохо масштабируется, так как стоит огромных денег. OpenAI использовала его в 2019 году и явно использует сейчас. Но, он слишком затратный и имеет много проблем при оценке. Кто-то оценивает краткость, а кто детализацию ответа. И получается сильный разброс.
Собственно это одна из причин почему перешли на MAS на основе Deep CFR. Он более гибкий, дешевле и легче масштабируем. Так как в MAS агентов могут обучить на разных правилах, по которым они потом оценивают ответы, чтобы дать оценку вопросу пользователя или для тюнинга модели.
Как пример, есть два подхода (в реальности их больше), где MAS на основе DeepCFR хорошо масштабируется и очень удобен:
Constitutional AI : Модель обучается на правилах (например, правах человека) вместо прямой обратной связи.
Debate : Две модели спорят между собой, а третья оценивает их аргументы.
Так что DeepCFR просто более качественный, универсальный, экономически более выгодный и легче масштабируется. Так как можно обучить агента под конкретные правила. Завтра поменялись правила, заменили какого то из агентов. Чем переобучать/fine-tuning всю модель.