это понятно. Остановить прогресс не получится но найти социальную форму жизни всего человечества в состоянии тотальной безработицы и безделья будет крайне проблематично, особенно для непоседливого Запада. Я общался с Google AI и мы пришли к единственно возможному положительному варианту развития событий. Люди должны стать младшими партнерами машин в огромной космической экспансии и переустройстве природы вне Земли. Но это слишком фантастический план в нашу смутную эпоху локальных войн и перемен. Спасибо, Удачи!
на самом деле проблема реальна. Уже очень скоро ИИ и тотальная роботизация вышвырнут на улицы абсолютно всех людей. Никакие профессии, навыки, таланты и упорство не будет востребовано экономически. Роботам не надо платить зарплату, премиальные, выходные пособия, с них нельзя брать подоходный и иные налоги. Капиталистическая система просто развалиться. Просто негде будет брать деньги они перестанут быть мерилом труда и благ. Как это предотвратить абсолютно не ясно. Коммунистический Китай скорее всего сможет найти способ распределения благ, но не капитализм. :-/
Интересные рассуждения. Но к уравнениям Ньютона люди пришли только через 10 тыс. лет цивилизации, Через 2.8 миллиона лет появления человека как вида и через 4 миллиарда лет эволюции жизни. Я это к чему? Просто подать на вход трансформера видео бесконечного количества падений мячика на землю не даст уравнений Ньютона. Но почему не использовать в пайплайне восприятия готовые 3D движки физики? Эта проблема давно решена в робототехнике, например в VLA (vision-language-action), «зрение-язык-действие» модель. Есть полностью открытые проекты (OpenVLA — Стэнфорд). Спасибо, Удачи !
Тема важная, но мне кажется, что вы беретесь за нее не с того конца. Ваши рассуждения это попытка строить новую крышу дома не имея надежного фундамента и стен.
Я рассуждаю примерно так: самосознание требует понимания хорошо и плохо для меня лично. Это самый главный механизм всех живых живых существ, начиная с простейших одноклеточных амеб. Они с самого начала имели рецепторы тепла, света, химии, физических прикосновений и встроенные механизмы движений в ответ на раздражения. Это можно рассматривать как самые ранние прообразы чувств положительных и отрицательных эмоций. Далее в ходе эволюции появились многоклеточные, нервная система, нейромедиаторы, отвечающие за чувство страха, тревоги, мотивации. Потом эмоции, неокортекс и наконец самосознание.
Для реализации подобного механизма в искусственных нейросетях нам необходимо изменить самую базовую архитектуру нейрона, добавить аналоги нейромедиаторов и механизм нейромодуляции больших групп нейронов одновременно. Такие модели уже есть и они тестируются учеными разных университетов. Если интересно, я тоже этим занимаюсь.
Интересная статья. Спасибо. Самое первое замечание по поводу накопления ошибок в последовательности стадий восприятия, анализа, планирования и исполнения. На самом деле вопрос решен давным давно при помощи регуляторов с обратными связями. Пайплайн должен быть не статическим, а динамическим. Захват подходит к ручке кружки и видит, что есть небольшая разница положений, пересчитывает кинематику и меняет план действий. Как ракета с головкой самонаведения. Я не вижу большой проблемы ни в теоретической части ни в реализации. Это полностью соответствует и биологическим системам и проверено миллиарды раз технически. Да, разумеется полноценный трансформер с физическим ИИ нужен, но он не обязан быть монолитным. Должны быть уровни иерархии с локальным интеллектом, самостоятельно корректирующим свои ошибки. В этом случае погрешности не будут накапливаться и общая схема станет проще, понятней, быстрей и точней. Ещё раз Спасибо и Удачи!
Какие то слишком уж обходные пути ищутся для понимания смысла происходящего в нейросетях. С моей точки зрения для NLP надо попробовать использовать матричную грамматику. Искать матрицы глагольных трансформаций векторов эмбеддингов сущностей. Например сумма векторов состояния голодного кота и молока умножается на матрицу "есть" сытый_кот = есть*(голодный_кот+молоко). Молоко на выходе исчезает. Нелинейности нейросетей можно реализовать логическими функциями: и, или, нет.
Крутая идея и схема работы. Я нашел CodeGraph самостоятельно, запустил, проверил и только потом увидел ваш пост. В любом случае Большое Спасибо и Удачи! p.s. Да, вектора пригодятся и особенно для работы со сложными фреймворками, пакетами, библиотеками. Вызовы всех функций будет долго проверять логическим путем. Вообще проект немного напоминаем знаменитый дизассемблер IDA Ильфака Гильфанова. С ним идут мощным базы данных всех системных вызовов всех ОС и компиляторов. Скорее всего нечто подобное скоро должно появиться и с CodeGraph.
Люди и есть большие обезьяны, но вместо печатных машинок у них теперь в руках мощные компьютеры, способные заменить миллионы других обезьян с машинками. Почему бы это и не сделать ? Научная, изобретательская интуиция, помогающая сузить поиск вариантов, приходит только с опытом. LLM и людям с начала придется набраться этого опыта. Я спокойно отношусь к брутфорс. Еще в студенчестве предпочитал использовать метод моделирования Монте Карло вместо сложных теоретических расчетов и это часто помогало. Хотя бы в начальных приближения точности. Сам метод обучения с подкреплением и есть обезьяны с машинками. Главное централизованно накапливать, а не терять положительный опыт. Мне кажется в этом есть смысл. Удачи !
Да, действительно LLM не хватает творческих начал, хотя генерировать галлюцинации они большие мастера. Поправить это не сложно. Достаточно самостоятельно генерировать необычные комбинации разных сущностей и действий, запрашивая ИИ проверить их реализуемость и потенциальную пользу. Сущности и взаимодействия можно брать например из лексической базы данных WordNet случайным образом в интересующих исследователя областях. Например запрашивать использование искусственных нейросетей в собаководстве. :-) Я как физик хорошо знаю, что почти все открытия были получены чисто эмпирическим путем при помощи случайных комбинаций предметов, материалов и событий.
Настоящая волна технологической революции на базе искусственного интеллекта и массовой роботизации в корне отличается от всех предыдущих. Ранее снижение физических и умственных затрат выливалось в новые возможности, профессии. Сейчас все клонится к тому, что человечески труд станет экономически не эффективным во всех областях деятельности и новых профессий не появится вообще. Компьютеры и роботы заменят и простого работягу на заводе, в поле, в офисе, а так же ученого, инженера, программиста, технолога, менеджера, экономиста, юриста, .. ВСЕХ! Как быть и что реально останется делать людям не ясно. Рушится все экономическая и социальная модель капитализма!
Очень интересная статья. Я совсем недавно познакомился со скилами и они представляются мне более естественным и обоснованным решением, чем классические запросы с промтами к модели. Не хвост (агент) крутит собакой (моделью), а собака хвостом. Инициатива модели по запуску в нужный момент нужных инструментов верна и может быть легко перенесена в робототехнику, роботам давно пора обзавестись быстрыми мозгами уровня Gemma 4. Большое спасибо, дальнейших успехов и Удачи !
Я не против открытого ПО. Magento, тоже имеет открытый исходный код и право использовать его бесплатно. Но людьми движет не только абстрактная любовь к искусству. Если бы Бах, Моцарт или Страдивари не получали деньги за свой труд, то никогда бы не достигли таких высот. Людям нужно что то есть, им необходимо признание, не просто лайки на форуме, а реальная монетизация.
нет, это не творчество, а просто бросание костей на удачу, вдруг выпадет счастье. От человека ничего не зависит и реально творческие люди в такие игры не играют. Нужен механизм когда реальные, осмысленные, направленные на улучшение старания людей будут давать результат. Почитайте с о работе нейросетей с подкреплением. Возможно вам удастся найти механизм, когда модель сама станет генерировать звук лучше, чем был вчера (эволюционировать) и пользователь сможет тонко управлять этим процессом в меру своих талантов, знаний, музыкально чутья, интуиции.
По поводу центрального сайта для сервиса это очень важно! Допустим человек найдет интересное решение. Как он опубликует его для оценки другими людьми? Конечной целью возможно будет монетизация идеи. Должен существовать механизм показа возможностей и покупки результатов как продукта. Для таких дел я обычно использую ПО электронного магазина Magento 2. Там можно дать право пользователям стать менеджерами своих виртуальных складов товаров. Оформит рекламу, назначить цену, ввести счёт для получения денег, следить за динамикой продаж и вам надо иметь процент от сделок. Не так ли? Всё-таки генерация только случайных паттернов это не метод. ИИ как раз должен быть заточен делать что-то лучше людей, а не увеличивать хаос на земле. :-) Удачи!
Ну это понятно, что обучающей стороной должен быть человек. Но почему вы думаете, что много людей будет готово тестировать ваш сервис, который ВСЕГДА будет генерировать только хаос ? Я сильно сомневаюсь в этом. По моему порочна сама концепция вашей идеи, создавать совершено случайные паттерны звук в надежде что когда-нибудь, кому-нибудь удастся получить интересный результат, а если нет? Что тогда? И почему не заменить эмбеддинги изображений на случайные вектора? В чем здесь драйв идеи?
Я вас понял, Молодцы! Очень интересный проект и направления мысли. Контекст разговора надо иметь глобальный (общий для данной предметной области) и частный для конкретных пользователей. RAG надо скорее всего переделать на GraphRAG. У меня есть наработки интеграции LLM с классическим ИИ на основе логического вывода типа Prolog, экспертная система CLIPS. Это позволяет полностью сделать прозрачной, верифицируемой логику выводов, уйти от необходимости использовать сверхтяжелые нейросети рассуждений. В комбинации с глобальным и персональными контекстами это должно существенно повысить точность ответов. У меня так же есть опыт оптимизации скоростей работы мультимодальных сетей и я думаю, что удастся найти локальное решение со скоростью реального времени для не вверх сложных задач. Я бы мог подключиться к решению этих проблем в рамках разумного бюджета, но только с оплатой на международные карточки если это вам интересно и нужно. Еще раз спасибо за статью, ответ и Удачи !
Ну вы блин даете. Как же вы, точнее ваша сеть, научится генерировать действительно интересные вещи? Кто и как будет отличать (управлять) хаосом ? Я как раз предлагаю не генерацию классических скрипок, синтов, а разумное развитие звуковых форм на базе внутренних законов гармонии самих звуков, а не случайных чисел. Так можно искать 1000 лет и ничего не найти, да кто конкретно будет искать, Любой музыкант или любитель услышит хаос и уйдет с вашего сайта. Еще немного другой момент по архитектуре сервиса. Я использую генерацию на стороне клиента при помощи расширений браузера, а сервер только помнит и обменивается между пользователями настройками нейросетей. Это более масштабируемая и гибкая схема.
Мне кажется в вашем пайплайне не хватает RAG (генерация с дополненной выборкой) компоненты. Это позволит гибко адаптировать систему к конкретным сервисам: банки, коммерция, медицина, страховка, ... Каждая область имеет свою специфику, терминологию, протокол общения. Модифицировать LLM очень накладно, а вот затраты внедрения RAG не велики и в смысле желез, софта и работы. Интересная статья. Спасибо Удачи ! p.s. Теоретически можно попробовать подставлять на вход RAG + мультимодальной модели нейросети не сгенерированный ASR текст (возможно искаженный), а сами вектора эмбеддингов фраз? Точнее и текст с промтами и вектор аудиосигнала.
бред сумасшедшего какой то ! Что вы там курите? Внутренние законы визуальных композиций форм, цветов, пространственных положений имеют совершенно отличную от звука и музыки природу. Генерация звука должна опираться на кластеризацию и статистику векторных представлений эмбеддингов звучания голосов лучших певцов, музыкальных инструментов, синтезаторов. Удачным расположением формант, спектров. Получить эти данные можно из оценок композиций музыкантами, звукорежиссерами, любителями музыки. Плюс совершенно необходимо подставлять на вход сети не случайные значения векторов, а осмысленные в плане знаний различных музыкальных гармоний, ритмов: классика, джаз, авангард, .. В противном случае вы получите на выходе какофонию не имеющую никакого эстетического значения, смысла и ценности. Я сам занимаюсь эпизодически этой темой для генерации новых голосов и звуковых эффектов. Но все мои работы базируются исключительно на модификациях, объединении лучших образцов, а не на генераторах случайных чисел.
это понятно. Остановить прогресс не получится но найти социальную форму жизни всего человечества в состоянии тотальной безработицы и безделья будет крайне проблематично, особенно для непоседливого Запада. Я общался с Google AI и мы пришли к единственно возможному положительному варианту развития событий. Люди должны стать младшими партнерами машин в огромной космической экспансии и переустройстве природы вне Земли. Но это слишком фантастический план в нашу смутную эпоху локальных войн и перемен. Спасибо, Удачи!
Китай и "новый строй" меня мало волнуют. Я живу в Чехии и мне важно сохранить тот строй который сейчас есть.
на самом деле проблема реальна. Уже очень скоро ИИ и тотальная роботизация вышвырнут на улицы абсолютно всех людей. Никакие профессии, навыки, таланты и упорство не будет востребовано экономически. Роботам не надо платить зарплату, премиальные, выходные пособия, с них нельзя брать подоходный и иные налоги. Капиталистическая система просто развалиться. Просто негде будет брать деньги они перестанут быть мерилом труда и благ. Как это предотвратить абсолютно не ясно. Коммунистический Китай скорее всего сможет найти способ распределения благ, но не капитализм. :-/
Интересные рассуждения. Но к уравнениям Ньютона люди пришли только через 10 тыс. лет цивилизации, Через 2.8 миллиона лет появления человека как вида и через 4 миллиарда лет эволюции жизни. Я это к чему? Просто подать на вход трансформера видео бесконечного количества падений мячика на землю не даст уравнений Ньютона. Но почему не использовать в пайплайне восприятия готовые 3D движки физики? Эта проблема давно решена в робототехнике, например в VLA (vision-language-action), «зрение-язык-действие» модель. Есть полностью открытые проекты (OpenVLA — Стэнфорд). Спасибо, Удачи !
Тема важная, но мне кажется, что вы беретесь за нее не с того конца. Ваши рассуждения это попытка строить новую крышу дома не имея надежного фундамента и стен.
Я рассуждаю примерно так: самосознание требует понимания хорошо и плохо для меня лично. Это самый главный механизм всех живых живых существ, начиная с простейших одноклеточных амеб. Они с самого начала имели рецепторы тепла, света, химии, физических прикосновений и встроенные механизмы движений в ответ на раздражения. Это можно рассматривать как самые ранние прообразы чувств положительных и отрицательных эмоций. Далее в ходе эволюции появились многоклеточные, нервная система, нейромедиаторы, отвечающие за чувство страха, тревоги, мотивации. Потом эмоции, неокортекс и наконец самосознание.
Для реализации подобного механизма в искусственных нейросетях нам необходимо изменить самую базовую архитектуру нейрона, добавить аналоги нейромедиаторов и механизм нейромодуляции больших групп нейронов одновременно. Такие модели уже есть и они тестируются учеными разных университетов. Если интересно, я тоже этим занимаюсь.
Спасибо за статью и Удачи !
Интересная статья. Спасибо. Самое первое замечание по поводу накопления ошибок в последовательности стадий восприятия, анализа, планирования и исполнения. На самом деле вопрос решен давным давно при помощи регуляторов с обратными связями. Пайплайн должен быть не статическим, а динамическим. Захват подходит к ручке кружки и видит, что есть небольшая разница положений, пересчитывает кинематику и меняет план действий. Как ракета с головкой самонаведения. Я не вижу большой проблемы ни в теоретической части ни в реализации. Это полностью соответствует и биологическим системам и проверено миллиарды раз технически. Да, разумеется полноценный трансформер с физическим ИИ нужен, но он не обязан быть монолитным. Должны быть уровни иерархии с локальным интеллектом, самостоятельно корректирующим свои ошибки. В этом случае погрешности не будут накапливаться и общая схема станет проще, понятней, быстрей и точней. Ещё раз Спасибо и Удачи!
Какие то слишком уж обходные пути ищутся для понимания смысла происходящего в нейросетях. С моей точки зрения для NLP надо попробовать использовать матричную грамматику. Искать матрицы глагольных трансформаций векторов эмбеддингов сущностей. Например сумма векторов состояния голодного кота и молока умножается на матрицу "есть" сытый_кот = есть*(голодный_кот+молоко). Молоко на выходе исчезает. Нелинейности нейросетей можно реализовать логическими функциями: и, или, нет.
Скрытый текст
Крутая идея и схема работы. Я нашел CodeGraph самостоятельно, запустил, проверил и только потом увидел ваш пост. В любом случае Большое Спасибо и Удачи! p.s. Да, вектора пригодятся и особенно для работы со сложными фреймворками, пакетами, библиотеками. Вызовы всех функций будет долго проверять логическим путем. Вообще проект немного напоминаем знаменитый дизассемблер IDA Ильфака Гильфанова. С ним идут мощным базы данных всех системных вызовов всех ОС и компиляторов. Скорее всего нечто подобное скоро должно появиться и с CodeGraph.
Люди и есть большие обезьяны, но вместо печатных машинок у них теперь в руках мощные компьютеры, способные заменить миллионы других обезьян с машинками. Почему бы это и не сделать ? Научная, изобретательская интуиция, помогающая сузить поиск вариантов, приходит только с опытом. LLM и людям с начала придется набраться этого опыта. Я спокойно отношусь к брутфорс. Еще в студенчестве предпочитал использовать метод моделирования Монте Карло вместо сложных теоретических расчетов и это часто помогало. Хотя бы в начальных приближения точности. Сам метод обучения с подкреплением и есть обезьяны с машинками. Главное централизованно накапливать, а не терять положительный опыт. Мне кажется в этом есть смысл. Удачи !
Да, действительно LLM не хватает творческих начал, хотя генерировать галлюцинации они большие мастера. Поправить это не сложно. Достаточно самостоятельно генерировать необычные комбинации разных сущностей и действий, запрашивая ИИ проверить их реализуемость и потенциальную пользу. Сущности и взаимодействия можно брать например из лексической базы данных WordNet случайным образом в интересующих исследователя областях. Например запрашивать использование искусственных нейросетей в собаководстве. :-) Я как физик хорошо знаю, что почти все открытия были получены чисто эмпирическим путем при помощи случайных комбинаций предметов, материалов и событий.
Настоящая волна технологической революции на базе искусственного интеллекта и массовой роботизации в корне отличается от всех предыдущих. Ранее снижение физических и умственных затрат выливалось в новые возможности, профессии. Сейчас все клонится к тому, что человечески труд станет экономически не эффективным во всех областях деятельности и новых профессий не появится вообще. Компьютеры и роботы заменят и простого работягу на заводе, в поле, в офисе, а так же ученого, инженера, программиста, технолога, менеджера, экономиста, юриста, .. ВСЕХ! Как быть и что реально останется делать людям не ясно. Рушится все экономическая и социальная модель капитализма!
Очень интересная статья. Я совсем недавно познакомился со скилами и они представляются мне более естественным и обоснованным решением, чем классические запросы с промтами к модели. Не хвост (агент) крутит собакой (моделью), а собака хвостом. Инициатива модели по запуску в нужный момент нужных инструментов верна и может быть легко перенесена в робототехнику, роботам давно пора обзавестись быстрыми мозгами уровня Gemma 4. Большое спасибо, дальнейших успехов и Удачи !
Я не против открытого ПО. Magento, тоже имеет открытый исходный код и право использовать его бесплатно. Но людьми движет не только абстрактная любовь к искусству. Если бы Бах, Моцарт или Страдивари не получали деньги за свой труд, то никогда бы не достигли таких высот. Людям нужно что то есть, им необходимо признание, не просто лайки на форуме, а реальная монетизация.
нет, это не творчество, а просто бросание костей на удачу, вдруг выпадет счастье. От человека ничего не зависит и реально творческие люди в такие игры не играют. Нужен механизм когда реальные, осмысленные, направленные на улучшение старания людей будут давать результат. Почитайте с о работе нейросетей с подкреплением. Возможно вам удастся найти механизм, когда модель сама станет генерировать звук лучше, чем был вчера (эволюционировать) и пользователь сможет тонко управлять этим процессом в меру своих талантов, знаний, музыкально чутья, интуиции.
По поводу центрального сайта для сервиса это очень важно! Допустим человек найдет интересное решение. Как он опубликует его для оценки другими людьми? Конечной целью возможно будет монетизация идеи. Должен существовать механизм показа возможностей и покупки результатов как продукта. Для таких дел я обычно использую ПО электронного магазина Magento 2. Там можно дать право пользователям стать менеджерами своих виртуальных складов товаров. Оформит рекламу, назначить цену, ввести счёт для получения денег, следить за динамикой продаж и вам надо иметь процент от сделок. Не так ли? Всё-таки генерация только случайных паттернов это не метод. ИИ как раз должен быть заточен делать что-то лучше людей, а не увеличивать хаос на земле. :-) Удачи!
Ну это понятно, что обучающей стороной должен быть человек. Но почему вы думаете, что много людей будет готово тестировать ваш сервис, который ВСЕГДА будет генерировать только хаос ? Я сильно сомневаюсь в этом. По моему порочна сама концепция вашей идеи, создавать совершено случайные паттерны звук в надежде что когда-нибудь, кому-нибудь удастся получить интересный результат, а если нет? Что тогда? И почему не заменить эмбеддинги изображений на случайные вектора? В чем здесь драйв идеи?
Я вас понял, Молодцы! Очень интересный проект и направления мысли. Контекст разговора надо иметь глобальный (общий для данной предметной области) и частный для конкретных пользователей. RAG надо скорее всего переделать на GraphRAG. У меня есть наработки интеграции LLM с классическим ИИ на основе логического вывода типа Prolog, экспертная система CLIPS. Это позволяет полностью сделать прозрачной, верифицируемой логику выводов, уйти от необходимости использовать сверхтяжелые нейросети рассуждений. В комбинации с глобальным и персональными контекстами это должно существенно повысить точность ответов. У меня так же есть опыт оптимизации скоростей работы мультимодальных сетей и я думаю, что удастся найти локальное решение со скоростью реального времени для не вверх сложных задач. Я бы мог подключиться к решению этих проблем в рамках разумного бюджета, но только с оплатой на международные карточки если это вам интересно и нужно. Еще раз спасибо за статью, ответ и Удачи !
Ну вы блин даете. Как же вы, точнее ваша сеть, научится генерировать действительно интересные вещи? Кто и как будет отличать (управлять) хаосом ? Я как раз предлагаю не генерацию классических скрипок, синтов, а разумное развитие звуковых форм на базе внутренних законов гармонии самих звуков, а не случайных чисел. Так можно искать 1000 лет и ничего не найти, да кто конкретно будет искать, Любой музыкант или любитель услышит хаос и уйдет с вашего сайта. Еще немного другой момент по архитектуре сервиса. Я использую генерацию на стороне клиента при помощи расширений браузера, а сервер только помнит и обменивается между пользователями настройками нейросетей. Это более масштабируемая и гибкая схема.
Мне кажется в вашем пайплайне не хватает RAG (генерация с дополненной выборкой) компоненты. Это позволит гибко адаптировать систему к конкретным сервисам: банки, коммерция, медицина, страховка, ... Каждая область имеет свою специфику, терминологию, протокол общения. Модифицировать LLM очень накладно, а вот затраты внедрения RAG не велики и в смысле желез, софта и работы. Интересная статья. Спасибо Удачи ! p.s. Теоретически можно попробовать подставлять на вход RAG + мультимодальной модели нейросети не сгенерированный ASR текст (возможно искаженный), а сами вектора эмбеддингов фраз? Точнее и текст с промтами и вектор аудиосигнала.
бред сумасшедшего какой то ! Что вы там курите? Внутренние законы визуальных композиций форм, цветов, пространственных положений имеют совершенно отличную от звука и музыки природу. Генерация звука должна опираться на кластеризацию и статистику векторных представлений эмбеддингов звучания голосов лучших певцов, музыкальных инструментов, синтезаторов. Удачным расположением формант, спектров. Получить эти данные можно из оценок композиций музыкантами, звукорежиссерами, любителями музыки. Плюс совершенно необходимо подставлять на вход сети не случайные значения векторов, а осмысленные в плане знаний различных музыкальных гармоний, ритмов: классика, джаз, авангард, .. В противном случае вы получите на выходе какофонию не имеющую никакого эстетического значения, смысла и ценности. Я сам занимаюсь эпизодически этой темой для генерации новых голосов и звуковых эффектов. Но все мои работы базируются исключительно на модификациях, объединении лучших образцов, а не на генераторах случайных чисел.