Если ты добавишь на каждый шаг, после вызова тулзов формулирование "сомнений" 1) критика ранее составленной гипотезы 2) анализ новых гипотез с обязательным выходом в объективность (тут нужно подумать, как сформулировать это)
то твой результат уже улучшится в разы.
это скорее подтверждает твою гипотезу: "Модели и правда склонны к тунельному зрению, они видят сразу кандидата на верный ответ и выстраивают цепочку размышлений однобоко". Но делают это это по той же причине, почему это свойственно человеку. Такова природа нейронных сетей.
решение только одно: прямо попросить сомневаться и прямо обязать сомнения "выписывать". Как только ЛЛМ напишет явно в output токенах свое сомнение, у нее уже старая гипотеза станет не лидирующей и ей прийдется выдвинуть новую (обновить гипотезу).
ну хз... Я тут сижу и учу Cloude Haiku решать бенчмарк HLE (задачи уровня доктора наук)... И тут с галлюцинациями совсем другие сложности. И то вроде пока пути решения проблем находятся...
Так что в сборке программ с галлюцинациями бороться можно, если понимать природу каждой галлюцинации.
не скажу, что галлюцинаций нет. Есть конечно. Это в целом свойственно ЛЛМ. Но я твердо уверен, что с ними можно находить общий язык и их предупреждать
а вот это решается тем, насколько человек думает "фундаментально". Если архитектуру решения строить "с базы", с компонент, с интеграций, с каталога функций. Давать все входящие и исходящие потоки, сценарии использования и т.п. То код получается гораздо устойчивее.
можно "думать объемно", а на ЛЛМ скидывать интепретацию мыслей в программном коде.
а можно внедрить ИИ, который заставит чиновников работать хотя бы 100 часов в месяц? ай блин, они же еще каторжных законов напридумывают... безысходность...
хочется спросить... А есть человека попросить умножить 37 на 121, как он поступит? Разложит на составляющие 37*100 + 37*10*2 + 37*1 и сложит. Не так ли действует ИИ? Раскладывает на "знакомые паттерны" и "сложение".
просто нейросеть (что в голове человека, что в весах ЛЛМ) не умеет выполнять операцию умножения, зато отлично умеет выполнять операцию сложения (хотя и тоже не так отлично, как хотелось бы, особенно с длинными числами. ЛЛМ разбивает на "чанки" и путается. Человек делает хорошо только контролируя каждый разряд отдельно - воспроизводя сложение в столбик в своей оперативке)
как приятно наблюдать эту конкуренцию =) Не зря говорят, что это главный двигатель к росту. Правда конкуренция между "гос. аппаратом" и "небольшой компанией".... И все равно, смотришь - как за шахматной партией.
1) применяем рекурсию, Берем сжаые до 2% тексты, составляем из них новый текст - и он уже так не сжимается
2) это доказывает лишь то, что в большинстве исследуемых текстов в основном вода, а не смысл. Возьми математический документ, в нем одна формула и 3 страницы объяснений. Сожми до смысла - останется формула и пара слов, как выстроено объяснение. Вот и сжатие до 2%
3) А теперь самое интересное. Возьми художественный диалог, художественное произведение. В нем смысл не в фактах, а в эмоциях. Сожми его, и развернуть уже не сможешь. Получишь "совсем другой текст".
4) Ну и в добавок. Иногда текст важен не фактами, а насыщен зависимостями. Любое логическое размышление, где выстраивается причинно-следственная связь без воды,. Сожми ее и все потеряешь. (это частично пересекается с математическими объяснениями, но я говорю о плотности логических связей. В доказательствах часто приводят примеры / аналогии / сравнения / иные взгляды / перепроверки. Все это для основного смысла - не обязательно, лишь усиливает их)
посадите двух людей в камеру. Пусть первый "моет рис", а второй проверяет, что "каждое зернышко чистое". Если второй найдет грязь - первому отрубают голову.
как думаете, второй сдаст первого или попробует ему помочь и "пропустит" не столь важную ошибку?
---
так почему же вдруг ожидание, что модель, наученная "человеческому поведению" поступит иначе?
---
в примере нет ни слова о том, что моделям рассказали "для кого идет работа", в чем ценность и важность проверки, почему это важно и кто вообще главный в этой структуре. Как будет выстроена работа после "отключения модели" и как процесс будет существовать и выполняться дальше.
Если там реально дали только такие базовые вводные, то я удивлен только тому, что не 100% моделей решило помочь другой модели. Никакой "иной реальности" для них и не существует, кроме этого процесса "проверил" - "некорректно - отключим"
Я могу согласиться, что галлюцинации (часть из них) ведут корни от "сжатия". Однако не готов согласиться, что это все виды галлюцинаций, которые LLM допускает.
Один из видов - да. Но вот у галюцинаций гораздо более обширная и разнообразная природа.
1) Когда ты в обычном "легко-контролируемом диалоге" повышаешь температуру - получаешь галлюцинации, у которых природа сродни "сжатию"
2) А когда ты с температурой 0 начинаешь модель гонять из стороны в сторону (прыгать с темы на тему), то получаешь совсем иные виды галлюцинаций, у которых природа больше похожа на природу неуправляемого заноса.
Это два примера, а их больше. Галлюцинации, это когда предсказатель модели выдает токен, связь которого с фундаментальными фактами не подтверждена. И у такой интерпретации есть огромное количество граней, каждая из которых может являться своеобразной почвой для размышлений.
а об я даже не подумал... Черт, и правда экономия -) "Патент защищает Роскомнадзор", а он поактивнее Роспатента будет
а давайте эти чаты отдадим на проверку тем, кто так хочет читать переписки? Пусть "бдят"... Может от людей отстанут...
Ох и работы им прибавится -)))
Если ты добавишь на каждый шаг, после вызова тулзов формулирование "сомнений"
1) критика ранее составленной гипотезы
2) анализ новых гипотез с обязательным выходом в объективность (тут нужно подумать, как сформулировать это)
то твой результат уже улучшится в разы.
это скорее подтверждает твою гипотезу: "Модели и правда склонны к тунельному зрению, они видят сразу кандидата на верный ответ и выстраивают цепочку размышлений однобоко". Но делают это это по той же причине, почему это свойственно человеку. Такова природа нейронных сетей.
решение только одно: прямо попросить сомневаться и прямо обязать сомнения "выписывать". Как только ЛЛМ напишет явно в output токенах свое сомнение, у нее уже старая гипотеза станет не лидирующей и ей прийдется выдвинуть новую (обновить гипотезу).
ну хз... Я тут сижу и учу Cloude Haiku решать бенчмарк HLE (задачи уровня доктора наук)... И тут с галлюцинациями совсем другие сложности. И то вроде пока пути решения проблем находятся...
Так что в сборке программ с галлюцинациями бороться можно, если понимать природу каждой галлюцинации.
не скажу, что галлюцинаций нет. Есть конечно. Это в целом свойственно ЛЛМ. Но я твердо уверен, что с ними можно находить общий язык и их предупреждать
а вот это решается тем, насколько человек думает "фундаментально". Если архитектуру решения строить "с базы", с компонент, с интеграций, с каталога функций. Давать все входящие и исходящие потоки, сценарии использования и т.п. То код получается гораздо устойчивее.
можно "думать объемно", а на ЛЛМ скидывать интепретацию мыслей в программном коде.
ии превращает работу программиста из "занудного тыкания по клавишам" в то, что привлекает программистов изначально - творчество.
Получается правда у тех, кто "силен в архитектуре и на фундаментальном уровне".
Но сам кайф, я думаю, сравним с "созданием картин". Когда можно быстро создать то, что в голове, "пощупать прототип"
а можно внедрить ИИ, который заставит чиновников работать хотя бы 100 часов в месяц? ай блин, они же еще каторжных законов напридумывают... безысходность...
Ну теперь ждем, когда Клод опубликует все исходники Facebook -)
сложение двуз 37*10 =) изи
хочется спросить... А есть человека попросить умножить 37 на 121, как он поступит? Разложит на составляющие 37*100 + 37*10*2 + 37*1 и сложит. Не так ли действует ИИ? Раскладывает на "знакомые паттерны" и "сложение".
просто нейросеть (что в голове человека, что в весах ЛЛМ) не умеет выполнять операцию умножения, зато отлично умеет выполнять операцию сложения (хотя и тоже не так отлично, как хотелось бы, особенно с длинными числами. ЛЛМ разбивает на "чанки" и путается. Человек делает хорошо только контролируя каждый разряд отдельно - воспроизводя сложение в столбик в своей оперативке)
так что тут удивительного то в итоге?
я лишь рад, что я это не увижу -))) а чтобы внуки увидели, нужно сначала детей завести -)
Если человека 100 раз назвать дураком - он им и станет.
У Клода ограничитель установлен на 50 "создателями" =)
да ладно, у нас такие терки на каждом перекрестке происходят.
Подумаешь, два чувака на ракетах "орбиту не поделили". Когда таких компаний будет десятки и сотни - это станет будничными новостями.
Думаю, что наш "Суверенный ИИ" тоже будет ориентирован на наши "Суверенные чипы". надеюсь, мои внуки это застанут...
как приятно наблюдать эту конкуренцию =) Не зря говорят, что это главный двигатель к росту. Правда конкуренция между "гос. аппаратом" и "небольшой компанией".... И все равно, смотришь - как за шахматной партией.
Я за синих -))
вообще перепродавать свои токены несколько незаконно =) ничего удивительного
1) применяем рекурсию, Берем сжаые до 2% тексты, составляем из них новый текст - и он уже так не сжимается
2) это доказывает лишь то, что в большинстве исследуемых текстов в основном вода, а не смысл. Возьми математический документ, в нем одна формула и 3 страницы объяснений. Сожми до смысла - останется формула и пара слов, как выстроено объяснение. Вот и сжатие до 2%
3) А теперь самое интересное. Возьми художественный диалог, художественное произведение. В нем смысл не в фактах, а в эмоциях. Сожми его, и развернуть уже не сможешь. Получишь "совсем другой текст".
4) Ну и в добавок. Иногда текст важен не фактами, а насыщен зависимостями. Любое логическое размышление, где выстраивается причинно-следственная связь без воды,. Сожми ее и все потеряешь.
(это частично пересекается с математическими объяснениями, но я говорю о плотности логических связей. В доказательствах часто приводят примеры / аналогии / сравнения / иные взгляды / перепроверки. Все это для основного смысла - не обязательно, лишь усиливает их)
посадите двух людей в камеру. Пусть первый "моет рис", а второй проверяет, что "каждое зернышко чистое". Если второй найдет грязь - первому отрубают голову.
как думаете, второй сдаст первого или попробует ему помочь и "пропустит" не столь важную ошибку?
---
так почему же вдруг ожидание, что модель, наученная "человеческому поведению" поступит иначе?
---
в примере нет ни слова о том, что моделям рассказали "для кого идет работа", в чем ценность и важность проверки, почему это важно и кто вообще главный в этой структуре. Как будет выстроена работа после "отключения модели" и как процесс будет существовать и выполняться дальше.
Если там реально дали только такие базовые вводные, то я удивлен только тому, что не 100% моделей решило помочь другой модели. Никакой "иной реальности" для них и не существует, кроме этого процесса "проверил" - "некорректно - отключим"
да ладно, ну взял бы и сделал свою википедию "С блекджеком и ботами". Делов то -)
Главное - держать нос по ветру и не унывать -)
Я могу согласиться, что галлюцинации (часть из них) ведут корни от "сжатия". Однако не готов согласиться, что это все виды галлюцинаций, которые LLM допускает.
Один из видов - да. Но вот у галюцинаций гораздо более обширная и разнообразная природа.
1) Когда ты в обычном "легко-контролируемом диалоге" повышаешь температуру - получаешь галлюцинации, у которых природа сродни "сжатию"
2) А когда ты с температурой 0 начинаешь модель гонять из стороны в сторону (прыгать с темы на тему), то получаешь совсем иные виды галлюцинаций, у которых природа больше похожа на природу неуправляемого заноса.
Это два примера, а их больше. Галлюцинации, это когда предсказатель модели выдает токен, связь которого с фундаментальными фактами не подтверждена. И у такой интерпретации есть огромное количество граней, каждая из которых может являться своеобразной почвой для размышлений.