Комментарии 15
Отлично.
Кстати, добавлю свое наблюдение:
Какое-то время назад я посещал курс импровизации; в частности, там люди выходили на сцену и, импровизируя, играли какую-то ситуацию.
Интересно было вот что - часто новенькие выдавали очень интересные ситуации; а бывшие, и с актерскими умениями - не очень. И последнее было связано вот с чем - профессионалы добавляли в ситуацию некий имхо явный вымысел в духе "сейчас я звоню президенту".
Вариант "сейчас я звоню президенту" может быть в художественной книге; может быть в игре. Но в реальной жизни существует трение, которое не позволяет делать, что угодно. Мы это естественным образом ощущаем, а LLM, как вы верно заметили, обучается на текстах - и поэтому этого не замечает.
И, кстати, интересно, что одни из лучших зацикленных систем с LLM - это системы с обратной связью в виде физических программных тестов ("у тебя не работает, вот ошибка") или с системами формальных математических доказательств ("утверждение X формально не доказано").
Да, в случае с актерами, новичок импровизирует жизнь, а профессионалы импровизируют текст/роль.
И добавлю следствие, если попытаться решить проблему галлюцинаций большим количеством текста, в промпте, rag или инструкции, то похоже это не сработает. Текст добавит связности, но на источник галлюцинации он не повлияет.
Да, в случае с актерами, новичок импровизирует жизнь, а профессионалы импровизируют текст/роль.
Спасибо, хорошая формулировка, буду использовать :)
И добавлю следствие, если попытаться решить проблему галлюцинаций большим количеством текста, в промпте, rag или инструкции, то похоже это не сработает. Текст добавит связности, но на источник галлюцинации он не повлияет.
Да, тут тоже согласен.
Спасает тут, похоже, то, что есть ряд заданий, где, условно "достаточно говорить, а делать необязательно". Но, кстати, программирование тоже к нему относится - из хорошего - то, что часто человеку действительно хватает именно небольших типовых решений. Имхо поэтому программисты-любители нахваливают нейросети (есть какое-то решение проблемы), а профессионалы ругают (потому что нейросеть делает типовое решение, а не точно соответствующее ситуации, что в их случае критично).
Очень интересная статья. Информативная, полезная и очень похожа на правду и отвечу почему я так думаю.
Предисловие,
Меньше года назад загорелся я написать программу спомощью АИ,(было-бы мало понятно, если не упомянуть тот факт что до этого времени, даже установка сторонних програм на РС была целым квестом, для меня) написал, коряво, но сам факт то что работает! так вот то что описанно в этой статье правда, и цикличность и само повидение инструмента.
Данный материал может помочь как в понимании его логики, так и в дальнейшем для работы с пациэнтом*( AI) . Спасибо
Браво, в самую точку. Я бы даже сказал, что Ваши формулировки достойны пойти в народ, быть разобранными на цитаты. В закладки и сохраню файлом.
При минимальном уточнении :-)
современная философия уверенно катится к содержательному совпадению с LLM
На самом деле это LLM стала содержательно совпадать с тем, что уже больше века является сущностью философии.
Разница между говорящими и галлюцинирующими БЯМ, разумеется, есть, и практически аналогична разнице между речью психически здорового человека и психопата. Один проводит проверки того, что говорит, до необходимого уровня глубины, другой -- гонит "поток сознания", как есть.
Даже здесь, на хабре, была статья (https://habr.com/ru/articles/984126/) о варианте нейросимвольной архитектуры LLM в узкой задаче генерации кода, но вообще таких проектов, -- архитектурно интегрирующих языковые и логические/символьные/референсные методы, -- по крайней мере несколько. Что ни один из них не получил пока массового развития и распростронения, говорит больше о потребителе, чем о продукте.
Статья оригинальная конечно, но мораль все-таки не ясна.
С точки зрения пользовательского опыта llm vs human, что именно делает человека надёжнее как инструмент?
То, что он боится ошибиться? Так эмоции в работе скорее минус, чем плюс.
Жизненный опыт? Ну llm видела больше кода, читала больше книг и смотрела больше фильмов, чем любой человек.
Интуиция? Возможно, конечно, но поди докажи, что она статистически лучше рандома.
Да, “чистая речь” не улыбается, ничем не рискует и не пахнет - но ведь это чаще хорошо, чем плохо?
Можно провести эксперимент: какому “первобытному обществу” доверим писать реализацию raft - тому, где есть специалист, которого в случае чего съедят, или тому, которое оплатило подписку на fable 5?
P.S. И да, галлюцинаций всё-таки становится все меньше. В обвязке с доп проверками риск от llm как будто бы уже сравнялся с риском от людей (а то и стал ниже)
Хм.. я писал немного о другом. Я не говорю, что человек надёжнее или, что LLM бесполезны. Речь шла о том, что связность как подмена верности опасна для всех. И если LLM связностью вытаскивает правильный ответ на вопрос из базы, это не говорит о том, что она отвечает осмысленно.
Обвязка помогает именно потому, что язык LLM упирается во внешнюю проверку. У того же raft есть тесты, есть отказы кода, вынуждающие LLM искать другую связность. Но она не думает, что правильно, она тащит следующую цепочку в тесты... Уверен для кодера такая ситуация выглядит как издевательство со стороны LLM. И уверен, что такая ситуация встречается чаще чем кажется. Улучшение моделей, конечно помогает, увеличивает базу для поиска связности, но принципиально подход не меняется. Разве что частично маскируется за счёт скрытой многоходовости агента. В общем, ни одна обвязка не изменит архитектуру.
связность как подмена верности опасна для всех
Здесь в целом согласен с вами: подмена верности связностью опасна в том смысле, что решение генерируется не на основе фактов, а через некоторое непонятное нам перемножение матриц, которое выдаёт правдоподобный ответ.
Я бы только дополнил, что LLM - это всё-таки чуть сложнее, чем «чистая связность» речи. Интерпретируемость показывает, что внутри моделей есть неречевые концепты, привязанные к структуре реального мира, а не только к статистике слов:
- https://arxiv.org/pdf/2310.02207 - вот здесь внутри моделей нашлись линейные представления пространства и времени, кодирующие реальные координаты городов и даты событий.
- https://arxiv.org/pdf/2502.00873 - здесь про то, как модели выполняют арифметику через тригонометрию. То есть тоже что-то более глубокое, чем простая речевая связность.
Но конечно да, концепты выучены из текста, логика генерации для нас непрозрачна, и, видимо, главный вывод - что галлюцинации LLM гораздо сложнее предсказать, чем галлюцинации людей.
Так эмоции в работе скорее минус, чем плюс.
Представим себе такую работу, которая взаимодействует с эмоциями других людей. Кинематограф, авторство книг/статей, политика и многое другое, явно или неявно.
Кто способен лучше вызывать эмоции у других людей?
Человек, профессионал в своей области. Понимает что такое эмоции, как с призмы профессиональных знаний(обьективнее), так и собственного человеческого опыта (субъективнее, ограничено опытом одной человеческой жизни).
AI, профессионал по всему одновременно. Прочитал и пережевал через себя любые возможные материалы в мире про эмоции, но не имел возможности их "прожить"
Ставлю на человека, а вы?
LLM — это эмулятор валящегося студента на экзамене: он «выдумывает» всегда — просто иногда «выдуманное» им совпадает с правильным ответом — и мы «ставим ему пятёрку»; а иногда является чушью различных степеней полноты — и тогда мы говорим: «это он галлюцинирует».
Все «настройки» и «тренировки» LLM сводятся к тому, чтобы тем или иным способом увеличить количество первых случаев и уменьшить — последних.
Модели натаскивают на текстах, и каким-то образом появляется интеллект - способность решать задачи. Да, модель предсказывает следующий токен. Все лишь предсказывает токен. И этого хватает, чтобы побеждать на олимпиадах по программированию, взламывать системы, доказывать математические теоремы. Никто же их не учил этому. Просто хороший текст (код) хорошо отражает реальность. Значит текст обладает не одной лишь связностью, но чем-то большим. И это нечто вполне усваивается моделью в процессе тренировки.
Математика- язык, русский язык - незначительное подмножество математики.
Ваша "чистая связность" - это "чистая математика", да математика не содержит внутри себя способа определить, какая из двух формул I=U/R или I=U*R верно описывает связь тока и напряжения - это определяется внешним по отношению к математики способом. Но зато если мы определили, что I=U/R - то дальше мы уже без эксперимента, на чистой математике, можем утверждать, что U=I*R, и не возможна ситуация, когда некая формула верна, а корректно выведенная из неё другая формула неверна, потому что по правилам языка математики U=I*R и I=U/R - это не два разных утверждения, а одно, по разному сформулированное. Ну и есть прикладная математика - с погрешностями данных, ошибками округления, эмпирическими формулами и прочими ограничениями - но отнюдь не бесполезная.
И да, я говорю математика - но это верно для любого мышления: хорошо известно, что разум не может проверить внутри себя даже верность утверждения "Вселенная существует" не говоря о любых её частных свойствах.
Это не свойство нейросетей или языка, это свойство любого мышления (хотя возможно, любое мышление - математика и язык в широком смысле слова).

LLM не научились врать. Они научились говорить