К сожалению, я тоже не могу причислять себя к кругу ученых занимающихся ИИ. Я скорее практик. Для упрощения и применимости инструмента пытаюсь сводить все к каким-то близким бытовым моделям. И тут вы правы, в чисто научном смысле галлюцинации это про ложные ответы. Как определяются ложные ответы — ретрив-ориентированные тесты (крутой функционал есть в LangFuse, но на крайний случай можно прогнать по таблице с ответами в ручном режиме); на основе эмбеддингов (когда измеряют дельту векторов по вопросу и ответу); можно прогнать через модельку обученную на правильно размеченных данных. Есть еще и самый понятный и близкий мне — определение ложности ответов на основе неопределенности, точнее сказать уверенности модели в ответах. Так как целью статьи было показать риск настройки длинных цепочек я сделал акцент именно на этой самой воспроизводимости.
К сожалению, я тоже не могу причислять себя к кругу ученых занимающихся ИИ. Я скорее практик. Для упрощения и применимости инструмента пытаюсь сводить все к каким-то близким бытовым моделям. И тут вы правы, в чисто научном смысле галлюцинации это про ложные ответы. Как определяются ложные ответы — ретрив-ориентированные тесты (крутой функционал есть в LangFuse, но на крайний случай можно прогнать по таблице с ответами в ручном режиме); на основе эмбеддингов (когда измеряют дельту векторов по вопросу и ответу); можно прогнать через модельку обученную на правильно размеченных данных. Есть еще и самый понятный и близкий мне — определение ложности ответов на основе неопределенности, точнее сказать уверенности модели в ответах. Так как целью статьи было показать риск настройки длинных цепочек я сделал акцент именно на этой самой воспроизводимости.