До этого момента мы говорили в основном о данных. Но у этой темы есть ещё один слой, возможно самый важный. Он начинается там, где онтология перестаёт восприниматься просто как удобный формат для ответа на вопросы по базе знаний и превращается в основу памяти.
В первой статье мы остановились на том месте, где классический RAG начинает буксовать. Он умеет находить близкие по смыслу фрагменты текста, но не умеет по-настоящему "жить" внутри структуры знаний. До определённого масштаба это почти незаметно. Но как только данных становится очень много, а вопросы требуют не буквального извлечения фраз, а работы со связями, векторный поиск начинает всё чаще давать не то чтобы неправильный, а недостаточно глубокий результат. Он вытаскивает похожее. Но похожее — не всегда значит связанное.
В последние два года у многих возникло ощущение, что большие языковые модели почти решили проблему доступа к знаниям. Достаточно взять ChatGPT или любую другую сильную LLM, добавить к ней документы компании, подключить поиск по базе знаний, и вот уже кажется, что мы получили универсального цифрового аналитика. Он читает инструкции, отвечает по регламентам, пишет письма, пересказывает договоры, собирает отчёты и даже объясняет табличные данные на человеческом языке. На этом фоне Retrieval‑Augmented Generation, или просто RAG, стал восприниматься как практически универсальный рецепт: если модель чего‑то не знает, надо просто «подложить» ей нужные данные...
Disclaimer
* нижеприведенный текст написан автором в ключе «философии искусственного интеллекта»
* комментарии профессиональных программистов приветствуются
Эйдосы — это образы, лежащие в основе человеческого мышления и языка. Они представляют из себя гибкую структуру (обогащение наших знаний о мире). Эйдосы текучи (поэзия), могут перерождаться (изменение мировоззрения) и менять свой состав (обучение — качественный рост знаний и умений). Они сложны (попробуйте, например, понять эйдос квантовой физики).
Но базовые эйдосы просты (наши знания о мире уровня трёх-семилетнего ребёнка). По своему устройству это чем то напоминает интерпретатор языка программирования.
"[ Нейронная сеть нуждается] в 300 миллионах изображений кошек, чтобы научиться понимать, что есть кошка, корова или собака. Но интеллект не основывается на больших данных (Big data). Наоборот, он основан на «маленьких данных». Если вы можете смотреть на кошку, извлекать абстрактные принципы «кошки» так, как это делают дети, и далее уже всегда знать, что такое кошка – это и есть интеллект"
Паскаль Кауфманн, швейцарский учёный, нейролог, основатель компании «Стармаинд».
В самом деле, почему дети обучаются распознавать кошек быстрее и проще, чем это делают нейронные сети? Другими словами, какова принципиальная схема человеческого механизма распознавания образов?