Pull to refresh

Comments 4

Самое интересное в RAG – вытянуть максимум из ретривера. А тем, как залить md в вектор и найденные фрагменты вставить в промт — уж «все заборы исписаны»)

Если позволяют ресурсы - https://huggingface.co/BAAI/bge-reranker-v2-m3 отличная модель реранкера (с динамической квантизацией тоже показывает очень хорошие результаты), с ней метрики значительно подрастут. А перед реранкером по-хорошему поиск комбинацией BM25 и Embeddings

Хорошая обзорная статья, о как то мало конкретики и примеров как можно использовать RAG. Я например поставил себе на комп Ollama и в ней OpenWebUI вроде RAG заработал, но на сколько точно он дает ответы - не понятно как проверить.

Видно, что автор особо ничего не строил, а тупо насобирал из туториалов умных слов, как и большинство туториалов. Реранкеры/модели не работают, если в базе данные у вас кривые. 90% построения RAG-системы, это крайне унылый и монотонный чанкинг и eval каждого шага, а у вас об этом один абзац только, где только и описано про нарезку с нахлестом. Данные всегда в таком виде, что тупо залить и радоваться не получится. Делаешь шаг - замеряешь, сравниваешь, правишь - замеряешь и так много раз. Часть документов ссылаются на другие документы, часть таблицами, часть сканами - все это надо нормализовать перед порезкой, а потом уже модели выбирать и реранкинг крутить. FAISS это не база, а поисковой движок, там нет ни персистентности, ни мета-данных и для этого как раз и сделана Chroma. И выбор базы надо делать исходя из того, что уже есть в инфраструктуре, а не потому что там что то быстро поднять. Если есть уже Elastic/PG/Sqlite, то легче в них встроиться, а не поднимать отдельно дополнительный сервис.

Sign up to leave a comment.

Articles