А что должна была сделать с предупреждением девушка из скрина? Там просто написано, что нужно удостовериться, что вы доверяете источнику, из которого делаете установку.
В последнем релизе lightrag: All RagAnything’s multimodal processing capabilities are merged into LightRAG; ( RagAnything will no longer receive core feature updates or maintenance going forward)
1001 и одно решение - имеется ввиду не продукт, а фреймворки, библиотеки и т.д на которых можно построить RAG. Говорить, что opensource решения не так хороши, когда на них держится вся мировая ИТ инфраструктура - как минимум, странно. Но скорее всего, судя по ответу, они даже и не рассматривались. Все описанные проблемы в статье решаются очень просто.
Opensource фреймворки, такие как graphrag (от Microsoft), graphiti, lightrag - позволяют легко работать с любыми форматами документов (от обычных текстовых документов и таблиц до web страниц). Поддерживают как облачные LLM так и локальные (причем позволяют подключить любую LLM с huggingface). Умеют работать с rerank моделями (в статье, кстати, об этом даже не упоминается) для улучшения результатов выдачи. Умеют как в обычный, так и в гибридным, и микс поиск. Также это не просто RAG, а с графами связей между документами и сущностями, так ещё и с возможностью отслеживать историю изменений связей.
Ну и конечно же фреймворки имеют отличный API для интеграции с любыми внутренними решениями. Поддерживают ролевые модели. Ну и плюсом, открытый код с возможностью доработки под свои хотелки.
Если нужно работать с нечитаемыми pdf (OCR) или структурировать данные excel, чтобы не было проблем попадания данных одной таблицы в разные чанки, подключаем opensource проект docling (от IBM) в дополнение. Прогнав документ через него, он сам отсеивает весь "мусор", так что даже документы готовить и вычищать не нужно (о чем так любят все твердить, когда их RAG показывает плохой результат, что мол документы не структурированны, вот и результат плохой).
И это только самые популярные решения, которые можно быстро поднять и на собственных серверах.
Мы в компании подняли RAG, который умеет работать с более 30 разными форматами документов (включая видео, аудио, картинки, таблицы, текст, веб страницы, код, сперва и другие) за 2 месяца. Теперь каждый отдельный ИТ проект имеет свою RAG с секундным поиском по всей проектной документации, видеоконференциям, созвонам, протоколам (они тоже, кстати, готовятся в течении 5 минут после окончания совещания через ИИ с автоматической постановкой задач).
Так что, решения уже все есть, хорошие и проверенные.
А что должна была сделать с предупреждением девушка из скрина? Там просто написано, что нужно удостовериться, что вы доверяете источнику, из которого делаете установку.
В последнем релизе lightrag: All RagAnything’s multimodal processing capabilities are merged into LightRAG; ( RagAnything will no longer receive core feature updates or maintenance going forward)
Rag anything больше не поддерживается, полностью интегрирован с lightrag
Статьи - это тоже одни слова. Если интересно, пишите мне, а лучше, приезжаете (Москва), покажу вживую.
1001 и одно решение - имеется ввиду не продукт, а фреймворки, библиотеки и т.д на которых можно построить RAG. Говорить, что opensource решения не так хороши, когда на них держится вся мировая ИТ инфраструктура - как минимум, странно. Но скорее всего, судя по ответу, они даже и не рассматривались. Все описанные проблемы в статье решаются очень просто.
Opensource фреймворки, такие как graphrag (от Microsoft), graphiti, lightrag - позволяют легко работать с любыми форматами документов (от обычных текстовых документов и таблиц до web страниц). Поддерживают как облачные LLM так и локальные (причем позволяют подключить любую LLM с huggingface). Умеют работать с rerank моделями (в статье, кстати, об этом даже не упоминается) для улучшения результатов выдачи. Умеют как в обычный, так и в гибридным, и микс поиск. Также это не просто RAG, а с графами связей между документами и сущностями, так ещё и с возможностью отслеживать историю изменений связей.
Ну и конечно же фреймворки имеют отличный API для интеграции с любыми внутренними решениями. Поддерживают ролевые модели. Ну и плюсом, открытый код с возможностью доработки под свои хотелки.
Если нужно работать с нечитаемыми pdf (OCR) или структурировать данные excel, чтобы не было проблем попадания данных одной таблицы в разные чанки, подключаем opensource проект docling (от IBM) в дополнение. Прогнав документ через него, он сам отсеивает весь "мусор", так что даже документы готовить и вычищать не нужно (о чем так любят все твердить, когда их RAG показывает плохой результат, что мол документы не структурированны, вот и результат плохой).
И это только самые популярные решения, которые можно быстро поднять и на собственных серверах.
Мы в компании подняли RAG, который умеет работать с более 30 разными форматами документов (включая видео, аудио, картинки, таблицы, текст, веб страницы, код, сперва и другие) за 2 месяца. Теперь каждый отдельный ИТ проект имеет свою RAG с секундным поиском по всей проектной документации, видеоконференциям, созвонам, протоколам (они тоже, кстати, готовятся в течении 5 минут после окончания совещания через ИИ с автоматической постановкой задач).
Так что, решения уже все есть, хорошие и проверенные.
Больше года чтобы поднять rag? Сильно. 1000 и 1 open source решение на GitHub. Разворачивай и дорабатывай как душе угодно. Вы точно ИТ компания?)