Информация
- В рейтинге
- Не участвует
- Зарегистрирован
- Активность
Специализация
Системный аналитик, Ученый по данным
Старший
От 270 000 ₽
Python
SQL
Pandas
Анализ данных
UML
Системная аналитика
Машинное обучение
Компьютерное зрение
Обработка естественного языка
Нейронные сети
Буквально недавно после практически 18 лет безупречной эксплуатации mx510 пересел на mx keys 3s. Обе мыши выше всяких похвал, первая еще в полном порядке - просто настало время попробовать что-то поновее)
Одна из задач статьи — показать, что среди открытых библиотек есть не только GraphRAG, но и другие интересные и перспективные варианты, развивающие данный подход с учётом его ограничений и проблем.
В описании архитектуры LightRAG отражены новые идеи создания и инкрементного обновления графа при добавлении новых документов (тематик). Связывание различных тематик (доменных областей) в один граф возможно, при этом соединение между темами может осуществляться через общие узлы (например, «прибор X» в медицинских документах и ГОСТах). Однако, по нашему мнению, по возможности лучше разделять доменные области на отдельные графы и выполнять маршрутизацию запросов.
LightRAG поддерживает загрузку текстовых данных в следующих форматах: TXT, MD, DOCX, PDF, PPTX, RTF, ODT, EPUB, HTML, HTM, TEX, JSON, XML, YAML, YML, CSV и др. Степень сложности тестовых документов - средняя на уровне статей и пунктов. Предобработку документов не проводили, тк в исследовательских целях интересно было провести сравнительный анализ на исходных документах. По опыту разработки RAG можем отметить, что разделение текста на чанки с учетом структуры (статья, пункт, абзац) оказывает существенное влияние на повышение качества ответов.
Спасибо за проделанную работу и качественные модели. Сравнение с gemma3 планируете сделать? Интересует область применения в RAG системах на русском языке.