Обновить

RAG‑система для анализа новостей с позиций исторической личности на основе литературных источников «АЙ_Ленин»

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.1K
Всего голосов 4: ↑4 и ↓0+8
Комментарии4

Комментарии 4

Приветствую. Можешь раскрыть как собирался раг файл и на чем. Не совсем понял как работает сейчас разметка для постинга сообщений в канал

Приветствую!

Первая часть вопроса:
RAG это локальный индекс Qdrant, а не один файл.

Как писал в статье, модель не дообучал, сборка офлайн по этапам:

  1. Корпус из литературы data/books/ (в git его нет)

  2. Реестр источников по путям/авторам: автор/источник PSS - core_self (R1), поддерживающие источники - influence_agree (R2), критики - influence_critical (R3)

  3. Чистка шума, чанки 256–512 токенов (~10% перекрытия)

Эмбеддинги Giga-Embeddings-instruct + BM25 + теги с сохранением в Qdrant.
В рантайме новость идёт в гибридный поиск по этим чанкам.

Вторая часть вопроса:

Пост в канал собирается не из сырого ответа LLM, а из триады.

LLM пишет текст с метками Факт: / Механизм: / Вывод:. Пайплайн чистит служебный мусор. Далее публикатор:

  • Факт = заголовок новости

  • из анализа вытаскивает Вывод и Механизм (без них пост не уходит)

  • добавляет ссылку источник и дисклеймер

  • шлёт в Telegram

Итоговый вид:
Факт: <заголовок>
Вывод: …
Механизм …

источник
<дисклеймер>

Я имел ввиду, на каких данных ты разметку делал? Как я понял из статьи, у тебя есть подписка на ленту новостей. Модель анализирует новость и если она подходит под тематику публикует. Но на каких данных собирался rag файл, и для чего он служит? Для определения тематики?

Да, я беру RSS-ленту новостей и каждую новость прогоняю через модуль цензуры. Он решает, допускать ли новость до анализа.

RAG тематику не определяет и не решает, публиковать ли новость. Он нужен, чтобы разобрать уже допущенный факт по первоисточникам.

Размечен книжный корпус — по пути к файлу и по автору:

  • ПСС (полное собрание сочинений), 55 томов - R1

  • союзники - R2

  • критики, если есть - (R3).

По теме допущенной новости RAG достаёт релевантные фрагменты из ПСС и, если есть, из текстов других авторов. Так модель опирается на источники, а не выдумывает Ленина.

Проще говоря: в индексе ищем цитаты на ту же тему, что и новость, а из найденного LLM собирает анализ Факта.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации