Pull to refresh
4K+
33
Игорь Хмельков@khmelkoff

Data Scientist

5
Rating
27
Subscribers
Send message

неизвестная ссылка не остаётся битой — она уезжает в отдельный индекс Unlinked Mentions с указанием, кто её упоминал

я как раз думаю двигаться в этом направлении.

По устройству vault — готовый RAG-корпус

На моём бенчмарке векторный поиск работает немного слабее LLM-агента, который всегда видит индекс и умеет ходить по ссылкам. Особенно по полноте ответа. И это у меня был RAG с адаптивным top_k. Наверняка кто-то ещё пытался сравнивать.

А как вы делали связи между сущностями? И ещё интересно, "для собственного использования" предполагает ответы по wiki от wiki-агента?

Вы сравниваете сравнивает теплое с мягким: сложный многошаговый пайплайн против базового векторного поиска.

Я сравниваю ответы одой и той же LLM, на один и тот же вопрос, с одним и тем же системным промптом. При этом в одном случае контекст скомпилирован из исходного документа, в другом - «сырые» фрагменты, отобранные по сходству с вопросом. Считаю такое сравнение правомерным. Подмешивание фрагментов в скомпилированный контекст качества не добавляет. Это я тоже проверил.

Если к RAG прикрутить такого же агента (для перекрестного поиска по терминам и метаданным), разница в качестве, скорее всегл, исчезнет

Какую архитектуру RAG здесь вы имеете в виду? Например, GraphRAG это тоже либо долго, либо дорого. По релевантности контекста он выглядит лучше чем простой векторный поиск.

Спасибо за комментарий, повеселили плачущим маркетологом. Я Data Scientist, а не маркетолог, но кажется, программистов на курс тоже берут) Почти на каждом задании ловил себя на желании написать скрипт руками, вместо того чтобы просто попросить Клода. Привычка сильнее курса. Зато есть вещи, которые я искренне не люблю делать сам: писать readme или строить дашборды по результатам. Тут я красиво умею изображать вайб-воркинг.

Спасибо. Отличный вопрос!

А ваши задачи без rag не решаются? Например положить все данные просто файлом рядом с моделью если это возможно.

В API Anthropic есть система кеширования, кэш живёт 5 минут. Если мы работаем с одним и тем же документом, то его можно закешировать и сэкономить на токенах. Качество ответов будет выше, чем у простейшей RAG системы. Картинка с дашбордом как раз этот эффект показывает. Дело в том, что бенчмарк синтетический. Я его сделал на gemma4:31b. Она получала тему для вопроса, но видела весь документ целиком, поэтому RAG уступает по качеству там, где в метрике используется "правильный" ответ.

модель куда эффективнее сама искал необходимую часть документа базовыми unix инструментами, чем получая избыточные данные от rag

Если RAG - просто векторный поиск, так скорее всего и будет. Сравнительно новые архитектуры предполагают использование в RAG агентов и LLM-судьи. В зависимости от его решения может адаптивно меняться количество чанков в выдаче, переформулироваться и дополняться вопрос, или вообще отключаться выдача, если LLM-судья решил, что для этого вопроса RAG не нужен.

Здравствуйте. Там всё на питоне и написано. инструменты, библиотека, rag система. ещё немного маркдауна, html и JavaScript. Статья в том числе и про то, как всё-равно пришлось написать код.

Не знаю какие причины у Автора, но бывает, что VRAM на RAG вообще не выделяют. Там же не один поток в проде может быть, а например восемь одновременно, одна домашняя видеокарта не спасёт, а на CPU как-то работает.

Так и я про это, только с другой стороны ) Высокие риски -> практики мало -> мало экспертизы -> низкая культура внедрения. А туториал ваш мне понравился.

ОПАСНО, хостим свои модели

Вы не думали что это ключевое отличие? В остальном, кажется обвинять российские компании в некомпетентности не совсем правильно. Есть как минимум три серьезных бизнес риска. Первый - аккаунт в любой момент заблокируют владельцы моделей из-за нарушения пользовательского соглашения. Второй - доступ к зарубежным моделям заблокируют по локальным причинам. Третий - стоимость токенов может вырасти кратно. Сейчас же прайс ниже себестоимости (поправьте меня, если ошибаюсь)? Поэтому он-прем и прочие аир-гэпы, поэтому чат-боты с локальными моделями. Несмотря на это, есть компании, которые уже поставили себе лейбл AI-Native.

Когда я только настраивал промпты, не было ограничения на "клонированные и синтетические" организмы. Вы не поверите, но у меня волосы вставали дыбом от того, что генерила gemma в тестовых запросах.

Загрузил в репозитарий. проверяйте

КДПВ в статье не показывается, только в ленте. Попробуйте поиском "RAG: Как собрать свой ретривер", она там будет на втором или третьем месте.

Спасибо! Собаку поменял )

Qwen3.5 27B пробовал. Инференс не стартует, остановил. Нужно разобраться, возможно обновить ollama. Говорят, хорошая модель. Получится запустить - сделаю апдейт.

Спасибо за статью, с удовольствием попробовал!
В функции make_docs список файлов лучше брать из annotated, у файлов из raw не у всех есть пара.

У меня получилось на trax 1.3.6. Попробовал и TPU и GPU, но тексты были короткими.

В Trax версии 1.3.7 в реформер не получалось загрузить веса. Старая ошибка, которую в 1.3.4 вроде бы исправляли. У Вас вышло?

Купил. С примерами да, проблема. По-моему spacy сейчас уже работает с русским языком.
Ну хоть шрифт нормальный, можно в транспорте почитать. «Обработку естественного языка в действии» изд. Питер — только при ярком свете днём или под стоваттной лампой.
Отличная идея использовать всего две точки на шее и подбородке, чтобы показать поворот головы! Красиво. Удачи Вам!
Да, точно, вложение!

Information

Rating
1,241-st
Location
Москва, Москва и Московская обл., Россия
Registered
Activity