неизвестная ссылка не остаётся битой — она уезжает в отдельный индекс Unlinked Mentions с указанием, кто её упоминал
я как раз думаю двигаться в этом направлении.
По устройству vault — готовый RAG-корпус
На моём бенчмарке векторный поиск работает немного слабее LLM-агента, который всегда видит индекс и умеет ходить по ссылкам. Особенно по полноте ответа. И это у меня был RAG с адаптивным top_k. Наверняка кто-то ещё пытался сравнивать.
Вы сравниваете сравнивает теплое с мягким: сложный многошаговый пайплайн против базового векторного поиска.
Я сравниваю ответы одой и той же LLM, на один и тот же вопрос, с одним и тем же системным промптом. При этом в одном случае контекст скомпилирован из исходного документа, в другом - «сырые» фрагменты, отобранные по сходству с вопросом. Считаю такое сравнение правомерным. Подмешивание фрагментов в скомпилированный контекст качества не добавляет. Это я тоже проверил.
Если к RAG прикрутить такого же агента (для перекрестного поиска по терминам и метаданным), разница в качестве, скорее всегл, исчезнет
Какую архитектуру RAG здесь вы имеете в виду? Например, GraphRAG это тоже либо долго, либо дорого. По релевантности контекста он выглядит лучше чем простой векторный поиск.
Спасибо за комментарий, повеселили плачущим маркетологом. Я Data Scientist, а не маркетолог, но кажется, программистов на курс тоже берут) Почти на каждом задании ловил себя на желании написать скрипт руками, вместо того чтобы просто попросить Клода. Привычка сильнее курса. Зато есть вещи, которые я искренне не люблю делать сам: писать readme или строить дашборды по результатам. Тут я красиво умею изображать вайб-воркинг.
А ваши задачи без rag не решаются? Например положить все данные просто файлом рядом с моделью если это возможно.
В API Anthropic есть система кеширования, кэш живёт 5 минут. Если мы работаем с одним и тем же документом, то его можно закешировать и сэкономить на токенах. Качество ответов будет выше, чем у простейшей RAG системы. Картинка с дашбордом как раз этот эффект показывает. Дело в том, что бенчмарк синтетический. Я его сделал на gemma4:31b. Она получала тему для вопроса, но видела весь документ целиком, поэтому RAG уступает по качеству там, где в метрике используется "правильный" ответ.
модель куда эффективнее сама искал необходимую часть документа базовыми unix инструментами, чем получая избыточные данные от rag
Если RAG - просто векторный поиск, так скорее всего и будет. Сравнительно новые архитектуры предполагают использование в RAG агентов и LLM-судьи. В зависимости от его решения может адаптивно меняться количество чанков в выдаче, переформулироваться и дополняться вопрос, или вообще отключаться выдача, если LLM-судья решил, что для этого вопроса RAG не нужен.
Здравствуйте. Там всё на питоне и написано. инструменты, библиотека, rag система. ещё немного маркдауна, html и JavaScript. Статья в том числе и про то, как всё-равно пришлось написать код.
Не знаю какие причины у Автора, но бывает, что VRAM на RAG вообще не выделяют. Там же не один поток в проде может быть, а например восемь одновременно, одна домашняя видеокарта не спасёт, а на CPU как-то работает.
Так и я про это, только с другой стороны ) Высокие риски -> практики мало -> мало экспертизы -> низкая культура внедрения. А туториал ваш мне понравился.
Вы не думали что это ключевое отличие? В остальном, кажется обвинять российские компании в некомпетентности не совсем правильно. Есть как минимум три серьезных бизнес риска. Первый - аккаунт в любой момент заблокируют владельцы моделей из-за нарушения пользовательского соглашения. Второй - доступ к зарубежным моделям заблокируют по локальным причинам. Третий - стоимость токенов может вырасти кратно. Сейчас же прайс ниже себестоимости (поправьте меня, если ошибаюсь)? Поэтому он-прем и прочие аир-гэпы, поэтому чат-боты с локальными моделями. Несмотря на это, есть компании, которые уже поставили себе лейбл AI-Native.
Когда я только настраивал промпты, не было ограничения на "клонированные и синтетические" организмы. Вы не поверите, но у меня волосы вставали дыбом от того, что генерила gemma в тестовых запросах.
Купил. С примерами да, проблема. По-моему spacy сейчас уже работает с русским языком.
Ну хоть шрифт нормальный, можно в транспорте почитать. «Обработку естественного языка в действии» изд. Питер — только при ярком свете днём или под стоваттной лампой.
я как раз думаю двигаться в этом направлении.
На моём бенчмарке векторный поиск работает немного слабее LLM-агента, который всегда видит индекс и умеет ходить по ссылкам. Особенно по полноте ответа. И это у меня был RAG с адаптивным top_k. Наверняка кто-то ещё пытался сравнивать.
А как вы делали связи между сущностями? И ещё интересно, "для собственного использования" предполагает ответы по wiki от wiki-агента?
Я сравниваю ответы одой и той же LLM, на один и тот же вопрос, с одним и тем же системным промптом. При этом в одном случае контекст скомпилирован из исходного документа, в другом - «сырые» фрагменты, отобранные по сходству с вопросом. Считаю такое сравнение правомерным. Подмешивание фрагментов в скомпилированный контекст качества не добавляет. Это я тоже проверил.
Какую архитектуру RAG здесь вы имеете в виду? Например, GraphRAG это тоже либо долго, либо дорого. По релевантности контекста он выглядит лучше чем простой векторный поиск.
Спасибо за комментарий, повеселили плачущим маркетологом. Я Data Scientist, а не маркетолог, но кажется, программистов на курс тоже берут) Почти на каждом задании ловил себя на желании написать скрипт руками, вместо того чтобы просто попросить Клода. Привычка сильнее курса. Зато есть вещи, которые я искренне не люблю делать сам: писать readme или строить дашборды по результатам. Тут я красиво умею изображать вайб-воркинг.
Спасибо. Отличный вопрос!
В API Anthropic есть система кеширования, кэш живёт 5 минут. Если мы работаем с одним и тем же документом, то его можно закешировать и сэкономить на токенах. Качество ответов будет выше, чем у простейшей RAG системы. Картинка с дашбордом как раз этот эффект показывает. Дело в том, что бенчмарк синтетический. Я его сделал на gemma4:31b. Она получала тему для вопроса, но видела весь документ целиком, поэтому RAG уступает по качеству там, где в метрике используется "правильный" ответ.
Если RAG - просто векторный поиск, так скорее всего и будет. Сравнительно новые архитектуры предполагают использование в RAG агентов и LLM-судьи. В зависимости от его решения может адаптивно меняться количество чанков в выдаче, переформулироваться и дополняться вопрос, или вообще отключаться выдача, если LLM-судья решил, что для этого вопроса RAG не нужен.
Здравствуйте. Там всё на питоне и написано. инструменты, библиотека, rag система. ещё немного маркдауна, html и JavaScript. Статья в том числе и про то, как всё-равно пришлось написать код.
Не знаю какие причины у Автора, но бывает, что VRAM на RAG вообще не выделяют. Там же не один поток в проде может быть, а например восемь одновременно, одна домашняя видеокарта не спасёт, а на CPU как-то работает.
Так и я про это, только с другой стороны ) Высокие риски -> практики мало -> мало экспертизы -> низкая культура внедрения. А туториал ваш мне понравился.
Вы не думали что это ключевое отличие? В остальном, кажется обвинять российские компании в некомпетентности не совсем правильно. Есть как минимум три серьезных бизнес риска. Первый - аккаунт в любой момент заблокируют владельцы моделей из-за нарушения пользовательского соглашения. Второй - доступ к зарубежным моделям заблокируют по локальным причинам. Третий - стоимость токенов может вырасти кратно. Сейчас же прайс ниже себестоимости (поправьте меня, если ошибаюсь)? Поэтому он-прем и прочие аир-гэпы, поэтому чат-боты с локальными моделями. Несмотря на это, есть компании, которые уже поставили себе лейбл AI-Native.
Когда я только настраивал промпты, не было ограничения на "клонированные и синтетические" организмы. Вы не поверите, но у меня волосы вставали дыбом от того, что генерила gemma в тестовых запросах.
Загрузил в репозитарий. проверяйте
КДПВ в статье не показывается, только в ленте. Попробуйте поиском "RAG: Как собрать свой ретривер", она там будет на втором или третьем месте.
Спасибо! Собаку поменял )
Qwen3.5 27B пробовал. Инференс не стартует, остановил. Нужно разобраться, возможно обновить ollama. Говорят, хорошая модель. Получится запустить - сделаю апдейт.
Спасибо за статью, с удовольствием попробовал!
В функции make_docs список файлов лучше брать из annotated, у файлов из raw не у всех есть пара.
У меня получилось на trax 1.3.6. Попробовал и TPU и GPU, но тексты были короткими.
В Trax версии 1.3.7 в реформер не получалось загрузить веса. Старая ошибка, которую в 1.3.4 вроде бы исправляли. У Вас вышло?
Ну хоть шрифт нормальный, можно в транспорте почитать. «Обработку естественного языка в действии» изд. Питер — только при ярком свете днём или под стоваттной лампой.