Комментарии / Профиль AlexErf13 / Хабр

Alex Erofeev@AlexErf13^{read⁠-⁠only}

Пользователь

-7

Рейтинг

Подписчики

ПрофильСтатьи11Посты3НовостиКомментарии24

ИИ-агенты без оркестрации и роутинга

AlexErf13 10 мар в 13:43

Токенов не жрет больше, чем например подход ReAct, как в OpenClaw. По сути тут все разделено между набором агентов внутри досок, и агента не обрабатывают все (у них есть goal и когда они не нужны они не действуют).

Нейросети не смогут в AGI

AlexErf13 15 фев в 16:45

Просто потому что у меня была node 2:5005:39 :)

Мясной слой для ИИ-агентов Пока Elon Musk ещё не продает...

AlexErf13 10 фев в 16:18

)))

Нейросети не смогут в AGI

AlexErf13 27 янв в 06:35

Они отлично иллюстрируют способности нейросетей :) Превьюшку уже поменять не могу, это ограничения habr.

Как сделать RAG/ИИ-ассистента без кода

AlexErf13 11 июн 2025 в 05:38

Ждем вашей статьи по теме - с удовольствием почитаем/разберем.

Как сделать RAG для своей компании

AlexErf13 9 мая 2025 в 04:47

Библиотеки pytesseract, pdf2image, PIL. Если нужно дайте знать я скину пример кода.

Как сделать RAG для своей компании

AlexErf13 9 мая 2025 в 04:45

У нас нет, но сейчас работаю с компанией у которой все документы в docx, pdf, и большинство отсканированые пиксельные. Тут довльно хорошо работает OCR для распознования в текст:

Как сделать RAG для своей компании

AlexErf13 6 мая 2025 в 17:27

Можно дату, но зачем усложнять если просто берем отрезаем все что старше чем X. Какое приложение должно вызывать MCP сервер? У нас адаптер в виде slack бота, он коннектится к MCP которые уже роутит вопрос куда надо. Можно использовать и облачную и локальную LLM, есть локальные 1 битные, которые даже на CPU более менее работают

Как сделать RAG для своей компании

AlexErf13 3 мая 2025 в 12:55

Из беспатных LLM? ну собственно даже chatGPT сейчас имеет бесплатный тариф, правда ограниченный по токенам. Либо любую локальную LLM отсюда https://huggingface.co/models. Либо вот эту для CPU https://t.me/aigentto/19.

Как сделать RAG для своей компании

AlexErf13 30 апр 2025 в 06:22

Интересная задача по поиску противоречий. Но это не совсем RAG, это скорее стадия подготовки к RAG. Стадия чистки данных. RAG выбирает топ X документов на запрос пользователя. На запрос типа «Какие ВНД противоречат друг другу и в чем?», он не выберет ничего.

Здесь вам просто нужно загнать все документы в LLM с промтом «Какие ВНД противоречат друг другу и в чем?». Если документов очень много, то нужно будет делать пошагово, то есть сказать: «Я буду сейчас давать тебе документы, твоя задача - выяснить, какие ВНД противоречат друг другу и в чем?». Можно это автоматизировать, чтобы оно, например, раз в какой-то период прогоняло этот сценарий и выявляло дубликаты.

Про локальный запуск. Примерные скорости при использовании GPU vs CPU локально (первый параметр - это сложность нейросети, чем больше, тем в среднем качественней результат):

Локальные модели, помещённые на GPU/VRAM:
- 7–13B: 20 токенов в секунду
- 14–40B: 15 токенов в секунду
- 70–700B: 10 токенов в секунду
Локальные модели, запущенные на CPU/RAM:
- 7B: 8 токенов в секунду
- 14–40B: 3 токена в секунду
- 70–700B: 1,5 токена в секунду

В среднем один токен состоит из 3–5 символов, включая пробелы, знаки препинания и специальные символы. На однобитных LLM будет в несколько раз быстрее, но качество может пострадать немного.

Таким образом, если у вас, например, 100 документов средним размером 2 листа A4 (~4000 символов), то есть весь объем в 4 тысяч символов, то обработка всех документов будет занимать в среднем ~1,5 часа на GPU и 8 часов на CPU, либо ~2-3 часа на 1-битной сети на CPU. Это очень примерно.

Если у вас объем документов больше, то вы уже рискуете не попасть в контекстное окно нейросети, и нужно будет сравнивать наборы документов, что приведет к вынужденным повторным сравнениям и удлинит этот процесс.

GPU, про который мы здесь говорим, это что-то типа ~RTX 4090 ценой ~250 тыс. рублей

Как сделать RAG для своей компании

AlexErf13 29 апр 2025 в 08:48

Если нужен код, читайте предыдущие статьи.

Создать App одним промтом

AlexErf13 23 апр 2025 в 10:37

Ничего не понял ) Английский у меня native. В чем вопрос то к статье? )

Создать App одним промтом

AlexErf13 23 апр 2025 в 10:37

Как раз таки следовал, но может не всем. Спасибо за bolt.new, выглядит интересно.

AI агенты — клоны сотрудников (часть 3)

AlexErf13 27 мар 2025 в 08:45

Ну, тут нужно посчитать. Ведь если использовать OpenAI VectorStore, то загрузка данных туда бесплатная. А за использование этих данных (а именно выборку топ 5-50 векторов) нужно будет платить в два раза меньше, чем если передавать эти данные каждый раз при использовании локальной векторной базы. Есть еще косты за хранение данных там, но они совсем копеечные. Поэтому у нас в итоге должно получиться дешевле, чем например с Gemini.

AI агенты — клоны сотрудников (часть 3)

AlexErf13 27 мар 2025 в 08:41

Надо почистить repo и все описать, сейчас там набор random скриптов ) Но я сделаю чуть позже.

Как я сделал RAG для своей компании (часть 2). И как начал делать AI Агента

AlexErf13 12 мар 2025 в 08:42

Да добавить NER + GraphDB для Wiki. Для Slack оставить ChromaDB + NER. Для JIRA сделать только GraphDB + NER.

Как я сделал RAG для своей компании (часть 2). И как начал делать AI Агента

AlexErf13 12 мар 2025 в 08:41

Не понял на что заменили chromaDB? Это же просто векторная БД, при чем тут модели и huggingface?

Как я сделал RAG для своей компании

AlexErf13 7 мар 2025 в 11:43

Записал попробовать GraphRAG + NER. Очень интересно на сколько лучше оно будет работать. Сейчас кстати уже неплохо на твердую 4 работает.

Как я сделал RAG для своей компании

AlexErf13 7 мар 2025 в 11:31

ElasticSearch тоже хочу попробовать, когда буду уже заливать весь slack + весь gitlab. Там наверное будут сотни тысяч или миллионы векторов.

Как я сделал RAG для своей компании

AlexErf13 7 мар 2025 в 11:29

Я пока заливал только wiki + один канал slack. Это за 7-8 лет истории, но получилось на удивление немного - несколько тысяч документов. По времени 5 минут на MacBook M3.