Обновить
6

Пользователь

0,2
Рейтинг
Отправить сообщение

Намного дороже. Все эти хабы/пользы и прочее, по сути прокладка между юзером и опенроутером со своей наценкой. Только работает без ВПН и оплата в рублях

Ну и цена у клода почти на уровне фронтир моделей сбера 😁

Спасибо сберу) все для развития ИИ в РФ...
qwen3.6-35b-a3b

Hermes, Openclaw это опенсорс который можно поставить себе на машину и выбрать любую модель. Гига аналогичная? Или как обычно, + х10-х20 стоимости в токенах от deepseek/qwen?

Подскажите, а свой сервер в смысле локально дома или в ДЦ?

Всё для того чтобы российские компании выбирали наших провайдеров AI, а не сливали данные за бугор🎉

Это на чем дип запускаешь? Я на своем смогу на что-то рассчитывать? 😁

Да. Например десятки тысяч сообщений из выгрузки рабочих ТГ чатов, тикетов, задач в трекере очистить от мусора, дедуп, классификация. LLM чанкинг, составление графа и прочего, где не требуется сложная аналитика и мышление. Всё что требует тысяч вызовов к API платных моделей и что может решить локальная - делаю на локальной.

Владею ноутбуком на RTX 5080, 64Gb DDR5, 2Tb SSD, Ultra 9 275HX. Так вот под рукой всегда qwen3.6-35b-a3b - MoE модель, которая не требуя интернета достаточно быстро работает 65-85 т/с, в зависимости от контекстного окна. Очень помогает в рутинных повторяющихся задачах. Для основной работы есть подписка на Codex. Было бы здорово чтобы реально появилась возможность запускать такие модели как GLM 5.2, Kimi, DeepSeek в приемлемой скорости 10-20 т/с на таком железе. Учитывая двухсторонние ограничения РФ<>Европа/США, это даст хорошую опору и независимость от политоты и прочего. Надеюсь такие энтузиасты найдут способ это сделать. Moe 120b/20 (oss) уже получается запускать на 20+- т/с.

Этому товарищу (fable), лучше заранее говорить, что бы больше 2-3 субагентов не запускал.

Попросил его провести аудит проекта небольшого и ушел, а он запустил 115 субагентов и за 6 минут съел 5 часовой лимит х20. Opus таким расточительством не занимается

Спасибо!

То что нормализацию делаете в . md правильно. Прогоняйте через ИИ чтобы переписывала документы в нужный под чанкер формат. Тогда сразу двух зайцев убьете, - нормализация и с алгоритмом чанкования не будете париться. Сами свой универсальный чанкер под свою документацию напишете.

С bpmn , диаграммами я не сталкивался лично, не подскажу. А так берите опенсорс qwen3-4b эмбеддер, смотрите метрики, реранкер тоже можете попробовать квена взять 0.6b. Зафиксируйте метрики на базовом квене и lora делайте на своих доках. У меня разные метрики выросли уже на 50-300% , на дообученном эмбеддере и реранкере. Но возможно вас и сырой гибрид с бм25 устроит. В любом случае каждый домен и пул документов как правило требует длительного тестирования и метрик. RAG нормальный без этого не построить.

Начните с бм25, реранкера(если его еще нет). Возможно этого хватит для выполнения ТЗ. Cohere 3.5 можете на опенроутере или российском провайдере-прокладке попробовать. Т.к иногда с ру серверов cohere отбивает 403

Спасибо!

Да, с вашим количеством документов подход явно иной. Это статья скорее для таких же как я, чтобы не городили оверкил там, где не нужно🫡

Извините, я какую задачу может решить модель 1b, если мы не про реранкеры/эмбеддеры ?! Генерация текста? Это можно и без модели решить

Да, раньше пробовал коробочные решения. Но там нет гибкости, нет возможности метаинфу к докам креплять и прочего. Это как раз подходит для того чтобы просто найти похожие фрагменты, но аналитики и диагностики ИИ на базе этой, система не даст. Достаточно примитивная

Спасибо, Интересно!

А вы думали тоже самое делать с моделями по крупнее? Qwen 8-14b или MoE 35b?

Ну хорошо 200B тянет. Пусть и 500b тянет. Насколько это в проде практично использовать или хотя бы как тестовую среду? В плане скорости. Вот есть допустим MoE Qwen235b, при входящем контексте в 200к токенов, сколько займет проглатывание контекста и какая будет скорость генерации? Даже если упереться во все оптимизации и трюки, аля https://inllm.ru/inferens/optimizaciya-inferensa#pagedattention-и-vllm

Насколько эти спарки и прочее юзабельны?

Это было в прошедшем) сейчас я понимаю и про слои, куда-сколько и про движки инференса и прочее. Тогда опыта было 0

Ловишь майнер, достаешь флешку с dr.web с надеждой что ты умный и думаешь на шаг вперед, вставляешь > запускаешь, а он, - "Обновите меня! Без обновлений не могу, скачайте с офф сайта новую версию". А офф сайт и браузер крашатся майнером, который на два шага вперед:)

Вот лучше бы это нашли как обойти.

Человек который придумает реально элегантную память для агента и в целом RAG, станет кумиром. Это реальная боль.. Казалось бы пол года бился за красивые recall и прочее, перебрал десятки моделей БЯМ, реранкеров, эмбеддеров, добавил бм25, накатил еще граф сверху, но как только к системе нужно подключить другой отдел своей же компании с немного другим форматом документации, ее объёмом и структурой, все идет через одно место и нужно снова проводить тесты, гонять метрики и молиться чтобы ранее рабочий алгоритм не отвалился.

Но одну истину я уяснил, если объём и формат документации позволяют сделать через библиотекаря(навигатора, роутера), лучше сделать так. Это прослеживается более адекватно, а не надежда на вектора, это одна точка отказа - LLM, а не три - LLM, embedding, reranker. Не нужно БД лишние держать. Но это не всегда серебряная пуля и нужно реально гонять тесты, как я вначале сказал. Так что ждем гения, который даст такую пулю🙂

Информация

В рейтинге
3 037-й
Зарегистрирован
Активность