Pull to refresh
6

User

8
Subscribers
Send message

да, это тупость несусветная))), аргументируют - наш суверенный код не должен попасть врагу. Кому он нужен "суверенный код" там на западе или в Китае))).

PS. Иногда смотришь этот суверенный код и думаешь - где тут мусорное ведро.

1с до RAG доросла? Круто!

HSNW почему 512? Максимум же 2560 можно юзать.

заметил что используется роутер/классификатор, как организована его работа? Программно или используется модель для классификации? Я в статье (https://habr.com/ru/articles/1019018/) описывал что с ростом документов и если используется модель для классификации, то промты необходимо мутировать и периодически сдвигать.

что за наезды на 1С?! Тебе бухгалтерия выдаёт зарплату каждый месяц на языке 1С, а ты вот так вот (((

Один только хейт. Автор лисапед изобретаем в свои юные годы, а все фТопку. Занимайся автор своим пер проектом, набьешь шишек. После будет озарение - где тут кнопку удалить все? Зато сколько опыта!!! Да прибудет с тобой сила, юный джедай!

да, перепутал префил 250-300 ток/с, генерация выше 30 ток/с не поднимается - упирается в скорость шины.

и не надо mtp, с ним одни галлюцинации получаешь.

попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.

Пробовал. Запускается Q4_KV4 спокойно, скорость генерации 30-40 ток/сек (упирается в низкую скорость шины 300 Гб/с). Вообще использовать модели в квантизации Q4 такое себе, по одному и тому же промту можно получить 1000 вариаций ответа. Только поиграться.

по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.

пробовал загонять qwen 35B тут уже памяти в притык и включается remat - скорость генерации падает бывает до 80 ток/сек

скорость шины не особо важна на GX10 для инференса, т. к. памяти с большим запасом и нет инфляции по remat + помогает mtp, которая на обратном проходе (forward) не вычисляет все токены + узкое окно максимальных токенов 64к + всего 1 агент и 3-4 субагентов всего. Если бы было под 50-100 агентов тогда да - включился бы remat и скорость шины была бы важна.

не ошибся, 27B покрывает 100% моих задач + остаётся большое окно для KV кеша. Использовать 35B для кодинга считаю бессмысленно.

гоняю Qwen3.6 27B Q8 дообученную под свой домен кодинга 1С, вшил sft+dpo по разным критериям. Оборудования для инференса Asus GX10 128Gb скорость при окне 65536 токенов 250-300 ток/сек на прогретом кеше. При окне 131072 токенов 90-150 ток/сек. Заливать инференс на окне 262144 токенов (это макс. для этой модели) не имеет смысла т. к. скорость генерации проседает до 20 ток/сек. - здесь основная причина огромные матрицы для вычислений. Вывод: грамотно подбирать гиперпаркметры для инференса.

Я только не понял причём тут кодинг и гермес? Гермес это тупо агент рабочей среды с набором скилов, памяти, правил. Хороший кодинг зависит от модели и хорошего промта, если на входе тупо написать "сделай мне классный mcp сераер" - на выходе и получите что просили. Для кодинга каждый день использую курсор + модели от антропика для плана + модель grok для кодинга - результат всегда приемлемый.

на arXiv есть статья (ссылку не помню) там пробовали в маскированный токен добавлять timestep, на длинных контекстах больше 32к результат приемлемый. Но KV кеш при увеличении длины контекста улетает в небо, т. к. каждый denoising step обрабатывает уже не 8-16 итераций.

И есть проблема что логиты лучше держать в fp32 для более точной корреляции денозинга.

Не понимаю в чем профит этой системы? Как я понял на каждом слое также используется какая-либо llm для проверки фактов, памяти, источников и.т.п. Так что мешает llm вытащить источник и сказать - "вот нашел источник, он праводоподобный"?

Поддерживаю! Сам говно(вайб)кодер opensource проектов. Но я ими пользуюсь каждый день, допиливаю, смотрю коммиты после агента, т.к. бесят куча fallback + к правке двух строк в одном модуле прилетает еще +100500 файлов. Я только не понимаю как автор 300к строк кода ревьювил?)))

Так я не понял сколько ты заработал на своих торговых ботах? Можно цифрами порадовать?

размер словаря (vocab size) ещё уменьши, удивишься как скорость генерации взлетит.

а dpo (датасет из пары хороший-плохой ответ) не пробовали файнтюнить? Сколько статей выкладывают про тюнинг, ни разу не видел чтобы dpo дообучали, все только на датасетах sft (инструкции) останавливаются.

Information

Rating
Does not participate
Registered
Activity