да, это тупость несусветная))), аргументируют - наш суверенный код не должен попасть врагу. Кому он нужен "суверенный код" там на западе или в Китае))).
PS. Иногда смотришь этот суверенный код и думаешь - где тут мусорное ведро.
заметил что используется роутер/классификатор, как организована его работа? Программно или используется модель для классификации? Я в статье (https://habr.com/ru/articles/1019018/) описывал что с ростом документов и если используется модель для классификации, то промты необходимо мутировать и периодически сдвигать.
Один только хейт. Автор лисапед изобретаем в свои юные годы, а все фТопку. Занимайся автор своим пер проектом, набьешь шишек. После будет озарение - где тут кнопку удалить все? Зато сколько опыта!!! Да прибудет с тобой сила, юный джедай!
попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.
Пробовал. Запускается Q4_KV4 спокойно, скорость генерации 30-40 ток/сек (упирается в низкую скорость шины 300 Гб/с). Вообще использовать модели в квантизации Q4 такое себе, по одному и тому же промту можно получить 1000 вариаций ответа. Только поиграться.
по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.
скорость шины не особо важна на GX10 для инференса, т. к. памяти с большим запасом и нет инфляции по remat + помогает mtp, которая на обратном проходе (forward) не вычисляет все токены + узкое окно максимальных токенов 64к + всего 1 агент и 3-4 субагентов всего. Если бы было под 50-100 агентов тогда да - включился бы remat и скорость шины была бы важна.
гоняю Qwen3.6 27B Q8 дообученную под свой домен кодинга 1С, вшил sft+dpo по разным критериям. Оборудования для инференса Asus GX10 128Gb скорость при окне 65536 токенов 250-300 ток/сек на прогретом кеше. При окне 131072 токенов 90-150 ток/сек. Заливать инференс на окне 262144 токенов (это макс. для этой модели) не имеет смысла т. к. скорость генерации проседает до 20 ток/сек. - здесь основная причина огромные матрицы для вычислений. Вывод: грамотно подбирать гиперпаркметры для инференса.
Я только не понял причём тут кодинг и гермес? Гермес это тупо агент рабочей среды с набором скилов, памяти, правил. Хороший кодинг зависит от модели и хорошего промта, если на входе тупо написать "сделай мне классный mcp сераер" - на выходе и получите что просили. Для кодинга каждый день использую курсор + модели от антропика для плана + модель grok для кодинга - результат всегда приемлемый.
на arXiv есть статья (ссылку не помню) там пробовали в маскированный токен добавлять timestep, на длинных контекстах больше 32к результат приемлемый. Но KV кеш при увеличении длины контекста улетает в небо, т. к. каждый denoising step обрабатывает уже не 8-16 итераций.
И есть проблема что логиты лучше держать в fp32 для более точной корреляции денозинга.
Не понимаю в чем профит этой системы? Как я понял на каждом слое также используется какая-либо llm для проверки фактов, памяти, источников и.т.п. Так что мешает llm вытащить источник и сказать - "вот нашел источник, он праводоподобный"?
Поддерживаю! Сам говно(вайб)кодер opensource проектов. Но я ими пользуюсь каждый день, допиливаю, смотрю коммиты после агента, т.к. бесят куча fallback + к правке двух строк в одном модуле прилетает еще +100500 файлов. Я только не понимаю как автор 300к строк кода ревьювил?)))
а dpo (датасет из пары хороший-плохой ответ) не пробовали файнтюнить? Сколько статей выкладывают про тюнинг, ни разу не видел чтобы dpo дообучали, все только на датасетах sft (инструкции) останавливаются.
да, это тупость несусветная))), аргументируют - наш суверенный код не должен попасть врагу. Кому он нужен "суверенный код" там на западе или в Китае))).
PS. Иногда смотришь этот суверенный код и думаешь - где тут мусорное ведро.
1с до RAG доросла? Круто!
HSNW почему 512? Максимум же 2560 можно юзать.
заметил что используется роутер/классификатор, как организована его работа? Программно или используется модель для классификации? Я в статье (https://habr.com/ru/articles/1019018/) описывал что с ростом документов и если используется модель для классификации, то промты необходимо мутировать и периодически сдвигать.
что за наезды на 1С?! Тебе бухгалтерия выдаёт зарплату каждый месяц на языке 1С, а ты вот так вот (((
Один только хейт. Автор лисапед изобретаем в свои юные годы, а все фТопку. Занимайся автор своим пер проектом, набьешь шишек. После будет озарение - где тут кнопку удалить все? Зато сколько опыта!!! Да прибудет с тобой сила, юный джедай!
да, перепутал префил 250-300 ток/с, генерация выше 30 ток/с не поднимается - упирается в скорость шины.
и не надо mtp, с ним одни галлюцинации получаешь.
попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.
Пробовал. Запускается Q4_KV4 спокойно, скорость генерации 30-40 ток/сек (упирается в низкую скорость шины 300 Гб/с). Вообще использовать модели в квантизации Q4 такое себе, по одному и тому же промту можно получить 1000 вариаций ответа. Только поиграться.
по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.
пробовал загонять qwen 35B тут уже памяти в притык и включается remat - скорость генерации падает бывает до 80 ток/сек
скорость шины не особо важна на GX10 для инференса, т. к. памяти с большим запасом и нет инфляции по remat + помогает mtp, которая на обратном проходе (forward) не вычисляет все токены + узкое окно максимальных токенов 64к + всего 1 агент и 3-4 субагентов всего. Если бы было под 50-100 агентов тогда да - включился бы remat и скорость шины была бы важна.
не ошибся, 27B покрывает 100% моих задач + остаётся большое окно для KV кеша. Использовать 35B для кодинга считаю бессмысленно.
гоняю Qwen3.6 27B Q8 дообученную под свой домен кодинга 1С, вшил sft+dpo по разным критериям. Оборудования для инференса Asus GX10 128Gb скорость при окне 65536 токенов 250-300 ток/сек на прогретом кеше. При окне 131072 токенов 90-150 ток/сек. Заливать инференс на окне 262144 токенов (это макс. для этой модели) не имеет смысла т. к. скорость генерации проседает до 20 ток/сек. - здесь основная причина огромные матрицы для вычислений. Вывод: грамотно подбирать гиперпаркметры для инференса.
Я только не понял причём тут кодинг и гермес? Гермес это тупо агент рабочей среды с набором скилов, памяти, правил. Хороший кодинг зависит от модели и хорошего промта, если на входе тупо написать "сделай мне классный mcp сераер" - на выходе и получите что просили. Для кодинга каждый день использую курсор + модели от антропика для плана + модель grok для кодинга - результат всегда приемлемый.
на arXiv есть статья (ссылку не помню) там пробовали в маскированный токен добавлять timestep, на длинных контекстах больше 32к результат приемлемый. Но KV кеш при увеличении длины контекста улетает в небо, т. к. каждый denoising step обрабатывает уже не 8-16 итераций.
И есть проблема что логиты лучше держать в fp32 для более точной корреляции денозинга.
Не понимаю в чем профит этой системы? Как я понял на каждом слое также используется какая-либо llm для проверки фактов, памяти, источников и.т.п. Так что мешает llm вытащить источник и сказать - "вот нашел источник, он праводоподобный"?
Поддерживаю! Сам говно(вайб)кодер opensource проектов. Но я ими пользуюсь каждый день, допиливаю, смотрю коммиты после агента, т.к. бесят куча fallback + к правке двух строк в одном модуле прилетает еще +100500 файлов. Я только не понимаю как автор 300к строк кода ревьювил?)))
Так я не понял сколько ты заработал на своих торговых ботах? Можно цифрами порадовать?
размер словаря (vocab size) ещё уменьши, удивишься как скорость генерации взлетит.
а dpo (датасет из пары хороший-плохой ответ) не пробовали файнтюнить? Сколько статей выкладывают про тюнинг, ни разу не видел чтобы dpo дообучали, все только на датасетах sft (инструкции) останавливаются.