Комментарии 12
интересно, а как вы вообще изначально выбирали локальные модели?
Раз уж Вы располагаете аж 128 Гб памяти, то было бы очень интересно увидеть в тестах ещё и https://github.com/antirez/ds4
по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.
Qwen запускал с дефолтными параметрами, без mtp и пенальти за зацикливание. Отдельный system prompt не писал, использовался дефолтный для Hermes
попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.
А почему без mtp? Скорость лишняя? Или еще причины есть?
Я давно юзаю локальные ллм и qwen 3.6 27b плотная модель работает в ощутимо лучше и умнее чем мое модели 35b a3b и ornit. Они как раз часто галюцинируют. Думаю тут дело в железке. Также для скорости я юзаю mtp и это даёт существенный буст к перформансу. Каких то лагов я не замечал, разве что только кроме одного раза где после резкой смены языка программирования у меня рейтинг предсказания упал до 0 и просто замедлилась скорость
А вот с гига кодом у меня был давно совсем печальный опыт и с его лагами и зацикливания и я быстро забросил попытки его использования
Да, у меня тоже сначала сложилось ощущение, что qwen 3.6 27b (dense) лучше пишет код, но на Spark она работает крайне медленно. Интересно будет попробовать qwen 3.8 27b. Может быть MTP как-то улучшит ситуацию со скоростью. Но в идеале, железка нужна другая.
Gigacode у меня изначально тоже вызывал только негатив - пришлось изрядно его тюнить навыками, чтобы хоть как-то с ним работать. Но для подстраховки держать можно, когда лимиты Claude исчерпываются.
А для какого спектра задач используете Qwen 3.6 27b?
В основном юзаю для бэкэнд Java Kotin огромных микросервисных банковских проектов. Также использую ее для повседневных задач типа, "настрой мне ВПН на моем серваке", "покажи кто слушает порт", "открой сайт", "смонтируй мне ролик из кучи роликов в этой папке", ... Очень мне помогает. Только что вышла новость что открыли обратный отсчёт выкладывания qwen 3.8 27b - пишут что она порвет в кодинге всех. Прямо очень жду. Но qwen 3.6 27b mtp - это для меня мегаимба. Я запускаю ее на 4080 32гб, и все летает.

Hermes c локальными LLM vs GigaCode: сравниваем агентов на реальных PHP/Symfony-задачах