Комментарии 11
интересно, а как вы вообще изначально выбирали локальные модели?
Раз уж Вы располагаете аж 128 Гб памяти, то было бы очень интересно увидеть в тестах ещё и https://github.com/antirez/ds4
по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.
Qwen запускал с дефолтными параметрами, без mtp и пенальти за зацикливание. Отдельный system prompt не писал, использовался дефолтный для Hermes
попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.
А почему без mtp? Скорость лишняя? Или еще причины есть?
Я давно юзаю локальные ллм и qwen 3.6 27b плотная модель работает в ощутимо лучше и умнее чем мое модели 35b a3b и ornit. Они как раз часто галюцинируют. Думаю тут дело в железке. Также для скорости я юзаю mtp и это даёт существенный буст к перформансу. Каких то лагов я не замечал, разве что только кроме одного раза где после резкой смены языка программирования у меня рейтинг предсказания упал до 0 и просто замедлилась скорость
А вот с гига кодом у меня был давно совсем печальный опыт и с его лагами и зацикливания и я быстро забросил попытки его использования
Да, у меня тоже сначала сложилось ощущение, что qwen 3.6 27b (dense) лучше пишет код, но на Spark она работает крайне медленно. Интересно будет попробовать qwen 3.8 27b. Может быть MTP как-то улучшит ситуацию со скоростью. Но в идеале, железка нужна другая.
Gigacode у меня изначально тоже вызывал только негатив - пришлось изрядно его тюнить навыками, чтобы хоть как-то с ним работать. Но для подстраховки держать можно, когда лимиты Claude исчерпываются.
А для какого спектра задач используете Qwen 3.6 27b?

Hermes c локальными LLM vs GigaCode: сравниваем агентов на реальных PHP/Symfony-задачах