Обновить

Комментарии 11

интересно, а как вы вообще изначально выбирали локальные модели?

По обзорам, которые мне попадались, и по советам Gemini, ChatGPT, DeepSeek. Смотрел на то, сколько памяти нужно для развертывания, какие показатели на бенчмарках.

Laguna, по сути, стала для меня открытием, которую посоветовал один из ИИ - позволяет выжать максимум из DGX Spark, как мне кажется

Раз уж Вы располагаете аж 128 Гб памяти, то было бы очень интересно увидеть в тестах ещё и https://github.com/antirez/ds4

Пробовал. Запускается Q4_KV4 спокойно, скорость генерации 30-40 ток/сек (упирается в низкую скорость шины 300 Гб/с). Вообще использовать модели в квантизации Q4 такое себе, по одному и тому же промту можно получить 1000 вариаций ответа. Только поиграться.

по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.

Qwen запускал с дефолтными параметрами, без mtp и пенальти за зацикливание. Отдельный system prompt не писал, использовался дефолтный для Hermes

попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.

А почему без mtp? Скорость лишняя? Или еще причины есть?

и не надо mtp, с ним одни галлюцинации получаешь.

Я давно юзаю локальные ллм и qwen 3.6 27b плотная модель работает в ощутимо лучше и умнее чем мое модели 35b a3b и ornit. Они как раз часто галюцинируют. Думаю тут дело в железке. Также для скорости я юзаю mtp и это даёт существенный буст к перформансу. Каких то лагов я не замечал, разве что только кроме одного раза где после резкой смены языка программирования у меня рейтинг предсказания упал до 0 и просто замедлилась скорость

А вот с гига кодом у меня был давно совсем печальный опыт и с его лагами и зацикливания и я быстро забросил попытки его использования

Да, у меня тоже сначала сложилось ощущение, что qwen 3.6 27b (dense) лучше пишет код, но на Spark она работает крайне медленно. Интересно будет попробовать qwen 3.8 27b. Может быть MTP как-то улучшит ситуацию со скоростью. Но в идеале, железка нужна другая.

Gigacode у меня изначально тоже вызывал только негатив - пришлось изрядно его тюнить навыками, чтобы хоть как-то с ним работать. Но для подстраховки держать можно, когда лимиты Claude исчерпываются.

А для какого спектра задач используете Qwen 3.6 27b?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации