Pull to refresh

Comments 9

интересно, а как вы вообще изначально выбирали локальные модели?

По обзорам, которые мне попадались, и по советам Gemini, ChatGPT, DeepSeek. Смотрел на то, сколько памяти нужно для развертывания, какие показатели на бенчмарках.

Laguna, по сути, стала для меня открытием, которую посоветовал один из ИИ - позволяет выжать максимум из DGX Spark, как мне кажется

Раз уж Вы располагаете аж 128 Гб памяти, то было бы очень интересно увидеть в тестах ещё и https://github.com/antirez/ds4

Пробовал. Запускается Q4_KV4 спокойно, скорость генерации 30-40 ток/сек (упирается в низкую скорость шины 300 Гб/с). Вообще использовать модели в квантизации Q4 такое себе, по одному и тому же промту можно получить 1000 вариаций ответа. Только поиграться.

по qwen не хватает данных с какими гиперпараметрами запускал (особенно интересует mtp), какой коэффициент пенальти от зацикливания в промтах, использовал ли отдельные system promt, user promt или все в одно окно кидал.

Qwen запускал с дефолтными параметрами, без mtp и пенальти за зацикливание. Отдельный system prompt не писал, использовался дефолтный для Hermes

попробуй докрутить, взять хотя бы qwen Q8, лучше bf16 с меньшим контекстным окном, составить отдельно правило system promt, температура 0.6-0.7, пенальти зацикливание 1.1. Оборудование тебе позволяет. Также есть qwen a3 она заточена под агентский цикл.

А почему без mtp? Скорость лишняя? Или еще причины есть?

и не надо mtp, с ним одни галлюцинации получаешь.

Sign up to leave a comment.

Articles