Обновить

GTX 1080 Ti не сдаётся: выбираем лучшую MoE-модель для llama-server среди 35B, 120B и 176B

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели9.7K
Всего голосов 4: ↑4 и ↓0+7
Комментарии14

Комментарии 14

У меня есть Pet проект (игра на Go + Ebiten, 2D графика, в стиле игр БК 0010), попробую на него натравить Swift-Qwen3.8-35B-A3B, но это будет уже завтра. Сегодня гонял целый день Qwen3.8-35B-A3B-Q4_K_M (уже не помню где скачал), со всеми моими “пожеланиями” справилась на ура…

Нашел только Swift-1.5-Qwen3.8-27B, но она дает только 2,9 т/с , а это очень мало… Так “капает” только Qwen3.8-flash-next …, но она лучше…

А что за Qwen3.8-35B-A3B-Q4_K_M.gguf ? мне упорно поисковик выдает только empero-ai/Qwen3.8-35B-A3B-Distill-GGUF То есть квен 3.6 в который попытались запихнуть 3.8. Оно точно лучше чистого 3,6?

3.6 не пробовал запускать, но Qwen3.8-35B-A3B на Go полностью пишет код и если допускает ошибки, то сам их и устраняет. Моя работа - написать промпт, проверить план и дополнить если необходимо, все остальное делает он. Инструкции выполняет “как часы”, по скорости и качеству кода, я лучше пока не видел. Ну … можно платный DeepSeek “поюзать”. У меня раньше, от одного проекта, были халявные 10$ ежесуточно (много чего перепробовал), платный DeepSeek ничем не лучше, но это мое субъективное мнение.

Так напишите пожалуйста точно, что у вас за Qwen3.8-35B-A3B. Так как такой модели не существует. Это кто-то взял 3.6 и помучил его, но точно не создатель квена. Это empero-ai, или у вас какая-то еще модель?

Как пример аналога моей модели: https://huggingface.co/IsValorum/Qwen3.8-35B-A3B-Distill-MTP-APEX-I-MiniPlus-V2.1-GGUF. Где скачал модель которая участвовала в эксперименте, не помню. :>)) PS. Нашел: https://huggingface.co/empero-ai/Qwen3.8-35B-A3B-Distill-GGUF/resolve/main/Qwen3.8-35B-A3B-Q4_K_M.gguf

Необходимо прояснить пару моментов:
- GPT-OSS-120B - хватит уже пинать этого мёртвого осла. Модели уже почти полтора года, по современным меркам она ни на что не годна
- Qwen3.8-35B-A3B не существует - это всё дистилляты поверх архитектуры 3.6. Ни одна версия такой модели, что я пробовал, не дотягивается до плотного Qwen3.8-27B

Даже устаревшая GPT-OSS-120B может быть востребована: например, на OpenRouter она по-прежнему предоставляется пользователям. Аналогично OpenAI поддерживает некоторые условно устаревшие модели, использование которых может обходиться дороже современных - вероятно, как для пользователя, так и для самой OpenAI. Возникает вопрос: почему? Ответ довольно прост: каждая модель требует индивидуальной настройки программного обеспечения, в частности корректировки системных инструкций под конкретные задачи. Я и сам с этим сталкивался: при переходе на новую современную LLM она не всегда работает так, как требуется. Поэтому преждевременно списывать такие модели со счетов. Например, мой опыт эксплуатации Qwen3.8-27B: я скачал её через Ollama, подключил к OpenCode, но она не выполняла указания пользователя. Возможно, я не смог правильно её настроить - вероятно, требовалась корректировка системной инструкции; не знаю. Но для меня она оказалась нерабочей.

У Ollama до сих пор висят незакрытыми пара issues про поведение агентов/инструментов для Qwen3.8. Я честно ждал месяц с выхода этой модели (да и Muse) и в результате переехал на чистый llama.cpp

Это зависит от того на чем пробовать. Ну и как замер делать. Сколько задачек успеет сделать за 2 часа например на конкретном железе. Да, можно подобрать что-то, что 3,6 не решит совсем, даже с подсказками и уточнениями, но если помучить на чем-то несложном и обычном, то будет интересно.

Попробуйте Bonsai 2(тернарно сжатый и репараметризованный Qwen3.8-27B с технологией PrismML), на 12 гигах 5070 вообще прекрасно себя чувствует, 49-56 токенов в среднем получаю на PQ2_0 версии. Для 1080ti скорее всего PQ1_0 лучше ставить, но это уже нужно тестировать. На больших проектах ещё не пробовал, но на маленьких на уровне 3.8-27B квена, как по мне

Qwen3.8-35B нету, это 3.6 дистиллированный и типа дообучен на 3.8, лучше ли он 3.6 чистого сомнительно, обычно улучшают что-то одно, ломают другое. Лучше последнего ornith 1.5 35B в котором основа всё та же Qwen3.6 среди этих моделей лучший, особенно cyber tiel, его реально сделали для агентских задач спокойной трудится над проектами сутками без остановки пока не выполнит задачу.

Сходил на указанный сайт, почитал про "на двух RTX 5060 Ti по 16 ГБ ". Ну что можно сказать, не все технические параметры указаны и учтены . Материнская плата x99 вполне может запускать две видеокарты в режиме x16+x16 pcie3, а на большинстве плат lga1700 будет только x8 (pcie5 или pcie4) + x4 (pcie4 или даже pcie3) (учитываем, что 5060ti сама по себе x8).

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации