Comments 14
Qwen3.8-27B - это самый важный открытый релиз года, если у вас есть компьютер, и если у вас его нет. Я отношусь ко второй группе, и это моя собственная вина.
Отлично. Теперь есть доказательство, что Мак не комп))
а они собираются выпустить микстуред модель на ядре 3.8?
на моём компе qwen3.6-35b-A3 даёт 30 ток.сек... 3.8-27b - только 7 ((
прикрутить mtp или dflash, получается от +50% до x4. Зачем вам MoE, когда есть mtp, который тот же мое, только модель активируется вся.
mtp и тем более dflash это дополнительные гигабайты vram, учитывая что у него на денсе модели только 7 т/с, то у него есть (очень вероятно) и другая проблема - это ограничение vram. А moe модель можно выгрузить в оперативку и получить те же 30 токенов в секунду, а с денсе моделью такое не прокатит, просадка будет сильно хуже.
С такими обьемами за железом никогда не угнаться.Маки даже новые тут не приносят ни скорости ни комфорта.Поэтому совет про закупку памяти заранее не работает И это при том что Apple подняла стоимость.
Сможете запустить ее?
вполне -

Согласен, две P100 выдают от 30 в начале и до 20 в течении долгих бесед. С агентами вполне можно работать.
Контекст до 128К. Дальше сжатие срабатывает.
evo-x2 96gb, Q8, ~12tg, pp до 340, 260к контекста. Очень много думает, даже на медиуме. На средней задаче раза 3 сжимаем контекст на 90%. На скрине задача мидл+ на большом проекте. Выигравает у qwen3.6-27b кажется засчет долгого рассуждения.

Macbook air m5 24gb
Я пробовал и с mtp и без, разницы нет. Примерно 8-10 токенов, если долго работает, то падает до 5-6 токенов в секунду, ибо мак скидывает частоты.
Написал ей простую задачу в виде небольшого скрипта - она думала 7 минут и у меня закончилось терпение...
Я с ней еще немного поэкспериментировал, если перед запросом ей написать "Отвечай сразу, кратко и по делу. Не используй скрытые размышления (thinking/reasoning). Выдавай только готовый результат." то модель будет намного меньше размышлять. С этим промтом предыдущую задачу сделала уже за 1:48 секунд, что уже не так грустно.
Кстати, пробовал вот эту модель - ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
Быть может кому-то эта версия будет интересна.
Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить