Pull to refresh

Comments 14

Qwen3.8-27B - это самый важный открытый релиз года, если у вас есть компьютер, и если у вас его нет. Я отношусь ко второй группе, и это моя собственная вина.

Отлично. Теперь есть доказательство, что Мак не комп))

а они собираются выпустить микстуред модель на ядре 3.8?
на моём компе qwen3.6-35b-A3 даёт 30 ток.сек... 3.8-27b - только 7 ((

прикрутить mtp или dflash, получается от +50% до x4. Зачем вам MoE, когда есть mtp, который тот же мое, только модель активируется вся.

mtp и тем более dflash это дополнительные гигабайты vram, учитывая что у него на денсе модели только 7 т/с, то у него есть (очень вероятно) и другая проблема - это ограничение vram. А moe модель можно выгрузить в оперативку и получить те же 30 токенов в секунду, а с денсе моделью такое не прокатит, просадка будет сильно хуже.

С такими обьемами за железом никогда не угнаться.Маки даже новые тут не приносят ни скорости ни комфорта.Поэтому совет про закупку памяти заранее не работает И это при том что Apple подняла стоимость.

UFO landed and left these words here

Согласен, две P100 выдают от 30 в начале и до 20 в течении долгих бесед. С агентами вполне можно работать.

Контекст до 128К. Дальше сжатие срабатывает.

Печально это всё, господа. Сначала резиновые (бу) карты 10ти летней давности. Потом похоже по паспорту будем закупаться. Корпы отнимают владение (переходите на облака)

NVIDIA P104-100 — это специализированная видеокарта для майнинга, выпущенная 12 декабря 2017 года.

UFO landed and left these words here

evo-x2 96gb, Q8, ~12tg, pp до 340, 260к контекста. Очень много думает, даже на медиуме. На средней задаче раза 3 сжимаем контекст на 90%. На скрине задача мидл+ на большом проекте. Выигравает у qwen3.6-27b кажется засчет долгого рассуждения.

на rocm, но он к сожаленью течёт =(

Macbook air m5 24gb

Я пробовал и с mtp и без, разницы нет. Примерно 8-10 токенов, если долго работает, то падает до 5-6 токенов в секунду, ибо мак скидывает частоты.

Написал ей простую задачу в виде небольшого скрипта - она думала 7 минут и у меня закончилось терпение...

Я с ней еще немного поэкспериментировал, если перед запросом ей написать "Отвечай сразу, кратко и по делу. Не используй скрытые размышления (thinking/reasoning). Выдавай только готовый результат." то модель будет намного меньше размышлять. С этим промтом предыдущую задачу сделала уже за 1:48 секунд, что уже не так грустно.

Кстати, пробовал вот эту модель - ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
Быть может кому-то эта версия будет интересна.

Sign up to leave a comment.

Articles