Я пробовал и с mtp и без, разницы нет. Примерно 8-10 токенов, если долго работает, то падает до 5-6 токенов в секунду, ибо мак скидывает частоты.
Написал ей простую задачу в виде небольшого скрипта - она думала 7 минут и у меня закончилось терпение...
Я с ней еще немного поэкспериментировал, если перед запросом ей написать "Отвечай сразу, кратко и по делу. Не используй скрытые размышления (thinking/reasoning). Выдавай только готовый результат." то модель будет намного меньше размышлять. С этим промтом предыдущую задачу сделала уже за 1:48 секунд, что уже не так грустно.
Кстати, пробовал вот эту модель - ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF Быть может кому-то эта версия будет интересна.
Macbook air m5 24gb
Я пробовал и с mtp и без, разницы нет. Примерно 8-10 токенов, если долго работает, то падает до 5-6 токенов в секунду, ибо мак скидывает частоты.
Написал ей простую задачу в виде небольшого скрипта - она думала 7 минут и у меня закончилось терпение...
Я с ней еще немного поэкспериментировал, если перед запросом ей написать "Отвечай сразу, кратко и по делу. Не используй скрытые размышления (thinking/reasoning). Выдавай только готовый результат." то модель будет намного меньше размышлять. С этим промтом предыдущую задачу сделала уже за 1:48 секунд, что уже не так грустно.
Кстати, пробовал вот эту модель - ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
Быть может кому-то эта версия будет интересна.