Comments 14
На 128 Гб памяти стоит попробовать Qwen3.8-Flash-Next, должно быть сильно быстрее и при этом умнее.
Режим по умолчанию (medium) — лучший компромисс.
Какой-то измененный чат темплейт? У Qwen3.8 27B по умолчанию xhigh, а не медиум.
Спасибо. Интересно потестирую.
Спасибо, точное замечание. Шаблон не менялся, он штатный: в нём прямо прописано reasoning_effort|default(‘xhigh’). Medium подставляет сам MTPLX. В его коде для Qwen3.8-27B стоит default_effort=“medium”, и в комментарии авторы объясняют, что выбрали его по замеру времени на кодинговой задаче. Для Flash-Next MTPLX, наоборот, оставляет родной xhigh. Так что в моих замерах «medium» — это умолчание MTPLX, а родному поведению модели соответствует прогон xhigh: 14,5 минуты, 30 из 30 скрытых тестов. Вывод от этого не меняется: xhigh и medium одинаково точны, а разница во времени меньше разброса между запусками. xhigh даже работает чище, без ошибок по ходу. Поправил это в тексте, чтобы не путать.
Подтверждаю, тем более модель в отличии от 27b мультимодальная модель смеси экспертов с 125B общих параметров и только 6B активных.
На мой взгляд лучше кодерскую модель взять, например tiel-coder-next
Полезный тест, спасибо! Отдельно хотел спросить про шум вентиляторов - насколько громко? И можно ли как-то снизить нагрузку на ноут для снижения шума, пусть и пожертвовав скоростью генерации?
Спасибо! Замерил специально под ваш вопрос: пять минут непрерывной генерации на Qwen3.8-27B, обороты и температура каждую секунду. Децибелы не мерил, так что ориентир — обороты вентиляторов. У этого MacBook Pro (M4 Max) в простое около 2 300–2 500 об/мин, максимум примерно 7 800.
turbo + fan smart (по умолчанию): 35 ток/с, вентиляторы ~7 850 об/мин — максимум, с первой секунды, пик 107 °C.
turbo + fan default (вентиляторы у macOS): 25 ток/с, ~5 350 об/мин, разгон за ~30 с, пик 116 °C.
sustained + fan default: 20 ток/с, ~5 350 об/мин, пик 115 °C.
Насколько громко. С настройками по умолчанию — на полную: MTPLX сам выкручивает вентиляторы на максимум сразу, не дожидаясь нагрева, чтобы чип не сбрасывал частоту. Звук как у ноутбука под рендером.
Можно ли тише. Да, одним переключателем: в настройках MTPLX сменить режим вентиляторов со smart на default, чтобы ими управляла macOS. Обороты падают примерно на треть, но чип сильнее греется и сбрасывает частоту, и генерация проседает на те же ~30%. Щадящий профиль sustained сверх этого шум не снижает: macOS разгоняет вентиляторы до того же уровня, а скорость падает ещё на пятую часть. Так что его не советую. Из непроверенного остаётся Low Power Mode в macOS: он сильнее всего ограничивает чип.
А еще бы прикладывать сколько памяти он отьедает, понятно что когда 128 можно не думать
А когда 24 уже начинаешь выбирать
СКолько контекст занимал?
MTPLX сообщает о своём плане памяти при старте:
Контекст. В этой задаче агент набирал 26–40 тыс. токенов за запрос: системный промпт pi, описания инструментов, спецификация, код и вывод тестов. Окно стояло на 262 тыс., реально использовалось меньше 15%.
Веса — 20,7 ГБ. Это 4 бита плюс MTP-головы, благодаря которым и идёт ускорение.
Контекст дешёвый. У модели гибридное внимание, полный KV-кеш только у 16 слоёв из 64, поэтому один токен стоит 64 КБ. 40 тыс. токенов ≈ 2,6 ГБ, 100 тыс. ≈ 6,5 ГБ, все 262 тыс. ≈ 16 ГБ.
Служебные буферы — около 3 ГБ.
Итого на этой задаче примерно 26 ГБ.
Нюанс: кеш сессий. На 128 ГБ MTPLX разрешал себе держать в памяти до 48 ГБ кеша уже обработанных промптов, чтобы не пересчитывать историю. На машине с меньшей памятью этот лимит, видимо, ниже, но это я не проверял.
Про 24 ГБ. macOS отдаёт GPU примерно две трети–три четверти памяти, то есть около 16–18 ГБ. Сборка 27B для MTPLX (20,7 ГБ только веса) туда не влезает. В линейке MTPLX для такого объёма есть Qwen3.5-9B с MTP, по их данным ей нужно от 16 ГБ. Её я не тестировал.
Omlx умеет часть нагрузки отдавать на нейро процессор ane. При определённых настройках у меня получалось немного разгрузить ГПУ, и вентиляторы не так сильно напрягались. На производительности вроде не сказалось.
Попробуйте ornith-1.5-35b-a3b
Я на прошлой неделе его для себя открыл ) на макстудио м4 128... как альтернатива моделям квен
Но это буквально дообученный квен - скорее развитие, а не альтернатива.
Не совсем.
Ornith-1.5 действительно вырос из Qwen-подобной базы и сильного дообучения, но это уже отдельная MoE-модель со своей схемой self-improvement и отдельными benchmark-результатами.
Поэтому я бы называл её скорее форком/развитием на базе Qwen, а не просто “дообученным Qwen”.
И да, на локалке она может быть заметно быстрее за счёт ~3B активных параметров на токен. Иииименно по этому я и предложил ТС попробовать.
Сам гоняю орнит в хвост и гриву и он на глаз очень быстр и точен, правда использую ornith-1.5-35b-a3b@bf16
Отличный обзор. Тоже рассматривал мак студио для локального квена, но пришел к вывдоу, что это экономически совершенно не выгодно.
Собрал сервер: x99 + xeon + 128 ddr3 (45к), ssd 2tb (20к), бп 1600Вт (50к, на вырост), корпус/охлаждение (30к), 2x3090 (150к, успел, сейчас около 200к). Итого ~300к.
На нем 2 vllm с qwen3.8 27b w4a16, у каждого по 150к контекстного окна. Два агента работают параллельно каждый на своей карте. Скорость на пустом контексте около 110 ts, при полность забитом 60-70 (карты органичены на 250w, греются до 60° - щадящий режим). Prefix_cache делает незаметным prefill (меньше секунды), для qwen под cline важно.
Короче, два интерактивных независимых агента лупят около 200ts за 300к денег.
Скоро доберусь до батч-режима. При 64 параллельных запросов обещают дать суммарную скорость до 1000 ts на одну карту.
И самое главное - этот обогреватель стоит в другой комнате и совсем не мешает работе.
Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8–27B. Что реально ускоряет, а что нет