Comments 150
Все эти мини-ПК, конечно, для очень специфических задач, к сожалению. А за статью - спасибо!
Прекрасно обслуживают все домашние проблемы и вопросы, если не пытаться на них поднимать что-то невменяемое: HA, тонна контейнеров в докере: agh, immich. различные LXC: мониторинг, ансибл, смоукпинг и т.п.
Также на встройке прекрасно обсчитывают даже жирные модели в том же immich.
И жрут при этом 2-5 ватта в час и в нагрузке 15.
плюсую, у меня 12 ядерник на core i3 (alder lake) - прямо в ящике стола работал, я на нем обкатывал кластеризацию Jira) только под долгой и максимальной нагрузкой приходилось приоткрыть дверцу, чтоб он не грелся там)
А какие домашние проблемы и вопросы тогда может обслуживать такой мини-пк, если не ставить на него HA, тонну контейнеров, мониторинг, и.т.п?
Как минимум есть реально домашние, они же бытовые-семейные: файлохранилище + медиасервер + умный дом. Туда же можно и пару контейнеров для обкатки личных проектов затащить, но это ещё не тонна)
По моему автор просто коряво построил фразу. Перечисленное относится к "прекрасно обслуживает", а не к "что-то невменяемое". Более того, это всё потянет даже малинка, но упадёт отзывчивость.
По крайней мере у меня список поболее и загрузка сервера около нуля. Но из-за большого числа хардов у меня корпус поболее и как результат не было смысла использовать ноутбучную платформу минипк. Я в него воткнул ADA2000 (всякие 3090 не влезали механически т.к. корпус низкопрофильный) и результаты явно лучше чем в статье. 14b модели летают, а 26b работает существенно быстрее. А то как у автора - очень похоже на мою конфигурацию до установки видеокарты, т.е. вообще на голом CPU (но у меня CPU мощнее из-за более высокого TDP).
Думал о миниПК, теперь понимаю что не сильно и надо. Тут на видеокарте 70 токенов в сек мало и памяти бы на видеокарту побольше хочется, для больших моделей.
А при чем тут сравнение окупаемости с моделями уровня Sonnet? Если локалка совершенно другого уровня
Просто взял данные из популярных моделей которыми сам пользуюсь (не по api, а как чатом)
Сравнение получилось вида, возьму велосипед, окупается за пол дня по сравнению с машиной. А потом сюрпризы с тем, чем велосипед отличается от машины. Впрочем, тыперь мы все знаем чем :)
ну может для некоторых задач тот уровень может быть избыточным, но из-за количества REST запросов - другого варианта просто нет
Расскажите пожалуйста про свои сервисы, о чем они?
Все взаимодействие с локальной llm сейчас на уровне собственных наработок и идей. Чаще всего это какие то рутинные задачи, например: поиск и фильтрация туров и мониторинг вариантов подешевле. Или локальный бот который будет вести новостной Тг канал (анализируя статьи из интернета, подбор интересных, компоновка и сжатие до 2-3 интересных предложений)
Тоже была мысль миник купить, только с 8060/128 ОЗУ. Цена 250к.
Дух авантюризма скорее даже просился наружу. Круто же, поставил локальную ллм, сделал агента и считай все , жизнь удалась) потом посмотрел через сколько он окупится если сравнить токены того же дипсика по апи, там на 200к рублей моим правнукам хватит и качество модели выше и скорость и инференсом не нужно заниматься и прочее и потом успокоился 🙂
Будем ждать удешевления всего этого дела :)
Только, боюсь, впереди пока маячит только удорожание
Аренда дешевле покупки.
Аренда дешевле покупки.
Только на коротких отрезках времени. В долгосрок покупка всегда выгодней аренды.
Долгосрок - лотерея. Особенно на всяких стремительно развивающихся технологиях.
Нет здесь лотереи. Срок жизни модели примерно полгода, потом она морально устаревает. Срок жизни компа год-два-три. Пользоваться без тырнета можно сильно дольше, конечно... только это не про инвестиции.
Будут ли модели дешеветь? Флагманские - вряд ди, они будут совершенствоваться, а не дешеветь. Может упасть цена за токен, но не за качественное решение задачи - качество подрастетт вместе с числом сожранных токенов. А локальные модели - возможно, и подешевеют.
Опять же, покупка движимого имущества без цели делания денег на оном здесь и теперь - это так себе инвестиция.
Наличие доступа к интернету еще больше лоттерея. Как бы не пришлось за локальными ЛЛМками на горбушку ездить.
Уже есть скрепные ллм за х10 к цене. В любой момент они могут стать единственными доступными.
Только на коротких отрезках времени
на срок жизни стартапа, например
Дожить бы ещё...
Всё так, но все свои данные сливаешь хз кому. Что с ними будет потом большой вопрос, не хотелось бы увидать лица NPC в каких-то играх похожие на твою семью только потому что дал какой-то нейронке задачу рассортировать свой фотоархив :)
лол что? вы видимо очень мало агентов используете))
я вот недавно вложил 3К$ в локальную сборку и в сравнении с подписками она должна окупится МАКСИМУМ за год (если юзается только одна максимальная подписка, в реальности же не так)
по факту оно уже окупилось, и как мощная игровая станция, и как возможность много что запускать без границ подписок, и возможность самому дообучать, но самое главное цензура
буквально вчера ставил себе солидворкс на линукс с рутрекера. Ни codex, ни claude, ни даже гугл не захотели связываться с таблеткой говоря что это незаконно и тд.
А qwen3.8-flash-next-uncensored вообще пофиг, за час с гаком у меня был полностью настроенный и рабочий солид, запускаемый одним кликом с иконки. И я там не участвовал особо, только апрувил команды под sudo и все.
Из подписки GLM Coding MAX можно выжать 31 миллиард токенов в месяц, неужели не хватит?
вопрос качества, чет я сомневаюсь что GLM на уровне самых топовых codex/claude а "дым пожиже" уже и локальные вполне справляются (по моей оценке последние локальные большие модели на уровне opus 4.6)
Вы сами себе противоречите, если локальные обрезанные (ну потому что 1,5ТБ памяти ни у кого нет) справляются и на уровне opus 4.6, то полноценная необрезанная модель уж точно получше будет и её качества хватит?
А еще длину контекста не забываем, я на миллионе уже так привык например работать, что с недоумением смотрю как многие "локальщики" борются за длину контекста в т.ч.
сразу видно что вы не в теме)
изначально даже плохонькие нейросети требовали конских вычислительных мощностей. Развитие идет вперед и то что раньше требовало кластер сейчас запускается на телефоне (без шуток)
Единую проблему что я вижу это действительно контекст. Можно "масштабировать" до 1М контекст но выйгрыш не сказать что большой в сравнении если нарезать и уже поэтапно делать. Согласен что следующим великим переворотом будет когда локальные смогут вмещать 1М контекста
Но в целом локальные уже добрались по качеству "старых фронтирных" с контекстом в 200К
У меня есть очень крупные задачи на которых я тестирую и локальные с 200К контекстом их успешно проходят в три раза медленнее в среднем чем текущие "фронтирные" потребляя в пять раз больше конктекста. То есть в крупных задачах проблема не в модели а в том что ей постоянно приходится "возвращаться" что бы поддерживать актуальный контекст и это жрет время и токены.
И другая проблема что на реально большом контексте лучше распределительный кластер чем все на одном чипе так как бутылочным горлышком становится скорость памяти и над этим сейчас весь мир работает (и успехи закрытых идут рука об руку с успехами в открытых локальных решениях так как любая оптимизация маштабируется и улучшает "крупные" решения)
Если не сложно расскажите хотя бы в общих чертах, что за этот час было напердолено, что гуглить/иишить чтоб сделать такое и себе. Когда я последний раз пытался воткнуть солид на вайн, у меня получилось завести сервак лицензий, но сам установщик выводил белый экран и пустое системное окно ошибки. Не поняв что с этим делать я переметнулся на компас, но гештальт то остался)) Альтиум при этом, когда понадобился, у меня заработал из коробки после довтыкания библиотек с вайнтриксов.
если честно я хз)
Изначально через Sol провел анализ и как вообще лучше всего запускать у меня на ПК солид (потому как Opus постоянно срезал и говорил что тут таблетка и вообще поставь винду параллельно)
А затем просто зарядил промтом настроенного локального кодового агента на базе qwen3.8-flash-next-uncensored, указав где лежит скачаный торент, куда я хочу установить и как это вижу (через вайн)
Он сам все делал, запускал проверки, смотрел что получилось делая скриншоты и в итоге за пару часов с гаком все заработало


Как то в начале сентября рабочий лимит на клод ушел за 2 дня точно таких же тасок, что все лето за месяц не съедало. Очень пригодилась Qwen3.8-Flash-next на AMD Ryzen AI 9 HX 470 с 96Гб рамы. Весь месяц я её гонял и не парился про лимиты или счета. Может не так быстро, как Сонет работает, но уже достаточно разумно для рабочих задач. Только не пойму, зачем автор NPU юзает, оно тут совершенно бесполезно. Я юзаю форк ллама.спп для Strix Halo, что дает мне 15-18 t/s tg и где-то 150-250 t/s ppt
потом посмотрел через сколько он окупится если сравнить токены того же дипсика по апи
Аналогично, коллега. Тоже сидел, всё высчитывал, что купить. Но понял, что подписка выйдет дешевле.
Как это ни забавно, но все самые мощные Ryzen AI берут как раз из-за жирной встройки. Я даже не видел нигде статей, как на очередном Ryzen AI 1337+ запустить NPU, все сразу упарываются в ROCm или иногда Vulkan. Ваша статья по-сути первая в своём роде.
На самом деле, большую часть информации перед покупкой подчерпнул из иностранных источников. И как верно было подмечено, многие берут более продвинутые чипы, например: Ryzen AI Max+ 395 и запускают модели на Windows используя NPU + iGPU или только iGPU что позволяет в сумме добиться на той же qwen 3.6 35b a3b средних значений в 60 ток\с (что примерно = 3090)
Сам по себе подход AMD на текущий момент очень сырой и с NPU и с iGPU в Ryzen AI. Возможно в дальнейшем будут работать над драйверами, поддержкой более масштабных моделей и скоростью работы и получится что то стоющее.
С NPU вообще у всех как-то не очень, даже в линуксе. Вот насчёт драйверов на обычные карты мне жаловаться не на что. У меня RX9070XT и с Vulkan в той же LMStudio (или llama.cpp напрямую) это буквально два клика - скачать модель и нажать загрузить. C ROCm даже связываться не хочу.
60 т/сек это далеко не равно 3090. 3090 на модели Qwen3.6 35b A3b q4 показывает 160+ т/сек и кардинально более высокий промпт процессинг (3300 т/сек)
Вопрос всегда в контексте. Сколько контекста лезет в 3090 и с какой скоростью. У меня самого 4090, действительно какой-нибудь мелкоквен с контекстом со спичечный коробок можно крутить и на ней - да что там, нужно. Но для кодинга это не годится, начинает терять сознание после нескольких /compact.
а можете плиз сориентировать по цифрам - о каком окне контекста примерно речь? (из вашего опыта)
Qwen 3.8 27B IQ4NL я разгонял до 101920 контекста ценой квантовки кэша до Q8. Но в такой конфигурации после часа-другого работы Qwen Code терял сознание и начинал в лупе пытаться сжать контекст, уходить на этом в таймаут, пытаться сжать контекст... На 395+ такой проблемы не было даже на Qwen Next (нативный ~256к контекст).
Ну, кстати, по идее этого уже наверное хватает разобрать какой-нибудь лог, или что-то попросить его подебажить. Как она вообще с этим справляется? Или если кодить, то например просто скрипты bash/groovy/python, без сложного и долгого ведения диалога)
Мои настройки для Qwen3.8-27B
set “MODEL_6_ALIAS=Qwen3.8-27B-Q4_K_XL” set “MODEL_6_PATH=E:\LLM\unsloth\Qwen3.8-27B-GGUF\Qwen3.8-27B-UD-Q4_K_XL.gguf” set “MODEL_6_ARGS= --n-gpu-layers 99 --ctx-size 163840 -np 1 --batch-size 256 --ubatch-size 256 --threads 32 --jinja --temp 0.6 --repeat-penalty 1.1 --top-k 20 --top-p 0.95 --min-p 0.0 --load-mode none --no-context-shift -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 3 --reasoning-effort medium”
Как можно видеть контекст 160к. Хватает на всю ночь работы. Но он у меня все задачи по коду и аудиту отправляет субагенту. Единственный минус работы с субагентами это постоянное перечитывание контекста. У меня P40, с 4090 думаю не так затратно по времени.
Это, наверное, на Linux? У винды свой оверхед на основную видеокарту.
UP: а, нет, увидел что не на linux. Не знаю, мне больше 22-23 гигов стабильно выделить не удается.
У меня Tesla P40, на ней ней видеовыходов, по этому Винда не грузит туда ничего. У меня система настроила какую то виртуальную карту, так как к компу не подключен монитор, работаю через удалённый стол. Если 4090 использовать для LLM, то надо ставить дополнительную карту для видеовыхода, чтобы освободить полностью 4090.
И в самих настройках важно -np 1 --batch-size 256 --ubatch-size 256 -ctk q8_0 -ctv q8_0, а так же убедиться, что не подключена модель vision.
А не пробовали сравнить производительность с встроенным iGPU?
Не проверял, т.к. в тесте очень сильно зависит частота RAM памяти для iGPU. А у меня стоят плашки по 4800 mhz
В дальнейшем как будет время обязательно протестирую. Или как в flm добавят поддержку iGPU для linux.
только igpu, причем строго на llama.cpp-vulkan и забыть про rocm (работает на windows/linux идентично без бубна), npu просто мертвый и существует для галочки. на 5600мгц 64гб и 890m (на 780m циферки будут похуже, но не сильно) подобная железка выдает 28tps на ornith1.5-35b-a3b-q5km и 34tps на byteshape-35b-a3b-iq4xs.
Ещё несколько месяцев назад использование Vulkan давало значительно меньшую скорость работы, чем rocm. Что-то изменилось из-за чего вы советуете vulkan?
надо собирать актуальную версию llama.cpp, они там постоянно патчат скорость (не всегда в плюс).
rocm требует танцев с бубном в плане настройки окружения. под виндой - определенные версии драйверов, которые не обновляются по полгода и больше. под линем - зависит от дистрибутива и самой железки в плане настройки флагов эмуляции и отключения ломанного функционала (HSA_ENABLE_SDMA, HSA_DISABLE_FRAGMENT_ALLOCATOR, HSA_OVERRIDE_GFX_VERSION и т.п).
в vulkan нет проблемы с выделенным лимитом vram в bios - uma работает корректно и под виндой и под линем. в том же comfyui при настройке rocm под разные жирные модели можно сойти с ума чтобы оно не крашилось и освобождало память корректно. у меня 2 железки 7840hs+780m и hx470+890m: на первой в биосе максимум 8gb vram при наличии 64гб uma-памяти, на второй - любой размер, хоть 64гб выделяй. в comfyui+rocm это крайне важно, там все ориентировано на vram. если бы cuda эмулировалась там через vulkan - дропнул бы rocm не задумываясь.
про значительно меньшую скорость - это вряд ли, по всему реддиту владельцы минипк дружно сообщают, что vulkan на strix-серии (point/halo) выдает чуть больше rocm без какой-либо специальной настройки. да, есть специальные сборки типа лимонада и патченных версий llama.cpp специально под rocm (патчи отказались вливать в апстрим) для внешних amd-карт, я их не проверял, т.к сижу на стоковом llama.cpp.
У меня тоже такой вопрос возник. У меня на iGPU вроде быстрее работает.
Спасибо, таких статей маловато. Решил не брать , буду использовать видеокарту
Я не уверен, что все до конца поняли, что речь здесь конкретно об NPU на младшей железке, а не производительности "реального" минипк на 395+. На всякий случай уточню, что квен некст в кванте к4 крутится на старшем 395+ со 128 гигами памяти со скоростью около 38 т\с (80 вт лимит тдп). Что звезд с неба не хватает, но наверное единственный реальный шанс потрогать такую модель дома.
А как по мне, этот квен3.8 некст суперская модель.
Он мне игру пишет, и делает это великолепно, по сравнению с любой другой локальной моделью.
Но да, ест 80+ гб оперативы на 130к контекста в q4
Нет, не поймите меня не правильно, модель нормальная. Но пока под боком есть клод и кодекс, которые точно работают, я предпочту их.

Когда купил все это - становится жалко не использовать :))
Ну и нет лимитов, оно кочегарит как майнинг ферма без перерывов. Ну и тарков тянет, что уж :)
Тоже думал внешнюю видеокарту подключить, но у меня beelink который из коробки так не умеет, будет колхоз с неясным выхлопом.
А я вот как увидел что у февма окулинк наружу, так сразу и понял что это мой вариант. Завелось без проблем, хотя в магазине где видюху брал меня уверяли что не включится, не знаю почему
я про такое и не знал даже! только про Thunderbolt подключения внешних видеокарт
Бп 7к, радеон 7900хтх 68к (взял бу, но 24гб) , приблуда для аоткнуть 2к, сам минипк (fevm faex) 250 с доставкой.
А 128гб памяти сейчас сами по себе отдельно косарей 100 наверное, в общем и целом мне нравится.
Квен кручу на встройке, внешка крутит треллис3д и квен имадж, так что квен текстовый просит встройку сделать картинку, потом генерит 3д, потом сует в юнити

Я к жуку не притронулся, просто сказал сделать дрозофилу гуманойда :)
А дальше все сама. И все это локально.
Я к жуку не притронулся, просто сказал сделать дрозофилу гуманойда :)
Ходят слухи, что дрозофил справился бы с этим лучше))
А расскажите про опыты с fevm faex1?
Всё хотел взять, но думал: “а надо ли?”. Так как читал про различные беды с поддержкой железа.
тарков тянет
причем видяха тут и не при чем?)
лучше видюху отдельно взять?
или мини пк все же?
У меня на ноуте оку линк есть
Нет, не поймите меня не правильно, модель нормальная. Но пока под боком есть клод и кодекс, которые точно работают, я предпочту их.
Как насчет своих авторских прав, скормленных облаку, допустимо ?
Каждому свое. У меня как в меме:
-- То есть вы слили openai всю свою кодовую базу?
-- Им же хуже.
Кому действительно есть что терять и нужен фронтир, те работают на enterprise планах за другие деньги.
38 т/с там ровно потому, что Next - MoE: на каждый токен читаются только активные эксперты. Для масштаба: плотная Qwen3.8-27B в Q8_0 читает 25,4 ГиБ весов на каждый токен. Моя десктопная DDR4 выдаёт около 17 ГБ/с, и потолок вышел 0,6 т/с. Ни раскладка по памяти, ни подкачка, ни закрепление его не сдвинули.
Скорость генерации на таких машинах — это пропускная способность памяти, делённая на байты на токен. NPU в эту формулу для генерации почти не входит.
А были какие-то причины кроме исследовательских отказаться от igpu в пользу npu? Просто по ощущениям все эти npu нынче - не пришей кобыле хвост. Их повтыкали а применения пока особо не придумали (оно должно быть в том, что ты можешь использовать их когда igpu загружен другой работаой в параллель, но в вашем случае я так понял igpu в простое). Ну и если идея про энергопотребление - то тут надо сравнивать на производительность, чую я што igpu посчитает и уйдет в сон моментально в npu будет молоть медленно и планомерно и выйдет прожорливее.
Npu это на самом деле затычка для минизадач в винде: поменять фон в видеозвонке, разобрать речь в текст и тд. Это не движок для моделей, это офисный миникостыль. Там и мощности то в районе 50топс как правило
NPU жрет почти ничего. Во время работы на NPU кулер даже не раскручивается. Но и модели туда лезут соответствующие - мусор, максимум эмбедденги погонять.
Для дома в отдельной коробке - Nvidia Jetson Thor =)

Расскажите для каких задач вы это все используете?
Я на RTX 3700 8Гб запустил Bonsai 2 (Это который ужатый Qwen 3.8)
Настроил, что у меня gpt-6-sol руководит процессом, а этот "банзай" кодит. При этом не смотря на то, что там 40 т/c оказывается, что эта модель настолько любит подумать, что даже если ей поставить reasoning low, "внутренний диалог" настолько большой и сильный, что она делала час делала задачу (а там пара простейших правок кода), на которую у gpt-6-luna уходит пару минут. При этом температура видяхи под 80 градусов. Т.е. на электричество на "бесплатный" qwen я потратил больше чем на платную luna. Т.е. для кодинга - смысла нет, ИМХО.
Задачи две - первая, это никто вас не прервет (привет очередной волне банов от антропиков!) и никто не заквантует вашу модель до уровня прошлой, т.е. что поставили, то и имеете. Вторая - это работа с тем, что облачные модели отказываются делать по своим guardrails (в частности, модели openai часто идут в отказ при просьбах поресерчить те же стратегии запрета или интересные конфигурации впн).
Впрочем, несмотря на наличие у меня дома коробки на 395+, я сам ей не особо пользуюсь - не доверю реальную задачу даже квен некст, мне привычнее ваншотом сделать задачу быстро, чем ковырять ее ночами. Но пару мутных задачек переложил на локалку после очередного бана клода.
Дык об этом и речь. ИМХО, даже на 395+ фиг запустишь что-нибудь, что будет по эффективности близко к облачным моделям (в части кодинга. другие сферы не проверял). Соответственно остаются только кейсы, когда нельзя отдавать данные "наружу".
В целом, если (когда?) облачные модели кончатся, локальный Qwen Next для меня заменит Opus образца начала года. А там может и еще интереснее игрушки подоспеют, Next ведь по сути прототип того, что будет дальше.
Угадайте, что сделал qwen3.8-27b, а что gpt-6-sol

Спасибо за детальный обзор. Тоже думал что-то подобное приобрести, но решил не рисковать и на нескольких 5060ti сделал себе (48Gb vram). Для неспешного инференса вполне хватает.
А можно было взять 5060ti за сравнимые деньги и получить гораздо лучшие характеристики без танев с бубном. NPU в 2026 году - это шляпа.
У меня точно такой же мини ПК и тоже с 64 ГБ видеопамяти. Пришел к выводу, что NPU в нем абсолютно бессмыслена для запуска больших моделей. В биос выдаешь видеокарте 880m 48 гигабайт памяти и запускаешь через нее модель традиционным способом через llama.cpp. И модель работает гораздо быстрее чем NPU и при этом абсодютно никаких плясок с бубном и никаких проблем. Модель unsloth\Qwen3.6-35B-A3B-UD-Q8_K_XL.gguf (MTP, 36,4ГБ) в llama.cpp под Windows (vulkan) с максимальным размером контекста 262 тыс токенов выдает 280 т/сек промпт процессинг и 22 т/сек генерация. Аналогичная модель, но с квантизацией Q4_K_M и размером 21,1 ГБ (Qwen3.6-35B-A3B-UD-Q4_K_M.gguf) выдает 280 т/сек чтение и 26 т/сек генерация. В linux работает еще быстрее на пару токенов.
Но вообще, устройство само по себе интересное, через oculink можно подключить внешнюю видеокарту (ту же 3090)
Вы можете снизить объем VRAM до 16 ГБ или даже меньше и ничего скорее всего не изменится. Попробуйте. На этой платформе движку инференса все равно, в какой памяти лежит модель или как она делится между ними - память фактически одна и деление на RAM/VRAM там достаточно условное. Если вы работаете на этом компьютере в Windows, откройте диспетчер задач и на вкладке Производительность/Память вы должны увидеть все свои 64 ГБ, несмотря на то, что вы выделили 48 ГБ из нее под VRAM.
У Вас этот мини PC есть или Вы тут теории выдумываете? Естественно, в диспетчере задач в разделе Память я вижу только 15,6 ГБ. А в закладке "Графический процессор" в поле "Выделенная память графического процессора" указано 47,8 ГБ. И движку инференса как раз таки важно это разделение памяти, если я урежу видеопамять, то скорость промпт процессинга падает с 300 до 163, а генерация с 26 до 16,5 т/сек.
(по сравнению с предыдущим моем сообщением скорости возросли, так как установил свежую сборку llama.cpp)
Системам AMD с shared memory действительно все равно, крутите ли вы модели в памяти VRAM или RAM - она объединенная. Возможно есть какие-то приколы под винду, но общая рекомендация - это, во-первых, не использовать винду, а далее - оставить системе 512 мегабайт видеопамяти (IOMMU=off, amdgpu.gttsize=126976) и работать целиком на RAM (Translation Table Manager) через vulkan. Кастомные контейнеры с оптимизированным под Strix Qwen Next работают по тому же принципу:
amd_iommu=offis the one we have measured, and it is worth 13 to 16 percent of prefill. The numbers and the mechanism are in the conditions paragraph above. Two things to weigh before copying it: it turns off DMA translation machine-wide, which is a real change in posture on a host that is not dedicated to this, and it takes the NPU with it. On a box that exists to serve this model it is the right trade and it is the one we made.
Что касается скорости, то ваши цифры в обоих случаях ниже того, что могло бы быть: до 16 т\с разгоняют даже qwen next без каких-либо оптимизаций (с ними до ~38)
При чем здесь Qwen3.8-flash-next, если речь идёт о Qwen3.6-35b-a3b? У flash-next другая архитектура (хотя обе MoE), которая позволяет быстро работать на сборках с небольшим количеством VRAM.
У меня немного более мощная система: ЦП AMD RYZEN AI MAX+ 395 w/ Radeon 8060S. Так что никаких теорий, чистая практика. Но если у вас так работает быстрее, значит используйте так.
Что касается раздела “Память”, то все зависит от того, куда вы там смотрите: налево, в столбец с разными метриками, или вправо-вверх, где указано общее количество памяти.
какое-то хождение по граблям и сбор всех ошибок которые только можно собрать
в целом, изначально как по мне проблема в постановке задачи - хотели подешевле и побольше (это прям видно по статье), а получилось как всегда))
64ГБ можно и лучще таки на двух видеокартах собрать и не играть в экономию на спичках
сборки на Ryzen AI Max+ 395 начинают стрелять от 96Гб, золотой стандарт на сейчас 128Гб
и сразу становится понятно почему мини-пк экономный (0.5Гб на систему, остальное на GPU) - если на постоянке будет лопатить qwen3.8-flash-next то выигрыш под KV-кеш и энергетическая экономность выигрывает у всяких динозавров на видеокартах
и то всегда нужно помнить что у подобных систем тонкое место это частота памяти
но это относительно так как по соотношению цена/качество и выходной результат 395 закрывает свою нишу с запасом
и это я даже не вспоминаю про то что подобные мини-ПК на сейчас являются лучшим выбором для дешевой компактной игровой сборки
Шикарная статья, спасибо. Давно хотел узнать как люди с NPU на AMD работают, а тут такой трактат.
В общем-то никак не работают: на NPU не запустить нормальную модель, плюс активация NPU сама по себе ухудшает работу машины в "стандартном" режиме - когда ты оставил минимальное количество VRAM. То есть даже для эмбеддингов NPU не включишь - пострадает производительность "нормальных" моделей.
Полезный материал, написано понятным языком - спасибо за публикацию. Мемасов имхо многовато, девять штук - это уже перебор, особенно с учетом того что и без них читается отлично
Потратить столько времени, чтобы увидеть очевидный результат?
Во-первых я не понимаю, зачем гнались за объемом озу в 64, когда модель использовали на 20? Судя по всему это сжатая типа AWQ MoE.
Во-вторых результат высчитывается практически по пропускной скорости памяти. Например DDR4 в два канала дает условные 50ГБайт/с, RTX3060 350, вот в 7 раз примерно это и есть токены/сек, если абсолютные то чего-то маловато для 3090 получилось, 3060 дает где-то под 85 на vLLM. Вот её и покупайте лучше, правда 12Гбайт это маловато, тогда лучше две.
Спасибо, начинаю понимать что-то
Я тут ноутбук купил AMD Ryzen AI 7 350 и 32 памяти, решил на винде тоже проверить, каков в деле этот NPU. Но я не стал копать как автор статьи, я включил агента сказал “сделать хорошо”. В итоге агент заиспользовал тот же стек FastFlowLM по тем же причинам, но я мучал модель Qwen3.8 Distilled 9B и хотел чтобы она мне арканоид в OpenCode сделала. В итоге свелось к тому что не совпадали шаблоны: шаблон froggeric отдаёт XML, OpenCode ждёт Hermes JSON, а парсер FLM 1.0.1 JSON внутри <tool_call> не понимает (с) агент.
В итоге агент патчил и пересобирал FLM, шаблон заработал, но модель Qwen3.8 Distilled 9B оказалась очень тупая. Qwen3.8 27b в формате q4nx для FLM не оказалось, а Qwen3.6–35B‑A3B я счёл для себя уже “старой”. В итоге сделал вывод, что стек очень сырой, грабли на граблях, и бросил это дело.
Но гибрид работает только с ONNX‑моделями, которые AMD заранее подготовила, и официально только на Windows
https://developer.amd.com/playbooks/hermes-lemonade-server/
https://launchpad.net/~lemonade-team/+archive/ubuntu/stable
Приятный сюрприз после Windows: на Linux драйвер NPU уже есть в ядре Proxmox, никаких регистраций.
Официальный док Install NPU Drivers https://download.amd.com/opendownload/RyzenAI/Driver/RAI_1.8_Linux_NPU_XRT.zip
Из trixie-backports https://packages.debian.org/trixie-backports/linux-image-7.1.8+deb13-amd64

На linux официальной поддержке именно режима гибрид - работает одновременно и NPU и iGPU - нет. Как в документации Ryzen AI Software 1.8.0 так и FLM указано, что на linux поддерживается только NPU.
А это по факту 2 сервиса которые вообще умеют работать с NPU на AMD (как я знаю).
По поводу драйверов, спасибо за ссылки, думаю пригодятся если кто то тоже захочет попробовать NPU.
Я не вполне понимаю, почему вы сосредоточились именно на NPU. Да, NPU есть, но он тут играет далеко не главную роль. Ryzen AI 9 365 относится к Ryzen AI 300 / Strix Point, а встроенная Radeon 880M поддерживается AMD для LLM-инференса через iGPU. У меня немного более мощная конфигурация: Ryzen AI Max+ 395 с Radeon 8060S, NPU тоже есть, конечно. И тут есть важный нюанс в архитектуре - unified memory. Для инференса на iGPU на самом деле не сильно важно, сколько памяти отдано под VRAM, скорость доступа к VRAM практически идентична скорости доступа к RAM. Ваш NPU точно так же держит модели в той же RAM. Т.е. я хочу сказать, что нужно забыть про объемы RAM или VRAM, оценивая то, поместится модель или нет. У дискретной видеокарты RAM и VRAM - это две разные памяти, и веса модели приходится копировать из одной в другую. У встроенной Radeon память общая: CPU и GPU обращаются к одной и той же физической RAM. Поэтому деление на RAM и VRAM в значительной степени логическое. Очень условно, VRAM нужна для фреймбуфера, чтобы вы картинку на экране монитора видели. А движку все равно, где будет лежать модель, т.е. какая его часть попадет в VRAM, а что останется в RAM. Это одна и та же память.
Я гоняю основные модели именно на iGPU, оставив NPU под второстепенные модели и задачи. Попробуйте. Скорее всего производительность у вас вырастет. У меня Qwen3.6–35B‑A3B (Q4_K_M) стабильно выдает 60+ ток/с на decode, и 800-900 в prefill в LM Studio. У вас цифры будут пониже, но все равно должно быть быстрее, чем на NPU.
Спасибо за совет, скорей всего так и сделаю. Просто изначально AMD позиционирует NPU "модуль" для работы с AI. Поэтому и хотелось проверить на что он способен и поделиться своим мнением. Единственный наверно плюс данного подхода - что процессор благодаря NPU не греется совсем. Стабильные 60-70 градусов. Если же использовать iGPU то там совершенно другая температура будет (мне кажется)
Квен флеш уже 3 часа работает

Просто изначально AMD позиционирует NPU “модуль” для работы с AI.
Да, но надо понимать для какого именно AI. AMD прямо указывает на класс устройств Copilot+ PC.
Unleash your productivity with AMD Ryzen™ AI Max processors, which are projected to be the world’s fastest performance for Copilot+ PCs3. Boost your workflow with incredibly fast and responsive multitasking, and AI experiences enabled by Copilot+.
Именно NPU определяет принадлежность к этому классу устройств.
https://support.microsoft.com/ru-ru/surface/drivers-firmware/learn-more-about-copilot-pcs-and-windows-11-pcs-from-surface
Copilot+ PC — это другой класс компьютеров с Windows 11, работающих на базе нейропроцессора (NPU) с турбонаддувом, который может выполнять более 40 триллионов операций в секунду (TOPS). Существуют функции Copilot+ PC, в том числе “Недавнее”, “Соавтор”, эффекты Windows Studio, автоматические субтитры и автоматическое суперразрешение.
Речь о поддержке некоторых функций Copilot.
К тому же AMD делает акцент на высокой эффективности NPU при работе с AI-задачами. Это не про высокую производительность. Neural Processing Unit (NPU): Dedicated AI engine, powered by AMD XDNA, designed for the ultimate in AI processing efficiency.
Этот Ryzen у них имеет “AI” не потому что там NPU. У них там все “AI” - и GPU, и CPU, и Gaming.
Из их рекламной страницы.
Go beyond console-level gaming with AI-optimized frame rates.
AMD Ryzen Processor (CPU): Cores with powerful AI capabilities to bring exciting new AI PC experiences to life.
AMD Radeon Graphics (GPU): Dedicated AI accelerators built in to optimize AI workloads.
https://www.amd.com/en/products/processors/consumer/ryzen-ai.html
вопрос охлаждения. В целом если норм охлаждение то Ryzen AI Max+ 395 может часами работать на 60+ градусах поддерживая 120W нагрузки (можно разлочить биос и игратся с лимитами/напряжениями и тд)
Ужасное дежавю.
AMD как обычно, память для видео по дефолту отрезает от оперативки, и хотя сейчас можно хотя бы руками уменьшить лимит, но все равно динамического регулирования нет.
Когда AMD давным давно сделала акселераторы для GPU-вычислений, было 1 в 1 - работает только под Линух, только с определенным ядром, несовместимо с большинством софта (ибо он под CUDA) и с кучей багов. Только тогда еще был бонус - можно было акселератор настройками сжечь физически =)
Ограничения памяти под NPU зашиты в его логику, к сожалению - для работы оного под Linux память ему тоже надо перераспределять из RAM в VRAM, хоть она и shared. А Windows еще накладывает какое-то идиотское ограничение, мол, модель NPU грузится в VRAM, но при этом в RAM должно быть свободно столько же. Получается ни туда, ни сюда, NPU проще забыть. AMD тут вторично.
По крайней мере в Windows на вашей платформе, думайте только про совокупный объём памяти, забудьте про деление на RAM/VRAM. Да, это может казаться контринтуитивно, но это так. Поначалу я тоже пытался выделить VRAM побольше, в силу привычки, но это на самом деле не нужно. Оставьте 8ГБ VRAM только под те вещи, которые нужны видеодрайверу (фреймбуфер, кэши всякие), да и все. Модель не должна на вашей платформе умещаться во VRAM чтобы работать на полной возможной скорости.
Отвечал, как будто у вас тоже AMD Strix Point. По всей видимости это не так. Но для этой платформы мой комментарий справедлив.
Я вам больше скажу - у меня на Fedora vram выделен абсолютный минимум, 512МБ кажется, через grub. Это не отменяет дурацкой архитектуры NPU.
Отвечал, как будто у вас тоже AMD Strix Point.
У меня 395+
Значит у нас одинаковые платформы. Правда, на ней я работаю в Windows. У меня размер общей памяти NPU отображается ровно таким же, как и размер общей памяти GPU. Из этого я делаю вывод, что по крайней мере в Windows, они делят общую память. Но в Linux все может быть иначе, конечно. Не перехожу в этом сетапе на линукс как раз из-за несколько лучшей его поддержки в Windows в настоящее время.
Нет, я про другое - если у вас допустим модель на 20 гигов в NPU, она грузится в VRAM, но при этом в RAM должно быть свободно столько же. Это делает невозможными конфигурации с большим дисбалансом между VRAM и RAM для NPU.
Уверен, что вы понимаете, что в любом случае в память там дважды ничего не грузится. Я имею в виду и в VRAM, и в RAM. Видимо, как я писал выше, это особенности линуксовых драйверов. В Windows у меня NPU “видит” в 4 раза больше памяти, чем выделено под VRAM. Вполне себе дисбаланс.
Дважды ничего не грузится - но 50% должно быть свободно:
On a 32 GB system, the NPU is limited to ~15.1 GB, which prevents running
gpt-oss:20b.
The 50% limit is imposed by Windows.
Т.е. для загрузки gpt-oss должны выделить не 32 гига, а 64. Хотя 32 хватило бы с головой. На Windows проблема усугубляется тем, что у нее нет шаманства с grub, и единственный способ регулировать распределение этой самой памяти - это BIOS, где цифры зашиты как варианты (емнип как обычно 512*X ?), т.е. после 32 идет не 48, а 64.
Да, но при чем тут VRAM? Вы же выше писали, что NPU грузит модели во VRAM, а также то, что зажали VRAM через параметры ядра в grub на уровне полугигабайта.
Напишу, как сейчас у меня. Всего 96ГБ общей памяти. При этом 16ГБ выделено под VRAM. И при этом же есть еще общая память графического процессора, выделяемая из RAM. У меня это 64 ГБ и не настраивается. Во всяком случае просто. NPU видит ровно те же 64 ГБ, но уже просто как общую память. Видимо, эта память делится между iGPU и NPU. Еще 16 никому не выделяется и остается под нужды системы. Т.е. у меня разбивка такая: 16 ГБ (система) + 64 ГБ (общая: IGPU, NPU, система) + 16 ГБ VRAM (iGPU).
В вашей цитате, по всей видимости, эти 15.1 ГБ - это и есть размер общей памяти (iGPU/NPU), только на системе с 32 ГБ памяти всего. Осложняется все тем, что и система видит эту память и тоже может занять ее под свои нужды. Т.е. вы бы в любом случае не смогли запустить gpt-oss:20b ни на iGPU, ни на NPU, без выгрузки экспертов или части слоёв в оставшуюся системную часть всей памяти.
вы говорите дичь.
это относится только в визуальным моделям всяким и просто потому что открытые решения на сейчас в том формате имеют прикол с тем что для выгрузки модели в GPU они сначала ее выгружают в RAM
и это давно известно и существуют guff-реализации таких моделей что бы все сразу на GPU летело
Я вот 90+ гигов модель запускаю на своей 128 и никаких проблем
скорее всего проблема с вашей стороны (если это винда то проблемы системы хотя не должно быть, и на винде успешно запускают огромных динозавров)
Вы поняли, что речь идет о моделях на NPU? И я не говорю дичь, я цитирую активный issue людей, которые пытаются с этим NPU баловаться.
я вам говорю как владелец таких модулей
проблема с "дублированием" есть но очень узкая, зависит от кривизны запуска и формата запаковки модели и опять таки даже если сильно нужна именно эта модель то есть способы решения
в остальном же абсолютно никаких проблем если руки прямые и ты знаешь что хочешь
плюс уже есть куча готового по типу LM Studio где все двумя кликами само запустится и скажет если что то не так или не пойдет на твоем пк
Я вам тоже говорю, как владелец 395+ - проблема требования "еще столько же памяти" на винде реальна. На linux - нет, но там никто не использует npu, потому что он конфликтует с флагами граба на производительность "нормальных" моделей.

но вообще странно, я знаю людей что используют винду для запуска и у них нет прямо таки проблем с "дублированием" иначе бы они просто не запустили бы те модели что мы запускали и проверяли на разных сборках
как быстро оно устареет?
Жесть, моя сборка из трёх майнерских видеокарт cmp50 на qwen3.6-35b-a3b около 500ткс на чтении и около 50 на генерации... Карты по 5к покупал. Жрет электричество и греется как печка - но блин, за эти копейки пофиг
Конкретно — мини‑ПК FIREBAT на Ryzen AI 9 365. Сама коробка без памяти и SSD стоила 30 тыс. ₽, SSD переехал со старого мини‑ПК, а 64 ГБ DDR5-4800 (2 × 32 ГБ) обошлись ещё в 40 тыс. ₽. Итого около 70 тыс. ₽ (~$825), и память оказалась дороже самого компьютера.
в коробку за 30к я еще поверю, но 64gb ddr5 125к стоит даже на али. Откуда у вас такие цены?
Я брал месяц назад ноут на hx370, и сразу дал glm 5.3 задачи по настройке, чтобы он все сделал.
Проблем с NPU не было, пришел к выводу, что:
1) имеет смысл использовать для малого потребления электроэнергиии слабых моделей, все же тот же qwen-3.6-35b-a3b уже староват.
2) в целом бесполезная покупка, даже с 64 гб оперативки.
Как игровая платформа тоже не очень, старый ноут на 1165g7/GTX1650Ti max q тянет игры куда быстрее.
Может конечно для компилирования 12 ядер, 24 потока хорошо, а так разочарован.
после моих экспериментов с видеокартами, видеть цифры в 17 токенов в секунду и 200 на префилл как-то мучительно... против 8000 префилл, 120 декоде
Толку от 120 декода, если модель сильно обрезанная и маленькая? Даже для Qwen3.8 27B надо минимум 32 Гб Vram и там будет сильно обрезанный контекст. Я вот использую Qwen Flash 4q на 96 Gb Ram, да немного медленнее, но зато контекст миллион, никаких компакшенов не испытываю
Туда влазит миллион?
Не должен, лезет с дикими танцами с бубном в 128 гигов.
Начали за здравие, окончили мазохизмам. Очень много воды чтобы просто расписать о проблемах которые вроде как очевидны изначально, учитывая множественные запросы из твоих сервисов. Щас проще туже Laya или Jev AI втыкнуть в такие дела, если под задачи подходит.
Я в другую сторону подзаморочился.
Ноутбук lenovo с Intel core 9 285h ai npu на борту и возможностью подключения внешней видеокарты через oculink, дома как раз она крутится, в дороге встроенный CPU с ядрами GPU и Npu.
Под мои задачи удачно вписывается модели уровня oss20b. Даже если 35b и получилось бы закрутить, то 32gb ОЗУ свели бы попытку на нет)
Сколько не пробовал npu, пользу смог только на одном из этапов диаризации говорящих выявить. В остальных случаях сколько не гонял, всегда получалось что встроенный процессор GPU 140t обходит ядра npu раз в 10 по скорости, при этом не имеет ограничений по весу моделей.
NPU крайне сырая технология, и изначально она создавалась не под современные LLM с огромными матричными весами и сложным attention, а под более простые и хорошо распараллеливаемые нейросетевые вычисления вроде распознавание изображений и речи.
Хотя может дело в том, что встройка в процессоре спокойно дает играть в игры уровня atomic heart :)
А по поводу контекста, то можно бить обработку на батчи и скармливать по 4к-8к, а не 32к контекст за раз передавая потом результат обработки кусочков на итоговый шаг обработки. Для экономии памяти. Но это страдания, когда ОЗУ 32gb, при ваших 64gb уже не актуальны)
А почему бы не использовать cachyos на KDE?
Купил мини‑ПК с приставкой «AI» ради локальной LLM. Что может NPU на самом деле