Pull to refresh
64K+
20
94
Rating
3
Subscribers
Send message

Купил мини‑ПК с приставкой «AI» ради локальной LLM. Что может NPU на самом деле

Level of difficultyMedium
Reading time13 min
Reach and readers95K

TL;DR. Я купил мини‑ПК с Ryzen AI 9 365, чтобы гонять большую локальную модель на NPU. Начал с Windows ради гибрида NPU+iGPU, который так и не заработал, прошёл квест с драйвером NPU, выяснил, что NPU видит только половину оперативки, переехал на Proxmox и в итоге запустил Qwen3.6–35B‑A3B через FastFlowLM прямо на хосте. Модель работает 24/7: prefill около 200 ток/с, decode 13–17 ток/с. По дороге выяснилось, что NPU обслуживает один запрос за раз, падает с double free, если клиент не дождался ответа, и умеет выгнать из памяти большую модель ради маленькой embedding‑модели. Ниже вся дорога по порядку, мини‑гайд и цифры.

Читать далее

Information

Rating
56-th
Location
Москва, Москва и Московская обл., Россия
Date of birth
Registered
Activity