Идея интересная, но запустить у меня не получилось - модель загружается в ОЗУ, vram примерно 300 мб занимает. Запускал на RTX 5060 ti 16 gb vram + rtx 4060 8gb, Cachy OS. Попробуйте опубликовать статью на сабреддите локаллама, я думаю там Вы найдете отклик.
Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате