Спасибо! Благодаря твоему примеру быстрее написал форк для Beellama с поддержкой turbo3, kvarn и Dflash для Bonsai. Правда принятие токенов у стандартной головы qwen 3.6 27b в лучше случае 60 процентов, но в любом случае это дает 65 токенов на 5060 ti 16gb, при 262к
https://github.com/Andgihat/beellama.cpp -- Вот, если кому интересно. Только учитывайте, что Dflash пока не родной, работает не на всю мощь
Спасибо! Благодаря твоему примеру быстрее написал форк для Beellama с поддержкой turbo3, kvarn и Dflash для Bonsai. Правда принятие токенов у стандартной головы qwen 3.6 27b в лучше случае 60 процентов, но в любом случае это дает 65 токенов на 5060 ti 16gb, при 262к