У меня RTX 5060 Ti на 16 гигабайт. Обычная потребительская карта, и на ней хочется гонять модели покрупнее, желательно с большим контекстом. Дальше история про то, как я скрестил две несовместимые вещи, потратил на это вечер, нашёл баг, который не выдаёт никаких ошибок, а потом выяснил, что настройка по умолчанию отнимала у меня четверть скорости.
Есть модель Ternary-Bonsai-27B от PrismML. Это Qwen3.6-27B, ужатый до примерно 2.1 бита на вес. Весит 6.66 гигабайта. Для 27B на 16-гигабайтной карте это отлично, потому что остаётся много места под контекст.
Проблема в том, что запускается она только на их собственном форке llama.cpp, а там нет сжатия KV-кеша. А KV-кеш на длинном контексте съедает больше, чем сама модель.
С другой стороны есть BeeLlama, форк от Anbeeld. В нём как раз есть TurboQuant и KVarN, две схемы сжатия KV. Но Bonsai он не грузит.
Причина простая и обидная: оба проекта завели у себя тип с названием Q2_0, и это разные форматы. К счастью удалось реализовать поддержку Bonsai в Beellama.