Комментарии 5
Спасибо, направление действительно стоит проверить. Я внимательно прочитал вашу статью. Насколько я понял, результат Bonsai получен с QAT и дистилляцией, тогда как PCST исследует более жёсткий режим — постквантизацию уже готовой модели без изменения весов обучением. Поэтому простая тернаризация LLaMA, вероятно, даст значительно более сильную деградацию.
Но Вы подкинули мысль, так что действительно имеет смысл добавить отдельный эксперимент с group-wise ternary, activation-aware objective, последовательной компенсацией ошибки и low-rank residual. Интересно также уточнить: вы предлагаете именно training-free тернаризацию готовой LLaMA или воспроизведение Bonsai-подобного QAT-процесса?
Довольно интересная статья, спасибо. Ощущение, что вы идёте по пути Unsloth.
Спасибо! Пересечение действительно есть в адаптивном распределении точности: разные слои и матрицы нельзя квантовать одинаково. Но PCST исследует несколько иной набор представлений — PQ, low-rank residuals, gauge-преобразования и функционально ориентированную оптимизацию без дообучения. Теперь обязательно подробнее сравним подход с Unsloth)

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов