Обновить

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов

Уровень сложностиСложный
Время на прочтение12 мин
Охват и читатели8.3K
Всего голосов 3: ↑3 и ↓0+4
Комментарии5

Комментарии 5

Можно попробовать бинарное и тернарное квантование, я писал о нем раннее.

Бинарная Bonsai 27B занимает 3.8 GB, при этом архитектурно это Qwen 3.6 27B.

Тернарная версия LLaMA-7B точно поместится в 1Gb и сохранит 60-75% качества исходной модели.

Спасибо, направление действительно стоит проверить. Я внимательно прочитал вашу статью. Насколько я понял, результат Bonsai получен с QAT и дистилляцией, тогда как PCST исследует более жёсткий режим — постквантизацию уже готовой модели без изменения весов обучением. Поэтому простая тернаризация LLaMA, вероятно, даст значительно более сильную деградацию.

Но Вы подкинули мысль, так что действительно имеет смысл добавить отдельный эксперимент с group-wise ternary, activation-aware objective, последовательной компенсацией ошибки и low-rank residual. Интересно также уточнить: вы предлагаете именно training-free тернаризацию готовой LLaMA или воспроизведение Bonsai-подобного QAT-процесса?

вы предлагаете именно training-free тернаризацию готовой LLaMA или воспроизведение Bonsai-подобного QAT-процесса?

Первое, попробовать тернарнизацию на заключительном шаге так сказать.

Довольно интересная статья, спасибо. Ощущение, что вы идёте по пути Unsloth.

Спасибо! Пересечение действительно есть в адаптивном распределении точности: разные слои и матрицы нельзя квантовать одинаково. Но PCST исследует несколько иной набор представлений — PQ, low-rank residuals, gauge-преобразования и функционально ориентированную оптимизацию без дообучения. Теперь обязательно подробнее сравним подход с Unsloth)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации