Обновить

Комментарии 5

Из легких локальных моделей со скоростью 70 ток/сек на данный момент самая продвинутая это Ornith-1.0-9B

К сожалению, у меня она довольно часто зацикливается, особенно когда контекст подбирается к 100К токенов, а вот ее старший вариант Ornith-1.0-35B-GGUF очень даже ничего. Этот Qwen/Gemma дистиллят с самоподдержкой выстраивания мышления под конкретную задачу хорошо показывает себя в агентном режиме, но статья все же о знакомстве с нетрадиционными методами квантизации, Ornith же использует обычную.

Ссейчас развивается еще другое направление — тензорное сжатие. При это каждый вес не раскладывается в {-1,0,1}, а производится низкоранговая факторизация самих матриц через tensor networks. Multiverse Computing на этом уже поднял оценку примерно до $1,7 миллиарда.

Отсюда вопрос: как квантование стыкуется с тензорным сжатием? Или после агрессивного квантования тензорный подход уже бесполезен?

как квантование стыкуется с тензорным сжатием?

Насколько я понимаю, они работают на разных уровнях: тернарное квантование урезает точность каждого веса и заменяет дорогостоящие операции умножения на сложение и вычитание, а тензорное сжатие урезает число параметров через низкий ранг.

Или после агрессивного квантования тензорный подход уже бесполезен?

ИХМО, после такой подход не имеет смысла:

Во-первых, почти не останется структуры, которую можно выгодно разложить.

Во-вторых, сама идея тернарного квантования (заменить умножение сложением) потеряет всякий смысл, тк поверх сложения появляется свертка тензорных факторов (умножение).

А вот применить тензорный подход до тернарной квантизации имеет смысл. При таком порядке никто никому не мешает.

Хм, вы подали интересную идею, спасибо!

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации