Комментарии 5
Из легких локальных моделей со скоростью 70 ток/сек на данный момент самая продвинутая это Ornith-1.0-9B
К сожалению, у меня она довольно часто зацикливается, особенно когда контекст подбирается к 100К токенов, а вот ее старший вариант Ornith-1.0-35B-GGUF очень даже ничего. Этот Qwen/Gemma дистиллят с самоподдержкой выстраивания мышления под конкретную задачу хорошо показывает себя в агентном режиме, но статья все же о знакомстве с нетрадиционными методами квантизации, Ornith же использует обычную.
Ссейчас развивается еще другое направление — тензорное сжатие. При это каждый вес не раскладывается в {-1,0,1}, а производится низкоранговая факторизация самих матриц через tensor networks. Multiverse Computing на этом уже поднял оценку примерно до $1,7 миллиарда.
Отсюда вопрос: как квантование стыкуется с тензорным сжатием? Или после агрессивного квантования тензорный подход уже бесполезен?
как квантование стыкуется с тензорным сжатием?
Насколько я понимаю, они работают на разных уровнях: тернарное квантование урезает точность каждого веса и заменяет дорогостоящие операции умножения на сложение и вычитание, а тензорное сжатие урезает число параметров через низкий ранг.
Или после агрессивного квантования тензорный подход уже бесполезен?
ИХМО, после такой подход не имеет смысла:
Во-первых, почти не останется структуры, которую можно выгодно разложить.
Во-вторых, сама идея тернарного квантования (заменить умножение сложением) потеряет всякий смысл, тк поверх сложения появляется свертка тензорных факторов (умножение).
А вот применить тензорный подход до тернарной квантизации имеет смысл. При таком порядке никто никому не мешает.
Хм, вы подали интересную идею, спасибо!
Отсталые

Нейронные сети нетрадиционного квантования