Comments 1
Собственно ничего нового. Если полез в cpu, то в первую очередь надо смотреть на загрузку скорости озу. На амд по виндой можно смотреть в hwinfo. Если образно по тесту aida имеем 80 гб/с, а в инференсе по hwinfo в его 50 и 10 т/с. То в теории можно разогнаться до 16 т/с (80/50*10). Идём в линукс и уже мучаем инференс там, зная потолок своей системы. Из коробки llama cpp упирается примерно в 75%. Правильной сборкой можно ещё выжать 10-15%. Будет время, напишу статью.
Sign up to leave a comment.
Почему MoE-модель тормозит? Чек-лист из трех шагов