Обновить

Комментарии 2

Качество еще не тестировал, но скорость действительно увеличилась ~30 -> 50 t/s при маленьком контексте на M1 Max (32С/64GB) при использовании incoai/Qwen3.8-27B-Splash. При увеличении контекста замедляется, но все равно быстрее. И да, в оригинале поддерживает начиная с M3, но есть форк с поддержкой М1/М2: https://github.com/paperniuk/splash

И на реддите в /localLLM обсуждение интересное.

Да обычно это выглядело как припарки. MTP давал прирост 1 -2 токена в секунду тут же прям хорошо приросло

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации