Проверил третью гипотезу, генерация выходит медленнее чем в режиме tensor процентов на 20, хотя и префил резко подскочил с 800-900 до 1400-1700.
Ускорение от mtp довольно сильно разнится, попробовал на том же контексте (отрывок из книги) задавать другие вопросы - прыгает от 30% до 70%, но все равно потрясающе, такой прирост ценой 1.5гб памяти.
Спасибо за статью. Имею связку 5070ti (pcie5x16) и 5060ti (pcie4x4). На пустом контексте скорость генерации ~ 27/45 (без mtp, с mtp, около 70% прироста), но на 100к опускается до 24/27 (около 13% прироста). Принятие черновика нормальное - "draft acceptance = 0.77460 ( 1677 accepted / 2165 generated), mean len = 2.73". Квант UD-Q5_K_X. Подскажите, это нормальное поведение на большой длине контекста или я что-то недокрутил? Конфиг такой: %LLAMA% -m %MODEL% ^ –host 0.0.0.0 --port 8033 -np 1 ^ -fa on -ctk q8_0 -ctv q8_0 ^ -ngl 99 --fit off ^ -b 2048 -ub 512 ^ –no-mmap --no-warmup ^ –temp 1.0 --top-k 20 --top-p 0.95 --min-p 0.0 ^ –presence-penalty 0.0 --repeat-penalty 1.0 ^ –jinja --reasoning-format deepseek ^ –chat-template-kwargs “{“reasoning_effort”:“low”}” ^ –spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.7 --cache-type-k-draft q4_0 --cache-type-v-draft q4_0 ^ –split-mode tensor -c 110000 ^ -lv 4 --timeout 900 --no-mmproj
UPD удалил --spec-draft-p-min 0.7, количество черновиков выставил в 4 получил 32 t/s (33% прироста), хотя принятие черновика упало довольно сильно (draft acceptance = 0.39764 ( 808 accepted / 2032 generated), mean len = 2.59)
Инструкция установки mir pay на wear os занимает пол страницы текста и, по опыту, занимает установка около 15 минут, на том же 4pda описаны ограничения (версия wear os, наличие интернета для обновления токенов), и даже компьютер для этого не нужен. В данном примере на обоих ос по умолчанию у вас нет функции оплаты, но на одной из них он быстро восстанавливается. Довольно странно это считать аргументом к использованию эппл вотч.
Спасибо!
Проверил третью гипотезу, генерация выходит медленнее чем в режиме tensor процентов на 20, хотя и префил резко подскочил с 800-900 до 1400-1700.
Ускорение от mtp довольно сильно разнится, попробовал на том же контексте (отрывок из книги) задавать другие вопросы - прыгает от 30% до 70%, но все равно потрясающе, такой прирост ценой 1.5гб памяти.
Спасибо за статью. Имею связку 5070ti (pcie5x16) и 5060ti (pcie4x4).
На пустом контексте скорость генерации ~ 27/45 (без mtp, с mtp, около 70% прироста), но на 100к опускается до 24/27 (около 13% прироста). Принятие черновика нормальное - "draft acceptance = 0.77460 ( 1677 accepted / 2165 generated), mean len = 2.73". Квант UD-Q5_K_X.
Подскажите, это нормальное поведение на большой длине контекста или я что-то недокрутил?
Конфиг такой:
%LLAMA% -m %MODEL% ^–host 0.0.0.0 --port 8033 -np 1 ^-fa on -ctk q8_0 -ctv q8_0 ^ -ngl 99 --fit off ^-b 2048 -ub 512 ^ –no-mmap --no-warmup ^–temp 1.0 --top-k 20 --top-p 0.95 --min-p 0.0 ^–presence-penalty 0.0 --repeat-penalty 1.0 ^–jinja --reasoning-format deepseek ^–chat-template-kwargs “{“reasoning_effort”:“low”}” ^–spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.7 --cache-type-k-draft q4_0 --cache-type-v-draft q4_0 ^–split-mode tensor -c 110000 ^-lv 4 --timeout 900 --no-mmprojUPD удалил
--spec-draft-p-min 0.7, количество черновиков выставил в 4 получил 32 t/s (33% прироста), хотя принятие черновика упало довольно сильно (draft acceptance = 0.39764 ( 808 accepted / 2032 generated), mean len = 2.59)Вы забыли указать основной момент, прекратили поставки из-за отсутствия возможности проводить платежи, то есть фактически за неуплату.
Инструкция установки mir pay на wear os занимает пол страницы текста и, по опыту, занимает установка около 15 минут, на том же 4pda описаны ограничения (версия wear os, наличие интернета для обновления токенов), и даже компьютер для этого не нужен.
В данном примере на обоих ос по умолчанию у вас нет функции оплаты, но на одной из них он быстро восстанавливается.
Довольно странно это считать аргументом к использованию эппл вотч.
Позвольте, выручка а не прибыль.
xiaomi 12-13-14, +- как 15 айфон по размеру