У меня на моей рабочей станции стоят 5060ti (pci-e v4 x4) + 5070ti (pci-e v4 x16), все под Windows. Тоже экспериментировал с layer split vs tensor split - в моем случае при tensor split существенно выше decode, но обнаружил другую проблему: если делать что-то, что задействует видеокарту параллельно (т.е смотреть ютуб например), скорость падает до 8tps, поэтому в итоге остановился на layer split, он медленнее, но зато можно в этот момент на компе что-то делать без ущерба для скорости decode.
на 16 лучше наверное все же Ornith1.5/Tiel-Coder A3B использовать. Они не сильно тупее квена3.8, но зато за счет MoE архитектуры позволяют гораздо больший контекст.
Странно, чатгпт говорит, что KV для Qwen3.8 27B на 200K в Q8_0 весит около 7GB , это подтверждается тем, что у меня в 32GB VRAM влезает Qwen3.8-27B-UD-Q4 + 220K контекста, все запускается и работает. Где ошибка?
Это же значит, что у вас 184320 контекст, или я чего то не понимаю? UPD: А, имеется в виду, что с 224K стартует, но ничего не генерирует, поэтому рабочий контекст 184K, ok.
Подскажите параметры запуска для llama.cpp с которыми вы запускаете Qwen3.8 27B Q5 с контекстом в 225К? У меня на двух картах 50x0 тоже с суммарной памятью 32Gb удается только 140K контекста в Q8_0 запустить максимально :(
у меня на 5070ti+5060ti на Qwen3.8 27B Q4_M помещается только 190К контекста в квантовании Q8_0. Возможно если для системного вывода видео использовать какую-то третью видеокарту, то 200К влезет. По скорости на полном контексте ~30t\s выдают, на незаполненном ~50t\s
На самом деле на многое. В статье автор описывает почему то только плотные модели, которые активируют весь массив параметров для генерации каждого токена. Но есть еще и MoE-модели, которые активируют лишь часть параметров для генерации токенов, на данный момент одной из лучших моделей этого класса является Tiel-Coder-35B-A3B , на моей практике она уступает плотному Qwen3.8 27B не драматично. Если поиграть с настройками, то на вашем железе она может дать сопоставимые или лучше результаты тем, что были рассмотрены в статье.
" цензуре достаточно сопоставить SNI в Вашем трафике, и пул адресов вашего хостинга в Нидерландах. " - ну тогда делаем сайт -заглушку и SNI совпадает с нашим хостингом.
Очень сомневаюсь в возможности использования ИИ (а корректнее наверное даже ML), для таких масштабов нужно не просто анализировать трафик каждого пользователя, а еще и записывать куда то результаты и анализировать их. Такое ощущение, что это усложнит инфраструктуру на порядок.
У Qwen3.8 27B (xhigh) Artificial Analysis Intelligence Index - 34, докупайте еще одну такую же карту (а лучше RTX3090/4090 24Gb) и вперед!
У меня на моей рабочей станции стоят 5060ti (pci-e v4 x4) + 5070ti (pci-e v4 x16), все под Windows. Тоже экспериментировал с layer split vs tensor split - в моем случае при tensor split существенно выше decode, но обнаружил другую проблему: если делать что-то, что задействует видеокарту параллельно (т.е смотреть ютуб например), скорость падает до 8tps, поэтому в итоге остановился на layer split, он медленнее, но зато можно в этот момент на компе что-то делать без ущерба для скорости decode.
сомневаюсь, 5090 с памятью GDDR7 работают, а для этого стандарта только недавно появились 3Gb чипы, они редкие и стоят совсем дорого.
на 16 лучше наверное все же Ornith1.5/Tiel-Coder A3B использовать. Они не сильно тупее квена3.8, но зато за счет MoE архитектуры позволяют гораздо больший контекст.
Ну вы тоже в ярость не впадайте :) Достаточно было бы и этой строчки:
Так llama тоже умеет параллелить, в двух режимах: layer и tensor. Флаг для запуска --split-mode layer/tensor --tensor-split 1,1,1
LM Studio в качестве движка использует так же llama.cpp, насколько мне известно, мы про него и говорим.
Странно, чатгпт говорит, что KV для Qwen3.8 27B на 200K в Q8_0 весит около 7GB , это подтверждается тем, что у меня в 32GB VRAM влезает Qwen3.8-27B-UD-Q4 + 220K контекста, все запускается и работает. Где ошибка?
Не пробовали сравнивать по качеству ответов FP8 с Q4 например? Любопытно всё же насколько она тупеет.
А на llama.cpp каких цифр удавалось достигать максимально?
Это же значит, что у вас 184320 контекст, или я чего то не понимаю? UPD: А, имеется в виду, что с 224K стартует, но ничего не генерирует, поэтому рабочий контекст 184K, ok.
Подскажите параметры запуска для llama.cpp с которыми вы запускаете Qwen3.8 27B Q5 с контекстом в 225К? У меня на двух картах 50x0 тоже с суммарной памятью 32Gb удается только 140K контекста в Q8_0 запустить максимально :(
не поделитесь параметрами запуска? У меня на похожем конфиге (видеокарты такие же + 64Gb RAM) почему то префилл 50tps, генерация тоже около 20
у меня на 5070ti+5060ti на Qwen3.8 27B Q4_M помещается только 190К контекста в квантовании Q8_0. Возможно если для системного вывода видео использовать какую-то третью видеокарту, то 200К влезет. По скорости на полном контексте ~30t\s выдают, на незаполненном ~50t\s
На самом деле на многое. В статье автор описывает почему то только плотные модели, которые активируют весь массив параметров для генерации каждого токена. Но есть еще и MoE-модели, которые активируют лишь часть параметров для генерации токенов, на данный момент одной из лучших моделей этого класса является Tiel-Coder-35B-A3B , на моей практике она уступает плотному Qwen3.8 27B не драматично. Если поиграть с настройками, то на вашем железе она может дать сопоставимые или лучше результаты тем, что были рассмотрены в статье.
Хорошо бы для Open WRT сделать
Так в РФ не заблокирован Github
" цензуре достаточно сопоставить SNI в Вашем трафике, и пул адресов вашего хостинга в Нидерландах. " - ну тогда делаем сайт -заглушку и SNI совпадает с нашим хостингом.
Очень сомневаюсь в возможности использования ИИ (а корректнее наверное даже ML), для таких масштабов нужно не просто анализировать трафик каждого пользователя, а еще и записывать куда то результаты и анализировать их. Такое ощущение, что это усложнит инфраструктуру на порядок.
Да это все равно придется попутно еще положить хостинг в РФ как класс, в противном случае подобные лимиты будут легко обходиться каскадными схемами.