на 16 лучше наверное все же Ornith1.5/Tiel-Coder A3B использовать. Они не сильно тупее квена3.8, но зато за счет MoE архитектуры позволяют гораздо больший контекст.
Странно, чатгпт говорит, что KV для Qwen3.8 27B на 200K в Q8_0 весит около 7GB , это подтверждается тем, что у меня в 32GB VRAM влезает Qwen3.8-27B-UD-Q4 + 220K контекста, все запускается и работает. Где ошибка?
Это же значит, что у вас 184320 контекст, или я чего то не понимаю? UPD: А, имеется в виду, что с 224K стартует, но ничего не генерирует, поэтому рабочий контекст 184K, ok.
Подскажите параметры запуска для llama.cpp с которыми вы запускаете Qwen3.8 27B Q5 с контекстом в 225К? У меня на двух картах 50x0 тоже с суммарной памятью 32Gb удается только 140K контекста в Q8_0 запустить максимально :(
у меня на 5070ti+5060ti на Qwen3.8 27B Q4_M помещается только 190К контекста в квантовании Q8_0. Возможно если для системного вывода видео использовать какую-то третью видеокарту, то 200К влезет. По скорости на полном контексте ~30t\s выдают, на незаполненном ~50t\s
На самом деле на многое. В статье автор описывает почему то только плотные модели, которые активируют весь массив параметров для генерации каждого токена. Но есть еще и MoE-модели, которые активируют лишь часть параметров для генерации токенов, на данный момент одной из лучших моделей этого класса является Tiel-Coder-35B-A3B , на моей практике она уступает плотному Qwen3.8 27B не драматично. Если поиграть с настройками, то на вашем железе она может дать сопоставимые или лучше результаты тем, что были рассмотрены в статье.
" цензуре достаточно сопоставить SNI в Вашем трафике, и пул адресов вашего хостинга в Нидерландах. " - ну тогда делаем сайт -заглушку и SNI совпадает с нашим хостингом.
Очень сомневаюсь в возможности использования ИИ (а корректнее наверное даже ML), для таких масштабов нужно не просто анализировать трафик каждого пользователя, а еще и записывать куда то результаты и анализировать их. Такое ощущение, что это усложнит инфраструктуру на порядок.
Мой опыт (февраль 2026г) - оператор T-mobile (ex- Тинькоф) по прилету пришла СМС со ссылкой куда надо зайти и номером контакт-центра. По ссылке ничего не открывалось, позвонил по номеру, попросил включить связь и сразу же все включилось. У меня еще есть зарубежная SIM - на нее так же прилетели СМС с инструкциями, но не стал ее активировать - через сутки она сама по себе разблокировалась, как и обещали.
сомневаюсь, 5090 с памятью GDDR7 работают, а для этого стандарта только недавно появились 3Gb чипы, они редкие и стоят совсем дорого.
на 16 лучше наверное все же Ornith1.5/Tiel-Coder A3B использовать. Они не сильно тупее квена3.8, но зато за счет MoE архитектуры позволяют гораздо больший контекст.
Ну вы тоже в ярость не впадайте :) Достаточно было бы и этой строчки:
Так llama тоже умеет параллелить, в двух режимах: layer и tensor. Флаг для запуска --split-mode layer/tensor --tensor-split 1,1,1
LM Studio в качестве движка использует так же llama.cpp, насколько мне известно, мы про него и говорим.
Странно, чатгпт говорит, что KV для Qwen3.8 27B на 200K в Q8_0 весит около 7GB , это подтверждается тем, что у меня в 32GB VRAM влезает Qwen3.8-27B-UD-Q4 + 220K контекста, все запускается и работает. Где ошибка?
Не пробовали сравнивать по качеству ответов FP8 с Q4 например? Любопытно всё же насколько она тупеет.
А на llama.cpp каких цифр удавалось достигать максимально?
Это же значит, что у вас 184320 контекст, или я чего то не понимаю? UPD: А, имеется в виду, что с 224K стартует, но ничего не генерирует, поэтому рабочий контекст 184K, ok.
Подскажите параметры запуска для llama.cpp с которыми вы запускаете Qwen3.8 27B Q5 с контекстом в 225К? У меня на двух картах 50x0 тоже с суммарной памятью 32Gb удается только 140K контекста в Q8_0 запустить максимально :(
не поделитесь параметрами запуска? У меня на похожем конфиге (видеокарты такие же + 64Gb RAM) почему то префилл 50tps, генерация тоже около 20
у меня на 5070ti+5060ti на Qwen3.8 27B Q4_M помещается только 190К контекста в квантовании Q8_0. Возможно если для системного вывода видео использовать какую-то третью видеокарту, то 200К влезет. По скорости на полном контексте ~30t\s выдают, на незаполненном ~50t\s
На самом деле на многое. В статье автор описывает почему то только плотные модели, которые активируют весь массив параметров для генерации каждого токена. Но есть еще и MoE-модели, которые активируют лишь часть параметров для генерации токенов, на данный момент одной из лучших моделей этого класса является Tiel-Coder-35B-A3B , на моей практике она уступает плотному Qwen3.8 27B не драматично. Если поиграть с настройками, то на вашем железе она может дать сопоставимые или лучше результаты тем, что были рассмотрены в статье.
Хорошо бы для Open WRT сделать
Так в РФ не заблокирован Github
" цензуре достаточно сопоставить SNI в Вашем трафике, и пул адресов вашего хостинга в Нидерландах. " - ну тогда делаем сайт -заглушку и SNI совпадает с нашим хостингом.
Очень сомневаюсь в возможности использования ИИ (а корректнее наверное даже ML), для таких масштабов нужно не просто анализировать трафик каждого пользователя, а еще и записывать куда то результаты и анализировать их. Такое ощущение, что это усложнит инфраструктуру на порядок.
Да это все равно придется попутно еще положить хостинг в РФ как класс, в противном случае подобные лимиты будут легко обходиться каскадными схемами.
Что то я все равно не понял этой мысли - каким образом включенный VPN у человека помогает встретиться со всем перечисленным какому то подростку.
Мой опыт (февраль 2026г) - оператор T-mobile (ex- Тинькоф) по прилету пришла СМС со ссылкой куда надо зайти и номером контакт-центра. По ссылке ничего не открывалось, позвонил по номеру, попросил включить связь и сразу же все включилось. У меня еще есть зарубежная SIM - на нее так же прилетели СМС с инструкциями, но не стал ее активировать - через сутки она сама по себе разблокировалась, как и обещали.