Ну взять например ваше утверждение, что "Gemma4 26B-A4B памяти на контекст требует в разы больше, чем Qwen3.6 35B-A3B". Размер памяти под контекст это математическая величина, которую можно рассчитать по формуле (llama.cpp это делает при старте и заранее выделяет требуемый размер памяти). Контекст у Qwen3.6 действительно занимает меньше места, за счёт своей архитектуры, но эта разница не в разы. За счёт того что сама модель Qwen3.6 на 35 млрд параметров, а Gemma на 26, то она весит больше, то итоговое потребление памяти (модель+контекст) примерно одинаковое
Качество ответа зависит от квантования модели, от квантования кэша, от формулировки задачи (промпта), от прочих настроек, включая температуру. Может быть выбрав правильные настройки вы с удивлением обнаружите, что в большинствое предыдущих случаев вы просто делали это не правильно?
Количество активных параметров указано в названии MoE модели. Qwen3.6-35b-A3b означает что из 35 миллиардов параметров активных 3 миллиарда (А3b - active 3 billions)
А как vision функции и общие знания мешают в агентских задачах? Несмотря на то что Qwen3.6 универсальная модель она агентские задачи все равно решает лучше.
То что "модель NorthMiniCode в отличие от Qwen специально заточена под агентские циклы" не делает ее лучше Qwen в агентских сценариях. Странный выбор модели учитывая что Qwen3.6 гораздо лучше.
У меня Qwen3.6-27b, запущенный на локальном компьютере, отлично распознает изображения и замечает даже самые мелкие детали. Судя по всему вы "другие существующие решения" и не пробовали даже?
Перерыл всё Авито и не нашел сетап V100 32ГБ + переходник + охлаждение за 25 тыс руб. Реальные цены 50+ да и то предзаказ из Китая. А название топика "Сервер за 25..." просто откровенное вранье ((( Сервер ведь не только из одной видеокарты состоит
На счёт кэширования кэша, тут сложно судить объективно, так так я не проводил тестирование в связи с отсутствием у меня бенчмарка данной метрики, но судя по статьям с исследованиями, которые я читал на реддите, разница имеется. Но в любом случае, при наличии свободной памяти квантование кэша выглядит не логичным.
2х RTX3090 ~120 тыс руб на Авито. Модель Qwen3.6-27b-q8_k_xl-mtp работает на скорости 1200 токен/сек префил и 45-50 токен/сек генерация. То есть более чем в 7 раз выше чтение промпта и в 3 раза выше генерация, чем в обсуждаемом в статье решении. На мой взгляд стоит того и отрабатывает свои деньги.
Странный и не логичный выбор настроек. Если у Вас много памяти, то почему не использовать модель с квантованием Q8_K_XL, которая лучше чем Q6? Опять же, при большом объеме памяти, зачем вы квантуете кэш на q8, вместо того чтобы использовать bf16? Это же снижает качество генерации, особенно ощутимо на больших контекстах, и не даёт никакой прибавки в скорости. По моему опыту, лучше использовать Open Code, он работает отлично и не имеет никаких проблем с контекстом 260k.
Вопрос ведь был не про удобство и привычки, а про затраты токенов. Я сейчас работаю с md-файлами, и для меня это кажется проще и удобнее. Но хотелось бы понять, может использование БД в этом плане действительно лучше?
Не тратьте время на LM Studio, а переходите на llama.cpp. Там все настраивается гораздо гибче. Вы сами можете задать какое количество ресурсов использовать. Если например имеется 30 гигабайт памяти, то с помощью параметров можно рассчитать чтобы использовалось именно 30 гигабайт, не больше и не меньше. Нужен большой размер контента - используете более агрессивное квантование кэшей и тд. Это я к тому, что ваш показатель "минимальный запас RAM" бессмысленнен. Оставшуюся свободную память можно использовать чтобы повысить качество генерации.
Наверное, то же Qwen3.6 27b, но с квантованием Q4_K_M, квантованием кэша q8_0. Также можно уменьшить бенчи, например, "–batch-size 1024", " --ubatch-size 512", на качество ответов это не влияет, только несколько снизит скорость. Выбрать максимальный размер контекста на всю оставшуюся после загрузки основных весов видеопамять. Использовать llama.cpp. Смотреть, сколько потребляется видеопамяти после загрузки модели и корректировать настройки, чтобы свободной оставалось ~512 МБ.
у vLLM слишком много "особенностей" при работе с квантованными моделями. Она у меня конечно тоже установлена, но для энтузиаста, который постоянно экпериментирует с моделями, настройками, новыми фичами и при этом использует консьюмерские видеокарты (как я), llama.cpp пока гораздо лучше чем vLLM
Ваши цифры без указания настроек запуска ничего не говорят. Какое квантование кэшей? Какие бетчи?
Ну взять например ваше утверждение, что "Gemma4 26B-A4B памяти на контекст требует в разы больше, чем Qwen3.6 35B-A3B". Размер памяти под контекст это математическая величина, которую можно рассчитать по формуле (llama.cpp это делает при старте и заранее выделяет требуемый размер памяти). Контекст у Qwen3.6 действительно занимает меньше места, за счёт своей архитектуры, но эта разница не в разы. За счёт того что сама модель Qwen3.6 на 35 млрд параметров, а Gemma на 26, то она весит больше, то итоговое потребление памяти (модель+контекст) примерно одинаковое
С помощью параметра
--n-cpu-moe, конкретное количество слоев определяется опытным путем, в зависимости от модели и железаКачество ответа зависит от квантования модели, от квантования кэша, от формулировки задачи (промпта), от прочих настроек, включая температуру. Может быть выбрав правильные настройки вы с удивлением обнаружите, что в большинствое предыдущих случаев вы просто делали это не правильно?
Извините, но Ваше сообщение говорит о том, что Вам нужно подтянуть матчасть. Почти все категоричные утверждения некорректны.
Количество активных параметров указано в названии MoE модели. Qwen3.6-35b-A3b означает что из 35 миллиардов параметров активных 3 миллиарда (А3b - active 3 billions)
Ага только какое отношение к модификации PS1 имеет скриншот с эмулятора Duckstation?
А как vision функции и общие знания мешают в агентских задачах? Несмотря на то что Qwen3.6 универсальная модель она агентские задачи все равно решает лучше.
То что "модель NorthMiniCode в отличие от Qwen специально заточена под агентские циклы" не делает ее лучше Qwen в агентских сценариях. Странный выбор модели учитывая что Qwen3.6 гораздо лучше.
Локальный qwen3.6-27b справился получше
У меня Qwen3.6-27b, запущенный на локальном компьютере, отлично распознает изображения и замечает даже самые мелкие детали. Судя по всему вы "другие существующие решения" и не пробовали даже?
Перерыл всё Авито и не нашел сетап V100 32ГБ + переходник + охлаждение за 25 тыс руб. Реальные цены 50+ да и то предзаказ из Китая. А название топика "Сервер за 25..." просто откровенное вранье ((( Сервер ведь не только из одной видеокарты состоит
Чем обусловлен выбор давно устаревшей модели, когда есть Qwen3.6, который с указанной задачей справится гораздо лучше и эффективнее?
На счёт кэширования кэша, тут сложно судить объективно, так так я не проводил тестирование в связи с отсутствием у меня бенчмарка данной метрики, но судя по статьям с исследованиями, которые я читал на реддите, разница имеется. Но в любом случае, при наличии свободной памяти квантование кэша выглядит не логичным.
2х RTX3090 ~120 тыс руб на Авито. Модель Qwen3.6-27b-q8_k_xl-mtp работает на скорости 1200 токен/сек префил и 45-50 токен/сек генерация. То есть более чем в 7 раз выше чтение промпта и в 3 раза выше генерация, чем в обсуждаемом в статье решении. На мой взгляд стоит того и отрабатывает свои деньги.
Странный и не логичный выбор настроек. Если у Вас много памяти, то почему не использовать модель с квантованием Q8_K_XL, которая лучше чем Q6? Опять же, при большом объеме памяти, зачем вы квантуете кэш на q8, вместо того чтобы использовать bf16? Это же снижает качество генерации, особенно ощутимо на больших контекстах, и не даёт никакой прибавки в скорости. По моему опыту, лучше использовать Open Code, он работает отлично и не имеет никаких проблем с контекстом 260k.
Вопрос ведь был не про удобство и привычки, а про затраты токенов. Я сейчас работаю с md-файлами, и для меня это кажется проще и удобнее. Но хотелось бы понять, может использование БД в этом плане действительно лучше?
Не тратьте время на LM Studio, а переходите на llama.cpp. Там все настраивается гораздо гибче. Вы сами можете задать какое количество ресурсов использовать. Если например имеется 30 гигабайт памяти, то с помощью параметров можно рассчитать чтобы использовалось именно 30 гигабайт, не больше и не меньше. Нужен большой размер контента - используете более агрессивное квантование кэшей и тд. Это я к тому, что ваш показатель "минимальный запас RAM" бессмысленнен. Оставшуюся свободную память можно использовать чтобы повысить качество генерации.
Наверное, то же Qwen3.6 27b, но с квантованием Q4_K_M, квантованием кэша q8_0. Также можно уменьшить бенчи, например, "–batch-size 1024", " --ubatch-size 512", на качество ответов это не влияет, только несколько снизит скорость. Выбрать максимальный размер контекста на всю оставшуюся после загрузки основных весов видеопамять. Использовать llama.cpp. Смотреть, сколько потребляется видеопамяти после загрузки модели и корректировать настройки, чтобы свободной оставалось ~512 МБ.
у vLLM слишком много "особенностей" при работе с квантованными моделями. Она у меня конечно тоже установлена, но для энтузиаста, который постоянно экпериментирует с моделями, настройками, новыми фичами и при этом использует консьюмерские видеокарты (как я), llama.cpp пока гораздо лучше чем vLLM