Устаревший, неустаревший, однако большинство моделей с ним не справляются. Для чистоты эксперемента, вот код который сгенерила модель для рендеринга указанной выше картинки (можно вставить в txt файл, поменять разрешение на svg и открыть любым просмоторщиком)
У меня с первого раза вышел зачетный пеликан на велике :))) Модель unsloth/Qwen3.8-27B-UD-Q8_K_XL.gguf , промпт: "Generate clean SVG code fora whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style "
Ну в разрешении 480р 10 секундный ролик генерируется чуть меньше 10 минут. Просто с ростом разрешения длительность генерации увеличивается в геометрической прогрессии:))
"Разрешение при self-host упирается в 768p" - максимальное разрешение при self-host 1920*1080. У меня на rtx3090 генерация 15 секундного видео в таком разрешении заняло почти 3 часа
Как пользователь двух rtx3090 именно для локальных LLM уточню: если не использовать nvlink и разделять модель Qwen3.6-27b q8-k-xl по слоям, то скорость генерации будет около 40-50 токенов в сек, но GPU не будут загружены на 100% (загрузка будет попеременно скакать) и реальное потребление энергии будет около 500 Вт. При этом действительно дорогой компьютер не нужен, LLM работает с такой скоростью даже на материнках с PCIE 3.0 и даже в режиме PCIE 4x.
Но при этом хочу сказать, что с каждым днём убеждаюсь, что Qwen3.6-27b q8-k-xl - это исключительно удачная локальная модель, можно даже сказать шедевр локального моделестроения:)) Многими недооцениваемая. После того как я облепил ее самописными (с ее помощью) MCP-серверами и инструментами, адаптированными под мои задачи, а также сформировал и постоянно пополняю для модели базу знаний о моей инфраструктуре и окружении, она вдруг резко стала на порядок более умной и компетентной:))
При чем тут вообще аппаратная часть? Вы даёте новичкам откровенно устаревшую и не актуальную информацию. Если у человека видеокарта на 16 гигабайт, то это не причина рекомендовать ему устаревшие модели. Современная модель типа Qwen3.6-35b-a3b q4 будет на 16 гигабайтах работать гораздо лучше чем старые модели, как по скорости, благодаря MTP и грамотному переводу части MoE слоев на CPU, так и несравнимо лучше по качеству ответов.
Вот ваше утверждение "для вайбкодинга лучше и дешевле облачные решения" как раз и следствие того, что вы оперирует устаревшей информацией, не имеете достаточного опыта работы с современными моделями и с современными приемами выстраивания пайплайна для работы с такими моделями. Локальный вайбкодинг сейчас - это про грамотную настройку агентов и инструментов, использование правильных MCP. Это конечно намного сложнее чем просто дать команду "напиши код...".
Ну взять например ваше утверждение, что "Gemma4 26B-A4B памяти на контекст требует в разы больше, чем Qwen3.6 35B-A3B". Размер памяти под контекст это математическая величина, которую можно рассчитать по формуле (llama.cpp это делает при старте и заранее выделяет требуемый размер памяти). Контекст у Qwen3.6 действительно занимает меньше места, за счёт своей архитектуры, но эта разница не в разы. За счёт того что сама модель Qwen3.6 на 35 млрд параметров, а Gemma на 26, то она весит больше, то итоговое потребление памяти (модель+контекст) примерно одинаковое
Качество ответа зависит от квантования модели, от квантования кэша, от формулировки задачи (промпта), от прочих настроек, включая температуру. Может быть выбрав правильные настройки вы с удивлением обнаружите, что в большинствое предыдущих случаев вы просто делали это не правильно?
Количество активных параметров указано в названии MoE модели. Qwen3.6-35b-A3b означает что из 35 миллиардов параметров активных 3 миллиарда (А3b - active 3 billions)
А как vision функции и общие знания мешают в агентских задачах? Несмотря на то что Qwen3.6 универсальная модель она агентские задачи все равно решает лучше.
То что "модель NorthMiniCode в отличие от Qwen специально заточена под агентские циклы" не делает ее лучше Qwen в агентских сценариях. Странный выбор модели учитывая что Qwen3.6 гораздо лучше.
Не пробовали изменить глубину размышлений? Доступны 4 настройки (xhigh, medium, low, nonе)
Устаревший, неустаревший, однако большинство моделей с ним не справляются. Для чистоты эксперемента, вот код который сгенерила модель для рендеринга указанной выше картинки (можно вставить в txt файл, поменять разрешение на svg и открыть любым просмоторщиком)
Для сравнения unsloth/Qwen3.6-27B-UD-Q8_K_XL.gguf
У меня с первого раза вышел зачетный пеликан на велике :))) Модель unsloth/Qwen3.8-27B-UD-Q8_K_XL.gguf , промпт: "
Generate clean SVG code fora whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style"Generate clean SVG code fora whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style"Ну в разрешении 480р 10 секундный ролик генерируется чуть меньше 10 минут. Просто с ростом разрешения длительность генерации увеличивается в геометрической прогрессии:))
"Разрешение при self-host упирается в 768p" - максимальное разрешение при self-host 1920*1080. У меня на rtx3090 генерация 15 секундного видео в таком разрешении заняло почти 3 часа
Как пользователь двух rtx3090 именно для локальных LLM уточню: если не использовать nvlink и разделять модель Qwen3.6-27b q8-k-xl по слоям, то скорость генерации будет около 40-50 токенов в сек, но GPU не будут загружены на 100% (загрузка будет попеременно скакать) и реальное потребление энергии будет около 500 Вт. При этом действительно дорогой компьютер не нужен, LLM работает с такой скоростью даже на материнках с PCIE 3.0 и даже в режиме PCIE 4x.
Но при этом хочу сказать, что с каждым днём убеждаюсь, что Qwen3.6-27b q8-k-xl - это исключительно удачная локальная модель, можно даже сказать шедевр локального моделестроения:)) Многими недооцениваемая. После того как я облепил ее самописными (с ее помощью) MCP-серверами и инструментами, адаптированными под мои задачи, а также сформировал и постоянно пополняю для модели базу знаний о моей инфраструктуре и окружении, она вдруг резко стала на порядок более умной и компетентной:))
При чем тут вообще аппаратная часть? Вы даёте новичкам откровенно устаревшую и не актуальную информацию. Если у человека видеокарта на 16 гигабайт, то это не причина рекомендовать ему устаревшие модели. Современная модель типа Qwen3.6-35b-a3b q4 будет на 16 гигабайтах работать гораздо лучше чем старые модели, как по скорости, благодаря MTP и грамотному переводу части MoE слоев на CPU, так и несравнимо лучше по качеству ответов.
Вот ваше утверждение "для вайбкодинга лучше и дешевле облачные решения" как раз и следствие того, что вы оперирует устаревшей информацией, не имеете достаточного опыта работы с современными моделями и с современными приемами выстраивания пайплайна для работы с такими моделями. Локальный вайбкодинг сейчас - это про грамотную настройку агентов и инструментов, использование правильных MCP. Это конечно намного сложнее чем просто дать команду "напиши код...".
Посмотрел по ссылке. Информация по моделям давно неактуальная и устаревшая. Для кодинга рекомендовать Qwen 2.5 Coder, серьезно?
Ваши цифры без указания настроек запуска ничего не говорят. Какое квантование кэшей? Какие бетчи?
Ну взять например ваше утверждение, что "Gemma4 26B-A4B памяти на контекст требует в разы больше, чем Qwen3.6 35B-A3B". Размер памяти под контекст это математическая величина, которую можно рассчитать по формуле (llama.cpp это делает при старте и заранее выделяет требуемый размер памяти). Контекст у Qwen3.6 действительно занимает меньше места, за счёт своей архитектуры, но эта разница не в разы. За счёт того что сама модель Qwen3.6 на 35 млрд параметров, а Gemma на 26, то она весит больше, то итоговое потребление памяти (модель+контекст) примерно одинаковое
С помощью параметра
--n-cpu-moe, конкретное количество слоев определяется опытным путем, в зависимости от модели и железаКачество ответа зависит от квантования модели, от квантования кэша, от формулировки задачи (промпта), от прочих настроек, включая температуру. Может быть выбрав правильные настройки вы с удивлением обнаружите, что в большинствое предыдущих случаев вы просто делали это не правильно?
Извините, но Ваше сообщение говорит о том, что Вам нужно подтянуть матчасть. Почти все категоричные утверждения некорректны.
Количество активных параметров указано в названии MoE модели. Qwen3.6-35b-A3b означает что из 35 миллиардов параметров активных 3 миллиарда (А3b - active 3 billions)
Ага только какое отношение к модификации PS1 имеет скриншот с эмулятора Duckstation?
А как vision функции и общие знания мешают в агентских задачах? Несмотря на то что Qwen3.6 универсальная модель она агентские задачи все равно решает лучше.
То что "модель NorthMiniCode в отличие от Qwen специально заточена под агентские циклы" не делает ее лучше Qwen в агентских сценариях. Странный выбор модели учитывая что Qwen3.6 гораздо лучше.
Локальный qwen3.6-27b справился получше