Комментарии 19
Буквально пару дней назад в llama.cpp завезли кеширование экспертов в vram через флаг --moe-cache-mib, т.е. нужные эксперты для работы динамически подгружаются в это свободное окно, которое вы зададите. Думается, что для gpt-oss-20b это даст буст на узкопрофильных запросах, лучше чем просто cmoe и fit без него.
Спасибо, пропустил. Киньте ссылку на PR, по названию флага я его не нашел. Я у себя в форке делал похожее: горячие эксперты кладутся на карту поштучно, набор снимается на чтении запроса. На 16 тысячах контекста это дало 1,24 к --fit, на 65 тысячах уже только 1,05. Похоже, набор, снятый на чтении запроса, плохо покрывает то, что модель выбирает, когда пишет сама. Если новый флаг пересобирает кэш по ходу генерации, должно выйти лучше. Интересно было бы сравнить.
Я не знаю стоит ли покупать видеокарту на 16 гигов, так как все уверенно говорят что такой ИИ будет хуже чем у бесплатных чатботов, а вы на 6 гигах что-то запускаете:) В общем мы вступили из эпохи точных технических характеристик в какую-то шаманскую магию, когда мнения по одному и тому же вопросу могут отличаться на 180 градусов:(
Deepseek. и это даже не про агентский кодинг а всего лишь про ассистирование
Какие преимущества и недостатки локальной 16Гб видеокарты перед бесплатными чатботами, если нужна функция помощника по коду - анализировать код большого проекта, улучшать его, не полностью самостоятельно а вместе с программистом.
Если вам нужен помощник по коду для анализа большого проекта, локальная 16 ГБ видеокарта уступает бесплатным облачным чат-ботам практически по всем ключевым параметрам, кроме приватности. Облачные сервисы бесплатно дают то, что локально на 16 ГБ невозможно или крайне неудобно.
🧠 Контекст: главное ограничение локального подхода
Для анализа большого проекта критически важен размер контекстного окна — сколько кода модель может «видеть» одновременно.
Параметр Локальная 16 ГБ видеокарта Бесплатные чат-боты (Gemini / ChatGPT) Типичное контекстное окно 2 500 – 48 000 токенов 1 000 000 токенов (Gemini) / 128 000 (ChatGPT) Практическое следствие Хватает на 1–2 файла или небольшую функцию Можно загрузить весь проект целиком или десятки файлов
Даже если удастся запустить модель с контекстом 48 000 токенов (как сообщают пользователи Qwen3.5 на 16 ГБ) , это всё равно на порядок меньше, чем бесплатный Gemini. А специализированные агенты для 16 ГБ, такие как DiffusionGemma, используют всего 768 входных токенов и полагаются на поиск по репозиторию, а не на полный контекст .
🚧 Почему 16 ГБ — это жёсткий потолок
Современные локальные модели, которые хоть как-то сопоставимы по качеству с облачными, требуют больше памяти, чем есть на 16 ГБ:
Модели 7B–14B влезают комфортно, но их возможности анализа архитектуры и сложных зависимостей заметно ниже, чем у облачных гигантов .
Модели 27B (например, Gemma 3 27B) влезают только в 4-битном сжатии, оставляя мало места под контекст .
Модели 32B и выше (Qwen 2.5 Coder 32B) уже не помещаются в 16 ГБ при usable-квантизации. Запуск с выгрузкой в RAM приводит к катастрофическому падению скорости .
Для сравнения, бесплатные облачные модели относятся к классу «Pro» или «Advanced», которые локально потребовали бы 50+ ГБ VRAM.
🛠️ Что на самом деле работает на 16 ГБ (и как)
Локальный подход на 16 ГБ требует инфраструктурных костылей, которые частично компенсируют нехватку контекста:
RAG и графы зависимостей: Вместо загрузки всего проекта строится индекс (векторный или по графу вызовов). Инструмент извлекает только релевантные функции и их зависимости .
Внешние проверки: Локальный агент генерирует изменения, а затем прогоняет тесты и статический анализ, откатывая неудачные правки .
Специализированные агенты: Существуют готовые решения (например,
@code.siddharth/codeилиDiffusionGemma Agent), которые связывают локальную модель с RAG и инструментами редактирования .
Это работает, но требует времени на настройку и даёт качество ниже, чем просто загрузка проекта в бесплатный Gemini.
⚖️ Итоговое сравнение для работы с большим проектом
Критерий Локальная 16 ГБ Бесплатные чат-боты Глубина анализа проекта Ограничена только извлечённым контекстом (RAG) Полный проект в одном контексте (Gemini) Качество модели 7B–14B, качество заметно ниже GPT-4o / Gemini 1.5 Pro (сильные модели) Приватность Полная (код не покидает машину) Данные уходят в облако (не для конфиденциального кода) Скорость Быстро для 7–14B (>100 ток/с) Зависит от сети, но бесплатно Ограничения 16 ГБ — потолок для 27B; 32B не влезает Лимиты сообщений на бесплатном тарифе
🎯 Вывод
Если у вас большой проект и нужен качественный анализ в паре с программистом, бесплатные чат-боты (особенно Gemini с его 1M контекста) дадут больше пользы без затрат на железо.
Локальная 16 ГБ видеокарта имеет смысл только если код строго конфиденциален и не может быть отправлен в облако. В этом случае вам придётся смириться с более слабыми моделями и строить вокруг них инфраструктуру из RAG и проверок, чтобы хоть как-то компенсировать отсутствие большого контекста.
Бесплатные чатботы - не агенты. На 16 гб вполне можно получить 150-160к контекста на Qwen 3.8 27B. Да, квант модели достаточно низкий, как и квант кэша, но в целом более чем неплохо работает. Лично на 5070TI получаю 50-35 токенов в секунду при декодинге и быстрый префилл. Но конечно для такой модельки хочется хотя бы 24 гб видеопамяти, а лучше все 32 :)
Либо же просто взять подписку на какого-нибудь китайца и не париться. Хотя лично мне просто нравится экспериментировать и пробовать разные штуки.
Да, как предложили ниже, если у вас много оперативки и мало видеопамяти, то лучше использовать MoE модели типа Qwen 3.6 35B A3B. Там можно эффективно выгружать часть слоёв на ОЗУ.
Да лучше конечно 64, или 128 или даже 256:) Но вопрос в цене.
И опять же все пишут токены в секунду, но это разве показатель? Я поставил какую-то Qwen3.8-27B-Uncensored-Q4_K_M.gguf для запуска на процессоре, и она в принципе работает (хоть и медленно), но на разных задачах показывает совершенно разный уровень интеллекта. Нужно как-то оценивать именно качество, а не только скорость. А то, когда пишут про запуск на 6Гб, думаешь - это и правда может быть полезно в реальных задачах, или просто новая забава гиков типа запуска Doom на кофеварке?
Базовый уровень интеллекта конкретной модели и так примерно понятен по разным бенчмаркам (хотя нельзя не учитывать так называемый benchmaxing и в целом довольно спорные бенчи, статистикой которых иногда можно манипулировать, в общем оценка моделей - сложная штука). Учитывая понижение квантизации модели, то вычитаем часть результатов. Особенно в тех задачах, которые требуют большие знания от модели. Ибо галлюцинировать она начнёт чаще. В агентном программировании падение качества результатов будет поменьше скорее всего. Но в целом, если не брать уж слишком низкие кванты результат будет примерно понятным с интеллектом просто из-за понимания способностей базовой модели и отдельно писать смысла не вижу. А скорость с размером контекста - это уже второй важный критерий. Особенно при локальном использовании.
Всё как всегда зависит от целей и способов применения. Но по личному опыту Qwen 27B - вполне хорош для многих кодинг задач (хотя очевидно уступает крупным моделям).
Эх, а я ведь мог год назад купить 5090 по достаточно низкой цене... Теперь жаба душит чутка...
Про Doom на кофеварке в точку это то, что получилось-цель была изначально иной, а токены в секунду без качества согласен, ничего не стоят. Портит ли конкретная сборка модель, мерить дешево: KL-дивергенция к исходной модели на своем тексте, у llama-perplexity для этого есть ключ --kl-divergence. У меня на gpt-oss KV-кэш в q8_0 вышел почти даром, перплексия +0,05%, а в q4_0 уже +10,7%. А есть ли толк от совсем маленьких моделей, я мерил отдельно, на 1-2B. Длинный список целиком они читают плохо, а нарезанный на куски слабая модель у меня прочитала вчетверо лучше. Про это будет следующая статья.
Qwen3.6-35B-A3B-APEX-MTP-I-Balanced - (по тестам как не сжатая), на GTX 1650 4 gb + 32gb RAM DDR4 получаю 100 токенов промт на начале и 15-17 генерация. А промт с MTP это считай примерно как х1.7 обычного, т.е. перемножаем на 1.7 при генерации (сравнимо с 27 токенами обычными, не успеваю читать когда генерирует). Это при общем контексте в 64К. Можно выше поднять контекст. Мне кажется вполне рабочая версия уже. Конечно не летает, но и карта копейки стоит. На RTX4080 я думаю будет поинтереснее
и какие реальные задачи вы на ней решаете и насколько успешно? а то сокрость генерации сама по себе ничего не значит в отрыве от пользы
С какими аргуметами запускаете?

Слои влезли все впритык (их там около 40-42 вроде по памяти), но я поставил уже потом -ngl 99 чтобы не вспоминать сколько их там точно. Хороший профит от --parallel 1 если только сам юзаешь, освобождает неплохую резервируюмую под мультирежим часть GRAM. Выжал все что можно из 4 Гб. GTX1650 у меня с GDDR6. Если взять GTX1660 с 6 Гб, то конечно значительно легче можно уже вздохнуть, сразу контент на 256К дать и --ub -b поднять чтобы чтение ускорить контента. Да и чип там пошустрее по шине - тоже даст рост.
Про MTP интересно. У gpt-oss своей MTP-головы нет, я пробовал черновик из n-грамм. На обычном тексте он не сработал ни разу: 126 вызовов, ноль черновиков. На нарочно повторяющемся тексте сработал на 7 токенах из 128, тоже в пределах шума. С настоящей головой у Qwen, видимо, другая история. Какую долю черновых токенов у вас принимает основная модель?
Зависит от того что вы понимаете под словом большой проект, бесплатный чат бот это вайбкодинг, когда вы пихаете в веб окно ему свои хотелки он вам отдает код, копируете и вставляете в свой проект, таким макаром работают с проектом когда сами пишут код целиком, а чат-бот только для подсказок, размер окна тут почти не важен, всегда можно начать новую сессию.
Если рассматривать агентскую разработку, то тут агент сам пишет вам код, и халявы тут либо нет вообще, либо ее крайне мало, и хватит на написание половины тетриса.
Так что сравнение бесплатного VS локальная видеокарта тут не корректно
Я понимаю что неудобно копипастить туда-сюда из браузера в IDE и обратно. Понимаю что нельзя заставить чатбота работать автоматически (хотя наверное можно, но это уже хаки за которые могут забанить). Но концептуально удобство уже на втором месте. А на первом - "ум" модели и качество её работы. Что толку в токенах к секунду, если там бред?
Ну так можно сказать и "что толку от дипсика" , если он ответил на ваш вопрос тоже "бред" полуторагодовалой давности. А так у локальной модели неоспоримое преимущество что она работает почти бесплатно и в любое время. С другой стороны без нужды/желания именно агентской разработки - толку от них как по мне действительно немного будет, если просто как чат юзать.
По описанию принцип тот же: все эксперты в ОЗУ, видеокарта держит горячих как кэш. У себя проверить не могу. Их консольная версия только под Linux, нужны CUDA 13 и драйвер r580 или новее. В тестах у них машины от 4060 и выше, про 16-ю серию ни слова. Если кто гонял его рядом с --fit на одной модели и одном железе, интересно было бы увидеть цифры.
Есть форк страты для квен 35б. Лучше наверное уже не будет. Ну и райзен 1 поколения в мусорку. И память не разогнать нормально и числодобилка так себе.

Полтора месяца ускорял MoE на GTX 1660 SUPER: выиграл штатный флаг llama.cpp