Обновить

Как я выбирал локальную модель для кодинга на 16 ГБ VRAM — и трижды менял победителя

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.9K
Всего голосов 6: ↑6 и ↓0+7
Комментарии33

Комментарии 33

Хороший пример того, почему модель стоит оценивать не на абстрактных задачах, а на реальном агентском сценарии. Отдельно впечатлила разница между 32K и 48K по скорости и запасу VRAM.

В локальных ИИ агентах - тарифицируются токены?

Если агент работает полностью на локальной модели - нет. Только косвенно: в виде счёта за электричество 🙂

А вариант переключение между моделями, которая заточена под задачу не пробовали?Возможно первоначальный старт будет долгим.

Если еще будете продолжать эксперименты, обратите внимание на jinja шаблон и "от кого" берете квант.

К примеру, мне нравился unsloth для моделей "поговорить". Но как только нужна агентская работа (вызов тулзов) - сплошь и рядом он подкладывает какой-то стандратный шаблон, который именно что "пихает JSON в тело ответа вместо чтобы вызвать функцию".

И тут можно либо скачать оригинальный шаблон, либо слегка подправить существующий. Либо брать версию от кого-то еще.

Т.е. проблема может быть не в модели и не в кванте (хотя на мелких квантах типа Q3 действительно работа с инструментами страдает), а в обвязке.

Все модели в статье устарели один-два года назад, современные модели и умнее, и быстрее, и гораздо лучше натренированы в кодинге в современных кодинг инструментах.

Никогда не спрашивайте у закрытых моделей что-то про открытые: во-первых у них устаревшие данные, во вторых складывается впечатление, что они специально вредят в ответах на такие вопросы. Наверное самый нормальный вариант, это мониторить субреддит /r/localllama там больше всего обсуждаются кодинг модели влезающие в 16Гб видеопамяти.

Упд: пытался подобрать запрос, чтоб они возвращали актуальные данные. Но даже когда включаешь веб-поиск и спрашиваешь так:

What models are mostly discussed on the subreddit /r/locallama in the last several months that can fit 16- 60 GB of memory and are good at coding?

все равно возвращают устаревшую херню, а не то, что действительно обсуждалось. Точно специально вредят.

А поделитесь конкретными кандидатами? Ограничения остаются прежними: 16 ГБ VRAM, рабочий контекст от 32K, стабильная работа с инструментами агента, включая запись файлов, и вменяемый русский язык.

Если есть свежие модели, которые проходят весь этот сценарий лучше и стабильнее - с удовольствием прогоню их через те же тесты.

Gemma 4 12-26b, Qwen3.8-27B-GSQ-RCO-IQ3_XXS-Uncensored-MTP, Ornith-1.5-9B все это влезет в 16гб

Да, Gemma 4 26B A4B у меня есть, Qwen3.8-27B тоже, но гоняю их в основном на общих текстовых задачах, а не в агентском кодинге.

А вот Ornith-1.5-9B пока не пробовал, возьму на заметку.

Если правда руки дойдут, вот еще кандидат, якобы под кодинго-агентские задачи заточен:

NeoHorse-1-9B — это очень свежая (сентябрь 2026) дообученная версия Qwen3.5-9B от команды TokenRhythm

Честно говоря, у меня макбук, а не выделенная видеокарта, другая ситуация, так что могу только советовать то, что видел, а не то, что сам руками пробовал.

Для кодинга в видеопамяти 16-32Гб сейчас король это Qwen3.8-27B, лучше него результата ни у кого не будет. Правда для 16 Гб надо уж совсем сильно квантовать, но вот как пример для вашей видео: https://www.reddit.com/r/LocalLLaMA/comments/1vper67/club5060ti_refresh_tested_rtx_5060_ti_presets_a/ у человека получается 64K контекст и около 30 токенов/с скорость. Скорость префила, правда, маловата. Однако раз уж вы планируете брать вторую карту, то можно будет использовать VLLM вместо llama.cpp, судя по комментариям, на нативном для CUDA nvfp4 кванте можно получить 3000/с скорость префила.

Идейное развитие именно Qwen3-Coder-30B-A3B, это модели Qwen3.6-35B и Qwen3.5-35B, обе лучше в кодинге, но они чуть больше размером и боюсь в 16Гб вообще не влезут. Но на длинном контексте они занимают меньше места чем Qwen3-Coder-30B из-за того, что их kv-кэш намного более экономичный. На них есть специальные файнтюны заточенные именно под кодинг, которые приближают их к Qwen3.8-27B, но все равно не дотягивают. Хотя и скорость сильно выше чем у 27b, это модели Ornith-1.5-35B-A3B, KAT-Coder-V2.5 и Tiel-Coder.

Ну и в целом, для локальных моделей на видюхе начального уровня лучше вместо OpenCode использовать pi coding agent - у него специально вылизанный системный промпт чтоб занимать как можно меньше токенов, или его сборку специально под мелкие модели: litte-coder.

Ну и наконец, лучше прискать по сабреддиту https://www.reddit.com/r/LocalLLaMA по вашей видео, можно найти много полезной инфы, включая конфиги, как все настроить, чтоб пролучить максимум результата.

Сколько у вас памяти на вашем маке?

У меня есть mac studio на m2 с 32Gb RAM, куплен в том числе и для работы в headless режиме (чтобы больше оперативки оставалось для LLM), что из моделей посоветуете для него? Цель - разработка, в основном на golang.

немного дезинфы, 35б квен влезет даже в 12гб гпу. просто нужно гуглить ncpumoe в поиске. но смысла в этом не прямо что бы много, когда есть плотный квен. в остальном все верно.

Спасибо за содержательный комментарий - одна из целей статьи как раз была в том, чтобы получить такие отклики.

Я, видимо, из-за инерции мышления не рассматривал для кодинга модели семейства Qwen без слова «coder» в названии. Поэтому Qwen3.8-27B, которая у меня уже есть, использовал только для общих задач.

Кстати, в текстовых тестах она показывает очень хорошо. Например, лучше всех из моих моделей на 20–30B объяснила смысл пословицы “Лес рубят - щепки летят”. Не каждый человек этот тест проходит 🙂

Но вернёмся к кодингу. У меня Qwen3.8-27B-IQ3_XS показывает:

  • при 32K - 22,6 токена/с и около 1,8 ГБ свободной VRAM;

  • при 64K - 17,8 токена/с и всего 506 МБ свободной VRAM.

То есть на 64K она запускается и работает, но запас уже совсем небольшой. Любая дополнительная нагрузка на GPU - может всё испортить.

Для сравнения: Qwen3-Coder-30B-A3B-Instruct-UD-IQ3_XXS в моём тесте выдавала 42,32 токена/с - почти вдвое больше.

На скорую руку протестировал Qwen3.8 на задаче средней сложности: создание Gutenberg-блока из HTML, регистрация изображений, перенос данных и публикация на сайте.

Итог: по качеству кода результат идентичный, а по времени:

  • Qwen3-Coder-30B-A3B - около минуты;

  • Qwen3.8-27B - около четырёх минут.

Так что вариант с 27B рабочий, но для потоковой рутины 4 минуты против одной - это ощутимая разница.

За наводку на pi coding agent и сабреддит отдельное спасибо. Есть что проверять.

Если сможете обуздать overthinking qwen 3.8 27b от тех же unsloth, то выбирайте ее (даже в iq3xxs, с 90к контекста, полностью помещается в памяти). Если нет, то qwen 3.5/3.6 27b. Как будто бы преимущества специализированных моделей-кодеров перед общими моделями - видны либо на очень сложных задачах, либо, когда модель выдает по ТЗ, например, одну конкретную функцию. Если модель должна вести проект целиком, архитектурно, то кодеры - проигрывают (ИМХО)

а что может влезть с адекватной работой на 12GB VRAM? unsloth qwen3.8:27B?

ornith 1.5, tiel Coder, qwen 3.8 gsq rco с очень агрессивным квантования кэша

я вот эту запускаю у себя на rtx3060 12гб
Qwen3.8-27B-GSQ-RCO-IQ3_XXS-Uncensored-MTP
среднее 16т/с выходит, окно 32к

Согласен полностью, сейчас нужно ставить 2 карты 5060 16 гб. И тогда можно запускать QWEN 3.8 27B или Gemma 4 31B для творчества. И Важен сам агент который управляет моделью, мне нравится Bionic от LMStudio.

Я типа ретроград, агентам на своем компе как-то не доверяю) (наверное зря, но у меня пока не возникла мотивация). Но вот скажите, какое качество кода выдают модели на карточке 16Гб? Реально лучше чем то что в бесплатных чатботах? (для всяких мелких задач мне тот же дипсик с ходу пишет утилиты без ошибок, я только код копирую и вставляю, а крупных задач у меня просто нет).

И еще неожиданно возник вопрос: насколько современные видеокарты шумные? Я как-то очень давно купил комп в сборке, а дома оказалось что блок питания громко гудит, и я понял что вообще не могу работать на таком компе - хорошо что по гарантии поменяли на практически бесшумный.

Я предпочитаю, разумеется, по API серьезные модели гонять, даже бесплатные. 16GB и "сверхконфиденциально, нельзя в облако" слабо вяжется.

Но для интереса пробовал и на 4060Ti 16GB. И прелесть по сравнению с чатботами именно в получении готового результата, без кучи копипейста ошибок и кода в браузер и обратно.

Пример задачи, которую за несколько итераций именно локальная модель порешала. (nemotron, кажется, был - трудно настроить, чтобы инструменты качественно вызывались, зато mamba архитектура позволяет хороший контекст держать)

Напиши функцию на Python (numpy), которая рассчитывает уникальные углы дифракции \theta для кубического кристалла по формуле n\lambda = 2d \sin(\theta), где d = a / \sqrt{h^2+k^2+l^2}.

Там именно что подводные камни есть, которые надо учесть. Но тут чатбот может и справится.

А это еще сложнее. Предметные области знать надо. И вряд ли с одного раза из чатика вы получите работающий код. Хотя сейчас не только локальные модели "выросли", может и получится уже.

Напиши на Python класс для работы с индексами Миллера в кубической кристаллической решетке.

Требования:

  1. Метод для вычисления межплоскостного расстояния $d_{hkl}$ при заданном параметре решетки $a$.

  2. Метод для проверки условия дифракции (правила погасания) для ГЦК (гранецентрированной кубической) решетки.

  3. Функция должна принимать на вход индексы (h, k, l) и возвращать True/False для возможности дифракции.

  4. Усложнение: Добавь расчет угла Брэгга (theta) для заданной длины волны (lambda) и порядка дифракции n=1.

  5. Используй только стандартную библиотеку math, без numpy (проверим чистую алгоритмику).

Но при малейшей возможности, конечно, лучше API. А если не "функцию написать", а реально с проектом работать, то и подавно. Я бы даже при возможности выделить модели 96GB (а-ля Ryzen или Mac) не стал бы с локальными программировать. Только доверять им по Инету полазить и что-то найти, подобрать (тоже нужно хорошее понимание JSON и вообще структур для работы с инстурментами, MCP).

И еще пример, когда локальная модель необходима: что-то нафиговертил с роутером, нет интернета. Просишь локальную модель зайти по ssh и поправить. Какой-нибудь Mikrotik или даже OpenWRT задолбаюсь чинить из командной строки - конкретные команды не помню. А тут "под моим чутким руководством" - хорошая помощь.

Из последнего очень порадовала qwen3.8 - 27b. У меня проблема была в связке SQLite - qt/c++ - qml. Все вертелось в одном потоке и были приличные тормоза. Я в чате закидывал файлы с классами, которые с бд работают, и мне моделька практически без ошибок разбила их на пары worker и GUI, прописала все взаимодействия. Причем архитектурно все вышло корректно, как я и сам планировал. Хочу попробовать ее в агентом режиме, ибо первая локальная модель с такими перспективами под мое железо.

И да, по железу: rtx 5060 ti 16gb, 32 RAM. Полностью в VRAM не помещается, но через ollama работала стабильно, около 15-25 токенов/сек

помещается она без проблем, возьми gsq-rco, на 16гб 100к контекста будет, и выброси бога ради олламу, ты сам себе в ногу стреляешь с ней.

В ногу я встретил давно, когда c++ выбрал, чего терять то уже. gsq-rco попробую, спасибо

А что сейчас лучше олламы? Мы на работе на 5090 TI развернули через llamacpp.

На 16 ГБ качество уже вполне рабочее, хотя небольшую утилиту бесплатный веб-DeepSeek, скорее всего, напишет лучше.

Мне локальные модели нравятся именно в роли рабочих лошадок: агент читает проект, сам правит файлы, делает несколько заходов - а я не считаю токены и не слежу за лимитами. Не обязательно умнее облака, зато всегда под рукой и стабильно тащит рутину.

У меня в этой категории моделей:
Qwen3.5-9B-ultra-uncensored-heretic-v2-Q6_K.gguf, 6.85 GB
Ornith-1.5-9B-Q6_K.gguf, 7.04 GB
Ministral-3-14B-Instruct-2512-BF16-abliterated.Q6_K.gguf, 10.33 GB
Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf, 11.29 GB
gemma4-v2-Q8_0.gguf, 11.80 GB

Возможно стоит попробовать gemma4:12b-it-qat

Она посвежее чем те, что тестировались, новее архитектура, может дать лучший результат как по россуждению, так и по агентским сценариям

Qwen3.8 flash next
На 5060 ti 16gb в q3 выдает до 22т/с, на cmp 50hx 20gb, после анлока gen2 17т/с.
Если не нужен контекст на 256к то можно и q4 квантование попробовать.
Для автономных задач более чем хватает.
Несмотря на то что рабочая лошадка у меня Qwen3.8-27B-UD-Q6_K_M (на 4x3060), более сложные задачи отдаю qwen flash next.

На cmp170hx у меня скорость падает с 44 до 10 т/сек при увеличении контекста до 32кб. И потом не восстанавливается. Особенность модели

модельный ряд опоздал на два года. впринципе все что умное и актуальное написали выше, это и ornith и gsq rco, и qwen 3.6 a3b.

конкретно для фронтенда должен быть хорош ornith.

докуп ещё одной карты не обязателен, 16гб вполне хватит что бы гонять что то умное. расширившись на 32гб например, ты останешься на том же плотном квене 3.8, просто возьмёшь квант повыше и закинешь больше контекста, какого то прорыва не будет. следующий апдейт это флеш некст, но туда надо 64гб озу и 24гб врам. и нграмы на ссд.

бюджетно 16гю врам это наиболее эффективная точка из соотношения затрат качества

Да, я тоже считаю, что на 16 ГБ VRAM можно собрать рабочий стек.

Основное, что “жмёт” сейчас, - это ограничение в 32K контекста. Но тут можно разделить роли: для анализа проекта и навигации по кодовой базе взять более легковесную модель-“архитектора”, а проверенный Qwen использовать только для кодинга.

А апгрейд до 32 ГБ привлекает не столько новыми весами, сколько возможностью уйти от жестких IQ3-квантов в сторону нормальных Q4/Q5 и добавить контекста до рабочего уровня.

За наводку на ornith спасибо - по описанию это интересная модель, и Ornith-1.5-9B-Q8_0.gguf хорошо помещается в память. А вот будет ли 9B давать такое же качество кода, как 30B, ответит только следующая серия тестов 🙂

Теперь под Qwen3-Coder-30B я планирую и дальнейший апгрейд

Спасибо! Было бы интересно почитать про опыт с двумя видеокартами

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации