Информация
- В рейтинге
- 939-й
- Откуда
- Казань, Татарстан, Россия
- Дата рождения
- Зарегистрирован
- Активность
Специализация
Веб-разработчик, HTML-верстальщик
Ведущий
От 250 ₽
JavaScript
Node.js
SCSS
Адаптивная верстка
HTML
CSS
React
Веб-разработка
WordPress
Opencart
Да, я тоже считаю, что на 16 ГБ VRAM можно собрать рабочий стек.
Основное, что “жмёт” сейчас, - это ограничение в 32K контекста. Но тут можно разделить роли: для анализа проекта и навигации по кодовой базе взять более легковесную модель-“архитектора”, а проверенный Qwen использовать только для кодинга.
А апгрейд до 32 ГБ привлекает не столько новыми весами, сколько возможностью уйти от жестких IQ3-квантов в сторону нормальных Q4/Q5 и добавить контекста до рабочего уровня.
За наводку на ornith спасибо - по описанию это интересная модель, и Ornith-1.5-9B-Q8_0.gguf хорошо помещается в память. А вот будет ли 9B давать такое же качество кода, как 30B, ответит только следующая серия тестов 🙂
Спасибо за содержательный комментарий - одна из целей статьи как раз была в том, чтобы получить такие отклики.
Я, видимо, из-за инерции мышления не рассматривал для кодинга модели семейства Qwen без слова «coder» в названии. Поэтому Qwen3.8-27B, которая у меня уже есть, использовал только для общих задач.
Кстати, в текстовых тестах она показывает очень хорошо. Например, лучше всех из моих моделей на 20–30B объяснила смысл пословицы “Лес рубят - щепки летят”. Не каждый человек этот тест проходит 🙂
Но вернёмся к кодингу. У меня Qwen3.8-27B-IQ3_XS показывает:
при 32K - 22,6 токена/с и около 1,8 ГБ свободной VRAM;
при 64K - 17,8 токена/с и всего 506 МБ свободной VRAM.
То есть на 64K она запускается и работает, но запас уже совсем небольшой. Любая дополнительная нагрузка на GPU - может всё испортить.
Для сравнения: Qwen3-Coder-30B-A3B-Instruct-UD-IQ3_XXS в моём тесте выдавала 42,32 токена/с - почти вдвое больше.
На скорую руку протестировал Qwen3.8 на задаче средней сложности: создание Gutenberg-блока из HTML, регистрация изображений, перенос данных и публикация на сайте.
Итог: по качеству кода результат идентичный, а по времени:
Qwen3-Coder-30B-A3B - около минуты;
Qwen3.8-27B - около четырёх минут.
Так что вариант с 27B рабочий, но для потоковой рутины 4 минуты против одной - это ощутимая разница.
За наводку на pi coding agent и сабреддит отдельное спасибо. Есть что проверять.
Да, Gemma 4 26B A4B у меня есть, Qwen3.8-27B тоже, но гоняю их в основном на общих текстовых задачах, а не в агентском кодинге.
А вот Ornith-1.5-9B пока не пробовал, возьму на заметку.
На 16 ГБ качество уже вполне рабочее, хотя небольшую утилиту бесплатный веб-DeepSeek, скорее всего, напишет лучше.
Мне локальные модели нравятся именно в роли рабочих лошадок: агент читает проект, сам правит файлы, делает несколько заходов - а я не считаю токены и не слежу за лимитами. Не обязательно умнее облака, зато всегда под рукой и стабильно тащит рутину.
А поделитесь конкретными кандидатами? Ограничения остаются прежними: 16 ГБ VRAM, рабочий контекст от 32K, стабильная работа с инструментами агента, включая запись файлов, и вменяемый русский язык.
Если есть свежие модели, которые проходят весь этот сценарий лучше и стабильнее - с удовольствием прогоню их через те же тесты.
Если агент работает полностью на локальной модели - нет. Только косвенно: в виде счёта за электричество 🙂