Обновить
8K+
5
Владислав Лебедкин@lebedkin_lab

Пользователь

7
Рейтинг
Отправить сообщение

Да, я тоже считаю, что на 16 ГБ VRAM можно собрать рабочий стек.

Основное, что “жмёт” сейчас, - это ограничение в 32K контекста. Но тут можно разделить роли: для анализа проекта и навигации по кодовой базе взять более легковесную модель-“архитектора”, а проверенный Qwen использовать только для кодинга.

А апгрейд до 32 ГБ привлекает не столько новыми весами, сколько возможностью уйти от жестких IQ3-квантов в сторону нормальных Q4/Q5 и добавить контекста до рабочего уровня.

За наводку на ornith спасибо - по описанию это интересная модель, и Ornith-1.5-9B-Q8_0.gguf хорошо помещается в память. А вот будет ли 9B давать такое же качество кода, как 30B, ответит только следующая серия тестов 🙂

Спасибо за содержательный комментарий - одна из целей статьи как раз была в том, чтобы получить такие отклики.

Я, видимо, из-за инерции мышления не рассматривал для кодинга модели семейства Qwen без слова «coder» в названии. Поэтому Qwen3.8-27B, которая у меня уже есть, использовал только для общих задач.

Кстати, в текстовых тестах она показывает очень хорошо. Например, лучше всех из моих моделей на 20–30B объяснила смысл пословицы “Лес рубят - щепки летят”. Не каждый человек этот тест проходит 🙂

Но вернёмся к кодингу. У меня Qwen3.8-27B-IQ3_XS показывает:

  • при 32K - 22,6 токена/с и около 1,8 ГБ свободной VRAM;

  • при 64K - 17,8 токена/с и всего 506 МБ свободной VRAM.

То есть на 64K она запускается и работает, но запас уже совсем небольшой. Любая дополнительная нагрузка на GPU - может всё испортить.

Для сравнения: Qwen3-Coder-30B-A3B-Instruct-UD-IQ3_XXS в моём тесте выдавала 42,32 токена/с - почти вдвое больше.

На скорую руку протестировал Qwen3.8 на задаче средней сложности: создание Gutenberg-блока из HTML, регистрация изображений, перенос данных и публикация на сайте.

Итог: по качеству кода результат идентичный, а по времени:

  • Qwen3-Coder-30B-A3B - около минуты;

  • Qwen3.8-27B - около четырёх минут.

Так что вариант с 27B рабочий, но для потоковой рутины 4 минуты против одной - это ощутимая разница.

За наводку на pi coding agent и сабреддит отдельное спасибо. Есть что проверять.

Да, Gemma 4 26B A4B у меня есть, Qwen3.8-27B тоже, но гоняю их в основном на общих текстовых задачах, а не в агентском кодинге.

А вот Ornith-1.5-9B пока не пробовал, возьму на заметку.

На 16 ГБ качество уже вполне рабочее, хотя небольшую утилиту бесплатный веб-DeepSeek, скорее всего, напишет лучше.

Мне локальные модели нравятся именно в роли рабочих лошадок: агент читает проект, сам правит файлы, делает несколько заходов - а я не считаю токены и не слежу за лимитами. Не обязательно умнее облака, зато всегда под рукой и стабильно тащит рутину.

А поделитесь конкретными кандидатами? Ограничения остаются прежними: 16 ГБ VRAM, рабочий контекст от 32K, стабильная работа с инструментами агента, включая запись файлов, и вменяемый русский язык.

Если есть свежие модели, которые проходят весь этот сценарий лучше и стабильнее - с удовольствием прогоню их через те же тесты.

Если агент работает полностью на локальной модели - нет. Только косвенно: в виде счёта за электричество 🙂

Информация

В рейтинге
939-й
Откуда
Казань, Татарстан, Россия
Дата рождения
Зарегистрирован
Активность

Специализация

Веб-разработчик, HTML-верстальщик
Ведущий
От 250 ₽
JavaScript
Node.js
SCSS
Адаптивная верстка
HTML
CSS
React
Веб-разработка
WordPress
Opencart