Обновить
3
Konstantin@ontop

SEO lead, руководитель

Отправить сообщение

Будет время тоже напишу статью на эту тему. Благо материала у меня достаточно.

Ставил цель именно выбор самой бюджетной сборки на PC, для успешного локального запуска Qwen 3.6 27b

В моем случае получился лидер Qwen3.6 27b Fable 4_k_s. Запуск в 16 GB RDNA4 Radeon 9070, кеш 8_0 + turbo4 (whd). Контекст 256k. Скорость работы в целом около 30t/s на заполненом на 100.000 контексте.

Планирую прикупить 7900 xt или 7900xtx - 20GB, проверить другие кванты. Это дешевле, чем брать Nvidia.

Сегодня протестировал Qwen 3.8 27B, пока по впечатлениям медленнее прошлой версии в 2 раза по результатам мышления.

Обещали 14 августа в 18:00 по Минску.

Gemini Flash 3.7 забыл :)

Snapcompact (оно же размещение контекста в картинке) работает локально, без вызовов LLM и может хранить информацию не хуже текста, а для моделей даже лучше, нет такого объема токенов. Точность текста при сжатии 100%.

Я бы вам не советовал на полном серьезе консультироваться с нейросетями в проектах, где от этого зависят дальнейшее масштабирование и развитие

Маленький лайв хак:

Claude кодирует изображения на основе их разрешения (размера в пикселях), а не содержимого.

  • Фиксированная цена: Каждые 750 пикселей стороны картинки превращаются примерно в ~1600 токенов (базовый расчет Anthropic).

  • Когда это выгодно: Если у вас есть огромная таблица, простыня кода на 20 000 токенов. Скриншот этого объема в хорошем разрешении (например, 1080p) может занять всего ~1500 - 3000 токенов.

  • Результат: Вы экономите до 80-90% контекстного окна и снижаете стоимость запроса.

То есть текст можно перевести в картинку и отправить Claude и получить экономию на контекст. Я это из коробки использую на omp harness агенте для сжатия контекста.

Насколько знаю 3.5 версия тоже вышла вначале в варианте 397B, потом уже вышли адаптированные версии. Ждём :) 27B, 35B.

В моем случае Kimi 2.6 прекрасно себя показала 4 месяца назад как альтернатива GPT5.4.

Брал на Opencode. Самая нормальная подписка. Потом эта модель появилась бесплатно на Windsufr, который сегодня стал Devin и с нормальным ускорением. То есть на Devin генерация Kimi был очень быстрой, даже там где последний много думал, что на самом деле хорошо.

Потом благополучно был заменён на GLM5.2, который тоже пока бесплатен на Devin. Но Grok4.5 на Cursor мне нравится больше, но благо обе модели хорошие исполнители, когда GPT5.6 Sol пишет подробные планы, но Grok еще и картинки понимает.

DeepSeekV4 PRO не плохая была, когда вышел Kimi2.6, но обе хуже GLM5.2. Знакомый разработчик говорит, что DeepSeek был замечен в сливах информации, потому компании его избегают как огня и других китайских моделей.

Антропики любят банить аккаунты, просто так (по информации блогеров и моей практики.
Не так зашел (забыл включить VPN), не так оплатил, больше одного аккаунта нельзя. Оплатил с не той карты... Засветил hermes и другие harness... Но, но!
В моем случае использую omp и аккаунт забанили без указания причин, как полагаю так как у меня было 2 аккаунта с идентичными Имя, Фамилия в данных. Кстати забанили, сразу, когда оплатил по своей карте, а когда через Apple pay оплачивал, не банили 3 месяца.
Но если ты на свободном рыке не уважаешь своих клиентов, клиенты тебя тоже любить не будут. Считаю если банят, больше не захожу на сервис, пока сами не разбанят аккаунт. Апелляцию написал, на этом все. Не нужны деньги, ок. Я найду им более успешное применение.
Cursor тоже есть Opus4.8 (который нужен только иногда для планов). Сейчас Grok 4.5 использую, вроде все устраивает.

На Plus все так, только показывает недельный лимит, на фоне этого решил прикупить Pro :)

Вот только не знаю, есть ли смысл или за 60$, Grok 4.5 на Cursor будет лучше?

Касаемо сброса лимитов, в аккаунте показывает, что накопилось уже 3 сброса лимита. Интересует это касается недельного и работает и на PRO тоже?

Подписки от z, как были #ермо, так и остались. Купил ранее за 20$, запустил 2 раза, 2 раза словил какие-то непонятные лимиты на количество запросов и закрыл больше не заходил. Использую GLM5.2 бесплатно через devin уже около месяца.

harness - понимают как систему-агента, которая отвечает за управление контекстом, запуск инструментов, планирование и автономное выполнение задач.

Оно кривое и в кодинге и в повседневных задачах.

Hermes это alpha проект с кучей багов и большой рекламной кампанией.

Есть harness более высокого уровня это Oh My Pi. Рекомендую попробовать, это другой уровень.

Разница во многих аспектах, но самый главный потребление токенов в 2-3 раза ниже чем у Hermes.

Пойду запущу Qwen 3.6 27B Q4_K_S на одной видеокарте 9070 16GB на домашнем компьютере на 30t/s, на 256k контекста...

И можно ещё на 80t/s запустить Qwen3.6 35B Apex-compact на 256k.

Вот мужики удивятся то!

Эх время то сейчас совсем другое, раньше лет так 20 назад, помню мужики железо крутили и бухали по гаражам, а сегодня железо крутят и модели запускают :)

Вроде было :) так в телеге есть голосовой.

Hermes agent стоит на постоянку. А вот desktop приложение запустил, посмотрел на 3Д человечков, удалил.

Это что?

Я использую MoE, с Imatrix знаком, использую Apex варианты квантования с imatrix.
Как понял MoE лучше дружит с imatrix, а вот 27B плохо квантуется с imatrix.

Тоже читал что bartowski и mudler делают лучшие кванты, на hugging

Интересует насколько Moe хуже?

Еще интересно почему ниже чем 6 bit лучше не запускать, насколько качество падает?

Используйте CUDA 13.3, а не 13.2 или 12.

Если интересно то можете подписывать в телеге на наш маленький чатик в котором мы обсуждаем такие темы - homelabru

Полписался бы, но у меня RDNA4.

Тоже использую llama, но 27b выдает у меня не более 40t/s.

На 35b выдает 100-110t/s.

Увеличил траты в 10-20 раз, производительность увеличил в 2 раза, нет необходимости быть у компьютера весь день, через Telegram можно все решать.
А так если в лоб использовать hermes на дорогой подписке с оплатой за токены, можно легко за 200-400$ улететь.
Но можно сказать я этого не почувствовал в тратах, так как hermes с моделью подороже выступает как оркестратор других более дешевых моделей через субагентов. То сеть основные модели такие как ChatGPT5.4, Gemini3.5Flash-High занимаются планированием, а исполнители (с проверкой дорогими моделями) идут уже DeepSeek4Pro, DeepSeek4Flash, Kimi2.6, GLM5.1, Gemini3pro3.1 (CLI) которые дешевле. Получается общий итог не хуже, расходы по лимитам кратно возросли, но траты на подписки остались в пределах 80$.

Примерно такая сумма у меня была раньше Copilot 39$ + ChatGPT 20$ + Claude 20$.

Была подписка 2 месяца. За 39$ предлагали 1500 лимитов запросов в день. Это получалось где-то по 70 запросов в день, без выходных. Если пользоваться VS Code мне в целом хватает, но перешёл на hermes agent. Тот стабильно в день делал 300-400 легко. Тут уже тарифа на хватает. Отметил подписку. Раньше мне этого хватало, сегодня этого мало, ещё и цены они поднимают.

1
23 ...

Информация

В рейтинге
Не участвует
Откуда
Минск, Минская обл., Беларусь
Дата рождения
Зарегистрирован
Активность

Специализация

SEO-специалист, Контекстолог
Ведущий