Я запускаю IQ_3S из вашей выборки, которая от Австралийского университета на 250 контекста, на 50t/s. Работает прекрасно, сравнивал с Q4_K_S по интелекту потерь нету. Использую вывод на материнской для монитора, видеокарта получается на 100% свободна по Vram (50 мегабайт это системный драйвер вероятно) .
9070 16gb. Изучая тему квантования, пришел к выводу, что создание модели с квантованием почти без потерь в отношении к FP8, это реальная задача в ближайшие 2-3 года, то есть получить модель на 16 GB = FP8 которая не будет уступать по всем параметрам это реально. Но двигают это интузиасты и различные научные учреждения. Unsloth это стартап студентов. Корпорации не очень заинтересованы в том, чтобы обычные пользователи запускали модели на обычных видеокартах, так как продать видеокарту дороже в 3 раза для них намного выгоднее.
Еще на качество модели очень сильно влияет сжатие контекста, q4/q4 довольно сильно портит перплексию и дивергенцию, потому вы можете повысить качество запуска IQ_3S за счет выбора другого способа сжатия, на обычной llama.cpp есть Q5_1/Q5_1 это лучше в 2 раза чем Q4, при 20% росте. Если на Nvidia есть поддержка можно попробовать turboquant форк llama от atomicbot. turbo4 сжатие как q4, но качество выше.
Пользуюсь Omarchy 3 месяца уже. Доволен. В плане обновлений насколько пониманию, они сделали свою песочницу с паузой в месяц, чтобы взломанные пакеты не попали в систему, так как это случается на arch.
Так в целом хорошая система. При старте 1 гигабайт оперативной занимает.
Минусы, это установка, но в кватро версии пофиксили выбор дисков. Теперь можно сделать разметку диска, перед установкой и не выбирать весь раздел. Щифрование диска LUKS стоит по дефолтуч выключателя нету, для некоторых это тоже возможно минус.
Игры летают. Chromium (от omarchy) синхронизируется с моим профилем. Figma уже вышла под линукс.
Игры летают. Только может Faceit для CS2 нету, но это проблема Faceit.
Могу с уверенностью сказать, все что мне нужно было от компьютера на Windows 11 тут есть в отличном решении.
Установка и обновление быстро и удобно.
Window's удалил. Иногда были моменты, что жалел, а именно когда надо было обновить биос и после у меня перестала загружаться система, snapshots не помогали, а нужно было работать.
Как оказалось дело было в настройка в биосе, которые надо было сбросить. Но нервы потратил и часа 3 времени.
Потом ещё один раз была похожая проблема когда дал llm возможность отредактировать LUKS, раздел.
Понял, лучше диск расшифровать по дефолту и LUKS раздел не трогать совсем, так как если полетит хоть маленький файл в загрузке, дальше только формат поможет, с чем я и столкнулся.
Очень приятно, что время когда корпорации управляли каждым шагом подходит к концу. Сегодня небольшие компании создают вполне интересные проекты. Omarchy я бы сравнил с ребенком, который делает свои первые шаги и я очень надеюсь у них получится действительно то, к чему они стремятся, так как начало уже очень впечатляет лично меня. Если говорить про юзабилити оно на уровне, как и в целом стиль и простота. Чувствуется, что сам автор пользуется этой системой и создаёт ее для себя, а именно для современного человека который работает с кодом, с дизайном, с инструментами и делает это во множестве окон с большими мониторами.
Будет время тоже напишу статью на эту тему. Благо материала у меня достаточно.
Ставил цель именно выбор самой бюджетной сборки на PC, для успешного локального запуска Qwen 3.6 27b
В моем случае получился лидер Qwen3.6 27b Fable 4_k_s. Запуск в 16 GB RDNA4 Radeon 9070, кеш 8_0 + turbo4 (whd). Контекст 256k. Скорость работы в целом около 30t/s на заполненом на 100.000 контексте.
Планирую прикупить 7900 xt или 7900xtx - 20GB, проверить другие кванты. Это дешевле, чем брать Nvidia.
Сегодня протестировал Qwen 3.8 27B, пока по впечатлениям медленнее прошлой версии в 2 раза по результатам мышления.
Snapcompact (оно же размещение контекста в картинке) работает локально, без вызовов LLM и может хранить информацию не хуже текста, а для моделей даже лучше, нет такого объема токенов. Точность текста при сжатии 100%.
Я бы вам не советовал на полном серьезе консультироваться с нейросетями в проектах, где от этого зависят дальнейшее масштабирование и развитие
Claude кодирует изображения на основе их разрешения (размера в пикселях), а не содержимого.
Фиксированная цена: Каждые 750 пикселей стороны картинки превращаются примерно в ~1600 токенов (базовый расчет Anthropic).
Когда это выгодно: Если у вас есть огромная таблица, простыня кода на 20 000 токенов. Скриншот этого объема в хорошем разрешении (например, 1080p) может занять всего ~1500 - 3000 токенов.
Результат: Вы экономите до 80-90% контекстного окна и снижаете стоимость запроса.
То есть текст можно перевести в картинку и отправить Claude и получить экономию на контекст. Я это из коробки использую на omp harness агенте для сжатия контекста.
В моем случае Kimi 2.6 прекрасно себя показала 4 месяца назад как альтернатива GPT5.4.
Брал на Opencode. Самая нормальная подписка. Потом эта модель появилась бесплатно на Windsufr, который сегодня стал Devin и с нормальным ускорением. То есть на Devin генерация Kimi был очень быстрой, даже там где последний много думал, что на самом деле хорошо.
Потом благополучно был заменён на GLM5.2, который тоже пока бесплатен на Devin. Но Grok4.5 на Cursor мне нравится больше, но благо обе модели хорошие исполнители, когда GPT5.6 Sol пишет подробные планы, но Grok еще и картинки понимает.
DeepSeekV4 PRO не плохая была, когда вышел Kimi2.6, но обе хуже GLM5.2. Знакомый разработчик говорит, что DeepSeek был замечен в сливах информации, потому компании его избегают как огня и других китайских моделей.
Антропики любят банить аккаунты, просто так (по информации блогеров и моей практики. Не так зашел (забыл включить VPN), не так оплатил, больше одного аккаунта нельзя. Оплатил с не той карты... Засветил hermes и другие harness... Но, но! В моем случае использую omp и аккаунт забанили без указания причин, как полагаю так как у меня было 2 аккаунта с идентичными Имя, Фамилия в данных. Кстати забанили, сразу, когда оплатил по своей карте, а когда через Apple pay оплачивал, не банили 3 месяца. Но если ты на свободном рыке не уважаешь своих клиентов, клиенты тебя тоже любить не будут. Считаю если банят, больше не захожу на сервис, пока сами не разбанят аккаунт. Апелляцию написал, на этом все. Не нужны деньги, ок. Я найду им более успешное применение. Cursor тоже есть Opus4.8 (который нужен только иногда для планов). Сейчас Grok 4.5 использую, вроде все устраивает.
Подписки от z, как были #ермо, так и остались. Купил ранее за 20$, запустил 2 раза, 2 раза словил какие-то непонятные лимиты на количество запросов и закрыл больше не заходил. Использую GLM5.2 бесплатно через devin уже около месяца.
Пойду запущу Qwen 3.6 27B Q4_K_S на одной видеокарте 9070 16GB на домашнем компьютере на 30t/s, на 256k контекста...
И можно ещё на 80t/s запустить Qwen3.6 35B Apex-compact на 256k.
Вот мужики удивятся то!
Эх время то сейчас совсем другое, раньше лет так 20 назад, помню мужики железо крутили и бухали по гаражам, а сегодня железо крутят и модели запускают :)
Я использую MoE, с Imatrix знаком, использую Apex варианты квантования с imatrix. Как понял MoE лучше дружит с imatrix, а вот 27B плохо квантуется с imatrix.
Тоже читал что bartowski и mudler делают лучшие кванты, на hugging
Я запускаю IQ_3S из вашей выборки, которая от Австралийского университета на 250 контекста, на 50t/s. Работает прекрасно, сравнивал с Q4_K_S по интелекту потерь нету. Использую вывод на материнской для монитора, видеокарта получается на 100% свободна по Vram (50 мегабайт это системный драйвер вероятно) .
9070 16gb. Изучая тему квантования, пришел к выводу, что создание модели с квантованием почти без потерь в отношении к FP8, это реальная задача в ближайшие 2-3 года, то есть получить модель на 16 GB = FP8 которая не будет уступать по всем параметрам это реально. Но двигают это интузиасты и различные научные учреждения. Unsloth это стартап студентов. Корпорации не очень заинтересованы в том, чтобы обычные пользователи запускали модели на обычных видеокартах, так как продать видеокарту дороже в 3 раза для них намного выгоднее.
Еще на качество модели очень сильно влияет сжатие контекста, q4/q4 довольно сильно портит перплексию и дивергенцию, потому вы можете повысить качество запуска IQ_3S за счет выбора другого способа сжатия, на обычной llama.cpp есть Q5_1/Q5_1 это лучше в 2 раза чем Q4, при 20% росте. Если на Nvidia есть поддержка можно попробовать turboquant форк llama от atomicbot. turbo4 сжатие как q4, но качество выше.
Пользуюсь Omarchy 3 месяца уже. Доволен. В плане обновлений насколько пониманию, они сделали свою песочницу с паузой в месяц, чтобы взломанные пакеты не попали в систему, так как это случается на arch.
Так в целом хорошая система. При старте 1 гигабайт оперативной занимает.
Минусы, это установка, но в кватро версии пофиксили выбор дисков. Теперь можно сделать разметку диска, перед установкой и не выбирать весь раздел. Щифрование диска LUKS стоит по дефолтуч выключателя нету, для некоторых это тоже возможно минус.
Игры летают. Chromium (от omarchy) синхронизируется с моим профилем. Figma уже вышла под линукс.
Игры летают. Только может Faceit для CS2 нету, но это проблема Faceit.
Могу с уверенностью сказать, все что мне нужно было от компьютера на Windows 11 тут есть в отличном решении.
Установка и обновление быстро и удобно.
Window's удалил. Иногда были моменты, что жалел, а именно когда надо было обновить биос и после у меня перестала загружаться система, snapshots не помогали, а нужно было работать.
Как оказалось дело было в настройка в биосе, которые надо было сбросить. Но нервы потратил и часа 3 времени.
Потом ещё один раз была похожая проблема когда дал llm возможность отредактировать LUKS, раздел.
Понял, лучше диск расшифровать по дефолту и LUKS раздел не трогать совсем, так как если полетит хоть маленький файл в загрузке, дальше только формат поможет, с чем я и столкнулся.
Очень приятно, что время когда корпорации управляли каждым шагом подходит к концу. Сегодня небольшие компании создают вполне интересные проекты. Omarchy я бы сравнил с ребенком, который делает свои первые шаги и я очень надеюсь у них получится действительно то, к чему они стремятся, так как начало уже очень впечатляет лично меня. Если говорить про юзабилити оно на уровне, как и в целом стиль и простота. Чувствуется, что сам автор пользуется этой системой и создаёт ее для себя, а именно для современного человека который работает с кодом, с дизайном, с инструментами и делает это во множестве окон с большими мониторами.
Будет время тоже напишу статью на эту тему. Благо материала у меня достаточно.
Ставил цель именно выбор самой бюджетной сборки на PC, для успешного локального запуска Qwen 3.6 27b
В моем случае получился лидер Qwen3.6 27b Fable 4_k_s. Запуск в 16 GB RDNA4 Radeon 9070, кеш 8_0 + turbo4 (whd). Контекст 256k. Скорость работы в целом около 30t/s на заполненом на 100.000 контексте.
Планирую прикупить 7900 xt или 7900xtx - 20GB, проверить другие кванты. Это дешевле, чем брать Nvidia.
Сегодня протестировал Qwen 3.8 27B, пока по впечатлениям медленнее прошлой версии в 2 раза по результатам мышления.
Обещали 14 августа в 18:00 по Минску.
Gemini Flash 3.7 забыл :)
Snapcompact (оно же размещение контекста в картинке) работает локально, без вызовов LLM и может хранить информацию не хуже текста, а для моделей даже лучше, нет такого объема токенов. Точность текста при сжатии 100%.
Я бы вам не советовал на полном серьезе консультироваться с нейросетями в проектах, где от этого зависят дальнейшее масштабирование и развитие
Маленький лайв хак:
Claude кодирует изображения на основе их разрешения (размера в пикселях), а не содержимого.
Фиксированная цена: Каждые 750 пикселей стороны картинки превращаются примерно в ~1600 токенов (базовый расчет Anthropic).
Когда это выгодно: Если у вас есть огромная таблица, простыня кода на 20 000 токенов. Скриншот этого объема в хорошем разрешении (например, 1080p) может занять всего ~1500 - 3000 токенов.
Результат: Вы экономите до 80-90% контекстного окна и снижаете стоимость запроса.
То есть текст можно перевести в картинку и отправить Claude и получить экономию на контекст. Я это из коробки использую на omp harness агенте для сжатия контекста.
Насколько знаю 3.5 версия тоже вышла вначале в варианте 397B, потом уже вышли адаптированные версии. Ждём :) 27B, 35B.
В моем случае Kimi 2.6 прекрасно себя показала 4 месяца назад как альтернатива GPT5.4.
Брал на Opencode. Самая нормальная подписка. Потом эта модель появилась бесплатно на Windsufr, который сегодня стал Devin и с нормальным ускорением. То есть на Devin генерация Kimi был очень быстрой, даже там где последний много думал, что на самом деле хорошо.
Потом благополучно был заменён на GLM5.2, который тоже пока бесплатен на Devin. Но Grok4.5 на Cursor мне нравится больше, но благо обе модели хорошие исполнители, когда GPT5.6 Sol пишет подробные планы, но Grok еще и картинки понимает.
DeepSeekV4 PRO не плохая была, когда вышел Kimi2.6, но обе хуже GLM5.2. Знакомый разработчик говорит, что DeepSeek был замечен в сливах информации, потому компании его избегают как огня и других китайских моделей.
Антропики любят банить аккаунты, просто так (по информации блогеров и моей практики.
Не так зашел (забыл включить VPN), не так оплатил, больше одного аккаунта нельзя. Оплатил с не той карты... Засветил hermes и другие harness... Но, но!
В моем случае использую omp и аккаунт забанили без указания причин, как полагаю так как у меня было 2 аккаунта с идентичными Имя, Фамилия в данных. Кстати забанили, сразу, когда оплатил по своей карте, а когда через Apple pay оплачивал, не банили 3 месяца.
Но если ты на свободном рыке не уважаешь своих клиентов, клиенты тебя тоже любить не будут. Считаю если банят, больше не захожу на сервис, пока сами не разбанят аккаунт. Апелляцию написал, на этом все. Не нужны деньги, ок. Я найду им более успешное применение.
Cursor тоже есть Opus4.8 (который нужен только иногда для планов). Сейчас Grok 4.5 использую, вроде все устраивает.
На Plus все так, только показывает недельный лимит, на фоне этого решил прикупить Pro :)
Вот только не знаю, есть ли смысл или за 60$, Grok 4.5 на Cursor будет лучше?
Касаемо сброса лимитов, в аккаунте показывает, что накопилось уже 3 сброса лимита. Интересует это касается недельного и работает и на PRO тоже?
Подписки от z, как были #ермо, так и остались. Купил ранее за 20$, запустил 2 раза, 2 раза словил какие-то непонятные лимиты на количество запросов и закрыл больше не заходил. Использую GLM5.2 бесплатно через devin уже около месяца.
harness - понимают как систему-агента, которая отвечает за управление контекстом, запуск инструментов, планирование и автономное выполнение задач.
Оно кривое и в кодинге и в повседневных задачах.
Hermes это alpha проект с кучей багов и большой рекламной кампанией.
Есть harness более высокого уровня это Oh My Pi. Рекомендую попробовать, это другой уровень.
Разница во многих аспектах, но самый главный потребление токенов в 2-3 раза ниже чем у Hermes.
Пойду запущу Qwen 3.6 27B Q4_K_S на одной видеокарте 9070 16GB на домашнем компьютере на 30t/s, на 256k контекста...
И можно ещё на 80t/s запустить Qwen3.6 35B Apex-compact на 256k.
Вот мужики удивятся то!
Эх время то сейчас совсем другое, раньше лет так 20 назад, помню мужики железо крутили и бухали по гаражам, а сегодня железо крутят и модели запускают :)
Вроде было :) так в телеге есть голосовой.
Hermes agent стоит на постоянку. А вот desktop приложение запустил, посмотрел на 3Д человечков, удалил.
Это что?
Я использую MoE, с Imatrix знаком, использую Apex варианты квантования с imatrix.
Как понял MoE лучше дружит с imatrix, а вот 27B плохо квантуется с imatrix.
Тоже читал что bartowski и mudler делают лучшие кванты, на hugging
Интересует насколько Moe хуже?
Еще интересно почему ниже чем 6 bit лучше не запускать, насколько качество падает?
Полписался бы, но у меня RDNA4.
Тоже использую llama, но 27b выдает у меня не более 40t/s.
На 35b выдает 100-110t/s.