Комментарии 20
5090 + ninfer + qwen 3.8 nvfp4 dflash2 - и ваши метрики в локальном использовании улучшатся в разы (часто помогает еще использование чат темплейта Qwen-Fixed-Chat-Templates)
На вашем железе надо было уже пробовать qwen 3.8 flash next, а не 27b.
локальные модели особенно интересны там, где можно обменять время на деньги
Ровно до того момента пока вашу подписку на тот же Клод не забанят,
В наше время полагаться на то что облака будут работать всегда, крайне не дальновидная я считаю позиция.
Опасения у вас конкретно про РФ или вообще про весь мир?
Меня тоже порой захватывает паранойя, что такую чудесную штуку, как Claude, могут однажды отобрать))
Все что за пределами страны разработчика, имеет не нулевой шанс в один прекрасный момент превратиться в тыкву, это не обязательно будет именно Клод, относится к любому провайдеру моделей, а в РФ это уже происходит, и тут надо быть совсем уж не далеким что бы все яйца класть в одну корзину
Тут, наверное, зависит от того, о каком сценарии говорим.
Если строить критичный production условного крупного финтеха так, что без Claude он встанет, — тут полностью согласен, это довольно странная архитектурная зависимость и все яйца в одну корзину класть явно не стоит.
Но для обычного пользователя я бы пока сильно себя не накручивал. Отключили Claude — пошёл в Codex. Отключили Codex — посмотрел на китайских товарищей. Если однажды закроют вообще всё облачное, к тому моменту, глядишь, каждый дома уже будет гонять своего Qwen))
В конце концов, теоретически можно дойти и до аргумента, что однажды нам каким-то образом перекроют доступ даже к мировому open source. Ненулевой шанс можно найти почти у любого сценария.
А пока это всё-таки бизнес: модели стоят огромных денег, и их надо кому-то продавать. Поэтому лично я скорее за то, чтобы решать такие проблемы по мере их появления, а не заранее отказываться от самого удобного инструмента из-за возможности, что когда-нибудь его могут отобрать.
Спасибо за статью, интересное расследование. Qwen становится всё лучше, когда выйдет версия 4.0 на основе 3.8 flash next - будет вобще пушка
Да, Qwen 3.8 очень хорош, визуальные задачи (на нашем домене) решает с 100% точностью. Причем именно на 8 кванте (по сравнению с 4) разница очень существенная. Так что да, время локальных моделей для production уже наступило.
Похоже на правду: Q8 почти не отличается от исходной модели, а Q4 расходится с ней в паре процентов токенов. На задачах с одним правильным ответом, вроде визуальных, это может быть заметно. У меня в примере Q6 и Q8 для 27B вердикт не меняли. Какой у вас Q4 и в какой точности энкодер картинок? И на скольких примерах эти 100%?


Может ли локальная 27B-модель расследовать продакшен-инцидент как Claude? Две RTX 5090, около 40 прогонов и одна гонка