Обновить

Может ли локальная 27B-модель расследовать продакшен-инцидент как Claude? Две RTX 5090, около 40 прогонов и одна гонка

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.5K
Всего голосов 9: ↑8 и ↓1+8
Комментарии20

Комментарии 20

5090 + ninfer + qwen 3.8 nvfp4 dflash2 - и ваши метрики в локальном использовании улучшатся в разы (часто помогает еще использование чат темплейта Qwen-Fixed-Chat-Templates)

Спасибо! Нужно будет проверить)

На вашем железе надо было уже пробовать qwen 3.8 flash next, а не 27b.

Сегодня уже почти на любом железе можно через Strata.

Да, но на его железяках можно взять нормальный квант и полный контекст

Спасибо, интересный проект

Похоже, напрашивается новый эксперимент)
возможно даже получится запустить UD-Q4_K_XL

Ждем)

Результат можно будет экстраполировать на новый M5 Ultra 256 Gb

flash next UD-Q4_K_XL очень неплохо запустилась и порядка 180 ток/с

Не томи)

Что с расследованием?

локальные модели особенно интересны там, где можно обменять время на деньги

Ровно до того момента пока вашу подписку на тот же Клод не забанят,
В наше время полагаться на то что облака будут работать всегда, крайне не дальновидная я считаю позиция.

Опасения у вас конкретно про РФ или вообще про весь мир?
Меня тоже порой захватывает паранойя, что такую чудесную штуку, как Claude, могут однажды отобрать))

Все что за пределами страны разработчика, имеет не нулевой шанс в один прекрасный момент превратиться в тыкву, это не обязательно будет именно Клод, относится к любому провайдеру моделей, а в РФ это уже происходит, и тут надо быть совсем уж не далеким что бы все яйца класть в одну корзину

Тут, наверное, зависит от того, о каком сценарии говорим.

Если строить критичный production условного крупного финтеха так, что без Claude он встанет, — тут полностью согласен, это довольно странная архитектурная зависимость и все яйца в одну корзину класть явно не стоит.

Но для обычного пользователя я бы пока сильно себя не накручивал. Отключили Claude — пошёл в Codex. Отключили Codex — посмотрел на китайских товарищей. Если однажды закроют вообще всё облачное, к тому моменту, глядишь, каждый дома уже будет гонять своего Qwen))

В конце концов, теоретически можно дойти и до аргумента, что однажды нам каким-то образом перекроют доступ даже к мировому open source. Ненулевой шанс можно найти почти у любого сценария.

А пока это всё-таки бизнес: модели стоят огромных денег, и их надо кому-то продавать. Поэтому лично я скорее за то, чтобы решать такие проблемы по мере их появления, а не заранее отказываться от самого удобного инструмента из-за возможности, что когда-нибудь его могут отобрать.

Отказываться не нужно, но нужно иметь запасной аэродром, что бы переключение прошло без сюрпризов.

Спасибо за статью, интересное расследование. Qwen становится всё лучше, когда выйдет версия 4.0 на основе 3.8 flash next - будет вобще пушка

3.8 flash next на Strata уже погонял) результаты интересные.

Да, Qwen 3.8 очень хорош, визуальные задачи (на нашем домене) решает с 100% точностью. Причем именно на 8 кванте (по сравнению с 4) разница очень существенная. Так что да, время локальных моделей для production уже наступило.

Похоже на правду: Q8 почти не отличается от исходной модели, а Q4 расходится с ней в паре процентов токенов. На задачах с одним правильным ответом, вроде визуальных, это может быть заметно. У меня в примере Q6 и Q8 для 27B вердикт не меняли. Какой у вас Q4 и в какой точности энкодер картинок? И на скольких примерах эти 100%?

Единственная ошибка Q8 не ошибка, а то что не видела позицию на вырезанном кропе. Остальное все ок (порядка 40 позиций).

Q4_K_M, энкодер не трогали, (mmproj) в F16 во всех конфигурациях.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации