Обновить
3

Пользователь

Отправить сообщение

И тут на сцену врывается локальный заквантованный донельзя Qwen 3.8 27b с квантованным же кэшем.

На авито продают, 35к примерно. Отличный вариант как по мне.

Прилично прокачалась в инфографике и управлении общими тулами и дебаг-тулами. Я слегка удивился, когда она начала сама двигать курсор в браузере и кликать мышой по кнопкам О_О.

Как уже отметили выше, на xhigh часто заходит в петли рассуждения на коротком контексте (70к не хватает, она думает до компактирования, а после - начинает заново размышлять и детализировать).

из забавного: первый раз увидел текстовыделитель при размышлениях (возможно это какая-то фича нового опенкод):



По детализации уделывает DS v4 flash.



Тестил в Q4_K_M на 3090, сейчас буду спускаться до Q4_0 так как очевидно нужен контекст 100+

Вопрос к экспертам, так как не увидел прямого ответа в комментариях выше. Если уже есть 3090, можно ли докупить к ней 3060ti на 12gb так как очень часто для 30б моделей не зватает совсем чуть-чуть, памяти, чтобы дотянуться до адекватных квантов и контекста около 40 тыс? или это провал и надо целиться во вторую 3090?

Сам себе отвечу:
https://www.reddit.com/r/LocalLLaMA/comments/1kgs1z7/309030603060_llamacpp_benchmarks_tips/

2 вопроса из контента статьи:

1. Вы пишите, что MiMo гораздо меньше Qwen3 235B, но в ее документации указано, что она имеет 309B параметров, упакованных в MoE структуру по 15B на одного эксперта. Мы говорим о разных моделях?

2. Gemini 2.5 Flash.

Пока мы писали эту статью и восхищались скоростью Xiaomi (11 секунд), Google выкатил превью Gemini 2.5 Flash"

Мы точно о 2.5 Flash говорим? Я ей уже около полугода пользуюсь, как превьюшками, так и финальной.

Наверное, я что-то упустил или не понял, заранее извиняюсь за душноту, просто интересно стало.

Спасибо за идею с альтернативными моделями! Тоже делаю себе такое, но как мобильное приложение на телефон, осталось прикрутить разделение на спикеров.

На пк делал как в комментарии выше через v3 turbo и pyannote - работает очень хорошо.

Во всех этих историях мне пока совершенно не понятно, как поселить такого слушателя во встрече в teams, в условиях перехода на on prem

Пока из того, что работает более менее стабильно это последние мистрали на 24b параметров и qwen3-30b-a3b-instruct\thinking. Но специально на эту задачу я не тестировал широкий спектр моделей.

Спасибо за обзорную статью. Как на практике применять скиллы при использовании cline/kilo агентов с курсор, например. Был у кого опыт?

Круто, что получился очень даже живой сервис при таком железе.

У меня чуть больше возможностей по железу, так что такую историю я тестил на 24b-30b моделях, которые весьма неплохо справляются с задачей. Лучше всего у них получается работать с mermaid библиотекой, особенно если в системный промпт добавлять валидный пример кода.

Передовые облачные могут с ходу выдать корректный код bpmn, а если их правильно запромтить, то легко переделывают базовый bpmn в проприетарный, например формат business studio. Но тогда теряется конфиденциальность. Жду новое поколение 20-30b нейронок, они уже очень близки к качественному выполнению задачи.

https://habr.com/ru/articles/953320/

Советую использовать модель turbo v3 вместо large.

Я все хочу закинуть свою версию на гит или веткой к ребятам или отдельно, но времени нет. Отладил под cuda только только на днях

Как раз недавно себе пилил такую систему но полностью локальную на whisperx и наработках из другого поста хабра. Работает весьма-весьма.

Зацикливание кстати очень часто происходит, даже далеко от границы достижения макс токенов

Зависит от оболочки для запуска и установленного макс контекста.

Open webui с ollama есть гораздо больше памяти, лм студии меньше, но в любом случае, максимальный контекст даже для лм студии не больше 40-50 токенов для 12б 4км модели. Больший контекст не влазит в 24 гб памяти и после этого происходит значительный дроп производительности.

и gpu? И какое время инференса на обеих моделях?

Попробовал 12б 6км - 40 токенов и есть ещё запас по памяти, думаю 8 бит потянет. Но ничем выдающимся не отличается, только поддержка русского на высоте.

27b 4_k_m на 3090 "летит" со скоростью 2,5 токена в сек. То есть неюзабельно.

Согласен, это весомые риски. Держим в голове обязательно 👍

1

Информация

В рейтинге
5 779-й
Зарегистрирован
Активность