Pull to refresh

Comments 49

Всегда возникает вопрос. Почему у некоторых ии разработчиков такие плохие видюхи. Если студент - вопросов нет.

Попробуй может что полегче в сегменте Moe когда будет время. Может ZAYA1-8B. И модели заточенные на рекурсию возможно Nanbeige4.2-3B.

Неалохая идея но тогда придеться внедрять в их cpp файлы архитектуру

Честно говоря, я уже попробовал nanbeige, там эффективно только на их настройках, грубо говоря, это просто познавательная штука. Zaya1-8b ещё не смотрел. Грубо говоря вся эта трабла с рекурсией зависит от модели, можно получить полезные результаты, а можно просто расширить своё понимание этого процесса.

Какую вы ветку использовали? Какую модель? В README указаны поддерживающиеся архитектуры.

Запятые теперь норм, но грамматика всё еще не ахти..

Спасибо что прислушались к моему комментарию в прошлой статье (про запятые и т.д.) Данная статья выглядит куда более серьезной и взрослой. Желаю вам успехов!

Да, огромное спасибо вам за совет!

Про открытые модели лучше всего ничего не спрашивать ни у каких LLM, ни у GPT, ни у Claude, ни у Gemini - в мире открытых моделей все меняется очень быстро, а у LLM во-первых минимум на пол года устаревшие данные, а во-вторых это похоже на какой-то сговор, все эти платные модели советуют устаревшее барахло. Лучше самому искать инфу, здесь основное обсуждение открытых моделей: https://www.reddit.com/r/LocalLLaMA/, ну и конечно https://huggingface.co/models, но там их море и легко потеряться. Самые скачиваемые часто бывают кривым барахлом, качают их из-за того, что в названии есть какой-нибудь Opus/Fable.

Qwen 32B-A3B: самая большая модель

Qwen 32B-A3B не существует. Обычно после названия пишут номер версии, а потом могут быть параметры, ну и 32B-A3B означает, что это MoE модель у которой 32B параметров всего и 3B параметров активных. У Qwen таких моделей не было вообще. Была dense модель Qwen3 32B и были MoE модели Qwen3 30B-A3B, Qwen 3.5 35B-A3B и Qwen 3.6 35B-A3B. Судя по рисунку после заголовка, у вас была Qwen 3.5 35B-A3B, но не оригинальная, а abliterated. Qwen3 вышли год-полтора назад и уже устарели, Qwen 3.6 самая современная, различные abliterated версии обычно хуже оригинальных.

Qwen 2.5 7B Coder Instruct

Многие читатели просили протестировать именно эту модель

Интересно, 2 года назад просили? :) Модель вышла в 2024 году, сейчас ее использовать смысла нет вообще.

Mistral 7B тоже древняя.

Под 6Гб видеопамяти, для кодинга вам можно попробовать либо Qwen 3.5 9B - 4-х битная по-идее должна влезть целиком, либо ее файнтюн Ornith-1.0, сам не пробовал, но судя по бенчмаркам, она хорошо от оригинала ушла: https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B-GGUF

Насчет Qwen2.5, я проводил опрос на гугл форме и тогда многие люди голосовали менно за Mistral+Qwen2.5+ Qwen3.5 35b-A3B
Насчет Qwen 3.5 9b я ее пробовал изза ее особеностей архитектуры запуск был медленее чем сейчас 35b запуск

Это не сговор, а статистика: модель тянет то, что чаще мелькало в обучении, а не то, что вышло вчера. Свежак живёт на r/LocalLLaMA и в лидербордах – тут вы правы на сто процентов. Правда, та же модель с включённым веб-поиском выдаёт вполне актуальную картину.

А какая сейчас лучшая локальная модель для программирования для 16-гиговой карты? RTX 4080, если быть точным.

Qwen 2.5 7B Coder неделю назад поставил и плевался, она только с третьего раза отреагировала под что мы пишем код и даже не под питон, а vba стала впаривать. Хотя мне надо питон под api. Сделала мне код, но такой бред можно и быстрее получить в gemini. Осталое уг, соглашусь. Есть варианты кормальных моделей? Я любитель клода.

Попробуйте мой проект он как раз должен решить проблему особенно если у вас более 4 гб

Про него как раз статья

Проект интернесный. В плане приближения разработки на локальных LLM.
Но, есть пара вопросов будет ли работать в MTP режиме с Qwen моделями ?
И понимаю, есть репа - изуйчайте, но в описании не увидел собсвенно какой механизм под капотом ?
Типа, да - что это дает, но не как это реализовано, или это коммерческая тайна ) ?
На первый взгляд, как будто бы если это сделать на уровне лангчейна - типа сделать описание главных "составляющих" кода и по шагово их доработать.
Понятно, что если с разу на уровне движка сделано - это меньше заморочек потом.

С малыми моделями - до 24b была проблема написания башскрипта, в целом не сложного ( 70 строк ), пришлось применять облачную.
А как у вас с написанием bash скриптов ?
( Я про то, что вот как будто, у малых моделей натыкаюсь на концептуальные ограничения в стилистике кода, хотя это можно решать через MCP )

Гоняю в свободное время qwen3.6-35b-a3b

На машине

i7 14700k

32 ram

RTX 5060ti infinity oc 16g

Через llama.cpp cuda добивался при контексте до 100к 50+ т/с

Контекстное окно на 1 поток 200к, при увеличении контекста ближе к 200к до 30т/с

Если интересно os Manjaro kde.

Насчет MTP в ветке patch-speedup которая являеться основной уже реализовано token prediction это дает сиьный буст а насчет MTP да будет работать ведь движок имеет ВСЕ функции оригинального llama.cpp кроме поддержки некоторый ахитектур.

Я думаю если в этот пк добавить майнинговую карту типа p104-100 за 1000 руб все будет работать в разы быстрее.

Это ноутбук. И я уже добился скорости с 2 ток в сек до 11 ток в сек с увелечением качесвта относительно базовой модели.

Если в ноуте есть свободный M.2, то туда можно воткнуть riser card или oculink переходник и подключить внешнюю видеокарту. Но это просто к сведению, а совсем не руководство к действию - вдруг в будущем пригодится информация.

Да знаю но для этого нужно eGPU стойка + бп для видеокарты

Не будет. Pascal как архитектура плохо заточена под нейронки.

Лучше использовать MI50 16gb они намного лучше для ИИ инференса и стоят по 9900 за шт.

Сами пробовали? Как с совместимостью с ПО от NVIDIA? Последние модели (этого года) смогли запустить на этом железе?

Совместимости с ПО от Nvidia на картах AMD нету для MI50 требуеться специальная ROCm сборка или установка Vulkan

Сильно ошибаетесь. К примеру, Tesla P40 с 24 ГБ врам работает в разы медленнее, чем 3050 ртх и тем более чем 3060 ти.

Версия cuda compute решает. Какая-нибудь 8.6 сильно, неимовеерно хуже 9.х.

Кроме того, старые архитектуры втдях могут быть не совместимы с новыми архитектура и llm. Qwen3 очень вероятно будет требовать модули cuda, которые реализованы только для rtx 3xxx и новее.

Скиньте ссылку, где tesla 24gb работает медленнее, чем 3050. Я не видел таких llm

Она не может физически работать лучше из за отсутствия тензорных ядер

Не совсем понятно. Можно запускать любую модель на этом форке или для запуска её надо как-то дорабатывать?

нет не любую только
Qwen2.5
Qwen3.5/3.6

Mistral v0.1 v0.2
Llama 3.1

Остальные архитектуры еще не поддерживаються но да форк запускает ЛЮБУЮ модель из этих архитектур

UPD: За это время были добавлены еще Gemma 2, Mistral 7B v0.3 и Mixtral 8x22B. Полный список можно посомтреть на репозитории проекта в ветке patch-speedup.

Попробовал несколько моделей. Ни одна не запустилась. Падают на assert при запуске. На гитхабе не включены issues, поэтому не могу туда отписаться

Извините сейчас исправлюсь

Я включил Issues вы можете отправить Issue и я смогу попробовать помочь вам!

На каком языке там писать?

Желательно английский.

Возможно вы используете не ту ветку порбуйте ту которую я указал в конце статьи это ускоренная ветка

Пробовал ветку `master`. Вроде разобрался, оказывается дело в параметрах запуска `–cache-type-k q8_0 --cache-type-v q8_0`. Без них запускается. А ветка `patch-speedup` даже не компилируется.

Пока не понял, стала ли модель умнее с `RECURRENT_D=12`

А ты на ноутбучной 3050 запустил 30B модель? И получил 11т/с? Если да, то звучит вообще интересно

Нет я получил 10 ток в секунду и запускал 35b модель но весь секрет в том что это MoE и реальных параметров в рантайме - 3b

Недавно смотрел видео, описывающее ещё один форк llama.cpp, где описывается, что удалось улучшить по сравнению с оригиналом с помощью Fable 5. Может будет интересно на youtube, репа на github

Здравствуйте, тоже смотрел это видео!

Можете попробовать Gemma 4 26B (Версию APEX I-Compact от mudler). У меня в LM Studio, на ноутбучной RTX 3050 4Гб, выходит на 10-12 т/сек при контексте в 100к.

Интересная идея, кстати. А почему кв кеш пишется на первой итерации а не на последней? Теоретически это следующим слоям будет давать более "качественные" значения же?

Интерестная идея я об этом не задумывался надо будет проверить насколько получиться увеличить качество

Дружище!

Ты делаешь классную штуку!

Читаю уже второй твой пост.

Молодец, что продолжаешь!

Если решился копать всерьез, то советую пощупать Bonsai-27B-1q-gguff.

Это тот же qwen, но аппаратно переученный на тернарные веса. 

В твоем кейсе - это буст и аппаратный, и интеллектуальный. Модель Бонсай 1q дает то же качество что и q4 (на самом деле около 92%), но при этом в 4 раза компактнее и в 10 раз быстрее в инференсе. И твой форк для llama возможно сможет сравнять её в качестве по сути к q8.

Вау спасибо очень интерестная вещь попробую ее только надо будет ее архитектуру добавить в форк

Sign up to leave a comment.

Articles