Comments 49
Всегда возникает вопрос. Почему у некоторых ии разработчиков такие плохие видюхи. Если студент - вопросов нет.
Школьник, а так наверно идеи рождаються из проблем.
Попробуй может что полегче в сегменте Moe когда будет время. Может ZAYA1-8B. И модели заточенные на рекурсию возможно Nanbeige4.2-3B.
Неалохая идея но тогда придеться внедрять в их cpp файлы архитектуру
Честно говоря, я уже попробовал nanbeige, там эффективно только на их настройках, грубо говоря, это просто познавательная штука. Zaya1-8b ещё не смотрел. Грубо говоря вся эта трабла с рекурсией зависит от модели, можно получить полезные результаты, а можно просто расширить своё понимание этого процесса.
Запятые теперь норм, но грамматика всё еще не ахти..
Спасибо что прислушались к моему комментарию в прошлой статье (про запятые и т.д.) Данная статья выглядит куда более серьезной и взрослой. Желаю вам успехов!
Про открытые модели лучше всего ничего не спрашивать ни у каких LLM, ни у GPT, ни у Claude, ни у Gemini - в мире открытых моделей все меняется очень быстро, а у LLM во-первых минимум на пол года устаревшие данные, а во-вторых это похоже на какой-то сговор, все эти платные модели советуют устаревшее барахло. Лучше самому искать инфу, здесь основное обсуждение открытых моделей: https://www.reddit.com/r/LocalLLaMA/, ну и конечно https://huggingface.co/models, но там их море и легко потеряться. Самые скачиваемые часто бывают кривым барахлом, качают их из-за того, что в названии есть какой-нибудь Opus/Fable.
Qwen 32B-A3B: самая большая модель
Qwen 32B-A3B не существует. Обычно после названия пишут номер версии, а потом могут быть параметры, ну и 32B-A3B означает, что это MoE модель у которой 32B параметров всего и 3B параметров активных. У Qwen таких моделей не было вообще. Была dense модель Qwen3 32B и были MoE модели Qwen3 30B-A3B, Qwen 3.5 35B-A3B и Qwen 3.6 35B-A3B. Судя по рисунку после заголовка, у вас была Qwen 3.5 35B-A3B, но не оригинальная, а abliterated. Qwen3 вышли год-полтора назад и уже устарели, Qwen 3.6 самая современная, различные abliterated версии обычно хуже оригинальных.
Qwen 2.5 7B Coder Instruct
Многие читатели просили протестировать именно эту модель
Интересно, 2 года назад просили? :) Модель вышла в 2024 году, сейчас ее использовать смысла нет вообще.
Mistral 7B тоже древняя.
Под 6Гб видеопамяти, для кодинга вам можно попробовать либо Qwen 3.5 9B - 4-х битная по-идее должна влезть целиком, либо ее файнтюн Ornith-1.0, сам не пробовал, но судя по бенчмаркам, она хорошо от оригинала ушла: https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B-GGUF
Насчет Qwen2.5, я проводил опрос на гугл форме и тогда многие люди голосовали менно за Mistral+Qwen2.5+ Qwen3.5 35b-A3B
Насчет Qwen 3.5 9b я ее пробовал изза ее особеностей архитектуры запуск был медленее чем сейчас 35b запуск
Это не сговор, а статистика: модель тянет то, что чаще мелькало в обучении, а не то, что вышло вчера. Свежак живёт на r/LocalLLaMA и в лидербордах – тут вы правы на сто процентов. Правда, та же модель с включённым веб-поиском выдаёт вполне актуальную картину.
А какая сейчас лучшая локальная модель для программирования для 16-гиговой карты? RTX 4080, если быть точным.
Qwen 2.5 7B Coder неделю назад поставил и плевался, она только с третьего раза отреагировала под что мы пишем код и даже не под питон, а vba стала впаривать. Хотя мне надо питон под api. Сделала мне код, но такой бред можно и быстрее получить в gemini. Осталое уг, соглашусь. Есть варианты кормальных моделей? Я любитель клода.
Проект интернесный. В плане приближения разработки на локальных LLM.
Но, есть пара вопросов будет ли работать в MTP режиме с Qwen моделями ?
И понимаю, есть репа - изуйчайте, но в описании не увидел собсвенно какой механизм под капотом ?
Типа, да - что это дает, но не как это реализовано, или это коммерческая тайна ) ?
На первый взгляд, как будто бы если это сделать на уровне лангчейна - типа сделать описание главных "составляющих" кода и по шагово их доработать.
Понятно, что если с разу на уровне движка сделано - это меньше заморочек потом.
С малыми моделями - до 24b была проблема написания башскрипта, в целом не сложного ( 70 строк ), пришлось применять облачную.
А как у вас с написанием bash скриптов ?
( Я про то, что вот как будто, у малых моделей натыкаюсь на концептуальные ограничения в стилистике кода, хотя это можно решать через MCP )
Здравствуйте вы можете посомотреть первую статью .
Там я уже полностью разобрал каждую часть реализации и то как это работает.
Гоняю в свободное время qwen3.6-35b-a3b
На машине
i7 14700k
32 ram
RTX 5060ti infinity oc 16g
Через llama.cpp cuda добивался при контексте до 100к 50+ т/с
Контекстное окно на 1 поток 200к, при увеличении контекста ближе к 200к до 30т/с
Если интересно os Manjaro kde.
Насчет MTP в ветке patch-speedup которая являеться основной уже реализовано token prediction это дает сиьный буст а насчет MTP да будет работать ведь движок имеет ВСЕ функции оригинального llama.cpp кроме поддержки некоторый ахитектур.
Я думаю если в этот пк добавить майнинговую карту типа p104-100 за 1000 руб все будет работать в разы быстрее.
Это ноутбук. И я уже добился скорости с 2 ток в сек до 11 ток в сек с увелечением качесвта относительно базовой модели.
Не будет. Pascal как архитектура плохо заточена под нейронки.
Лучше использовать MI50 16gb они намного лучше для ИИ инференса и стоят по 9900 за шт.
Сильно ошибаетесь. К примеру, Tesla P40 с 24 ГБ врам работает в разы медленнее, чем 3050 ртх и тем более чем 3060 ти.
Версия cuda compute решает. Какая-нибудь 8.6 сильно, неимовеерно хуже 9.х.
Кроме того, старые архитектуры втдях могут быть не совместимы с новыми архитектура и llm. Qwen3 очень вероятно будет требовать модули cuda, которые реализованы только для rtx 3xxx и новее.
Не совсем понятно. Можно запускать любую модель на этом форке или для запуска её надо как-то дорабатывать?
нет не любую только
Qwen2.5
Qwen3.5/3.6
Mistral v0.1 v0.2
Llama 3.1
Остальные архитектуры еще не поддерживаються но да форк запускает ЛЮБУЮ модель из этих архитектур
UPD: За это время были добавлены еще Gemma 2, Mistral 7B v0.3 и Mixtral 8x22B. Полный список можно посомтреть на репозитории проекта в ветке patch-speedup.
Попробовал несколько моделей. Ни одна не запустилась. Падают на assert при запуске. На гитхабе не включены issues, поэтому не могу туда отписаться
Извините сейчас исправлюсь
Я включил Issues вы можете отправить Issue и я смогу попробовать помочь вам!
Возможно вы используете не ту ветку порбуйте ту которую я указал в конце статьи это ускоренная ветка
А ты на ноутбучной 3050 запустил 30B модель? И получил 11т/с? Если да, то звучит вообще интересно
Здравствуйте, тоже смотрел это видео!
Есть нюанс. PR в llama.cpp, с судя по всему аналогичным фиксом, был открыт ещё в марте. Интрига в самом низу https://github.com/ggml-org/llama.cpp/issues/25859 .
Можете попробовать Gemma 4 26B (Версию APEX I-Compact от mudler). У меня в LM Studio, на ноутбучной RTX 3050 4Гб, выходит на 10-12 т/сек при контексте в 100к.
Интересная идея, кстати. А почему кв кеш пишется на первой итерации а не на последней? Теоретически это следующим слоям будет давать более "качественные" значения же?
Дружище!
Ты делаешь классную штуку!
Читаю уже второй твой пост.
Молодец, что продолжаешь!
Если решился копать всерьез, то советую пощупать Bonsai-27B-1q-gguff.
Это тот же qwen, но аппаратно переученный на тернарные веса.
В твоем кейсе - это буст и аппаратный, и интеллектуальный. Модель Бонсай 1q дает то же качество что и q4 (на самом деле около 92%), но при этом в 4 раза компактнее и в 10 раз быстрее в инференсе. И твой форк для llama возможно сможет сравнять её в качестве по сути к q8.
2. Рекурсивный движок llama.cpp на RTX 3050: тесты Qwen 32B и 7B Coder — прирост качества х3 и аппетиты по памяти