Обновить
8K+
25

Пользователь

24,1
Рейтинг
127
Подписчики
Отправить сообщение

На мини-ПК с 128 гб озу gpt-oss120b работает чуть быстрее, около 30 ток/сек.

На макстудио 96гб озу 40-70 т/сек.

Тоже для сравнения qwen30b a3b на пк без gpu. Результаты около 10-15 т/сек:

https://www.reddit.com/r/LocalLLaMA/comments/1kdsp4z/qwen_3_performance_quick_benchmarks_across/

Для сравнения скорость gemma26b на макбук м4про 24гб 52ток/сек https://habr.com/ru/companies/bothub/articles/1024424/

Вот еще один пример удачной конфигурации: две майнинговые cmp50hx подключены к материнке по 16 и 4 линиям pci-e (практически любая игровая материнка так может). Результат: 68 т/сек на gpt-oss20b. https://youtu.be/3xmP29iBOv0?si=vyUy_tthiELOGjF6

Для qwen 35b и gemma26b использование 2-3 майнинговых gpu на игровой материнке может дать 50 токенов как в третьей ссылке из статьи.

Тут способ ускорения майнинговых карт cmp50 cmp70 и cmp90, подключенных по одной линии pci-e с 24 до 55 т/с https://youtu.be/1wMfvz7Lvzg?si=2G-K6uI-Mv8zjpnT

Майнинговым картам не нужно больше чем х4. Поэтому если игровая материнка работает х4+х4+х4 то этого вполне достаточно для моделей 26в и 35в.

У вас понятно материнка получше, но жесткой необходимости в таких материнках нет. Можно использовать игровые.

Вот пример еще сборки на майнинговых картах с более 1 линии pci-e на материнке. Результат qwen35b 28-40т/с.

https://youtu.be/G9CxvVsr6Bw?si=fMSXcIg2XzJSCcCv

Не распаивал. У меня ж майнинговая материнка. Там одна линия на каждый слот. Нет смысла карты распаивать.

Нужно конечно побольше примеров работы майнинговах видеокарт в игровых материнках. Пока только одну статью эту статью на хабре видел. Если еще попадется-скину сюда.

Игровые материнки бывают х16+х8+х1+х1

Х16+х8+х4+х1 линий pci-e

В статье видимо материнка первого типа. Там только 2 майнинговые gpu нормально работают. Третья gpu начинает тормозить всю систему из-за низкой скорости передачи данных по х1

Kubold.cpp и lm studiu раскладывают сами по 4 gpu. Причем по разному. На скрине с 4 показаниями из cpu-z видно сколько в какой карте разложено. Запущен qwen35

Там в третьей сслке cmp50+cmp90 подключено к игровой материнке и дают 55 т/с . Некоторые малеринки позволяют третью майнинговую gpu воткнуть. Еще парочку можно подключить через переходники к м2 как во второй ссылке.

Рабочие станции тоже прикольно. Но qwen122b они все равно нк потянут на майнинговых картах. А для qwen35b достаточно игровой материнки

Конкретно в моем случае проще купить игровую материнку, чтобы поднять скорость генерации с 20 до 40 примерно.

Но в более крупных LLM от 50В параметров

оптимизация пригодится наверное.

Когда буду загружать qwen122b или gpt120b обязательно попробую. Сейчас нравится использовать не оптимизированные, но удобные приложения.

Да, я в курсе. У меня на 1×p106 время обрвботки запроса около 90 секунд. А когда модель полностью умещается в видеокарты становится 1,5 сек.

Майнинговые материнки на авито продаются от 500р. Конкретно как у меня от 1500р. За 3-4 т можно с процем. ОЗУ минимум 8 гб еще 1000руб.

Блок питания+корпус 2-10т руб.

Видеокарты по 1000-2000 руб.

Итого в 15 тыс можно уложиться. У меня подороже вышло. Я года три назад все покупал. Цены выше были.

У меня 20т/с ограничение из-за майнинговой материнки. В третьей ссылке из статьи две майнинговые карты дают 50т/с на игровой материнке в gemma26b

Три p106-100 по 6 гб дают на gemma 26b 18-20 т/с

Две p106-100 и одна p104-100 на 8 гб дают те же 18-20т/с

3×106+ 1×104 дают тоже 18-20 т/с но контекст можно использовать большой.

Это мои результаты на майнинговой материнке. На игровых материнках результат будет лучше.

Качество LLM можно оценить запустив три gemma на обычном пк или ноутбуке. 4b 12b и та, что в статье 26b должны пойти но любом пк с 32 гб озу (или 16 гб озу+ видеокарта).

Подписка точно дешевле, чем любой локальеый запуск LLM. Разница как при покупкуюе/аренде авто или при покупке/аренде квартиры.

Но всегда будут люди, которые предпочитают покупать свое железо, чем арендовать вычислительеые мощности.

Потребление видеокарт на скрине видно. Ватт 30-40 каждая примерно

на сайте https://whatmodelscanirun.com/ можно вбить любую GPU. сразу покажет какие модели с какой скоростью будут работать. при разных контекстах

Не встречал сборок, где работают сразу amd и nvidia. а какая материнка у вас? на третьем слоте сколько там линий PCI-e?

1
23 ...

Информация

В рейтинге
364-й
Зарегистрирован
Активность