Комментарии 36
Интересно, у меня как раз 3060, только вот я думал к ней в пару воткнуть tesla p100, там памяти по больше и она по шустрее...
Тоже думал про старые Tesla именно из-за объёма и пропускной способности памяти. P100 интересная и даже подешевле 3060 на 12гигов, 16 ГБ HBM2, пропускная способность заметно выше. Но сама архитектура уже старенький Pascal, плюс связка P100 + 3060 получится довольно странной. Ну и 3060 я покупал ещё с расчётом на то, что её потом при необходимости можно будет продать без катастрофической потери в цене, карта сейчас довольно ходовая. Но было бы интересно проверить, как llama.cpp поведёт себя на такой паре, особенно в tensor split.
а почему не V100?
Потому что V100 у меня в шкафу не лежала) И зачем мне специально покупать старый серверный ускоритель, который ещё неизвестно как поведёт себя в связке с уже имеющейся 3060. А потом ещё и ломать голову с его продажей из-за гораздо меньшей ликвидности?
v100 дороже, и если уж покупать что то старое, то явно не дорогое, чтоб не жалко если что, p100 на озоне по 7.5к
к тому же судя по этой статье, p100 имеет потенциал
https://habr.com/ru/articles/1071442/?ysclid=muhaz6uf74695878160
сделать rtx3060 ведущей а p100 как хранилище с быстрой памятью.
16 ГБ HBM2 за такие деньги звучат вкусно и очень заманчиво. Но на постоянку я бы скорее всё равно предпочёл вторую 3060, потому что непонятно, как они будут вести себя вместе. Просто как хранилище P100 использовать не получится, она всё равно будет считать, от этого по идее никуда не деться.
Да, считать будет, но у меня мать X99 c 2x Xeon 2699, на ней 2 pcie 16x так что потенциал есть =)
Что дальше? Думаю дальше можно попробовать сборки типа https://huggingface.co/DavidAU/activity/models
Порекомендую использовать вместо Qwen3.8–27B GGUF иную модель Qwen3.8-35B-A3B GGUF. Почему эту модель… Размер почти как у Вашей, но как описывают ее на Huggingface “35B общие параметры с ~3B активным на токен - разреженность MoE означает, что он работает значительно быстрее, чем плотный 35B при том же квантовании”. А Ваша стразу имеет 27b активных токенов. К примеру: у меня на одной 1080ti, также приблизительно такая же скорость (29 - 31 т.с), чуть поменьше чем у Вас на двух не очень старых видеокартах.
Спасибо! Как раз сейчас смотрю в сторону A3B/MoE) На момент, когда я гонял основные тесты и писал статью, такого изобилия community-сборок ещё не было, а сейчас уже глаза разбегаются. Обязательно что-нибудь из этого погоняю на тех же сценариях. Если не сложно, киньте ссылку на конкретный вариант, который имели в виду.
Не существует реальной Qwen3.8-35B-A3B, то о чем вы говорите лишь дообученная квен3.6 и она заметно слабее последней 27б.
МоЕ модель превосходит плотную модель в скорости, но уступает в качестве. Увы, чудес не бывает.
Зачем каждый раз изобреть велосипед. Забудьте уже про эти 3060. Есть же нормальные видюхи. 1) пара CMP50 на 20 гб. Будет в 2 раза быстрее и памяти почти в 2 раза больше. 2) пара 2080ти с нвлинк даёт на квен3.8 27б в фп8 до 100 т/с! 3) пара 3070м на 16 гб. В 1,5 раза быстрее твоих 3060 и памяти больше.
А сервер надо собирать на сервером железе. Сейчас эпики первого поколения стоят буквально пару тысяч рублей и дают 128 линий пси-е (о май гад, можно насовать смп50 на 10гб по 5 тр за шт больше чем выдержит домашняя электросеть), правда материнка не дешёвая, но и память 8 канальная. А эпики 2 поколения ещё и псие 4 поколения и ддр4 3200.
Мне кажется, что вы статью дальше заголовка не читали. В ней специально несколько раз написано, что это не гайд по сборке самого крутого LLM-сервера с нуля, а эксперимент с уже имеющимся железом, которое у многих может быть под рукой. Не выкидывать же его, в самом деле. В моём случае из заметных покупок были одна видеокарта и корпус с шумоподавлением.
Если ставить задачу именно “собрать сервер с нуля с максимальным токен/с на рубль”, то да, конечно, можно подбирать совсем другое железо. Но тогда и статья была бы про другое.
Причём приведённые вами варианты тоже не сопоставимы с обычной 3060 “из коробки”. CMP 50HX на 20 ГБ, 2080 Ti на 22 ГБ и 3070M на 16 ГБ - это уже довольно специфическое или модифицированное железо, а не массовая карта, которую можно без особых приключений купить, поставить, а потом при необходимости продать. Для меня ликвидность 3060 тоже была фактором: карта очень ходовая, и её потом можно будет продать без большой потери в цене.
С EPYC тоже не всё заканчивается на процессоре за пару тысяч. Нужна ещё SP3-плата с подходящим количеством и расположением PCIe-слотов, память и вся остальная обвязка, причём нормальная материнка под несколько GPU сама может стоить очень дорого. Это уже полноценная отдельная сборка сервера с нуля, а не доработка того, что уже лежало дома в шкафу. Ну и для домашнего сервера я бы не сбрасывал со счетов потребление и охлаждение. Две RTX 3060 - это примерно 340 Вт на пару, тогда как многие из перечисленных Tesla/CMP/2080 Ti находятся примерно в районе 250 Вт на карту. Я не утверждаю, что мой стенд рекордсмен по токен/ватт, но для машины, которая может работать часами или даже днями, это тоже часть экономики.
Поэтому особенно забавно читать про “сервер надо собирать на серверном железе” под статьёй, где вся суть как раз в том, что даже старый домашний Z97, i7-4790 и две потребительские ходовые видеокарты удалось довести до вполне рабочего состояния.
3070m к слову жрёт 110 вт. И такая же ходовая как и 3060, только всем лучше.
Для тенсор сплит важна скорость обмена между видеокартами. Эпик даст полноценные 16х 4.0. У вас же 8х 3.0 а это в 4 раза меньшая пропускная способность. На своей машине вы не запустите qwen flash next. А я так понимаю за подобными моделями будущее, по крайней мере ближайшие полгода-год. Если эпик дорого, есть более доступные Xeon.
На вашем железе можно попробовать bonsai 2. Контекста влезет все 256к.
Вы использовали термин "нормальные видюхи", и при этом не указали ни одной нормальной видюхи... Суть теста была как раз в использовании НОРМАЛЬНЫХ видеокарт для НОРМАЛЬНЫХ людей, а не списанного серверного старья, франкенштейнов, переделок с мобильных чипов, и иже с ними...
Попробуйте tabbyapi - там используется бэкэнд exllamav3 - qwen3.8 4bpw kv Q6 + mtp n=2 + vision на процессор и получите 200 тыс контекста. Если очень захотите, то можете запустить и 6bpw с q4 кешем при 120 тыс контекста без mtp - опробовано лично на 5060ti 16gb + 4060 8gb. Кванты exl3 - очень даже неплохие и память используется более эффективно, чем в llama.cpp. И я бы посоветовал использовать pi.dev - легче и настроить можно только необходимые функции.
Если заинтересует, то могу рассказать особенности с настройкой и скинуть свои прессеты в ЛС.
Спасибо, про tabbyapi и exllamav3 раньше вообще не слышал. Сейчас почитал, звучит интересно, особенно 4bpw + Q6 KV при тех же суммарных 24 ГБ VRAM. Если не сложно, киньте ссылку на конкретный exl3-квант qwen3.8-27B, который вы использовали. И интересно, сколько примерно токенов/с получалось на 5060 Ti + 4060 именно при генерации?
Мне тоже нравится эта модель и я запускаю ее локально на M1 Max, но:
Одну и ту же задачу я делал 9 часов локально (игра 2048) и за 2 минуты на GLM 5.3 flash. Стоит ли игра свеч?
Конечно, облачные модели - это вообще сказка, тут спорить не о чем) Но лимиты, платные токены и зависимость от внешнего сервиса никуда не деваются. А своё локальное как резервное подспорье всегда полезно, можно сколько угодно гонять, экспериментировать и спокойно работать с чувствительной информацией, которую нельзя куда-то сливать. Я бы вообще не противопоставлял одно другому, скорее облако и локалка хорошо дополняют друг друга.
Очень занимательная статья, читая сам начал переживать этот тернистый путь. Боюсь только многие не поймут, пока сами не попробуют.
Недавно целый день настраивал тот же Qwen 3.8, но в BF16 формате с контекстным окном 64К и vLLM вместо Ollama, на паре AMD Radeon R9700 (ИИ мне сразу сказал, что не влезет т.к. надо ~75Гб памяти, а у меня 64Гб). Тоже знатно намучался т.к. на AMD много сложнее (модель гибридная, размер блока не стандартный, ROCm работать нормально не хочет и vLLM подключал универсальные Triton ядра вместо родного ROCm = 12-15 токенов.
Но в рабочем компе у меня 3080Ti, вот тоже все думаю, что бы с ней придумать и смотрю в сторону Qwen3.8-35B-A3B как вам выше посоветовали.
Ох... да, пока сам через всё не пройдешь, не поймешь, как всё на самом деле сложно и запутанно... Для AMD с rocm и vllm, мне кажется сложностей у вас гораздо больше, чем у меня, но 12-15 токенов/с на такой конфигурации звучит вполне неплохо. На 3080ti интересно поглядеть как она себя покажет на community MoE вариантах.
Касательно 3080ti у меня дилемма схожая с тем, что вы проходили. Одной карты маловато и я все не решу, что лучше. Купить вторую такую же (будет очень много gpu мощности, но мало памяти), поменять на 3090 (я даже искал зимой ещё на Авито вариант живой), 5090 слишком дорогая. А если пару 3090 поставить то надо весь системник менять и главное этот монстр будет шуметь и греться. Тут уже можно посмотреть в сторону ryzen ai 395+ не шустро, но для одного человека норм.
Тоже начал осваивать локальный инференс. Купил 2080 ti 22gb на Авито. Не успел наиграться с картой, сдохла через неделю) Но стабильно выдавала 23 т/с на квене3.8-27b-4-k-m. Заказал из Китая такую же карту) Хочу собрать 2х2080 с кастомной vllm под 100 т/с)
Если не секрет, по чем выходит 22Гб версия из Китая? На авито смотрю уже почти и нет 22Гб.
Уф.. А есть ли жизнь для 1050 ti?
2680 v4 +16Ram + 1050 ti 4 VARM Qwen_Qwen3.5-2B-Q8_0 9t\s пыжиться.... кто сможет на 775 Xeone запустить?
Вместо двух 3060 можно поставить три майнинговых p106-100. Скорость будет чуть поменьше, но цена в разы дешевле. Типа такого: https://habr.com/ru/articles/1055222/comments/
Рассчеты сколько токенов может выдавать любая LLM на любой корте или сборке из карт можно глянуть здесь: https://whatmodelscanirun.com/
https://whatmodelscanirun.com/ - все очень субъективно... 3050 на Qwen3.5 9B Q4_K_M не выдает 36t\s точно.. ну или я круворуко llama сконфигурировал. Так же Qwen3.5 4B Q4_K_M не выдаст... 63 t\s... я конечно Q4 не гонял... щас проверю... Но Qwen3.5 9B Q4_K_M на 2060 на 6gb не выдаст 53t\s
Если я не прав... дайте конфиги для llama что бы достичь таких цифр...
webthefirst,
у меня подобная конфигурация с первых чисел августа, но без Docker. В чём его смысл на сервере?
MODEL=“/srv/models/Qwen3.8-27B/Qwen3.8-27B-UD-Q4_K_XL.gguf” HOST=“0.0.0.0” PORT=“8080” THREADS=“4” CTX=“98304” BATCH=“1024” NGL=“999”
EXTRA=“–parallel 1
–tensor-split 68,60
–mlock
–temp 0.7
–top-p 0.8
–top-k 20
–min-p 0.03
–presence-penalty 0.0
–repeat-penalty 1.0
–frequency-penalty 0.0
-ctk q4_0
-ctv q4_0
–spec-type draft-mtp
–spec-draft-n-max 1
-fa on
–jinja
-ub 384
–cache-ram 8192
–reasoning off”

Qwen3.8–27B на двух RTX 3060 12ГБ: как я разогнал OpenCode с ~9 до ~40 токенов/с при 128K контекста