Обновить
8K+
7

Пользователь

30,1
Рейтинг
2
Подписчики
Отправить сообщение

Конечно, облачные модели - это вообще сказка, тут спорить не о чем) Но лимиты, платные токены и зависимость от внешнего сервиса никуда не деваются. А своё локальное как резервное подспорье всегда полезно, можно сколько угодно гонять, экспериментировать и спокойно работать с чувствительной информацией, которую нельзя куда-то сливать. Я бы вообще не противопоставлял одно другому, скорее облако и локалка хорошо дополняют друг друга.

Ох... да, пока сам через всё не пройдешь, не поймешь, как всё на самом деле сложно и запутанно... Для AMD с rocm и vllm, мне кажется сложностей у вас гораздо больше, чем у меня, но 12-15 токенов/с на такой конфигурации звучит вполне неплохо. На 3080ti интересно поглядеть как она себя покажет на community MoE вариантах.

Спасибо, про tabbyapi и exllamav3 раньше вообще не слышал. Сейчас почитал, звучит интересно, особенно 4bpw + Q6 KV при тех же суммарных 24 ГБ VRAM. Если не сложно, киньте ссылку на конкретный exl3-квант qwen3.8-27B, который вы использовали. И интересно, сколько примерно токенов/с получалось на 5060 Ti + 4060 именно при генерации?

Да я и сам, честно говоря, сейчас посидел, почитал и резко задумался, может, чисто ради эксперимента попробовать P100 третьей воткнуть. Если у вас 3060 и P100 на x16 заведутся нормально, вообще интересно будет посмотреть, что получится.

16 ГБ HBM2 за такие деньги звучат вкусно и очень заманчиво. Но на постоянку я бы скорее всё равно предпочёл вторую 3060, потому что непонятно, как они будут вести себя вместе. Просто как хранилище P100 использовать не получится, она всё равно будет считать, от этого по идее никуда не деться.

Потому что V100 у меня в шкафу не лежала) И зачем мне специально покупать старый серверный ускоритель, который ещё неизвестно как поведёт себя в связке с уже имеющейся 3060. А потом ещё и ломать голову с его продажей из-за гораздо меньшей ликвидности?

Мне кажется, что вы статью дальше заголовка не читали. В ней специально несколько раз написано, что это не гайд по сборке самого крутого LLM-сервера с нуля, а эксперимент с уже имеющимся железом, которое у многих может быть под рукой. Не выкидывать же его, в самом деле. В моём случае из заметных покупок были одна видеокарта и корпус с шумоподавлением.
Если ставить задачу именно “собрать сервер с нуля с максимальным токен/с на рубль”, то да, конечно, можно подбирать совсем другое железо. Но тогда и статья была бы про другое.
Причём приведённые вами варианты тоже не сопоставимы с обычной 3060 “из коробки”. CMP 50HX на 20 ГБ, 2080 Ti на 22 ГБ и 3070M на 16 ГБ - это уже довольно специфическое или модифицированное железо, а не массовая карта, которую можно без особых приключений купить, поставить, а потом при необходимости продать. Для меня ликвидность 3060 тоже была фактором: карта очень ходовая, и её потом можно будет продать без большой потери в цене.
С EPYC тоже не всё заканчивается на процессоре за пару тысяч. Нужна ещё SP3-плата с подходящим количеством и расположением PCIe-слотов, память и вся остальная обвязка, причём нормальная материнка под несколько GPU сама может стоить очень дорого. Это уже полноценная отдельная сборка сервера с нуля, а не доработка того, что уже лежало дома в шкафу. Ну и для домашнего сервера я бы не сбрасывал со счетов потребление и охлаждение. Две RTX 3060 - это примерно 340 Вт на пару, тогда как многие из перечисленных Tesla/CMP/2080 Ti находятся примерно в районе 250 Вт на карту. Я не утверждаю, что мой стенд рекордсмен по токен/ватт, но для машины, которая может работать часами или даже днями, это тоже часть экономики.
Поэтому особенно забавно читать про “сервер надо собирать на серверном железе” под статьёй, где вся суть как раз в том, что даже старый домашний Z97, i7-4790 и две потребительские ходовые видеокарты удалось довести до вполне рабочего состояния.

Спасибо! Как раз сейчас смотрю в сторону A3B/MoE) На момент, когда я гонял основные тесты и писал статью, такого изобилия community-сборок ещё не было, а сейчас уже глаза разбегаются. Обязательно что-нибудь из этого погоняю на тех же сценариях. Если не сложно, киньте ссылку на конкретный вариант, который имели в виду.

Спасибо, погляжу, что там предлагают) Там можно ещё на несколько ночей залипнуть в тестах 😁 Особенно интересно будет погонять MoE-варианты и посмотреть, что у них там со скоростью и MTP.

Тоже думал про старые Tesla именно из-за объёма и пропускной способности памяти. P100 интересная и даже подешевле 3060 на 12гигов, 16 ГБ HBM2, пропускная способность заметно выше. Но сама архитектура уже старенький Pascal, плюс связка P100 + 3060 получится довольно странной. Ну и 3060 я покупал ещё с расчётом на то, что её потом при необходимости можно будет продать без катастрофической потери в цене, карта сейчас довольно ходовая. Но было бы интересно проверить, как llama.cpp поведёт себя на такой паре, особенно в tensor split.

Информация

В рейтинге
258-й
Зарегистрирован
Активность