
Комментарии 58
После быстрого поиска в этих ваших eBay и Авито у меня сложилось впечатление, что речь там идет про 350-500 долларов, но уж никак не 150-200
На ozon от 10к ₽
Я на таобао брал, есть плюс минус по такой же цене на озоне и вб
Чат ГПТ говорит что Tesla P40 24 Gb вроде как нормальный вариант для старого сервера Интел (два Xeon 5600 2х6 ядер + 110 ГБ DDR3). Или есть лучше варианты? Цена довольно бюджетная
10к стоят 16 гигвые версии, за 32 гб цена будет в районе 50к
да, 40к на таобао. но нужно охлаждение и SXM2 адаптер на PCIe
про охлаждение я не просто так написал. там 300 Вт дури, это или большая воздушная система охлаждения (типа как у RTX4090, шумная и нужна медная площадка-переходник под крепление на рамку GPU) или водянка на 300 Вт. Если две карты - две водянки или кастомная.
ну и блок питания нужен киловатт+ (два Xeon 5600 2х6 ядер тоже прожорливые)
Модели развиваются очень быстро. Сегодня вы можете запускать квен 3.8, а завтра какой-нибудь квен 4.0 будет выдавать полтокена в минуту. И стенд становится бесполезным, а карты - никому не нужными
Не думаю.
Скорее оптимизируют большие модели для запуска на домашних GPU (смотрите квантование LLM)
Для MoE моделей уже сделали:
квантование квантованием, а всякие flash attention на старых поколениях не поддерживаются... ну и будет идти условно как с Doom - на тесте на беременность запускаем, но в здравом уме кто так будет играть? тоже засматривался на p100, v100, но как будто в переплату за 5060 вложено как раз то время, что тратится на налаживание охлада и нервы вокруг этого всего. Не считаете?
в любом случае спасибо за опыт, было интересно
На v100 даже без flash attention всё очень неплохо работает.
Казалось бы уже прошла четверть 21 века, компьютеры, технологии, нейросети, хабр - авангард it-прогресса, а на деле всё то же сборище мифов древней греции, передаваемое из уст в уста. Ну вот же: раз, два. Дальше искать стало лень, а уверен есть ещё. Видеокарта это хардварный универсальный вычислитель, а все алгоритмы находятся в софте, как он написан так и будет считать. Устареть может только его вычислительная мощность, форм-фактор и всё. Во все эти легенды о неподдерживаемых квантованиях и прочих сугубо софтверных вещах я больше не верю, если не доказано ссылками что это так на самом деле. Впредь, пожалуйста подтверждайте утверждения, не превращая их в городские легенды.
Вольта физически не поддерживает аппаратное асинхронное копирование данных в shared memory (cp.async), которое появилось только в Ampere. Из-за этого все подобные порты под CC 7.0 - не более чем эмуляция с диким оверхедом по памяти. как я изначально сказал:
будет идти условно как с Doom - на тесте на беременность запускаем, но в здравом уме кто так будет играть?
вот спеки Ampere и Volta, или ссылки автора архитектур для вас не доказательства?
https://images.nvidia.com/content/volta-architecture/pdf/volta-architecture-whitepaper.pdf
Во все эти легенды о неподдерживаемых квантованиях
А пассаж про "неподдерживаемые квантования" вы вообще сами придумали и сами же бросились опровергать. Я ничего подобного не утверждал. без дословного цитирования такие выпады не несут достаточно объективности чтобы считаться серьёзными.
p.s. ваша вторая ссылка есть просто инструкция к первой, так что, сдаётся мне, не лень дальше искать было, а гипотеза просто резко обрела границы =)
5060 маловато будет и по объему VRAM и по шине данных.
я смотрел RTX5070Ti.
так вот, одна V100 на 32 Гб будет выгоднее, чем RTX5070Ti в плане работы с моделями типа qwen 3.8-27b и gemma 4 26b. Они полностью помещаются в VRAM (у RTX5070Ti чуть не хватает, нужно vram offloading делать, это снижает скорость работы.
Производительность и вычисления (FP32): RTX 5070 Ti достигает показателя 43,9 Тфлопс, что примерно в 2,8 раза превышает производительность V100 (15,7 Тфлопс).
По цене одна V100 на 32 Гб стоит примерно в три раза дешевле RTX5070Ti.
Вот тут есть жирный плюс двух V100 - их можно спарить в мост NVLink. там есть нюансы работы именно с NVLink, но в целом современные LLM и провайдеры умеют распределять VRAM. У RTX 40хх/50хх такую фичу выпилили
Вот только не понимаю, почему за пустой кусок текстолита хотят 10 тыс.
Спасибо, интересно про такое почитать. Хоть у меня уже есть «домовой», но хочется помощнее и подешевле по цене для экспериментов. Хотелось бы более детальнее про железо (всё, включая водянку) и про ПО (сборки из исходников). Можно серию статей про поэтапную сборку системы для домашнего применения.
актуальная тема. сами тоже думаем сделать небольшую сборку для офиса и выбираем. Заранее спасибо за более подробную про железо и софт. По вашему сценарию работы - какие задачи, сколько пользователей одновременно работает, как часто требуется вмешательство/контроль после запуска в рабочем режиме постоянного использования ?
А неттопы на Ryzen AI Max+ 395 не более перспективные в этом плане?
Присоединяюсь к вопросу. У меня лично к покупке какого-бы то ни было б/у какое-то неприятие, а тут покупка достаточно дорогого б/у, да еще и возня с нестандартными драйверами, охлаждением и прочим. А коробочка Ryzen AI - все-же потенциально приобретение на будущее. Еще из плюсов - она портативна (буквально портативнее ноутбука) и вполне может быть использована просто как обычный ПК, а не только для ИИ. Из минусов - все говорят что нужна CUDA, и еще скорость доступа к памяти ниже. Про CUDA - ну я не знаю, почему этот вопрос до сих пор не решили, тем более сейчас в эпоху вайбкодинга. Как по мне так Тьюринг-полноты вычислителя должно быть достаточно, остальное - вопросы скорости работы. И вот тут вроде как действительно может быть медленнее чем видеокарта. Но наверное нужны отзывы от реальных владельцев, лучше них никто не скажет.
Немного упрощая, с LLM всё упирается в память. Объём определяет какую модель вы в принципе сможете запустить. А пропускная способность памяти определяет скорость работы.
Примеры:
RTX 5090: 32GB, 1800GB/s
Ryzen AI Max+ 395: 128GB, 250GB/s
Mac M3 Ultra: 512GB, 800GB/s
NVidia H200: 140GB, 4800GB/s
Здесь можно заметить что Ryzen AI Max+ очень медленный по сравнению с другими вариантами. Запустить на нём можно много чего, но оно будет еле ползать.
Ну и стоимость примерно растёт как O(объём*скорость).
Ещё есть интересный момент с тем как разработчики моделей принимают решение о том какого размера будет модель. Я думаю что они отталкиваются от целевого железа, на котором эту модель предполагается запускать. Qwen 27B не просто так имеет такой размер. Она в наиболее популярном квантовании Q4 как раз хорошо помещается в очень распространённый среди энтузиастов 32GB GPU, потому что это потолок, который можно получить на 1 GPU потребительского сегмента. Имея нестандартное количество памяти, может так получиться, что для вас просто нет подходящей модели, они будут или слишком маленькие, или наоборот слишком большие.
Нет, там очень низкая скорость на всем, кроме МоЕшек.
У меня всего-лишь 370 ai, 64гб памяти, но не думаю что разница будет существенной с 395ым. Все очень упирается в медленный ddr5 и тот же qwen3.8 27b я еле-еле вытягиваю 15т/с и ниже по мере наполнения контекста. А свежих moe моделей нет.
Как-то немного, но минимально приемлимо. Это с mtp?
А moe-вариант qwen3.6-35b какую скорость показывает?
на 395 память в два раза быстрее, точнее каналов в два раза больше, разница была бы в 30 т/с. Добавляем MTP, получаем до 40-50т/с и контекст в 200к для мультиагентов. Уже не так плохо.
Не будет там таких цифр. Там на 60к уже меньше 20 т\с, на 200к оно вообще будет всю ночь думать - проверено на практике.
https://www.reddit.com/r/StrixHalo/comments/1vwm4p3/qwen38_27b_new_record_on_strix_halo_52_tokens_per/
за что купил, за то продал.
тестовое оно все
Они были перспективны год назад, но год назад под них не было моделей. Сейчас модели есть под 200gb железо, это уже ryzen 495, но ценник не гуманный, выйдут вот-вот.
Долго думал, стоит ли брать v100 в модификации корпуса rtx5090 - такие в среднем продают за 62 тысячи рублей. Взял. Никто не пишет прошумящие дроссели, они шумят практически у всех. По окладу нет проблем, но в api не можешь регулировать скорость вентиляторов - есть "ручной" спрятан за платой и можно крутить :) - шум в закрытом корпусе на уровне 35-40 дбм. Сейчас интересно смотрится PG199 - типа аналог A100 но только на 32гб, пишут что они стояли в автопилотах Теслы и обладают такой же скоростью как оригинальные A100 - но я не проверял, только видел, цены в среднем от 140 до 200 тысяч, в зависимости от наглости продавца - не рискнул.
По V100 в нагрузке, такая картина
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.178.04 Driver Version: 580.178.04 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 Tesla V100-SXM2-32GB Off | 00000000:03:00.0 Off | 0 |
| N/A 54C P0 248W / 300W | 31245MiB / 32768MiB | 96% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| 0 N/A N/A 2166 C ...local/lib/ollama/llama-server 31242MiB |
+-----------------------------------------------------------------------------------------+Делать даунвольт до 260 не рекомендую, ollama будто зависает и перезапускают модель в случаях когда используется более половины памяти, если выделено 300 ватт, то таких проблем не наблюдал. Облачные V100 кстати показывают 250 ватт - соответственно по моим тестам в долгую показывают результат qwen3.8:27b 20-22 t\s против локальной v100 28-30 t\s. Брать или нет, смотрите сами, также стоит подсчитать затраченное электричество - в зависимости от использования 20 долларовая подписка в определенных случаях будет смотреться привлекательнее.
2080 22Гб не рассматривали?
Я рассматривал. Одна такая вк не очень интересный вариант - 27b и 35b варианты qwen лезут только в экстремальных квантованиях и с ограничением контекста.
Очень интересный вариант две 2080 с мостиком nvlink. Получаем и прирост скорости относительно v100 32gb и нормальный cuda и работающий flash attention и нормальный охлад и запас памяти ощутимый для более точных квантований. Правда с драйверами есть нюансы, но вроде нормально решаемые.
прирост скорости относительно v100 32gb
Всё-таки они быстрее?
У меня варианты: купить V100 32 на PCI, или городить на 2 карты 2080, новый БП и всё такое.
Одна - дохловатая, но не убогая. Две просто - также дохловатые. Две с nvlink и отстроенной на tensor parallelizm системой - быстрые. Цифры получаются по тестам уровня 3090.
У меня сейчас в паре с 5060ти стоит tesla t10 - вариант 2080ти для geforce now - подрезана шина памяти до 256 бит, урезан тдп до 150 ватт, но памяти штатно 16 гб. На ии-задачах где-то на 10-15% медленнее 5060ти. Думаю 2080ти 22 гб должна показывать скорость на уровне 5060ти.
Нет. Смотрел именно в 32 гб, чтобы уместить. Купил только после того как погонял в облаке и посмотрел цены на аренду, очень сильно растут.
А можно информацию по префилу? Генерация это хорошо. Но она обычно в агентном режиме в сессии занимает буквально 1%, поэтому всегда более интересна скорость префила если в модель отправить контекста около 200к токенов
Хм, то есть всё это дело с четырьмя картами можно запихать в иммерсионную жидкость и помогать отапливать дом? А такие “домашние ИИ фермы” ещё в пулы не объединяются, чтобы напрокат мощности сдавать?
Анализируя кучу статей на Хабре по теме такой сборки и пытая Гемини гугла вопросами, пришёл к выводу, что сборка на v100 изжила своё из-за малой производительности для современных моделей и большой жадности перепродаванов всей обвязки на которой нужно поднимать эту сборку.
2 RTX 3090 по рентабельности и возможностям смотрятся куда более перспективнее. На них можно хотя бы обучать некоторые модели.
В какой-то другой статье высказали правильный на мой взгляд вывод: решения на tesla v100 - как входной билет на базе простых текстовых моделей. То есть, купил, попробовал, через 2 года выбросил, ибо запросы моделей и пользователей растут, а железо не молодеет.
Только 2 3090 сейчас стоят 240 тыс. Несколько месяцев назад когда стоили в 2 раза меньше то да.
по деньгам лучше 4x 5060ti 16gb (или более старые БУ 4060ti 16gb), они в разы дешевле но потребуют серверную материнку (у китайцев готовую железку под atx блок питания можно найти за 100-130т.р.)
p.s. кстати для маленьких моделей типа qwen3.8-27b широкая шина pcie не так уж и нужна, даже 1x более чем достаточно, если веса полностью в памяти и использовать layer разделение (хотя я пользуюсь tensor для 2x gpu и железки утилизируются на 100%, т.е. скорости pcie 4 хватает), а значит можно и десктопные материнки использовать.
А у меня зато бесшумно. :)
На полке стоят 3 Dell Precision с NVIDIA RTX A5000, 16 GB и ещё несколько с RTX A2000, 4 GB.
Распознавание речи, генерации речи, Routing для домашнего AI Assistant, OCR, работает прекрасно на локальных машинах.
А остальные AI задачи через вызовы на Groq, OpenAI, Anthropic и китайских AI API хостеров.
Да. Тема занятная. Но надо учитывать важный фактор — технологическое устаревание и прекращение поддержки этих карточек индустрией и софтом. Развиваются новые технологии в железе. Они используются в библиотеках и фреймворках, на которых строятся новые модели. Эти карточки не поддерживают новые технологии. Соответственно, постепенно поддержка этих старых карточек уходит из софта. Через лет 5 новые модели уже просто нельзя будет запустить на этих устаревших карточках. Либо можно будет, но с лютыми костылями и просадками в производительности. Но в итоге, со временем, и костыли перестанут работать. Поддержка этих видеокарт уходит и их популярность падает.
Эти видеокарты имеют смысл если вам не надо будет использовать самые последние модели. Помните про это.
Поддержка V* и P* прекратилась этим летом, последние драйвера 585, куда 13. Так что видеокарты ещё актуальны при цене 10-50 т.р.. Одна 3090 стоит дороже чем сборка на V100, а предлагает только 24 гб.
Существующий софт отлично работает на этих gpu, так что V100/P100 можно использовать как обычную видеокарту, а монитор подключить к материнке.
У V100 существовали две основные версии: PCIe и SXM2. Для домашней сборки логичнее смотреть именно на SXM2.
И чем это лучше заводской PCIe версии? Нужно возиться с недешёвыми адаптерами которые могут порезать шину. Сборка оказывается дороже чем монолитная карта. В чём же преимущество, если в итоге всё равно весь этот колхоз вставляется в тот же PCIe разъём?
Что-то у вас низкая скорость генерации, видимо без MTP запускаете?. У меня сервер тоже на 2-х V100 16Гб, с моделью qwen3.8 27b в квантовании Q5_K_M получается около 50 т/с (при генерации кода до 60 доходит). Обработка промпта в районе 600-700 т/с, вполне терпимо.

Вообще, очень доволен этими картами, даже заказал еще одну. Единственный минус - охлаждение. Я брал с турбинами сразу в напечатанных корпусах, под нагрузкой они шумят как самолет. Пришлось турбинки подключить через регуляторы напряжения XL4015E и уменьшить power limit карт до 150 Вт. В планах поменять на водяное охлаждение, чтобы избавиться от шума вообще.
А ведь помимо nVidia c CUDA есть ещё Radeon с Vulkan. И карточки, например, mi50 instinct на 16 и 32 ГБ или даже BC-250 со всеми разблокированными (ну, кому как повезёт) ядрами.
У V100 существовали две основные версии: PCIe и SXM2.
Три версии- забыли упомянуть SXM3- она вместо 12 вольт силового питания требует 48 вольт. Платы-переходники для SXM3 значительно дороже переходников под SXM2.
Я примерно по такой же логике несколько месяцев назад считал локальный сервер под LLM.
Для одного активного пользователя экономика обычно не сходится: API того же DeepSeek слишком дешёвый. Смысл появляется, когда такая машина работает не как персональный ПК, а как общий AI-узел на несколько человек и разные задачи.
Днём код и локальные модели для разработчиков, между запросами OCR, транскрибация, нормализация, ночью несрочные агентные задачи и пакетная обработка. Поставил задачу в очередь и лёг спать.
Как пример Ryzen AI Max+ 395 интересен сочетанием 128 ГБ общей памяти и 100–150 Вт потребления. За два года 24/7 это примерно 1,8-2,6 МВт/ч, тогда как старый сервер на 2-4 V100 легко съест 17-26 МВт/ч (за 2 года).
То есть только электричество такого V100-сервера за два года порядка 150-210 тыс. ₽ при 8 ₽/кВт/ч (за 2 года). А если ещё покупать сам сервер, карты, БП и охлаждение, по совокупным затратам уже можно приблизиться к двум современным машинам на Ryzen AI Max+ 395.
Поэтому старые Tesla имеют смысл прежде всего тогда, когда их практически бесплатно отдали из ДЦ вместе с инфраструктурой. Если всё покупать и собирать с нуля, компактная современная машина, расшаренная на несколько пользователей и задач, выглядит рациональнее.
Облачный API при этом я бы всё равно оставил для сложных и срочных запросов.
Собираем домашний сервер для LLM дешевле RTX 3090: NVIDIA Tesla V100 SXM2 в 2026 году