Комментарии 43
Последний драйвер, который поддерживает и RTX 4080 (Ada), и V100 (Volta) относится к ветке 550.x
Но только c 535 torch видит V100 из докера на убунте
Сработало. Плата считывает обороты вентилятора, и он реагирует на ШИМ. Теперь я держу его на 10% мощности. Даже при полной нагрузке карта не греется выше 50 С, и работает кулер бесшумно.
Что-то тут не то. 10% кулера и 300 Вт отводимой мощности дают 50 градусов? Сдаётся мне, нагрузка очень далека от 100%. А что показывает nv-top?
V100 - старая карта (2018), но скорость памяти - весьма достойная: 900 ГБ/с.
Я заказал на Alibaba две карточки, каждая с 32 ГБ, каждая по $550.
Опишете, что получилось?
Как это делается? Мне ali express не показывает подобные комптерные товары и перекидывает на русскую версию сайта
потому что надо смотреть не розничный маркетплейс aliexpress, а оптовую b2b-площадку alibaba, а также включать впн и менять регион доставки на более подходящий
https://www.alibaba.com/product-detail/NVIDIA-Tesla-V100-16G-32G-PCIE_1601834765226.html
также есть посредники, за небольшую комиссию ищущие, покупающие и доставляющие конкретные вещи из китая, например, на канале PRO Hi-tec рекламируют некоего владислава
Qwen3.6-27B конкурирует с Claude Sonnet 4.6 в рейтинге Agentic Index от Artificial Analysis. Она обходит Sonnet 4.6 в бенчмарках MMMU-Pro и Terminal-Bench 2.0. Эта модель с 27 миллиардами параметров, работающая на железе со вторичного рынка, реально может тягаться с последними облачными моделями от Anthropic.
Если это было про "настоящую" Qwen3.6-27B, то какая связь с используемой конфигурацией?
IMHO Q5_K_M с последней буковкой M в агентских задача ощутимо хуже себя проявит даже по сравнению с Q5_K_XL.
Интересно, почему он так сделал. Памяти у автора даже больше моих 24GB (хотя 16+16 это ни разу не 32 с учетом пересылок данных между картами).
[qwen3.6-27b-mtp] ; spec-draft-n-max = 4: NVIDIA GeForce RTX 3090, 65 %, 22458 MiB (22.6/0.4); 35 t/s ; #gen drafts = 890, #acc drafts = 696, #gen tokens = 3560, #acc tokens = 1761 model = d:\_Models\_caches\.lm-studio\models\unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-UD-Q5_K_XL.gguf alias = qwen3.6-27b flash-attn = on parallel = 1 cache-type-k = q8_0 cache-type-v = q8_0 ctx-size = 65536 spec-type = draft-mtp spec-draft-n-max = 4 fit-target = 512
У меня точно такая же карточка, только я сразу выкинул штатный куллер т.к. ревёт он безбожно и поставил простенькую водянку купленную на авито за 2000р. Тишина и температура не превышает 60 градусов при длительной 100% загрузке. Единственное пришлось немного УШМ поработать чтобы сделать переходник под блок СЖО. Сейчас подумываю о покупке материнки на алишке под 4 таких SXM2 модуля а там nvlink уже будет. Беспокоит то, что вроде эта карта поддерживается до 4.8 pytorch
А кто-нибудь в курсе, в чем подстава? Это же 3080 или даже 3090 , и их даже продают уже сразу собранными хошь с водоблоком, хошь с воздухом, и да, на ебае от 200 долларов-евро-фунтов.
С дровами совсем плохо? Или питание быстро сыпаться начинает? С mxm-ками такое дело было, и с квадрой, и с файрпро, а тут плотность упаковки и формфактор похожие, а тут потребление еще в разы больше..
С теслами-то? Никакой подставы. Просто с датацентров списывают и всё. С турбинкой она перегревается до 82 и начинает снижать производительность. Ей надо 300 Вт рассеивать. Там хорошее охлаждение нужно.
У неё только видеовыхода нет. Но с grid-драйверами от google я вполне себе играл на ней через встройку.
Я скачал и установил последний официальный драйвер 582.53 для Tesla V100 от NVIDIA, но после ввода команды nvidia-smi в терминале Windows (powershell) обнаружил, что он не поддерживает режим WDDM (Windows Display Driver Model) и запускается только в режиме TCC (Tesla Compute Cluster). Это значит, что запустить игры на серверном ускорителе с официальным драйвером от NVIDIA не получится и карту можно будет использовать только для рабочих задач. Однако можно установить серверный драйвер от Google, который поддерживает оба режима TCC/WDDM. Я установил последний драйвер версии 582.16, но столкнулся с проблемой - после перезагрузки ОС очень долго загружается, а после загрузки Windows и входа в систему Tesla V100 перестает определяться. Пришлось удалить драйвер 582.16 от Google с помощью программы DDU (Display Driver Uninstaller) и путем перебора предыдущих версий драйверов найти подходящий с которым система работает стабильно. В итоге подошел драйвер 553.74 от 7 апреля 2025 года.
У меня получилось на официальном драйвере 582.53 от NVIDIA перевести tesla v100 в режим WDDM под windows 11. Работает стабильно, правда установка была с некоторыми костылями. Может кому-нибудь будет полезно https://habr.com/ru/posts/1042620/
Подстава в том, что это древнее железо, выработавшее за 8 лет круглосуточной работы весь свой ресурс, на которое уже кончились даже драйверы и скоро начнёт отказываться работать софт. Карты на актуальных видеочипах стоят совсем других денег.
Там ресурс такой, что фиг его выработаешь так легко. В серверах с водянкой они грелись градусов до 50-60, а то и ниже.
А что касается софта - уж не знаю, зачем авторы гонятся за версиями CUDA всё выше и выше. Полагаю, все эти проекты (кроме тензорных ядер поколения выше 1) можно запустить на V100.
Я брал себе такую игрушку, потому как я с нуля на С++ прямо под CUDA и тензорные ядра напрямую пишу нейронку с обучением. У себя я могу любую версию CUDA поставить для компиляции (и для V100 ставлю 7, хотя установлена 12). Кстати, с версией ниже 7 проект не запускается на V100. Возможно, авторы этого софта ставят версии CUDA, так как современные на данный момент карты с младшими версиями не желают работать. Вот и приходится компилировать под старшую версию, чтобы у большинства запустилось. Очень сомневаюсь, что всё это из-за каких-то нововведений в CUDA старших версий.
Насчет ресурса железа можно не париться, там отваливаться нечему кроме банок памяти. А вот софтверная смерть из-за дропа старых версий куды - реальная угроза
Спасибо за статью! Даже не догадался бы что такое можно в пк запихать
Подумайте дважды перед тем как брать эти "халявные" видеокарты. Сейчас у сборок pytorch минимальная версия CUDA - 12.6 . И то, даже под 12.6 уже не все модели можно запустить - ace step например не запускается.
Короче с каждым днем все больше шансов на то, что модель или интерфейс к модели не заработает на этих картах 2018 и древнее. Поэтому если вы не готовы сутками сидеть и перебирать версии драйверов, куды, моделей, а потом компилировать все вручную - подумайте дважды, может стоит подкопить и взять что-то с поддержкой CUDA поновее.
https://www.reddit.com/r/LocalLLaMA/comments/1kg7768/nvidia_to_drop_cuda_support_for_maxwell_pascal/
Тут один чел поддерживает форк vLLM специально для V100:
https://github.com/1CatAI/1Cat-vLLM
Понятно, что это не pytorch, но для определённых проектов эти карты - очень хорошее решение.
Я вот так смотрел на это дело: сколько $ стоит один GB VRAM?
96GB / RTX 6000 PRO - $111 / GB
32GB / RTX 5090 - $116 / GB
48GB / RTX 4090 - $81 / GB
24GB / RTX 3090 - $42 / GB
32GB / V100 - $18 / GB
Понятно, что память на всех этих устройствах разная по скорости. И производительность вычислений отличается очень сильно. Но для кэйсов, где упирается в размер памяти (а это в основном инференц) - V100 очень хороший вариант.
По моим исследованиям:
скорость генерации токенов на V100 приблизительно такая же как и на RTX 4090. Хотя тут есть ньюанс в котором надо разобраться - это с FlashAttention.
скорость обработка промпта (prompt processing) - на V100 в 3 раза медленнее чем на RTX 4090.
ASUS Ascent GX10 (DGX Spark) - ~$35 / GB + bonus “бубен не нужен”
Скорость памяти (bandwidth) у всех карточек в моём сообщении выше: от 900 до 1700 GB/s
DGX Spark: 273 GB/s - как-то не очень. По скорости генерации токенов получается в 3 раза медленнее V100. Хотя за счёт MTP может и не всё так плохо.
30 токенов/с будет давать всё равно, а ещё их кластеризовать можно, например 8 по 100Гб…
Про DGX Spark, народ пишет что для Qwen 3.6 27B Dense, с квантизацией FP8
скорость генерации токенов - 8 t/s
MTP помогает разогнаться до 15 t/s
Слабенько как-то.
Я у себя на RTX 4090 получаю 48 t/s (это с MTP):
https://huggingface.co/Qwen/Qwen3.6-27B-FP8/discussions/11
И карточки тоже можно запускать параллельно.
Так вот именно, что для определенных проектов. Если вы точно знаете что будете пускать и знаете что оно заработает - это отличный выбор. Мое предостережение скорее для людей, которые хотят вкатиться в мир нейронок, попробовать не только чатовые LLM, но и генерацию музыки, видео, изображений и т.п. Последним я сильно не рекомендую брать v100, p40 и прочие списанные карты, которые сейчас подешевели.
Проблема решается сборкой собственного контейнера с нужными либами один раз. Дальше просто таскаешь этот образ и не паришься с обновлениями хостовой системы
есть более элегантное решение - плата с отдельными питанием, sxm2x1/2/4 разъёмами, с возможностью установки кулеров цпу или водоблоков. и да, там работает nvlink

Очень красивый вариант, но за такую плату китайцы хотят от 500$, что разы выше бюджета автора на всю сборку.
Того что на рисунке мало. Нужно ее как-то с материнкой сопрягать еще.
С вентилятором нормально выкрутился, респект за пайку контактов. Но вообще для таких сборок проще сразу печатать кожух на 3D принтере и ставить обычные серверные вертушки на продув
всем привет. тоже заинтересовался было этими картами, но есть подвох (глубоко не копал но на ютубе есть ролики от наших гуру по ЛЛМ) - если в кратце - эта архитектура старая и нейросети на ней запускаются с квантизацией 16 бит, а современные идут по 8 и 4 бита, так что... копайте в эту сторону, если получится у кого то запустить 8 и 4 битные ллм-ки то я тоже себе буду копить на сбору чисто для нейронок.
турбина на серверных картах — это жесть, она рассчитана на серверную стойку где её насквозь продувает. в обычном корпусе такого продува нет. на 10% оборотов в простое норм, а вот под нагрузкой V100 горячая как печка, 250 ватт всё-таки. рядом ещё 4080 греет. без лютого продува корпуса карта начнёт сбрасывать частоты — будет тупить. я бы повесил все вертушки на хаб с управлением по температуре и сделал жёсткий продув: спереди-снизу холодный воздух гоним внутрь, сверху-сзади горячий выкидываем. иначе турбина на 10% просто гоняет уже горячий воздух по кругу. как она под долгой игрой себя ведёт, не перегревается?
При этом максимальное потребление V100 составляет 150 Вт
При этом, максимальное потребление V100 составляет 300 Вт (PCI урезана до 250)




Как я установил в свой игровой ПК серверный GPU за £200