Так там только выкачать репу и setup скрипт запустить. Пользуюсь стратой уже недели 2 (вернее форком strata-v100) с квантом iq3_s, скорость и качество довольно приятные. По ощущениям qwen 3.8 flash next лучше умеет в планирование и архитектуру, а 27b в реализацию.
Новость, достойная хабра. Попросить ИИ найти и поменять условный переход в екзешнике) Больше удивляет, что кто-то сегодня пользуется даунлоад менеджерами.
Что-то у вас низкая скорость генерации, видимо без MTP запускаете?. У меня сервер тоже на 2-х V100 16Гб, с моделью qwen3.8 27b в квантовании Q5_K_M получается около 50 т/с (при генерации кода до 60 доходит). Обработка промпта в районе 600-700 т/с, вполне терпимо.
Вообще, очень доволен этими картами, даже заказал еще одну. Единственный минус - охлаждение. Я брал с турбинами сразу в напечатанных корпусах, под нагрузкой они шумят как самолет. Пришлось турбинки подключить через регуляторы напряжения XL4015E и уменьшить power limit карт до 150 Вт. В планах поменять на водяное охлаждение, чтобы избавиться от шума вообще.
Сами веса в памяти лежат в сжатом виде (карта их распаковывает на лету), но KV кэш вроде как занимает больше места. Хотя вот если указать сжатие кэша посильнее (вместо q8 сделать q4, например), то место в памяти освобождается и можно выделить на контекст больше
NVlink дает прирост что-то около 10%, на реддите читал у кого-то. Так что прям упарываться именно в нвлинк не стоит, если проц и материнка хотя бы x8 шину PCIe дают на обе карты
llama.cpp нормально их поддерживает. Главная проблема V100, да и вообще всех тесла - это охлаждение. Для тихой работы нужно ставить водянку, иначе кастомные турбины ревут как самолет, даже при пауэрлимите.
Зачем писать глупости, все llama.cpp поддерживает. Недавно собрал сервер на двух v100, вытянул свежую версию из гитхаба, собрал и запускаю любые GGUFы. На данный момент юзаю qwen3.8 27b Q6_К, с МТР все летает на ура.
Для вас создали https://github.com/Niko1221/Strata, а вы с лламой мучаетесь
Так там только выкачать репу и setup скрипт запустить. Пользуюсь стратой уже недели 2 (вернее форком strata-v100) с квантом iq3_s, скорость и качество довольно приятные. По ощущениям qwen 3.8 flash next лучше умеет в планирование и архитектуру, а 27b в реализацию.
Спасибо за много details, но есть большие сомнения насчет способностей iq2_xxs кванта)
Так strata для МоЕ моделей, там немного по-другому работает.
Потому что исходный код уже потерял свою ценность. Быстро и дешево написать новое приложение с нужным тебе функционалом.
Буквально на днях скачивал модель с hf, разбитую на части, curl отлично справился. Там можно маски задавать в урле
Новость, достойная хабра. Попросить ИИ найти и поменять условный переход в екзешнике) Больше удивляет, что кто-то сегодня пользуется даунлоад менеджерами.
Что-то у вас низкая скорость генерации, видимо без MTP запускаете?. У меня сервер тоже на 2-х V100 16Гб, с моделью qwen3.8 27b в квантовании Q5_K_M получается около 50 т/с (при генерации кода до 60 доходит). Обработка промпта в районе 600-700 т/с, вполне терпимо.
Вообще, очень доволен этими картами, даже заказал еще одну. Единственный минус - охлаждение. Я брал с турбинами сразу в напечатанных корпусах, под нагрузкой они шумят как самолет. Пришлось турбинки подключить через регуляторы напряжения XL4015E и уменьшить power limit карт до 150 Вт. В планах поменять на водяное охлаждение, чтобы избавиться от шума вообще.
Сами веса в памяти лежат в сжатом виде (карта их распаковывает на лету), но KV кэш вроде как занимает больше места. Хотя вот если указать сжатие кэша посильнее (вместо q8 сделать q4, например), то место в памяти освобождается и можно выделить на контекст больше
Это в llama.cpp? У меня как раз pcie 3.0 x16 и x8 работают с двумя v100, llama.cpp их нормально нагружает с -sm tensor вроде
NVlink дает прирост что-то около 10%, на реддите читал у кого-то. Так что прям упарываться именно в нвлинк не стоит, если проц и материнка хотя бы x8 шину PCIe дают на обе карты
llama.cpp нормально их поддерживает. Главная проблема V100, да и вообще всех тесла - это охлаждение. Для тихой работы нужно ставить водянку, иначе кастомные турбины ревут как самолет, даже при пауэрлимите.
Зачем писать глупости, все llama.cpp поддерживает. Недавно собрал сервер на двух v100, вытянул свежую версию из гитхаба, собрал и запускаю любые GGUFы. На данный момент юзаю qwen3.8 27b Q6_К, с МТР все летает на ура.
Но у памяти этого спарка пропускная способность всего 276 ГБ/с. Модельки будут крутиться, но МЕДЛЕННО.
И чтобы умная была как Клод опус
1 бит с 90% конечно сомнительно, но тернарная версия интересна.
Мне Apex версии больше всего нравятся, на моих тестах лучше всего показывают
Скорости генерации прям грустные какие-то. Кажись, было бы эффективнее взять серверную материнку с озона вместе с процессором и памятью ddr4.
Ждём qwen3.7 35b a3b
не при капитализме)