Обновить
4
Алексей@melodicmsk

Пользователь

0,1
Рейтинг
Отправить сообщение

На 2080 есть на Смр50 нету, физически есть, но драйвер говорит что нет.

Хотелось бы видосик

3070m к слову жрёт 110 вт. И такая же ходовая как и 3060, только всем лучше.

Для тенсор сплит важна скорость обмена между видеокартами. Эпик даст полноценные 16х 4.0. У вас же 8х 3.0 а это в 4 раза меньшая пропускная способность. На своей машине вы не запустите qwen flash next. А я так понимаю за подобными моделями будущее, по крайней мере ближайшие полгода-год. Если эпик дорого, есть более доступные Xeon.

На вашем железе можно попробовать bonsai 2. Контекста влезет все 256к.

Зачем каждый раз изобреть велосипед. Забудьте уже про эти 3060. Есть же нормальные видюхи. 1) пара CMP50 на 20 гб. Будет в 2 раза быстрее и памяти почти в 2 раза больше. 2) пара 2080ти с нвлинк даёт на квен3.8 27б в фп8 до 100 т/с! 3) пара 3070м на 16 гб. В 1,5 раза быстрее твоих 3060 и памяти больше.

А сервер надо собирать на сервером железе. Сейчас эпики первого поколения стоят буквально пару тысяч рублей и дают 128 линий пси-е (о май гад, можно насовать смп50 на 10гб по 5 тр за шт больше чем выдержит домашняя электросеть), правда материнка не дешёвая, но и память 8 канальная. А эпики 2 поколения ещё и псие 4 поколения и ддр4 3200.

Префил в 19 токенов это печаль. Такое ощущение что видеокарта вообще не работает. Ну и архитектура паскаль без тензорных ядер это печаль. Советую тебе поменять хотя бы на лептопную 3070м/3080м 16 гб франкенштейн. Потребляет в 2 раза меньше. Во всем быстрее. Префил будет раз в 10-20 быстрее. Для работы с агентом это очень важно.

Нет, помаленьку потеют соединения. Через шланги н чего не уходит. Из-за того что температура выше окружающей среды, эти микроутечки испаряются быстрее чем успевают сформировать капли. Это нормально, у всех так. Ну и опрессовку вы наверняка делали не правильно. Надо накачивать и замерять время потери давления при рабочей температуре. Все там прекрасно шипит и убегает. Ну и 1,5 бар это многовато. 1 достаточно.

У тебя что мало игр в стим, в которые ты играл 1 раз или не играл вообще? Тут тоже самое

Не совсем понятно по фото, где там что. Жидкость из расширительного бачка должна подаваться в помпу. Это исключает завоздушивание помпы и возможные проблемы при пуске. Далее поток жидкости выталкивает пузыри.

Для этого достаточно поставить расширительный бачек в верхней точке.

Я больше 20-30к не использовал. Просто запускал из любопытства. Посадки почти не было. Посадка на уровне квен3.8 27б.

Главное написано, в каком режиме работает и сколько каналов.

Статья вообще ничем. Это же квен4 со своими плюшками. У меня на 3090 и 64 гб озу выдаёт под 50 т/с. Обращение к ссд редко превышает нескольких мегабайт в секунду, иногда 200-300. В этом кайф нграм таблицы. Автор вообще не понял, что это и как с этим жить. Статья, мягко говоря, нуждается в полной переработке.

GitHub - weicj/vLLM-2080Ti-Definitive: The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS ) · GitHub https://share.google/Z6OXHSUeH144wFZt7

А тем временем пара 2080ти с нвлинк в ку8 даёт 100 т/с на форке вллм. Пара 3090 должна давать соответственно 130+.

В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.

Собственно ничего нового. Если полез в cpu, то в первую очередь надо смотреть на загрузку скорости озу. На амд по виндой можно смотреть в hwinfo. Если образно по тесту aida имеем 80 гб/с, а в инференсе по hwinfo в его 50 и 10 т/с. То в теории можно разогнаться до 16 т/с (80/50*10). Идём в линукс и уже мучаем инференс там, зная потолок своей системы. Из коробки llama cpp упирается примерно в 75%. Правильной сборкой можно ещё выжать 10-15%. Будет время, напишу статью.

Сегодня в хозяйстве появляется такая коробочка. Пощупаем. Самому интересно, кто кого заборит, коробочка или Дуал эпик с 16 каналом.

Все ждали 35В, а вышла довольно тяжелая штукенция, которая не особо то и лучше 27В.

У меня жена учитель. Была. По сути я был спонсором образования, потому что на ту зарплату можно только обедать.

Даже современная память даёт реальных 100 гб/с, 20 из них в играх съедает проц. Остаётся 80гб/с полезной псп. Это уровень очень старых видеокарт начального уровня. Играть на встройке ещё та боль. Фпс колбаски, потому что процессор занимает озу в самый неподходящий момент. А процессоров с мощной встройкой и 3д кэш пока не делают. Есть конечно аномалии типа амд 395, где память под 250 гб/с, но цена такая, что дешевле ноут с процессором пошустрее и видюхой около флагманской в придачу.

1

Информация

В рейтинге
3 302-й
Зарегистрирован
Активность

Специализация

Инженер встраиваемых систем, Инженер электронных устройств
Ведущий