GitHub - weicj/vLLM-2080Ti-Definitive: The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS ) · GitHub https://share.google/Z6OXHSUeH144wFZt7
Собственно ничего нового. Если полез в cpu, то в первую очередь надо смотреть на загрузку скорости озу. На амд по виндой можно смотреть в hwinfo. Если образно по тесту aida имеем 80 гб/с, а в инференсе по hwinfo в его 50 и 10 т/с. То в теории можно разогнаться до 16 т/с (80/50*10). Идём в линукс и уже мучаем инференс там, зная потолок своей системы. Из коробки llama cpp упирается примерно в 75%. Правильной сборкой можно ещё выжать 10-15%. Будет время, напишу статью.
Даже современная память даёт реальных 100 гб/с, 20 из них в играх съедает проц. Остаётся 80гб/с полезной псп. Это уровень очень старых видеокарт начального уровня. Играть на встройке ещё та боль. Фпс колбаски, потому что процессор занимает озу в самый неподходящий момент. А процессоров с мощной встройкой и 3д кэш пока не делают. Есть конечно аномалии типа амд 395, где память под 250 гб/с, но цена такая, что дешевле ноут с процессором пошустрее и видюхой около флагманской в придачу.
Имея домашнюю лабу на 512гб озу, на первое место выходит место на диске. Хочется скачать все крупные модели, которые влезут в озу, а их в разных квантах наберётся пол сотни. Ссд на терабайт как кэш для запуска. И тут внезапно встаёт дилемма с схд в нагрузку. На авито истерика с нормальными хдд похлеще чем с видеокартами.
Дуал 2080ti с nvlink даёт до 100т/с на qwen 27b в q8. Контекст близкий к максимальному. Учитывая цену, сейчас это топ комплект для плотного квена. За последние 2 недели цены выросли % на 30. Чуть дешевле пара 3070м на 16гб, но скорость +-35 т/с в однопотоке, двухпоток 2х скорости.
Нет, так не бывает. Во всем мире весь бензин обязательно с присадками. Не все из них октаноповышающие. Если смотреть на тот же мтбэ, это по сути присадка, она не вырабатывается напрямую из нефти на нпз.
Про октан корректор конечно напрасно так. Я согласен, что всякие там хайгир и прочие брендовые толку мало. Но когда нет например 95ого, а есть только 92, то лучше все таки залить присадки, желательно с двойной дозой. Так же в продаже на маркетплейсах встречается мма монометиланилин, о котором упоминал ось в статье. Ничего плохого в этой присадке нет. Плохо будет, если на ней ездить постоянно десятки тысяч км. Мма очень плотно используется в атоспорте. Льют его безобразно много, по 10-15%. И даже в этом случае особо нагара и и т. П. Не страдают. Можно лить ацетон, смело до 15%. Можно лить толуол/ксилол 10%. Многократно лил самолично в самые современные моторы, все это только улучшает работу мотора, но это дороже готового бензина. В багажнике постоянно лежит что-то октаноповышающее на случай плохого бензина. Всем рекомендую.
Как же тогда системы старт-стоп бензин экономят, если при пуске бензина уйма тратиться. Эта уйма тратиться один раз при первом пуске и прогреве. Таксисты в очереди все глушат мотор.
GitHub - weicj/vLLM-2080Ti-Definitive: The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS ) · GitHub https://share.google/Z6OXHSUeH144wFZt7
А тем временем пара 2080ти с нвлинк в ку8 даёт 100 т/с на форке вллм. Пара 3090 должна давать соответственно 130+.
В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.
Собственно ничего нового. Если полез в cpu, то в первую очередь надо смотреть на загрузку скорости озу. На амд по виндой можно смотреть в hwinfo. Если образно по тесту aida имеем 80 гб/с, а в инференсе по hwinfo в его 50 и 10 т/с. То в теории можно разогнаться до 16 т/с (80/50*10). Идём в линукс и уже мучаем инференс там, зная потолок своей системы. Из коробки llama cpp упирается примерно в 75%. Правильной сборкой можно ещё выжать 10-15%. Будет время, напишу статью.
Сегодня в хозяйстве появляется такая коробочка. Пощупаем. Самому интересно, кто кого заборит, коробочка или Дуал эпик с 16 каналом.
Все ждали 35В, а вышла довольно тяжелая штукенция, которая не особо то и лучше 27В.
У меня жена учитель. Была. По сути я был спонсором образования, потому что на ту зарплату можно только обедать.
Даже современная память даёт реальных 100 гб/с, 20 из них в играх съедает проц. Остаётся 80гб/с полезной псп. Это уровень очень старых видеокарт начального уровня. Играть на встройке ещё та боль. Фпс колбаски, потому что процессор занимает озу в самый неподходящий момент. А процессоров с мощной встройкой и 3д кэш пока не делают. Есть конечно аномалии типа амд 395, где память под 250 гб/с, но цена такая, что дешевле ноут с процессором пошустрее и видюхой около флагманской в придачу.
Имея домашнюю лабу на 512гб озу, на первое место выходит место на диске. Хочется скачать все крупные модели, которые влезут в озу, а их в разных квантах наберётся пол сотни. Ссд на терабайт как кэш для запуска. И тут внезапно встаёт дилемма с схд в нагрузку. На авито истерика с нормальными хдд похлеще чем с видеокартами.
Дуал 2080ti с nvlink даёт до 100т/с на qwen 27b в q8. Контекст близкий к максимальному. Учитывая цену, сейчас это топ комплект для плотного квена. За последние 2 недели цены выросли % на 30. Чуть дешевле пара 3070м на 16гб, но скорость +-35 т/с в однопотоке, двухпоток 2х скорости.
Ждём мелкие qwen 3.8.
Ага, щас. Я в убунте не смог с наскока обновить драйвер нвидиа.
1,6 тб/с это считай как у 5090. В теории можно довольно шустро гигантские модели шевелить. Кими к3 до 30 т/с чисто но процессоре.
Мир полон чудес, когда не знаешь (плохо знаешь) физику ©
3.5 это типа отсылка на qwen 3.5?
Было бы здорово сравнить с другими платформами, например с интелом или amd Sp3 сокет
Нет, так не бывает. Во всем мире весь бензин обязательно с присадками. Не все из них октаноповышающие. Если смотреть на тот же мтбэ, это по сути присадка, она не вырабатывается напрямую из нефти на нпз.
Мма и тэс очень сильно отличаются по виду и запаху.
Про октан корректор конечно напрасно так. Я согласен, что всякие там хайгир и прочие брендовые толку мало. Но когда нет например 95ого, а есть только 92, то лучше все таки залить присадки, желательно с двойной дозой. Так же в продаже на маркетплейсах встречается мма монометиланилин, о котором упоминал ось в статье. Ничего плохого в этой присадке нет. Плохо будет, если на ней ездить постоянно десятки тысяч км. Мма очень плотно используется в атоспорте. Льют его безобразно много, по 10-15%. И даже в этом случае особо нагара и и т. П. Не страдают. Можно лить ацетон, смело до 15%. Можно лить толуол/ксилол 10%. Многократно лил самолично в самые современные моторы, все это только улучшает работу мотора, но это дороже готового бензина. В багажнике постоянно лежит что-то октаноповышающее на случай плохого бензина. Всем рекомендую.
Как же тогда системы старт-стоп бензин экономят, если при пуске бензина уйма тратиться. Эта уйма тратиться один раз при первом пуске и прогреве. Таксисты в очереди все глушат мотор.