Мне не принципиально, просто объяснил что откуда брал, т.к. пока не понятно дает ли что то, тем-более в моем случае с такой гетерогенной системой. У меня вообще желание добить до конца взять актуальное решение и разобраться с адаптацией под новые драйвера, в моем случае я на этом же пк ещё играю, тем-более в будущих драйверах может ещё что накопают, а применить решение от новых драйверов к старым может быть невозможно. Теплится надежда что может быть и rt на CMP 50hx разлочат а не фиктивные циферки напишут, хотя это маловероятно.
Хм. Сделал ещё один тест и обнаружил что nccl при попытке использовать p2p ложится наглухо. Или я наворотил что то не так, ну или что то надо ещё. Возможно по этому не видно толком приростов.
Мне удалось p2p судя по параметрам тестов активировать на CMP 50hx 20gb + rtx 4070 12 gb, в режиме x8 с разделением слотов x8/x8 непонятно дало ли что то, возможно +4 токена плюсом выползло. Ещё надо посмотреть на модели которая 1 к 1 на видеокартах помещается, там пик был 65. @iatethelogsсори что заставил дополнительно покопаться, видимо затык где то в другом месте.
Это да. Пока потенциально есть понимание после PCI-E gen 1 x16, в decode что то изменилось? Или пока только в худшую сторону? Latency между картами уменьшилось до 5 us, при обмене? Кстати. Если у вас p2p x16, у меня x8 те же скорости. Мне больше интересно подтвердилось ли моё предположение, о том что p2p даст ещё прироста? или вышло копейки?
А я думал когда относительная влажность воздуха при данной температуре воздуха в точки соприкосновения превышает 100% . но да, у топикстартера не будет, на кондиционере будет на видюхах маловероятно. Но относительную влажность я бы прочекал так на всякий пожарный, чтобы запас был. А так если общая окружающая 9 градусов, к примеру отнс.влажность 30, воздух нагрелся в точке соприкосновения до 12 градусов, отн. стала 26%, т.к. абсорбционная способность воздуха стала выше, ну подсосет где нибудь чуть влажности,
воздух коснулся элемента где 9 градусов, ну вернется относительная влажность 30%-30.3%, конденсат не выпадет.
Эт так прикидки. Пытался больше понять пока писал вообще возможна ли данная ситуация.
Просто у меня мод на 20 гигов. Но сути не меняет и она на уровень ниже rtx 4070. Например в PP я на двух qwen 3.8 27b получаю 1000-1500 на 64 к, и 40-60 tg с мтп в зависимости от задач. И разница у меня с layer и PP минимальная 10-15% и больше дает стабильности генерации и уменьшения падения производительности, но не более. Как сказал активировать p2p имеет смысл, как раз p2p лочат с серии rtx 3000, на 2000 вроде ещё должен работать, ток на CMP залочен из коробки, но уже на сколько знаю заставляли китайцы работать, человек который патч под CMP 50hx 20gb делает пока другим занялся, т.к. p2p у него нормально вроде не будет работать из за двухпроцовой материнки видюхи к разным процам подключены. В общем вам как идея на покопать, возможно ещё сверх лимита выжмите. У меня времени нет из-за личных обстоятельств сесть и покопать нормально, дома не более часа могу за компом провести :-(
Ps: и ещё момент, чтобы p2p заработал, материнка должна уметь шарить обмен между двумя слотами, к примеру если оба x16 на x8/x8 или на x79 с Xeon некоторые Китай платы умеют два слота в x16. Это из того что нарыл и прикидывал.
Сразу оговорюсь, текст ниже основан на предположениях и наблюдениях, и вычитках из статей других людей, по факту надо испытать на этих.
Pci-e может в p2p, без nvlink, но в nvidia лочат на уровне дров, суть в чем, что если phb режим, то обмен идёт все равно через проц, это примерно 15-20 us задержка обмена данными, а если видюхи будут напрямую общаться с друг другом в тензорном режиме по p2p то latency 1-5us, как говорю я заметил один момент на своей системе, rtx 4070 и CMP 50hx в тензорном. Обе видюхи нагружены на 100%, сплит 1 в 1, но скорость я получаю почти такую же как в layer, как раз из за гетерогенности системы и долгого обмена между слотами в режиме phb, причем другой человек с двумя CMP 50hx получает в этом же режиме больше, у него серверная плата и там latency меньше,. В decode требования к пропускной способности ниже, но важна скорость обмена. И как говорил чисто наблюдение и эксперименты с искусственным занижением скорости decode и стрекотанием дросселей, во всех случаях power был одинаковый и нагрузка GPU 100% но в зависимости от скорости декодирования он изменяется, меньше скорость реже стрекот, выше скорость чаще стрекот, а это говорит о том что нагрузка потребления не постоянная, но информационные датчики которые выводят нагрузку они выводят среднепиковую не на условный такт, а на секунду или другой более мелкий отрезок времени, в итоге информационные датчики которые рапортую о нагрузке не показывают реальную картину, на самом деле нагрузка 10,100,13,97,7,84,15,99 и т.д. а в среднепиковая будет в итоге 100, скорее всего датчики отображают максимальную на отрезок времени.
P2p попробуйте ещё активировать, по идее должен decode ещё подрасти. Тк. На CMP 50hx с этой проблемой столкнулся. GPU грузится на 100% но по стрекотанию дросселей и скорости генерации понятно, что узкое место именно latency 15-20 us, в p2p должно быть около 5 us, что скорость генерации может ещё повысить и позволит получить не 34.4% а возможно 50%+ но надо сделать и тестить.
Мне не принципиально, просто объяснил что откуда брал, т.к. пока не понятно дает ли что то, тем-более в моем случае с такой гетерогенной системой. У меня вообще желание добить до конца взять актуальное решение и разобраться с адаптацией под новые драйвера, в моем случае я на этом же пк ещё играю, тем-более в будущих драйверах может ещё что накопают, а применить решение от новых драйверов к старым может быть невозможно. Теплится надежда что может быть и rt на CMP 50hx разлочат а не фиктивные циферки напишут, хотя это маловероятно.
Я использовал решение xrip , сделав форк, применив патчи из предложения от https://github.com/xrip/cmp50hx-unlock/issues/14 но слегка по другому, пересобрал патчи на основе issues14, и накатил патч из 615 https://github.com/aikitoria/open-gpu-kernel-modules с адаптацией к 610.43.03 но только для https://github.com/aikitoria/open-gpu-kernel-modules/blob/c8bff5400e2fc8bda4cb9a141fb596aad607a35f/patch-libcuda-p2p.py#L4 вроде ток он был нужен для используемой мной связки и возможно я тут жестко накосячил, был уже третий час ночи, кормил дочь, и жонглировал дипсиком и локальной моделью. Я пользуюсь сейчас llama.cpp думал ещё ninfere попробовать, vllm не пробовал. Потому что пока p2p нет, и смысла не было особо. Вы для 50 hx и гибридный p2p тоже будете подливать/подлили?
Хм. Сделал ещё один тест и обнаружил что nccl при попытке использовать p2p ложится наглухо. Или я наворотил что то не так, ну или что то надо ещё. Возможно по этому не видно толком приростов.
Мне удалось p2p судя по параметрам тестов активировать на CMP 50hx 20gb + rtx 4070 12 gb, в режиме x8 с разделением слотов x8/x8 непонятно дало ли что то, возможно +4 токена плюсом выползло. Ещё надо посмотреть на модели которая 1 к 1 на видеокартах помещается, там пик был 65. @iatethelogsсори что заставил дополнительно покопаться, видимо затык где то в другом месте.
Это да. Пока потенциально есть понимание после PCI-E gen 1 x16, в decode что то изменилось? Или пока только в худшую сторону? Latency между картами уменьшилось до 5 us, при обмене? Кстати. Если у вас p2p x16, у меня x8 те же скорости. Мне больше интересно подтвердилось ли моё предположение, о том что p2p даст ещё прироста? или вышло копейки?
А я думал когда относительная влажность воздуха при данной температуре воздуха в точки соприкосновения превышает 100% . но да, у топикстартера не будет, на кондиционере будет на видюхах маловероятно. Но относительную влажность я бы прочекал так на всякий пожарный, чтобы запас был. А так если общая окружающая 9 градусов, к примеру отнс.влажность 30, воздух нагрелся в точке соприкосновения до 12 градусов, отн. стала 26%, т.к. абсорбционная способность воздуха стала выше, ну подсосет где нибудь чуть влажности,
воздух коснулся элемента где 9 градусов, ну вернется относительная влажность 30%-30.3%, конденсат не выпадет.
Эт так прикидки. Пытался больше понять пока писал вообще возможна ли данная ситуация.
Просто у меня мод на 20 гигов. Но сути не меняет и она на уровень ниже rtx 4070. Например в PP я на двух qwen 3.8 27b получаю 1000-1500 на 64 к, и 40-60 tg с мтп в зависимости от задач. И разница у меня с layer и PP минимальная 10-15% и больше дает стабильности генерации и уменьшения падения производительности, но не более. Как сказал активировать p2p имеет смысл, как раз p2p лочат с серии rtx 3000, на 2000 вроде ещё должен работать, ток на CMP залочен из коробки, но уже на сколько знаю заставляли китайцы работать, человек который патч под CMP 50hx 20gb делает пока другим занялся, т.к. p2p у него нормально вроде не будет работать из за двухпроцовой материнки видюхи к разным процам подключены. В общем вам как идея на покопать, возможно ещё сверх лимита выжмите. У меня времени нет из-за личных обстоятельств сесть и покопать нормально, дома не более часа могу за компом провести :-(
Ps: и ещё момент, чтобы p2p заработал, материнка должна уметь шарить обмен между двумя слотами, к примеру если оба x16 на x8/x8 или на x79 с Xeon некоторые Китай платы умеют два слота в x16. Это из того что нарыл и прикидывал.
Сразу оговорюсь, текст ниже основан на предположениях и наблюдениях, и вычитках из статей других людей, по факту надо испытать на этих.
Pci-e может в p2p, без nvlink, но в nvidia лочат на уровне дров, суть в чем, что если phb режим, то обмен идёт все равно через проц, это примерно 15-20 us задержка обмена данными, а если видюхи будут напрямую общаться с друг другом в тензорном режиме по p2p то latency 1-5us, как говорю я заметил один момент на своей системе, rtx 4070 и CMP 50hx в тензорном. Обе видюхи нагружены на 100%, сплит 1 в 1, но скорость я получаю почти такую же как в layer, как раз из за гетерогенности системы и долгого обмена между слотами в режиме phb, причем другой человек с двумя CMP 50hx получает в этом же режиме больше, у него серверная плата и там latency меньше,. В decode требования к пропускной способности ниже, но важна скорость обмена. И как говорил чисто наблюдение и эксперименты с искусственным занижением скорости decode и стрекотанием дросселей, во всех случаях power был одинаковый и нагрузка GPU 100% но в зависимости от скорости декодирования он изменяется, меньше скорость реже стрекот, выше скорость чаще стрекот, а это говорит о том что нагрузка потребления не постоянная, но информационные датчики которые выводят нагрузку они выводят среднепиковую не на условный такт, а на секунду или другой более мелкий отрезок времени, в итоге информационные датчики которые рапортую о нагрузке не показывают реальную картину, на самом деле нагрузка 10,100,13,97,7,84,15,99 и т.д. а в среднепиковая будет в итоге 100, скорее всего датчики отображают максимальную на отрезок времени.
P2p попробуйте ещё активировать, по идее должен decode ещё подрасти. Тк. На CMP 50hx с этой проблемой столкнулся. GPU грузится на 100% но по стрекотанию дросселей и скорости генерации понятно, что узкое место именно latency 15-20 us, в p2p должно быть около 5 us, что скорость генерации может ещё повысить и позволит получить не 34.4% а возможно 50%+ но надо сделать и тестить.