Обновить

Как мы запускали NVME over RDMA под Alt Virtualization p11 с Huawei Dorado 5000V6. Уроки импортозамещения

Уровень сложностиСредний
Время на прочтение53 мин
Охват и читатели8K
Всего голосов 14: ↑14 и ↓0+18
Комментарии7

Комментарии 7

часто немного лукавят и имеют в виду не NVME over ROCEv2, а NVME over TCP. Это не RDMA в его исходном смысле.

А вот это не подсветите? В чем разница, не в смысле, а в цифрах? 384К иопс с РДМА, а сколько без на том же железе?

Эти данные где-то лежат, но не факт, что их получится найти. Помню лишь на голом 100GbE Ethernet тест через коммутатор показывал в районе 50Gb/sec, что мало. С iops тоже было слабовато, но это на ненастроенных хостах. При тщательной настройке это всё можно улучшить. И конечно, лучше всё это делать под конкретные приложения.

Dorado старается выдавать хорошие iops (два контроллера и много памяти обязывают), поэтому здесь, наверное, не очень корректно получится выполнить сравнение между rdma и не-rdma.

Утверждается, что в среднем по больнице, RDMA быстрее обычной передачи ~30%, что и указано. Мне попадало много статей о сравнении ROCEv2 с другими протоколами (FC/iWARP) с разборами причин. Они достаточно хорошо ищутся в интернет. у FC производительность примерно та же самая, но RDMA - это Ethernet-сеть, которая администрируется обычным сетевым инженером.




Статьи с объяснениями я читал, там пишут как 10-15%, так и 30. Но это всегда гипотетические рассуждения, ни разу не видел реальных измерений.

Так-то 10-15% - маловато чтобы городить огород. А вот 50Gb/sec и С iops тоже было слабовато - это уже в 2 раза меньшая производительность. И тут стоит подумать.

Сравнительных исследований, причём лабораторных, достаточно. Внимательнее поищите. Мерянья цифрами между протоколами закончились ещё около 10 лет назад.

Первая попавшаяся мне статья. Тут про сравнение Infiniband, ROCE и Ethernet:
https://sc16.supercomputing.org/sc-archive/tech_poster/poster_files/post149s2-file3.pdf

Но надо всегда понимать, кто и для чего их писал.

NVME over RDMA - хороший выход для тех, кому нужна хорошая производительность, но нет желания городить параллельную структуру FC SAN.



Со 100% достоверностью подтверждаю, что разница между NVMe over TCP и RoCEv2 всего 15% (проверено неоднократно на самом разном оборудовании - карточках и т.д.). Все эти танцы с бубном вокруг RDMA для развлечения сойдут (типа делаю R&D). Но в промышленной эксплуатации смысла не имеют. Практика показала - что тупая конфигурация PCIe5+200GBit card+200Gbit iSCSI - без всяких затей и денежных трат на разрабочиков с DevOps-ами - бьет все выше перечисленное в рамках price/performance. Знаю компанию которая выкинула в мусор 500 млн руб на эту развлекаловку. Технология 2015г (NVMe+RDMA) - по большому счету за 11 лет существования ничего особенного не продемонстрировала и мссово не пошла в рынок (факт).

Я тоже не вижу смысла загоняться в РДМА и строю сеть под диски на двухголовых 100Г. Дешево и сердито. Но и коммутаторов с рдма я не щупал, поэтому и хотел реальные замеры посмотреть. Собственные ощущения к делу не пришьешь.

"Да, дураки они в этой своей Nvidia сидят! PFC, какие-то... ETS, ECN - голова пухнет... UEC консорциум зачем-то собрали, ROCEv3 придумывают. То ли дело iscsi+100GbE карты". Пришёл vasek07 и всех разоблачил.

RDMA создавался для того, чтобы преодолеть проблемы TCP sawteeth или "пила TCP", он не работает через TCP стек. Зато у вас они никуда не исчезают, хоть вы 400GbE адаптеры возьмите. И с ретрансмитами проблема остаётся, особенно на больших размерах кадра.

И lossless в традиционной схеме не может появиться из ниоткуда, если его никто специально не настраивает - его нет.

Ваш трафик от источника к приемнику в вашей схеме как-то ушёл и как-то пришёл. Качество кабелей и коммутация на коротких расстояниях сейчас достаточно хорошее, и в большинстве случаев ваш подход работать будет (iscsi+100gbe), но далеко не всегда.

Мы тоже любим экономить, но так, чтобы "кроилово не вело к попадалову". Сейчас есть понимание того, что FC достаточно хорошо заменяется на NVME over RDMA (для этого всё и делалось, никаких R&D)

У Maipu(Cофинет) на коммутаторах нет никаких лицензий. maipu у себя пишет one time investment. Ощутимая разница от HPE/Brocade.

P.S. Про компанию и 500 млн руб - пруфы будут? Можете в личку кинуть. В "крупных" компаниях вам за профуканные 500 т. руб. голову отвинтят, что на три порядка меньше. Без плана и пилота такие вещи не делаются.


Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации