Хабр Курсы для бэкендеров
РЕКЛАМА
Практикум, Хекслет, SkyPro, авторские курсы — собрали всех и попросили скидки. Осталось выбрать!

и вывод какой? все же MoE как раз оптимизация "обычныйх" нейронок
то есть выйгрыш в 70% и более уже закрывает много вопросов
а у вас в статье если я правильно понял описываются именно железячные "неоптимальности" и потери менее 10%
Есть предположение, что обновление драйвера может улучшить производительность. Stable сейчас 595, если хочется вообще свежак - 610 серию.
интересно, а на 5090 в принципе кто-то нормально запускает большие MoE модели или там сразу память заканчивается? и вопрос по самой статье - какая версия CUDA использовалась для тестов?
MoE на 5090 недобирает полтора раза, и дело не в маршрутизации