Данила Поддубный@danyathewriter
Работаю в бигтехе c данными и в физике с мозгом.
17
Рейтинг
15
Подписчики
Информация
- В рейтинге
- 465-й
- Зарегистрирован
- Активность
Специализация
Бэкенд разработчик, Системный инженер
Работаю в бигтехе c данными и в физике с мозгом.
держу за тебя кулачки, но мне кажется, что для MoE на 100-120млрд результат будет совсем близко неюзабельного, хотя очень уважаю твой эксперимент
мне кажется, что довольно неплохо, учитывая, что позволяет не на самой свежей карте переквалифицировать локальную модель из разряда не юзабельных совсем до "ну типа чет там будем крутить"
Согласен, что это все же скорее смена режима, в репо использовали CUDA 13, так что я думаю, что другие конфиги нет смысла пробовать. У драйверов Nvidia какая-то своя очень специфическая филосовия под Windows, которую мне пока что не удалось понять
Для Qwen3.8 27B не будет действительно толку (чет я сонный это писал), но на опыте с Qwen3.6 я думаю можно ожидать какой-нибудь MoE релиз в ближайшем времени (может для 35B)
Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.
Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.
Я учел данные замечания, спасибо, что так внимательно прочитали мою статью
Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B
Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.
А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.
Если есть предложения более красивой формулировки - буду рад поправить.
C FreeToken GLM-5.2 на 753B при 40B активных умеещается на одной RTX PRO 6000, так что не соврал получается
вроде бы все таки cli есть https://github.com/MiniMax-AI/cli
у меня абсолютно ускользнуло от взора их cli!
Я на тот момент билдил с дев ветки, не очень сильно ждать хотелось
Скрытый текст
Очень толково, но мне кажется, что для дома бюджет не реалистичный, да и жена выгонит, если серверный шкаф будет гундеть 24 на 7.
Возможно, я очень старомоден, но я терпеть не могу Harness CI/CD. Хоть убейте не могу отвыкнуть от Jenkins
тут уже зависит, потому что на 5090 moe буду сильно быстере, там сумасшедная разница в пропускной способности, а вот в спарк тупо более крупные модели буду помещаться
сразу отвечу - 5090, будет примерно в 4 раза быстрее мака
потому что у MoE моделей считаются только активные веса (понятное дело, что там еще кэш и тд), но даже чисто гипотетически единовременных экспертов в памяти должно быть меньше, чем занимает qwen 3.5 27b
Что у AMD, что у Intel с этим была страшная беда еще 2 года назад, во времена когда я работал в одной синией конторе мы активно пытались это фиксить, так что сейчас, мне кажется ситуация значительно лучше, но мне кажется, что все еще очень далека от Nvidia и даже ВНЕЗАПНО Apple.
По идее если обе карты подключены в PCIe, то оно и будет бутылочным горлышком, но пропускная способность настолько высокая у интерфейса, что мне кажется должн быть не очень заметно.