Обновить
16K+
12
Данила Поддубный@danyathewriter

Работаю в бигтехе c данными и в физике с мозгом.

17
Рейтинг
15
Подписчики
Отправить сообщение

держу за тебя кулачки, но мне кажется, что для MoE на 100-120млрд результат будет совсем близко неюзабельного, хотя очень уважаю твой эксперимент

мне кажется, что довольно неплохо, учитывая, что позволяет не на самой свежей карте переквалифицировать локальную модель из разряда не юзабельных совсем до "ну типа чет там будем крутить"

Согласен, что это все же скорее смена режима, в репо использовали CUDA 13, так что я думаю, что другие конфиги нет смысла пробовать. У драйверов Nvidia какая-то своя очень специфическая филосовия под Windows, которую мне пока что не удалось понять

Для Qwen3.8 27B  не будет действительно толку (чет я сонный это писал), но на опыте с Qwen3.6 я думаю можно ожидать какой-нибудь MoE релиз в ближайшем времени (может для 35B)

Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.

Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.

Я учел данные замечания, спасибо, что так внимательно прочитали мою статью

Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B

Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.

========================================================================================================================
ИТОГОВЫЙ ИНДЕКС ИИ-СЛОПА: 0.16 / 1.00  [human]
Похоже на текст, написанный либо вычитанный и доработанный человеком.
========================================================================================================================
[0.63] #############        1. Тире как универсальный знак препинания: тире в 62 из 125 абзацев (50%), 2.70 на 1000 символов
[0.08] ##                   2. Антитеза не X, а Y: встречается в 6 из 125 абзацев (5%)
[0.35] #######              3. Абзацы-обрывы в одну строку: однострочных абзацев-обрывов: 17 из 124 (14%); исключено псевдо-заголовков: 1
[0.29] ######               4. Заголовки-клиффхэнгеры: 17 заголовков, разброс длины ~2.2 слов, драматизирующих: 0 (0%)
[0.06] #                    5. Слова-связки без смысловой нагрузки: слов-связок без смысла: 1 (0.23 на 1000 слов)
[0.13] ###                  6. Афористичные концовки: встречается в 8 из 125 абзацев (6%)
[0.32] ######               7. Искусственная симметрия и триады: перечислений X, Y и Z: 5, списков из трех пунктов: 3 из 5
[0.00]                      8. Затухание конкретики к концу текста: тренд конкретности по 117 абзацам: наклон +0.20
[0.00]                      9. Неопределенная атрибуция и раздутая значимость: встречается в 0 из 125 абзацев (0%)
[0.00]                      10. Псевдо-искренность: встречается в 1 из 125 абзацев (1%)
========================================================================================================================

А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.

Если есть предложения более красивой формулировки - буду рад поправить.

C FreeToken GLM-5.2 на 753B при 40B активных умеещается на одной RTX PRO 6000, так что не соврал получается

вроде бы все таки cli есть https://github.com/MiniMax-AI/cli

у меня абсолютно ускользнуло от взора их cli!

Я на тот момент билдил с дев ветки, не очень сильно ждать хотелось

Скрытый текст
Небыстрая cuda?! Что здесь имелось ввиду? Есть много альтернатив? Ну то есть да, есть, но от других производителей с худшей пропускной способностью
Небыстрая cuda?! Что здесь имелось ввиду? Есть много альтернатив? Ну то есть да, есть, но от других производителей с худшей пропускной способностью

Очень толково, но мне кажется, что для дома бюджет не реалистичный, да и жена выгонит, если серверный шкаф будет гундеть 24 на 7.

Возможно, я очень старомоден, но я терпеть не могу Harness CI/CD. Хоть убейте не могу отвыкнуть от Jenkins

тут уже зависит, потому что на 5090 moe буду сильно быстере, там сумасшедная разница в пропускной способности, а вот в спарк тупо более крупные модели буду помещаться

сразу отвечу - 5090, будет примерно в 4 раза быстрее мака

потому что у MoE моделей считаются только активные веса (понятное дело, что там еще кэш и тд), но даже чисто гипотетически единовременных экспертов в памяти должно быть меньше, чем занимает qwen 3.5 27b

Что у AMD, что у Intel с этим была страшная беда еще 2 года назад, во времена когда я работал в одной синией конторе мы активно пытались это фиксить, так что сейчас, мне кажется ситуация значительно лучше, но мне кажется, что все еще очень далека от Nvidia и даже ВНЕЗАПНО Apple.

По идее если обе карты подключены в PCIe, то оно и будет бутылочным горлышком, но пропускная способность настолько высокая у интерфейса, что мне кажется должн быть не очень заметно.

1

Информация

В рейтинге
465-й
Зарегистрирован
Активность

Специализация

Бэкенд разработчик, Системный инженер