Обновить

753B на одной видеокарте: разбор FreeToken

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели14K
Всего голосов 15: ↑11 и ↓4+8
Комментарии20

Комментарии 20

Где б***ь 753B на одной видеокарте? Спасибо.

C FreeToken GLM-5.2 на 753B при 40B активных умеещается на одной RTX PRO 6000, так что не соврал получается

Плюс 400-500 Гб ОЗУ нужно.

И вот здесь главная боль, которая не про сами гигабайты, а про их непостоянство.

Главная боль в непостоянстве гигабайтов, понятно. Четырежды переваренный ии-слоп, который даже не потрудились вычитать. Фу таким быть.

А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.

Если есть предложения более красивой формулировки - буду рад поправить.

А что смущает в формулировки?

Непостоянство гигабайтов.

Но слопить статьи совесть не позволяет

Это предложение буквально эталон воды, которую льют нейронки.

Вообще, если читать статью вдумчиво, то в глазах рябить начинает от клифхенгеров уровня:

Сюжет, которого в датацентре просто нет.

И фронтир, ради которого заголовок.

и бесполезных попыток директивного управления вниманием читателя:

Здесь надо остановиться.

Вот это ядро работы, здесь стоит замедлиться.

А теперь самое наглядное.

И на косноязычность это не списать, это чистейший ии-слоп.

Если есть предложения более красивой формулировки - буду рад поправить.

Главная проблема заключается в нерегулярном расходе памяти.

Я учел данные замечания, спасибо, что так внимательно прочитали мою статью

Спасибо.

Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.

========================================================================================================================
ИТОГОВЫЙ ИНДЕКС ИИ-СЛОПА: 0.16 / 1.00  [human]
Похоже на текст, написанный либо вычитанный и доработанный человеком.
========================================================================================================================
[0.63] #############        1. Тире как универсальный знак препинания: тире в 62 из 125 абзацев (50%), 2.70 на 1000 символов
[0.08] ##                   2. Антитеза не X, а Y: встречается в 6 из 125 абзацев (5%)
[0.35] #######              3. Абзацы-обрывы в одну строку: однострочных абзацев-обрывов: 17 из 124 (14%); исключено псевдо-заголовков: 1
[0.29] ######               4. Заголовки-клиффхэнгеры: 17 заголовков, разброс длины ~2.2 слов, драматизирующих: 0 (0%)
[0.06] #                    5. Слова-связки без смысловой нагрузки: слов-связок без смысла: 1 (0.23 на 1000 слов)
[0.13] ###                  6. Афористичные концовки: встречается в 8 из 125 абзацев (6%)
[0.32] ######               7. Искусственная симметрия и триады: перечислений X, Y и Z: 5, списков из трех пунктов: 3 из 5
[0.00]                      8. Затухание конкретики к концу текста: тренд конкретности по 117 абзацам: наклон +0.20
[0.00]                      9. Неопределенная атрибуция и раздутая значимость: встречается в 0 из 125 абзацев (0%)
[0.00]                      10. Псевдо-искренность: встречается в 1 из 125 абзацев (1%)
========================================================================================================================

У меня на вашем тексте показывает 0.25, но не суть. Этот скрипт намеренно "мягкий" и детектит совсем уж откровенный слоп, от которого глаза вытекают. В вашем же случае текст не вычищен до конца от мусора.

Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.

Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.

Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать".

Я прошу прощения за излишнюю резкость, ваша статья стала вишенкой на торте из слоп-статей, которые я сегодня читал, но это меня не оправдывает. Вы правы, это не четырежды переваренный слоп, скорее статья со слоп-изюмом в некоторых абзацах.

Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.

Могу, но не буду. Использование ИИ при подготовке статьей это абсолютно нормально. Мои претензии сугубо к качеству формулировок, которые добавляют воды и пафоса без какого-то смысла или задумки. Из-за это физически тяжело воспринимать текст вдумчиво.

Не все что и вас написано в статье, уже на самом деле реализовано в коде. А так идеи интересные, надо будет попробовать внедрить это в llama.cpp

Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B

Qwen3.8 27B плотная, ИМХО не будет большого эффекта для нее от этой технологии.

Для Qwen3.8 27B  не будет действительно толку (чет я сонный это писал), но на опыте с Qwen3.6 я думаю можно ожидать какой-нибудь MoE релиз в ближайшем времени (может для 35B)

А я вот жду поддержку AMD :)

Хвост TTFT как граница работоспособности — самый полезный тезис здесь: средний tok/s ничего не говорит, когда харнесс отваливается по таймауту на десятом вызове инструмента. Зацепилась за оговорку про пиннинг: если пул экспертов не удается зарегистрировать под DMA, откат на чисто CPU-шный бэкенд обнуляет всю конструкцию с q*, и это уже не мелкое ограничение, а другой режим работы. Не встречали, при каких конфигурациях драйвера под Windows этот откат срабатывает на практике — он виден в логах явно или только по проседанию скорости?

Согласен, что это все же скорее смена режима, в репо использовали CUDA 13, так что я думаю, что другие конфиги нет смысла пробовать. У драйверов Nvidia какая-то своя очень специфическая филосовия под Windows, которую мне пока что не удалось понять

Подставим их же измеренные на стенде пропускные и посмотрим, какая доля промахов уезжает по PCIe на разных машинах:

а как у вас так получилось, что на 4060 процент промахов ниже, чем на 5090, у которой банально памяти в 4 раза больше?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации