Обновить

753B на одной видеокарте: разбор FreeToken

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели18K
Всего голосов 17: ↑13 и ↓4+11
Комментарии26

Комментарии 26

Где б***ь 753B на одной видеокарте? Спасибо.

C FreeToken GLM-5.2 на 753B при 40B активных умеещается на одной RTX PRO 6000, так что не соврал получается

Плюс 400-500 Гб ОЗУ нужно.

И вот здесь главная боль, которая не про сами гигабайты, а про их непостоянство.

Главная боль в непостоянстве гигабайтов, понятно. Четырежды переваренный ии-слоп, который даже не потрудились вычитать. Фу таким быть.

А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.

Если есть предложения более красивой формулировки - буду рад поправить.

А что смущает в формулировки?

Непостоянство гигабайтов.

Но слопить статьи совесть не позволяет

Это предложение буквально эталон воды, которую льют нейронки.

Вообще, если читать статью вдумчиво, то в глазах рябить начинает от клифхенгеров уровня:

Сюжет, которого в датацентре просто нет.

И фронтир, ради которого заголовок.

и бесполезных попыток директивного управления вниманием читателя:

Здесь надо остановиться.

Вот это ядро работы, здесь стоит замедлиться.

А теперь самое наглядное.

И на косноязычность это не списать, это чистейший ии-слоп.

Если есть предложения более красивой формулировки - буду рад поправить.

Главная проблема заключается в нерегулярном расходе памяти.

Я учел данные замечания, спасибо, что так внимательно прочитали мою статью

Спасибо.

Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.

========================================================================================================================
ИТОГОВЫЙ ИНДЕКС ИИ-СЛОПА: 0.16 / 1.00  [human]
Похоже на текст, написанный либо вычитанный и доработанный человеком.
========================================================================================================================
[0.63] #############        1. Тире как универсальный знак препинания: тире в 62 из 125 абзацев (50%), 2.70 на 1000 символов
[0.08] ##                   2. Антитеза не X, а Y: встречается в 6 из 125 абзацев (5%)
[0.35] #######              3. Абзацы-обрывы в одну строку: однострочных абзацев-обрывов: 17 из 124 (14%); исключено псевдо-заголовков: 1
[0.29] ######               4. Заголовки-клиффхэнгеры: 17 заголовков, разброс длины ~2.2 слов, драматизирующих: 0 (0%)
[0.06] #                    5. Слова-связки без смысловой нагрузки: слов-связок без смысла: 1 (0.23 на 1000 слов)
[0.13] ###                  6. Афористичные концовки: встречается в 8 из 125 абзацев (6%)
[0.32] ######               7. Искусственная симметрия и триады: перечислений X, Y и Z: 5, списков из трех пунктов: 3 из 5
[0.00]                      8. Затухание конкретики к концу текста: тренд конкретности по 117 абзацам: наклон +0.20
[0.00]                      9. Неопределенная атрибуция и раздутая значимость: встречается в 0 из 125 абзацев (0%)
[0.00]                      10. Псевдо-искренность: встречается в 1 из 125 абзацев (1%)
========================================================================================================================

У меня на вашем тексте показывает 0.25, но не суть. Этот скрипт намеренно "мягкий" и детектит совсем уж откровенный слоп, от которого глаза вытекают. В вашем же случае текст не вычищен до конца от мусора.

Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.

Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.

Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать".

Я прошу прощения за излишнюю резкость, ваша статья стала вишенкой на торте из слоп-статей, которые я сегодня читал, но это меня не оправдывает. Вы правы, это не четырежды переваренный слоп, скорее статья со слоп-изюмом в некоторых абзацах.

Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.

Могу, но не буду. Использование ИИ при подготовке статьей это абсолютно нормально. Мои претензии сугубо к качеству формулировок, которые добавляют воды и пафоса без какого-то смысла или задумки. Из-за это физически тяжело воспринимать текст вдумчиво.

Не все что и вас написано в статье, уже на самом деле реализовано в коде. А так идеи интересные, надо будет попробовать внедрить это в llama.cpp

Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B

Qwen3.8 27B плотная, ИМХО не будет большого эффекта для нее от этой технологии.

Для Qwen3.8 27B  не будет действительно толку (чет я сонный это писал), но на опыте с Qwen3.6 я думаю можно ожидать какой-нибудь MoE релиз в ближайшем времени (может для 35B)

А я вот жду поддержку AMD :)

Хвост TTFT как граница работоспособности — самый полезный тезис здесь: средний tok/s ничего не говорит, когда харнесс отваливается по таймауту на десятом вызове инструмента. Зацепилась за оговорку про пиннинг: если пул экспертов не удается зарегистрировать под DMA, откат на чисто CPU-шный бэкенд обнуляет всю конструкцию с q*, и это уже не мелкое ограничение, а другой режим работы. Не встречали, при каких конфигурациях драйвера под Windows этот откат срабатывает на практике — он виден в логах явно или только по проседанию скорости?

Согласен, что это все же скорее смена режима, в репо использовали CUDA 13, так что я думаю, что другие конфиги нет смысла пробовать. У драйверов Nvidia какая-то своя очень специфическая филосовия под Windows, которую мне пока что не удалось понять

Подставим их же измеренные на стенде пропускные и посмотрим, какая доля промахов уезжает по PCIe на разных машинах:

а как у вас так получилось, что на 4060 процент промахов ниже, чем на 5090, у которой банально памяти в 4 раза больше?

я потестил это, при помощи некоторых махинаций я внедрил все фишки freetoken в llama.cpp и получил утроение скорости Qwen 3.6 35B-A3B в q4km, а конкретно с 9t/s до 21~ в среднем, Gemma 4 26b-a4b ускорилась примерно до 17 токенов с 7... насчёт prefill сказать нечего, я просто батчи задрал до 4096/1024 и получал до 700т/с, запускалось всё это на 2696v3 с 48гб ddr3 на видеокарте rtx3070m...

мне кажется, что довольно неплохо, учитывая, что позволяет не на самой свежей карте переквалифицировать локальную модель из разряда не юзабельных совсем до "ну типа чет там будем крутить"

позже разогнал до 27 стабильных токенов... гемму до 19... думаю тут есть ещё простор для оптимизации, вернее, в оригинальном репозитории всё стерильно, я перелопатил некоторые репозитории, чтобы одолжить идеи, результат себя оправдал, в теории, если докинуть немного озу, до 128, хотя бы, что для ddr3 не так дорого, то можно будет запускать MoE на 100-120млрд параметров, типо того же qwen 3.8 next, токенов 10 мб будет, если немного добрать видеопамять, то и все 15-20 наверное получится выжать

держу за тебя кулачки, но мне кажется, что для MoE на 100-120млрд результат будет совсем близко неюзабельного, хотя очень уважаю твой эксперимент

ага, я это проверял, оно не заработало толком на 8гб, от 16 уже можно разгуляться

Есть 5060ti на 16 Гб, Тесла v100 на 32 Гб и 2 компа на зёрнах с 128 и 32 ddr4 ОЗУ. Попрошу помощи что мне на этом запустить с юзабельной скоростью? Карты в принципе даже смешать можно, т.к. по идее есть возможность БП помощнее поставить. Но я пока думал докупить на второй памяти и попробовать 2 запустить-одну на сильную модель и остальные на экспертов.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации