Комментарии 26
Где б***ь 753B на одной видеокарте? Спасибо.
И вот здесь главная боль, которая не про сами гигабайты, а про их непостоянство.
Главная боль в непостоянстве гигабайтов, понятно. Четырежды переваренный ии-слоп, который даже не потрудились вычитать. Фу таким быть.
А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.
Если есть предложения более красивой формулировки - буду рад поправить.
А что смущает в формулировки?
Непостоянство гигабайтов.
Но слопить статьи совесть не позволяет
Это предложение буквально эталон воды, которую льют нейронки.
Вообще, если читать статью вдумчиво, то в глазах рябить начинает от клифхенгеров уровня:
Сюжет, которого в датацентре просто нет.
И фронтир, ради которого заголовок.
и бесполезных попыток директивного управления вниманием читателя:
Здесь надо остановиться.
Вот это ядро работы, здесь стоит замедлиться.
А теперь самое наглядное.
И на косноязычность это не списать, это чистейший ии-слоп.
Если есть предложения более красивой формулировки - буду рад поправить.
Главная проблема заключается в нерегулярном расходе памяти.
Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.
========================================================================================================================
ИТОГОВЫЙ ИНДЕКС ИИ-СЛОПА: 0.16 / 1.00 [human]
Похоже на текст, написанный либо вычитанный и доработанный человеком.
========================================================================================================================
[0.63] ############# 1. Тире как универсальный знак препинания: тире в 62 из 125 абзацев (50%), 2.70 на 1000 символов
[0.08] ## 2. Антитеза не X, а Y: встречается в 6 из 125 абзацев (5%)
[0.35] ####### 3. Абзацы-обрывы в одну строку: однострочных абзацев-обрывов: 17 из 124 (14%); исключено псевдо-заголовков: 1
[0.29] ###### 4. Заголовки-клиффхэнгеры: 17 заголовков, разброс длины ~2.2 слов, драматизирующих: 0 (0%)
[0.06] # 5. Слова-связки без смысловой нагрузки: слов-связок без смысла: 1 (0.23 на 1000 слов)
[0.13] ### 6. Афористичные концовки: встречается в 8 из 125 абзацев (6%)
[0.32] ###### 7. Искусственная симметрия и триады: перечислений X, Y и Z: 5, списков из трех пунктов: 3 из 5
[0.00] 8. Затухание конкретики к концу текста: тренд конкретности по 117 абзацам: наклон +0.20
[0.00] 9. Неопределенная атрибуция и раздутая значимость: встречается в 0 из 125 абзацев (0%)
[0.00] 10. Псевдо-искренность: встречается в 1 из 125 абзацев (1%)
========================================================================================================================У меня на вашем тексте показывает 0.25, но не суть. Этот скрипт намеренно "мягкий" и детектит совсем уж откровенный слоп, от которого глаза вытекают. В вашем же случае текст не вычищен до конца от мусора.
Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.
Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.
Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать".
Я прошу прощения за излишнюю резкость, ваша статья стала вишенкой на торте из слоп-статей, которые я сегодня читал, но это меня не оправдывает. Вы правы, это не четырежды переваренный слоп, скорее статья со слоп-изюмом в некоторых абзацах.
Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.
Могу, но не буду. Использование ИИ при подготовке статьей это абсолютно нормально. Мои претензии сугубо к качеству формулировок, которые добавляют воды и пафоса без какого-то смысла или задумки. Из-за это физически тяжело воспринимать текст вдумчиво.
Не все что и вас написано в статье, уже на самом деле реализовано в коде. А так идеи интересные, надо будет попробовать внедрить это в llama.cpp
Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B
Хвост TTFT как граница работоспособности — самый полезный тезис здесь: средний tok/s ничего не говорит, когда харнесс отваливается по таймауту на десятом вызове инструмента. Зацепилась за оговорку про пиннинг: если пул экспертов не удается зарегистрировать под DMA, откат на чисто CPU-шный бэкенд обнуляет всю конструкцию с q*, и это уже не мелкое ограничение, а другой режим работы. Не встречали, при каких конфигурациях драйвера под Windows этот откат срабатывает на практике — он виден в логах явно или только по проседанию скорости?
Подставим их же измеренные на стенде пропускные и посмотрим, какая доля промахов уезжает по PCIe на разных машинах:
а как у вас так получилось, что на 4060 процент промахов ниже, чем на 5090, у которой банально памяти в 4 раза больше?
я потестил это, при помощи некоторых махинаций я внедрил все фишки freetoken в llama.cpp и получил утроение скорости Qwen 3.6 35B-A3B в q4km, а конкретно с 9t/s до 21~ в среднем, Gemma 4 26b-a4b ускорилась примерно до 17 токенов с 7... насчёт prefill сказать нечего, я просто батчи задрал до 4096/1024 и получал до 700т/с, запускалось всё это на 2696v3 с 48гб ddr3 на видеокарте rtx3070m...
мне кажется, что довольно неплохо, учитывая, что позволяет не на самой свежей карте переквалифицировать локальную модель из разряда не юзабельных совсем до "ну типа чет там будем крутить"
позже разогнал до 27 стабильных токенов... гемму до 19... думаю тут есть ещё простор для оптимизации, вернее, в оригинальном репозитории всё стерильно, я перелопатил некоторые репозитории, чтобы одолжить идеи, результат себя оправдал, в теории, если докинуть немного озу, до 128, хотя бы, что для ddr3 не так дорого, то можно будет запускать MoE на 100-120млрд параметров, типо того же qwen 3.8 next, токенов 10 мб будет, если немного добрать видеопамять, то и все 15-20 наверное получится выжать
держу за тебя кулачки, но мне кажется, что для MoE на 100-120млрд результат будет совсем близко неюзабельного, хотя очень уважаю твой эксперимент
Есть 5060ti на 16 Гб, Тесла v100 на 32 Гб и 2 компа на зёрнах с 128 и 32 ddr4 ОЗУ. Попрошу помощи что мне на этом запустить с юзабельной скоростью? Карты в принципе даже смешать можно, т.к. по идее есть возможность БП помощнее поставить. Но я пока думал докупить на второй памяти и попробовать 2 запустить-одну на сильную модель и остальные на экспертов.

753B на одной видеокарте: разбор FreeToken