Комментарии 20
Где б***ь 753B на одной видеокарте? Спасибо.
И вот здесь главная боль, которая не про сами гигабайты, а про их непостоянство.
Главная боль в непостоянстве гигабайтов, понятно. Четырежды переваренный ии-слоп, который даже не потрудились вычитать. Фу таким быть.
А что смущает в формулировки? ИИ я конечно использую для редактуры, но слопить статьи совесть не позволяет, так что это скорее моя собственная косоязычность и невнимательность. У меня действительно в тестах стабильно есть проблема, что при сохранении рабочего сетапа примерно 0.5 видеопамяти плавает и в один момент модель падает с OOM, а при более скромной квантизации видеокарта просто не загружается примерно на то количество, которое позволит запустить более агрессивную квантизацию.
Если есть предложения более красивой формулировки - буду рад поправить.
А что смущает в формулировки?
Непостоянство гигабайтов.
Но слопить статьи совесть не позволяет
Это предложение буквально эталон воды, которую льют нейронки.
Вообще, если читать статью вдумчиво, то в глазах рябить начинает от клифхенгеров уровня:
Сюжет, которого в датацентре просто нет.
И фронтир, ради которого заголовок.
и бесполезных попыток директивного управления вниманием читателя:
Здесь надо остановиться.
Вот это ядро работы, здесь стоит замедлиться.
А теперь самое наглядное.
И на косноязычность это не списать, это чистейший ии-слоп.
Если есть предложения более красивой формулировки - буду рад поправить.
Главная проблема заключается в нерегулярном расходе памяти.
Обнаружил у вас в блоге статью о проблемах использвания ИИ в написании статей, в поисках ответов, как я мог бы улучшить свою редактуру. Все таки очень грубое мнение у вас о моей работе сложилось.
========================================================================================================================
ИТОГОВЫЙ ИНДЕКС ИИ-СЛОПА: 0.16 / 1.00 [human]
Похоже на текст, написанный либо вычитанный и доработанный человеком.
========================================================================================================================
[0.63] ############# 1. Тире как универсальный знак препинания: тире в 62 из 125 абзацев (50%), 2.70 на 1000 символов
[0.08] ## 2. Антитеза не X, а Y: встречается в 6 из 125 абзацев (5%)
[0.35] ####### 3. Абзацы-обрывы в одну строку: однострочных абзацев-обрывов: 17 из 124 (14%); исключено псевдо-заголовков: 1
[0.29] ###### 4. Заголовки-клиффхэнгеры: 17 заголовков, разброс длины ~2.2 слов, драматизирующих: 0 (0%)
[0.06] # 5. Слова-связки без смысловой нагрузки: слов-связок без смысла: 1 (0.23 на 1000 слов)
[0.13] ### 6. Афористичные концовки: встречается в 8 из 125 абзацев (6%)
[0.32] ###### 7. Искусственная симметрия и триады: перечислений X, Y и Z: 5, списков из трех пунктов: 3 из 5
[0.00] 8. Затухание конкретики к концу текста: тренд конкретности по 117 абзацам: наклон +0.20
[0.00] 9. Неопределенная атрибуция и раздутая значимость: встречается в 0 из 125 абзацев (0%)
[0.00] 10. Псевдо-искренность: встречается в 1 из 125 абзацев (1%)
========================================================================================================================У меня на вашем тексте показывает 0.25, но не суть. Этот скрипт намеренно "мягкий" и детектит совсем уж откровенный слоп, от которого глаза вытекают. В вашем же случае текст не вычищен до конца от мусора.
Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать". Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.
Скор другой из-за того, что я нейронку на Gemini 3.7 Flash менял, чтобы она больше каких-то деталей нашла.
Видите, все же это лишь неакуратная редактура чем "Четырежды переваренный ии-слоп, который даже не потрудились вычитать".
Я прошу прощения за излишнюю резкость, ваша статья стала вишенкой на торте из слоп-статей, которые я сегодня читал, но это меня не оправдывает. Вы правы, это не четырежды переваренный слоп, скорее статья со слоп-изюмом в некоторых абзацах.
Можете сделать более хардкорную версию и нести свет на всем Хабре выжигаю огнем и мечем злосных пользователей триклятого ИИ.
Могу, но не буду. Использование ИИ при подготовке статьей это абсолютно нормально. Мои претензии сугубо к качеству формулировок, которые добавляют воды и пафоса без какого-то смысла или задумки. Из-за это физически тяжело воспринимать текст вдумчиво.
Не все что и вас написано в статье, уже на самом деле реализовано в коде. А так идеи интересные, надо будет попробовать внедрить это в llama.cpp
Там у них много открытых issues на GitHub. Из самых любпытных, которые, мне кажется, ждут больше всего - это поддержка нескольких видеокарт и конечно же Qwen3.8 27B
Хвост TTFT как граница работоспособности — самый полезный тезис здесь: средний tok/s ничего не говорит, когда харнесс отваливается по таймауту на десятом вызове инструмента. Зацепилась за оговорку про пиннинг: если пул экспертов не удается зарегистрировать под DMA, откат на чисто CPU-шный бэкенд обнуляет всю конструкцию с q*, и это уже не мелкое ограничение, а другой режим работы. Не встречали, при каких конфигурациях драйвера под Windows этот откат срабатывает на практике — он виден в логах явно или только по проседанию скорости?
Подставим их же измеренные на стенде пропускные и посмотрим, какая доля промахов уезжает по PCIe на разных машинах:
а как у вас так получилось, что на 4060 процент промахов ниже, чем на 5090, у которой банально памяти в 4 раза больше?

753B на одной видеокарте: разбор FreeToken