Комментарии 59
Вспоминается сказка про скорняка и шапки. Можно и 7 шапок с одной шкуры сшить (IQ_2), но больно маленькие будут )
С этим согласен, что тянуть шкуру так себе затея, но если посмотреть проект Strata + то что описано в статье, грядет новая эра локального инфересна, пусть и с потерей качества, но на железе за вменяемые $ и это большой +
Проект только что вышел в свет, да там много чего дорабатывать перерабатывать и тп
Так и какое отклонение от BF16? И почему не https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf ? Кроме прочего как вы вообще собираетесь 8K контекста пользовать, и что получилось с prefill? :) Странно, но можно было бы утилизировать 35-A3B, там KV копейки стоит, а качество с -cmoe скорее всего будет выше
А на видяхе с 12ГБ локалный инференс норм или совсем никуда?
Ternary-Bonsai версия норм летает) но думаю оно по качеству гораздо хуже чем тот же qwen3.6-35-A3B
Покрутил несколько моделек разных на ограниченном железе. 24 на сегодгя минимальный оптимум, ИМХО. Для 12/16 сносно работают MoE но они пока заметно туповаты. Вероятно это особенность не технологии а конкретных моделей. Возможно, ситуация изменится если появятся узкоспециализированные модели - зачем мне для кодинга загружать и каждый раз обсчитывать рецепты борща? Модели меньше не станут, но будут работать чуть строже.
8К контекст для агентной работы это вообще ни о чем.
Еще нормальная конфигурация 24+8. Вторая для маленьких моделей (автодополнение и т.п.)
Пока использую модель для причесывания кода и всяких украшательств на которые раньше никогда не было времени и желания. Архитектуру и базовые алгоритмы пока делаю сам или прямыми короткими запросами.
Смотрел что вообще можно сибрать на бытовом железе. Кратко - ничего. Ради двух карт 24+24 даже нет смысла заморачиваться - большого прироста они не дадут. А цены на промышленные конфигурации измеряются десятками килобаксов. Еще и покупать надо ехать в рф (внезапно).
24... 24... оптимум... невелики ваши запросы однако, на всякие украшательства... Мой минимум это 128 на Мак и тот уже слегка трещит... ))
Ну эт у вас, лично я радуюсь тому что у меня места на диске хватает на 3.6 35B A3B Q3_K_M MTP
Варианты с расшаренной системной памятью тоже достаточно унылы. А маки, на мой взгляд, сами по себе достаточно унылы.
24 гигабайт достаточно для Q4 денз квена, плюс около 80 тысяч контекста. Можно больше, но на костылях. Такая конфигурация - это что-то между хайку и старым опусом (а-ля 4.6) - для локального окологейминг-пк - вполне неплохо. Дальше будет лучше.
Страта на 16 гб в максимальном iq3 (какой она там предлагает) + вижн и 256к контекста даёт 25-35 т/с. Вполне норм.
выбрасываешь бонсай, плюешь в корзину с бонсаем, качаешь gsq rco iq3, размером в 10гб. запускаешь, контекст ставишь 64к.
Сейчас у меня работает на одной RTX 3060
модель Qwen3.8-Flash-Next-UD-IQ4_XS
Кроме видеопамяти, она занимает еще около 100Gb RAM (DDR4)
Процессор CPU E5-2699 v4
Начинает отвечать на скорости около 10 t/s
при заполнении контекста
ближе 100 тыс токенов уже дает около 4 t/s
ближе 200 тыс токенов уже дает около 1 t/s
Prompt speed начинается около 170 t/s и падает до 7 t/s
Запуск в винде, Unsloth Studio, режим MTP+Ngram
Кстати, именно MTP стало причиной запуска в Unsloth Studio,
поскольку квант модели был подготовлен именно для этой студии.
У меня моделька Bonsai на основе Qwen3.6-27B и на 6 Гб видеокарте запускается с однобитным квантом, вот только результат не очень практически полезный.
Смысла в модели на 8к контекста не очень много
Следующий этап должен ответить на более важный вопрос: насколько хорошо модель сохраняет свои способности после настолько агрессивного сжатия.
Ну, ответ как бы понятен - никак.
Я контекст на 64К ставлю, Q8 на модель, bf16 KV - на RTX 2080 8ГБ и 32ГБ(+20ГБ swap) получается 10-15ток/с.
llama-bench.exe для подбора параметров. --fit оптималку ищет.
Каким параметром можно загруженные слои в VRAM удалить из RAM ??? Или сама CUDA требует копию в RAM?
Спасибо за много details, но есть большие сомнения насчет способностей iq2_xxs кванта)
В какой момент такие статьи стали получать положительный рейтинг. Воды налито столько что у меня слов нет. Как можно настолько сложно писать о самых базовых вещах, это просто какой-то невообразимый для меня уровень написания воды... Нет, я понимаю что это вероятно пародия на исследование написанная нейросеткой и слегка отредаченная, по крайней мере судя по наличию огромного количества английских слов, уж очень llmки любят смешивать английский с русским, да и наличия смысла в тексте стремится к нулю, но всё же. Читает же это кто-то и ставит плюсы.
Блин есть же базовые вещи, да, можно квантовать сетку в тернарный вид с сохранением некоторых промежуточных состояний поверх для уменьшения деградации, квантовать контекст в какой-нибудь turboquant 4bit nc и получить свой 256к контекст на 8гб карте. Великолепно. Правда качество у этого будет как справедливо заметили выше про версию ternary bonsai от prismml, такое себе. Ну нельзя настолько существенно сжать без сильной деградации, или по крайней мере этого ещё никто не сделал.
Ладно, что то меня разнесло. Но как же раздражает. Хоть глубокое исследование запускайте перед тем как изобретать велосипед двухлетней давности. Нейросетки блин будут до последнего цепляться за устаревшие методы, предлагать контекст 8-32к и тд, ибо считают что все до сих пор сидят на полном внимании и контекст неизбежно потребляет дофига памяти.
например, пять друзей автора регистрируются и ставят пять плюсиков через пять минут после публикации. А ещё несколько докидывают статье с хорошим положительным рейтингом те, кто особо не вчитывался, но им почему-то за минутный просмотр понравилось и почему бы не присоединиться к уже оценившим?
Спасибо, что выразали мои мысли. Я поначалу думал, что в статье есть какая-то новищна, а тут просто сделали очевидные задукоментированные вещи. Ещё и не понятно зачем.
это из разряда:

Короче непонятно какое качество. И в этом вообще фундаментальная проблема, на один и тот же вопрос "какую покупать видеокарту для домашнего ИИ" одни источники отвечают что можно и 8 гигабайт и все будет работать, другие - что нужен чуть ли не домашний сервер с несколькими топовыми картами каждая ценой около миллиона, иначе смысла в этом "домашнем ИИ" не будет и даже связываться не стоит. Кому хочешь тому и верь:(
Что-бы ответить на вопрос надо знать цель домашнего ИИ. Кому-то 8Gb хватит, кому-то 100Gb мало)
Да цели вполне обычные. Некоммерческое однопользовательское применение, примерно тот уровень интеллекта, который ожидаешь от бесплатных чатботов, но без ограничений и с дополнительными возможностями. Лично я для себя определил так:
генерация качественных, но не слишком большого разрешения (512*512) изображений и таких же небольших видео (720p более чем достаточно);
помощь с пониманием кода и написание кода в достаточно больших проектах;
написание и улучшение художественных текстов, удержание в памяти достаточно большого контекста литературного произведения;
фоновый поиск информации в интернете, что-то вроде личного ассистента, который бы отслеживал для меня все самое интересное и полезное - новости, тенденции, передовые технические решения, что-то где можно получить какую-то выгоду и т.п., на всех языках мира (с переводом на русский) и создавал бы подборки.
Не получится. Там везде нужна хотя бы сотня гигабайт видеопамяти. Лучше несколько сотен. Чтобы работало реально не хуже. Без всяких экономий и сокращений. Разработчики сеток неспроста не делают их однобитовыми.
Как тратить памяти меньше никто не знает, цены на железо неразумные.
Там везде нужна хотя бы сотня гигабайт видеопамяти
Тогда зачем все эти нейронки на 8Gb? Для чего-то они нужны?
Нищие люди которые не могут себе позволить видеокарту за полтора миллиона тоже существуют.
Всякие чат боты первой линии и легкая обработка документации. Различные сценарии автоматизации. Все они в основном заготовки. Надо дообучать под свой датасет.
Если чётко ставить конкретную узкую задачу они экономят некоторое время на писанину. 24ГБ уже сносно программирует в агентском режиме если не давать ему слишком углубляться в большой проект.
Отчеты о работе за меня Qwen 14b на 12Gb успешно пишет. Сделать понятное саммари по расшифровке разговора из GigaAM он тоже в состоянии. А последняя и вовсе на CPU прекрасно работает.
Читает всю эту писанину, возможно, другой Qwen на 32b, на то он и босс.
Для агентной разработки ничего подобрать не получилось, в OpenCode тупят страшно и инструменты запускают неустойчиво все модели, что были под рукой. Но я надеюсь на расширение до 2*12Gb.
Если вам ок необходимость переключать модели (генератор картинок отдельной моделью) пойдет даже 8гб карта.
Понимание кода по общущениям неплохое у 30b-moe qwen, там насколько я помню хватало 1 карточки на 16gb. Написание - как будто вообще забей, лучше проплатить любую фронтир модель в подписке - слишком разница большая.
Тут нужны плотные модели - moe уже не очень, а значит что-то вменяемое - qwen 27b - это уже ~26gb для запуска в 4b кванте.
Ну тут пойдет тоже qwen 27b в теории, но у вас какая-то супер обширная задача - скорее всего скорости инференса не хватит.
Сейчас - я бы под ваши хотелки попробовал сборку из 2х 5060ti (правда цены давненько не смотрел), квантованную в 4b или даже возможно в 5b влезет плотную модель.
Дополню Вас для тех кого интересует: моя видеокарта 1080ti (11 Gb) на выходе дает для Qwen3.8 35b moe ~ 30 t/s; для Qwen3.8 125b moe ~ 10 t/s; для Owen3.8 27b (плотная) ~ 2 t/s. Это все для контекстного окна ~ 64kb, при увеличении до 128 kb падает приблизительно на 10%. Это все на разных вариантах 4b квантования.
Статью написала/отредактировала «нейронка»? Интересно проверить внутренний датчик «слопа».
7 раза встретил слово «важно». Смысл указывать, что нечто важно, если это автоматически должно быть так? Если нечто неважно, просто не пишите об этом. Писать следует только о важном. И вообще к чему это оценочное суждение? Просто объясняйте концепции наглядно, тогда читатель сам поймёт, действительно это важно или не очень. Также недавно видел статистику, что Claude использует это слово в 116 раз чаще человека.
Два раза встретил слово «просто», ещё и с двоеточием после: «Простая последовательность:», «Простое правило:». Если хотите что-то объяснить, так объясняйте, зачем уточнять, что это просто? Главное — объясните понятно, а читатель сам решит, просто это было или сложно.
Так можно ли запустить Qwen3.8–27B целиком на RTX 5060 8 GB?

Тут от модельки, залетающей в 64гига vram, порой приходится страдать, что ж там под крышкой дна на ультра низком квантовании происходит - страшно подумать.
Для поболтать о всяком разном - пойдет по приколу, на этом всё.
Лучше пойти по пути RAM вычислений, 3.8 flash-next вполне сносно работает
У меня модель на 26gb занимается раскладывание данных по полочкам (категоризация, выделение из общего текста конкретных данных), распознаванием текстов с картинок, составлением сводок, ведёт содержательные беседы с мошенниками которые пишут мне в телегу. Со всеми задачами на контексте в 100к - справляется отлично. Категоризация и распознавание - вообще даже слишком хорошо.
Так что сильно от задачи зависит. Если цель прямо генерировать много нового - то да, но если обратная - больше объем исходных данных привести к небольшим конечным - с этим как будто и компактные модели отлично справляются.
Если кто-то еще не видел: Qwen3.8-Flash-Next на 5070 https://github.com/Niko1221/Strata
Проект в доработке это только первоначальная версия проекта
Типичный инженерный успех - из готовых библиотек собрали работающую схему, нашли настоящий bottleneck и получили воспроизводимую медиану вместо удачного прогона - но два бита на вес без пройденного quality gate это как коллега, который отвечает мгновенно и уверенно - слушать приятно, но доверять пока рано :D
можно ли ехать на велосипеде с квадратными колёсами? можно, но колеса переворачивать с грани на грань придётся руками.
по факту единственный обзор который реально стоит времени и сил, и который нужен, это сравнение gsq rco кванта квена 27б и ista Coder через страту. причём не в плане скорости, а в плане наличия мозга.
и именно поэтому никто такое сравнение не сделает. будем дальше клодослоп изрыгивать.
А тут всё правильно, нет ошибки? В случае «более высокая точность обязательно будет быстрее,» ожидаемая гипотеза - что более высокая точность будет медленнее.
Это важный практический момент. Нельзя заранее считать, что более высокая точность обязательно будет быстрее, точно так же как нельзя считать, что меньшее количество бит автоматически даст максимальную производительность.
Вопрос только один - на...., а главное зачем? Есть ornith-1.5-9B, который гораздо больше подходит под запуск на 6/8 Гб VRAM, или MoE модель, если ОЗУ позволяет. Качество более маленьких, но менее квантованных моделей лучше и стабильшее, чем большие, но в усмерть заквантованные.
А с какими параметрами llama.cpp запускали? Чот у меня всего 7-8 токенов/с выходит...

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с