Комментарии 45
Спасибо за статью! С удовольствием почитал (да и с пользой)
ps мои 2 мысли -
1. на мой взгляд текущая модель с бесконечной гонкой видеокарт целыми дата центрами и не успевающей энергетикой все это хозяйство прокормить, имхо, тупиковая ветвь развития, нутром чую будут кардинальные перемены в технологии ИИ.
2. влажная мечта :) - где тут да и не только - попадалась статейка про стартап который пишет нейронки прямо в чипы, в кремень, стоит пока тоже некисло, но это первый шаг, зато токенов (боюсь наврать) что то около 8000 сек а на порядок меньшее энергопотребление, вот было бы классно - как помните в денди вставлялись карты с играми? Я бы согласился и утянув ремешок на поясе прикупил такой агрегат, мне бы квена 3.6 27b с головой хватило а там глядишь и другие картриджи с ИИ подоспели бы... эх мечты...
тот стартап за пол года после первой публикации не сумел собрать из этого бизнес (боюсь не хочет работать с частниками много железа дешево а хочет продавать мало железа за дорого крупняку, а те жмутся и не хотят)
Мне кажется, я даже скорее убежден, что вне зависимости от того, как будет складываться экономическая ситуация с пузырем ИИ, модели естественным образом придут на телефон каждого.
А из прикольных железок для ИИ очень хочу попобровать позапускать модели на Tenstorrent Wormhole потому что RISC-V и производительность по спецификации должна быть какая-то сумасшедшая, но нужно блог развивать чтобы дали на обзор.
Переход на фотонные вычисления или нейроморфные чипы неизбежен при таких аппетитах. Кремний уже уперся в предел миниатюризации, дальше только масштабирование вширь за счет новых электростанций
И это ровно та нагрузка, которую моё железо не тянет.
На 7,6 т/с ответ в чате нормален — модель обгоняет скорость вашего чтения. Но агентный цикл платит префилл на каждом ходу по растущему контексту, и двадцать ходов превращаются в вечер.
Вообще, есть кэширование контекста, когда тот-же llama.cpp создает чекпойнт kv-кэша на определенное место в контексте и в следующий раз не весь контекст пересчитывается, а с этого чекпойнта. Но это кеширование сильно жрет память. Как вариант, для маков можно попробовать Omlx вместо llama.cpp ибо они этот кэш контекста пишут на диск вместо памяти. Но Omlx не работает с gguf моделями, либо mlx, который весьма хреново жмет, тупо все слои одинаково, либо их собственный какой-то optiq-mlx, который в теории лучше, но я когда с ним последний раз игрался (пару месяцев назад), моделей в этом формате было мало, а то-что находил, было тупее gguf. Может сейчас ситуация улучшилась.
На тот момент не было к сожалению ни mlx оптимизаций, ни omlx релизов и даже llama.cpp была только в дев ветке, так что "Я его слепила из того что было". Оптимистично думаю, что можно получить спокойно еще даже 20-30% после более широкой поддержки сообщества. Конечно грустно немного, что кажется единственные кто получил доступ перед релизом были Unsloth. Это не очень хороший знак для экосистемы.
Запись kv на диск имеет смысл только если вы хотите к этому контексту вернуться потом (например быстро обработать стартовый промпт opencode). Вам так и так весь контекст (kv-cache) надо держать в памяти что бы сгенерировать ответ.
Спасибо за столь подробное описание. При запуске через llama-server можно и даже наверное нужно установить размерность кеша в Q8(–cache-type-k q8_0 --cache-type-v q8_0), это сделает работу менее прожорливой.
Просто статистика. У меня macbook pro m3 max 36Gb c 30 gpu и заявленная пропускная способность 300Gb/сек. Модель Muse-Glimmer-30B-UD-Q4_K_XL. LM Studio выдаёт ~10 tok/sec. Запуск через llama-server - 15 tok/sec.
Установить то можно, и я даже ради интереса тестировал на рабочем немощном компьютере с 16 Gb оперативной памяти маленькие модели (Qwen3.5/Gemma-4 на ~8B параметров), чтобы хотя бы контекст в 40000 токенов себе позволить, но есть проблема - они становятся рассеянными и начинают делать ошибки. Скорее всего, большим моделям тоже поплохеет.
Это как будто бы ключевая проблема малых моделей. Конечно круто, что Gemma-4 хорошо идет локально, но мне кажется, что локальные модели все таки играют на одном поле с подписками за 20 баксов, так что учитыая их текущий перфоманс они кажутся довольно бессмысленными (ну могу себе представить как-то их оркестрацию более серьезными моделями, но что-то это не звучит дешево)
Пока пытался все завести пришел к выводу что для пропускной способности мака все же лучше подходят модели типа MoE из-за не очень высокой пропускной способности по отношению к видеокартам. Скорее всего вернусь к теме после выхода Qwen 3.8B потому что там могут быть хорошие MoE релизы. Если все же будет основной акцент на dense, то ждите гайд по ram offset
Q8(–cache-type-k q8_0 --cache-type-v q8_0)
крайне не рекомендую так делать, т.к. это сильно сказывается на интеллектуальных способностях модели. Это супер чувствительная к квантованию часть(возможно даже самая чувствительная)
Теоретически "–cache-type-k bf16 --cache-type-v q8_0" почти не роняет интеллект, т.к. для того же Qwen разрядность ключей кеша гораздо важнее разрядности значений. Но, практически, когда я экспериментировал с такими настройками у меня становился колом prefill на первых 30-40 токенах. Мне это было не особо важно, поэтому разбираться не стал, оставил разрядность по-умолчанию.
Очень круто! Супер!
Я тут подумал после вашей статьи что немного не правильно тестирую модели: я запускаю просто чат llamacpp и прошу написать игру в нем. Как я понял из вашей статьи то Квен 27б при таком сценарии с большей вероятности сделает лучше чем эта модель потому что на бенче по программированию набирает больше очков? То есть эта модель больше заточена как раз под OpenCode и закрывает задачи за несколько итераций?
Новую статью хотим конечно же. Ждем 3.8)
Спасибо! Было бы здорово увидеть статью как оптимально совместно использовать железо ноутбука на HX370/32RAM со встроенным GPU 5070ti/12VRAM
Планирую сделать отдельный разбор как оптимизировать локальные модели под обычный пк после выхода Qwen 3.8 - должна быть мощная штука
Да, было бы очень интересно, потому что есть много компов без унифицированной памяти, с быстрой, но относительно небольшой видеопамятью (8-16) и более объёмной оперативной (16-32). Нужно ли всегда подстраиваться под объём видеопамяти, или для МоЕ это не так?
Это как раз то, за что я люблю MoE модели.
Тем не менее я бы сказал, что потециал есть, потому что по сути 5080 в типа 3 раза выше по пропускной способности чем унифицированная память. Вопрос того, какой офсет себе можно позволить в оперативную память будет скорее влиять на общую пропускную способность и как результат решит какую квантизацию выбрать
База про пропускную способность памяти на маках расписана отлично, а то народ привык просто закидывать проблему гигабайтами оперативки, а потом удивляется скорости в полтора токена
Кажется не раскрытой тема с MTP, дающим неплохое такое ускорение.
Перешел с opencode на pi т.к. он шустрее(можно подключить https://pi.dev/packages/pi-llama-cpp чтобы автоматом подхватило llama.cpp сервер)
Эпично! Спасибо.
Рассчитываю на апдейт статьи когда зарелизится квен 3.8 27б
Гипотеза: если бы не текущий дефицит чипов и огромный спрос для датацентров, то мы бы уже сейчас покупали GPU с 32-64 Gb GDDR6 памяти на борту для инференса. Возможно через 2-3 года Хуанг будет продавать народу не видеокарты для игр, а наследников DGX Spark для локального инференса с сотнями Gb унифицированной памяти за пару тысяч $.
Истории для инвесторов про зарабатывание денег на инфренсе токенов - очевидно провал и финансовый пузырь. Такой бизнес-план звучит также тупо, как идея из 00х про инвестиции в доменные имена. А ведь в моменте красивый домен мог стоить миллионы долларов по тем деньгам...
Хуанг вообще не хочет продавать народу, он хочет продавать датацентрам. Потому что это другие деньги совсем и - очень важно! - планируемые инвестиции. Когда из за майнеров геймеры завыли - что сделала нвидия? Подняла разом цены на все, издевательски опубликовав "РРЦ" которую никто не видел. Накидала ограничений в дрова, да таких, что плевались все. Разделение на майнерские карты и игровые добавило огоньку. Разумеется Куртка просек что SLI надо бы убирать, а то "накупят дешевых карт под нейронки, а дорогие не покупают" и убрали SLI из игровых карт. Покупайте профессиональное за цену х100 (а что? им есть какие то конкуренты? нету). В итоге имеем совершенно безобразный по ценам рынок видеокарт, а глядя на эту вакханалию и карты-затычки цены подтянули как минимум к ценам материнок. И на этом рынке нет места ни геймерам, ни майнерам(давно уже) ни любителям LLM - по таким ценам это может скупать только безумный. И этот безумный - это ИИ компании. За счет хайпа у них есть деньги, и на эти деньги они скупают все просто бураном. Деньги из ниоткуда не берутся - они берутся или из кредитов, или из прибыли. И то и другое оплачивает конечный покупатель. Вот это и обеспечивает бешеные капитализации ИИ компаний. Завтра они скажут - так, цена 1 доллар за токен, и - превед. Нет, сразу конечно они так не сделают, не самоубийцы, но дыры в бюджетах будут выправлять так. Подсадив на нейронки половину земного шара, они будут пытаться доить до последнего токена. А потом такие - а не, мы банкроты, ничо не знаем. Или придут к некоему балансу. Суть моих пространных размышлений в том, что для среднестатистического пользователя нейронок это выльется в ту же сумму, как если бы он собрал железо для запуска той нейронки / (деленное на 10) - тут важно учитывать экономию централизованности. Этот параметр взят буквально с потолка, я его сам придумал, но если кто-то сможет посчитать более точно, я буду только рад. Самому интересно.
Получается M5 Max 18-Core, GPU 40-Core, 128GB за 700+ тыс. руб. с пропускной скоростью в 614 ГБ/с даст только 35 токенов в секунду?
Примерно. Столько же сколько и бу 3090 за 80 тысяч.
Примерно так, да. Для Dense моделей m5max/128gb не самое подходящее решение. Зато если выйдет MoE ~ 80-100B/A10B то тут этот конфиг заиграет новыми красками
А как архитектура с мульти-экспертами даст больше генерации токенов?
Я думал есть условно GGUF и есть MLX формат. Один лучше раскрывается на GPU типо Nvidia, вторая на Apple Silicon архитектуре-процессорах.
Но одни и те же открытые модели собирают под оба формата.
MoE модели обычно надо много VRAM, но скорость памяти не так критична потому что активных параметров меньше. К примеру у меня moe qwen 3.5 122b a10b генерирует ответ быстрее чем dense qwen 3.5 27b.
Просто я сейчас перед выбором или взять M5 Max с 128GB или взять 5090 с 32 гб
Задачи - локальная модель для кодинга.
Тот же Qwen 3.6 35B A3B уже щупал, но 8 токенов в секунду на 3080Ti с 64 GB DDR4 прям очень слабо. Хочется разогнать скорость, не потеряв качество.
Не берусь предсказывать. Раньше в локальных моделях делался упор на MoE модели требовательные к VRAM, пока не пришел qwen со своей маленькой 27b dense моделью и стал царем горы.
Почему никто не говорит про проблемы на маках - про циклические зависания даже простых моделей, тот же whisper который помещается в 8 гб объединенной памяти глючит на больших объемах, при этом на старой 8гб gpu нет таких проблем.
Успел купить 5090 за 200 т.р в октябре и на qwen3.6:27b минимальная цифра по генерации была 75 токенов в секунду и контекст в 210 тысяч влезает, поэтому выбирайте внимательнее. Ну и плюс на mlx pytorch не умеет в gpu оптимизации т.е. что либо дообучить\обучить на маке можно, но проблематично в сравнении с зелеными картами.
Не хейтер маков, но они переоценены блогерами и любителями яблочной экосистемы.
MLX странный формат. На маке на маленьком контексте он действительно работает лучше чем GGUF, но с ростом контекста хотя бы до 64к (а это обычная агентская разработка) скорости начинают деградировать сильнее чем GGUF.
Плюс очень странная история с MTP. Его очень долго добавляли в MLX и как будто бы добавили тоже не очень правильно. Но тут нужно поресерчить, говорю по ощущениям с дискуссий реддита
Тестирование это хорошо, но ни слова про перегрев. Или у вас дополнительное охлаждение или тесты делались быстро и в холодильнике? На мак-мини запускал модели, спустя минуту вентилятор работает почти на полную мощь. Интересно как на тоненьком air без вентиляторов проводили тесты.



Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить