Pull to refresh

Comments 78

Спасибо за статью! С удовольствием почитал (да и с пользой)
ps мои 2 мысли -
1. на мой взгляд текущая модель с бесконечной гонкой видеокарт целыми дата центрами и не успевающей энергетикой все это хозяйство прокормить, имхо, тупиковая ветвь развития, нутром чую будут кардинальные перемены в технологии ИИ.
2. влажная мечта :) - где тут да и не только - попадалась статейка про стартап который пишет нейронки прямо в чипы, в кремень, стоит пока тоже некисло, но это первый шаг, зато токенов (боюсь наврать) что то около 8000 сек а на порядок меньшее энергопотребление, вот было бы классно - как помните в денди вставлялись карты с играми? Я бы согласился и утянув ремешок на поясе прикупил такой агрегат, мне бы квена 3.6 27b с головой хватило а там глядишь и другие картриджи с ИИ подоспели бы... эх мечты...

тот стартап за пол года после первой публикации не сумел собрать из этого бизнес (боюсь не хочет работать с частниками много железа дешево а хочет продавать мало железа за дорого крупняку, а те жмутся и не хотят)

Мне кажется, я даже скорее убежден, что вне зависимости от того, как будет складываться экономическая ситуация с пузырем ИИ, модели естественным образом придут на телефон каждого.

А из прикольных железок для ИИ очень хочу попобровать позапускать модели на Tenstorrent Wormhole потому что RISC-V и производительность по спецификации должна быть какая-то сумасшедшая, но нужно блог развивать чтобы дали на обзор.

Переход на фотонные вычисления или нейроморфные чипы неизбежен при таких аппетитах. Кремний уже уперся в предел миниатюризации, дальше только масштабирование вширь за счет новых электростанций

Не звучит честно говоря. Современные модели убиваются о потолок данных, а не чипов, потому что обучение на синтетических данных работает сильно хуже

И это ровно та нагрузка, которую моё железо не тянет.

На 7,6 т/с ответ в чате нормален — модель обгоняет скорость вашего чтения. Но агентный цикл платит префилл на каждом ходу по растущему контексту, и двадцать ходов превращаются в вечер.

Вообще, есть кэширование контекста, когда тот-же llama.cpp создает чекпойнт kv-кэша на определенное место в контексте и в следующий раз не весь контекст пересчитывается, а с этого чекпойнта. Но это кеширование сильно жрет память. Как вариант, для маков можно попробовать Omlx вместо llama.cpp ибо они этот кэш контекста пишут на диск вместо памяти. Но Omlx не работает с gguf моделями, либо mlx, который весьма хреново жмет, тупо все слои одинаково, либо их собственный какой-то optiq-mlx, который в теории лучше, но я когда с ним последний раз игрался (пару месяцев назад), моделей в этом формате было мало, а то-что находил, было тупее gguf. Может сейчас ситуация улучшилась.

На тот момент не было к сожалению ни mlx оптимизаций, ни omlx релизов и даже llama.cpp была только в дев ветке, так что "Я его слепила из того что было". Оптимистично думаю, что можно получить спокойно еще даже 20-30% после более широкой поддержки сообщества. Конечно грустно немного, что кажется единственные кто получил доступ перед релизом были Unsloth. Это не очень хороший знак для экосистемы.

Запись kv на диск имеет смысл только если вы хотите к этому контексту вернуться потом (например быстро обработать стартовый промпт opencode). Вам так и так весь контекст (kv-cache) надо держать в памяти что бы сгенерировать ответ.

Спасибо за столь подробное описание. При запуске через llama-server можно и даже наверное нужно установить размерность кеша в Q8(–cache-type-k q8_0 --cache-type-v q8_0), это сделает работу менее прожорливой.

Просто статистика. У меня macbook pro m3 max 36Gb c 30 gpu и заявленная пропускная способность 300Gb/сек. Модель Muse-Glimmer-30B-UD-Q4_K_XL. LM Studio выдаёт ~10 tok/sec. Запуск через llama-server - 15 tok/sec.

Установить то можно, и я даже ради интереса тестировал на рабочем немощном компьютере с 16 Gb оперативной памяти маленькие модели (Qwen3.5/Gemma-4 на ~8B параметров), чтобы хотя бы контекст в 40000 токенов себе позволить, но есть проблема - они становятся рассеянными и начинают делать ошибки. Скорее всего, большим моделям тоже поплохеет.

Это как будто бы ключевая проблема малых моделей. Конечно круто, что Gemma-4 хорошо идет локально, но мне кажется, что локальные модели все таки играют на одном поле с подписками за 20 баксов, так что учитыая их текущий перфоманс они кажутся довольно бессмысленными (ну могу себе представить как-то их оркестрацию более серьезными моделями, но что-то это не звучит дешево)

Пока пытался все завести пришел к выводу что для пропускной способности мака все же лучше подходят модели типа MoE из-за не очень высокой пропускной способности по отношению к видеокартам. Скорее всего вернусь к теме после выхода Qwen 3.8B потому что там могут быть хорошие MoE релизы. Если все же будет основной акцент на dense, то ждите гайд по ram offset

У Qwen 3.8B для локальных игрищ намечается релиз только плотной модели на 27B

Q8(–cache-type-k q8_0 --cache-type-v q8_0)

крайне не рекомендую так делать, т.к. это сильно сказывается на интеллектуальных способностях модели. Это супер чувствительная к квантованию часть(возможно даже самая чувствительная)

Теоретически "–cache-type-k bf16 --cache-type-v q8_0" почти не роняет интеллект, т.к. для того же Qwen разрядность ключей кеша гораздо важнее разрядности значений. Но, практически, когда я экспериментировал с такими настройками у меня становился колом prefill на первых 30-40 токенах. Мне это было не особо важно, поэтому разбираться не стал, оставил разрядность по-умолчанию.

Очень круто! Супер!

Я тут подумал после вашей статьи что немного не правильно тестирую модели: я запускаю просто чат llamacpp и прошу написать игру в нем. Как я понял из вашей статьи то Квен 27б при таком сценарии с большей вероятности сделает лучше чем эта модель потому что на бенче по программированию набирает больше очков? То есть эта модель больше заточена как раз под OpenCode и закрывает задачи за несколько итераций?

Новую статью хотим конечно же. Ждем 3.8)

А какое железо, если не секрет? Хочу на релиз 3.8 сделать гайд по оптимальную настройку как раз под opencode на пк

Ну у меня если пойдет то только 35moe. У меня 3070 8 гб

Спасибо! Было бы здорово увидеть статью как оптимально совместно использовать железо ноутбука на HX370/32RAM со встроенным GPU 5070ti/12VRAM

Планирую сделать отдельный разбор как оптимизировать локальные модели под обычный пк после выхода Qwen 3.8 - должна быть мощная штука

Да, было бы очень интересно, потому что есть много компов без унифицированной памяти, с быстрой, но относительно небольшой видеопамятью (8-16) и более объёмной оперативной (16-32). Нужно ли всегда подстраиваться под объём видеопамяти, или для МоЕ это не так?

Это как раз то, за что я люблю MoE модели.

Тем не менее я бы сказал, что потециал есть, потому что по сути 5080 в типа 3 раза выше по пропускной способности чем унифицированная память. Вопрос того, какой офсет себе можно позволить в оперативную память будет скорее влиять на общую пропускную способность и как результат решит какую квантизацию выбрать

Не-не-не, 5080 всю модель в себя всосёт, это слишком просто. Вопрос как раз про "немощные" 5070ti и ниже с 8-16Гб видеопамяти.

База про пропускную способность памяти на маках расписана отлично, а то народ привык просто закидывать проблему гигабайтами оперативки, а потом удивляется скорости в полтора токена

Кажется не раскрытой тема с MTP, дающим неплохое такое ускорение.

главное учитывать что МTP так же требует больше vram, из-за того что юзаются доп. модели которые набрасывают черновые токены из которых потом основная модель выбирает

Я не видел MTP версии пока что, только DFlash на который жаловался

Эпично! Спасибо.

Рассчитываю на апдейт статьи когда зарелизится квен 3.8 27б

Гипотеза: если бы не текущий дефицит чипов и огромный спрос для датацентров, то мы бы уже сейчас покупали GPU с 32-64 Gb GDDR6 памяти на борту для инференса. Возможно через 2-3 года Хуанг будет продавать народу не видеокарты для игр, а наследников DGX Spark для локального инференса с сотнями Gb унифицированной памяти за пару тысяч $.

Истории для инвесторов про зарабатывание денег на инфренсе токенов - очевидно провал и финансовый пузырь. Такой бизнес-план звучит также тупо, как идея из 00х про инвестиции в доменные имена. А ведь в моменте красивый домен мог стоить миллионы долларов по тем деньгам...

Скрытый текст

Хуанг вообще не хочет продавать народу, он хочет продавать датацентрам. Потому что это другие деньги совсем и - очень важно! - планируемые инвестиции. Когда из за майнеров геймеры завыли - что сделала нвидия? Подняла разом цены на все, издевательски опубликовав "РРЦ" которую никто не видел. Накидала ограничений в дрова, да таких, что плевались все. Разделение на майнерские карты и игровые добавило огоньку. Разумеется Куртка просек что SLI надо бы убирать, а то "накупят дешевых карт под нейронки, а дорогие не покупают" и убрали SLI из игровых карт. Покупайте профессиональное за цену х100 (а что? им есть какие то конкуренты? нету). В итоге имеем совершенно безобразный по ценам рынок видеокарт, а глядя на эту вакханалию и карты-затычки цены подтянули как минимум к ценам материнок. И на этом рынке нет места ни геймерам, ни майнерам(давно уже) ни любителям LLM - по таким ценам это может скупать только безумный. И этот безумный - это ИИ компании. За счет хайпа у них есть деньги, и на эти деньги они скупают все просто бураном. Деньги из ниоткуда не берутся - они берутся или из кредитов, или из прибыли. И то и другое оплачивает конечный покупатель. Вот это и обеспечивает бешеные капитализации ИИ компаний. Завтра они скажут - так, цена 1 доллар за токен, и - превед. Нет, сразу конечно они так не сделают, не самоубийцы, но дыры в бюджетах будут выправлять так. Подсадив на нейронки половину земного шара, они будут пытаться доить до последнего токена. А потом такие - а не, мы банкроты, ничо не знаем. Или придут к некоему балансу. Суть моих пространных размышлений в том, что для среднестатистического пользователя нейронок это выльется в ту же сумму, как если бы он собрал железо для запуска той нейронки / (деленное на 10) - тут важно учитывать экономию централизованности. Этот параметр взят буквально с потолка, я его сам придумал, но если кто-то сможет посчитать более точно, я буду только рад. Самому интересно.

Хуанг вообще не хочет продавать народу, он хочет продавать датацентрам.

Хотеть может и хочет, но в свете того, что почти все владельцы датацентров объявили о том, что разрабатывают свои собственные чипы для инреференса, надо быть дураком, чтоб не понимать, к чему это может привезти, а он не дурак.

Получается M5 Max 18-Core, GPU 40-Core, 128GB за 700+ тыс. руб. с пропускной скоростью в 614 ГБ/с даст только 35 токенов в секунду?

Примерно. Столько же сколько и бу 3090 за 80 тысяч.

Примерно так, да. Для Dense моделей m5max/128gb не самое подходящее решение. Зато если выйдет MoE ~ 80-100B/A10B то тут этот конфиг заиграет новыми красками

А как архитектура с мульти-экспертами даст больше генерации токенов?

Я думал есть условно GGUF и есть MLX формат. Один лучше раскрывается на GPU типо Nvidia, вторая на Apple Silicon архитектуре-процессорах.

Но одни и те же открытые модели собирают под оба формата.

MoE модели обычно надо много VRAM, но скорость памяти не так критична потому что активных параметров меньше. К примеру у меня moe qwen 3.5 122b a10b генерирует ответ быстрее чем dense qwen 3.5 27b.

Просто я сейчас перед выбором или взять M5 Max с 128GB или взять 5090 с 32 гб
Задачи - локальная модель для кодинга.

Тот же Qwen 3.6 35B A3B уже щупал, но 8 токенов в секунду на 3080Ti с 64 GB DDR4 прям очень слабо. Хочется разогнать скорость, не потеряв качество.

Не берусь предсказывать. Раньше в локальных моделях делался упор на MoE модели требовательные к VRAM, пока не пришел qwen со своей маленькой 27b dense моделью и стал царем горы.

Почему никто не говорит про проблемы на маках - про циклические зависания даже простых моделей, тот же whisper который помещается в 8 гб объединенной памяти глючит на больших объемах, при этом на старой 8гб gpu нет таких проблем.

Успел купить 5090 за 200 т.р в октябре и на qwen3.6:27b минимальная цифра по генерации была 75 токенов в секунду и контекст в 210 тысяч влезает, поэтому выбирайте внимательнее. Ну и плюс на mlx pytorch не умеет в gpu оптимизации т.е. что либо дообучить\обучить на маке можно, но проблематично в сравнении с зелеными картами.

Не хейтер маков, но они переоценены блогерами и любителями яблочной экосистемы.

а какой полный конфиг системы? PCI-E 5.0 ? DDR5 32 или 64 гб ? CPU ?
хочется понять примерно к чему стремиться. 75 токенов в секунду это прям нравится.

Собирал в октябре 2025, когда 2 модуля памяти по 32гб продавались за 22 тысячи рублей.

Всего 64 гб ОЗУ, ryzen 7-9700X, мать MSI B850 GAMING PLUS WIFI, nvme на 2 тб за 15т.р ну и корпус с БП DEEPCOOL GamerStorm PN1200M = все это вышло в 130 тысяч. И плюс RTX5090 за 200р. Сейчас так сетап в среднем около 700-750р выйдет.

  1. Посмотрите внимательнее на текущий сетап, 8т\с это навскидку маловато. На чистом CPU у меня гемма 26B/A4 выдает под 13 т\с. Поставил скачаться квен для проверки, но повторюсь, навскидку это выглядит странно (или это ddr4 так сильно влияет, что перекрывает буст от видяхи..). Радикально не ускорится конечно, но, мне кажется, процентов 50+ ещё можно выжать

  2. Если вам 35B достаточно, то конечно 5090, она уделает мак как стоячий. Особенно с кодом, особенно, если подразумевается много префила, где макам особенно больно (m5 в этом плане заметно подкрутили, но разница все еще очень велика)

  3. У 128Гб систем сейчас есть дурацкая проблема в отсутствии разнообразия моделей. Есть заметное число в районе 20-35 (gemma, пачка qwen, вот героиня статьи ). И дальше дырка до ~250B с очень редкими вкраплениями. Очень немолодая OSS120, упомянутый выше зимний квен ровно в одной редакции, странноватый nemotron и кажется всё (есть ещё второй\третий эшелон, но там кажется в основном доработки на базе топов, и их проверять у меня лично уже сил не хватает).. Очень сильно попрыгав, утаптывая, можно всунуть младшие кванты нового дипсик-флеша или инклинга или 235B квена.. Но у мака (и например систем на базе AMD395+) в 128гб еще и систему надо разместить.. А еще хочется контексту, да побольше, а еще если агенты, то и в два-три-n потоков... А если еще и работать на ней же, а не оставить чисто как LLM-сервер, то среда разработки, запуски и т.п. и т.д..

а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.

он имеет смысл только из-за компактности и энергопотребления (при очень медленной генерации), за те же деньги можно собрать x86 машину с gpu, будет работать быстрее (особенно moe модели)

спасибо. все указывает что пора поднимать систему с 5090, pci-e 5.0, 64 ddr5

у меня совет, за эти деньги приобретите серверную материнку (в китае например HUANANZHI для amd epyc 7002/7003) и 4-ре 4060ti 16gb (или 5060ti 16gb), они тормознее примерно в два раза чем 5090, холоднее и на порядок дешевле (потому что тормозные, в современных играх с трудом 40 кадров даже на средних, и ни о каких 4k даже не думать).

запускать модели полностью или даже частично на ram - это путь в никуда, агенты будут работать невероятно медленно (часами там где могли бы минуты), поэтому постарайтесь даже не рассматривать этот вариант.

если модель будет помещаться в gpu полностью, то ram практически не требуется, т.е. ее может быть меньше чем суммарно vram (но 32gb все же рекомендуется оставить)

у меня есть условные 700-800к. Хочу получить максимальный профит. Планировал взять максимальный макбук M5 Max на 128 Gb. Но теперь склоняюсь к 5090

32gb vram это совсем совсем впритык, что бы запускать 'топовые маленькие' модели qwen3.6..3.8 27b/35b-a3b, только 4битная квантизация и 8бит квантизация кеша (можно без него но тогда контекст будет не полный) а так же vision способности с оговоркой, может придется переносить на cpu.

рассмотрите варианты добавить в сетап хотя бы еще одну gpu на 8gb (на ней будете запускать vision модуль и спекулятивное декодирование для ускорения генерации)

две видяхи? 5090 и 5060ti ? сейчаc же не работает SLI режим?

в корне неверное понимание моего комментария.

никакого sli нет и не нужно и не нужен интерконнект для инференса, для маленьких моделей более чем достаточно передачи данных между gpu через pcie->cpu->pcie

у меня две независимые рекомендации:
* вместо ОДНОЙ 5090 32gb покупаете 2 а лучше 4 дешевых 5060ti 16gb (они стоят порядка 50-60т.р. за штуку) и серверную материнку (с 2-4 pci-e 16x). Кстати для 2-ух gpu можно найти материнку не серверную (pcie будут работать в 8x режиме, для слабых моделей это не критично, у меня вообще в 4x работают) что еще сильнее удешевит конфиг.

p.s. настоятельно рекомендую собрать 64gb vram конфиг из 4x 16gb gpu

* если все же решите купить одну 5090, то добавьте любую современную nvidia gpu хоть на 8gb, на которой отдельно перенесете веса vision (mmproj файл) и в идеале модель (порядка 1-2gb) для спекулятивного декодирования (повышает скорость генерации в 2-4 раза в зависимости от везения), и не важно если вы ее посадите на x4 pcie.

upd. одна gpu 32b хороша для генерации видео и изображений, так как софт, распределяющий на несколько gpu сложнее в настройке или отсутствует

а LM Studio или LLama.cpp умеет так раскидывать веса в одну-две видяхи, контекст в другие? если я возьму 4 шт 5060.

Просто пропускная способность 5060ti - 448 Гбайт/сек это ну прям очень мало по сравнению с 5090.

Да, llama.cpp умеет распределять нагрузку между gpu и даже умеет между нодами кластера. Умеет разные вендоров gpu amd/nvidia/intel и т.п.

контекст в другие

нет, kv-cache должен размещаться рядом с весами (требования по объему пропорционально занятому весами пространству, с оговорками на роутер moe архитектуры и др.)

Очень толково, но мне кажется, что для дома бюджет не реалистичный, да и жена выгонит, если серверный шкаф будет гундеть 24 на 7.

Минусы 128гб систем к ней относятся точно также. Насколько помню, по вычислительной мощи это ~1\4 от 5090\6000, по пропускной способности ~1\6. Для себя не рассматривал её по собственными причинам (arm на linux - не то, с чем хотелось бы возиться и альтернативно применять). Из плюсов - отлично стакается через фирменный интерконект на очень высокой скорости и это всё ещё cuda. Минусы - дорогая и небыстрая cuda :( Если бы она вышла по той цене и в те сроки когда её анонсировали - было бы неплохо. Сейчас и в почти два раза дороже - довольно нишевое устройство

Кстати, квен скачался, запустил, получил на CPU/ddr5 15tps, т.е. 8 это все-таки маловато.

я сейчас попробовал gemma-4-26b-a4b-qat
31 токен в секунду.

а qwen3.6-35b-a3b дает 8 токенов. Запускал на deafult параметрах в LM Studio.

Промпт был одинаковый - "напиши о себе, что ты умеешь, какие у тебя возможности".

Почему такая разница - ведь они обе MoE

квантизация у вас скорее всего разная, сравнивать нужно в одинаковых условиях

Скрытый текст
Небыстрая cuda?! Что здесь имелось ввиду? Есть много альтернатив? Ну то есть да, есть, но от других производителей с худшей пропускной способностью
Небыстрая cuda?! Что здесь имелось ввиду? Есть много альтернатив? Ну то есть да, есть, но от других производителей с худшей пропускной способностью

сразу отвечу - 5090, будет примерно в 4 раза быстрее мака

а Nvidia DGX Spark 128GB 4TB вариант? продают за 500к на Авито.

тут уже зависит, потому что на 5090 moe буду сильно быстере, там сумасшедная разница в пропускной способности, а вот в спарк тупо более крупные модели буду помещаться

потому что у MoE моделей считаются только активные веса (понятное дело, что там еще кэш и тд), но даже чисто гипотетически единовременных экспертов в памяти должно быть меньше, чем занимает qwen 3.5 27b

MLX странный формат. На маке на маленьком контексте он действительно работает лучше чем GGUF, но с ростом контекста хотя бы до 64к (а это обычная агентская разработка) скорости начинают деградировать сильнее чем GGUF.

Плюс очень странная история с MTP. Его очень долго добавляли в MLX и как будто бы добавили тоже не очень правильно. Но тут нужно поресерчить, говорю по ощущениям с дискуссий реддита

Тестирование это хорошо, но ни слова про перегрев. Или у вас дополнительное охлаждение или тесты делались быстро и в холодильнике? На мак-мини запускал модели, спустя минуту вентилятор работает почти на полную мощь. Интересно как на тоненьком air без вентиляторов проводили тесты.

MacBook Air не особенно грелся. Не было не вентилятора, ничего подобного. Во время тестов до тротлинга не дошло. Температура в комнате была наверное градусов 25, потому что лето не самое холодное

Статья классная, спасибо автору.

Кто-нибудь использовал amd radion ai pro r9700? Особенно интересна связка из двух карт для распределенных моделей локальных llm. Как вообще на практике?

Что у AMD, что у Intel с этим была страшная беда еще 2 года назад, во времена когда я работал в одной синией конторе мы активно пытались это фиксить, так что сейчас, мне кажется ситуация значительно лучше, но мне кажется, что все еще очень далека от Nvidia и даже ВНЕЗАПНО Apple.

По идее если обе карты подключены в PCIe, то оно и будет бутылочным горлышком, но пропускная способность настолько высокая у интерфейса, что мне кажется должн быть не очень заметно.

Пропускная способность зависит только от материнки, насколько я понял. А количество карт даёт возможность загрузить более увесистые нейронки. Прочитал с amd из-под ubuntu работать можно.

Если это запуски для дома, и не надо гонять параллельно 100500 потоков, то в PCI упереться невероятно сложно, трафик между картами по меркам шины мизерный. Зимой измерял на облачном кластере, при запуске дипсика было ~700Mbps. Дома на запусках сеток попроще шина выше 10% не забивалась. Даже запуск между устройствами в локалке на 2.5GbE упирался отнюдь не в сеть.

У llamacpp есть несколько тредов где собирают производительность в относительно унифицированном виде, по AMD посмотрите здесь https://github.com/ggml-org/llama.cpp/discussions/15021 Имейте ввиду что производительность приводится на очень небольшой модели.

Автор, чисто чтоб проверить свои ощущения, не в претензию: статья писалась LLM-кой или вычитывалась ей?

К содержанию тоже без претензий, было познавательно.

Просто хочется понять, кажется мне или нет)

Статья частично оформлялась с помощью ЛЛМки (грамматика, какие-то косяки в логике), потому что оригинально это были просто собственные эксперименты, которые я решил оформить на хабр потому что появилось пару мыслей по ходу написания о текущем состоянии комьюнити

Шаг 1 — собрать llama.cpp

Ну зачем пугать людей с первого же пункта? На гитхабе llama.cpp раздел релизы вовсе не пустой, и более того появляется по несколько релизов в день, так что что-то собирать есть смысл только если уж очень свербит и не подождать несколько часов появления нового релиза.

Вообще вот абсолютно минимальный QuickStart локальной нейронки:

  • Качаем с гитхаба llama.cpp релиз под вашу архитектуру, распаковываем куда больше нравиться

  • Качаем с HuggingFace понравившуюся модель в формате gguf, ложим куда нравиться

  • Запускаем: llama-server --model путь_к_нейронке.gguf

Всё готово! Запускаем браузер, заходим на 127.0.0.1:8080 и пользуемся.

Я на тот момент билдил с дев ветки, не очень сильно ждать хотелось

Sign up to leave a comment.

Articles