Комментарии 17
Купить Mac Studio на 512 ГБ за 15 тысяч долларов -чтобы огромная 400B-модель в абсолютной тишине, без шума вентиляторов и с потреблением 100 Ватт генерировала тебе рецепт шарлотки.Дорого? Да. Бессмысленно? Возможно. Но зато как эстетично на рабочем столе! 🍏✨
Не понял зачем сравнивать с RTX PRO 6000?
Mac M5 Ultra на 256Гб памяти в магазине Эпла стоит $10800.
RTX PRO 6000 самый дешевый на амазоне стоит $15000, чтоб более менее сравняться по объему, например, для запуска DeepSeek 4 Flash надо минимум два, и то не известно насколько больше будет DeepSeek 4 Flash Vision, может в 2 уже не влезет. То есть 30 тыс долларов только на карты + все остальное.
То есть они никак не конкуренты. Можно сравнить с кластером из двух DGX Spark, по деньгам примерно одинаково, а вот по производительности Спарки сольют сильно, как минимум генерация у них будет раза в 4 медленнее, prefil может будет такой-же, тесты покажут.
Цен на Mac M5 Ultra 512 сейчас еще нет, но в теории, он позволит использовать GLM-5.3 с 4-м квантом на скорости достаточной для работы, а не просто поиграться.
512 ГБ единой памяти Apple реальный аргумент: сопоставимый объём памяти на дискретных картах стоит на порядок дороже
Память у Apple все равно медленнее, чем на специализированном железе, и ядер меньше. Это хорошая рабочая машинка, но сравнивать с ускорителем или покупать вместо - идея так себе.
Исходя из этой логики, RTX PRO 6000 гораздо медленнее чем B300, память аж в 4.5 раза медленнее, просто кошмарный разрыв, для сравнения между pro 600 и новым эпл студией разрыв сильно меньше. А значит и ничего кроме B300 покупать нельзя. :)
Требования к скорости растут кратно объёмам данных. Условно они увеличили объем памяти в четыре раза, а скорость лишь в два. Что толку от 512Гб, если все это тормозит? Как персоналка мак идеален (у меня m5 pro). Но в качестве числодробилки для гигантских моделей это извращение.
Оно не совсем так работает. Есть две очень популярные модели: Qwen3.8 27b и DeepSeep Flash 284B. Дипсик в 10 раз больше чем Квен, однако если их запустить на одинаковом железе с достаточным количеством памяти, он будет работать быстрее чем Квен. Чисто за счет того, что это МоЕ модель у которой только 13B параметров активны, а у Квен все 27B. Знаю того, у кого есть два DGX Spark подключенных в кластер на котором у него работал Дипсик Флеш и он подтверждает это: попробовал новый Квен, оказалось, что он медленнее Дипсика на его железе, вернулся на Дипсик.
Все современные модели, выпущенные за последние полгода больше чем 31B - они MoE модели.
(у меня m5 pro)
У нового m5 ultra во-первых память в четыре! раза быстрее чем у m5 pro (307Mb/s у про против 1.2Tb/s у ультры), во-вторвых CPU ядер в 2 раза больше чем у про, в третьих GPU ядер в 4 раза больше чем у про.
Посмотрим на первые тесты, но похоже на 256Mb версии уже можно будет полноценно работать с такими моделями DeepSeep Flash и сегодня вышедшим GLM-5.3 Flash (c 4-м квантом) получая скорости сравнимые со скоростью АПИ и обладателям этих машинок подписки станут уже не нужны.
Цифры - из официальных спецификаций NVIDIA и пресс-релиза Apple, не из маркетинговых слайдов «в X раз быстрее», не люблю такое.
и тем не менее вы взяли маркетинговые цифры. Весь инференс пока что заточен на использование cuda, который есть только у nvidia видеокарт. Т.е. сравнивать производительность чисто по пропускной способности и даже мощности gpu бесполезно.
Я когда-то спрашивал на хабре, можно ли взять MaxSun Intel Arc Pro B60 Dual 48G - сказали, что без cuda скорость может быть раза в два ниже, чем у аналогичного решения от nvidia. Но там хотя бы полноценная дискретная видеокарта, а тут просто cpu с чуть более продвинутой оперативной памятью.
а тут просто cpu с чуть более продвинутой оперативной памятью.
Ну еще и немножко GPU, не только CPU. А если приглядеться повнимательнее, давайте сравним эту вашу аж дискретную видеокарту с m5 ultra чипом:
Memory bandwich - напрямую влияет на скорость генерации токенов, у Intel Arc Pro B60 - 456 GB/s, у M5 Ultra - 1.2 TB/s - в три раза больше.
Производительность видео, у Intel Arc Pro B60 с 40 видеоядрами - около 50 fp16 tflops, у M5 Ultra пока не известно, но если экстраполировать с M5 Max у которого 40 видеоядер, до Ultra с его 80 видеоядер, то будет где-то в районе 140 fp16 tflops. То есть у мака чистой производительности в 3 раза больше.
Итого, ваша полноценная видеокарта намного медленнее того, что есть у нового мак студии. И памяти у студии гораздо больше.
откуда у вас такие данные? Если от нейросети, то она вполне может галюцинировать:

Это модель Qwen3-30B-A3B в квантизации Q4_K_M. Потом еще переспрашиваешь у нее "как у тебя получилось так, что пропускная способность в два раза выше, а токенов выдает даже меньше", то она "ой, извините" и называет количество токенов у m5 max в два раза меньше.
Может быть m5 ultra и обогнал по скорости b60 - тестов еще нет, но чтобы запускать ии в 3 раза быстрее - это просто смешно. Если бы встроенные ноутбучные видеокарты так обходили десктопные, то люди бы только их и покупали
Спеки по интеловской карте на сайте интела, правда там флопсы только fp32 (12.28), но memory bandwich тот, что я указал: https://www.intel.com/content/www/us/en/products/sku/243916/intel-arc-pro-b60-graphics/specifications.html
FP16 есть здесь, в этих спеках: https://www.techpowerup.com/gpu-specs/arc-pro-b60-dual.c4384
Про макбук, memory bandwith у m5 ultra из официального пресс релиза: https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/
Флопсов там нет, но есть количество ядер. Флопсы для m5 max, у которого ядер в два раза меньше, я взял отсюда: https://skorppio.com/blog/apple-m5-max-vs-nvidia-ai-deep-dive
Если бы встроенные ноутбучные видеокарты
Какие еще встроенные ноутбучные карты? Эпловский M чип это в одном корпусе и CPU, и GPU, и память. Нет разных карт, есть один чип на все, чтоб минимизировать расстояния между элементами внутри чипа для повышения производительности. Чем длиннее дорожка, тем меньше максимальная частота которую можно по этой дорожке передать, ибо сигнал затухает.
Смотрите какая интересная вещь получается - вы хотите сравнить производительность для fp16 или fp32, вот только intel заточен под работу с int квантованием и конечно может проигрывать в fp железу, которое на fp специализируется.
Дальше вы сравниваете не реальный а маркетинговый (пиковый) показатель tflops, на котором предсказуемо модель не будет работать постоянно. Кстати по ссылке для intel вы еще не учитываете приписку x2 (потому что две видеокарты в одной).
Эпловский M чип это в одном корпусе и CPU, и GPU, и память. Нет разных карт, есть один чип на все, чтоб минимизировать расстояния между элементами внутри чипа для повышения производительности. Чем длиннее дорожка, тем меньше максимальная частота которую можно по этой дорожке передать, ибо сигнал затухает.
Вы путаете кэш и оперативную память. У Apple устройств она намертво припаяна близко к чипу, но точно не находится в нем. Соответственно где я неправ? Может arm процы и имеют другую архитектуру, но упрощенно это все те же cpu+встроенная ноутбучная видеокарта - пожертвовали производительностью для того, чтобы запихнуть все в маленький корпус.
И предположу, что из-за цен производители в дальнейшем наоборот будут делать память модульной, а в новые устройства вставлять только необходимый минимум с возможностью апгрейда (как это уже бывало раньше)
вот только intel заточен под работу с int квантованием
Для инреференса моделей используется fp16, а не int8. Даже когда модель заквантованна до 4, или скольки угодно бит, в нее зашиты таблицы, где каждому квантованому значению есть соответствующее fp16 значение и именно эти значения используются в расчетах.
Кстати по ссылке для intel вы еще не учитываете приписку x2
Посмотрите внимательнее мое исходное сообщение, для интеловской карты я использовал 50 tflops, что примерно равно 24.58 умноженному на два.
Вы путаете кэш и оперативную память. У Apple устройств она намертво припаяна близко к чипу, но точно не находится в нем.
Отсюда: https://en.wikipedia.org/wiki/Apple_M5
Each chip integrates a central processing unit (CPU), graphics processing unit (GPU), neural processing unit (NPU), and unified memory in a single package.
Вольный перевод: Каждый чип содержит ЦПУ, ГПУ, НПУ и память в одном пакете.
но упрощенно это все те же cpu+встроенная ноутбучная видеокарта
"Встроенная ноутбучная видеокарта" можно сказать про чип M5 начального уровня, где всего 8 видеоядер ядер и работает она чуть быстрее ноутбучной Nvidia 3050, дискретной а не встроенной: https://www.notebookcheck.net/Apple-M5-8-Core-GPU-Benchmarks-and-Specs.1244908.0.html
Чип M5 Ultra ставится не в ноутбуки, а в настольные системы и содержит в десять раз больше видеоядер. Тестов еще нет, посмотрим как выйдет.
из-за цен производители в дальнейшем в дальнейшем наоборот будут делать память модульной
У эпловских процессоров один разработчик - сам эпл. Что касается других производителей, Cerebras разрабатывает чипы где память внутри вычислительных модулей, Nvidia недавно купила их конкурента Groq, очевидно чтоб самим также делать, OpenAI тоже делают свой чип где память на одном кристалле с вычислительными модулями.
Причина простая - так выходит на порядки быстрее и экономичнее. Для справки, насколько быстрее: https://habr.com/ru/news/1074634/
Для инреференса моделей используется fp16, а не int8. Даже когда модель заквантованна до 4, или скольки угодно бит, в нее зашиты таблицы, где каждому квантованому значению есть соответствующее fp16 значение и именно эти значения используются в расчетах.
1)инференс, а не "инреференс". Вы его даже назвали неправильно - о чем говорить дальше.
2)почему вы решили, что int8 вообще не используется? Оказывается производители llama, mistral, qwen, gemma и т.п. впустую тратят ресурсы, выпуская int8?
Отсюда: https://en.wikipedia.org/wiki/Apple_M5
Each chip integrates a central processing unit (CPU), graphics processing unit (GPU), neural processing unit (NPU), and unified memory in a single package.
Вольный перевод: Каждый чип содержит ЦПУ, ГПУ, НПУ и память в одном пакете.
1)википедия - очень "авторитетный" ресурс
2)вы сами пишете "ЦПУ, ГПУ, НПУ и память в одном пакете" - с чего вы решили, что они являются физически одним неделимым объектом? Даже без познаний архитектуре - память делается на одних заводах, cpu+gpu на других. Как вы себе представляете процесс их соединения в единое целое? Одно из них расплавить до кремния и наплавить на второе?
"Встроенная ноутбучная видеокарта" можно сказать про чип M5 начального уровня, где всего 8 видеоядер ядер и работает она чуть быстрее ноутбучной Nvidia 3050, дискретной а не встроенной: https://www.notebookcheck.net/Apple-M5-8-Core-GPU-Benchmarks-and-Specs.1244908.0.html
1)разговор шел про архитектуру. Каким образом вы сюда приплели сравнение мощности?
2)т.е. вы хотите сказать, что gpu в новейшем m5 проце работает на уровне дискретной видеокарты начального уровня четырехлетней давности, причем даже не десктопной, а ноутбучной? А m5 ultra видимо ожидается на уровне ноутбучной 3060, а до современных десктопных видеокарт ему как до луны?
Чип M5 Ultra ставится не в ноутбуки, а в настольные системы и содержит в десять раз больше видеоядер. Тестов еще нет, посмотрим как выйдет.
Чип m5 max ставится в ноутбуки, т.е. ноутбучный. Чип m5 ultra - это просто два чипа m5 max в одном корпусе. Вы хотите сказать, что если в ноутбучное железо добавить еще один нотубучный проц, то железо перестает быть ноутбучным?
У эпловских процессоров один разработчик - сам эпл. Что касается других производителей, Cerebras разрабатывает чипы где память внутри вычислительных модулей, Nvidia недавно купила их конкурента Groq, очевидно чтоб самим также делать, OpenAI тоже делают свой чип где память на одном кристалле с вычислительными модулями.
Причина простая - так выходит на порядки быстрее и экономичнее. Для справки, насколько быстрее: https://habr.com/ru/news/1074634/
1)я даже не знаю, как это комментировать. Если у вас любой производитель комплектующих может просто взять и напечатать память, то откуда тогда в мире дефицит памяти, а производимая память раскуплена уже на весь 2027 год? Например, Nvidia уже поставляет просто чипы, а не комплекты чип+память как раньше:
https://runet.news/articles/66201
2)Вы только что сравнили проц с asic для нейросетей. Даже без познаний в архитектуре asic вас никак не смущает, что они существуют давно, они мощнее, но никто их не ставит в компьютеры вместо cpu/gpu?
1)я даже не знаю, как это комментировать.
2)Вы только что сравнили проц с asic для нейросетей.
ОК, напишу по-другому. Смысл в том, что производительность современных видео (да и процессоров тоже) упирается в пропускную способность памяти. Увеличить ее можно либо увеличивая количество линий - тут уже достигли предела, либо повышая частоту на которой передается сигнал от памяти к процессору. Но чем выше частота, тем сильнее затухает сигнал при одной и той-же длине дорожки от микросхемы памяти, до процессора. И надо либо увеличивать напряжение, либо уменьшать длину дорожки. Эпл подошли к этому радикально - ставят кристаллы памяти внутрь одного чипа с процессором, вплотную с его кристаллом, чтоб длина дорожек от памяти до процессора была минимальная. В результате они имеют хорошую производительность с низким потреблением электричества.
На мой скромный взгляд, в будущем будет все больше производителей использовать либо такой подход, либо вообще интегрировать память в тот-же самый кристалл процессора/видеопроцессора, ибо в этом случае выигрыш максимальный.
На ваш взгляд будущее выглядит по-другому, когда в видеокартах будут слоты расширения памяти. В свете вышесказанного я считаю это маловероятным, ибо слоты расширения увеличивают помехи мешают достичь максимальной производительности. Но кто знает, может вы и правы и мы увидим видеокарты начального и среднего уровня со слотами памяти.
2)почему вы решили, что int8 вообще не используется? Оказывается производители llama, mistral, qwen, gemma и т.п. впустую тратят ресурсы, выпуская int8?
Никто из них не тратит ресурсы на int8, и у них нет моделей с тензорами int8. Некоторые выпускают модели с тензорами fp8, но это все еще формат с плавающей точкой и не имеет никакого отношения к целочисленному int8. Квантование, это совсем другое, это упаковка тензоров чтоб они занимали меньше места, но после распаковки тензоры все еще fp16.
1)википедия - очень "авторитетный" ресурс
2)вы сами пишете "ЦПУ, ГПУ, НПУ и память в одном пакете" - с чего вы решили, что они являются физически одним неделимым объектом?
Найдите фотки и посмотрите. Один кристалл - CPU+GPU+NPU и прочая обвязка, рядом вплотную к нему размещают кристаллы памяти. Все в корпусе одного чипа, в виде одного неделимого объекта. Если у вас есть ссылки на то, что это не так - пожалуйста поделитесь ими.
Чип m5 max ставится в ноутбуки, т.е. ноутбучный.
Ок, и видео в этом ноутбучном m5 max намного быстрее вашей современной дискретной сдвоенной видеокарты Intel Arc Pro B60 Dual 48G, не говоря уже о количестве доступной и более быстрой памяти. И при этом весь ноут вместе с экраном потребляет меньше этой одной дискретной видеокарты.

Больше памяти — не значит быстрее: prefill, decode и релиз Apple M5 Ultra