Pull to refresh

Comments 20

Потому что могут? (-:

Универсальность, ибо не все к ИИ сводится. На GPU кластере можно пускать очень малый класс задач. На CPU можно все подряд. Да, CPU+HBM в разы хуже по чистой энергоэффективности, но зато намного круче в плане универсальности.

В разы? Давайте возьмём первые 2 места с top500. ARM+SME vs GPU

Green500 List - June 2026 | TOP500

#1 LineShine  2,198.40 (PFlop/s) 52.070 (GFlops/watts)

#2 El Capitan  1,809.00 (PFlop/s) 60.941 (GFlops/watts)

Разница <15%

Да, в топе Green500 ARM+GPU c цифрой 70 (GFlops/watts)

Но там и масштабы поменьше.

Насколько вообще сегодня уместно называть GPU устройство, задачи которого никак не связаны с обработкой изображений? Просто CPU с архитектурой, предполагающей высокую параллельность и скорость вычислений за счёт примитивизации и всяческих инструкций для перемножения матриц за один такт. Я бы рассматривал это уже как отдельную архитектуру CPU. GPU не предназначается для майнинга криптовалют, ИИ и прочих задач. Пусть фактически это и одно устройство.

Потому что современный GPU не вписывается в стандартную классификацию single instruction multi data (SIMD), а писать "MSIMD with HBM compatible with CUDA" долго, вот и пишут GPU - всем понятно о чем речь.

Я бы рассматривал это уже как отдельную архитектуру CPU.

Она и есть отдельная и называется GP GPU.
Просто в последнее "GP" люди писать стесняются.

Они не стесняются, но неудобно писать в последнее GP.

создатели LineShine делают ставку на то, что современный CPU с HBM-памятью, широкими векторными блоками и сотнями ядер закрывает оба класса задач достаточно хорошо

В принципе старичок Fugaku на ARM без акселераторов до сих пор держится в десятке Top 500 (и в первой сотне есть ещё несколько машин на том же A64FX), так что ничего уникального в этом нет, хотя и нетипично.

Там Fujitsu довольно прилично в софт вложилась. Все что мне попадало оттуда в руки было довольно сильно переписано. Всякие ручные анроллы, ручной инлайнинг, луп фьюжн и прочие техники. Все это частенько на допотопном фортране и должно требовать уйму времени и денег на переписывание, тестирование и валидацию.

Вокруг любого суперкомпьютера крутятся специально обученные люди, которые только этим и занимаются.

Скорее всего на ARMv8.2 мастерили прототип, делать большой кластер не имеет большого смысла. А вот в ARMv9 добавили векторные инструкции, как раз, то что надо.

Вполне возможно. Ну и «чего им без дела лежать?» не исключаю. Хотя, здесь, сдаётся мне, некое кумулятивное многофакторное решение.

LX2 это ARMv9, два вычислительных кристалла, 304 ядра суммарно, 8 стеков HBM по 32 ГБ непосредственно на кристалле

Прям 8 стеков по 32 ГБ каждый, то есть в сумме 256 ГБ HMB на кристалле рядом с ядрами? Тут друг интересуется, можно ему один такой, ЛЛМ-ки погонять? :)

5 лет друг пусть подождет, как модули начнут списыватся - будут по сто баксов на али. Примерно как сейчас V100.

Качество генерации крайне низкое. Фактический материал испорчен бессмысленными добавлениями и некорректными переделками. Добавлен информационный шум.

Сама новость интересная. Вот пример, как она подается в других источниках. https://serverflow.ru/blog/novosti/kitayskiy-superkompyuter-lineshine-na-baze-arm-cpu-lx2-dostigaet-1-54-eflops-ii-proizvoditelnosti-be/

LX2 оснащены 32 ГБ памяти HBM с пропускной способностью до 4 ТБ/с и поддержкой до 256 ГБ внешней памяти DDR5 на один чип.

Как по мне это только звучит круто. На самом деле если там 304 ядра и если разделить 32Гб на всех, это примерно 105Мб на ядро. :-/
На самом деле плотность ядер на узел такова, что даже если взять DDR с 256Гб на 1 сокет, то выходит что на ядро выйдет менее 1Гб. С сапфиром интеловым уже наелись такого, у него был режим кэша (когда HBM L4 кэш, а DDR просто память), может и тут будет. Но латентность доступа в этом режиме не очень.

Возникает вопрос - что считать то будем? Ну ЛЛМки тренировать, но не проще было реально гпу взять, или что то тезорное? У кого есть задачи, которым нужно экзафлопс, но при этом меньше 1Гб на процесс? Напишите мне, если есть - очень интересно узнать что это. Взлом SHA, майнинг битка не предлагать, извините :)

Дальше. Количество ядер, экзафлопсы и особенности сети.
Понятно что на всем кластере никто не будет гонять одну задачу на всех узлах разом. Даже не половине. Стартап просто займет больше времени чем расчет. Но разок линпака наверно можно померять. Но вот беда, памяти там для HPL практически нет. Обычный, классический линпак он от сетки не очень зависит. И если бы всем нужен был бы только линпак кластеры строили бы на эзернете. А тут памяти мало и будет сильный дисбаланс в сетку. И кстати, что за сетка то? Ну и более, для таких монстров, актуальный вопрос - а свичи потянут? Mellanox/Nvidia на последних интерконнектах обещала вроде congestion free topology. А тут?
Вообщем вопросы-вопросы.

Открытый вопрос о LineShine: заявленные 2 EFLOPS — это достигнутая производительность или пиковая?

Таки достигнутая

Таки да, тоже сегодня увидел. Благодарю!

Sign up to leave a comment.

Information

Website
www.mts.ru
Registered
Founded
Employees
over 10,000 employees
Location
Россия