Обновить
128K+

Процессоры

Изучаем мозги вычислительных устройств

142,07
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Когда быстрый чип ждет данные: где России искать место в гонке ИИ‑ускорителей

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели2.6K

Когда говорят об аппаратном обеспечении для искусственного интеллекта, разговор обычно быстро сводится к GPU. У кого больше ускорителей, современнее техпроцесс и выше показатели в FLOPS, тот и должен выигрывать технологическую гонку.

На практике мощный вычислительный кристалл может значительную часть времени ждать, пока память и интерфейсы доставят ему данные. За десять лет производительность вычислительных блоков GPU выросла намного быстрее пропускной способности памяти, а стоимость HBM остается высокой и в последние годы росла даже в пересчете на емкость и пропускную способность. Поэтому эффективность современной ИИ‑платформы определяется уже не отдельным чипом, а всей системой: памятью, межсоединениями, хост‑процессором, компилятором и программной средой.

Может ли Россия участвовать в этой гонке, не пытаясь полностью повторить NVIDIA? Какие направления выглядят реалистичнее универсального GPU и где в подобных системах может использоваться RISC‑V?

Под катом разберемся, чем инференс отличается от обучения, зачем ускорителю собственные управляющие процессоры и почему перспективной точкой входа могут стать Edge AI, промышленная автоматизация и робототехника.

Читать далее

Новости

Палеокомпьютинг, часть 1: процессор Вирта, проект Оберон, новая архитектура в Qemu и KubeVirt и запуск в Cozystack и K8s

Время на прочтение58 мин
Охват и читатели3.1K

1 января 2024 года умер Никлаус Вирт, человек, который придумал Pascal, Modula-2 и Oberon, получил премию Тьюринга и всю жизнь упрямо воевал с раздутым софтом. Мало кто знает, что уже глубоко за семьдесят он сел и спроектировал собственный процессор, маленький и простой, чтобы на нём можно было показать студентам компьютер целиком, от логических вентилей до окон на экране.

В сентябре 2026 года я взял этот процессор и попробовал запустить его везде, куда смог дотянуться. Сначала прямо во вкладке браузера, причём не в эмуляторе, а в виде той самой схемы, которую нарисовал Вирт. Потом в QEMU, как обычную виртуальную машину. Потом в Kubernetes, где вообще-то живут совсем другие виртуалки, с Ubuntu и базами данных. И в конце концов в Cozystack, нашей облачной платформе, где машину Вирта теперь можно поставить кнопкой из каталога, как какой-нибудь PostgreSQL. По дороге я наконец измерил то, о чём программисты спорят десятилетиями, — сколько на самом деле стоит проверка выхода за границы массива. Ещё запустил на процессоре Вирта маленькую языковую модель. И, раз уж честно, одним неосторожным движением отправил в переезд все виртуалки рабочего кластера (никто не пострадал, но было неприятно).

Статья получилась очень длинной, потому что за девять дней случилось очень много всего, и значительная часть случившегося — это мои собственные ошибки, которые пришлось находить и исправлять. Я старался писать так, чтобы её мог читать человек, который про Оберон никогда не слышал, а всё, что интересно только специалистам, спрятал под спойлеры. Читать можно подряд, а можно прыгнуть сразу в интересную часть. Сначала будет рассказ про сам Оберон, потом про то, как разваливался мой первоначальный план, потом про процессор и проверку границ, про браузер и лабораторные, про QEMU, Kubernetes и Cozystack, а в самом конце про языковую модель и про то, как всё это поставить себе.

Читать далее

Как плата ASUS убила Ryzen 9 9950X3D после выбора профиля памяти

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели6.4K

Один из самых опасных пунктов в BIOS на первый взгляд выглядит совершенно безобидно. Речь не про разгон процессора или ручные настройки напряжения. Это готовый профиль памяти, который плата сама предлагает включить в один клик. Пользователю даже не придется подбирать тайминги самому. На платформе AM5 такой клик уже не первый раз заканчивается мертвым процессором. Обиднее всего, когда это стоит владельцу флагманского Ryzen 9 9950X3D. Поэтому интересно понять, что плата успевает поменять в этот момент, почему страдает процессор, а не модули памяти, и как проверить, что автоматика не переборщила.

Читать далее

Андервольтинг процессора Intel 12+ поколения на примере Fanless Mini-PC Chatreey TK12-F с Intel Core i5-1235U

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.6K

“Если нельзя, но очень хочется, то можно”

Начиная с 12-го поколения, Intel окончательно заблокировала интерфейсы управления напряжением на уровне микрокода для большинства мобильных процессоров. Официально андервольт остался доступен только на части топовых с индексами HX и HK. В итоге на большинстве процессоров H-серий и всех энергоэффективных процессорах P- и U-серий изменить напряжение напрямую через ThrottleStop или Intel XTU в Windows стало технически невозможно — соответствующие ползунки превратились в неработающие “декоративные элементы”. Однако лазейки, позволяющие обойти запрет, всё-таки остались. Об этом мы сейчас и поговорим.

Читать далее

SystemRDL на примере PeakRDL: добиваемся консистентности регистров в RTL, верификации и документации

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.4K

При разработке IP-блока инженеру приходится писать логику, превращающую входные данные в выходные. Желательно, чтобы этой логикой можно было еще и управлять в рантайме, поэтому в IP-блок добавляют контрольные и статусные регистры, которым нужно обеспечить подключение со стороны системного интерконнекта.

Теперь представим: архитектор описывает эти регистры в каком-нибудь markdown, инженер, глядя на них, пишет Verilog имплементацию, а разработчик драйвера вручную создает заголовочные файлы на C. Если повезет, все эти компоненты будут соответствовать друг другу. Но только один раз. Решить проблему соответствия способен язык SystemRDL.

Читать далее

В 100 раз эффективнее ARM: потоковый процессор Electron E1

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели20K

Если энергопотребление ЦОДов будет и дальше расти, то для них придётся выкупать мощности АЭС, как это сделали Microsoft и Amazon. Но должен быть другой выход. Поэтому есть большая потребность в энергоэффективных CPU.

Год назад стартап Efficient Computer представил «самый энергоэффективный в мире» процессор Electron E1. Разработчики попытались заново изобрести универсальный CPU, ориентируясь именно на энергоэффективность. Правда, конкретно этот CPU предназначен для embedded-систем, но схожую архитектуру применяют и для ЦОДов.

Новый CPU в 10−100 раз эффективнее ARM на типичных embedded-задачах, таких как быстрое преобразование Фурье (по данным с сенсоров) или выполнение свёрток (вычисление карты признаков) в свёрточных нейросетях.

Сейчас E1 и компилятор проходят тестирование среди разработчиков. Участники закрытой программы тестирования могут проверить свой код С и С++ в веб-песочнице, оценить его энергоэффективность на новом CPU.

Читать далее

Как дилетант устройство процессора Интел 8080 изучал

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели6.1K

Некоторое время назад стало доступно описание на языке Verilog легендарного микропроцессора 8080, полученное реверс-инжинирингом с фотографии кристалла его советского клона — КР580ВМ80А. Кому интересно техническое изложение про авторскую реализацию этого процессора — добро пожаловать под кат.

Читать далее

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Время на прочтение17 мин
Охват и читатели12K

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.

Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением пропускной способности и минимизацией задержек. Два этих показателя необходимо оптимизировать в рамках ограничений, задаваемых тремя принципиальными факторами: вычислительные (скорость аппаратных операций и поддерживаемые типы), память (ёмкость и иерархия) и коммуникация (ширина передачи данных в памяти и сети, задержка и иерархия). Эти концепции отлично рассмотрены в книге Scaling Book от Google, а именно в разделе Roofline.

Читать далее

SoftSerial: Двоичный ЦАП на STM32 (или формирователь цифрового паттерна)

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели8.5K

В этом тексте я показал как сделать универсальный полностью конфигурируемый однобитный ЦАП на основе микроконтроллера STM32F407ZG.

Суть проста.
В программе есть RAM массив двоичных семплов длинны N, которые надо отправить "на улицу" со строго выдержанным микросекундным периодом.

Есть частота дискретизации, задаваемая частотой переполнения аппаратного таймера.

Надо выдать на GPIO пин этот поезд из нулей и единиц. Причем сделать это так, чтобы в ARM процессоре было не более 2х прерываний: половина перемещения и окончание перемещения.

В тексте представлена пошаговая методичка того как это сделать.

Читать далее

SoftSerial: Двоичный АЦП на STM32 (или самодельный логический анализатор)

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели10K

Можно ли на STM32 реализовать однобитный ADC?
Причем без использования аппаратного ADC.

Да так, чтобы GPIO пин читался со строго определенным микросекундным периодом по команде аппаратного таймера и сохранял значения прочитанных логических уровней в массив.

При этом во время чтения N однобитных семплов должно произойти не более 2х аппаратных прерываний.

Да, можно.

Читать далее

О нанометрах. Просто

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9.6K

Поговорим о нанометрах. Просто и доступно. Что такое «тонкий» и «толстый» нанометры? В чем отличия? И кто лучше?

Собеседник — Халиль Эль‑Хажж, руководитель службы проектов и внедрения НТЦ «Модуль». В прошлом — старший инженер сектора физического дизайна (топологии) цифровых СБИС НТЦ «Модуль».

Читать далее

Аппаратная безопасность платформ на базе RISC-V

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели6.1K

Вычислительные узлы используются в средствах связи, платёжных терминалах, транспорте, сетевом оборудовании, промышленной автоматике, бытовых и носимых устройствах. Эти устройства исполняют код, работают с криптографическими ключами, принимают обновления, подключаются к сетям и нередко эксплуатируются вне контролируемой среды.

Многие такие изделия хранят или обрабатывают активы, требующие защиты: криптографические ключи, учётные данные, встроенное программное обеспечение, пользовательские данные. Защищённость этих активов определяется в том числе свойствами аппаратной основы. Ошибки разграничения доступа, некорректная конфигурация отладочных интерфейсов, уязвимая цепочка загрузки или недостаточно проверенный сторонний IP-блок могут нарушать предпосылки, на которых основана работа программных средств защиты.

Аппаратная безопасность охватывает вопросы проектирования микроконтроллеров, систем на кристалле, IP-ядер, загрузочных цепочек и других компонентов вычислительных платформ. В рамках одной статьи подробно раскрыть все эти направления невозможно, поэтому ниже приведён вводный обзор основных классов угроз, подходов к верификации, аппаратных механизмов защиты и возможных направлений исследований на базе RISC-V.

Читать далее

Как я учил планировщик класть широкие команды для Эльбруса, и почему LLM проиграла жадному алгоритму за 3 миллисекунды

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели10K

Проще говоря, NEX CLI x Elbrus берет граф и модель e2k‑v6 и показывает: сколько насчитал жадный, сколько мог бы идеальный, и на какой операции и каком канале разница.

Читать далее

Ближайшие события

Микрокод внутри сопроцессора Intel 8087: обмен регистрами

Уровень сложностиСложный
Время на прочтение13 мин
Охват и читатели14K

В 1980 году Intel 8087 стал первым массовым математическим сопроцессором компании и заложил основу для современных вычислений с плавающей точкой. Сегодня его уже не встретить в компьютерах, но внутри этого чипа скрыта интересная инженерная история: сложные операции выполнялись с помощью микрокода, записанного в собственном ПЗУ.

В этой статье разберём, как устроен микрокод одной из инструкций 8087 — FXCH, которая меняет местами значения в стековых регистрах. На первый взгляд операция кажется простой, но внутри она превращается в последовательность из 14 микроинструкций с проверкой тегов, обработкой исключений и обменом данных через временные регистры. Посмотрим, как исследователи восстановили эту логику по фотографиям кристалла и что можно узнать о внутреннем устройстве процессора спустя десятилетия после его выхода.

Разобрать 8087

Пишу алгоритм FFT на Си для процессора Эльбрус: прямая векторизация

Уровень сложностиСложный
Время на прочтение192 мин
Охват и читатели18K

Данная статья является продолжением предыдущей статьи.
Здесь рассматривается вариант прямой векторизации алгоритма FFT.
Перед чтением рекомендуется бегло ознакомиться с предыдущей статьёй.

Читать далее

ARM в сервере: будущее инфраструктуры или очередной провал

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели12K

В первом квартале 2026 года 17,7% проданных серверных процессоров были на ARM. AWS уже выпускает пятое поколение Graviton, Google предлагает Axion не только в виртуалках, но и на bare metal, Microsoft разворачивает Cobalt 200, а Oracle использует AmpereOne. При этом индустрия уже дважды хоронила эту архитектуру — в 2013 и в 2018 году. Под катом расскажу, кто лежит на кладбище ARM, почему третий заход оказался успешнее и готов ли ваш стек к переезду.

Читать

Как QEMU исполняет чужой код: изучаем Tiny Code Generator изнутри

Уровень сложностиСредний
Время на прочтение40 мин
Охват и читатели14K

QEMU — это не просто виртуализация с KVM. Его главная cуперсила — способность запускать программы, скомпилированные для одной архитектуры, на совершенно другом процессоре. Безо всякой поддержки со стороны хоста. Например, запустить прошивку для ARM-микроконтроллера на x86-ноутбуке.

Как это работает? Под капотом QEMU скрывается JIT-компилятор под названием TCG (Tiny Code Generator). В этой статье мы разберем его устройство на практических примерах для RISC-V и посмотрим, как инструкции превращаются из одного машинного кода в другой, как формируются блоки трансляции, и зачем там нужны longjmp и цепочки блоков.

Читать далее

PCIe и DDR3 на ПЛИС Gowin: как мы заставили работать то, что не работало у производителя

Уровень сложностиСложный
Время на прочтение18 мин
Охват и читатели14K

Привет, Хабр! Меня зовут Владимир Заикин. Под руководством Семёна Григорьева @rsdpisuy, я занимаюсь разработкой на ПЛИС в лаборатории YADRO в СПбГУ. Мой рассказ — о том, как мы реализовали общение по PCIe с ПЛИС на плате Sipeed Tang Mega 138K Pro с кристаллом GW5AST-138K от Gowin.

Устройство, реализованное на ПЛИС, должно было принимать данные по PCIe, сохранять их в DDR3 и обрабатывать пользовательской логикой. Чтобы реализовать такую функциональность, мы обратились к примеру взаимодействия с PCIe-контроллером от производителя платы, но тот оказался нерабочим. Пришлось разбираться самим. В итоге мы сделали рабочий стенд: Linux-драйвер, хост-программа на C и аппаратное описание на Verilog. Все это выложили в открытый доступ, чтобы поделиться своим опытом и помочь другим безболезненно разобраться с этой проблемой.

Читать далее

Полупроводниковый завод своими руками

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели96K

Периодически ко мне обращаются люди с вопросами вроде: «Я нашел инвестора на строительство полупроводникового завода, подскажите, с чего начать, какие подводные камни?» или «Я хочу начать производить сенсоры для видеокамер с нуля», ну и опять про подводные камни. Ну, давайте посмотрим, с чего начать и какие подводные камни.

Посмотреть на подводные камни

Самый уникальный x86 процессор из 90-х — Cyrix MediaGX. Как инженерам Cyrix удалось уместить целый компьютер в два чипа?

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели20K

Все мы с вами привыкли к тому, что балом на рынке x86-процессоров правят всем известные Intel и AMD. Некоторые читатели могут вспомнить также процессоры VIA (Centaur), которые массово применялись в тонких клиентах и ноутбуках в середине нулевых, единицы знают про чипы Transmeta серии Crusoe, которые отличались концептуально близкой к Эльбрусу VLIW-архитектурой, ну а совсем уж гики могут вспомнить Vortex86 — экзотические x86-процессоры, предназначенные для встраиваемых систем.

Однако люди незаслуженно забывают про Cyrix MediaGX — уникальный процессор родом из 1997 года, который интегрировал в двух чипах целый компьютер: и видеокарту, и звуковую карту, и PCI/ISA/IDE-контроллеры, и даже USB! Что за чудесный процессор сделала Cyrix, каким образом он прожил почти до конца нулевых, и причём тут AMD - читайте в сегодняшней статье!

Читать далее
1
23 ...