Обновить
64K+

GPGPU *

Технология Nvidia для реализации алгоритмов

26,59
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Время на прочтение10 мин
Охват и читатели97K

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Читать далее

Новости

Домашний ИИ: простой способ добавить «интеллект» своему компьютеру

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели9K

В этой статье мы рассмотрим открытые модели машинного обучения. Они не требуют обязательного подключения к интернету и подписки, никуда не передают ваши данные и достаточно компактные, чтобы их можно было запускать на ПК или ноутбуке. Эксперименты выполнялись на ПК с Core i5-14600, 32 ГБ DDR5 и RTX 3070Ti c 8 ГБ VRAM. Комментарии подготовлены экспертами лаборатории искусственного интеллекта российской ИТ-компании «Криптонит».

Читать далее

Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели7.4K

Большинство инструкций по локальному запуску LLM сводятся к одной-двум командам: вставьте их в терминал, дождитесь загрузки модели и готово. Такой подход работает ровно до первой ошибки. После этого становится непонятно, на каком из нескольких уровней возникла проблема: в Windows, WSL2, драйвере NVIDIA, Docker, CUDA или самом inference-сервере.

В этой статье развернем Qwen3-0.6B на обычной NVIDIA-видеокарте под Windows 11 с использованием WSL2, Docker, NVIDIA Container Toolkit и vLLM.

Читать далее

ROUGE‑V: как я транслировал CUDA/PTX в LLVM IR и запускал его без CUDA runtime

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели4.9K

Я написал транслятор CUDA/PTX в LLVM IR: он берёт PTX от настоящего nvcc и собирает его обычным clang. Восемь ядер уже исполнены на живой GeForce MX450 и побитово совпали с хост‑эталоном. А главное — как настоящий nvcc и видеокарта сломали мои зелёные тесты.

Читать далее

Qwen3.8–27B на двух RTX 3060 12ГБ: как я разогнал OpenCode с ~9 до ~40 токенов/с при 128K контекста

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели12K

Можно ли превратить две RTX 3060 12 ГБ на старой Z97-платформе в нормальный локальный backend для OpenCode? Я начал с 9 токенов/с на длинном контексте и в итоге получил около 40 токенов/с в реальной агентной сессии с контекстом за 100K без уменьшения модели и без отказа от 128K.

В статье — tensor split без CUDA P2P, Q8 KV‑cache, встроенный MTP, подбор n-max, неудачные эксперименты с NCCL и shared buffers, реальные long‑context тесты и проверка качества на coding‑задачах.

Читать далее

Мощный ИИ агент в 16гб VRAM

Время на прочтение8 мин
Охват и читатели106K

Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.

Читать далее

Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели109K

Qwen3.8-Flash-Next - открытая 125B-модель на архитектуре, которая станет основой Qwen4. По опубликованным Qwen результатам она конкурирует с закрытыми frontier-моделями в задачах программирования, работы с агентами и computer use.

Мы запустили полный checkpoint Qwen/Qwen3.8-Flash-Next на одной RTX 4090. Пиковое потребление VRAM составило 5,95 ГБ, без 4-битной квантизации и дистилляции. Использовался полный checkpoint в bf16, который генерировал обычные токены.

По сравнению с Opus 4.6 Max, согласно собственным данным Qwen:

Читать далее

Встречаем RTX PRO 6000 BSE: достойная ли это альтернатива H100 NVL по производительности, качеству и цене

Время на прочтение10 мин
Охват и читатели12K

Графический ускоритель NVIDIA RTX PRO 6000 Blackwell Server Edition в сравнении с более распространенными H100 интересен прежде всего аппаратной поддержкой NVFP4 — четырехбитного формата весов с двухуровневым масштабированием, представленного в 2025 году. Как переход моделей на NVFP4-квантизацию влияет на производительность? Что и при каких профилях нагрузки с учетом этого перехода окажется предпочтительней — ускоритель нового семейства Blackwell или старый знакомый H100?

Меня зовут Алексей, я инженер по разработке ПО искусственного интеллекта в YADRO. В ходе статьи я получу подробные ответы на эти вопросы, а помогут в этом YADRO G4208P G3 — производительные серверы для задач ИИ, машинного обучения и глубокой аналитики. В один такой сервер я установлю четыре RTX PRO 6000, в другой — восемь H100 NVL. Оценивать буду на моделях различного размера и архитектуры: Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE) в форматах FP8 и NVFP4, а также DeepSeek-V4-Flash в форматах Mixed FP4 и NVFP4. Использую vLLM в сценариях offline и server — vLLM 0.23.0 для Qwen, vLLM 0.26 для DeepSeek-V4-Flash — а также Docker-image на основе nvidia/cuda:13.2.0-cudnndevel-ubuntu22.04.

Читать далее

Как проект из ШАДа попал в Spotlight статей на конференции ICML 2026

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Граф из миллионов вершин не загружает современную GPU на все 100%: видеокарта почти всё время не вычисляет, а ждёт загрузки данных из памяти. Графовые нейросети, или GNN, упираются в это давно: сами операции достаточно простые, но доступ к памяти нерегулярный и разреженный. И чем мощнее GPU, тем заметнее недостаточная её утилизация.

Идея выросла из проектного курса в ШАДе. Толчком стало то, что один из самых популярных фреймворков для работы с графами, Deep Graph Library, на момент начала работы не обновлялся уже около года — это знак того, что в области что‑то застряло.

Меня зовут Федя Великонивцев, я старший исследователь Yandex Research, руковожу группой, которая занимается эффективными вычислениями на GPU. На том курсе мы с коллегами — Дарьей Фоминой из команды ML‑инфраструктуры Яндекса, Вячеславом Ждановским из команды разработки инференса — и студентами Даниилом Красильниковым, Алексеем Бойковым и Андреем Долговязовым взялись выяснить, почему графовые нейросети тормозят на современных GPU.

Так появился проект, который мы оформили в отдельную статью — On Efficient Scaling of GNNs via IO‑Aware Layer Implementations. Её приняли на ICML-2026 со статусом Spotlight. Для контекста: из 23 918 поданных работ приняли 6 352 (26,6%), а Spotlight достался только 536 работам — это 2,2% заявок с самыми высокими оценками программного комитета.

Дальше расскажу, как мы прошли путь от этого вопроса до трёх семейств специализированных GPU‑кернелов — с парой неожиданных находок по дороге.

Читать далее

AI ready: почему дата-центр для ИИ сложнее обычного модульного ЦОДа

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели11K

В первой статье я рассказал, как мы пришли к идее AI ready — локального контура, который собирает инженерную базу, вычисления и прикладной ИИ в одну систему. Теперь подробнее про первый «железный» уровень ИИ-контура — AI Base.

Идеи есть у многих, до пилота добираются единицы. Мы думали: возьмём концепцию модульного ЦОДа, немного подобьём её под стойки с GPU, и наш пилот полетит. В МЦОДе уже решены базовые задачи по компоновке, комплектации и автоматике — так зачем изобретать велосипед? Но первая гипотеза провалилась, как только мы начали считать нагрузку.

AI-нагрузка меняет подход к проектированию МЦОДа. Как именно? Полгода назад рабочей группе инженеров только предстояло это понять.

Скажу сразу: пилот AI ready сейчас находится на этапе разработки. Итоговую конфигурацию мы пока не утвердили, но базовые инженерные решения уже приняты. Про них рассказываю в статье.

Читать далее

Запускаем LLM локально на майнинг ферме из 4 GPU

Время на прочтение3 мин
Охват и читатели15K

В последнее время становится все более популярным локальный запуск LLM. У каждогг свои причины, но основные это: проблемы с западными сервисами, нестабильный интернет и утечка данных в открытый доступ (преценденты уже были).

В этой статье я расскажу как запускал LLM локально на майнинговом железе, какие тонкости есть при запуске. Расскажу архитектуру моей сборки и примерную стоимость железа. Также протестирую скорость работы с некоторыми наиболее популярными MoE LLM, включая модели от гугла и ChatGPT. По поводу целесообразности подобных сборок решение каждый примет сам исходя из своих задач и финансовых ресурсов.

Читать далее

Vibecode по дешевке — домашний сервер с Qwen Code за 25к, который не отключит Anthropic

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели72K

Я начинающий инженер: учусь, работаю, пишу код. Подсел на Claude — и быстро уткнулся в лимиты: полчаса работы, и могучие руки превращаются в лапки. А пока писал эту статью, Anthropic вообще взял и отключил Fable 5 — для всех разом. Сегодня доступ есть, завтра кто-то наверху решил — и ты ни с чем.

Поэтому я собрал собственный сервер с локальной LLM. Серверная Tesla V100 с Авито, переходник, водянка, открытая рама вместо корпуса — всё про 25 тысяч за базу (и ~35 со всеми доп. картами). Внутри крутится Qwen3.6-35B и пишет код со скоростью до 85 токенов в секунду.

В статье — честно и с цифрами: какое железо и почём, замеры скорости, как llama.cpp раскидывает одну модель сразу по нескольким видеокартам, и живые примеры того, что она умеет — от генерации кода до разбора чужого на прочность. Никакого облака и подписок: всё работает дома, рядом с кроватью, и его никто не отключит сверху.

Посмотреть. что собрал

Домик для ИИ: как завод пришёл к идее AI ready для бизнеса

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9.8K

Бизнес нацелился делать свой собственный AI. Все задают вопрос: «Какая модель мне нужна?» Но никто не задумывается, на каких мощностях модель будет работать. 

Мы тоже сначала не задумывались. Разработали корпоративного AI-агента, прокачали ИТ-команду, чтобы двигаться дальше — и споткнулись о «железный порог». Так родилась идея AI ready модуля. В статье рассказали, что это такое и почему AI начинается не с модели, а с инфраструктуры. 

Читать далее

Ближайшие события

48-кубитный гибридный симулятор Гровера на домашней видеокарте: пробиваем стены памяти и времени

Уровень сложностиСложный
Время на прочтение5 мин
Охват и читатели7.1K

Вокруг квантовых вычислений много маркетингового шума. Если вы попытаетесь смоделировать честное 48-кубитное квантовое состояние в комплексном базисе complex128, то неизбежно упретесь в «стену памяти» в 4.5 Петабайта. Если же вы решите применить блочную декомпозицию пространства состояний для ее поочередного обсчета, то упретесь в «стену времени» длиною в несколько лет непрерывных вычислений на GPU.

В этой статье мы разберем проект гибридного симулятора, который обходит обе стены, удерживая потребление видеопамяти в пределах 268 МБ, а время симуляции сокращает в 400 раз.

Давайте сразу снимем маски: физически данный симулятор не удерживает 48 кубитов в единой суперпозиции. Между старшей и младшей половиной регистра полностью отсутствует квантовая запутанность (entanglement).

Вместо этого применена жесткая, но эффективная классическая блочная декомпозиция (принцип Space-Time Trade-off, то есть размен памяти на время):

Читать далее

Ускоряем и оптимизируем numpy, pandas, scipy и sklearn

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели13K

С момента публикации статьи на Хабре «Импортозамещаем numpy, pandas, scipy и sklearn» прошло почти три года. В течение этого времени я приостановил работу над проектом из-за нехватки времени, ресурсов и сил. К тому же, меня расстроило, что не смог выполнить просьбу пользователя @N-Cube, который активно интересовался моей библиотекой и хотел ускорить работу своего Jupyter Notebook.

В самый критический момент на помощь пришел волшебный AI, который, хоть и иногда проявлял недостаток гибкости, с готовностью исполнял все пожелания своего хозяина. Благодаря этому проект начал продвигаться вперед.

За это время в библиотеки были добавлены поддержка CUDA, множество ручных SIMD-оптимизаций с динамическим выбором SIMD, несколько реализаций линейной регрессии и многое другое.

Давайте рассмотрим, что на сегодняшний день позволяет сделать моя библиотека.

Я представлю несколько тестовых примеров в двух вариантах: с использованием AVX-2 на процессоре Intel® Core™ i7-4790K и AVX-512 на Intel® Xeon. Также покажу результаты замеров для каждого из них. Все тесты проводились без использования GPU, исключительно на процессоре. Это позволяет сравнивать производительность Python и моей библиотеки на равных условиях. Операционная система – Ubuntu 24.04, компилятор – GNU 13.3.0.

Читать далее

SpaceX собирается выпускать собственные GPU

Время на прочтение4 мин
Охват и читатели12K

Нет, не для того, чтобы вытеснить с рынка NVIDIA, хотя в перспективе и такое возможно. Как бы то ни было, компания SpaceX неожиданно раскрыла планы по созданию собственных графических процессоров. Пока речь идет только о планах по выпуску продукции под собственные нужды (да, в космосе тоже нужны GPU). Посмотрим, что и зачем планирует выпускать корпорация Илона Маска.

Читать далее

Синтетика как топливо: почему self-training работает и где начинается model collapse

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели4.5K

Эта статья продолжает цикл о новой парадигме ИИ, на этот раз предлагаем обудить, как синтетика помогает и где начинается опасность.

Читать далее

Cтрою ИИ нового поколения на MacBook Air, пока корпорации сжигают миллиарды на GPU

Уровень сложностиСредний
Время на прочтение2 мин
Охват и читатели5.9K

Индустрия ИИ сегодня напоминает строительство Вавилонской башни. Пока гиганты вроде OpenAI, Google и Meta соревнуются, кто закупит больше H100 и сожжет больше мегаватт, я разрабатываю детерминированное ИИ-ядро на обычном MacBook Air M2 (8GB RAM). В этой статье я расскажу, почему текущий путь развития нейросетей - это тупик, и как математика O(1) на языке Rust решает проблему галлюцинаций.

Читать далее

Стена данных: почему ИИ упирается не в GPU, а в реальность

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели7.3K

В новой статье наш эксперт Антон Пчелинцев размышляет о причинах дефицита качественных данных, следующем прорыве в области развития ИИ и о том, что делать для получения преимущества.

Читать далее

Как мы внедряли QoS InfiniBand для приоритизации ML-обучений с точки зрения сети

Время на прочтение13 мин
Охват и читатели4.8K

В статье расскажем, как мы командой Yandex Infrastructure внедрили QoS в сетях InfiniBand при ограниченной вендорской поддержке и скудной практической документации. Обсудим мотивацию: рост смешанных нагрузок во внутреннем облаке и необходимость предсказуемых SLO для различных обучений. Отдельно рассмотрим как могут быть связаны QoS и топология сети DragonFly+.

Читать далее
1
23 ...