Обновить

Джереми Синклер поделился видеозаписью с демонстрации во время eXperience Day в кампусе Qualcomm.

Сравнению подвергли два ноутбука. Их полные спецификации названы не были, да и тест не настолько глубокий. Условно ситуацию можно описать так: справа находился новейший мобильный процессор Intel Core Ultra 7 155H, слева — Snapdragon X Elite. На обоих ноутбуках было запущено приложение для редактирования видео DaVinci Resolve, популярный в профессиональных кругах пакет цветокоррекции, визуальных эффектов и постобработки аудио для macOS, Windows и Linux.

Нетрудно разглядеть, что на обоих ноутбуках работала Windows. Разница лишь в том, что слева запустили версию DaVinci Resolve не для x86, а специально перекомпилированную под ARM. Релиз подобной версии пока лишь только намечается.

Тест касался NPU, нейроускорителя системы на кристалле Qualcomm. Представитель компании хвастает, что это самый мощный NPU на ноутбучном чипе, 45 TOPS. Для бенчмарка на ноутбуках одновременно запустили Magic Mask, нейросетевую функцию DaVinci Resolve для отслеживания объекта на видео.

За счёт нейроускорителя ноутбук на Snapdragon X Elite оказался значительно быстрее: он работал на скорости в 7 кадров в секунду против 3 у чипа Intel. При этом энергопотребление у системы на кристалле Qualcomm меньше. Точные числа названы не были; в другом видео на ARM показана категория энергопотребления «Умеренная» из «Диспетчера задач» Windows против «Очень высокой» у Intel.

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации