Команда,
Запуск MobileMe не стал нашим звездным часом. Есть некоторые вещи, которые мы могли бы сделать лучше:
— MobileMe не соответствует стандартам Apple — на это явно требуется больше времени и испытаний.
— Вместо того чтобы запускать MobileMe в качестве монолитного сервиса, мы могли бы начать с запуска синхронизации с iPhone, а затем запустить веб-приложения по одному — во-первых Mail, спустя 30 дней(если всё в порядке с почтой) Calendar, а затем 30 дней спустя Contacts.
— Запуск MobileMe в одно время с выходом iPhone 3G, iPhone 2,0 прошивки и App Store был ошибкой. Этого более чем достаточно для того чтобы запуск MobileMe мог быть отложен без последствий.
Мы принимаем ряд мер чтобы извлечь из этого опыта уроки, для улучшения MobileMe сервисов, которые полюбят наши клиенты. Один из шагов, которыми я могу поделиться с вами заключается в том, что команда MobileMe будет подотчетна Eddy Cue, который возглавляет все наши интернет-сервисы — iTunes, App Store и, с сегодняшнего дня, MobileMe. В новой должности Eddy станет вице-президентом по интернет-сервисам и будет подчиняться непосредственно мне.
Запуск MobileMe явно свидетельствует о том, что нам нужно больше узнать о интернет сервисах. Будущее MobileMe является одновременно захватывающим и амбициозным, и мы будем стараться, чтобы сделать этот сервис, которым мы все будем гордиться, к концу текущего года.
Стив
Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с
Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.
ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.
Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.
В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.
Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.
При этом сама видеокарта была загружена далеко не полностью.
Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

