Обновить

18 ноября — день кнопочного телефона. Ностальгии пост.

18 ноября 1963 года американская Bell Systems выпустила кнопочную модель с тональным набором для коммерческого использования — уж не знаю, как принято праздновать этот день, но на меня почему-то напала ностальгия о моих кнопочных девайсах :)

Их было немного. Первым стал Motorola t191 — кнопочная малявка, который у меня был с тарифом Мегафон О'Лайт — когда 1 смс стоило 1 цент. Mojno bilo vot tak celimi dnyami i nochami pisat vsem podryad, po4ti ne dumaya o balanse telefona, a vmesto poshlih emoji bili starie dobrie smailiki ;-)

Потом появился Siemens c65 — мой первый девайс с камерой (0.3Мп), фотографии с которого до сих пор есть где-то на компе и напоминают о тёплых школьных временах. Следом за ним от брата достался «неубиваемый» M65 и, чуть позже, «бизнесовый» S65, который умер, как и первые два, из-за проблема с джойстиком. На этих телефонах я уже вовсю ковырялся с Siemens Update Tool и что-то там перепрошивал.

Чуть позже я сменил религию на Nokia — сначала модный E65, а потом Е60 без камеры — то было время первой работы, на которой нельзя было иметь телефон с камерой. Времена Jimm (icq-клиент) и Web Money, когда можно было пополнить баланс прямо с телефона.

Будучи студентом, ходил в основном с «рейзером», которым можно было «хлопнуть» в конце разговора ) Ну а уже на последнем курсе универа появился HTC P3300 на WM, который я выбрал спустя месяц листания каталогов «Связного». Вот же времена были!

А как было у вас?

Теги:
Всего голосов 15: ↑15 и ↓0+38
Комментарии32

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации