Обновить

Как вы знаете, мобильный интернет стал нестабильным последнее время, поэтому в поезде у меня появилась возможность посмотреть, что же я там скачивал почитать, когда появится время. И наткнулся на книгу: «Founders at Work [Stories of Startups' Early Days]» — 2008 года. Фактически эта книга рассказывает про яркие, выстрелившие стартапы в долине с 1980 по 2006 год примерно.

И знаете, хотя большинство из этих стартапов либо были куплены и растворены в других компаниях, либо обанкротились спустя некоторое время после выхода книги, сами истории мне понравились, в силу того, что можно сравнить то, о чём думали люди, и что по факту случилось спустя 20–25 лет.

Книга делает упор на то, что успешный проект могут запустить разные люди, с разным бэкграундом, с разным пониманием IT-бизнеса и принципов развития компаний. Выглядит как агитка венчурных фондов, но люди-то реальные и компании эти реальные.

Также подчёркиваются преимущества долины, где одни и те же люди по цепочке выстраивают свои компетенции и получают деньги на развитие своих идей фактически от одних и тех же инвестиционных фондов. Что ярко кричит — приезжай в долину, именно тут делаются успешные стартапы.

Конечно, книга очень сильно устарела, и многие вещи, о которых рассказывали основатели бизнеса как об инсайте, уже считаются базовым навыком, который расписывается в любой айтишной книге начального уровня. И также меня посмешила глава про BlackBerry как о лидере корпоративного мобильного мира. Книжка пошла в печать спустя пару месяцев после выхода первого iPhone, и никто не думал, что BlackBerry так быстро потеряет свои позиции в мобильном мире.

Практической пользы на текущий момент от книги нет, но книга развлекает как документалистика о событиях бума доткомов.

Теги:
Рейтинг0
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации