Обновить

В лингвистике имеется слабо изученный закон Ципфа, применяемый для изучения распределений числовых значений различной природы. При этом отсутствует внятное теоретическое объяснение природы этого закона. Попытаемся придумать объяснение.

Рассмотрим следующую модель. Допустим, есть множество вершин, линейно упорядоченных и образующих граф, в котором из каждой вершины идут рёбра во все последующие вершины. В случайно выбранную вершину поступает новая информация. Вершина передает эту информацию в случайно выбранную вершину, в которую из нее идёт ребро, и так по цепочке. Если мы посчитаем для каждой вершины вероятность прохождения пути через неё, получим распределение частоты получения информации между вершинами. Будет ли подчиняться это распределение закону типа Ципфа?

Если взять выборку цепочек передачи информации, то они выделят подграф исходного графа, в котором частоты получения информации вершинами будут соответствовать степеням вершин. Известно, что распределение узлов интернета по степеням подчиняется закону Парето, который аналогичен закону Ципфа.

В качестве обобщения можно рассмотреть в качестве исходного графа произвольное частично упорядоченное множество. Еще одно обобщение – переменная густота этого графа, которая может привести к изменению степенного параметра распределения для разных групп вершин.

Вообще применимость закона Ципфа для конкретной предметной области зависит от простоты выдвигаемой модели. Если моделируемый объект ведет себя примерно так, то модель применима

Теги:
Рейтинг0
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации