Обновить

России предложили замедлить или запретить Telegram

Герман Клименко ныне Председатель Совета Фонда развития цифровой экономики, и сопредседатель Совета ТПП РФ по развитию информационных технологий и цифровой экономики, а в прошлом советник президента РФ Владимира Путина по вопросам развития интернета считает, что если заблокировать или замедлить мессенджер Telegram, то россияне быстрее перейдут на отечественную разработку под названием MAX.

"...Тут вопрос скорости перехода. Принудительно быстро или спокойно медленно. Государство должно помочь немножечко Телеграму, либо ухудшить его связь, либо может быть вообще запретить. Хотя, надеюсь, и без этого обойдется..." сказал Клименко.

Ранее, в июле 2024 года, Герман Клименко верно спрогнозировал лавинообразный "износ кэша" YouTube в России.

UPD: Как и в июле 2024 года в с случае YouTube пресс-секретарь президента РФ Песков пояснил, что никакой блокировки ресурса Telegram не планируется, то есть, в переводе с канцелярского на обычный русский, это значит что в официальный общедоступный реестр запрещенных ресурсов он как и YouTube включен не будет.

Теги:
Всего голосов 5: ↑4 и ↓1+5
Комментарии12

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации