Обновить

Подтвердились худшие опасения про тотальное доминирование фейковых SD-карт на AliExpress. Нормальную недорогую карту емкостью от 128 ГБ купить там, скорее всего, не получится.

После предыдущей истории, где 9 из 10 карт microSD оказались фейковыми, я следом заказал пару карт из числа самых популярных с количеством заказов более 10 тыс. Microdrive и ShanDian. С ними все повторилось – истинная емкость оказалась 64 ГБ вместо заявленных 128 ГБ.

Резюме: покупать карты китайских брендов на AliExpress начиная от 128 ГБ сейчас нельзя. Вероятность фейка практически стопроцентная. Исключениями могут стать только дорогие карты SanDisk, Kingston, Kodak и Samsung, но их тоже надо проверять.

Что касается карт меньшей емкости, то последние 2-3 года подделки встречаются крайне редко, что подтверждается моим старым тестом. Однако они есть, например под брендом QWQ.

Главная причина - 64-гиговые карты стоят копейки. Что-то с них выгадать невозможно. Кроме того, на рынке много лет преобладают недорогие кристаллы по 512 Гбит, из которых и делают 64-гиговые карты. Попадаются и 256 Гбит, но, по ощущениям, цены на них аналогичны 512-м. А вот на 128-гиговую карту надо уже два кристалла по 512 Гбит или один терабитный, и вот тут появляется соблазн «сэкономить».

Но, как бы там ни было, удивляет во всей этой истории то, что нормальных недорогих карт китайских брендов емкостью 128 ГБ и более в продаже найти не удалось.

Теги:
Всего голосов 13: ↑13 и ↓0+13
Комментарии3

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации