
Комментарии 5

Веса можно ужать. В FP8 та же 70B займёт около 70 ГБ, но качество после квантования придётся проверять на своих задачах
Все будет отлично с качеством, разница в пару процентов. Вот занимаемый размер сократится существенно. А если еще квантануть V в FP8 внутри KV-кеша, то название статьи совсем потеряет всякий смысл.
Я понимаю, что статья рекламная и рассчитана на неразбирающихся в теме клиентов, но подскажите, кто в здравом уме будет размещать модели на хостинге, где даже на самых дорогих тарифах хост стабильно падает в ребут раз в две недели? Я даже молчу о такой забавной вещи как персональные данные (которые будут кидать в модель) и требования РКН к хостингам по ним.
Да, квантование весов модели в FP8 может примерно вдвое сократить занимаемый ими объём памяти, а FP8 KV-cache также способен заметно уменьшить расход памяти. Но утверждать, что потеря качества всегда составляет «пару процентов», слишком обобщённо. В документации vLLM отдельно рекомендуется калибровка FP8 KV-cache для максимальной точности, а также отмечается, что некорректные коэффициенты масштабирования могут влиять на accuracy.
https://docs.vllm.ai/en/latest/features/quantization/quantized_kvcache/
При этом в статье нигде не утверждается, что KV-cache нельзя оптимизировать. Основная мысль в другом: реальный LLM-сервис нельзя рассчитать простой формулой «размер модели / объём VRAM». Даже после FP8 остаются веса модели, KV-cache, служебные буферы, параллельные запросы, особенности prefill/decode, пропускная способность памяти и обмен между GPU. Именно поэтому эти компоненты в статье рассматриваются отдельно.
NVIDIA Dynamo, например, поддерживает выгрузку KV-cache из памяти GPU в оперативную память и хранилище. Это как раз хороший пример того, что даже с оптимизациями ёмкость KV-cache остаётся отдельной инфраструктурной задачей.
https://docs.nvidia.com/dynamo/dev/cli/kv-cache-offloading/overview
то касается утверждения о том, что сервер AÉZA «стабильно падает в ребут раз в две недели»: нам неизвестно о какой-либо системной проблеме такого характера, инфраструктура работает в штатном режиме. Если вы действительно сталкиваетесь с регулярными перезагрузками, пожалуйста, предоставьте номер тикета, ID сервера и, если есть, логи или другие подтверждения. Мы подробно проверим ситуацию, и если проблема действительно окажется на нашей стороне, предоставим компенсацию в соответствии с нашей обычной практикой поддержки.
Но утверждать, что потеря качества всегда составляет «пару процентов», слишком обобщённо.
В работе Give Me BF16 or Give Me Death? в прошлом году авторы оценили FP8, INT8 и INT4 относительно BF16 на академических бенчмарках и реальных задачах для моделей размером от 8B до 405B, выполнив более 500 000 оценок.
Работа показала, что FP8 практически не дает потерь на всех масштабах моделей.
FP8 по сравнению с BF16 сохраняет 99,75% точности. Самый худший случай показал 98,44% (BBH, модель 70B), т. е. потеря около 1,5%. Это не очень обобщенно, а полностью реально.
Основная мысль в другом: реальный LLM-сервис нельзя рассчитать простой формулой «размер модели / объём VRAM».
Основная мысль статьи, которую я прочитал: LLM не работает на одной карте.
Читателя подводят к мысли, что нужно запускать 70B модель на более чем на одной дорогущей 80GB карте (те минимум удвоить расходы) ради +1.5% точности.
О том что на самом деле модели запускают не более чем в FP8 и столько карт просто не нужно статья умалчивает, лишь вскользь упоминая о FP8.
Что касается утверждения о том, что сервер AÉZA «стабильно падает в ребут раз в две недели»: нам неизвестно о какой-либо системной проблеме такого характера, инфраструктура работает в штатном режиме.
Поэтому я от вас и ушел, описал личный опыт, сервера были THR-4, MSK-4, IC14 и IC9-2. Стабильно работал только самый слабый из них IC9-2.
Если вы действительно сталкиваетесь с регулярными перезагрузками, пожалуйста, предоставьте номер тикета, ID сервера и, если есть, логи или другие подтверждения.
Хороша ложка к обеду. Ушла история, но осадочек остался.
@ToxaBes Спасибо, что нашли время так подробно изложить свою позицию по статье. Мы обязательно учтём эти замечания в дальнейшей работе, чтобы повысить качество и точность наших технических материалов, а также сделать тему более понятной для читателей и лучше раскрывать её практические аспекты.
Что касается вашего опыта использования нашего сервиса, нам жаль, что он оставил у вас негативное впечатление. Мы постоянно работаем над повышением стабильности инфраструктуры, качества серверов и сервиса в целом.
Ещё раз приносим извинения за то, что ваш опыт не оправдал ожиданий, и благодарим вас за обратную связь. Желаем вам всего наилучшего и успехов в дальнейшем.
Теория футбола она такая да. Выбегаешь на поле - и вдруг оказывается что ноги не лишние
Все эти метрики и бенчи по ии нейрослопище забугорное. Чтобы показать что одна можель лучше другой на столько то процентов.
Как в той рекламе стирального порошка, который удаляет на 10% пятен лучше и чище. Но кито в рекламе не говорит лучше чем что.
Потом запукаешь бф16 модель. Проседает пропускная способность. Токены летят просто медленнее но зато точнее самих себя. На всё контекстное окно плывёт любой трансформер с похеру каким квантованием. И всё это "работает" так что никто не может понять как. А когдатагент делает хрень, ну его просто просят переделать, пока не получится. Пока матрицы смыслов не перемножаться как хочется, а не как "понято" ии.
Вчера на процессоре 16 ядер цпу и 16гб рама запустил квен на 8млрд параметров - свет включает дома.
В Продах крутим по 26-27 млрд на гпу. Черта с рогами лепят.
Куда там 70 лярдов надо и для чего? А наверное чтобы за один запрос к ллм она сразу поняла что это запрос и его надо обработать.
LLM работает не на одной видеокарте: анатомия AI‑инфраструктуры 2026