Не совсем так. Механизм oversubscription VRAM через миграцию страниц в системную память есть и на Linux.
Начиная с Pascal (GTX 10xx и новее), у GPU появился Page Migration Engine с аппаратными page fault’ами. Если память выделена через cudaMallocManaged, драйвер разруливает нехватку VRAM: страницы мигрируют между GPU и RAM по мере обращения, без падения приложения. Собственно, это и есть штатный способ считать данные, не помещающиеся в GPU целиком (out-of-core).
Нюанс: это работает только если фреймворк использует cudaMallocManaged, а не обычный cudaMalloc. Многие инференс-движки (llama.cpp, ExLlama и т.п.) применяют второй вариант и просто падают с OOM при нехватке VRAM, независимо от ОС. Так что «тихая деградация в 15 раз» зависит скорее от того, как написан конкретный скрипт.
Весь диалог (на скриншотах в этой новости) – всего 6,5 руб. Получается намного быстрее, чем выбирать товары вручную.
По поводу MCP-сервера и чат-бота. Имеете в виду, что ассистент работает более предсказуемо через модели платные? Да – здесь выбран DeepSeek V4 Flash (но можно попробовать переключить ассистента на другие модели, хотя уже выбрана оптимальная модель), длительность диалога и количество уточнений не ограничено – вы можете в свободной форме спрашивать у чат-бота разные вещи на тему заказа товаров, примерно как и при обычном диалоге с любой нейросетью.
Супер, тоже благодарю за информацию) Как раз было очень интересно, сколько такой инференс протянется на игровой видеокарте. Получается, на одной видюхе запускать такого зверя бессмысленно.
Предлагаете специально вносить ошибки, чтобы выглядело менее сгенерированно?) Т. к. я раньше работал редактором в печатном издании, мои тексты иногда называют «сгенерированными». Думаю, на сегодня тут уже никакая подобная экспертиза не имеет значения, потому как этот вопрос очень субъективный.
Спасибо, это потрясающе)
Не совсем так. Механизм oversubscription VRAM через миграцию страниц в системную память есть и на Linux.
Начиная с Pascal (GTX 10xx и новее), у GPU появился Page Migration Engine с аппаратными page fault’ами. Если память выделена через
cudaMallocManaged, драйвер разруливает нехватку VRAM: страницы мигрируют между GPU и RAM по мере обращения, без падения приложения. Собственно, это и есть штатный способ считать данные, не помещающиеся в GPU целиком (out-of-core).(Подробности в блоге NVIDIA: Unified Memory for CUDA Beginners и разбор перформанса в Improving GPU Memory Oversubscription Performance.)
Нюанс: это работает только если фреймворк использует
cudaMallocManaged, а не обычныйcudaMalloc. Многие инференс-движки (llama.cpp, ExLlama и т.п.) применяют второй вариант и просто падают с OOM при нехватке VRAM, независимо от ОС. Так что «тихая деградация в 15 раз» зависит скорее от того, как написан конкретный скрипт.Весь диалог (на скриншотах в этой новости) – всего 6,5 руб. Получается намного быстрее, чем выбирать товары вручную.
По поводу MCP-сервера и чат-бота. Имеете в виду, что ассистент работает более предсказуемо через модели платные? Да – здесь выбран DeepSeek V4 Flash (но можно попробовать переключить ассистента на другие модели, хотя уже выбрана оптимальная модель), длительность диалога и количество уточнений не ограничено – вы можете в свободной форме спрашивать у чат-бота разные вещи на тему заказа товаров, примерно как и при обычном диалоге с любой нейросетью.
Спасибо, исправил)
Исправил, спасибо!
Спасибо! На самом деле там сначала было правильно, но при редактуре решил убрать некоторые слова предложения, получилась опечатка)
Исправил, торопился при редактировании - поэтому опечатался.
Вы угадали правильный ответ!
Я обращался к модели через наш сайт.
Супер, тоже благодарю за информацию) Как раз было очень интересно, сколько такой инференс протянется на игровой видеокарте. Получается, на одной видюхе запускать такого зверя бессмысленно.
Спасибо, очень интересно) уже изучаю)
Предлагаете специально вносить ошибки, чтобы выглядело менее сгенерированно?) Т. к. я раньше работал редактором в печатном издании, мои тексты иногда называют «сгенерированными». Думаю, на сегодня тут уже никакая подобная экспертиза не имеет значения, потому как этот вопрос очень субъективный.