Комментарии 3
Непонятно зачем это все? Если виндовс, то скорее всего потребительская железка, а значит видеокарта одна, максимум две. 3 сильно большие костыли. Vllm работает в врам, а значит ничего нормального в потребительское железо не засунуть через вллм. Чем это все городить, быстрее будет накатить нативный линукс. Под виндой рулит llama Cpp, со всякими форками типа страта.
Нужно БОЛЬШЕ сущностей, когда уже есть llamafile и strata
Статья не актуальна. Если у вас есть минимум 12vram и 48-64ram (минимальные требования для локальных ллм), то устанавливаете Strata и она автоматически поставит и запустит вам самую мощную локальную модель на сегодняшний день с хорошей скоростью и контекстом. Еслии вам не нужна самая лучшая модель, то скачиваете lm studio, выбираете модель, правильно её настраиваете через интерфейс (по кол-ву настроек она сейчас едва ли уступает голой llama), и запускаете. Всё это актуально для Виндоус11 с видеокартой nvidia или amd. А от всяких подобных консольных телодвижений с линуксами у меня лично уже изжога, так они мне надоели. До сих пор с неприязнью вспоминаю, как я с трудом поставил rocm на wsl и запустил модель на llama, только ради того, чтобы обнаружить что никакой прибавки в скорости по сравнению с lm studio на Виндоус и нет.

Запускаем LLM локально на Windows: WSL2, Docker, CUDA и vLLM