Pull to refresh
4K+
5
Anna Reshetnyak@AnnaResh

AI/ML researcher engineer

9
Rating
2
Subscribers
Send message

Ускорение инференса энкодерной guard‑модели: TensorRT, Triton, vLLM, Ray Serve

Level of difficultyMedium
Reading time23 min
Reach and readers6.4K

Когда в системе есть узел между LLM и пользователем его скорость также важна, как и скорость самой LLM. Когда этот узел сам является моделью (и иногда даже — тоже LLM) — задача ускорения становится совсем веселой и её нужно уметь решать разными способами. В этой работе я опишу процесс ускорения guardrail‑модели — узла, которые проверяет — нет ли на входе или выходе опасного контента.

Guard стоит на входе/выходе LLM‑приложения. В статье речь про небольшую модель — чуть больше 0.5 Gb. Но она вызывается дважды за один ход диалога, и сначала пользователь ждет, пока guard проверит его запрос перед отправкой в LLM, затем — пока он проверит сгенерированный ответ перед выдачей пользователю.

Моей задачей было ускорить такую небольшую guard‑модель (Locustfile, базовые benchmark‑конфиги и инструкции по воспроизведению экспериментов в репо). Я потестила пять инструментов: TensorRT, NVIDIA Triton, vLLM, Ray Serve и отдельно — переход бэкбона на Flash DeBERTa.

Про допущенные ошибки, результаты и выводы — о том, как бы я построила подобную работу сейчас — ниже. Надеюсь, это сбережет вам время.

Читать далее

Information

Rating
832-nd
Registered
Activity

Specialization

Инженер по безопасности, ML разработчик
Python
Docker
FastAPI
PostgreSQL
CI/CD
Высоконагруженные системы
Проектирование архитектуры приложений
Английский язык