Обновить
5

Пользователь

3
Подписчики
Отправить сообщение

Спасибо, опечатку поправили!
На нагрузочных тестах проверяли, ~120 человек должно держать, при необходимости можно будет масштабировать экземляры моделей, запуская на нескольких GPU. Ну и в целом, ещё есть поле для потенциальных оптимизаций инференса :)
На самом деле, кроме экономии видеопамяти, "маленькие" языковые модели, на которые мы делаем упор, также значительно быстрее генерируют токены.
Запускались на дне открытых дверей - система справлялась

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность