Спасибо, опечатку поправили! На нагрузочных тестах проверяли, ~120 человек должно держать, при необходимости можно будет масштабировать экземляры моделей, запуская на нескольких GPU. Ну и в целом, ещё есть поле для потенциальных оптимизаций инференса :) На самом деле, кроме экономии видеопамяти, "маленькие" языковые модели, на которые мы делаем упор, также значительно быстрее генерируют токены. Запускались на дне открытых дверей - система справлялась
Спасибо, опечатку поправили!
На нагрузочных тестах проверяли, ~120 человек должно держать, при необходимости можно будет масштабировать экземляры моделей, запуская на нескольких GPU. Ну и в целом, ещё есть поле для потенциальных оптимизаций инференса :)
На самом деле, кроме экономии видеопамяти, "маленькие" языковые модели, на которые мы делаем упор, также значительно быстрее генерируют токены.
Запускались на дне открытых дверей - система справлялась