У меня тоже 3090 , но такого TPS я не достиг, подскажите какой движок используете (llama.cpp, vlm , ...) если можно ссылку на hf модели (gguf же?) , там и квант будет понятен и чей форк (unsloth?) или lmstudio-community ? И главное параметры запуска(загрузки) какие?
У меня тоже 3090 , но такого TPS я не достиг, подскажите какой движок используете (llama.cpp, vlm , ...) если можно ссылку на hf модели (gguf же?) , там и квант будет понятен и чей форк (unsloth?) или lmstudio-community ? И главное параметры запуска(загрузки) какие?
2 рубля за сколько токенов in/out?
А можно раскрыть - какой вывод из представленных результатов?
По мне так все варианты рабочие.