Комментарии 3
У Selectel полно серверов с видеокартами какие хочешь
A100 есть на 40 и на 80Gb.
А можно было бы и 2шт RTX6000Pro взять, вот только зачем это же не Instruct модель что с ней делать то. Зачем она нужна в таком виде.
И кстати на HuggingFace есть GGUF Q4_K_M всего на 48Gb и патч для llama.cpp, так что при наличии пары видеокарт можно было и локально запустить
овчинка выделки не стоит. она даже отвечать нормально не умеет же. Для неё ещё данные размечать, SFT, RL, тесты делать - это огромная работа для BigCompanys. А квантовать её и запускать как есть, как многие пишут - вообще непонятно зачем. Не ввязывайтесь. Суверенитет и на буржуйских моделях проживет локально. Нужно создавать агента с грамотным плотным кодом вокруг легкой модели(моделей), а не передавать все на произвол судьбы в attention LLM.

Сколько стоит суверенитет