Можно влезть в бюджет и до 40 000 руб - 4 штуки P102-100 в общем 40Гб VRAM. Для комфортного использования 32B моделей хватает (20-50 ток сек с контекстом 100K). Если интересно могу написать как как это сделать. Использую llama.cpp, для некоторых задач адаптировал vllm под sm_61 Paskal https://github.com/ampir-nn/vllm-pascal
Четыре майнинговые карты P102-100 - 40Гб VRAM полет нормальный ))) Nemotron-3-Nano-30B-A3B-Q8_0.gguf - 41.98 tokens per second //// Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf - 34.40 tokens per second
Добрый вечер, сам хромировал - в трехлитровой банке с ангедридом :). Раз в месяц - наверное, после хромирования гильзу диаметром 15мм доводили притиркой алмазной пастой ))) Позже шлифовали на станке. Это для моторчика два с половиной кубов см - F2A
Эта модель стоит денег
Зубов бояться - в рог не давать . :)
Можно влезть в бюджет и до 40 000 руб - 4 штуки P102-100 в общем 40Гб VRAM. Для комфортного использования 32B моделей хватает (20-50 ток сек с контекстом 100K). Если интересно могу написать как как это сделать. Использую llama.cpp, для некоторых задач адаптировал vllm под sm_61 Paskal https://github.com/ampir-nn/vllm-pascal
Еще пару лет и профессия "программист" встанет рядом с профессией "кучер" .
Быстрей бы уже - тупость людей уже просто запредельная.
Еще рекомендую попробовать запуск gguf моделей на vllm - огромный прирост производительности на слабом железе https://docs.vllm.ai/en/stable/features/quantization/gguf/ .
Почему только vllm? llama.cpp гораздо шустрее будет работать на таком железе.
Какой смысл в запуске UD-IQ2_M - для чего это ???
sudo nvidia-smi -pl 150 /// то есть карты ограниченны на 150Вт каждая - при использовании llama.cpp нагрузка не более 40%
Четыре майнинговые карты P102-100 - 40Гб VRAM полет нормальный ))) Nemotron-3-Nano-30B-A3B-Q8_0.gguf - 41.98 tokens per second //// Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf - 34.40 tokens per second
Большое зарядное устройство ... :)
Добрый вечер, сам хромировал - в трехлитровой банке с ангедридом :). Раз в месяц - наверное, после хромирования гильзу диаметром 15мм доводили притиркой алмазной пастой ))) Позже шлифовали на станке. Это для моторчика два с половиной кубов см - F2A
Латунные гильзы хромировали в "дворце пионеров" - авиамоделизм был .... )))
Спасибо большое - интересно. Технология хромирования алюминия сохранилась?
Природа не отдыхает - даже на IT работниках.
Может так случиться - что все IT работники станут грузчиками, ну в лучшем случае ..... )))
Получится "парк стоячего периода" - путешествие в мир большого .....