Обновить
1

Пользователь

Отправить сообщение

Зубов бояться - в рог не давать . :)

Можно влезть в бюджет и до 40 000 руб - 4 штуки P102-100 в общем 40Гб VRAM. Для комфортного использования 32B моделей хватает (20-50 ток сек с контекстом 100K). Если интересно могу написать как как это сделать. Использую llama.cpp, для некоторых задач адаптировал vllm под sm_61 Paskal https://github.com/ampir-nn/vllm-pascal

Еще пару лет и профессия "программист" встанет рядом с профессией "кучер" .

Быстрей бы уже - тупость людей уже просто запредельная.

Еще рекомендую попробовать запуск gguf моделей на vllm - огромный прирост производительности на слабом железе https://docs.vllm.ai/en/stable/features/quantization/gguf/ .

Почему только vllm? llama.cpp гораздо шустрее будет работать на таком железе.

Какой смысл в запуске UD-IQ2_M - для чего это ???

sudo nvidia-smi -pl 150 /// то есть карты ограниченны на 150Вт каждая - при использовании llama.cpp нагрузка не более 40%

Четыре майнинговые карты P102-100 - 40Гб VRAM полет нормальный ))) Nemotron-3-Nano-30B-A3B-Q8_0.gguf - 41.98 tokens per second //// Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf - 34.40 tokens per second

Большое зарядное устройство ... :)

Добрый вечер, сам хромировал - в трехлитровой банке с ангедридом :). Раз в месяц - наверное, после хромирования гильзу диаметром 15мм доводили притиркой алмазной пастой ))) Позже шлифовали на станке. Это для моторчика два с половиной кубов см - F2A

Латунные гильзы хромировали в "дворце пионеров" - авиамоделизм был .... )))

Спасибо большое - интересно. Технология хромирования алюминия сохранилась?

Природа не отдыхает - даже на IT работниках.

Может так случиться - что все IT работники станут грузчиками, ну в лучшем случае ..... )))

Получится "парк стоячего периода" - путешествие в мир большого .....

Информация

В рейтинге
4 507-й
Зарегистрирован
Активность