Обновить
0
Алексей@slash_spb

Инженер-программист

Отправить сообщение

На 4х CMP 170hx можно запустить flash с контекстом 1 млн. Где-то сейчас 500к будет за карты. 100 токенов на декод

надо не tensor parallel использовать, а tensor pipeline и даже на pci2 скорость генерации не упрется в шину PCI. Да, время первого токена возрастет, но не сильно критично. Если в параллель будет работать 4-8 агентов, то обе карты будут загружены на 100%

+1

Ага, особенно понравилось пусть команда сама решает, не вмешивайся в задачи. Видел я во что превращается проект при таком подходе. Потом столько же времени рефакторить и оптимизировать....

Информация

В рейтинге
Не участвует
Откуда
Россия
Зарегистрирован
Активность