Pull to refresh
0
Алексей@slash_spb

Инженер-программист

Send message

На 4х CMP 170hx можно запустить flash с контекстом 1 млн. Где-то сейчас 500к будет за карты. 100 токенов на декод

надо не tensor parallel использовать, а tensor pipeline и даже на pci2 скорость генерации не упрется в шину PCI. Да, время первого токена возрастет, но не сильно критично. Если в параллель будет работать 4-8 агентов, то обе карты будут загружены на 100%

+1

Ага, особенно понравилось пусть команда сама решает, не вмешивайся в задачи. Видел я во что превращается проект при таком подходе. Потом столько же времени рефакторить и оптимизировать....

Information

Rating
Does not participate
Location
Россия
Registered
Activity