надо не tensor parallel использовать, а tensor pipeline и даже на pci2 скорость генерации не упрется в шину PCI. Да, время первого токена возрастет, но не сильно критично. Если в параллель будет работать 4-8 агентов, то обе карты будут загружены на 100%
Ага, особенно понравилось пусть команда сама решает, не вмешивайся в задачи. Видел я во что превращается проект при таком подходе. Потом столько же времени рефакторить и оптимизировать....
На 4х CMP 170hx можно запустить flash с контекстом 1 млн. Где-то сейчас 500к будет за карты. 100 токенов на декод
надо не tensor parallel использовать, а tensor pipeline и даже на pci2 скорость генерации не упрется в шину PCI. Да, время первого токена возрастет, но не сильно критично. Если в параллель будет работать 4-8 агентов, то обе карты будут загружены на 100%
+1
Ага, особенно понравилось пусть команда сама решает, не вмешивайся в задачи. Видел я во что превращается проект при таком подходе. Потом столько же времени рефакторить и оптимизировать....