Привет! Спасибо за вопрос,target_rps задаётся отдельно в конфигурации каждой job. Общей квоты по llm_conn_id сейчас нет. В описанных сценариях пока используем именно такой per-job подход, а запуски разводим по расписанию. Для нескольких одновременных потребителей одной точки входа внешний token bucket действительно надёжный подход. По partition уточню: одиночный 429 не переисполняет всю партицию - сначала повторяется конкретный запрос. Партиция падает, только если попытки исчерпаны и число неуспешных батчей превысило n_errors. При продолжительной серии 429 Spark действительно может переисполнить задачу и повторить уже выполненные запросы.
Привет! Спасибо за вопрос,
target_rpsзадаётся отдельно в конфигурации каждой job. Общей квоты поllm_conn_idсейчас нет. В описанных сценариях пока используем именно такой per-job подход, а запуски разводим по расписанию. Для нескольких одновременных потребителей одной точки входа внешний token bucket действительно надёжный подход. Поpartitionуточню: одиночный 429 не переисполняет всю партицию - сначала повторяется конкретный запрос. Партиция падает, только если попытки исчерпаны и число неуспешных батчей превысилоn_errors. При продолжительной серии 429 Spark действительно может переисполнить задачу и повторить уже выполненные запросы.