Комментарии 2
Кажется, самое интересное начинается сразу после последнего абзаца :)
Кто именно суммирует usage — продукт или биллинг — вопрос скорее вторичный. Гораздо веселее становится, когда запрос выполнился, usage-event отправился дважды; либо не отправился вообще; либо клиент успел одновременно запустить десять генераций при остатке в 1000 токенов.
Тут уже появляются idempotency по event_id, reservation/pre-authorize лимита, eventual consistency и reconciliation между продуктом и биллингом. И вот граница ответственности между ними становится действительно архитектурной задачей.
А так как вводная схема — вполне понятная.
Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Кто должен считать потребление в AI-сервисе: продукт или биллинг