Pull to refresh

Comments 1

Практический нюанс к разделу 5.2: и штраф за длину в RLVR, и SFT под метку дают лишь статистический сдвиг средней длины, а не бюджет с гарантией. В логах это видно сразу — на low распределение длин с длинным хвостом, и на редких тяжелых задачах модель все равно уезжает за ожидаемый лимит, так что для latency-SLA внешний max_tokens никуда не деть. Причем именно обрезание по внешнему лимиту дает худший из возможных исходов: трейс есть, финального ответа нет, токены оплачены. Встречали ли вы в отчетах, что модели отдельно учат аккуратно закрывать трейс и выдавать ответ при подходе к границе бюджета, или это до сих пор целиком на совести рантайма?

Sign up to leave a comment.

Articles