Comments 1
Практический нюанс к разделу 5.2: и штраф за длину в RLVR, и SFT под метку дают лишь статистический сдвиг средней длины, а не бюджет с гарантией. В логах это видно сразу — на low распределение длин с длинным хвостом, и на редких тяжелых задачах модель все равно уезжает за ожидаемый лимит, так что для latency-SLA внешний max_tokens никуда не деть. Причем именно обрезание по внешнему лимиту дает худший из возможных исходов: трейс есть, финального ответа нет, токены оплачены. Встречали ли вы в отчетах, что модели отдельно учат аккуратно закрывать трейс и выдавать ответ при подходе к границе бюджета, или это до сих пор целиком на совести рантайма?
Sign up to leave a comment.
Как управлять reasoning effort в LLM