Обновить

Комментарии 3

Я думал, что кредитные организации заведомо строят свою бизнес-модель на том, что часть кредитов не будет возращена (ну да, что-то может быть получится вернуть через коллекторов или суды, но это долго и не гарантированно). За этим им и нужны проценты (причём часто процентная ставка индивидуальна для каждого клиента) - чтобы с переплаты одних погасить задолженности других.

И задача должна быть сформулирована не "вернёт ли долг", а "с какой вероятностью вернёт долг"? А дальше от этого плясать уже подбирая индивидуальную процентную ставку (ну и отказывая тем, у кого шанс возврата ниже порога).

Вообще это плохая идея работать дискретно с вероятностными исходами (даже сам человек не может знать на 100% вернёт ли долг - могут возникнуть какие-то форс-мажорные обстоятельства, далеко не все из которых являются страховым случаем - природа явления реального мира, который анализирует модель - не предполагает возможности предсказания без ложноотрицательных и ложноположительных срабатываний). При валидации проверять "если модель оценила шанс возврата в 80%, то среди всех людей кому модель дала такую оценку, должно быть примерно 80% тех кто вернул долг и 20% тех кто не вернул".

Вы все правильно говорите, но дело в том, что проверить вероятность гораздо сложнее. Допустим, модель выдала вероятность 80%. Это значит надо собрать из всей выборки всех тех кому модель так же предсказала 80% и посмотреть вернули ли они долг. Считать будет дольше, чем при обычной бинарной кроссэнтропии, но идея интересная. Надо будет как-нибудь провести такой эксперимент.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации