Обновить

Модель распознала 10 документов из 10 без единой ошибки. Можно ли пускать её на тысячу таких же? Метрология отвечает: 10 из 10 доказывают меньше, чем кажется.

Есть правило трёх: если в n проверенных образцах не нашлось ни одного дефекта, верхняя граница доли дефектов с 95% уверенностью — примерно 3/n.

10 документов без ошибок — доля ошибок может быть до ~26%.

30 документов — до ~9,5%.

100 документов — до ~3%.

300 документов — около 1%.

То есть, чтобы с 95% уверенностью сказать «ошибок не больше 1%», нужно около 300 документов подряд без единой ошибки.

Но и 300 не спасут, если выборка однородная. Ошибки LLM не случайны, как брак на конвейере, — они кучкуются: таблицы, мелкий шрифт, сканы. Поэтому выборку делят на группы по этим признакам и считают отдельно для каждой. Иначе 300 чистых текстовых PDF ничего не скажут о таблицах.

Ещё две вещи, которых нет у партии товара:

• Невоспроизводимость: прогоните один и тот же документ несколько раз — ответ может отличаться.

• Дрейф: новая версия модели или промпта обнуляет приёмку, проверку нужно повторить.

И до всего этого договоритесь, что считается ошибкой: любая опечатка или неверное число в ключевом поле. От этого зависит, что вы вообще измеряете.

А на скольких документах вы проверяли модель, прежде чем пустить её в работу?

Теги:
+3
Комментарии3

Ректор МГТУ им. Баумана посоветовал не отдавать детей в IT

Ректор МГТУ им. Баумана Михаил Гордин советует не отдавать детей в IT, так как навык программирования не гарантирует долгую карьеру. Об этом он заявил в интервью «Ведомостям».

Ректор МГТУ им. Баумана посоветовал не отдавать детей в IT

Публикации