Согласен, что LLM OCR может быть менее устойчивым, готовых публичных бенчмарков такого рода я тоже не видел. Отчасти предложенный в статье подход можно доработать аугментациями картинок и пдф - по крайней мере для случаев, когда изображение портится случайно. Причём можно аугментировать не всё изображение, а случайный патч (а-ля dropout): проверяем, ломается ли модель только в этом месте или ошибка расползается дальше. А чтобы бороться с этим в проде, кажется, проще всего дублировать чтение классическим OCR и сверять с выходом OCR LLM. Сюда еще можно докинуть multimodal LLM на постобработку для повышения качества.
Добрый день!
Согласен, что LLM OCR может быть менее устойчивым, готовых публичных бенчмарков такого рода я тоже не видел. Отчасти предложенный в статье подход можно доработать аугментациями картинок и пдф - по крайней мере для случаев, когда изображение портится случайно. Причём можно аугментировать не всё изображение, а случайный патч (а-ля dropout): проверяем, ломается ли модель только в этом месте или ошибка расползается дальше. А чтобы бороться с этим в проде, кажется, проще всего дублировать чтение классическим OCR и сверять с выходом OCR LLM. Сюда еще можно докинуть multimodal LLM на постобработку для повышения качества.