Обновить
3
Владимир Ловцов@lovets18

Пользователь

Отправить сообщение

Добрый день! 

Согласен, что LLM OCR может быть менее устойчивым, готовых публичных бенчмарков такого рода я тоже не видел. Отчасти предложенный в статье подход можно доработать аугментациями картинок и пдф - по крайней мере для случаев, когда изображение портится случайно. Причём можно аугментировать не всё изображение, а случайный патч (а-ля dropout): проверяем, ломается ли модель только в этом месте или ошибка расползается дальше. А чтобы бороться с этим в проде, кажется, проще всего дублировать чтение классическим OCR и сверять с выходом OCR LLM. Сюда еще можно докинуть multimodal LLM на постобработку для повышения качества.

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность

Специализация

Ученый по данным, ML разработчик