Pull to refresh
3
Владимир Ловцов@lovets18

User

Send message

Добрый день! 

Согласен, что LLM OCR может быть менее устойчивым, готовых публичных бенчмарков такого рода я тоже не видел. Отчасти предложенный в статье подход можно доработать аугментациями картинок и пдф - по крайней мере для случаев, когда изображение портится случайно. Причём можно аугментировать не всё изображение, а случайный патч (а-ля dropout): проверяем, ломается ли модель только в этом месте или ошибка расползается дальше. А чтобы бороться с этим в проде, кажется, проще всего дублировать чтение классическим OCR и сверять с выходом OCR LLM. Сюда еще можно докинуть multimodal LLM на постобработку для повышения качества.

Information

Rating
Does not participate
Registered
Activity

Specialization

Ученый по данным, ML разработчик