Обновить
4K+
2
Ефимов Владимир@vlaefi

Занимаюсь разработкой бэкенда и ML-решений

7
Рейтинг
Отправить сообщение

Использование VLM и OCR для распознавания текста на изображениях

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели7K

Привет, Хабр! Одним из моих направлений работ является создание базы знаний по обучающим курсам, которые включают текст и видеоматериалы. И некоторое время назад у меня возник вопрос: какое решение для меня будет оптимальным для распознавания текста на кадрах. В частности, что лучше мне подойдет — VLM или связка OCR + LLM, облачное решение или локальная установка.

Более того, я углубился в тематику OCR: посмотрел ряд типичных задач для OCR и материал на Хабр, провел ряд экспериментов. Надеюсь, данная обзорная статья и мои примеры на GitHub помогут вам быстрее попробовать различные варианты и подобрать оптимальный для своих задач.

Читать далее

Информация

В рейтинге
1 071-й
Зарегистрирован
Активность

Специализация

Бэкенд разработчик
Средний
От 200 000 ₽
Git
Python
ООП
Базы данных
Linux
Java