Pull to refresh
32K+
85

Пользователь

52,5
Rating
182
Subscribers
Send message

Периферийное распознавание — будущее работы с документами: дайджест недели Smart Document Engine

Reading time10 min
Reach and readers6.2K

В бизнесе важна каждая минута. Но если документ сначала нужно передать на обработку, проверить его и только потом внести данные в учетную систему, между реальной операцией и ее отражением в системе возникает разрыв. Все это время собственник не видит актуальной картины и вынужден принимать решения на основе уже устаревшей информации. Поэтому распознавать документы нужно непосредственно там и тогда, где происходит операция.

Эту задачу решает периферийное распознавание, реализованное в Smart Document Engine. Платформа позволяет обрабатывать документы прямо в точке их появления — например, на складе или рабочем месте сотрудника — с помощью смартфона, планшета или другого устройства и сразу передавать готовые данные в корпоративные системы. В результате бизнес получает актуальную картину происходящего, а разрыв между реальной операцией и ее отражением в учете сокращается до минимума.

Собрали главное за Неделю Smart Document Engine в одном дайджесте 👇

Читать далее

Томограф в чемодане: одна съемка от начала до конца (часть 2)

Level of difficultyEasy
Reading time6 min
Reach and readers9.2K

В первой части мы, исследователи Smart Engines, представили наш портативный томограф и рассказали про его устройство. Судя по вопросам после докладов, самой убедительной части в той истории как раз и не хватало: а как это выглядит вживую? Поэтому сегодня никаких аксиальных коллинеаций. Мы включили запись на телефоне и сняли одно исследование целиком, от первого кадра до 3D‑картинки.

Читать далее

Smart Engines представляет: портативный компьютерный томограф в чемодане (Часть 1)

Level of difficultyMedium
Reading time14 min
Reach and readers6.8K

Сегодня мы бы хотели представить сообществу Хабра футуристичную технологию, в которую за последние годы вложили все силы и душу. Речь пойдет о портативной томографии.

Рассказываем, как мы в Smart Engines  создали первый в мире носимый томограф свободного позиционирования. Устройство весит менее 5 кг, помещается в чемодан, его можно фактически держать в руках и при этом получать полноценную 3D‑реконструкцию исследуемого объекта — без привычного для КТ массивного кольца и сложной стационарной механики. Благодаря этому нам удалось реализовать принцип «не пациент идет к томографу, а томограф — к пациенту».

Читать далее

Ключ к безопасной идентификации: дайджест недели сканеров с технологиями Smart Engines

Reading time9 min
Reach and readers8.8K

При работе с документами бизнесу необходимо решение, которое, с одной стороны, эффективно выявляет попытки мошенничества с использованием поддельных документов, а с другой — не замедляет обслуживание добросовестных клиентов. Сегодня наши технологии позволяют решать обе задачи одновременно.

Совместно с ГК «Интек» Smart Engines разработала линейку российских программно-аппаратных комплексов для автоматического ввода данных и проверки подлинности документов.

За Неделю сканеров мы рассказали и показывали, как сканеры Smart Engines помогают выявлять подделки, встраиваются в полностью автоматизированные процессы и применяются в банках, аэропортах, государственных учреждениях, системах контроля доступа и роботизированных комплексах. 

Собрали главное за Неделю сканеров в одном дайджесте👇

Читать далее

Следующими можете быть вы: почему злоумышленники так любят облачные KYC‑сервисы

Level of difficultyEasy
Reading time7 min
Reach and readers8.4K

Привет, Хабр! В начале сентября 2026 года на киберпреступном форуме появился сервис Nexus, предлагавший доступ к огромному массиву удостоверений личности граждан США и Канады. По утверждению его операторов, в базе находились сведения более чем о 170 млн человек: 153 млн водительских удостоверений, 10 млн ID-карт, 3 млн паспортов и 579 тыс. медицинских карт. В открытом доступе данные оказались из-за утечки компании IDScan.net, предоставляющей решения для проверки документов и личности. 

По данным IDScan.net, неавторизованная третья сторона могла получить доступ к информации, хранившейся в облачных аккаунтах, и скопировать ее. По состоянию на середину сентября расследование продолжается. Однако сам факт возможного копирования клиентских данных из облачной среды компания признала.

Эта статья не является разбором ошибок IDScan и тем более попыткой обвинить пострадавшую компанию. IDScan стала жертвой преступников, как до нее становились жертвами банки, государственные учреждения, медицинские организации и технологические корпорации. Но сейчас важно задать вопрос: почему у внешнего участника KYC-процесса вообще оказался массив документов, который можно было похитить?

Читать далее

МФО выдали заем мошеннику: кто должен отвечать за последствия

Level of difficultyEasy
Reading time6 min
Reach and readers8.4K

Недавно россиянка стала жертвой мошенничества: на ее имя оформили около 60 микрозаймов на сумму более 2,5 млн рублей. Для этого злоумышленникам оказалось достаточно фотографии ее паспорта. Девушка больше года сталкивается со звонками и угрозами коллекторов, а более двадцати МФО продолжают пытаться взыскать с нее деньги. 

Инцидент чрезвычайно показателен: он еще раз напоминает, насколько серьезной остается угроза мошенничества и как дорого она может обойтись обычному человеку. Масштаб риска растет вместе с числом утечек: по отраслевым данным, за 2025 год и первую половину 2026 года в открытый доступ попали 326 баз данных клиентов российских компаний, содержащих около 1,175 млрд строк с информацией о пользователях. Это вдвое больше совокупного числа публичных утечек в Латинской Америке, на Ближнем Востоке, в Африке, Азиатско-Тихоокеанском регионе и других странах СНГ. В таких условиях исходить из того, что паспортные и другие персональные данные остаются известны только их владельцу, уже нельзя: оказавшись в открытом доступе, они с высокой вероятностью могут стать инструментом мошенников. Поэтому вопрос зачастую заключается в том, насколько быстро злоумышленники попытаются оформить с их помощью кредит или заем.

В этом контексте следует задать другой, не менее важный вопрос: кто должен нести ответственность за последствия такого мошенничества?  Разберемся,  какую роль в предотвращении подобных схем играют банки и МФО и почему надежная проверка личности заемщика должна быть обязательной частью процесса выдачи кредита.

Читать далее

On‑device OCR для первички: как распознавать документы без отправки в облако

Level of difficultyEasy
Reading time7 min
Reach and readers5.7K

Представим обычную ситуацию: экспедитор принимает товар на складе, подписывает накладную и фотографирует документ корпоративным смартфоном. Через несколько секунд реквизиты должны оказаться в учетной системе — без ручного ввода данных, офисного сканера и ожидания, пока бумага доедет до бухгалтерии.

Но есть условие: фотография не должна отправляться ни OCR‑провайдеру, ни стороннему центру обработки, ни оператору ручной верификации. В идеальном сценарии изображение вообще не покидает мобильное устройство — в корпоративную систему поступают уже извлеченные и проверенные данные.

Возможно ли распознать на смартфоне многостраничный УПД со сложной таблицей, исправить перспективу, прочитать мелкий шрифт и рукописные пометки — и сделать все это без подключения к внешней инфраструктуре? Короткий ответ: да. Однако для безопасной системы распознавания первички недостаточно написать в презентации «работает локально». Нужно правильно выстроить весь маршрут документа — от камеры смартфона до 1С или ERP.

Читать далее

Вверх ногами: как научить OCR понимать, что документ перевернут

Level of difficultyMedium
Reading time6 min
Reach and readers9.6K

Всем привет! 

В своих постах мы часто пишем о разных этапах систем распознавания документов (например, тут и тут). Настало время рассказать о еще одной задаче (и нашем решении для нее), которая часто опускается из подробного рассмотрения.

Наверняка каждый из вас хоть раз клал лист в сканер перевернутым (ну или вы очень везучи). Человек в случае такой оказии может повернуть изображение в редакторе или немного повертеть головой, а что делать системе распознавания? 

Просто взять и проигнорировать перевернутые изображения нельзя, ведь при обработке больших объемов данных, например, цифровизации архивов, таких изображений может быть множество. При этом попытки запустить OCR-модели на перевернутых строках обычно заканчиваются плачевно – мы получаем случайные последовательности символов.

Давайте разбираться по порядку!

Читать далее

Как поймать поддельный документ по голограмме – даже без ультрафиолета

Level of difficultyMedium
Reading time5 min
Reach and readers8.6K

Как при автоматической проверке документов отличить оригинал от цветной ксерокопии или даже муляжа? Один из надежных признаков подлинности – наличие оптически-переменных защитных элементов (OVD, Optical Variable Device), например голограмм. Их внешний вид меняется при изменении угла обзора и положения источника света.

В Smart Engines мы разработали и запатентовали метод обнаружения OVD, который позволяет выявлять копии и муляжи с помощью сканера под управлением ИИ. Для проверки достаточно видимого диапазона и серии изображений документа, полученных при разных положениях подсветки. О том, как нам удалось реализовать такой подход и научить сканер обнаруживать муляжи по OVD, читайте под катом.

Читать далее

2000 идентификаций в секунду: как выбрать нужную таблицу на документе без нейросетей

Reading time8 min
Reach and readers9.2K

Система распознавания документов может найти на одном изображении сразу несколько областей, похожих на таблицы. Среди них может быть нужная нам таблица, другая таблица, блок реквизитов, рамка или просто удачно выровненный текст. И прежде чем запускать распознавание ячеек, нужно понять, какой именно из найденных регионов содержит целевую таблицу.

В Smart Engines мы решили эту задачу необычным способом: превратили каждый табличный регион в строку, которая одновременно описывает его геометрию и текстовое содержимое, а затем стали идентифицировать нужную таблицу с помощью регулярных выражений. Получился быстрый детерминированный алгоритм, способный выполнять около 2000 идентификаций таблиц в секунду даже на обычном мобильном процессоре.

Сегодня в статье мы расскажем, как устроено строковое представление таблицы, почему оно позволяет отказаться от набора хрупких эвристик и как более точная идентификация нужной таблицы влияет на итоговое качество распознавания документа.

Читать далее

ЕСИА — не индульгенция: кто отвечает за ошибку идентификации и когда KYC можно строить без Госуслуг

Level of difficultyEasy
Reading time9 min
Reach and readers7.9K

Привет, Хабр! Представим: финансовая организация получает из ЕСИА подтвержденные сведения о клиенте, завершает дистанционную идентификацию и принимает его на обслуживание. Позднее выясняется, что операцию совершал мошенник. Паспорт оказался утраченным, изображение документа – отредактированным, а доступ к учетной записи – скомпрометированным.

Кто отвечает? Оператор ЕСИА, потому что сведения пришли из государственной системы? Организация, которая приняла решение обслужить клиента? Или тот, кто когда-то разместил в системе недостоверные данные?

Интуитивный ответ – «если государственная система сказала, что все в порядке, какие могут быть вопросы к бизнесу». Юридический ответ устроен сложнее: подключение к ЕСИА распределяет функции между участниками процесса, но не переносит всю ответственность на оператора системы. Разберемся, где проходит эта граница и как построить технологический контур идентификации, который не сводится к одному зеленому чекбоксу.

Эту статью мы подготовили совместно с Национальным советом финансового рынка (НСФР). В основу юридической части легло заключение НСФР о правовых условиях использования решений Smart Engines для получения и проверки сведений, необходимых финансовым организациям при идентификации клиентов.

Дисклеймер: в тексте учитывается законодательство по состоянию на август 2026 года. Материал носит информационный характер и не заменяет правовой анализ конкретного бизнес-процесса.

Читать далее

Почему слабым местом кредитного конвейера может оказаться не только ставка, но и плохой OCR

Level of difficultyEasy
Reading time6 min
Reach and readers7.9K

Привет, Хабр! Кредиты и все, что с ними связано – тема для многих весьма чувствительная. Мы в Smart Engines выступаем за то, чтобы сделать самые раздражающие процессы удобными и быстрыми. И в этом смысле распознавание документов – это редкий пример технологии, где интересы банка (сократить издержки), сотрудника (меньше рутины) и клиента (не ждать решение неделями) действительно совпадают. Под катом рассказываем, как автоматическое распознавание документов может трансформировать процесс кредитования в банках и как такие технологии становятся ключевым звеном кредитного конвейера.

Читать далее

Типизация документов без OCR и нейросетей: 99.79% точности за 3 мс

Level of difficultyMedium
Reading time5 min
Reach and readers15K

Когда пользователь загружает документ в систему, сначала нужно понять, что именно он прислал. Паспорт? Договор? Полис? Заявление? От этого зависит весь дальнейший сценарий обработки: какие поля искать, какие проверки выполнять и какой OCR использовать. Ошибка на этом этапе делает бессмысленной всю дальнейшую обработку. Мы покажем, что тип документа можно определить, вообще не читая его содержимое. Для этого не нужны OCR, нейронные сети или анализ текста – достаточно использовать геометрию документа.

Читать далее

Почему паспорту на экране больше нельзя верить: как ИИ-фрод ломает KYC и что с этим делать

Level of difficultyEasy
Reading time10 min
Reach and readers11K

Привет, Хабр!

Развитие искусственного интеллекта заметно изменило экономику финансового мошенничества – в том числе атак на системы KYC. По оценке INTERPOL за 2026 год, схемы с использованием ИИ могут приносить в 4,5 раза больше средств, чем схемы без него. Генеративные инструменты позволяют охватывать больше потенциальных жертв, ускорять подготовку и снижать затраты на каждую новую атаку.  

KYC-системы продолжают совершенствоваться, но теперь сталкиваются не с единичными случаями фальсификации, а с непрерывным потоком машинно созданных подделок. В этой статье разберем, как генеративный ИИ меняет атаки на удаленную идентификацию, почему фотографию паспорта нельзя считать достаточным доказательством его подлинности и какие уровни защиты помогают выявлять цифровое вмешательство до оформления услуги.

Читать далее

Как математическая модель победила нейросеть: ректификация документов, сложенных втрое

Level of difficultyMedium
Reading time5 min
Reach and readers15K

Сегодня практически любую задачу компьютерного зрения пытаются решить нейронной сетью. Геометрическая ректификация документов — не исключение: современные модели умеют распрямлять даже скомканные листы бумаги.

Реальность устроена иначе: никто не комкает деловые документы перед распознаванием, гораздо чаще их просто складывают пополам или втрое для удобства хранения или транспортировки. Поэтому большие нейросетевые модели на самом деле представляют скорее лишь научный интерес, а для практических целей куда полезнее придумать простой, но эффективный и быстрый алгоритм. 

В Smart Engines мы пошли другим путем: вместо универсальной нейросети построили математическую модель документа, сложенного втрое. В результате получили алгоритм, который не только превосходит современный геометрический трансформер DocTr по качеству, но и работает до 60 раз быстрее.

В этой статье мы расскажем, как работает наш подход, зачем нам понадобилась школьная проективная геометрия и каким образом она обеспечивает нам неразрывность ректифицированного изображения.

Читать далее

Как мы разрушили последний бастион бюрократии в HR и сократили время оформления сотрудников до нескольких секунд

Level of difficultyEasy
Reading time6 min
Reach and readers8.6K

Самый дорогой сотрудник для компании — тот, который уже найден, но еще не может приступить к работе.

Каждый час между принятием решения о найме и фактическим выходом сотрудника означает потерянное рабочее время, дополнительную нагрузку на HR и задержку бизнес-процессов.

И хотя кадровый документооборот давно стал электронным, само оформление сотрудников редко можно назвать быстрым. Причина проста — документы по-прежнему приходится получать, проверять, сопоставлять и переносить в корпоративные системы.

В итоге документы остаются одним из последних бюрократических барьеров между кандидатом и его выходом на работу. Под катом рассказываем, как Smart Engines удалось решить эту задачу и сократить обработку кадрового пакета до нескольких секунд.

Читать далее

4.6-битные сети: от теории к практике. Причём здесь HardTanh?

Level of difficultyHard
Reading time11 min
Reach and readers8.9K

Уже прошло два года с тех пор, как мы предложили схему 4.6-битного квантования и рассказали про нее, в том числе и на Хабре: раз и два. Вспомним, что при 4.6-битном квантовании веса и входы слоя принимают такие целые значения, что их попарные произведения помещаются в знаковый 8-битный тип данных. Такая схема позволила нам вычислять нейронные сети на процессорах мобильных устройств быстрее, чем в 8-битном формате, и точнее, чем в 4-битном, потому что уровней квантования больше.

За прошедшее время у нас появился опыт практического применения таких сетей, и оказалось, что для реального использования важны не только схема квантования и алгоритм умножения. Не меньше вопросов возникает по поводу того, как устроены активации, как хранить карты признаков между слоями, как обрабатывать ветвления и как именно обучается квантованная сеть. Сегодня в статье как раз поговорим про это.

Читать далее

«Клиенты приходят не только из-за курса»: как РНКО «Металлург» 10 лет живет без ручного ввода паспорта

Level of difficultyEasy
Reading time6 min
Reach and readers7.9K

Привет, Хабр! На связи Smart Engines. Недавно мы провели открытый диалог с Егором Карасевым, первым заместителем Председателя Правления РНКО «Металлург», и обсудили наше сотрудничество длиной в 10 лет. Все это время компания использует технологии Smart Engines для распознавания паспортов клиентов в отделениях. Получился разговор не столько об OCR, сколько о том, как автоматизация меняет потоковое обслуживание, снижает нагрузку на сотрудников и помогает бизнесу не терять клиентов из-за ручного ввода данных.

Под катом – история о том, как паспортный сканер, взятый с выставки «на попробовать», стал частью банковского процесса, который работает уже одиннадцатый год.

Читать далее

Ваш KYC не работает: почему цифровые подделки документов стали опаснее бумажных

Level of difficultyEasy
Reading time7 min
Reach and readers9.8K

Когда говорят о подделке документов, обычно подразумевают попытку обмануть человека. Но сегодня документы все чаще проверяют не сотрудники банков и служб безопасности, а алгоритмы цифрового онбординга, KYC и удаленной идентификации.

Поэтому появились подделки нового типа — рассчитанные не на людей, а на компьютеры. Их задача не выглядеть идеально, а заставить систему распознавания извлечь нужные реквизиты и пропустить заявку дальше.

Как выглядят такие атаки, почему существующие решения часто оказываются к ним не готовы и зачем мы создали открытый датасет цифровых подделок документов MIDV-DM — расскажем под катом.

Читать далее

Встраиваем проверку возраста без ЕБС в Telegram, MAX и любой другой мессенджер

Level of difficultyEasy
Reading time5 min
Reach and readers10K

Привет, Хабр! Говоря о проверке возраста для доступа к онлайн-платформам, нельзя обойти стороной один из наиболее очевидных кейсов: мессенджеры. Они давно вышли за рамки простого обмена сообщениями – и для многих новых функций есть конкретные возрастные ограничения. В этой статье мы поговорим о том, как за пару минут интегрировать распознавание паспорта для удобной возрастной идентификации в мини-приложение мессенджера – без биометрии, ЕБС и раскрытия персональных данных. С кодом и видео. В общем, заглядывайте под кат!

Читать далее
1
23 ...

Information

Rating
Does not participate
Works in
Registered
Activity