Если несколько упрощенно, то примерно так и есть, только вместо фото снимков рентгеновские снимки, а вместо мешей поверхности – внутренняя структура с воксельной визуализацией.
Все так. Для сравнения: стационарные томографы бывают разными, и цена у них разная. И все нужны. И здесь будет так же. А как оно иначе может быть вообще?
Будем работать над тем, чтобы наши соотечественники жили лучше и дольше. Да, бывает, что новые технологии сначала появляются на частные деньги, поскольку "денег нет". Но потом деньги появляются. Про стационарные томографы вам уже написали.
Мы надеемся, что так и будет, и работаем над этим. Мы сами разработчики, а не производители. Но производителей мы знаем, говорим с ними, и да – это абсолютно реально.
Психологическая – это, наверное, не к нам. Но есть и вполне физический аспект. Оператор же снимает много раз, а каждый пациент снимается только один. Поэтому уже сейчас в качестве "зеленого индикатора" используется стандартный дозиметр, позволяющий контролировать дозу.
В нашем пайплайне выделение табличных областей (включая случаи, когда таблицы расположены вплотную или «слиплись» без видимых разделителей) решается на этапе предобработки. И на вход регулярным выражениям уже подается корректно изолированная табличная зона.
Что касается вложенных таблиц - это отдельная интересная нетривиальная задача, мы расскажем про это уже в другой статье.
У корпоративного ПО цена зависит не только от самого продукта, но и от сценария использования. Поэтому одна цифра на странице «Цены» скорее вводила бы в заблуждение, чем помогала сориентироваться.
Более того, именно в диалоге наши менеджеры могут разобраться в вашей задаче и предложить ровно ту конфигурацию и схему лицензирования, которая вам нужна — без лишних функций и затрат.
Если у Вас возникают психологические технические трудности с заполнением формы, то всегда можно написать напрямую на почту sales@smartengines.ru или позвонить по телефону +7 (495) 649 82 60
Естественно, мы возвращаем эти сигналы через разные элементы в интерфейсе. Иначе было бы сложно представить, как нашими продуктами пользовались в системообразующих банках, в крупных государственных структурах, вплоть до границы.
Имелось в виду document poisoning — класс атак, при которых в документ намеренно вносятся изменения, нарушающие работу алгоритмов распознавания. Для LLM- и VLM-подходов эта тема действительно становится все более актуальной.
В Smart Engines мы развиваем собственный движок OCR, который не использует LLM для распознавания документов. Он поддерживает более 100 языков и письменностей мира, включая кириллическую рукопись, и полностью работает локально без передачи данных в облако.
Спасибо за комментарий. Мы нигде не утверждаем, что типизация заменяет OCR – это разные задачи.
Более того, на практике существует немало сценариев, где OCR вообще не требуется. Например, проверка комплектности пакета документов, контроль заполнения обязательных полей, наличия подписей, печатей или других реквизитов. Во всех этих случаях сначала необходимо понять, что за документ перед нами, а извлечение текста может вообще не понадобиться.
Поэтому типизация – это не только пре-фильтр перед OCR, но и самостоятельная задача, которая во многих бизнес-процессах имеет вполне самостоятельную ценность.
Кажется, здесь смешаны сразу несколько разных сценариев.
Если можно заставить пользователя что-то сразу заполнить, то конечно никаких задач определения типа и тем более распознавания текста нет. Но статья вообще не про это. Мы рассматриваем ситуацию, когда система уже получила готовый скан документ. В этот момент спрашивать пользователя, что это за документ, уже поздно – это и есть задача типизации.
Что касается современных OCR-моделей, никто не спорит с их возможностями. Но использовать полноценный OCR или VLM только для того, чтобы понять тип документа, – это примерно как запускать компилятор, чтобы проверить расширение файла. Если задачу можно решить за 3 мс на CPU без OCR, без нейросетей и без обучения, то именно такой подход и выглядит наиболее рациональным.
По абсолютным цифрам — спасибо, добавим в следующий раз. Если коротко: на Jetson Orin Nano наша локализация занимает 87 мс против 5400 мс у DocTr, ректификация — 200 мс против 600 мс.
Связь с fixed-point арифметикой здесь и правда есть, но не тождественная.4.6-битная схема является равномерным симметричным квантованием: мы используем целые уровни от -11 до 11 и масштаб, который связывает эти уровни с вещественными значениями. В q-format масштаб задаётся положением двоичной точки, то есть степенью двойки, а пересчёт после умножения часто сводится к сдвигу. У нас масштаб выбирается как параметр квантования слоя/активации и не обязан быть степенью двойки.
Главная особенность 4.6-битной схемы в выбранном диапазоне уровней. Веса и активации квантуются так, что их произведения помещаются в знаковый 8-битный тип. Дальше суммы, конечно, накапливаются в более широких аккумуляторах — 16- и 32-битных.
Схема рассчитана не на ПЛИС и не на специализированный DSP, а на обычные CPU с SIMD-расширениями, например ARM NEON или x86 AVX. Такие процессоры хорошо работают с 8-битными целыми типами, но не поддерживают напрямую «настоящие» 4.6-битные числа или форматы вроде FP8.
Низкоуровневую арифметику инференса мы подробнее разбирали в предыдущем посте: https://habr.com/ru/companies/smartengines/articles/822407. В этом посте фокус другой: как обучать сети с таким квантованием и какую архитектуру сети выбрать, чтобы на инференсе не появлялись промежуточные 32-битные карты признаков между слоями.
При обучении мы не считаем градиенты в 4.6-битной арифметике. Обучение может быть «дорогим»: с float32, эмуляцией квантования и аппроксимацией градиента. Цель — получить после обучения небольшую утилитарную сеть, которая быстро и дёшево исполняется на устройстве пользователя.
К сожалению или к счастью, реальный рынок, где используются KYC технологии, обычно заметно менее идеален, чем презентации вендоров KYC-платформ.
В реальности существуют разные сценарии. Да, есть кейсы, в которых есть видеопоток и где можно проверить наличие OVD. Распознавание паспорта в видеопотоке мы сделали 11 лет назад. Проверку голограмм в видеопотоке мы сделали и запатентовали в США 7 назад. А датасет ID документов с голограммами, для ученых, которые действительно в теме, MIDV-Holo мы опубликовали и представили на ICDAR 3 года назад.
Но это далеко не весь рынок и уж точно не большинство проверок документов в мире.
Достаточно посмотреть на то, как сегодня оформляются кредиты, особенно микрозаймы. Ежедневно выдаются десятки тысяч займов по фотографии документа, загруженной через веб-форму или мобильное приложение, зачастую без какого-либо видео.
Если несколько упрощенно, то примерно так и есть, только вместо фото снимков рентгеновские снимки, а вместо мешей поверхности – внутренняя структура с воксельной визуализацией.
Ух, забористо! Мы все же сомневаемся, что, сняв два колеса с мини-трактора, можно получить мотоцикл. Кажется, нужен еще ряд изменений :)
Все так. Для сравнения: стационарные томографы бывают разными, и цена у них разная. И все нужны. И здесь будет так же. А как оно иначе может быть вообще?
Будем работать над тем, чтобы наши соотечественники жили лучше и дольше. Да, бывает, что новые технологии сначала появляются на частные деньги, поскольку "денег нет". Но потом деньги появляются. Про стационарные томографы вам уже написали.
Стоп! Какие гироскопы? Нет никаких гироскопов, это важно))) А про порядок цен вы все верно разложили.
Обидно за державу! Мы ж не продажу 100 штук Гигачатов обсуждаем)
Мы надеемся, что так и будет, и работаем над этим. Мы сами разработчики, а не производители. Но производителей мы знаем, говорим с ними, и да – это абсолютно реально.
Психологическая – это, наверное, не к нам. Но есть и вполне физический аспект. Оператор же снимает много раз, а каждый пациент снимается только один. Поэтому уже сейчас в качестве "зеленого индикатора" используется стандартный дозиметр, позволяющий контролировать дозу.
Обязательно оформим!
Спасибо за вопрос.
В нашем пайплайне выделение табличных областей (включая случаи, когда таблицы расположены вплотную или «слиплись» без видимых разделителей) решается на этапе предобработки. И на вход регулярным выражениям уже подается корректно изолированная табличная зона.
Что касается вложенных таблиц - это отдельная интересная нетривиальная задача, мы расскажем про это уже в другой статье.
У корпоративного ПО цена зависит не только от самого продукта, но и от сценария использования. Поэтому одна цифра на странице «Цены» скорее вводила бы в заблуждение, чем помогала сориентироваться.
Более того, именно в диалоге наши менеджеры могут разобраться в вашей задаче и предложить ровно ту конфигурацию и схему лицензирования, которая вам нужна — без лишних функций и затрат.
Если у Вас возникают
психологическиетехнические трудности с заполнением формы, то всегда можно написать напрямую на почту sales@smartengines.ru или позвонить по телефону +7 (495) 649 82 60Спасибо за интересный комментарий!
Естественно, мы возвращаем эти сигналы через разные элементы в интерфейсе. Иначе было бы сложно представить, как нашими продуктами пользовались в системообразующих банках, в крупных государственных структурах, вплоть до границы.
Имелось в виду document poisoning — класс атак, при которых в документ намеренно вносятся изменения, нарушающие работу алгоритмов распознавания. Для LLM- и VLM-подходов эта тема действительно становится все более актуальной.
В Smart Engines мы развиваем собственный движок OCR, который не использует LLM для распознавания документов. Он поддерживает более 100 языков и письменностей мира, включая кириллическую рукопись, и полностью работает локально без передачи данных в облако.
Спасибо за комментарий. Мы нигде не утверждаем, что типизация заменяет OCR – это разные задачи.
Более того, на практике существует немало сценариев, где OCR вообще не требуется. Например, проверка комплектности пакета документов, контроль заполнения обязательных полей, наличия подписей, печатей или других реквизитов. Во всех этих случаях сначала необходимо понять, что за документ перед нами, а извлечение текста может вообще не понадобиться.
Поэтому типизация – это не только пре-фильтр перед OCR, но и самостоятельная задача, которая во многих бизнес-процессах имеет вполне самостоятельную ценность.
Кажется, здесь смешаны сразу несколько разных сценариев.
Если можно заставить пользователя что-то сразу заполнить, то конечно никаких задач определения типа и тем более распознавания текста нет. Но статья вообще не про это. Мы рассматриваем ситуацию, когда система уже получила готовый скан документ. В этот момент спрашивать пользователя, что это за документ, уже поздно – это и есть задача типизации.
Что касается современных OCR-моделей, никто не спорит с их возможностями. Но использовать полноценный OCR или VLM только для того, чтобы понять тип документа, – это примерно как запускать компилятор, чтобы проверить расширение файла. Если задачу можно решить за 3 мс на CPU без OCR, без нейросетей и без обучения, то именно такой подход и выглядит наиболее рациональным.
Все крайне прагматичнее. Если примеры из нашей с Вами повседневности:
Полис ОСАГО, который распечатывается на А4, а носится сложенным
Электронная виза РФ, которую получают иностранцы, аналогично, формата А4, но носится в паспорте
ОМС, который традиционно тоже носится в паспорте
Транспортные документы, которые привозят вам экспедитор вместе с товаром
...
По абсолютным цифрам — спасибо, добавим в следующий раз. Если коротко: на Jetson Orin Nano наша локализация занимает 87 мс против 5400 мс у DocTr, ректификация — 200 мс против 600 мс.
Связь с fixed-point арифметикой здесь и правда есть, но не тождественная.4.6-битная схема является равномерным симметричным квантованием: мы используем целые уровни от -11 до 11 и масштаб, который связывает эти уровни с вещественными значениями. В q-format масштаб задаётся положением двоичной точки, то есть степенью двойки, а пересчёт после умножения часто сводится к сдвигу. У нас масштаб выбирается как параметр квантования слоя/активации и не обязан быть степенью двойки.
Главная особенность 4.6-битной схемы в выбранном диапазоне уровней. Веса и активации квантуются так, что их произведения помещаются в знаковый 8-битный тип. Дальше суммы, конечно, накапливаются в более широких аккумуляторах — 16- и 32-битных.
Схема рассчитана не на ПЛИС и не на специализированный DSP, а на обычные CPU с SIMD-расширениями, например ARM NEON или x86 AVX. Такие процессоры хорошо работают с 8-битными целыми типами, но не поддерживают напрямую «настоящие» 4.6-битные числа или форматы вроде FP8.
Низкоуровневую арифметику инференса мы подробнее разбирали в предыдущем посте: https://habr.com/ru/companies/smartengines/articles/822407. В этом посте фокус другой: как обучать сети с таким квантованием и какую архитектуру сети выбрать, чтобы на инференсе не появлялись промежуточные 32-битные карты признаков между слоями.
При обучении мы не считаем градиенты в 4.6-битной арифметике. Обучение может быть «дорогим»: с float32, эмуляцией квантования и аппроксимацией градиента. Цель — получить после обучения небольшую утилитарную сеть, которая быстро и дёшево исполняется на устройстве пользователя.
А Вы, батенька, похоже бот, если не заметили и тут на Хабре, и на нашем сайте ссылки на демо-приложения, бесплатно и без регистрации.
В Вашем рассуждении есть зияющая дыра, которая очевидно закрывается сразу на первых страницах нашего сайта. Мы не сервис.
К сожалению или к счастью, реальный рынок, где используются KYC технологии, обычно заметно менее идеален, чем презентации вендоров KYC-платформ.
В реальности существуют разные сценарии. Да, есть кейсы, в которых есть видеопоток и где можно проверить наличие OVD. Распознавание паспорта в видеопотоке мы сделали 11 лет назад. Проверку голограмм в видеопотоке мы сделали и запатентовали в США 7 назад. А датасет ID документов с голограммами, для ученых, которые действительно в теме, MIDV-Holo мы опубликовали и представили на ICDAR 3 года назад.
Но это далеко не весь рынок и уж точно не большинство проверок документов в мире.
Достаточно посмотреть на то, как сегодня оформляются кредиты, особенно микрозаймы. Ежедневно выдаются десятки тысяч займов по фотографии документа, загруженной через веб-форму или мобильное приложение, зачастую без какого-либо видео.