Обновить
128K+

Обработка изображений *

Работаем с фото и видео

87,99
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Машина времени уже доступна всем или техника путешествия в прошлое

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели14K

Понимаю, заголовок очень похож на кликбейт, но таковым не является. С другой стороны описана немного другая машина времени.

Всё просто, вот краткое описание требований для «машины времени»:

— Старая фотография знакомого места.
— Реставрация старой фотографии: добавить цветов в ч/б фото и возможно, атмосферности.
— Оживление старой фотографии Minimax H3 и добавление одного или нескольких современных персонажей в старый оживленный мир.

Всего два небольших промпта в процессе.

Подробное описание магии с примерами.

Новости

SVG: почему иконка получает не тот размер

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели8K

После экспорта из Figma иконка 24×24 может оказаться в браузере крошечной, огромной или размытой. Обычно файл при этом исправен — просто разные части цепочки смотрят на разные параметры. Разбираем систему координат, viewBox, контракты и ловушки в React.

Читать далее

Использование VLM и OCR для распознавания текста на изображениях

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели6.7K

Привет, Хабр! Одним из моих направлений работ является создание базы знаний по обучающим курсам, которые включают текст и видеоматериалы. И некоторое время назад у меня возник вопрос: какое решение для меня будет оптимальным для распознавания текста на кадрах. В частности, что лучше мне подойдет — VLM или связка OCR + LLM, облачное решение или локальная установка.

Более того, я углубился в тематику OCR: посмотрел ряд типичных задач для OCR и материал на Хабр, провел ряд экспериментов. Надеюсь, данная обзорная статья и мои примеры на GitHub помогут вам быстрее попробовать различные варианты и подобрать оптимальный для своих задач.

Читать далее

Весь архив Циолковского, прочитанный машиной: 51 008 листов и точность, измеренная без эталона

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.7K

Фонд 555 Архива РАН, 51 008 листов рукописей Циолковского, прочитан машиной целиком. Как измерить точность чтения, когда эталона нет, и какие результаты пришлось признать отрицательными.

Читать далее

Microsoft Paint и Photos добавляют невидимые водяные знаки даже на локально сгенерированные изображения

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели8.6K

TL;DR

• Microsoft Paint поддерживает и локальную, и облачную генерацию изображений

• Paint и Photos также имеют в комплекте локальные модели ИИ

• Эти приложения отправляют промпт удалённому серверу для модерации

• Вместе с отмодерированным промптом сервер возвращает GUID

• GUID встраивается в локально сгенерированное изображение в качестве невидимого водяного знака

• Переключаемая в настройках функция видимого водяного знака не управляет этим невидимым водяным знаком

• На PC с Copilot+ генерация изображений выполняется локально, но модерация промптов остаётся удалённой

• Microsoft раскрывает, что Paint добавляет к сгенерированным ИИ изображениям метаданные C2PA

• Сгенерированные ИИ изображения можно сохранять только в форматы, поддерживающие C2PA: PNG, JPEG, GIF и .paint

Читать далее

Подсчет транспорта в видеопотоке: пять мест, где я ошибся

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели5.6K

Счетчик показал десятки проездов за одну красную фазу светофора. Машина была одна, и она стояла.

Нейросеть при этом отработала правильно. Она видела машину и держала ее рамку все это время. Ошибка была в семидесяти строках обычного Python, которые я написал сам.

Система считает машины, автобусы и трамваи на видео с неподвижной камеры… Готовых наборов данных не брал: хотел пройти весь путь от съемки до обученной модели сам и посмотреть, где он ломается.

Ломался он пять раз. Метрики тоже будут, вместе с разбором, почему верить им нельзя.

Читать далее

Как я обучила нейросеть рисовать спектрограммы (и что из этого получилось)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.1K

В проекте используется графическая нейросеть, созданная изначально для работы с изображениями, как инструмент для создания музыки. Модель обучалась на спектрограммах, не зная, что рисует звук, а не картинки. Так стандартный визуальный инструмент стал музыкальным.

Читать далее

Как я учу компьютер читать старые чертежи — и почему одного OCR оказалось мало

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели5.3K

Я не пытался создать «нейросеть, которая всё понимает». Вместо этого я построил конвейер: компьютерное зрение для поиска видов, детерминированные правила для геометрии, специализированные детекторы для разрывов и исполнений, а поверх — экспериментальный семантический слой на NVIDIA Nemotron. В статье — архитектура, метрики (mAP, Recall), устройство append‑only датасета и инженерные грабли, которые я собрал на 229 чертежах.

Читать далее

Обзор рынка ДЗЗ в России: 2026

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели2.9K

Состояние российского рынка дистанционного зондирования Земли на август 2026 года

Российский рынок дистанционного зондирования Земли переживает довольно заметный переходный период. Еще несколько лет назад ДЗЗ в России в основном ассоциировалось с государственными космическими аппаратами, а коммерческий рынок данных оставался относительно небольшим. Сейчас ситуация меняется: появляются частные операторы спутников, собственные группировки, наземные станции, платформы доступа к данным и сервисы автоматической аналитики.

Одновременно государство начинает выступать не только владельцем космической инфраструктуры, но и крупным заказчиком данных у различных поставщиков. По оценке руководства Роскосмоса, потенциал российского рынка данных ДЗЗ после запуска новой модели закупок может вырасти более чем в шесть раз — до 31 млрд рублей. При этом уже в 2026 году Роскосмос сообщил о заключении контрактов на предоставление данных ДЗЗ примерно на 5 млрд рублей для федеральных и других государственных органов.

Именно поэтому 2026 год можно считать одним из переломных для российского рынка ДЗЗ.

Читать далее

Unlimited-OCR от Baidu: читает страницу как картинку

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.2K

Как вы себе представляете работу OCR? Страничка сканируется, программа находит области с буквами, распознает их и выдает текст. Старый добрый Tesseract так и пашет. А вот новый baidu/Unlimited-OCR делает финт ушами: он вообще не ищет буквы. Он берет всю страницу как картинку, жмет ее в горстку визуальных токенов и скармливает языковой модели, которая разворачивает их обратно в структурированный текст. Звучит как извращение, но… работает.

Это прямой наследник идеи DeepSeek-OCR. Сегодня коротко разложу: что это, как устроено, что умеет и как запустить у себя. Будет полезно всем, кто хочет распознавать многостраничные документы за одну проходку или вписать такую функцию в свой проект.

Читать далее

Конвертация docx на сервере: LibreOffice headless против Apache POI, и где каждый ломается

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.6K

Задача звучит безобидно: «нам нужно на бэкенде превращать .docx в .html (а иногда .html в .pdf)». В тикете это одна строчка. На практике конвертация офисных документов — одна из тех тем, где красивый прототип собирается за час, а потом полгода латается по краям: то таблица разъехалась, то картинки пропали, то сервис лёг под нагрузкой, то .doc из 2007-го отказывается открываться.

Я подходил к этой задаче двумя принципиально разными способами и в итоге держу два отдельных репозитория:

Читать далее

Изучаем нейронную сеть на Java

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели9.6K

Всем привет, меня зовут Антон, я работаю в Сбере разработчиком Java, в продукте GigaIDE. В этой статье мы перепишем нейронную сеть c Phyton’а на Java, которая распознаёт рукописные цифры MNIST. Попробуем распознавать свои цифры, рисуя их мышкой, сделаем обратный запрос в сеть и заглянем в ее «мозги», а в конце сделаем выводы.

Читать далее

Как мы автоматизировали перевод скриншотов в документации

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели8K

Когда документацию переводят на другой язык, обычного перевода текста недостаточно: на скриншотах тоже остаются кнопки, настройки и подсказки.

Рассказываем, как мы проверяли автоматический перевод таких скриншотов, зачем в процессе нужен глоссарий и какие метрики удалось улучшить.

Читать далее

Ближайшие события

Как найти остров по одной фотографии: геолокация через геометрию и CUDA

Время на прочтение8 мин
Охват и читатели7.7K

Фото островного курорта. Ни EXIF, ни GPS, ни модели камеры – ничего. Нужно назвать курорт, координаты и сторону света, куда смотрела камера. Пытаться ответить на эти вопросы через google lens – значит упустить возможность повеселиться. Поэтому я взялся за задачу с помощью математики и программирования.

Читать далее

Как подобрать цвета в проекте: от теории до промптов

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели9.2K

Подбор идеальной палитры — одна из самых сложных задач для начинающего дизайнера, фотографа, нейронщика — в общем, любого, кто работает с визуалом.

В этой статье я разбираю весь путь: от базовых вопросов и свойств цвета до рабочих цветовых схем и промптов, которые помогают удерживать заданную палитру в нейросетях.

Читать далее

Невидимые метки в AI-картинках 2.0: JPEG, blur, перерисовка и ошибки первого теста

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели6.6K

После первой статьи в комментариях попросили больше технической части и меньше выводов по одной картинке. Разбираюсь, что SynthID переживает, что может разрушить метку и что вообще доказывает её наличие.

В первой статье я проверил одно изображение через сторонний сервис и сделал из этого слишком широкий вывод. В комментариях предложили более нормальный набор тестов: JPEG-сжатие, resize, crop, blur, скриншот, повторную генерацию и анализ частотной области. Там же мне скинули reverse engineering SynthID. Так что здесь разбираемся уже не с одним сервисом, а с самой технологией.

Услышал ваши комментарии, исправляюсь

Как поймать поддельный документ по голограмме – даже без ультрафиолета

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.3K

Как при автоматической проверке документов отличить оригинал от цветной ксерокопии или даже муляжа? Один из надежных признаков подлинности – наличие оптически-переменных защитных элементов (OVD, Optical Variable Device), например голограмм. Их внешний вид меняется при изменении угла обзора и положения источника света.

В Smart Engines мы разработали и запатентовали метод обнаружения OVD, который позволяет выявлять копии и муляжи с помощью сканера под управлением ИИ. Для проверки достаточно видимого диапазона и серии изображений документа, полученных при разных положениях подсветки. О том, как нам удалось реализовать такой подход и научить сканер обнаруживать муляжи по OVD, читайте под катом.

Читать далее

Человек, которого никогда не было. Как ИИ создаёт синтетические личности?

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.3K

Ещё недавно у фальшивой личности обязательно был настоящий владелец.

Мошеннику требовался чужой паспорт, фотография, номер телефона или хотя бы несколько строк из утёкшей базы. Дальше начиналась ручная работа: заменить снимок, исправить дату рождения, подобрать похожее лицо, придумать объяснение для оператора.

Человек мог не знать, что от его имени берут кредит, но он существовал.

Привет, Хабр! Мы Михаил Никитин и Карина Саркисян из команды Tevian. На всякий случай уточним: мы настоящие. А вот с героями этой статьи не всё так однозначно..

Генеративный ИИ сильно упростил создание таких профилей. Теперь мошенническую анкету можно собирать с пустого листа. Нейросеть придумает биографию, нарисует лицо, исправит документ, оживит портрет для видеозвонка и поможет отвечать на вопросы службы поддержки. Реальными останутся только отдельные детали: адрес, телефон, номер документа или данные из утечки. Получится человек, у которого есть паспорт, селфи и цифровой след. Нет только прошлого.

Разобрать синтетическую личность

Почему в Chrome маленькие JPEG выглядят иначе

Время на прочтение4 мин
Охват и читатели12K

Этот значок на компьютере моего коллеги выглядит лучше

Как-то я общался с коллегой у него за компьютером и заметил, что логотип выглядит не совсем так, как моём компьютере. На компьютере коллеги он казался тоньше и больше походил на исходное изображение. Он имел размер 15px; на картинке выше показана его увеличенная версия.

Примечание: показано не исходное изображение. Это было уже довольно давно, поэтому я создал новое изображение, чтобы продемонстрировать, в чём же проблема.

Если прищуриться или отойти подальше, то изображение из Chrome выглядит толще. Это немного странно, но если заменить картинку на SVG, то проблема исчезнет. Однако мне всё равно стало любопытно: почему она вообще так рендерится?

Я провёл исследование и обнаружил в Chrome изящную оптимизацию, используемую для рендеринга JPEG в мелком масштабе.

Читать далее

ИАД x Сайбокс

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.5K

Если нет времени читать всё, то вкратце: в октябре 2025 года отрасль OCR‑моделей для распознавания бухгалтерских документов пережила настоящий взрыв качества их работы. Благодаря этому нам удалось увеличить точность и производительность наших моделей в продуктах ИАД и Сайбокс:

- Сократили длительность обработки счёта с 3–4 минут до 30 секунд с помощью замены тяжёлой Qwen2.5-VL-72B на оптимизированную nanonets‑ocr2-3b.

- На 70% уменьшили объём проверок вручную, что особенно полезно для инструмента по сравнению документов (модель перестала добавлять мусор, не выдумывает числа и не искажает структуру).

- Повысили пропускную способность в 5 раз на том же оборудовании. Сейчас модель весит меньше, и больше ресурсов остаётся на поточную обработку.

- Таблицы теперь распознаются как HTML — за 1 секунду. Раньше приходилось гонять результат OCR через вторую LLM‑модель, чтобы распарсить таблицы.

Если интересно, как мы к этому пришли и какую пользу от проведённого нашей командой исследования получили наши продукты, то заходите.

Статья состоит из двух частей: первая про бизнес, вторая про технические подробности реализации и исследования.

Читать далее
1
23 ...