MK AIMask / Блог

Скрытый OCR-слой: данные, которых не видно, но можно скопировать

Невидимый OCR-слой в PDF может сохранить персональные данные после визуального редактирования. Как проверить документ перед отправкой в ИИ.

Скрытый OCR-слой: данные, которых не видно, но можно скопировать

У сканированного PDF часто есть невидимый дубль: OCR-слой делает картинку доступной для поиска и копирования. Полезно — пока документ не отредактировали только визуально.

В материале Showing What is Hidden, опубликованном 26 июня и обновлённом 12 августа, Apryse показывает, как скрытый текст перестаёт совпадать с изображением после правок или повторного OCR. Автор отдельно отмечает риск: персональные данные можно закрыть на видимом слое, но оставить в подложке, которую спокойно прочитает парсер или ИИ.

Проверка «глазами» здесь бессильна. Нужен повторный разбор файла: извлечь все текстовые поверхности, метаданные и вложенные объекты, затем убедиться, что исходные значения действительно исчезли.

Как поможет AIMask

AIMask обрабатывает документы локально, маскирует найденные сущности и проводит независимую проверку результата. Сотрудник получает безопасную копию, а не красивую чёрную плашку поверх всё ещё доступного текста.

Поделиться материалом

Telegram ВКонтакте