MK AIMask / Blog

PDF выглядит чистым. А что в нём прочитает ИИ?

Исследование PDF показывает, почему видимая страница, скрытый текст, метаданные и данные для ИИ могут не совпадать — и как снизить риск утечки.

PDF выглядит чистым. А что в нём прочитает ИИ?

Открываете PDF: фамилия закрыта, номер договора не виден, всё выглядит безопасно. Но поисковый индексатор или ИИ может получить совсем другую версию документа.

В свежем исследовании The PDF Is Not the Document авторы разобрали большие массивы реальных PDF и показали, что один файл одновременно содержит несколько представлений: отрисованную страницу, скрытый текстовый слой, граф объектов, метаданные и подписанный диапазон байтов. Эти слои способны расходиться между собой. В одном из массивов метаданные, удалённые из видимого представления, восстанавливались из «осиротевших» объектов.

Отсюда простой вывод: визуально закрасить данные — не то же самое, что удалить их. Перед отправкой документа во внешний ИИ нужно проверить не только картинку, но и всё, что извлекают парсер, OCR и индексатор.

Как поможет AIMask

AIMask локально находит и маскирует персональные данные и секреты в документах, а затем независимо проверяет результат. PDF считается безопасным только после контроля текстовых слоёв, метаданных и других скрытых поверхностей.

Share this article

Telegram ВКонтакте