КЛИЕНТ
Enterprise-организация, оперирующая большим массивом разнородных документов: договоры, финансовые и аналитические отчёты, кадровые досье, сканы бумажных архивов с печатями и подписями. Заказчик не раскрывается в соответствии с соглашением о неразглашении. Решение носит межотраслевой характер и применимо в финансовом секторе, страховании, промышленности, enterprise-консалтинге и HR-холдингах.
ОТРАСЛЬ
Межотраслевое решение: финансовый сектор, страхование, промышленность, enterprise-консалтинг, HR-холдинги.
ЗАДАЧА
У заказчика регулярно возникает необходимость передавать документы за доверенный периметр:
- Внешним сторонам — подрядчикам, рецензентам, внешним аудиторам, регуляторам, а также для публикации в открытых реестрах и архивах;
- В генеративные ИИ-системы — для обогащения корпоративных баз знаний (RAG), чат-ботов и LLM без риска компрометации коммерческой тайны и персональных данных.
Регуляторный контур задачи: 152-ФЗ «О персональных данных», 3-МР Банка России по информационной безопасности при применении ИИ и LLM, методика ФСТЭК России по оценке угроз, OWASP Top-10 for LLM (LLM06: Sensitive Information Disclosure) и MITRE ATLAS.
ПРОБЛЕМАТИКА
Ручная обработка и типовые DLP-инструменты не закрывают задачу:
- Человеческий фактор. На документах в десятки и сотни страниц пропуск одного упоминания ФИО, спецсчёта или лицензии — особенно в сносках, таблицах или падежных склонениях — компрометирует всю процедуру и влечёт регуляторные риски;
- Слепая зона для текста. Стандартные текстовые парсеры не видят графические утечки: сканы, печати, факсимиле и рукописные подписи;
- Блокировка рабочих процессов. Построчная ручная вычитка экспертами занимает дни, парализуя регулярный обмен данными и масштабирование AI-сервисов;
- Необратимость вымарывания. При классическом закрашивании документ превращается в несвязный текст и непригоден для санкционированного восстановления авторизованными лицами.
РЕШЕНИЕ
Разработан и внедрён многоуровневый конвейер потокового обезличивания и обратимой токенизации по принципу эшелонированной защиты (defense-in-depth). Работы выполнены в развитие компетенций «КРЕДО-С» в области защиты персональных данных и защиты конфиденциальной информации:
- Гибридный конвейер распознавания (NER + регулярные выражения + OCR). Связка кастомной NER-модели, морфологических словарей и regex-паттернов детектирует ФИО во всех падежах, должности, паспортные данные, СНИЛС, ИНН, адреса, номера договоров и специфичные идентификаторы. Нативно поддерживаются DOCX, XLSX и PDF с сохранением разметки и формул, а также сканы через OCR-модуль;
- Компьютерное зрение для визуальных артефактов. Нейросетевая модель локализует и маскирует оттиски круглых и треугольных печатей, штампы согласования и факсимиле на сканах — уязвимость, недоступную чисто текстовым DLP-системам;
- Безопасная обратимая токенизация. Чувствительные данные заменяются семантическими токенами вида [ФИО_1], [ОРГАНИЗАЦИЯ_2], [СУММА_1], сохраняя грамматическую и логическую структуру текста для LLM и RAG. Таблица соответствий шифруется в локальном Vault-хранилище заказчика: доверенный получатель восстанавливает исходный вид в один клик;
- Локальный контур контроля качества (LLM-as-a-Judge). Второй независимый рубеж: компактная локальная LLM в закрытом контуре проводит семантический аудит уже обезличенного текста, выявляя скрытые квази-идентификаторы и узкоконтекстные утечки;
- Калибровка на эталонном стенде. Алгоритмы протестированы на выборке из 100 эталонно размеченных документов. Оптимизация смещена в пользу метрики Recall (F2-score): цена пропуска утечки несоизмеримо выше цены лишней маскировки.
Среда развёртывания — 100% on-premise, изолированный закрытый контур заказчика (air-gapped / Kubernetes), без передачи данных во внешние облачные сервисы.
РЕЗУЛЬТАТЫ
| Показатель | Значение | Эффект для организации |
|---|---|---|
| Полнота обнаружения ПДн (Recall) | 0.86 (F2 = 0.82) | Минимизация рисков регуляторных штрафов по 152-ФЗ и 3-МР Банка России |
| Эффективность второго рубежа (LLM-Judge) | 0.80 Recall | Перехват скрытых контекстных утечек, пропущенных первичным NER |
| Покрытие графических элементов | 100% | Полная маскировка печатей, штампов и подписей на сканах |
| Трудозатраты экспертов ИБ и юристов | снижение в 6–8 раз | Переход от сплошной вычитки к точечной валидации подсвеченных находок |
| Скорость обработки документов | минуты вместо дней | Пакетная автоматическая обработка без задержки бизнес-процессов |
Архитектура нейтрализует угрозу OWASP LLM06 (Sensitive Information Disclosure), учитывает требования 3-МР Банка России и методику ФСТЭК России, а семантическая токенизация сохраняет ценность данных для RAG и LLM: модели генерируют точные ответы без риска утечки исходных персональных данных.
ЧАСТО ЗАДАВАЕМЫЕ ВОПРОСЫ
Что такое обезличивание персональных данных?
Обработка, после которой по данным нельзя определить их принадлежность конкретному субъекту без дополнительной информации. В этом решении обезличивание сделано обратимым: чувствительные значения заменяются семантическими токенами вида [ФИО_1] или [ОРГАНИЗАЦИЯ_2], а таблица соответствий шифруется в локальном Vault-хранилище заказчика. Тема примыкает к защите персональных данных по 152-ФЗ.
Чем обезличивание отличается от обычного вымарывания в документе?
При классическом закрашивании документ превращается в несвязный текст: он теряет смысл и непригоден для санкционированного восстановления. Семантическая токенизация сохраняет грамматическую и логическую структуру, поэтому документ остаётся пригодным и для чтения человеком, и для работы LLM и RAG, а доверенный получатель восстанавливает исходный вид в один клик.
Какие данные и форматы обрабатываются?
ФИО во всех падежах, должности, паспортные данные, СНИЛС, ИНН, адреса, номера договоров и специфичные идентификаторы. Нативно поддерживаются DOCX, XLSX и PDF с сохранением разметки и формул, сканы — через OCR-модуль. Отдельный слой компьютерного зрения маскирует оттиски печатей, штампы согласования и факсимиле — то, чего не видят чисто текстовые DLP-системы.
Почему оптимизация идёт по Recall, а не по точности?
В информационной безопасности цена пропуска утечки несоизмеримо выше цены лишней маскировки. Поэтому алгоритмы калиброваны по F2-score на выборке из 100 эталонно размеченных документов: полнота обнаружения 0.86 при F2 = 0.82, второй рубеж на локальной LLM добавляет 0.80 Recall по скрытым контекстным утечкам.
Уходят ли данные во внешние сервисы?
Нет. Развёртывание 100% on-premise: изолированный закрытый контур заказчика (air-gapped или Kubernetes), включая локальную компактную LLM для контроля качества. Незащищённые данные во внешние облачные сервисы не передаются — это же требование закрывает риск разглашения конфиденциальной информации.
Каким требованиям это соответствует?
Архитектура учитывает 152-ФЗ «О персональных данных», 3-МР Банка России по информационной безопасности при применении ИИ и LLM, методику ФСТЭК России по оценке угроз, а также нейтрализует угрозу OWASP Top-10 for LLM LLM06 (Sensitive Information Disclosure) с учётом матрицы MITRE ATLAS.
Другие проекты по безопасности ИИ: аудит безопасности LLM/RAG-решения · практическое тестирование LLM (AI Red Teaming).
Вам требуется аналогичное решение?
Специалисты компании «КРЕДО-С» готовы провести технический аудит и подобрать оптимальное решение под задачи вашего предприятия с учётом всех требований законодательства и регуляторов (ФСТЭК, ФСБ, Банк России).
Заказать консультацию эксперта