Свежий кейс: служебные документы в публичном чат-боте

В апреле 2026 года РБК рассказал о проверке в Министерстве внутренней безопасности США: исполняющий обязанности директора CISA летом 2025 года загружал в ChatGPT служебные материалы. Документы не были засекречены, но считались чувствительными и не предназначались для публичного распространения.

Кейс показателен не должностью участника, а типовой мотивацией: человек хочет быстрее получить резюме, анализ или черновик. С точки зрения утечки достаточно обычной рабочей операции — загрузить файл во внешний интерфейс.

Что показывают исследования

По данным Check Point за июль–август 2026 года, примерно один из 36 промптов в наблюдаемом корпоративном трафике имел высокий риск утечки чувствительных данных. В отчёте за 2025 год показатель составлял один из 80 промптов, ещё 7,5% запросов содержали потенциально чувствительную информацию.

Исследование Harmonic Security на выборке более трёх миллионов промптов и загрузок за июль–сентябрь 2025 года зафиксировало, что 21,81% чувствительных данных направлялись в инструменты, которые могли использовать пользовательский ввод для обучения. Это данные конкретных поставщиков защиты и их клиентской выборки, а не универсальная статистика для всех компаний, но они хорошо показывают масштаб неконтролируемого канала.

Важно читать цифры корректно: телеметрия вендоров отражает их выборку, правила детектирования и набор наблюдаемых сервисов. Для собственной оценки нужны инвентаризация AI-инструментов и анализ реального трафика организации.

Четыре канала риска

  1. Сам промпт или файл. ПДн, коммерческая тайна, код и реквизиты передаются поставщику сервиса уже при отправке запроса.
  2. История, журналы и память. Содержимое может попадать в историю диалогов, телеметрию, кэш, коннекторы или служебные логи — режим зависит от продукта и договора.
  3. Подключённые источники. AI-ассистент с доступом к почте, диску или базе способен получить больше данных, чем нужно конкретному пользователю.
  4. Извлечение через атаки. Prompt injection и недостаточный контроль доступа могут заставить агента раскрыть сведения из подключённого контекста.

Microsoft Research показал на архитектурах fine-tuning и RAG, что фильтрация промптов и ответов остаётся вероятностной защитой; для корпоративных сценариев нужен детерминированный контроль прав доступа к данным. OWASP отдельно рекомендует не помещать секреты, ключи и строки подключения в системные промпты.

Какие ограничения работают вместе

  • утвердить разрешённые AI-сервисы и классы данных, которые можно в них отправлять;
  • разделить публичные, корпоративные и локальные модели по допустимым сценариям;
  • убирать ПДн и коммерческие идентификаторы до загрузки, а не надеяться на фильтр ответа;
  • применять минимальные права к коннекторам, RAG-индексам и AI-агентам;
  • контролировать личные аккаунты и теневые AI-инструменты на рабочих устройствах;
  • обучить сотрудников разбирать файлы, таблицы, сканы и скрытые метаданные;
  • определить порядок реагирования, если чувствительные данные уже отправлены.

Кейс: юридический отдел просит AI сравнить договоры

В договорах есть ФИО, телефоны, банковские реквизиты, названия контрагентов, суммы и кодовые названия проектов. Для сравнения условий нужны предмет, ответственность, сроки и формулировки пунктов — большинство идентификаторов задаче не помогают.

Рабочий процесс: создать копии, обнаружить стандартные ПДн и внутренние термины, подтвердить маскирование, повторно проверить результат и только затем загрузить очищенные файлы в разрешённый инструмент. Если политика запрещает внешний сервис даже для очищенных документов, задача должна выполняться в локальном AI-контуре.

Как помогает docdef

docdef проверяет PDF, DOCX, XLSX и сканы, находит персональные и корпоративные сущности, позволяет пользователю подтвердить контекст и формирует отдельную очищенную копию. Корпоративные словари помогают скрывать не только типовые ПДн, но и названия клиентов, проектов и внутренние коды.

Граница решения: docdef снижает объём данных в подготовленном файле, но не контролирует ручной ввод в чат, настройки внешнего AI-провайдера, права коннекторов и последующее использование результата. Нужны политика, доступы, мониторинг и обучение.

Источники и исследования

  1. РБК: «Слив сквозь нейросеть: чем опасна загрузка документов в ИИ-сервисы»Кейс CISA/DHS и рекомендации по внутренним правилам использования ИИ, 15.04.2026.
  2. Check Point: AI Threat Landscape, July–August 2026Телеметрия корпоративных сетей и доля промптов с высоким риском утечки.
  3. Check Point Research AI Security Report 2025Данные о высокорисковых и потенциально чувствительных запросах к GenAI.
  4. Harmonic Security: GenAI in the EnterpriseИсследование более 3 млн промптов и файлов в 300 AI-инструментах.
  5. Microsoft Research: participant-aware access controlИсследование рисков извлечения данных из корпоративных LLM-систем.
  6. OWASP GenAI Security Project: System Prompt LeakageРекомендации по исключению секретов из системных промптов и дизайну контроля.