Два тренда встретились. Бизнес массово подключает большие языковые модели к рабочим процессам, а спрос за утечки ужесточился. Утечка данных через LLM открывает каналы, которых раньше не было. Разберём, где именно бизнес теряет данные через языковые модели и как эти каналы закрыть.
Что считается утечкой данных из LLM
Утечка происходит, когда чувствительная, конфиденциальная или регулируемая информация раскрывается без нужного разрешения. Как правило, это происходит так: сотрудник вставляет данные в промпт, модель извлекает закрытую информацию из подключённых систем, чувствительные данные попадают в ответ, логи переписки и обучающие выборки хранятся без защиты.
По отчёту IBM Cost of a Data Breach за 2025 год, около 13% организаций сообщили об утечках с участием ИИ-моделей, и 97% из них назвали причиной недостаточный контроль доступа к ИИ. То есть в подавляющем большинстве случаев дело не в изощрённой атаке, а в открытых воротах.
По оценке Gartner, к 2027 году более 40% утечек данных, связанных с ИИ, будут вызваны неправомерным трансграничным использованием генеративного ИИ: внедрение GenAI опережает развитие управления данными и мер безопасности. По опросу Gartner (май — ноябрь 2025), 57% сотрудников используют для работы личные аккаунты в генеративном ИИ, а треть признались, что загружали чувствительную информацию в неодобренные компанией инструменты.
Как утечка данных через LLM выглядит в отраслях
Опасность проще увидеть на конкретных сценариях. Зачастую они выглядят как обычная работа:
- В банке аналитик загружает в чат-бот выгрузку по клиентам, чтобы быстро подготовить отчёт. Вместе с цифрами наружу уходят ФИО, номера счетов и контакты.
- В ритейле маркетолог отдаёт модели базу лояльности для сегментации рассылки, и персональные данные покупателей оказываются на внешнем сервере.
- На производстве инженер просит модель проверить участок кода АСУ ТП, а вместе с кодом раскрывает детали технической архитектуры.
- Юрист загружает договор с контрагентом, чтобы получить краткое содержание, и коммерческие условия сделки покидают периметр компании.
Каждое действие вписывается в повседневные задачи и выглядит безобидно. Но если данные обрабатываются, хранятся, извлекаются или раскрываются вне утверждённых правил, компания получает риски по безопасности, приватности, договорным обязательствам и регуляторике.
Как контролировать каналы утечки
Защита строится на контроле того, как данные входят в инфраструктуру, движутся и выходят из ИИ-систем.
Что необходимо настроить
- Политики использования ИИ. Зафиксируйте, что можно и нельзя вводить в LLM, какие инструменты одобрены, кто отвечает за ревью. Это ограничивает Shadow AI (теневой ИИ), который часто становится причиной утечек.
- Классификация данных. До подключения LLM найдите и разметьте чувствительные данные во всей инфраструктуре.
- Минимизация. Модель получает минимум данных под задачу. Обезличенная версия вместо полной клиентской базы снижает последствия утечки.
- Контроль доступа. Нет прав на документ вне LLM – нет и внутри. Ролевая модель, наименьшие привилегии, регулярный пересмотр прав.
- Защита RAG и коннекторов. Пайплайны должны следовать существующим правам и возвращать только уместную информацию. Каждый коннектор нужно проверять на права, объём данных и аутентификацию.
Как защитить LLM от утечки данных на практике
Каналов утечки, как мы писали выше, много, поэтому частичные меры не работают. Одной проверкой доступа задача не решается, если обучающие данные лежат в открытом виде, а среда выполнения не изолирована.
Наполеон Гейт: LLM-шлюз, который защищает от утечки данных
Каналы утечки закрывает отдельный слой инфраструктуры между сотрудниками и языковыми моделями. Наполеон Гейт работает как LLM-шлюз: весь трафик к моделям проходит через одну контролируемую точку. Шлюз логирует каждый запрос, фильтрует чувствительные данные на уровне DLP до отправки в модель и разграничивает права по ролям. Решение отвечает требованиям 152-ФЗ и приказа ФСТЭК №117, модуль распознавания чувствительных данных работает в закрытом контуре, который как раз и не выпускает данные наружу в модели
Как устроено решение, мы описали в отдельной статье про Наполеон Гейт. Ниже – небольшое сравнение, какие задачи решает шлюз.

Так схематично выглядит процесс работы Наполеон Гейт: весь трафик к LLM проходит через контролируемый шлюз.

Цена утечки: регуляторика
Утечка данных из LLM создаёт серьёзные проблемы с комплаенсом. Компании важно не только то, что данные утекли. Важен и сам механизм: как их собирали, обрабатывали, хранили и раскрывали. Утечка говорит о провале контроля на этом уровне.
В России цена утечки данных выросла напрямую. Оборотные штрафы за утечки персональных данных заменили символические взыскания, которые бизнес закладывал в операционные расходы. Утечка запускает цепочку обязательств: уведомление об инциденте, план реагирования, аудит. Если LLM раскрыла клиентские записи, данные сотрудников, медицинские или финансовые данные, компания оценивает, квалифицируется ли инцидент как утечка персональных данных, и какие обязанности из этого следуют.
В регулируемых отраслях последствия жёстче. Медицинские и финансовые организации защищают данные административными, физическими и техническими мерами. Если LLM раскрывает такие данные без защиты, компания сталкивается с нарушениями по приватности и по безопасности одновременно.
Частые вопросы об утечке данных через LLM
Какие данные утекают через LLM чаще всего
Чаще всего наружу уходят персональные данные клиентов и сотрудников, исходный код, учётные данные и API-ключи, финансовая информация и коммерческая тайна. Самый высокий риск несут регулируемые данные: медицинские, биометрические, финансовые, данные детей. Их утечка запускает юридические и договорные последствия.
Безопасно ли загружать конфиденциальные данные в публичные ИИ-сервисы
Нет. Данные, отправленные в публичный сервис, попадают на внешние серверы, сохраняются в логах и могут использоваться для обучения модели. Удалить их оттуда практически невозможно. Для работы с конфиденциальной информацией нужна модель в закрытом контуре и контроль трафика к внешним ИИ-сервисам.
Запоминает ли LLM персональные данные
Да, если персональные данные попали в обучающую или дообучающую выборку, модель способна воспроизвести их в будущих ответах.
Решаете похожую задачу по безопасности LLM? Расскажите о проекте, обсудим, как закрыть каналы утечки под ваши требования.
.png)


