Мой блог
«Copilot видит только то, к чему у пользователя есть доступ»: почему это главный источник утечек данных
Когда в компании заходит речь об интеграции Microsoft 365 Copilot, системные администраторы и специалисты по информационной безопасности первым делом изучают документацию по правам доступа. Главный тезис вендора звучит безупречно: ИИ-ассистент обращается исключительно к той информации, на просмотр которой у конкретного пользователя уже есть официальные разрешения. Казалось бы, можно выдохнуть. Однако именно в этой буквальности и таится серьезный подвох, с которым я регулярно сталкиваюсь при аудите корпоративных систем и настройке нейросетевых инструментов.
Что именно обещает официальная документация Microsoft
Справка вендора, посвященная архитектуре и конфиденциальности Copilot, четко определяет границы работы искусственного интеллекта. Ассистент не обладает сквозной видимостью всего тенанта Microsoft 365. Любой запрос к данным строго ограничен правами учётной записи, под которой авторизовался сотрудник.
Технически это реализовано через механизм Semantic Index: процесс «заземления» (grounding) обращается только к тому контенту, на который у пользователя есть разрешения. Но ключевой нюанс заключается в пороге входа: для того чтобы документ попал в выдачу нейросети, сотруднику достаточно иметь базовое право на просмотр. Как только пользователю доступен просмотр файла, этот документ автоматически становится частью контекста для ИИ.
Где обещание перестаёт утешать: проблема accidental oversharing
Сама по себе концепция соблюдения прав идеальна. Проблема скрывается в том, как эти права распределены в реальности. В руководствах по подготовке к внедрению Copilot прямо указано: по умолчанию SharePoint устанавливает максимально либеральные параметры совместного доступа (sharing settings).
Когда я тестировал и настраивал Copilot для сквозного поиска по экосистеме — через почту, чаты Teams, хранилища OneDrive и документы SharePoint, — ассистент мгновенно собирал релевантные выжимки из десятков источников. Но ровно по той же схеме нейросеть поднимает файлы, ссылки на которые когда-то давно были случайно расшарены на всю компанию. В терминологии Microsoft это называется accidental oversharing (непреднамеренное избыточное предоставление доступа). Нейросеть не взламывает защиту, она просто мгновенно находит то, о чём люди давно забыли, но где формально оставлены открытые права.
Инструменты аудита прав перед запуском ИИ
Чтобы предотвратить потенциальные утечки до включения ассистента, в экосистеме Microsoft предусмотрен специализированный инструментарий для администраторов. Из практики выделю основные средства аналитики:
- Content Management Assessment — автоматизированный модуль, анализирующий структуру контента и предоставляющий практические рекомендации по выявлению потенциально «перерасшаренных» документов.
- Отчёты Data Access Governance (DAG) — инструмент для локализации сайтов с критическим или избыточно доступным содержимым. Здесь особенно важны два отчёта:
- Site permissions baseline report — детальная карта текущих прав доступа по библиотекам и сайтам;
- Отчёт «Everyone except external users» (EEEU) — список из 100 популярных сайтов, к которым открывался доступ для всех внутренних пользователей за последние 28 дней.
Важная оговорка: окно в 28 дней и лимит в 100 сайтов — это лишь оперативный срез, а не полная инвентаризация тенанта. Документ, расшаренный на всю компанию пять недель назад, в этот отчёт уже не попадет. Поэтому я рекомендую выгружать EEEU-отчёты регулярно, сделав это постоянной процедурой аудита.
Два инструмента ограничения, которые легко перепутать
Для изолирования проблемных зон администраторам доступны два механизма, которые часто путают, хотя они решают совершенно разные задачи:
Restricted Access Control (RAC) — жестко урезает физический доступ. Сайт привязывается к конкретным группам безопасности. Если пользователя нет в группе, он полностью теряет доступ к ресурсу и его содержимому, даже если ранее у него были прямые права или действующая ссылка.
Restricted Content Discovery (RCD) — более мягкий инструмент. Он вообще не меняет права доступа пользователей к сайту. Вместо этого он скрывает контент от индексации в Copilot, агентах и общекорпоративном поиске.
Разница здесь принципиальна: если сайт вообще не должен быть доступен сотрудникам вне группы — используем RAC. Если же на сайте завязан действующий бизнес-процесс, но вы не хотите, чтобы эти документы всплывали в подсказках нейросети — включаем RCD. Второй вариант согласовать с владельцами бизнес-департаментов гораздо проще, так как он не ломает привычный рабочий процесс.
Метки чувствительности: что подтверждено, а что остается домыслом
Официальные материалы по безопасности Microsoft Purview Information Protection подтверждают, что Copilot учитывает права использования, заложенные в зашифрованных файлах (через метки чувствительности или IRM).
В документации присутствует важный практический тезис: шифрование способно заблокировать программный доступ (programmatic access) к файлу, тем самым ограничивая ИИ-ассистента или автономных агентов в чтении содержимого.
Однако не стоит делать поспешных выводов о том, что любая метка чувствительности автоматически «закрывает» файл от нейросети. Проведённый мной анализ документации и тарифных планов показывает: вендор использует формулировки о передаче контекста чувствительности и поддержке меток агентами, но прямых гарантий стопроцентной блокировки без настройки шифрования программного доступа не даёт. В диалоге с отделом ИБ я всегда рекомендую опираться только на подтверждённый факт ограничения программного доступа.
Что остаётся в журналах аудитa после ассистента
После работы ИИ-ассистента в системе остаются детальные журналы. В руководствах по конфиденциальности указано, что хранящиеся данные включают:
- Исходный промпт пользователя;
- Ответ Copilot;
- Точные цитаты и ссылки на первоисточники, использованные для формирования ответа (grounding).
Для администраторов и офицеров безопасности это отличный рабочий материал. Через сервисы Content Search или Microsoft Purview можно четко отследить, к каким именно файлам дотянулся ассистент по запросу конкретного сотрудника. Гипотетические риски превращаются в конкретный список документов с путями к ним. При этом сам пользователь может удалить свою историю запросов через портал My Account, но системный логин на стороне администрирования сохраняется.
Чего документация не говорит: проговорите это до совещания
Готовясь к защите проекта перед руководством или ИБ-департаментом, важно учитывать вопросы, на которые официальные справки Microsoft не дают прямых ответов:
- Отсутствие отраслевой статистики oversharing: В документации риск описан лишь как техническое следствие базовых настроек. Любые цифры про «N% компаний с утечками через ИИ», звучащие на презентациях, — это маркетинговая аналитика сторонних агентств, а не данные вендора.
- Динамика изменения прав на лету: Документация не регламентирует поведение ИИ в ситуации, когда права у пользователя отзываются непосредственно в момент генерации ответа.
- Границы применения Restricted Content Discovery: Полный список объектов за пределами SharePoint (например, специфические структуры в OneDrive), поддерживающих RCD, отдельно не детализирован.
- Отсутствие версионирования справок Learn: Страницы документации Microsoft обновляются без уведомлений и изменения версий. Перед подготовкой регламентов всегда перепроверяйте формулировки.
Кроме того, открытым остаётся практический вопрос задержки синхронизации (лага): через какое точно время после отзыва прав у учётной записи документ перестаёт появляться в цитатах и ответах Copilot.
Боты на серверах Telegram уже доступны — подайте заявку в бету
Пока корпоративный сегмент разбирается с безопасностью ИИ, разработчики экосистемы Telegram получают интересные инфраструктурные обновления. Появилась возможность разворачивать Telegram-ботов непосредственно на серверах мессенджера — без необходимости арендовать сторонние VPS, настраивать Docker-контейнеры и поднимать вебхуки.
Функционал постепенно становится доступен участникам сообщества, а бета-доступ позволяет протестировать серверный запуск ботов без лишних расходов на инфраструктуру и постоянного контроля за серверами.
Источник: habr.com
