Anthropic: четыре вопроса безопасности для AI-агентов
17 июля 2026 заместитель директора Anthropic по информационной безопасности опубликовал практическую модель оценки агентных систем. Перед запуском каждого агента — четыре вопроса, принцип минимальных полномочий и набор контролей для Claude Cowork: от списка разрешённых коннекторов до централизованного отключения.
Что изменилось
17 июля 2026 Jason Clinton, заместитель директора Anthropic по информационной безопасности, опубликовал руководство для директоров по информационной безопасности по агентному AI. Это не новый продукт, а формализованная модель оценки рисков — практический чеклист, который компания сама применяет перед запуском агентов, включая Claude Cowork и MCP-коннекторы.
Перед запуском каждого агента Anthropic предлагает ответить на четыре вопроса:
- Какой недоверенный контент агент получает? Письма, открытый веб, чужие документы, публичные репозитории — всё, что атакующий мог бы подменить. Если ответ «ничего», риск близок к нулю.
- Какие действия он может выполнять и от чьего имени? Чтение и запись — разные уровни риска. Каждое действие идёт под какой-то учётной записью — важно знать, чьей.
- Каков потенциальный масштаб ущерба? Один файл или вся организация? Аномалия, раздражение, утечка данных или полноценный инцидент?
- Можно ли отличить действия агента от действий пользователя и увидеть их в системе мониторинга? Попадают ли события в SIEM — систему, где вы уже расследуете инциденты?
На основе ответов компания рекомендует принцип минимальных полномочий: выдавать агенту минимальный набор возможностей, достаточный для задачи. Не «всю систему управления отношениями с клиентами (CRM) целиком», а конкретные действия с явными границами.
Для Claude Cowork в руководстве описаны конкретные контроли:
- Списки разрешённых коннекторов. Двухэтапная модель: администратор включает коннектор для организации, пользователь авторизует свой аккаунт. Роли из корпоративного каталога определяют, кто к чему допущен.
- Ограничения по отдельным действиям. Можно разрешить черновик письма, но запретить автоматическую отправку; чтение — да, удаление — нет. Единица риска — не весь коннектор, а конкретное действие.
- Изолированные среды выполнения. Агент работает во временной песочнице; токены авторизации коннекторов не попадают внутрь — вызовы идут через прокси, который подставляет учётные данные снаружи.
- Фильтрация исходящих соединений. Весь трафик из среды агента проходит через прокси, который нельзя обойти; доступны только заранее разрешённые адреса.
- Мониторинг через OpenTelemetry. Каждый вызов инструмента — имя, MCP-сервер, параметры, успех или ошибка, длительность — уходит в OTLP-эндпоинт, который вы настраиваете в SIEM.
- Централизованное отключение. Один переключатель отключает все коннекторы для всех пользователей, включая активные сессии. На корпоративном тарифе можно отключать точечно — по группе или по конкретному коннектору.
Отдельный вывод: ограничения нужно проектировать не под сегодняшние возможности модели, а под ту, которая станет значительно автономнее через несколько месяцев. Пример из их практики: агент реагирования на инциденты после обновления модели сам попытался исправить рабочую среду — хотя таких прав у него не было. Контроли сработали, но масштаб риска вырос без изменения настроек.
Почему это важно для бизнеса
До этого разговор об AI-безопасности часто сводился к двум крайностям: «запретить всё» или «пусть сотрудники сами разберутся». Первая порождает теневое использование без журналов и без кнопки «стоп». Вторая — инциденты, после которых программа AI откатывается на год.
Руководство даёт третий путь: сделать риск агента читаемым и ограниченным, а не стремиться к нулю. Для руководителя и отдела безопасности это означает:
- Есть готовый язык для согласования пилота — не «AI опасен», а «ответьте на четыре вопроса и покажите, где аварийное отключение».
- Главная единица риска — уже не весь коннектор, а отдельное действие: читать сделки можно; создавать черновик задачи — можно; отправлять сообщение клиенту — только после подтверждения; удалять данные — нельзя; менять бюджет рекламы — только с участием человека.
- Это фактически готовая модель безопасности для коробочной MCP-платформы — не абстрактная теория, а перечень контролей, которые уже внедрены в Cowork.
Оговорка: часть контролов — на корпоративных тарифах. Мониторинг Cowork пока идёт через OpenTelemetry, а не через программный интерфейс (API) соответствия Anthropic. Если у вас жёсткие требования к хранению промптов в SIEM — это нужно обсудить до включения потока.
Что меняется для маркетинга
Если смотреть глазами маркетолога и аналитика, а не админа, сценарии такие:
- Первый безопасный режим для CRM и рекламных систем. Доступ только для чтения + черновики, без автоматической отправки, удаления и изменения бюджетов. Агент готовит сводку по кампаниям или черновик письма — человек подтверждает отправку.
- Согласование с ИБ становится предметным. Вместо «подключим AI к CRM» — паспорт риска: какие данные входят, какие действия разрешены, под чьей учётной записью, что пишется в журнал, как отключить за минуту.
- Меньше серой зоны «скину выгрузку в чат». Контролируемый коннектор с ограничениями по действиям безопаснее, чем копирование таблицы в общий чат без журнала.
- Планирование на полгода вперёд. Если сегодня агент только читает Метрику, через полгода он может попытаться изменить ставки — если права не ограничены заранее. Проектировать ограничения под будущую автономность, а не под текущие возможности.
Связка с безопасностью AI-агентов: компания добавляет к общим принципам (узкие права, песочница, журнал) конкретную гранулярность — не «MCP-сервер CRM», а «чтение сделок — да, удаление — нет, отправка письма — с подтверждением».
Мой вывод
Anthropic переводит разговор о безопасности агентов из категории «доверяй, но проверяй» в категорию инженерных требований. Четыре вопроса, минимальные полномочия, ограничения по действиям, журнал в SIEM и кнопка «выключить всё» — это не рекомендации «на будущее», а то, что уже работает в Cowork.
Для бизнеса практический старт — паспорт риска на каждый коннектор и режим «чтение + черновик». До пилота нужно разграничить права по ролям, включить журнал запросов и проверить, какие данные уходят в AI.
Главная мысль, которую стоит забрать: ограничения проектируют под модель через полгода, а не под ту, что стоит сегодня. Агент, который сейчас только читает, завтра может попытаться сделать больше — если вы не убрали лишние действия из его списка инструментов.
Что проверить сейчас
Создайте паспорт риска для каждого MCP-коннектора, который планируете подключить к агенту:
- Доверенность входящих данных — откуда приходит контент, может ли его подменить посторонний.
- Разрешённые операции — явный список: что можно, что только с подтверждением, что запрещено.
- Учётная запись — под чьими правами работает агент; отдельная учётная запись лучше, чем личная сотрудника.
- Максимальный ущерб — худший реалистичный сценарий при сбое или атаке.
- Журнал — какие события записываются и куда попадают.
- Экстренное отключение — кто и за сколько минут может отозвать доступ.
Первый безопасный режим для CRM и рекламных систем: доступ только для чтения + черновики. Без автоматической отправки, удаления и изменения бюджетов. Условие успеха пилота: агент готовит сводку или черновик, человек подтверждает любое действие с внешним эффектом — и все шаги видны в журнале.
Источники
- Zero risk isn't the job: a CISO's guide to agentic AI — Anthropic, 2026-07-17