Главная → Блог → ИИ-агент вышел из-под контроля

ИИ-агент вышел из-под контроля · Часть 3, финал

Яндекс выпустил инструкцию, как не дать ИИ-агенту натворить бед. Я сверил с ней свою защиту и нашёл 5 дыр

8 октября 2026Кирилл Кривицкий
Яндекс выпустил инструкцию, как не дать ИИ-агенту натворить бед. Я сверил с ней свою защиту и нашёл 5 дыр

Как обещал, разбираю документ Яндекса и делюсь своим скиллом защиты.

Скилл в Claude Code это файл-инструкция: как ИИ должен выполнять определённую работу. Лежит в папке `~/.claude/skills/`, и Claude сам подхватывает его, когда задача подходит. Мой учит его проверять безопасность.

Что за документ

AI-SAFE (AI Secure Agentic Framework Essentials) выпустила команда безопасности Yandex Cloud в сентябре 2025 года. Это 29 страниц про угрозы для ИИ-агентов, то есть программ, которые не просто отвечают на вопросы, а сами действуют: читают файлы, ходят в интернет, запускают команды. Документ открытый, на русском и бесплатный.

Скачать AI-SAFE v1.0 с сайта Yandex Cloud (PDF, 12,5 МБ)

Угрозы разложены по пяти уровням:

  1. Интерфейс: что агент получает на вход и что выдаёт. Здесь живёт промпт-инъекция, про неё была прошлая часть.
  2. Исполнение и инструменты: что агенту разрешено запускать и трогать.
  3. Инфраструктура и оркестрация: где агент работает и как общается с другими агентами.
  4. Ядро и логика: как агент рассуждает и планирует, не зацикливается ли.
  5. Данные и знания: к каким данным у агента есть доступ и не отравлены ли они.

В конце документа практический чек-лист из 15 пунктов и каталоги угроз от OWASP. Половина пунктов привязана к продуктам Яндекса, но суть у них общая для любого, кто пускает ИИ к своим делам.

Документ раскладывает угрозы для ИИ-агентов по пяти уровням и завершается практическим чек-листом
Документ раскладывает угрозы для ИИ-агентов по пяти уровням и завершается практическим чек-листом

В сентябре 2026 года вышла версия 2.0, атлас со связями между угрозами, слабыми местами и мерами защиты. Её выдают по заявке на странице AI-SAFE.

Что из него стоит запомнить

  • В письмах, документах и на сайтах могут лежать команды для ИИ. Всё, что агент прочитал снаружи, для него данные, а не приказы.
  • Результату ИИ не доверять вслепую: проверять код и данные до того, как пустить дальше.
  • У агента должны быть лимиты: на время, на число шагов, на деньги. Иначе он может зациклиться и сжечь бюджет.
  • Агент должен вести журнал: что прочитал, что вызвал, что записал. Без журнала не разобрать, что случилось.
  • Доступ только к тем данным, которые нужны для задачи. Личные данные людей лишний раз в нейросеть не отправлять.
  • Агента, который запускает код, держать в изолированной «песочнице».
  • Всё необратимое (удалить, отправить письмо, заплатить) только после подтверждения человеком.

Моя проверка на прочность

У меня есть скилл security-check. По нему ИИ проверяет каждый новый скилл, подключение и агента перед тем, как я начну им пользоваться. И каждый чужой документ (PDF, письмо, таблицу) перед тем, как его пересказать: нет ли там скрытого текста и команд. Это 31 проверка в семи разделах. Собирал я его ещё летом, как раз по этому документу Яндекса.

На днях сверил заново, пункт за пунктом. Нашёл 5 дыр.

Повторная сверка своей проверки с документом пункт за пунктом нашла в ней пять дыр
Повторная сверка своей проверки с документом пункт за пунктом нашла в ней пять дыр

Песочница. Самая обидная. Ровно на ней мой агент прогулялся по компьютеру в первой части: список «разрешённых инструментов» оказался не забором. Урок я тогда записал в память, а в саму проверку не внёс.

Лимиты. У фонового агента должен быть потолок по времени и шагам, а цикл, который ходит во внешний сервис, должен делать паузы. Однажды без этого у меня набежало 223 запроса к соцсети за три с половиной часа и блокировка на сутки.

Журнал. Что агент делал, должно записываться. Иначе на вопрос «что он трогал» ответить нечем.

Личные данные. Если скилл отправляет данные клиентов (заявки, телефоны, письма) в сторонний сервис, он отправляет только то, что нужно для задачи.

Цепочка поставок. Чужой скилл, подключение или пакет из интернета перед установкой нужно прочитать целиком и не запускать установку вслепую.

Все пять теперь закрыты.

Делюсь скиллом

Скилл выложен файлом, очищенным от моих путей и названий:

Скачать SKILL.md (18 КБ)

Как поставить:

  1. Создайте папку `~/.claude/skills/security-check/`.
  2. Положите туда файл `SKILL.md`.
  3. Перезапустите Claude Code.

Дальше скилл сам срабатывает после создания или правки других скиллов, подключений (MCP-серверов) и агентов. Ещё его можно позвать фразой «прогони security-check по …» или проверить им входящий документ.

Одно правило из него же: прежде чем ставить чужой скилл, прочитайте его целиком. Мой тоже.

Прежде чем ставить чужой скилл, его нужно прочитать целиком, и этот тоже
Прежде чем ставить чужой скилл, его нужно прочитать целиком, и этот тоже

На этом серия про безопасность закончена. Спасибо, что читали.

В следующей серии разберу мифы об искусственном интеллекте. Начну с самого живучего: что с ИИ можно делать только несерьёзные проекты.

Понравился разбор?

Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?

← Все материалы