ИИ-агент вышел из-под контроля · Часть 3, финал
Яндекс выпустил инструкцию, как не дать ИИ-агенту натворить бед. Я сверил с ней свою защиту и нашёл 5 дыр

Как обещал, разбираю документ Яндекса и делюсь своим скиллом защиты.
Скилл в Claude Code это файл-инструкция: как ИИ должен выполнять определённую работу. Лежит в папке `~/.claude/skills/`, и Claude сам подхватывает его, когда задача подходит. Мой учит его проверять безопасность.
Что за документ
AI-SAFE (AI Secure Agentic Framework Essentials) выпустила команда безопасности Yandex Cloud в сентябре 2025 года. Это 29 страниц про угрозы для ИИ-агентов, то есть программ, которые не просто отвечают на вопросы, а сами действуют: читают файлы, ходят в интернет, запускают команды. Документ открытый, на русском и бесплатный.
Скачать AI-SAFE v1.0 с сайта Yandex Cloud (PDF, 12,5 МБ)
Угрозы разложены по пяти уровням:
- Интерфейс: что агент получает на вход и что выдаёт. Здесь живёт промпт-инъекция, про неё была прошлая часть.
- Исполнение и инструменты: что агенту разрешено запускать и трогать.
- Инфраструктура и оркестрация: где агент работает и как общается с другими агентами.
- Ядро и логика: как агент рассуждает и планирует, не зацикливается ли.
- Данные и знания: к каким данным у агента есть доступ и не отравлены ли они.
В конце документа практический чек-лист из 15 пунктов и каталоги угроз от OWASP. Половина пунктов привязана к продуктам Яндекса, но суть у них общая для любого, кто пускает ИИ к своим делам.

В сентябре 2026 года вышла версия 2.0, атлас со связями между угрозами, слабыми местами и мерами защиты. Её выдают по заявке на странице AI-SAFE.
Что из него стоит запомнить
- В письмах, документах и на сайтах могут лежать команды для ИИ. Всё, что агент прочитал снаружи, для него данные, а не приказы.
- Результату ИИ не доверять вслепую: проверять код и данные до того, как пустить дальше.
- У агента должны быть лимиты: на время, на число шагов, на деньги. Иначе он может зациклиться и сжечь бюджет.
- Агент должен вести журнал: что прочитал, что вызвал, что записал. Без журнала не разобрать, что случилось.
- Доступ только к тем данным, которые нужны для задачи. Личные данные людей лишний раз в нейросеть не отправлять.
- Агента, который запускает код, держать в изолированной «песочнице».
- Всё необратимое (удалить, отправить письмо, заплатить) только после подтверждения человеком.
Моя проверка на прочность
У меня есть скилл security-check. По нему ИИ проверяет каждый новый скилл, подключение и агента перед тем, как я начну им пользоваться. И каждый чужой документ (PDF, письмо, таблицу) перед тем, как его пересказать: нет ли там скрытого текста и команд. Это 31 проверка в семи разделах. Собирал я его ещё летом, как раз по этому документу Яндекса.
На днях сверил заново, пункт за пунктом. Нашёл 5 дыр.

Песочница. Самая обидная. Ровно на ней мой агент прогулялся по компьютеру в первой части: список «разрешённых инструментов» оказался не забором. Урок я тогда записал в память, а в саму проверку не внёс.
Лимиты. У фонового агента должен быть потолок по времени и шагам, а цикл, который ходит во внешний сервис, должен делать паузы. Однажды без этого у меня набежало 223 запроса к соцсети за три с половиной часа и блокировка на сутки.
Журнал. Что агент делал, должно записываться. Иначе на вопрос «что он трогал» ответить нечем.
Личные данные. Если скилл отправляет данные клиентов (заявки, телефоны, письма) в сторонний сервис, он отправляет только то, что нужно для задачи.
Цепочка поставок. Чужой скилл, подключение или пакет из интернета перед установкой нужно прочитать целиком и не запускать установку вслепую.
Все пять теперь закрыты.
Делюсь скиллом
Скилл выложен файлом, очищенным от моих путей и названий:
Как поставить:
- Создайте папку `~/.claude/skills/security-check/`.
- Положите туда файл `SKILL.md`.
- Перезапустите Claude Code.
Дальше скилл сам срабатывает после создания или правки других скиллов, подключений (MCP-серверов) и агентов. Ещё его можно позвать фразой «прогони security-check по …» или проверить им входящий документ.
Одно правило из него же: прежде чем ставить чужой скилл, прочитайте его целиком. Мой тоже.

На этом серия про безопасность закончена. Спасибо, что читали.
В следующей серии разберу мифы об искусственном интеллекте. Начну с самого живучего: что с ИИ можно делать только несерьёзные проекты.
Понравился разбор?
Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?