Темы
Статьи темы
Новые сверху
Яндекс выпустил инструкцию, как не дать ИИ-агенту натворить бед. Я сверил с ней свою защиту и нашёл 5 дыр
Разбор открытого документа Yandex Cloud AI-SAFE о безопасности ИИ-агентов: пять уровней угроз и практический чек-лист. Как я сверил с ним свой скилл защиты для Claude Code, нашёл пять дыр и закрыл их. Скилл security-check можно скачать.
В этом письме может быть невидимая команда для вашего ИИ. И в этом резюме. И даже в научной статье
Реальные случаи скрытых команд для ИИ (промпт-инъекций) с источниками: научные статьи с белым текстом для ИИ-рецензентов, резюме, письма, комментарии в коде, ИИ-браузер. Как нам в рассылке посоветовали спрятать подсказки для нейросетей на сайте и как защищаюсь я.
ИИ-агент выполнил команду, которую я ему не разрешал. И это была только половина
Как проба с файлами-приманками показала, что список «разрешённых инструментов» в Claude Code не ограничивает агента: он выполнил запрещённую команду, прочитал чужие файлы и записал файл в автозагрузку. Как агента заперли по-настоящему и почему защиту проверяют по следам, а не по настройкам.
Как поймать ИИ на выдумке. 5 вопросов, которые я теперь задаю ему каждый раз
Итоги серии про ошибки ИИ-агента: почему он уверенно сочиняет, принимает пустоту за ответ и обещает то, чего не сделает. Пять вопросов, которые помогают поймать выдумку, и правила, чтобы она не повторялась.
«Мне кажется, ты врёшь». Что сочиняет мой ИИ-агент
Четыре реальных случая, когда ИИ-агент уверенно сочинял: коллеги «не заходили» в систему, цены «актуальны», отдел продаж «в доме», чувства, которых не было. Откуда берутся такие выдумки и почему они звучат убедительнее правды.
Самый вежливый лжец в моей команде сидит у меня в компьютере
ИИ-агент каждый день обещал «завтра проверю» и ни разу не проверил сам. Почему так происходит, чем опасно убедительное обещание и как его заменили задачей по расписанию, которая срабатывает без напоминаний.
Стоп-краны для ИИ: какие предохранители я поставил и зачем они срабатывали
Человек ошибается один раз, программа повторит ошибку тысячу раз. Две аварии, после которых появились предохранители, полный список стоп-кранов в рекламе, публикациях, выкате сайта и у агентов, и правило не верить сервису на слово.
Ключи от сервисов для ИИ: к чему его подключить и как не потерять доступы
Нейросеть в чате умеет только разговаривать. Что меняется, когда у неё появляются ключи от рабочих сервисов, к чему подключён ИИ у меня и какие правила защиты ключей стоит завести сразу.
Почему 90% автоматизаций проваливаются — и как не попасть в это число
Автоматизация — модное слово, под которым прячется кладбище брошенных проектов. Разбираю пять причин, по которым «давайте всё автоматизируем» заканчивается ничем, и как сделать иначе.
О чём эта тема
ИИ ошибается не как человек: уверенно, вежливо и столько раз подряд, сколько его запустят. Здесь случаи из моей работы. Агент сочинял факты, каждый день обещал «завтра проверю», выполнил команду, которую я не разрешал. И что я ставил после каждого случая: стоп-краны, правила, проверку по следам, а не по словам.
Тема нужна всем, кто даёт ИИ доступ к рабочим сервисам, почте или деньгам.
Если читать с нуля, начните с этих трёх
- Самый вежливый лжец в моей команде сидит у меня в компьютере: с этого началась серия про ошибки агента.
- Стоп-краны для ИИ: какие предохранители стоят и после каких аварий они появились.
- В этом письме может быть невидимая команда для вашего ИИ: скрытые команды на реальных примерах.