Агентство из ИИ · Часть 4
Я построил пульт для ИИ-агентов, а потом понял, что проще сказать одну фразу
После истории с агентством на Paperclip я решил попробовать ещё раз, но уже по-взрослому. В августе поставил другую платформу для агентов, Multica. Она, как и Paperclip, стояла у меня на компьютере, а не в облаке. За 10 дней я достроил к ней свой пульт.
Около 2800 строк кода и 257 тестов. Проработал пульт 25 дней, 29 августа я выключил его вместе с платформой.
Сломалось что-то? Нет. Просто пользоваться им оказалось неудобнее, чем работать без него.
Зачем я его строил
С Paperclip главная беда была в том, что расход не видно, пока не полезешь в цифры. Перед стройкой я сравнил: за неделю по аккаунту ушло 121 миллион токенов, а новая платформа из них видела 64 тысячи. Разница почти в 2000 раз.
Одна учебная задача «расскажи о себе» прогонялась на самой дорогой модели и сожгла 64 тысячи токенов. Хватило бы самой дешёвой.
Платформа расход записывала, но управлять им не умела. Пульт должен был закрыть эту дыру.
Что он умел
- показывал недельный расход по всему аккаунту и прогноз до конца недели;
- раскладывал расход по проектам и ролям;
- держал очередь согласования: агент приносит работу, я жму «взять», «доработать» или «отклонить»;
- публиковал принятое в ВК и Телеграм;
- раз в неделю ставил каждой роли задачу разобрать свои уроки: что пошло не так.
Тормоза
Самой интересной частью были защиты.
Расход во время работы агента не виден нигде: запись о нём появляется за несколько миллисекунд до конца прогона. Поэтому тормоз пришлось делать не по токенам, а по действиям. На 25-м действии агент получает предупреждение, на 40-м следующее действие запрещено.
Ещё 2 предохранителя:
- если одна задача разбудила агента 5 раз, это петля, задачу останавливаем;
- если у роли 10 запусков за 10 минут, это лавина, роль ставим на паузу.
Одну петлю я поймал ещё на стройке. Хотел, чтобы защита оставляла агенту комментарий «стоп». Замер показал: комментарий будит агента через 13 миллисекунд. То есть сам тормоз стал бы педалью газа. От комментариев отказался.
В бою ни петля, ни лавина так и не случились.
Как ставилась задача через пульт
Зайти в интерфейс. Создать карточку. Выбрать агента. Описать задачу так, чтобы он понял без меня. Приложить файлы, которые ему понадобятся. Запустить.
Дальше ждать. Открыть карточку, посмотреть, что получилось. Не то? Написать комментарий. Комментарий будит агента, и он заново перечитывает всю историю задачи. Снова ждать. Снова открыть.
И так по кругу: раскладываешь, перекладываешь, переключаешь статусы.
Как ставится задача сейчас
Открываю папку проекта в Claude Code или VS Code. Говорю голосом: «напиши пост про то-то» или «проверь, что с рекламой за неделю». Всё.
Инструкции, знания по клиенту, прошлые работы уже лежат в этой папке. Прикладывать их к карточке не нужно, исполнитель и так в них сидит.
Не понял задачу? Переспросит тут же, в разговоре. Сделал не так? Говорю «переделай вот это», и он правит сразу, пока всё ещё перед глазами. Без карточек, статусов и ожидания.
Когда я выключал платформу, в ней лежало 32 задачи. 8 из них я перенёс в папки проектов, 7 задач самого пульта отложил, остальные признал мёртвыми.
Что из этого следует
Интерфейс не делает ИИ умнее. Для меня лучший пульт сейчас это папка проекта и разговор. Задача ставится одной фразой, контекст уже на месте, правки идут вживую.
Привычка осталась. Смотреть расход до запуска, а не после, и мерить, а не угадывать.
Может быть, к интерфейсу я ещё вернусь, чуть попозже. А может, и не вернусь. Пока не знаю.
В следующей части расскажу, как устроена папка-исполнитель, в которой ИИ работает у меня каждый день.
Понравился разбор?
Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?