Слово «агент» за последний год налипло на всё подряд. Агентом называют чат-бота в поддержке, надстройку над таблицей и рассылку по расписанию. Из-за этого возникает ощущение, что термин пустой и придуман для продаж. Он не пустой. За ним стоит одно конкретное отличие, и его видно невооружённым глазом, если знать, куда смотреть.
Разберу без терминов: что такое агент, чем он отличается от чата и от ассистента, из чего состоит и где ломается. Пишу по своей ежедневной работе с агентами, а не по обзорам.
Одно отличие, из которого следует всё остальное
ИИ-агент — это языковая модель, помещённая в повторяющийся круг и снабжённая инструментами.
Круг состоит из четырёх шагов. Получить задачу. Решить, какое действие сделать. Сделать его — открыть файл, поискать в сети, запустить проверку. Посмотреть на результат и решить: задача выполнена или нужен ещё один заход.
И вот последний шаг — это всё. Чат отвечает и останавливается: дальше ход ваш. Агент смотрит на то, что у него вышло, видит, что вышло плохо, и заходит на второй круг сам. Потом на третий. Пока не сделает или пока не упрётся.
Отсюда и все остальные отличия. Раз агент действует, ему нужны руки — инструменты. Раз он идёт по кругу, ему нужно помнить, что было на прошлом шаге, — память. Раз он работает без вас, ему нужны границы — что можно, а чего нельзя ни при каких условиях.
Чем агент отличается от ассистента
Это самая частая путаница, и различие тут не техническое, а про то, у кого в руках нить задачи.
ИИ-ассистент — это помощник внутри вашей работы. Он подсказывает, предлагает варианты, пишет черновик, отвечает на вопрос. Работу при этом делаете вы, а он стоит рядом. После каждой его реплики ход снова ваш: посмотреть, оценить, попросить иначе.
Агент забирает работу целиком. Вы ставите задачу и уходите. Он сам решает, из скольких шагов она состоит, сам их выполняет, сам ловит свои ошибки и возвращается с результатом — или с сообщением, что не смог и почему.
Практическая проверка простая: посчитайте, сколько раз вы вмешиваетесь между постановкой задачи и результатом. Каждый ход — ассистент. Ни разу — агент. И между ними целая шкала, на которой стоит большинство реальных инструментов.
Из чего агент состоит
Пять частей. Их полезно знать, потому что ломается всегда конкретная, а не «ИИ вообще».
Модель — мыслящая часть. Она рассуждает, формулирует, решает, что делать дальше. Её вы арендуете помесячно и можете заменить на другую.
Инструменты — руки. Чтение и запись файлов, поиск в интернете, запуск программ, обращение к чужим сервисам. Без инструментов модель остаётся собеседником: она может рассказать, как сделать, но не может сделать.
Свод правил — должностная инструкция. Кто он, для кого работает, каким тоном, чего не делает никогда. Это обычный текст, и пишете его вы. От качества этого текста результат зависит сильнее, чем от выбора модели, — и это, пожалуй, самое неочевидное во всей теме.
Цикл — тот самый механизм повторения шагов. Он же решает, когда остановиться: задача сделана, или попытки исчерпаны, или агент упёрся в границу, которую ему поставили.
Память — способ не терять нить. Часть её живёт в текущей переписке, часть записывается в файлы, чтобы пережить перезапуск. Про устройство программы, которая всё это собирает воедино, есть отдельный разбор про обвязку.
Где агенты ломаются
Три поломки, с которыми сталкивается каждый, кто работает с агентами дольше недели. Ни одна не лечится более мощной моделью.
Зацикливание. Агент выбрал подход, подход не работает, а он повторяет его снова и снова с мелкими вариациями. Со стороны выглядит как усердие, по сути — как человек, который дёргает запертую дверь. Лечится ограничением числа попыток и прямым указанием: не вышло дважды — остановись и скажи.
Уверенная выдумка. Агент сообщает несуществующий факт тем же ровным тоном, что и проверенный. Это свойство самой технологии, а не брак конкретного продукта. Лечится тем, что вы требуете источник на каждое утверждение и отделяете «я проверил» от «я предполагаю». В моей работе это правило записано отдельным пунктом и проверяется на каждом ответе.
Потеря нити. В длинной задаче рабочая переписка переполняется, старое начинает вытесняться, и агент забывает, о чём договорились в начале. Лечится не уговорами, а гигиеной: одна задача — один разговор, важное складывается в файлы, а не держится в переписке.
Что агент реально умеет сегодня
Скажу осторожно, потому что тема перегрета обещаниями с обеих сторон.
Хорошо получается работа, которая состоит из текста и файлов, имеет проверяемый результат и повторяется. Разобрать выгрузку и найти закономерность. Переупаковать материал под другую площадку. Свести десяток источников в один документ. Проверить готовый текст по списку правил. Собрать и вести базу знаний.
Плохо получается всё, где нет способа проверить результат внутри самой задачи. Придумать стратегию. Решить, что важно. Оценить, зайдёт ли текст живому человеку. Здесь агент производит гладкую убедительную поверхность, и отличить хорошее от плохого можете только вы.
Отсюда рабочая рамка, к которой я пришла: агенту отдаётся исполнение, за собой остаётся постановка задачи и приёмка. Смещение в любую сторону ломает результат. Отдали приёмку — получили красивую пустоту. Забрали исполнение — вернулись к ручной работе и не поняли, зачем всё это было.
Коротко
Агент отличается от чата одной стрелкой, замыкающей круг: он смотрит на собственный результат и решает, идти ли на второй заход. От ассистента отличается тем, у кого в руках нить задачи. Состоит из модели, инструментов, правил, цикла и памяти, а ломается всегда в конкретной части, а не «в ИИ вообще». И работает тем лучше, чем точнее вы поставили задачу, — качество правил решает больше, чем выбор модели.
Как записываются те самые правила, чтобы агент подхватывал их сам, разобрано в материале про скиллы.