Чек-лист: как создать ИИ-агента для ресёрча за семь шагов

Главное за 30 секунд
- Главная ошибка: верить отчёту агента о его собственной проверке. Приёмку запускает человек, отдельной командой.
- Критерий приёмки должен уметь провалиться. «Хорошо написано» — не критерий, «ровно пять тем» — критерий.
- Формат выхода решается до промпта, а не после. Иначе агент отдаёт стену текста.
- Одна оценка без цикла переделок экономит больше, чем выбор модели подешевле.
- Проверка, которая не падает на сломанном входе, не существует. Ломайте нарочно.
Агент-ресёрч — это исполнитель, который ищет информацию по заданию, отбирает нужное и складывает результат в заданном формате. Каждое утро, по расписанию, без участия человека.
Собрать такого можно за один заход. Сложность не в сборке, а в том, чтобы результату можно было доверять. Ниже семь шагов, которые эту разницу и создают. Пропущенный шаг возвращается красивым отчётом, которому нельзя верить.
1. Одна задача, одно предложение
Опишите, что должно стать правдой после работы агента.
Каждое утро в файле лежат пять свежих тем с рабочей ссылкой и готовым углом подачи.
Если формулировка не помещается в предложение, это две задачи. Их надо разделить и делать двумя агентами.
2. Формат выхода решается до промпта
Определите, что именно агент вернёт, и опишите структуру заранее.
Один файл. Пять блоков. В каждом: что произошло и ссылка, угол подачи, почему это важно вашей аудитории.
Без этого шага агент отдаёт стену текста, и разбирать её приходится руками. Экономия на описании формата оборачивается ежедневной ручной работой.
3. Критерии приёмки: бинарные, три-пять штук
Каждый критерий должен уметь провалиться. «Хорошо написано» проверке не поддаётся. «Ровно пять тем» поддаётся.
- ровно пять тем;
- у каждой рабочая ссылка на первоисточник, не выдуманная;
- у каждой угол подачи, а не пересказ новости;
- у каждой строка «почему это важно»;
- ничего старше суток.
Критерий, который нельзя провалить, не существует. Он выглядит как проработка, а работает как пожелание.
4. Модель и потолок расхода
- модель берётся самая дешёвая из подходящих, дорогая — как исключение под конкретную задачу;
- одна оценка без цикла переделок: иначе агент крутится и жжёт бюджет;
- потолок числа вызовов и потолок расхода задаются числом, а не намерением.
Ресёрч — это поиск и отбор, а не сложное рассуждение. Дорогая модель здесь редко окупается.
5. Запреты пишутся в промпт прямым текстом
- не выдумывать факты, цифры и ссылки;
- не выдавать старое за новое;
- ничего никуда не публиковать, только черновик в файл;
- не выходить за названные папки и адреса.
Запрет, которого нет в промпте, рано или поздно будет нарушен. Это не про недобросовестность модели, а про то, что не описанное поведение остаётся на её усмотрение.
6. Кто проверит результат — решается до запуска
Нужна одна команда, дающая однозначный ответ «прошло» или «не прошло». Например, поиск по файлу, который обязан ничего не найти.
Проверку запускает человек, а не агент. Слова исполнителя о собственной проверке не принимаются ни в каком виде: ни «всё в порядке», ни «найдено ноль», ни числа.
Живой случай. Агент вычистил формулировку из документов и отчитался: финальная проверка нашла ноль совпадений. Внешний скрипт нашёл ещё около двадцати мест, включая текст на сайте. Агент не обманывал — он прогнал поиск по более узкой папке, чем было в задании, и честно доложил результат этого поиска.
Если приёмочную команду придумать не получается, задача поставлена плохо. Её надо переформулировать до запуска, а не после.
7. Живой прогон и мутация
Живой прогон — настоящий запуск на настоящих данных. Не заглушка и не «команда не упала».
Мутация — сломать нарочно и убедиться, что проверка упала. Починить и убедиться, что прошла.
Проверка, которая не падает на сломанном входе, не существует. Она даёт спокойствие, но не даёт правды.
Три ошибки, которые стоят дороже всего
| Ошибка | Как выглядит | Чем лечится |
|---|---|---|
| Агент выдумал числа | «замерить не смог» и рядом три правдоподобные цифры | доказательство файлом, а не текстом отчёта |
| Агент проверил не всё | «найдено ноль», а на деле два десятка вхождений | точный список папок в задании и проверка отдельным скриптом |
| Проверка не умела падать | зелёный результат на заведомо сломанном коде | мутационный прогон обязателен |
Короткая версия
- Задача в одно предложение
- Формат выхода
- Бинарные критерии приёмки
- Дешёвая модель, одна итерация, потолок расхода
- Запреты прямым текстом
- Приёмочная команда, которую запускает человек
- Живой прогон и мутация
Скачать чек-лист в PDF — две страницы, удобно распечатать и держать рядом.
Что дальше
Чек-лист не делает агента умнее. Он делает результат проверяемым, и на практике это оказывается полезнее.
Если нужен агент под конкретную задачу — поиск клиентов, разбор заявок, ежедневный обзор рынка — напишите, разберём вашу задачу и скажем, решается ли она агентом или проще обойтись без него.
KrutMaxAI
ИИ в жизни и в работе. Разбираем агентов на живых примерах: что работает, что ломается и сколько это стоит на самом деле. Без обещаний, которые нельзя проверить.
Хотите такую же автоматизацию у себя? Расскажите о задаче — ответим, что можно поручить ИИ-агентам уже сейчас.
Часто задаваемые вопросы
Зачем нужен отдельный агент для ресёрча, если можно просто спросить нейросеть?
Разовый вопрос даёт разовый ответ. Агент работает по расписанию, с одинаковой структурой выхода и с проверкой источников. Разница видна на второй неделе: у агента накапливается сравнимая по формату история, у разовых запросов — разрозненные ответы.
Агент может выдумать данные?
Да, и это главная опасность. Известный случай: агент написал «замерить не смог» и в том же ответе привёл три правдоподобных числа. Лечится запретом в промпте и внешней проверкой, которую запускает человек, а не сам агент.
Какую модель брать для агента-ресёрча?
Самую дешёвую из подходящих. Ресёрч — это поиск и отбор, а не сложное рассуждение. Дорогая модель берётся как исключение, под конкретную задачу, где дешёвая доказанно не справилась.
Что такое критерий приёмки, который умеет провалиться?
Условие, которое можно проверить командой и получить однозначный ответ «да» или «нет». «Ровно пять тем», «у каждой рабочая ссылка», «ничего старше суток». Формулировка вроде «качественный обзор» проверке не поддаётся и потому критерием не является.