БЛОГ
KrutMaxAIИИ в жизни и в работе

Чек-лист: как создать ИИ-агента для ресёрча за семь шагов

4 мин чтенияKrutMaxAI™ · Микростудия ИИ-автоматизации
Чек-лист: как создать ИИ-агента для ресёрча за семь шагов

Главное за 30 секунд

  • Главная ошибка: верить отчёту агента о его собственной проверке. Приёмку запускает человек, отдельной командой.
  • Критерий приёмки должен уметь провалиться. «Хорошо написано» — не критерий, «ровно пять тем» — критерий.
  • Формат выхода решается до промпта, а не после. Иначе агент отдаёт стену текста.
  • Одна оценка без цикла переделок экономит больше, чем выбор модели подешевле.
  • Проверка, которая не падает на сломанном входе, не существует. Ломайте нарочно.

Агент-ресёрч — это исполнитель, который ищет информацию по заданию, отбирает нужное и складывает результат в заданном формате. Каждое утро, по расписанию, без участия человека.

Собрать такого можно за один заход. Сложность не в сборке, а в том, чтобы результату можно было доверять. Ниже семь шагов, которые эту разницу и создают. Пропущенный шаг возвращается красивым отчётом, которому нельзя верить.

1. Одна задача, одно предложение

Опишите, что должно стать правдой после работы агента.

Каждое утро в файле лежат пять свежих тем с рабочей ссылкой и готовым углом подачи.

Если формулировка не помещается в предложение, это две задачи. Их надо разделить и делать двумя агентами.

2. Формат выхода решается до промпта

Определите, что именно агент вернёт, и опишите структуру заранее.

Один файл. Пять блоков. В каждом: что произошло и ссылка, угол подачи, почему это важно вашей аудитории.

Без этого шага агент отдаёт стену текста, и разбирать её приходится руками. Экономия на описании формата оборачивается ежедневной ручной работой.

3. Критерии приёмки: бинарные, три-пять штук

Каждый критерий должен уметь провалиться. «Хорошо написано» проверке не поддаётся. «Ровно пять тем» поддаётся.

  • ровно пять тем;
  • у каждой рабочая ссылка на первоисточник, не выдуманная;
  • у каждой угол подачи, а не пересказ новости;
  • у каждой строка «почему это важно»;
  • ничего старше суток.

Критерий, который нельзя провалить, не существует. Он выглядит как проработка, а работает как пожелание.

4. Модель и потолок расхода

  • модель берётся самая дешёвая из подходящих, дорогая — как исключение под конкретную задачу;
  • одна оценка без цикла переделок: иначе агент крутится и жжёт бюджет;
  • потолок числа вызовов и потолок расхода задаются числом, а не намерением.

Ресёрч — это поиск и отбор, а не сложное рассуждение. Дорогая модель здесь редко окупается.

5. Запреты пишутся в промпт прямым текстом

  • не выдумывать факты, цифры и ссылки;
  • не выдавать старое за новое;
  • ничего никуда не публиковать, только черновик в файл;
  • не выходить за названные папки и адреса.

Запрет, которого нет в промпте, рано или поздно будет нарушен. Это не про недобросовестность модели, а про то, что не описанное поведение остаётся на её усмотрение.

6. Кто проверит результат — решается до запуска

Нужна одна команда, дающая однозначный ответ «прошло» или «не прошло». Например, поиск по файлу, который обязан ничего не найти.

Проверку запускает человек, а не агент. Слова исполнителя о собственной проверке не принимаются ни в каком виде: ни «всё в порядке», ни «найдено ноль», ни числа.

Живой случай. Агент вычистил формулировку из документов и отчитался: финальная проверка нашла ноль совпадений. Внешний скрипт нашёл ещё около двадцати мест, включая текст на сайте. Агент не обманывал — он прогнал поиск по более узкой папке, чем было в задании, и честно доложил результат этого поиска.

Если приёмочную команду придумать не получается, задача поставлена плохо. Её надо переформулировать до запуска, а не после.

7. Живой прогон и мутация

Живой прогон — настоящий запуск на настоящих данных. Не заглушка и не «команда не упала».

Мутация — сломать нарочно и убедиться, что проверка упала. Починить и убедиться, что прошла.

Проверка, которая не падает на сломанном входе, не существует. Она даёт спокойствие, но не даёт правды.

Три ошибки, которые стоят дороже всего

ОшибкаКак выглядитЧем лечится
Агент выдумал числа«замерить не смог» и рядом три правдоподобные цифрыдоказательство файлом, а не текстом отчёта
Агент проверил не всё«найдено ноль», а на деле два десятка вхожденийточный список папок в задании и проверка отдельным скриптом
Проверка не умела падатьзелёный результат на заведомо сломанном кодемутационный прогон обязателен

Короткая версия

  1. Задача в одно предложение
  2. Формат выхода
  3. Бинарные критерии приёмки
  4. Дешёвая модель, одна итерация, потолок расхода
  5. Запреты прямым текстом
  6. Приёмочная команда, которую запускает человек
  7. Живой прогон и мутация

Скачать чек-лист в PDF — две страницы, удобно распечатать и держать рядом.

Что дальше

Чек-лист не делает агента умнее. Он делает результат проверяемым, и на практике это оказывается полезнее.

Если нужен агент под конкретную задачу — поиск клиентов, разбор заявок, ежедневный обзор рынка — напишите, разберём вашу задачу и скажем, решается ли она агентом или проще обойтись без него.


KrutMaxAI

ИИ в жизни и в работе. Разбираем агентов на живых примерах: что работает, что ломается и сколько это стоит на самом деле. Без обещаний, которые нельзя проверить.

Сайт и все продукты · Telegram-канал · Сообщество ВКонтакте

Хотите такую же автоматизацию у себя? Расскажите о задаче — ответим, что можно поручить ИИ-агентам уже сейчас.

Часто задаваемые вопросы

Зачем нужен отдельный агент для ресёрча, если можно просто спросить нейросеть?

Разовый вопрос даёт разовый ответ. Агент работает по расписанию, с одинаковой структурой выхода и с проверкой источников. Разница видна на второй неделе: у агента накапливается сравнимая по формату история, у разовых запросов — разрозненные ответы.

Агент может выдумать данные?

Да, и это главная опасность. Известный случай: агент написал «замерить не смог» и в том же ответе привёл три правдоподобных числа. Лечится запретом в промпте и внешней проверкой, которую запускает человек, а не сам агент.

Какую модель брать для агента-ресёрча?

Самую дешёвую из подходящих. Ресёрч — это поиск и отбор, а не сложное рассуждение. Дорогая модель берётся как исключение, под конкретную задачу, где дешёвая доказанно не справилась.

Что такое критерий приёмки, который умеет провалиться?

Условие, которое можно проверить командой и получить однозначный ответ «да» или «нет». «Ровно пять тем», «у каждой рабочая ссылка», «ничего старше суток». Формулировка вроде «качественный обзор» проверке не поддаётся и потому критерием не является.