EVERYONE.
Начните с ограниченных настроек
Оставьте развертывание, передачу диалога и последующие действия отключенными во время создания базовой линии тестирования. Ограничьте аудиторию перед добавлением тестовых получателей. Справочник по API: GET Get Settings · PUT Replace Settings
Считайте действующие настройки после обновления. Изменяйте только одно поведение за раз при тестировании передачи диалога или последующих действий, затем восстанавливайте ограниченную базовую линию перед переходом к другому сценарию.
Добавление тестовых получателей
Оставьте дляai_audience значение ALLOWLISTED_ONLY, затем добавьте каждого тестировщика в виде номера телефона в формате E.164. Сохраните возвращенный id записи списка разрешенных, чтобы позже можно было удалить эту запись.
Справочник по API: GET List Allowlist · POST Create Allowlist Entry · DELETE Delete Allowlist Entry
Запуск одношагового теста
Справочник по API: POST Test Agent
Текущий ответ REST не включает
estimated_token_usage.
Сохранение контекста для многошаговых тестов
Отправьте возвращенныйconversation_id со следующим сообщением клиента.
Справочник по API: POST Test Agent
Тестирование знаний, навыков, коннекторов и инструментов
Охватите настроенные ресурсы вместо тестирования только идеальных сценариев (happy-path). Справочник по API: POST Run Connector Tool · GET List Connector Logs- Задавайте вопросы, ответы на которые содержатся в бизнес-информации, FAQ, на веб-сайтах и в файлах.
- Проверяйте недостающие факты, противоречивые источники, устаревший контент и неподдерживаемые запросы.
- Проверяйте, когда каждый навык должен и не должен запускаться.
- Проверяйте каждый инструмент коннектора с валидными, невалидными и неполными входными данными.
- Убедитесь, что секретные значения никогда не появляются в ответах или журналах.
- Включайте случаи, которые должны инициировать передачу диалога человеку или не давать ответа.
/connectors/{connectorId}/tools/{toolId}/runs с репрезентативными input, прежде чем разрешить агенту выбирать его в диалоге:
Тестирование через WhatsApp с получателями из списка разрешенных
Проверьте те же сценарии с каждого тестового номера телефона из списка разрешенных. Это подтверждает поведение в реальном канале, которое тестовая конечная точка не может воспроизвести полностью.Запуск оценок
API оценки предоставляет следующие ресурсы:
Перечислите доступные случаи, отправьте запуск, используя требуемое значение
eval_case_ids, сохраните возвращенный job_id и опрашивайте конечную точку задания.
scenario, categories, max_turns и success_criteria. Подробные результаты включают оценки, метки ходов, причины, стенограммы и временные метки. Сводки объединяют оценки, основные моменты и категории сбоев.
Контрольный список для запуска
- Необходимые бизнес-факты верны и не противоречат друг другу.
- Многоходовые разговоры сохраняют заданный контекст.
- Отсутствующая информация приводит к безопасному ответу вместо выдуманного.
- Инструменты коннектора успешно работают и безопасно завершаются с ошибкой при репрезентативном вводе.
- Сценарии передачи работают как ожидается.
- Ошибки оценки рассмотрены и либо исправлены, либо явно приняты.
- Ответственный за откат знает, как отключить развертывание.
Далее: Безопасное развертывание
Сначала включите агента для получателей из белого списка, а затем расширьте на всю аудиторию.

