EVERYONE 之前,针对预期答案和失败情况测试代理。
从受限设置开始
在建立测试基线时,保持推出、转接和跟进处于禁用状态。在添加测试接收者之前限制受众。 API 参考: GET 获取设置 · PUT 替换设置
更新后读回有效设置。在测试转接或跟进时,一次更改一种行为,然后在转移到另一个场景之前恢复受限基线。
添加测试接收者
将ai_audience 设置为 ALLOWLISTED_ONLY,然后将每个测试人员添加为 E.164 电话号码。存储返回的允许列表条目 id,以便稍后可以删除该条目。
API 参考: GET 列出允许列表 · POST 创建允许列表条目 · DELETE 删除允许列表条目
运行单轮测试
API 参考: POST 测试代理
当前的 REST 响应不包括
estimated_token_usage。
保留多轮测试的上下文
将返回的conversation_id 与下一条客户消息一起发送。
API 参考: POST 测试代理
测试知识、技能、连接器和工具
覆盖配置的资源,而不是仅测试理想路径问题。 API 参考: POST 运行连接器工具 · GET 列出连接器日志- 提出由业务信息、常见问题解答、网站和文件回答的问题。
- 检查缺失的事实、矛盾的来源、过时的内容和不支持的请求。
- 验证每项技能何时应该运行,何时不应该运行。
- 使用有效、无效和不完整的输入来测试每个连接器工具。
- 确认机密值永远不会出现在响应或日志中。
- 包括应触发人工转接或不产生响应的情况。
/connectors/{connectorId}/tools/{toolId}/runs 使用代表性的 input 直接运行每个配置的工具:
通过 WhatsApp 与允许列表中的接收者进行测试
从每个允许列表中的测试电话号码验证相同的场景。这确认了测试端点无法完全重现的实时渠道行为。运行评估
评估 API 提供以下资源:
列出可用的用例,使用所需的
eval_case_ids 值提交运行,保留返回的 job_id,并轮询作业端点。
scenario、categories、max_turns 和 success_criteria。详细结果包括分数、轮次标签、原因、记录和时间戳。摘要汇总了分数、亮点和失败类别。
上线检查清单
- 必需的业务事实正确且不矛盾。
- 多轮对话保留了预期的上下文。
- 缺失信息会产生安全的响应,而不是捏造的答案。
- 连接器工具在具有代表性的输入下能够安全地成功和失败。
- 交接场景表现符合预期。
- 评估失败已得到审查,并已修复或明确接受。
- 回滚负责人知道如何禁用发布。
下一步:安全发布
首先为白名单收件人启用代理,然后扩展到所有受众。

