Google 开源 AQuA:定期抽样生产会话、为线上智能体找问题的质量智能体,32 个会话一次扫描 3.76 美元
不在请求链路上、只读不改,用另一个智能体给线上智能体做体检。
// 要点
- AQuA(Ambient Quality Agent)是 google/adk-recipes 仓库里的开源参考实现,部署在自己的 Google Cloud 项目里,可定时、每次部署后或按需运行,每次最多抽样 1,000 个会话。
- 流程分五步:抽样、按九项清单审查、聚类、对照完整记录核验、跨次运行跟踪;它不在请求链路上,也不会修改智能体、不会自己提 PR。
- 旅行助手示例:32 个会话产生 42 条发现、聚成 9 类,核验剔除 3 类后剩 6 个问题;改了两处单行提示词后,完整通过的会话从 5/32 升到 13/32。
- 成本:96 个会话的单智能体扫描 0.70 美元,32 个会话的多智能体扫描 3.76 美元(约每会话 0.12 美元)。
开发者视角我更看重核验那一步:先让模型找问题,再让它对照原始记录剔除误报,这和我坚持只引一手信源是同一个道理。智能面试这类会话型产品可以照搬这个思路,每次发版后抽几十个真实会话做体检,一次几美元,比等用户投诉便宜得多。