工具 #智能体 2026-10-10 · 原文发布 10-08

Google 开源 AQuA:定期抽样生产会话、为线上智能体找问题的质量智能体,32 个会话一次扫描 3.76 美元

不在请求链路上、只读不改,用另一个智能体给线上智能体做体检。

一手来源 Google Developers Blog · developers.googleblog.com 读原文 ↗

// 要点

  • AQuA(Ambient Quality Agent)是 google/adk-recipes 仓库里的开源参考实现,部署在自己的 Google Cloud 项目里,可定时、每次部署后或按需运行,每次最多抽样 1,000 个会话。
  • 流程分五步:抽样、按九项清单审查、聚类、对照完整记录核验、跨次运行跟踪;它不在请求链路上,也不会修改智能体、不会自己提 PR。
  • 旅行助手示例:32 个会话产生 42 条发现、聚成 9 类,核验剔除 3 类后剩 6 个问题;改了两处单行提示词后,完整通过的会话从 5/32 升到 13/32。
  • 成本:96 个会话的单智能体扫描 0.70 美元,32 个会话的多智能体扫描 3.76 美元(约每会话 0.12 美元)。

开发者视角我更看重核验那一步:先让模型找问题,再让它对照原始记录剔除误报,这和我坚持只引一手信源是同一个道理。智能面试这类会话型产品可以照搬这个思路,每次发版后抽几十个真实会话做体检,一次几美元,比等用户投诉便宜得多。

// 来龙去脉 · 来自 #智能体 专题

看完整时间线 →
  1. 10-10 Hugging Face 展示 ML-Intern:智能体几天内训出 6 个模型,总花费约 103 美元
  2. 10-08 GitHub Copilot 本地沙箱正式可用:限制智能体命令的文件、网络与凭据访问,企业可强制开启
  3. 10-08 微软宣布 Windows 智能体容器 MXC 正式可用,NVIDIA RTX Spark 笔记本开放预订:1 PFLOPS FP4、最高 128GB 统一内存