智能体

智能体落地:评测、可靠性、工具调用与成本。 这一页按时间倒序收录简报里所有与 智能体 相关的条目,并保留每条的一手来源。

订阅本专题 RSS 最近更新 · 2026-10-10

现状解读

智能体正从「能不能做成」走向「能不能稳定、安全、可核算地跑」。10 月 5 日的 ThinkingBox 显示至少成功一次和次次成功差距很大(Claude Opus 5 是 79.09% 对 47.53%);10 月 7 日 Windows MXC 正式可用、Copilot 本地沙箱基于它限制智能体权限。10 月 8 日又补上两块:Google 开源 AQuA,定期抽样生产会话给线上智能体做体检,示例里两处单行提示词修复让完整通过从 5/32 升到 13/32,32 个会话扫描花费 3.76 美元;Hugging Face 的 ML-Intern 从 0 美元预算开始、花钱前先问,几天训出 6 个模型共约 103 美元。

趋势是智能体的治理从运行环境延伸到了上线后的质检和花钱规则:隔离靠操作系统,质量靠另一个智能体持续抽查,预算靠显式审批。

接下来值得关注:AQuA 这类旁路质检能否成为 ADK 等框架的标配,「花钱先问」会不会变成付费类智能体的通用做法,以及更多评测改用重复运行和终态校验。

我的建议:上线会写数据或会花钱的智能体前,先定隔离策略、预算上限和审批点;上线后每次发版抽样几十个真实会话做体检,问题先核验再修,同一任务重复跑多次再看通过率。

Darius · 更新于 2026-10-10

时间线 5 条

  1. 10-10 · 周六 · 2 条

  2. 10-08 · 周四 · 2 条

  3. 10-05 · 周一 · 1 条