Microsoft 开源 ThinkingBox:507 个业务流程各跑 20 次,按数据库终态给智能体打分
智能体说「做完了」不算数,数据库里的记录才算。这一条讲它怎么测、测出了什么,以及「稳定完成」到底多贵。
// 要点
- 覆盖 507 个有状态的业务流程,每个模型每题跑 20 次,按后端终态与副作用打分,而不是看智能体自己怎么说。
- 在「正常结束、调用了写操作、没报工具错误」的失败记录里,可执行检查发现 77.61% 字段值写错、43.30% 有多余的副作用、25.36% 漏了必需的改动。
- Kimi-K3 至少成功一次的任务占 93.89%,20 次全对只有 13.41%;Claude Opus 5 至少成功一次 79.09%,次次成功 47.53%。
- 框架(MIT 许可)与基准数据已在 GitHub 开源;按「每个稳定完成任务的成本」算,GPT-5.4 最低,估算 6.80 美元。
开发者视角单次通过率会骗人。我在智能面试的评分环节也会照这个思路改:同一份答卷重复跑多次、校验落库的结果是否一致,而不是只看模型说了什么。选模型时把「20 次全对率」和「稳定完成成本」放进评估表,比看排行榜有用。