智能体
智能体落地:评测、可靠性、工具调用与成本。 这一页按时间倒序收录简报里所有与 智能体 相关的条目,并保留每条的一手来源。
现状解读
智能体正从「能不能做成」走向「能不能稳定、安全、可核算地跑」。10 月 5 日的 ThinkingBox 显示至少成功一次和次次成功差距很大(Claude Opus 5 是 79.09% 对 47.53%);10 月 7 日 Windows MXC 正式可用、Copilot 本地沙箱基于它限制智能体权限。10 月 8 日又补上两块:Google 开源 AQuA,定期抽样生产会话给线上智能体做体检,示例里两处单行提示词修复让完整通过从 5/32 升到 13/32,32 个会话扫描花费 3.76 美元;Hugging Face 的 ML-Intern 从 0 美元预算开始、花钱前先问,几天训出 6 个模型共约 103 美元。
趋势是智能体的治理从运行环境延伸到了上线后的质检和花钱规则:隔离靠操作系统,质量靠另一个智能体持续抽查,预算靠显式审批。
接下来值得关注:AQuA 这类旁路质检能否成为 ADK 等框架的标配,「花钱先问」会不会变成付费类智能体的通用做法,以及更多评测改用重复运行和终态校验。
我的建议:上线会写数据或会花钱的智能体前,先定隔离策略、预算上限和审批点;上线后每次发版抽样几十个真实会话做体检,问题先核验再修,同一任务重复跑多次再看通过率。
Darius · 更新于 2026-10-10
时间线 5 条
-
10-10 · 周六 · 2 条
- Google 开源 AQuA:定期抽样生产会话、为线上智能体找问题的质量智能体,32 个会话一次扫描 3.76 美元
视角 · 我更看重核验那一步:先让模型找问题,再让它对照原始记录剔除误报,这和我坚持只引一手信源是同一个道理。智能面试这类会话型产品可以照搬这个思路,每次发版后抽几十个真实会话做体检,一次几美元,比等用户投诉便宜得多。
出自 10-10 简报 · 第 05 条 → - Hugging Face 展示 ML-Intern:智能体几天内训出 6 个模型,总花费约 103 美元
视角 · 「从 0 预算开始、花钱先问」是所有会动钱的智能体都该抄的设计。对小团队,这意味着训一个专用小模型的门槛降到几美元一次试验;我会拿内容审核、标签分类这类固定任务先试一版,再和直接调大模型比成本。
出自 10-10 简报 · 第 07 条 →
- Google 开源 AQuA:定期抽样生产会话、为线上智能体找问题的质量智能体,32 个会话一次扫描 3.76 美元
-
10-08 · 周四 · 2 条
- GitHub Copilot 本地沙箱正式可用:限制智能体命令的文件、网络与凭据访问,企业可强制开启
视角 · 让编码智能体放手跑,最大的顾虑一直是它在本机能碰到什么。我会先把团队的默认策略定成「只能写当前仓库、禁止读 Git 凭据、联网走白名单」,本地 MCP 服务器也一并纳入;这比事后审查每一条命令省心得多。用其他编码智能体的团队,也该照这个标准检查自己的隔离做法。
出自 10-08 简报 · 第 03 条 → - 微软宣布 Windows 智能体容器 MXC 正式可用,NVIDIA RTX Spark 笔记本开放预订:1 PFLOPS FP4、最高 128GB 统一内存
视角 · 和上面 Copilot 本地沙箱用的是同一个 MXC,本机跑智能体的隔离层已经在系统里了。128GB 统一内存能装下百亿级模型,意味着「隐私数据不出机」的需求可以先在单台机器上验证:AI 云盘这类处理私人文件的产品,可以考虑出一个本地推理的版本。但别急着买硬件,先确认你的工作负载在本地模型上的质量够不够。
出自 10-08 简报 · 第 05 条 →
- GitHub Copilot 本地沙箱正式可用:限制智能体命令的文件、网络与凭据访问,企业可强制开启
-
10-05 · 周一 · 1 条
- Microsoft 开源 ThinkingBox:507 个业务流程各跑 20 次,按数据库终态给智能体打分
视角 · 单次通过率会骗人。我在智能面试的评分环节也会照这个思路改:同一份答卷重复跑多次、校验落库的结果是否一致,而不是只看模型说了什么。选模型时把「20 次全对率」和「稳定完成成本」放进评估表,比看排行榜有用。
出自 10-05 简报 · 第 01 条 →
- Microsoft 开源 ThinkingBox:507 个业务流程各跑 20 次,按数据库终态给智能体打分