2026-10-05 · 周一 · 4 条

ThinkingBox 测智能体稳定性、Ai2 开源 AstaBrief、Anthropic 1 亿美元培养部署工程师

这几天的主线是「落地」而不是「更强」:智能体要按次次都对来评估,小模型开始接手带引用的长文生成,企业缺的是能把模型接进业务的工程师。

RSS
  1. Microsoft 开源 ThinkingBox:507 个业务流程各跑 20 次,按数据库终态给智能体打分

    • 覆盖 507 个有状态的业务流程,每个模型每题跑 20 次,按后端终态与副作用打分,而不是看智能体自己怎么说。
    • 在「正常结束、调用了写操作、没报工具错误」的失败记录里,可执行检查发现 77.61% 字段值写错、43.30% 有多余的副作用、25.36% 漏了必需的改动。
    • Kimi-K3 至少成功一次的任务占 93.89%,20 次全对只有 13.41%;Claude Opus 5 至少成功一次 79.09%,次次成功 47.53%。
    • 框架(MIT 许可)与基准数据已在 GitHub 开源;按「每个稳定完成任务的成本」算,GPT-5.4 最低,估算 6.80 美元。

    开发者视角单次通过率会骗人。我在智能面试的评分环节也会照这个思路改:同一份答卷重复跑多次、校验落库的结果是否一致,而不是只看模型说了什么。选模型时把「20 次全对率」和「稳定完成成本」放进评估表,比看排行榜有用。

  2. Ai2 开源 AstaBrief 8B:一次生成带引用的研究报告,比 Claude 驱动的模式快约 3.5 倍

    • 基于 Qwen3-8B,输入研究问题与检索到的文献片段,一次写完整篇带引用的报告,而不是逐节生成。
    • 在 Asta 里,Fast 模式平均每份报告 51.1 秒,Claude 驱动的 Thinking 模式为 178.5 秒,约快 3.5 倍。
    • 用过滤后的 4.7 万条样本做后训练;模型与训练数据一并开源,方便复现和二次开发。
    • Ai2 表示,权重开放后机构可以在自有基础设施上部署,适合研究问题本身敏感的场景。

    开发者视角「检索后写成带引用的长文」是 AI 云盘文档问答最常见的需求,8B 小模型能在一次调用里做完,意味着可以私有化部署、把成本压下来。我会先拿自己的文档集对比引用准确率,再决定是否替掉现有的大模型调用。

  3. GitHub Copilot 代码评审开放 REST / GraphQL API,默认评审力度改为 Balanced

    • 可以通过 REST 与 GraphQL API 请求 Copilot 代码评审,并可为每次请求单独设置评审力度。
    • 新老仓库与组织的默认评审力度改为 Balanced,已明确选 Lite 的保持不变,2026 年 9 月 28 日生效。
    • 面向 Copilot Pro、Pro+、Max、Business 与 Enterprise 正式可用;力度可在企业、组织、仓库、个人四级设置,下级覆盖上级。

    开发者视角有了 API,AI 评审可以挂进自己的发布流程,比如只在改动涉及支付或权限时调高力度。默认力度变了,评审耗时和额度消耗可能随之变化,这周值得看一眼账单和 PR 等待时间。AI 写初稿后评审怎么分工,我在博客《当 AI 承担大部分初稿时的代码评审实践》里写过。

  4. Anthropic 投入 1 亿美元成立 Claude Frontier Academy,计划到 2027 年底培养 1 万名前沿部署工程师

    • 承诺投入 1 亿美元,目标是到 2027 年底培养 1 万名「前沿部署工程师」(FDE)。
    • 先通过线下培训与实操考核,再进入 12 周驻场期,在本单位主导一个真实的 Claude 用例;首批 FDE 认证预计 2027 年初颁发。
    • 首批班次在旧金山、纽约、伦敦开课,学员来自 Accenture、Bain、Capgemini、澳大利亚联邦银行、Deloitte、McKinsey、Morgan Stanley 与 Novo Nordisk 等。
    • 建立在 Claude 合作伙伴网络之上,该网络覆盖 46,000 家公司,已颁发超过 175,000 个 Claude 认证。

    开发者视角模型厂商开始自己培养「把模型接进业务的人」,说明企业侧卡的不是模型能力,而是集成和交付。对独立开发者和小团队,能拿着真实用例交付落地的经验比证书更值钱,这正是可以接单的地方。

本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。