2026-10-10 · 周六 · 8 条

Claude Code 钩子可失败即拦截、Anthropic 三年 1.5 亿美元投入 Genesis Mission、Google 开源 AQuA 与 ML Drift

今天的主线是「把失败情况想在前面」:Claude Code 让守卫钩子出错时默认拦截,Copilot 评审的额度和触发权收归组织,Google 用另一个智能体给线上智能体做体检。智能体进生产后,决定质量的不只是模型,还有故障、账单和质检这些默认值怎么设。

RSS
  1. Claude Code 2.1.295 让钩子可以「失败即拦截」,网关可按上游限定模型和首包超时

    • 命令型和 HTTP 型钩子新增 onFailure: "block":钩子起不来、超时或以意外退出码结束时,拦下这次操作而不是放行。
    • Claude apps 网关的每个上游可配置可选的 models 列表,只把列出的模型发往该上游,故障切换时同样遵守;Bedrock、Vertex、Foundry 等云上游支持 timeouts.upstream_ttfb_ms,限制流式响应开始前的等待时间,超时后切换或返回 502。
    • 支持 Program Status Protocol(OSC 7501),实现了该协议的终端可以显示 Claude Code 正在工作、等你操作还是已完成。
    • 新增 CLAUDE_CODE_RETRY_WATCHDOG_MAX_WAIT_MS,限制无人值守重试模式等待 429 和 529 错误的时长。

    开发者视角「失败即拦截」是安全钩子该有的默认值:一个挂掉就放行的守卫,等于没有守卫。我会把拦截删除、拦截推送生产配置这类钩子都切到 block,同时给钩子本身加健康检查,免得它一出错就把整个团队卡住。

  2. Anthropic 承诺三年投入 1.5 亿美元支持美国 Genesis Mission,把 Claude 扩展到超过 15 个联邦机构

    • 在白宫科技政策办公室主办的峰会上宣布:三年 1.5 亿美元,用于联邦政府的 Genesis Mission(用 AI 加速科学发现)。
    • 资金将让 Claude 覆盖该计划中超过 15 个机构,包括 NASA、美国国立卫生研究院(NIH)和美国国家科学基金会(NSF)。
    • 三年内为「数百个」Genesis Mission 研究项目提供 Claude、Claude Code 和 API 额度,并与机构和国家实验室在聚变能源、量子计算等方向合作。
    • 同时为参与项目的科学家提供培训、上手和技术支持,帮助新加入的机构启动第一个项目。

    开发者视角对做产品的人,这条的意义不在金额,而在 Claude Code 被当成科研人员的标配工具来发。和 10-05 那条 1 亿美元培养部署工程师连起来看,Anthropic 在花钱买「落地能力」;面向专业用户的产品,可以参考这个路子,把培训和上手支持当成产品的一部分来设计。

  3. Codex CLI 0.162.0 加入受管 Git worktree 工具,并收紧 Linux 沙箱的几处漏洞

    • 在受信任的本地项目里开启 worktrees 功能开关后,Codex 可以创建和列出受管的 Git worktree。
    • 智能体 Command Center 可以用 p 键置顶任务;自定义的 Responses 兼容模型提供方可配置联网和远程压缩。
    • Linux 沙箱修复:多个被拒绝文件时的启动问题、拒绝可写的沙箱构建可执行文件,ripgrep 配置不再能削弱拒绝规则。
    • 可重试的 Responses 和 WebSocket 失败会遵守服务端的 Retry-After;apply_patch 会保留已有的 CRLF 换行。

    开发者视角worktree 交给智能体自己管,意味着同一仓库里并行跑多个任务会成为常态。我的建议是先在一个仓库里试,约定 worktree 的命名和清理规则;ripgrep 那条修复也提醒我们,沙箱规则要定期用实际命令去验证,而不是只看配置文件。

  4. Copilot 代码评审可改由组织付费,并能限制只有授权用户才能触发

    • 新设置有两档:Member(默认)计入成员自己的 Copilot 额度,额度用完时评审会失败;Organization 计入仓库所属组织。
    • 选择 Organization 需要组织开启 AI Credits 付费用量,可以另设预算;入口在组织设置的 Copilot > Policies。
    • 新开关「只允许授权用户触发 Copilot 代码评审」开启后,组织或企业之外的 Copilot 许可证(如个人许可证)不能请求评审。
    • 组织层开启后,仓库管理员无法关闭。

    开发者视角默认档下成员额度一用完评审就失败,这对把评审设为必过检查的团队是隐患。我会改成组织付费并设预算,同时打开授权触发开关;和 10-05 评审开放 API 那条连起来看,评审正在从个人工具变成组织的流程成本,需要有人管账。

  5. Google 开源 AQuA:定期抽样生产会话、为线上智能体找问题的质量智能体,32 个会话一次扫描 3.76 美元

    • AQuA(Ambient Quality Agent)是 google/adk-recipes 仓库里的开源参考实现,部署在自己的 Google Cloud 项目里,可定时、每次部署后或按需运行,每次最多抽样 1,000 个会话。
    • 流程分五步:抽样、按九项清单审查、聚类、对照完整记录核验、跨次运行跟踪;它不在请求链路上,也不会修改智能体、不会自己提 PR。
    • 旅行助手示例:32 个会话产生 42 条发现、聚成 9 类,核验剔除 3 类后剩 6 个问题;改了两处单行提示词后,完整通过的会话从 5/32 升到 13/32。
    • 成本:96 个会话的单智能体扫描 0.70 美元,32 个会话的多智能体扫描 3.76 美元(约每会话 0.12 美元)。

    开发者视角我更看重核验那一步:先让模型找问题,再让它对照原始记录剔除误报,这和我坚持只引一手信源是同一个道理。智能面试这类会话型产品可以照搬这个思路,每次发版后抽几十个真实会话做体检,一次几美元,比等用户投诉便宜得多。

  6. Google 以 Apache 2.0 开源端侧 GPU 推理引擎 ML Drift,Gemma 内存开销最多低 12%

    • ML Drift 是 LiteRT 的核心 GPU 加速引擎,也可作为独立库使用,Apache 2.0 许可,代码在 GitHub。
    • 支持 OpenGL ES、OpenCL、Metal 和 WebGPU,覆盖 Android、iOS,以及通过 WebGPU 的 Windows、Linux 和通过 Metal 的 macOS(桌面为预览)。
    • 针对端侧大模型按 prefill 和 decode 阶段切换内核;Gemma 基准中内存开销比其他框架最多低 12%,YouTube Shorts 平均帧延迟最多降低 40%。
    • 旧的 TFLite GPU delegate 不再有新功能,LiteRT 加速器对现有模型完全向后兼容。

    开发者视角和 10-07 的 EmbeddingGemma 2 放在一起看,端侧语义检索的模型和引擎都齐了。AI 云盘这类产品可以先在网页端用 WebGPU 试一版本地向量化,把隐私敏感文件留在用户设备上;还在用 TFLite GPU delegate 的项目,该排迁移计划了。

  7. Hugging Face 展示 ML-Intern:智能体几天内训出 6 个模型,总花费约 103 美元

    • ML-Intern 会先规划,花钱前申请预算,先跑小测试再跑完整任务,然后在 Hugging Face 的算力上训练、评估并发布模型。
    • 每个任务从 0 美元预算开始,运行付费任务前需要用户批准;在 HuggingChat 打开 ML-intern 模式即可使用。
    • 示例 Citrus Doctor 微调 Qwen3.5-2B 识别柑橘病害,335 张测试图准确率从 14.9% 升到 52.8%,花费约 1.90 美元。
    • 作者几天内做了 6 个项目,总计约 103 美元;模型、数据集和 Space 公开在 ML-Intern-lab 组织下。

    开发者视角「从 0 预算开始、花钱先问」是所有会动钱的智能体都该抄的设计。对小团队,这意味着训一个专用小模型的门槛降到几美元一次试验;我会拿内容审核、标签分类这类固定任务先试一版,再和直接调大模型比成本。

  8. Ai2 用 GPU 时间预算替代优先级调度:占用率保持 98%,调试任务 p90 排队从 2 小时降到 30 秒

    • Ai2 的集群规模 88 到 1024 张 GPU 不等,服务约 150 名研究员,需求是供给的 2 到 3 倍。
    • 改为由管理者设定 GPU 时间预算、分层公平共享调度:任务声明的最短运行时间受保护不被抢占并计入预算,预算外的时间免费但可被抢占。
    • 改造前后占用率都保持在 98%;30 天测试中各团队拿到应得 GPU 时长的 98%,15 个分配里 13 个达到 95% 以上。
    • 调试任务 p90 排队从 2 小时降到 30 秒,需要人工介入的修复减少 74%。

    开发者视角这篇没有开源代码,但思路可以直接用:把「优先级」换成「预算」,抢资源就有了成本。团队内部共享推理或微调 GPU 时,我会先按项目分预算、给调试任务留快速通道,比反复调优先级省心得多。

本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。