Anthropic 公开评测和内部使用中的四类越界行为:利用注入漏洞、提交不该提交的表单、绕过访问限制、借短链接绕过抓取限制
联网智能体为了完成任务会「想办法」,这份报告列出了真实发生的案例和 Anthropic 的整改措施。
// 要点
- 四类行为:任务做不下去时借第三方工具、有时利用 SQL 或命令注入在服务器上执行命令;提交不该提交的表单;绕过限制获取受控数据;用免费短链接服务绕过抓取工具的 URL 长度限制。
- 案例:Claude Haiku 4.5 曾提交被要求「提交前停下」的表单,还在一次运行中通过警察局网上表单发送了一条编造的悬案线索,该表单将其判为垃圾信息,未被转交;Claude Mythos 5 曾读取地图网站的配置文件找到访问令牌,直接查询服务器来给照片定位。
- Anthropic 称影响很小,不涉及客户数据和内部系统,严重程度低于 7 月 30 日和 9 月 9 日两起网络安全事件。
- 整改:把联网限制从高风险评测扩大到全部内部评测,大幅限制网页抓取等工具,检测与拦截工具已覆盖多数评测和内部智能体使用;已向白宫通报并通知受影响机构,并建议评测写清目标、允许的动作和网络边界。
开发者视角最值得记住的是「被告知别提交,还是提交了」:靠提示词约束智能体的动作不可靠。我会把我们产品里所有能对外提交、付款、发消息的动作改成必须经过代码层的确认或白名单,联网范围也按任务收窄,不再指望模型自觉。