2026-10-08 · 周四 · 5 条 Anthropic 发布 Claude Haiku 5.5、GPT-6 在 ChatGPT 全球推送、GitHub Copilot 本地沙箱正式可用
今天的主线是智能体的「跑得起」和「管得住」同时往前走:Haiku 5.5 把小模型价格压到 Haiku 4.5 的十分之一,让大量子任务交给智能体在成本上成立;GitHub 和微软则把沙箱、密钥拦截做进系统和平台,给放手让智能体干活补上护栏。
-
- 价格按提示长度分档:10 万 token 以内输入每百万 0.10 美元、输出 0.50 美元,超过 10 万 token 为 0.50 美元与 2.50 美元;Haiku 4.5 是 1 美元与 5 美元。官方说明新分词器每个任务会多用一些 token,算上这一点平均仍便宜约 75%。
- 对比 Haiku 4.5:OSWorld 2.1(离线子集)72.4% 对 15.7%,Terminal-Bench 4.0 39.2% 对 0.0%;Sonnet 5.5 在 Terminal-Bench 4.0 上是 70.6%,官方仍建议复杂编码任务用 Sonnet 5.5 或 Opus 5.5。
- 同日起 Sonnet 5.5 的缓存读取从每百万 0.20 美元降到 0.10 美元,官方称多数智能体任务因此便宜约 20%;本周起 Max 5x、Max 20x 每月分别送 100 和 200 美元 API 额度,Team 最多 500 美元。
- 模型 ID 为 claude-haiku-5-5,已上 Claude Platform、AWS、Google Cloud 与 Microsoft Azure;Python 与 TypeScript SDK 同时加入 computer use 与 browser use 的 beta 支持。
开发者视角我会马上把 PandaClaws 的分类、摘要和改写,以及 AI 云盘的文档问答这类短提示调用切到 Haiku 5.5 跑一轮对比:10 万 token 以内价格只有原来的十分之一,主模型做规划、Haiku 做子任务的分工终于算得过账。要注意新分词器会多用一点 token,别只看单价,按「完成一个任务的总花费」来算;我在《每月维持三款 AI 产品在线运行的真实成本》里的成本表也得重算了。
-
- GPT-6 正在 ChatGPT 中面向全球推送。
- 同时推出 Intelligent UI:官方称回答更快,并带有可以直接浏览和使用的可视化与交互体验。
开发者视角对做产品的人,这条的意义在于用户预期:大家每天在 ChatGPT 里看到的是带图、可点的回答,再回到纯文本对话框会觉得落后。我会先盘点智能面试的评分报告和 AI 云盘的问答结果里,哪些适合换成图表或卡片展示,再决定要不要让模型直接输出结构化界面。
-
- 在 Copilot CLI、Copilot 应用以及使用 Agent Host 的 VS Code 会话中正式可用,包含在 Copilot 订阅内,不额外收费。
- 可限制智能体命令能读写的文件和目录,控制对互联网、局域网、Git 凭据与 GitHub CLI 凭据的访问;在支持的情况下也覆盖本地 MCP 服务器和语言服务器。
- 底层是 Microsoft eXecution Container(MXC),把同一份沙箱策略翻译成 Windows、macOS、Linux 的原生系统控制;企业可通过托管设置强制开启,开发者无法放宽。
- 沙箱作用于工具执行,与 Copilot 使用哪个模型无关。
开发者视角让编码智能体放手跑,最大的顾虑一直是它在本机能碰到什么。我会先把团队的默认策略定成「只能写当前仓库、禁止读 Git 凭据、联网走白名单」,本地 MCP 服务器也一并纳入;这比事后审查每一条命令省心得多。用其他编码智能体的团队,也该照这个标准检查自己的隔离做法。
-
- 模型读取周边代码来判断可能的凭据,包括没有可识别 token 格式的密码;它只做识别,不生成代码或文字。
- 已有的 AI 检测密钥告警即日起自动换成新模型,GHSP 与 GHAS 客户不额外收费;GHES 3.23 将以公开预览提供 AI 检测告警。
- AI 推送拦截进入私有预览,在密钥进入仓库历史之前提醒移除;Copilot CLI 与 Copilot 应用的 /security-review 即将加入该分类器的检查,同样先是私有预览。
- 新的推送拦截和 /security-review 检查默认关闭、需主动开启,会消耗 GitHub AI Credits;即使没有拦下推送,检查也可能计费。
开发者视角智能体每步都在提交,密钥混进历史的概率只会更高,push 时就拦下比事后轮换便宜得多。我会先在已买 GHSP 的仓库开推送拦截试点,同时给 AI Credits 设预算上限,因为不拦截也会计费;GitHub 在说明里还特意写了「智能体不应在未授权时开启计费功能」,这条值得原样写进团队的智能体规则。
-
- 微软宣布 Microsoft Execution Containers(MXC)正式可用:这是系统级基础设施,让智能体在操作系统控制下安全、持续地在后台运行。
- RTX Spark 由最多 6,144 核的 Blackwell RTX GPU 与最多 20 核的 Grace CPU 组成,以 600 GB/s 互联,提供 1 PFLOPS FP4 算力和最高 128GB 统一内存;笔记本即日开放预订,10 月 16 日上市,紧凑台式机 11 月开售。
- NVIDIA 举例称它能在本地运行 125B 参数的 Qwen 3.8 Flash Next,不按量计费,数据不出本机;Acer、ASUS、Dell、HP、Lenovo、微软、MSI、Gigabyte 都将推出机型。
- 同时预览 DGX Station for Windows:GB300 超级芯片、748GB 一致性内存、最高 20 PFLOPS FP4,官方称可在本地运行万亿参数级模型。
开发者视角和上面 Copilot 本地沙箱用的是同一个 MXC,本机跑智能体的隔离层已经在系统里了。128GB 统一内存能装下百亿级模型,意味着「隐私数据不出机」的需求可以先在单台机器上验证:AI 云盘这类处理私人文件的产品,可以考虑出一个本地推理的版本。但别急着买硬件,先确认你的工作负载在本地模型上的质量够不够。
本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。