2026-10-07 · 周三 · 3 条 Mistral 发布 1T 参数的 Large 4 预览、Google 开源多模态 EmbeddingGemma 2、Anthropic 扩大网络安全验证计划
今天的主线是「开放」在两头同时推进:开源权重往上够到 1T 参数的旗舰,往下做到不到 1B、能在手机上跑的多模态向量模型;闭源一侧,Anthropic 则用分级审核把更强的网络安全能力开给经过验证的防守方。
-
- 1 万亿参数、每 token 激活 490 亿的原生多模态模型,支持 160 多种语言,覆盖欧盟全部官方语言。
- 预览 API 价格:输入每百万 token 1.36 美元,输出 4.18 美元;官方表示「本月底发布权重」,发布前先与安全机构和合作方做实战红队测试。
- 编码:DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 28.3%;AutomationBench(657 个业务流程)59.9%。
- 网络安全:在 AA Cyber Index 的漏洞复现并修补测试中得分 82%,Cybench 40 道题解出 93%;在 3,800 张 NVIDIA Grace Blackwell GPU 上从零训练。
开发者视角输入 1.36 美元、输出 4.18 美元,这个价位已经值得把 PandaClaws 的长文生成和多语种改写拿去比一轮。但现在只是预览,权重和许可证都还没出,我会先用 API 跑自己的评测集,等月底权重和许可条款落地再决定要不要考虑自部署。
-
- 模块化加载:只要文本和代码是 270M,加视觉 440M,加音频 570M,全模态 740M;文本与代码的上下文窗口 8,192 token。
- 输出 768 维向量,借助 Matryoshka 表示学习可截断到 512、256 或 128 维;MTEB (Code) 比 EmbeddingGemma 1 高 14%,多语言文本精度保持不变。
- 端侧:纯文本权重运行约占 191 MB 内存,全模态在 Pixel 11 Pro 上约 567 MB;经量化感知训练压到 INT4 与 INT8。
- 以 Apache 2.0 发布,权重在 Hugging Face,可通过 Ollama、vLLM、Transformers、sentence-transformers、MLX、LiteRT 等使用。
开发者视角这条和 AI 云盘最直接相关:图片、视频、录音和文档进同一个向量空间,就能用一句话跨类型搜文件,不用再为每种格式各接一套模型。我会先拿 270M 的文本版替换现有向量模型做对比,再按需加载视觉模块;128 维截断能把索引存储压下来,但要先在自己的检索集上测召回掉多少。
-
- Defense Access 面向 SOC、应急响应、恶意代码逆向与漏洞分析,企业、高校、政府安全团队、开源维护者和有漏洞报告记录的个人研究者都可申请,目标几天内答复。
- Red Team Access 增加授权渗透测试与红队,只对机构开放、审核需几周;Specialized Access 面向航空、电网、电信等关键系统测试,与美国政府协同逐案审核。
- 在 CyScenarioBench 上,Defense 档拦下了 Opus 5.5 的 50 个任务中的 46 个;Red Team 档不拦截,完成 34 个,与不加防护时相同。
- 参与机构须保留数据以便监控滥用;今年秋天 Enterprise Frontier Safeguards 上线后,可把数据存在自己控制的云上。计划可在 Claude Platform、Vertex AI 与 Microsoft Foundry 使用。
开发者视角如果你的团队在用 Claude 做代码审计或安全排查时经常被拦,这就是正规通道:先申请审核最快的 Defense 档。要注意的是入档就得保留数据,对 AI 云盘这类处理用户私有文件的产品,安全测试最好用脱敏的副本环境跑,别把真实用户数据带进去。
本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。