2026-10-07 · 周三 · 3 条

Mistral 发布 1T 参数的 Large 4 预览、Google 开源多模态 EmbeddingGemma 2、Anthropic 扩大网络安全验证计划

今天的主线是「开放」在两头同时推进:开源权重往上够到 1T 参数的旗舰,往下做到不到 1B、能在手机上跑的多模态向量模型;闭源一侧,Anthropic 则用分级审核把更强的网络安全能力开给经过验证的防守方。

RSS
  1. Mistral Large 4 公开预览:1T 总参数、49B 激活,API 每百万 token 输入 1.36 美元,权重月底开放

    • 1 万亿参数、每 token 激活 490 亿的原生多模态模型,支持 160 多种语言,覆盖欧盟全部官方语言。
    • 预览 API 价格:输入每百万 token 1.36 美元,输出 4.18 美元;官方表示「本月底发布权重」,发布前先与安全机构和合作方做实战红队测试。
    • 编码:DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 28.3%;AutomationBench(657 个业务流程)59.9%。
    • 网络安全:在 AA Cyber Index 的漏洞复现并修补测试中得分 82%,Cybench 40 道题解出 93%;在 3,800 张 NVIDIA Grace Blackwell GPU 上从零训练。

    开发者视角输入 1.36 美元、输出 4.18 美元,这个价位已经值得把 PandaClaws 的长文生成和多语种改写拿去比一轮。但现在只是预览,权重和许可证都还没出,我会先用 API 跑自己的评测集,等月底权重和许可条款落地再决定要不要考虑自部署。

  2. Google 开源 EmbeddingGemma 2:270M 到 740M 的多模态向量模型,代码检索比上一代高 14%,Apache 2.0

    • 模块化加载:只要文本和代码是 270M,加视觉 440M,加音频 570M,全模态 740M;文本与代码的上下文窗口 8,192 token。
    • 输出 768 维向量,借助 Matryoshka 表示学习可截断到 512、256 或 128 维;MTEB (Code) 比 EmbeddingGemma 1 高 14%,多语言文本精度保持不变。
    • 端侧:纯文本权重运行约占 191 MB 内存,全模态在 Pixel 11 Pro 上约 567 MB;经量化感知训练压到 INT4 与 INT8。
    • 以 Apache 2.0 发布,权重在 Hugging Face,可通过 Ollama、vLLM、Transformers、sentence-transformers、MLX、LiteRT 等使用。

    开发者视角这条和 AI 云盘最直接相关:图片、视频、录音和文档进同一个向量空间,就能用一句话跨类型搜文件,不用再为每种格式各接一套模型。我会先拿 270M 的文本版替换现有向量模型做对比,再按需加载视觉模块;128 维截断能把索引存储压下来,但要先在自己的检索集上测召回掉多少。

  3. Anthropic 扩大网络安全验证计划:分三档开放 Opus 5.5、Sonnet 5.5 与 Mythos 5.1 的进阶安全能力

    • Defense Access 面向 SOC、应急响应、恶意代码逆向与漏洞分析,企业、高校、政府安全团队、开源维护者和有漏洞报告记录的个人研究者都可申请,目标几天内答复。
    • Red Team Access 增加授权渗透测试与红队,只对机构开放、审核需几周;Specialized Access 面向航空、电网、电信等关键系统测试,与美国政府协同逐案审核。
    • 在 CyScenarioBench 上,Defense 档拦下了 Opus 5.5 的 50 个任务中的 46 个;Red Team 档不拦截,完成 34 个,与不加防护时相同。
    • 参与机构须保留数据以便监控滥用;今年秋天 Enterprise Frontier Safeguards 上线后,可把数据存在自己控制的云上。计划可在 Claude Platform、Vertex AI 与 Microsoft Foundry 使用。

    开发者视角如果你的团队在用 Claude 做代码审计或安全排查时经常被拦,这就是正规通道:先申请审核最快的 Defense 档。要注意的是入档就得保留数据,对 AI 云盘这类处理用户私有文件的产品,安全测试最好用脱敏的副本环境跑,别把真实用户数据带进去。

本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。