2026-10-06 · 周二 · 3 条

Aleph Alpha 开源 Kolibri、AWS 给编码智能体发 SageMaker 推理技能、OpenAI 说明欧盟文本水印做法

周末没有前沿大模型发布,主线是「部署」:开源模型拼的是单卡能不能跑、长上下文贵不贵,云厂商把部署经验打包成编码智能体的技能,监管则开始落到生成文本的水印上。

RSS
  1. Aleph Alpha 开源 Kolibri:78B MoE 每 token 激活 3.46B,验证到 100 万 token 上下文,Apache 2.0

    • MoE 架构,总参数 78B、每 token 激活 3.46B;只做德语和英语,官方称是「重深度不重广度」,还为德语专门做了分词器。
    • 原生上下文 262,144 token,质量与服务效率验证到 1,048,576 token;对延迟敏感或复杂任务,建议不超过 262,144。
    • FP8 权重约 78 GB,最低 2 张 A100 80 GB、2 张 H100,或单张 H200、B200、B300;用 vLLM 加官方插件部署,提供 OpenAI 兼容接口。
    • 推理力度可设 low、medium、high 或关闭,并可与工具调用同时使用;预训练 20T token,10 月 3 日以 Apache 2.0 许可发布。

    开发者视角每 token 只激活 3B 多、单卡能跑,又是 Apache 2.0,这类模型很适合 AI 云盘这种要私有化部署的长文档问答。不过它只做德英两种语言,中文场景别直接上;我更想拿它验证的是「滑窗注意力 + 长上下文」在自己硬件上的真实吞吐,再决定下一个自部署模型怎么选。

  2. AWS 发布 aws-ai-ml 技能:让 Claude Code、Codex、Kiro 帮你压测 SageMaker 推理端点并生成部署代码

    • 通过 Agent Toolkit for AWS 提供,支持任何兼容 MCP 的编码智能体,包括 Kiro、Claude Code 和 Codex。
    • 智能体可以压测推理端点、推荐部署配置、对比多次性能测试结果,并生成可执行的 SageMaker Python SDK v3 代码。
    • 需要 AWS CLI 2.35 以上与 uv;生成的代码用你自己的 AWS 凭证运行,官方称从零到能对话约 10 分钟。
    • Kiro 与 Claude Code 还可以通过 AWS MCP Server 在运行时搜索并加载技能,无需本地安装。

    开发者视角「技能」正在变成云厂商争夺编码智能体入口的新方式:谁的部署经验被装进智能体,谁的平台就更容易被选中。它产出的是代码而不是黑盒操作,这点我认同;但跑压测会真实开端点、产生费用,先在单独的账号里设好预算上限再让智能体动手。

  3. OpenAI 公布在欧盟规则下给生成文本加水印的做法,检测能力先向研究人员开放

    • 10 月 5 日发布在 OpenAI 的 Safety 栏目下,介绍其在欧盟规则下对生成文本加水印的做法。
    • 文章说明了水印适用的范围以及检测的工作方式。
    • 检测能力先向研究人员开放,文中解释了原因。

    开发者视角我能读到的只有官方 RSS 摘要,细节还要等原文;但方向已经很明确:面向欧盟用户的产品,生成文本可能被打上可检测的标记。像 PandaClaws 这种内容生成后台,现在就该把「哪些内容由模型生成、用了哪家模型」记进元数据,等合规要求落地时不用返工。

本期由 AI 辅助检索与起草,选题标准与观点由 Darius 设定。