Aleph Alpha 开源 Kolibri:78B MoE 每 token 激活 3.46B,验证到 100 万 token 上下文,Apache 2.0
一个专攻德语和英语、带推理模式与工具调用的开源模型,FP8 权重约 78 GB,单张 H200 或 B200 就能起服务。
// 要点
- MoE 架构,总参数 78B、每 token 激活 3.46B;只做德语和英语,官方称是「重深度不重广度」,还为德语专门做了分词器。
- 原生上下文 262,144 token,质量与服务效率验证到 1,048,576 token;对延迟敏感或复杂任务,建议不超过 262,144。
- FP8 权重约 78 GB,最低 2 张 A100 80 GB、2 张 H100,或单张 H200、B200、B300;用 vLLM 加官方插件部署,提供 OpenAI 兼容接口。
- 推理力度可设 low、medium、high 或关闭,并可与工具调用同时使用;预训练 20T token,10 月 3 日以 Apache 2.0 许可发布。
开发者视角每 token 只激活 3B 多、单卡能跑,又是 Apache 2.0,这类模型很适合 AI 云盘这种要私有化部署的长文档问答。不过它只做德英两种语言,中文场景别直接上;我更想拿它验证的是「滑窗注意力 + 长上下文」在自己硬件上的真实吞吐,再决定下一个自部署模型怎么选。