开源 #开源模型 2026-10-06 · 原文发布 10-03

Aleph Alpha 开源 Kolibri:78B MoE 每 token 激活 3.46B,验证到 100 万 token 上下文,Apache 2.0

一个专攻德语和英语、带推理模式与工具调用的开源模型,FP8 权重约 78 GB,单张 H200 或 B200 就能起服务。

一手来源 Aleph Alpha · Hugging Face 模型页 · huggingface.co 读原文 ↗

// 要点

  • MoE 架构,总参数 78B、每 token 激活 3.46B;只做德语和英语,官方称是「重深度不重广度」,还为德语专门做了分词器。
  • 原生上下文 262,144 token,质量与服务效率验证到 1,048,576 token;对延迟敏感或复杂任务,建议不超过 262,144。
  • FP8 权重约 78 GB,最低 2 张 A100 80 GB、2 张 H100,或单张 H200、B200、B300;用 vLLM 加官方插件部署,提供 OpenAI 兼容接口。
  • 推理力度可设 low、medium、high 或关闭,并可与工具调用同时使用;预训练 20T token,10 月 3 日以 Apache 2.0 许可发布。

开发者视角每 token 只激活 3B 多、单卡能跑,又是 Apache 2.0,这类模型很适合 AI 云盘这种要私有化部署的长文档问答。不过它只做德英两种语言,中文场景别直接上;我更想拿它验证的是「滑窗注意力 + 长上下文」在自己硬件上的真实吞吐,再决定下一个自部署模型怎么选。

// 来龙去脉 · 来自 #开源模型 专题

看完整时间线 →
  1. 10-05 Ai2 开源 AstaBrief 8B:一次生成带引用的研究报告,比 Claude 驱动的模式快约 3.5 倍