开源 #开源模型 2026-10-11 · 原文发布 10-09

Cloudflare 开源多模态决策模型 Clef-omni,Clef-flash 输入价从每百万 0.09 美元降到 0.038 美元

只做「从给定选项里打分选择」的决策模型,现在能直接看图、听音频、看视频。

一手来源 Cloudflare 博客 · blog.cloudflare.com 读原文 ↗

// 要点

  • Clef 系列按 schema 定义的选项给输入打分,而不是生成文本;Clef-omni 在一次调用里接受文本、图片、音频(wav、mp3)和视频(mp4、webm),基于 Qwen3-Omni-30B-A3B-Instruct 并去掉了语音输出部分,权重已上 Hugging Face。
  • Clef-omni 在 Workers AI 上为每百万输入 token 0.15 美元;中位延迟纯文本约 130 ms、图片约 150 ms,一段 21 秒带声音的视频约 1.5 秒。
  • Clef-flash 降到每百万输入 token 0.038 美元,托管上下文从 64k 缩到 24k;Clef 价格不变(0.24 美元),中位延迟快了 1.7 到 2.0 倍,并放出权重和 SGLang 启动命令供自托管。

开发者视角和 10-09 那条 Liquid AI 的 d1 连起来看,「决策模型」正在成为一个独立品类:审核、分类、路由这类只需要选一个答案的活,不必再用生成模型。PandaClaws 里图片和视频的内容审核,我会先拿 Clef-omni 做一轮对比测试;用 Clef-flash 的要注意上下文降到了 24k。

// 来龙去脉 · 来自 #开源模型 专题

看完整时间线 →
  1. 10-10 Google 以 Apache 2.0 开源端侧 GPU 推理引擎 ML Drift,Gemma 内存开销最多低 12%
  2. 10-09 LightOn 开源 LightOnOCR-3:0.8B 到 4B 三个尺寸,Apache 2.0,olmOCR-Bench 最高 86.3
  3. 10-09 Liquid AI 开放 d1 决策模型:d1-3B 一次前向给出判断,RTX 4090 上单题 8 毫秒