Cloudflare 开源多模态决策模型 Clef-omni,Clef-flash 输入价从每百万 0.09 美元降到 0.038 美元
只做「从给定选项里打分选择」的决策模型,现在能直接看图、听音频、看视频。
// 要点
- Clef 系列按 schema 定义的选项给输入打分,而不是生成文本;Clef-omni 在一次调用里接受文本、图片、音频(wav、mp3)和视频(mp4、webm),基于 Qwen3-Omni-30B-A3B-Instruct 并去掉了语音输出部分,权重已上 Hugging Face。
- Clef-omni 在 Workers AI 上为每百万输入 token 0.15 美元;中位延迟纯文本约 130 ms、图片约 150 ms,一段 21 秒带声音的视频约 1.5 秒。
- Clef-flash 降到每百万输入 token 0.038 美元,托管上下文从 64k 缩到 24k;Clef 价格不变(0.24 美元),中位延迟快了 1.7 到 2.0 倍,并放出权重和 SGLang 启动命令供自托管。
开发者视角和 10-09 那条 Liquid AI 的 d1 连起来看,「决策模型」正在成为一个独立品类:审核、分类、路由这类只需要选一个答案的活,不必再用生成模型。PandaClaws 里图片和视频的内容审核,我会先拿 Clef-omni 做一轮对比测试;用 Clef-flash 的要注意上下文降到了 24k。