Cloudflare于2026年10月9日宣布推出Clef‑omni,这是一款可同时接收音频、视频、图像和文本输入的决策模型。此次更新还下调了Clef‑flash的价格,使其低于竞品Jev模型,并提升了原版Clef在Cloudflare Workers AI平台上的运行速度。
Clef‑omni的功能
Clef‑omni基于Qwen3‑Omni‑30B‑A3B‑Instruct混合专家模型构建。与只能处理文本的早期决策模型不同,它可以直接接收wav或mp3音频,以及mp4或webm视频,还能处理图片和文字。如今,开发者只需发送一次API请求,就能对来自这些媒体类型的选项进行评分,无须再单独搭建转录或图像识别流程。
测试显示,纯文本查询约需130 ms返回结果,图像输入约需150 ms,音频片段只需几百毫秒;处理一段带声音的21秒视频则约需1.5 秒。
价格与速度调整
Clef‑flash的价格已从每百万输入token $0.09降至$0.038,低于TypeSafe的Jev模型。托管版Clef‑flash的上下文窗口现限制为24 k token,低于此前的64 k;不过,开放权重仍支持256 k token,可供用户自行托管。
原版Clef的价格仍为每百万token $0.24。基础设施升级——包括改用SGLang服务框架——让它处理大型输入的速度提升了约一倍。
为什么重要
开发者现在可以构建一个AI处理步骤,同时查看照片、声音片段和短视频,并据此作出判断,例如确认家用电器是否安装正确。Clef‑flash降价后,需要扫描大量图像或文档的小型企业也更容易负担决策模型的费用;原版Clef提速则有助于降低实时应用的延迟。