Cloudflareは2026年10月9日、音声、動画、画像、テキストをまとめて入力できる判断モデル「Clef‑omni」の提供開始を発表した。今回の更新では、Workers AIプラットフォーム上で、Clef‑flashを競合するJevモデルより安価にしたほか、初代Clefモデルも高速化した。
Clef‑omniでできること
Clef‑omniは、Qwen3‑Omni‑30B‑A3B‑InstructのMixture of Experts(MoE)基盤モデルを採用する。テキストしか扱えなかった従来の判断モデルとは異なり、画像や文章に加え、wavまたはmp3形式の音声、mp4またはwebm形式の動画を直接取り込める。こうした各種メディアの選択肢を1回のAPIリクエストで評価できるため、個別の文字起こしや画像認識の処理が不要になる。
テストでは、テキストのみのクエリは約130 ms、画像入力は約150 msで応答する。音声クリップは数百ミリ秒で処理され、音声付きの21秒の動画は約1.5秒で処理される。
価格と処理速度の変更
Clef‑flashの価格は、入力トークン100万個あたり$0.09から$0.038に引き下げられ、TypeSafeのJevモデルより安価になった。ホスト版Clef‑flashのコンテキストウィンドウは、64 kから24 kトークンに縮小。一方、オープンウェイト版の重みは、セルフホスティングで引き続き256 kトークンに対応する。
初代Clefモデルの価格はトークン100万個あたり$0.24のまま。SGLangサービングフレームワークへの移行を含むインフラの強化により、大きな入力の処理速度は約2倍になった。
なぜ重要か
開発者は、たとえば家電製品が正しく設置されているかを判断するために、写真、音声クリップ、短い動画をまとめて確認するAI処理を1つのステップで構築できる。Clef‑flashの値下げにより、多数の画像や文書を調べる必要がある中小企業も判断モデルを利用しやすくなり、Clefの高速化はリアルタイムアプリケーションの遅延を減らす。