Cloudflare meddelade den 9 okt 2026 att företaget lanserar Clef‑omni, en beslutsmodell som kan ta emot ljud, video, bilder och text samtidigt. I samma uppdatering sänks priset på modellen Clef‑flash, som nu är billigare än konkurrenten Jev, och den ursprungliga Clef-modellen blir snabbare på Cloudflares plattform Workers AI.
Det här kan Clef‑omni göra
Clef‑omni bygger på en Qwen3‑Omni‑30B‑A3B‑Instruct-modell med en blandning av experter. Till skillnad från tidigare beslutsmodeller, som bara kunde hantera text, kan den ta emot ljud direkt i wav- eller mp3-format och video i mp4- eller webm-format, tillsammans med bilder och text. Nu kan ett enda API-anrop bedöma alternativ utifrån alla dessa medietyper, utan separata arbetsflöden för transkribering eller bildigenkänning.
I tester besvaras frågor med enbart text på cirka 130 ms, bildfrågor på cirka 150 ms och ljudklipp på några hundra millisekunder. En 21 sekunder lång video med ljud behandlas på ungefär 1,5 sekunder.
Pris- och hastighetsändringar
Priset på Clef‑flash har sänkts från $0.09 till $0.038 per miljon inmatningstoken, vilket gör modellen billigare än TypeSafes Jev-modell. Den värdbaserade versionen av Clef‑flash har nu ett kontextfönster på högst 24 k token, en minskning från 64 k. Modellvikterna med öppen viktning stöder fortfarande 256 k token vid egen drift.
Den ursprungliga Clef-modellen kostar fortfarande $0.24 per miljon token och körs nu ungefär dubbelt så snabbt för stora indata tack vare uppgraderingar av infrastrukturen, bland annat en övergång till serveringsramverket SGLang.
Varför det spelar roll
Utvecklare kan nu bygga ett enda AI-steg som granskar ett foto, ett ljudklipp och en kort video för att till exempel avgöra om en hushållsapparat är korrekt installerad. Det lägre priset på Clef‑flash gör beslutsmodeller överkomliga för småföretag som behöver granska många bilder eller dokument, samtidigt som den snabbare Clef-modellen minskar fördröjningen i realtidsapplikationer.