Cloudflare hat am 9. Okt. 2026 Clef‑omni vorgestellt, ein Entscheidungsmodell, das Audio-, Video-, Bild- und Texteingaben gemeinsam verarbeiten kann. Mit demselben Update senkt das Unternehmen den Preis für das Modell Clef‑flash unter den des konkurrierenden Jev-Modells und beschleunigt das ursprüngliche Clef-Modell auf seiner Workers-AI-Plattform.
Was Clef‑omni kann
Clef‑omni basiert auf dem Mixture-of-Experts-Modell Qwen3‑Omni‑30B‑A3B‑Instruct. Anders als frühere Entscheidungsmodelle, die nur Text verarbeiten konnten, nimmt es direkt Audio im wav- oder mp3-Format sowie Videos im mp4- oder webm-Format zusammen mit Bildern und Text auf. Ein einzelner API-Aufruf kann nun Optionen anhand all dieser Medientypen bewerten. Separate Transkriptions- oder Bilderkennungspipelines sind damit nicht mehr nötig.
In Tests werden reine Textanfragen in etwa 130 ms beantwortet, Bildeingaben in etwa 150 ms und Audioclips in wenigen hundert Millisekunden. Ein 21‑Sekunden-Video mit Ton wird in rund 1,5 Sekunden verarbeitet.
Änderungen bei Preis und Geschwindigkeit
Der Preis für Clef‑flash wurde von $0.09 auf $0.038 pro Million Eingabe-Tokens gesenkt. Damit ist das Modell günstiger als TypeSafes Jev-Modell. Das Kontextfenster der gehosteten Version von Clef‑flash ist jetzt auf 24 k Tokens begrenzt, statt zuvor 64 k. Die Open-Weight-Gewichte unterstützen beim Selbsthosting weiterhin 256 k Tokens.
Der Preis des ursprünglichen Clef-Modells bleibt bei $0.24 pro Million Tokens. Dank Infrastrukturverbesserungen, darunter der Umstellung auf das Serving-Framework SGLang, verarbeitet es große Eingaben jetzt etwa doppelt so schnell.
Warum es wichtig ist
Entwickler können jetzt einen einzelnen KI-Schritt einrichten, der etwa ein Foto, einen Audioclip und ein kurzes Video auswertet, um beispielsweise zu entscheiden, ob ein Haushaltsgerät korrekt installiert ist. Der niedrigere Preis von Clef‑flash macht Entscheidungsmodelle für kleine Unternehmen erschwinglicher, die viele Bilder oder Dokumente prüfen müssen. Das schnellere Clef-Modell verringert zugleich die Latenz bei Echtzeitanwendungen.