Cloudflare anunció el 9 de octubre de 2026 el lanzamiento de Clef‑omni, un modelo de decisión que acepta entradas de audio, video, imágenes y texto. La misma actualización también reduce el precio de Clef‑flash, que ahora cuesta menos que el modelo Jev de la competencia, y acelera el modelo Clef original en la plataforma Workers AI de Cloudflare.
Qué puede hacer Clef‑omni
Clef‑omni se basa en Qwen3‑Omni‑30B‑A3B‑Instruct, un modelo fundacional de mezcla de expertos. A diferencia de los modelos de decisión anteriores, que solo procesaban texto, puede recibir directamente audio en formato wav o mp3 y video en formato mp4 o webm, además de imágenes y texto. Ahora, una sola solicitud a la API puede evaluar opciones a partir de cualquiera de estos tipos de contenido, sin necesidad de recurrir a procesos separados de transcripción o reconocimiento de imágenes.
En las pruebas, las consultas que solo incluyen texto tardan unos 130 ms; las entradas con imágenes, unos 150 ms; los clips de audio, unos cientos de milisegundos; y un video de 21 segundos con sonido se procesa en aproximadamente 1,5 segundos.
Cambios de precio y velocidad
El precio de Clef‑flash bajó de $0.09 a $0.038 por millón de tokens de entrada, por lo que ahora es más barato que el modelo Jev de TypeSafe. La ventana de contexto de Clef‑flash en la versión alojada ahora se limita a 24 k tokens, frente a los 64 k anteriores; sin embargo, los pesos de código abierto siguen admitiendo 256 k tokens para el autoalojamiento.
El modelo Clef original mantiene su precio de $0.24 por millón de tokens y ahora funciona aproximadamente el doble de rápido con entradas grandes, gracias a mejoras en la infraestructura, entre ellas la migración al framework de ejecución SGLang.
Por qué importa
Los desarrolladores ahora pueden crear un único paso de IA que analice una foto, un clip de audio y un video corto para decidir, por ejemplo, si un electrodoméstico está bien instalado. El menor precio de Clef‑flash hace que los modelos de decisión sean más accesibles para pequeñas empresas que necesitan analizar muchas imágenes o documentos, mientras que la mayor velocidad del modelo Clef reduce la latencia en aplicaciones en tiempo real.