A Cloudflare anunciou em 9 de outubro de 2026 o lançamento do Clef‑omni, um modelo de decisão que aceita entradas de áudio, vídeo, imagem e texto em conjunto. A mesma atualização também torna o modelo Clef‑flash mais barato que o concorrente Jev e acelera o modelo Clef original na plataforma Workers AI da Cloudflare.
O que o Clef‑omni pode fazer
O Clef‑omni é baseado no modelo fundacional de mistura de especialistas Qwen3‑Omni‑30B‑A3B‑Instruct. Ao contrário dos modelos de decisão anteriores, que só processavam texto, ele pode receber diretamente arquivos de áudio wav ou mp3 e vídeos mp4 ou webm, além de imagens e texto. Agora, uma única solicitação à API pode avaliar opções a partir de qualquer um desses tipos de mídia, sem a necessidade de fluxos separados de transcrição ou reconhecimento de imagens.
Nos testes, consultas apenas de texto levam cerca de 130 ms para retornar; entradas de imagem, cerca de 150 ms; clipes de áudio, algumas centenas de milissegundos; e um vídeo de 21 segundos com som é processado em aproximadamente 1,5 segundo.
Mudanças de preço e velocidade
O preço do Clef‑flash caiu de US$ 0.09 para US$ 0.038 por milhão de tokens de entrada, tornando-o mais barato que o modelo Jev, da TypeSafe. A janela de contexto do Clef‑flash hospedado agora está limitada a 24 k tokens, abaixo dos 64 k anteriores. Já os pesos de código aberto continuam oferecendo suporte a 256 k tokens para hospedagem própria.
O modelo Clef original continua custando US$ 0.24 por milhão de tokens e agora funciona cerca de duas vezes mais rápido com entradas grandes, graças a melhorias na infraestrutura, incluindo a migração para o framework de execução SGLang.
Por que importa
Os desenvolvedores agora podem criar uma única etapa de IA que analisa uma foto, um áudio e um vídeo curto para decidir, por exemplo, se um eletrodoméstico foi instalado corretamente. O preço mais baixo do Clef‑flash torna os modelos de decisão mais acessíveis para pequenas empresas que precisam analisar muitas imagens ou documentos, enquanto o Clef mais rápido reduz a latência em aplicações em tempo real.