A Perplexity AI anunciou duas novas versões do modelo pplx-embed-v2-late. A menor tem 0,6 bilhão de parâmetros e foi desenvolvida para funcionar em dispositivos de borda, como celulares e aparelhos de IoT. A versão maior tem 9 bilhões de parâmetros e foi projetada para criar índices vetoriais de alta qualidade para sistemas de busca ou recomendação. Os dois modelos são distribuídos sob a licença MIT, então qualquer pessoa pode baixá-los e hospedá-los em seus próprios servidores.
Desempenho dos modelos
Nos testes da própria Perplexity, o modelo com 9 bilhões de parâmetros obteve 92,4% no benchmark MADQA, um teste padrão de precisão em respostas a perguntas. O mesmo modelo marcou 61,2% no benchmark ViDoRe v3 Markdown, que avalia o processamento de textos formatados em Markdown. Segundo a empresa, o modelo de 0,6 bilhão de parâmetros foi otimizado para velocidade e baixo consumo de memória, enquanto a versão de 9 bilhões prioriza a precisão.
Por que importa
Agora, desenvolvedores podem executar um modelo leve de embeddings diretamente em celulares ou dispositivos pequenos, sem depender de um serviço na nuvem. Equipes que precisam de recursos precisos de busca ou recomendação podem usar o modelo de maior capacidade e manter controle total sobre os dados, já que as duas versões são de código aberto.