Perplexity AI ha annunciato due nuove versioni del modello pplx-embed-v2-late. La variante più piccola, con 0,6 miliardi di parametri, è progettata per funzionare su dispositivi edge come telefoni o apparecchi IoT. Quella più grande, con 9 miliardi di parametri, è pensata per creare indici vettoriali di alta qualità per sistemi di ricerca o raccomandazione. Entrambi i modelli sono distribuiti con licenza MIT, quindi chiunque può scaricarli e ospitarli sui propri server.
Le prestazioni dei modelli
Nei test interni di Perplexity, il modello da 9 miliardi di parametri ha ottenuto il 92,4% nel benchmark MADQA, un test standard per misurare l’accuratezza nella risposta alle domande. Lo stesso modello ha raggiunto il 61,2% nel benchmark ViDoRe v3 Markdown, che misura la capacità di elaborare testi formattati in Markdown. L’azienda afferma che il modello da 0,6 miliardi è ottimizzato per la velocità e il ridotto consumo di memoria, mentre quello da 9 miliardi punta sull’accuratezza.
Perché conta
Gli sviluppatori possono ora eseguire un modello di embedding leggero direttamente su telefoni o dispositivi di piccole dimensioni, senza ricorrere a un servizio cloud. I team che hanno bisogno di funzionalità precise di ricerca o raccomandazione possono usare il modello più capiente mantenendo il pieno controllo dei propri dati, perché entrambe le versioni sono open source.