I ricercatori hanno scoperto che i modelli linguistici di grandi dimensioni contengono un indizio geometrico che permette di capire se una risposta è corretta. Calcolando lo spostamento medio degli stati nascosti tra le risposte sbagliate e quelle giuste, è possibile creare un vettore di valutazione che ordina le risposte candidate senza alcuna messa a punto. Testata su cinque modelli da 1 miliardo a 8 miliardi di parametri, la tecnica supera il consueto approccio zero-shot basato sulla log-probabilità fino a 32 punti su ARC-Challenge e MMLU e fino a 52 punti su TruthfulQA.
Come funziona il metodo
Gli autori selezionano cinquanta esempi etichettati, li passano al modello per raccogliere le rappresentazioni nascoste circa a metà della rete e calcolano il vettore medio che va dagli stati associati alle risposte errate a quelli associati alle risposte corrette. Al momento dell’inferenza, per valutare ogni risposta candidata basta un solo passaggio in avanti e un prodotto scalare con questo vettore. Non viene generato alcun testo e i parametri del modello restano invariati.
Cosa implica per l’affidabilità dei modelli
Usata per rilevare le allucinazioni, la direzione geometrica raggiunge un AUROC di 0,693, contro 0,578 con la normale valutazione basata sulla probabilità. Lo studio mostra inoltre che gli indizi di correttezza relativi al ragionamento fattuale, alle conoscenze di dominio e alla veridicità occupano sottospazi quasi ortogonali: i modelli mantengono quindi segnali distinti per diversi tipi di correttezza. Questo potrebbe spiegare perché spesso i modelli sembrano conoscere la risposta giusta, ma non riescono a formularla.
Perché conta
Per gli utenti di tutti i giorni, questa tecnica potrebbe rendere più affidabili le risposte dei chatbot, soprattutto alle domande fattuali. Potrebbe anche offrire un modo per individuare le probabili allucinazioni senza ricorrere a calcoli costosi. Il metodo, però, richiede comunque l’accesso agli stati nascosti del modello, che la maggior parte delle API pubbliche non espone.