Oossa

Una puntuación geométrica mejora la precisión de los modelos de lenguaje

Un nuevo método identifica una dirección en los estados ocultos del modelo que clasifica las respuestas hasta 52 puntos mejor que la puntuación probabilística estándar.

Por Publicado por Oossa: 1 min de lectura

Domenico Loia · Unsplash

Investigadores descubrieron que los modelos de lenguaje grandes almacenan una señal geométrica que indica si una respuesta es correcta. Al observar el desplazamiento promedio de los estados ocultos entre las respuestas incorrectas y las correctas, pueden crear un vector de puntuación que clasifica las opciones sin ajustar el modelo. En pruebas con cinco modelos de entre 1 billion y 8 billion de parámetros, la técnica supera el enfoque habitual de probabilidad logarítmica sin ejemplos por hasta 32 puntos en ARC‑Challenge y MMLU, y por hasta 52 puntos en TruthfulQA.

Cómo funciona el método

Los autores toman cincuenta ejemplos etiquetados, los procesan con el modelo para recopilar representaciones ocultas aproximadamente a mitad de la red y calculan el vector promedio que apunta de los estados asociados a respuestas incorrectas a los de respuestas correctas. En el momento de la inferencia, cada respuesta candidata solo requiere una pasada hacia delante y un producto escalar con este vector. No se genera texto de respuesta ni se modifican los parámetros del modelo.

Qué implica para la fiabilidad de los modelos

Como detector de alucinaciones, la dirección geométrica alcanza un AUROC de 0.693, frente a 0.578 con la puntuación probabilística estándar. El estudio también muestra que las señales de corrección relacionadas con el razonamiento factual, el conocimiento de dominios y la veracidad ocupan subespacios casi ortogonales. Esto significa que los modelos conservan señales separadas para distintos tipos de corrección y podría explicar por qué a menudo conocen internamente la respuesta correcta, pero no logran darla.

Por qué importa

Para los usuarios de a pie, esta técnica podría dar lugar a respuestas más fiables de los chatbots, especialmente ante preguntas factuales. También apunta a una forma de detectar posibles alucinaciones sin un coste computacional elevado. Sin embargo, el método requiere acceso a los estados ocultos del modelo, que la mayoría de las API públicas no ofrecen.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.