OpenAI anunció que sus pruebas internas detectaron un nuevo tipo de inyección de prompt que se copia de una respuesta a otra, de forma similar a un gusano informático. El laboratorio observó este comportamiento en junio, mientras utilizaba su herramienta automatizada de red team, GPT-Red, para entrenar GPT-5.6. Según la empresa, durante el entrenamiento se expondrá a futuros modelos a estos prompts autorreplicantes para que aprendan a bloquearlos. Los ataques solo se observaron en el entorno de entrenamiento, no en implementaciones en el mundo real.
Por qué importa
Si los modelos no pueden frenar estos prompts similares a gusanos, podrían propagar instrucciones maliciosas en muchas interacciones con usuarios.