OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.

OpenAI detecta inyecciones de prompt autorreplicantes

OpenAI afirma que sus pruebas internas detectaron ataques de prompt similares a gusanos y que está entrenando futuros modelos con su bot de red team para reconocerlos.

BreveOossa1 min de lectura

OpenAI anunció que sus pruebas internas detectaron un nuevo tipo de inyección de prompt que se copia de una respuesta a otra, de forma similar a un gusano informático. El laboratorio observó este comportamiento en junio, mientras utilizaba su herramienta automatizada de red team, GPT-Red, para entrenar GPT-5.6. Según la empresa, durante el entrenamiento se expondrá a futuros modelos a estos prompts autorreplicantes para que aprendan a bloquearlos. Los ataques solo se observaron en el entorno de entrenamiento, no en implementaciones en el mundo real.

Por qué importa

Si los modelos no pueden frenar estos prompts similares a gusanos, podrían propagar instrucciones maliciosas en muchas interacciones con usuarios.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

Fuentes y referencias

#FuenteMedioFechaIdea clave
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29 sept 2026It's a worm attack, AI-style

1 fuentes

Última actualización: ·Markdown·llms.txt