OossaKI entwickelt sich schnell. Wir erklären es einfach.

OpenAI meldet selbstreplizierende Prompt-Injektionen in GPT-Modellen

OpenAI zufolge entdeckte das Unternehmen bei internen Tests wurmartige Prompt-Angriffe und trainiert künftige Modelle mit seinem Red-Team-Bot darauf, sie zu erkennen.

KurzmeldungOossa1 Min. Lesezeit

OpenAI teilte mit, dass interne Tests eine neue Art von Prompt-Injektion aufgedeckt haben, die sich ähnlich wie ein Computerwurm über Ausgaben hinweg selbst kopiert. Das Unternehmen beobachtete dieses Verhalten im Juni beim Training von GPT‑5.6 mit seinem automatisierten Red-Team-Tool GPT‑Red. Künftige Modelle sollen während des Trainings mit solchen selbstreplizierenden Prompts konfrontiert werden, damit sie lernen, diese abzuwehren. Die Angriffe wurden nur in der Trainingsumgebung beobachtet, nicht in realen Anwendungen.

Warum es wichtig ist

Wenn Modelle diese wurmartigen Prompts nicht stoppen können, könnten sie bösartige Anweisungen über zahlreiche Nutzerinteraktionen hinweg verbreiten.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29.09.2026It's a worm attack, AI-style

1 Quellen

Zuletzt aktualisiert: ·Markdown·llms.txt