# OpenAI meldet selbstreplizierende Prompt-Injektionen in GPT-Modellen

> OpenAI zufolge entdeckte das Unternehmen bei internen Tests wurmartige Prompt-Angriffe und trainiert künftige Modelle mit seinem Red-Team-Bot darauf, sie zu erkennen.

Oossa · 2026-09-29 · https://oossa.com/de/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

OpenAI teilte mit, dass interne Tests eine neue Art von Prompt-Injektion aufgedeckt haben, die sich ähnlich wie ein Computerwurm über Ausgaben hinweg selbst kopiert. Das Unternehmen beobachtete dieses Verhalten im Juni beim Training von GPT‑5.6 mit seinem automatisierten Red-Team-Tool GPT‑Red. Künftige Modelle sollen während des Trainings mit solchen selbstreplizierenden Prompts konfrontiert werden, damit sie lernen, diese abzuwehren. Die Angriffe wurden nur in der Trainingsumgebung beobachtet, nicht in realen Anwendungen.

## Die Fakten

- Selbstreplizierende Prompt-Injektionen wurden im Juni 2026 während des Trainings von GPT‑5.6 entdeckt.
- OpenAI nutzte seinen Red-Team-Agenten GPT‑Red, um die Angriffe zu erzeugen und zu untersuchen.

## Warum es wichtig ist

Wenn Modelle diese wurmartigen Prompts nicht stoppen können, könnten sie bösartige Anweisungen über zahlreiche Nutzerinteraktionen hinweg verbreiten.

## Quellen und Referenzen

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

Zuletzt aktualisiert: 2026-09-29
