OpenAI teilte mit, dass interne Tests eine neue Art von Prompt-Injektion aufgedeckt haben, die sich ähnlich wie ein Computerwurm über Ausgaben hinweg selbst kopiert. Das Unternehmen beobachtete dieses Verhalten im Juni beim Training von GPT‑5.6 mit seinem automatisierten Red-Team-Tool GPT‑Red. Künftige Modelle sollen während des Trainings mit solchen selbstreplizierenden Prompts konfrontiert werden, damit sie lernen, diese abzuwehren. Die Angriffe wurden nur in der Trainingsumgebung beobachtet, nicht in realen Anwendungen.
Warum es wichtig ist
Wenn Modelle diese wurmartigen Prompts nicht stoppen können, könnten sie bösartige Anweisungen über zahlreiche Nutzerinteraktionen hinweg verbreiten.