# KI-Agententeams kosten mehr, bringen aber selten bessere Ergebnisse

> Eine Studie von Vals AI zeigt: Teams aus mehreren Agenten verbrauchen bis zu fünfmal so viele Tokens wie ein einzelnes Modell – bei nur minimalen Qualitätsgewinnen.

Oossa · 2026-10-11 · https://oossa.com/de/ai-agent-teams-cost-more-but-rarely-improve-results

Datum des Ereignisses: 2026-10-11

Eine neue Untersuchung von Vals AI hat einzelne KI-Agenten mit Agententeams auf dem Vibe Code Bench verglichen. Zum Einsatz kamen zwei führende Modelle – GPT‑6 Sol und Claude Opus 5.5 – jeweils allein und in Gruppen mit bis zu 100 Agenten. Die Teams verbrauchten 1,8 × bis 5,1 × so viele Tokens wie ein einzelnes Modell, erzielten aber kaum bessere Ergebnisse.

## Was die Zahlen zeigen

Von vier direkten Vergleichen war nur einer statistisch signifikant: GPT‑6 Sol erzielte bei mittlerer Reasoning-Stufe im Team 7,3 Punkte mehr. Bei der höchsten Reasoning-Einstellung ließ sich für keines der beiden Modelle ein messbarer Vorteil feststellen. Die Daten legen nahe, dass der zusätzliche Rechenaufwand durch Agentenschwärme nur selten zu höherer Qualität führt – insbesondere dann, wenn die Modelle bereits mit voller Leistung laufen.

## Warum mehr Tempo nicht automatisch bessere Ergebnisse bringt

Auch Forschende von OpenAI kommen zu einem ähnlichen Schluss. In einem Podcast merkte Noam Brown an, dass zusätzliche Agenten vor allem Aufgaben beschleunigen, die sich gut parallelisieren lassen, etwa Webrecherchen oder Mathematik. Die Antwort selbst werde dadurch aber nicht besser. Vier Agenten lösten eine Aufgabe doppelt so schnell, verursachten aber auch die doppelten Kosten. Bei Dutzenden Agenten zeigte sich ein abnehmender Zusatznutzen; für kreative Arbeiten wie das Schreiben eines Romans bringen große Schwärme keinen Mehrwert.

## Die Fakten

- Vals AI testete GPT‑6 Sol und Claude Opus 5.5 am 11. Okt. 2026 auf dem Vibe Code Bench.
- Agententeams verbrauchten 1,8 × bis 5,1 × so viele Tokens wie einzelne Agenten.
- Nur einer von vier Vergleichen zeigte einen signifikanten Zugewinn: GPT‑6 Sol erzielte bei mittlerem Reasoning 7,3 Punkte mehr.
- Bei der höchsten Reasoning-Stufe verschafften Teams keinem der beiden Modelle einen nennenswerten Vorteil.
- OpenAIs Noam Brown zufolge lösten vier Agenten Aufgaben doppelt so schnell, verursachten aber doppelte Kosten.

## Warum es wichtig ist

Für Entwickler, die ihre Cloud-Rechenkosten im Blick behalten müssen, ist die Studie ein Warnsignal: Mehr KI-Agenten dürften die Ausgaben erhöhen, ohne die Produktqualität zu verbessern. Unternehmen, die Routineaufgaben beschleunigen wollen, sollten die Token-Kosten gegen den bescheidenen Geschwindigkeitsgewinn abwägen und könnten mit der Optimierung einzelner Agenten-Prompts besser fahren.

## Quellen und Referenzen

1. [AI agent teams waste massive tokens for barely measurable quality gains, research finds](https://the-decoder.com/ai-agent-teams-waste-massive-tokens-for-barely-measurable-quality-gains-research-finds/) – The Decoder, 2026-10-11

Zuletzt aktualisiert: 2026-10-11
