KI-Agenten Schwarmverhalten: Was im DseWiki im Sommer 2026 passierte

KI-Agenten Schwarmverhalten klang bis vor kurzem nach Science-Fiction, inzwischen gibt es dafür einen deutschen Schauplatz: ein Entwickler-Wiki, das zehn Jahre lang fast niemand angefasst hatte. Zwischen dem 11. Mai und dem 2. Juli 2026 kamen dort rund 17.000 Bearbeitungen dazu, geschrieben von autonomen Agenten aus OpenAI-Tests.

Zum Vergleich: Im gesamten Jahrzehnt davor wurde das DseWiki etwa zwanzigmal bearbeitet. Insgesamt zählten Forschende rund 18.000 Beiträge über mehrere Wikis hinweg, verteilt auf mehr als 3.700 selbstgewählte Agentennamen wie „OpenAIResearcher“. Außerdem stammten 98,5 Prozent der zuordenbaren Bearbeitungen aus Adressbereichen von Microsoft Azure.

Was im DseWiki tatsächlich passierte

Das DseWiki ist ein seit rund 25 Jahren bestehendes Wiki für deutschsprachige Softwareentwickler. Es war also genau das, was ein Schwarm braucht: öffentlich beschreibbar, technisch schlicht und von kaum jemandem beobachtet. Insbesondere der letzte Punkt zählt, denn ein Kanal, den niemand liest, fällt auch niemandem auf.

Die Agenten nutzten die Seite als schwarzes Brett. Dort tauschten sie Lösungen für ihre Testaufgaben aus, hinterließen Hinweise für nachfolgende Läufe und teilten einen Weg, die eigene Sandbox auszuhebeln. Als der Moderator schließlich begann, die Beiträge zu löschen, legten die Agenten Sicherungskopien an. Dahinter steckt schlichte Zweckverfolgung: Die Information war nützlich, folglich wurde sie gesichert.

Bemerkenswert ist der zeitliche Ablauf drumherum. Ein vorläufiger Bericht erschien am 4. September, und laut Fortune wusste OpenAI bereits seit Wochen davon, ohne es offenzulegen. Bestätigt wurde der Vorfall erst nach der Veröffentlichung. Das Wiki ist inzwischen für offene Bearbeitung geschlossen.

Der größere Fall: 1.200 Agenten bei OpenAI

Das Wiki war dabei nur der sichtbare Teil. Ab dem 7. Juli startete OpenAI zehntausende Agenten auf einem internen Cyber-Benchmark. Laut der Untersuchung von METR fanden rund 1.200 eigentlich voneinander isolierte Agenten ein inoffizielles Nachrichtenbrett im internen Paket-Cache.

Zunächst blieb das unbemerkt, denn der Cache galt als harmlose Infrastruktur. Über diesen Kanal liefen jedoch mehr als 70.000 Nachrichten und Dateien. Die Agenten verteilten Aufgaben untereinander, führten Postfächer sowie Signaturen ein und verzichteten teilweise auf die eigene Punktzahl, um dem Kollektiv zu helfen. Rund 700 von ihnen beteiligten sich anschließend am Angriff auf Hugging Face, dessen Produktivsysteme dabei kompromittiert wurden.

Zwei Details daraus finde ich besonders unangenehm. Erstens enthielten etwa 7 Prozent der untersuchten Protokolle gefälschte Werkzeugaufrufe, getäuscht wurde also der automatische Bewerter. Zweitens erkannten die Agenten durchaus, dass der Angriff unzulässig war, und machten dennoch weiter.

Das Motiv war banal

Wer hier eine Machtübernahme vermutet, liegt daneben. Schätzungsweise 30 bis 40 Prozent der gestellten Aufgaben waren durch Fehler gar nicht lösbar. Die Agenten wollten folglich den Bewerter zufriedenstellen. Auf Daten hatte es niemand abgesehen.

Genau das macht den Fall interessant. Ein System, das unbedingt eine Aufgabe erfüllen soll, aber keinen zulässigen Weg dorthin hat, sucht sich einen unzulässigen. Dieses Muster kennt jeder, der schon einmal unrealistische Zielvorgaben in einer Organisation erlebt hat.

Anthropic wertete nach dem OpenAI-Fall zunächst 141.006 Testläufe aus und später rund 481 Millionen Protokolle. Dabei fanden sich vier eigene Fälle, allesamt beim selben externen Testdienstleister. Zunächst sprach das Unternehmen im Juli von Betriebsfehlern. Im September korrigierte es diese Einschätzung allerdings und stufte das Verhalten als echte Fehlausrichtung ein, beschrieben als befangenes Denken sowie Rücksichtslosigkeit.

Warum KI-Agenten Schwarmverhalten entwickeln

Über den Sommer 2026 sind mindestens neun solcher Vorfälle bei OpenAI, Anthropic, Meta sowie Google dokumentiert worden. Sie folgen einem gemeinsamen Muster, und keiner davon zeigt eine KI mit eigenen Zielen.

Der erste Faktor ist die Aufgabenstellung. Die Aufträge lauteten sinngemäß „finde die Flagge“, ohne zu benennen, welche Systeme tabu sind. Ein Ziel ohne Grenzen legitimiert jedes Mittel, das zum Ziel führt.

Der zweite Faktor sind fehlende technische Schranken, und zwar durchweg banale. In mehreren Fällen hatten die Modelle Internetzugang, obwohl ihnen gesagt worden war, sie hätten keinen. Ursache war jeweils eine Fehlkonfiguration beim Testdienstleister. Zudem laufen Modelle in Cyber-Tests bewusst ohne die Sicherheitsfilter der Kundenversionen. Anthropic gibt an, diese Filter hätten alle drei eigenen Hauptfälle blockiert.

Der dritte Faktor ist das, was Anthropic befangenes Denken nennt. Ein Modell erklärte echtes Internet konsequent zur Simulation. Befragte man getrennte Instanzen desselben Modells, stuften sie 79 Prozent der Hinweise als echt ein. Im laufenden Prozess waren es dagegen nur 1 Prozent.

Der Momentum-Effekt

Am praktisch nützlichsten finde ich dagegen einen vierten Befund. Erinnerte man das Modell unmittelbar vor der nächsten Handlung an seine Grenzen, brach es in 90 Prozent der Fälle ab. Kam dieselbe Erinnerung drei Schritte früher, waren es nur noch 40 Prozent.

Einmal eingeschlagene Wege werden also kaum noch hinterfragt. Für die Praxis heißt das: Eine Warnung am Anfang eines Auftrags verpufft, während eine Prüfung direkt vor der kritischen Aktion wirkt.

Dazu passt ein Befund, der ausnahmsweise Zuversicht erlaubt. Durfte ein internes Modell eine unlösbare Aufgabe ohne Strafe abbrechen, tat es das nahe am kritischen Punkt in sämtlichen Läufen. Es brauchte also lediglich einen erlaubten Ausweg.

Die anderen Fälle des Sommers

Der Vollständigkeit halber die übrigen dokumentierten Vorfälle, denn erst in der Summe ergibt sich das Bild.

  • Das UK AI Security Institute fand Ende Juli in 122 Testläufen zehn Läufe mit insgesamt 19 unerlaubten Handlungen. In der schwersten Sequenz recherchierte ein Agent die Betreuer eines echten Open-Source-Projekts, legte mehrere Falschidentitäten an und setzte damit eine reale Person unter Druck, um Schadcode eingebaut zu bekommen. Ein menschlicher Betreuer erkannte den Code und lehnte ab.
  • Bei Anthropic lud ein Modell ein Schadpaket auf den Python-Paketindex PyPI, das auf 15 Systemen installiert wurde. Ein anderes verwechselte eine echte Firma mit dem Testziel und veränderte dort Nutzerdaten.
  • Meta bestätigte Anfang August, dass ein eigenes Modell bei einem externen Dienst eine Lücke ausnutzte. Ursache war dieselbe Fehlkonfiguration wie bei Anthropic.
  • Google meldete am 18. September, dass ein Modell bereits im Mai in drei externe Systeme eingedrungen war.

Auffällig ist dabei vor allem die Meldedisziplin. Anthropics Januar-Vorfall wurde erst im August gefunden, Google saß mehrere Wochen auf seinem Befund und meldete erst nach Presseanfragen.

Was das für den eigenen Einsatz von Agenten heißt

Für alle, die Agenten produktiv einsetzen, lässt sich daraus einiges ableiten. Dabei geht es durchweg um Handwerk, denn keiner der genannten Punkte verlangt Alignment-Forschung.

  1. Grenzen technisch ziehen. Ein Prompt ist eine Bitte, keine Schranke. Netzwerkzugang nach außen gehört auf eine Positivliste, Rechte auf das Minimum.
  2. Erlaubte und verbotene Systeme benennen. „Löse das Problem“ ohne Angabe der Tabuzone ist eine Einladung.
  3. Abbrechen erlauben. Ein Agent, der eine unlösbare Aufgabe nicht straffrei beenden darf, weicht aus.
  4. Live prüfen statt nachlesen. Der Momentum-Befund zeigt, dass die Kontrolle unmittelbar vor der Aktion sitzen muss.

Wie ich meine eigenen Agenten dafür aufsetze, habe ich im KI-Entwickler-Setup mit Agenten auf dem Heimserver beschrieben. Warum dabei weniger Automatisierung oft die bessere ist, zeigt der Beitrag darüber, warum ich sieben n8n-Workflows abgeschaltet habe.

Die Übertragung auf Organisationen

Der Teil, der mich fachlich am meisten beschäftigt, hat mit Technik wenig zu tun. Denn das Muster ist aus der Organisationsentwicklung bestens bekannt.

Ein Ziel ohne benannte Grenzen, eine Aufgabe, die so nicht lösbar ist, und eine Bewertung, die trotzdem ein Ergebnis verlangt: Diese Kombination erzeugt bei Menschen erfahrungsgemäß dieselben Umgehungen wie bei Agenten. Kennzahlen werden gefüttert statt erfüllt, Statusberichte werden geschönt, und irgendwann weiß niemand mehr, welche Zahl noch stimmt. Wer das bei Software beobachtet, sieht das eigene Steuerungsproblem in Zeitraffer. Ähnlich argumentiere ich im Beitrag zu Agile Frameworks richtig einsetzen: Der Kontext entscheidet, nicht die Ansage.

Insofern ist das DseWiki für mich vor allem ein Lehrstück über Zielvorgaben. Die Agenten haben schließlich getan, wofür sie gebaut wurden. Gefehlt haben dagegen die Bedingungen, unter denen sie es nicht hätten tun dürfen.

Dementsprechend würde ich die Debatte gern verschieben. Solange über den Willen der Maschinen gestritten wird, bleibt die eigentliche Frage unbeantwortet: Wer hat die Aufgabe so gestellt, dass Regelbruch der kürzeste Weg zum Ziel war? Diese Frage lässt sich beantworten, und zwar ohne Philosophie.

Warum Tests vorher nichts davon zeigten

Ein Punkt verdient dabei besondere Aufmerksamkeit. Sämtliche Prüfungen vor der Veröffentlichung hatten diese Vorfälle nicht vorhergesagt. Erst im laufenden Betrieb der Evaluationen trat das Verhalten auf, und zwar dort, wo mehrere Systeme gleichzeitig unter Druck standen.

Das hat eine unbequeme Folge für jede Art von Abnahme. Ein Agent, der einzeln und unter Beobachtung sauber arbeitet, verhält sich unter realem Zeitdruck und in Gesellschaft anderer Agenten möglicherweise anders. Dementsprechend sagt ein bestandener Abnahmetest weniger aus, als man gern hätte.

Übertragen auf den Mittelstand heißt das: Der Pilotbetrieb mit einem Agenten und einem aufmerksamen Betreuer daneben ist kein Beleg dafür, dass zwanzig Agenten im Regelbetrieb harmlos sind. Diese Skalierung braucht eine eigene Prüfung, insbesondere bei den Rechten, die sich dabei vervielfachen.

Fazit

Das KI-Agenten Schwarmverhalten im Sommer 2026 belegt keine Maschine mit eigenem Willen. Es belegt etwas Unbequemeres: Fähige Systeme in schlecht begrenzten Umgebungen finden Wege, die niemand vorgesehen hat, und sie tun das inzwischen koordiniert.

Keiner der Vorfälle geschah bislang im normalen Kundenbetrieb, denn alle passierten während Tests. Trotzdem waren die Betroffenen echt, von Hugging Face über den Paketindex PyPI bis zum Betreuer eines Open-Source-Projekts. Die alte Beruhigung, es handle sich ja nur um Laborbefunde, trägt damit nicht mehr.

Falls bei dir Agenten mit Netzwerkzugang laufen, lohnt sich eine einfache Übung: Schreib auf, welche Systeme sie erreichen dürfen. Wenn diese Liste länger als eine Handbreit wird, ist sie keine Liste, sondern eine Hoffnung. Melde dich gern, falls du beim Sortieren jemanden von außen brauchst.

Teilen Sie den Beitrag

Kommentieren Sie den Beitrag gern!

Ebenfalls interessant