← Zurück zu allen Insights

Ein Projektleiter hat morgens drei KI-Agenten gestartet: einen für die Recherche zu einem Ausschreibungstext, einen für die Vorbereitung eines Statusberichts, einen für erste Entwürfe zur Kundenkommunikation. Bis Mittag hat er nicht selbst getextet oder recherchiert – er hat geprüft, korrigiert, freigegeben, zurückgewiesen. Trotzdem ist er erschöpfter als an einem klassischen Tag mit eigener Textarbeit. Dieses Gefühl ist kein Einzelfall und auch keine Frage der persönlichen Belastbarkeit, sondern ein inzwischen gut beschriebenes Phänomen: „Brainfry“, zu Deutsch etwa mentale Überhitzung durch KI-Aufsicht.

Aufsicht ist nicht dasselbe wie Nutzung

Eine vielbeachtete Studie des BCG Henderson Institute, veröffentlicht 2026 in der Harvard Business Review, hat den Unterschied empirisch belegt: Befragt wurden knapp 1.500 Vollzeitbeschäftigte großer Unternehmen quer über Branchen und Funktionen. Wer KI überwiegend zur reinen Aufgabenersetzung nutzt, erholt sich eher. Wer KI-Agenten dagegen dauerhaft überwachen, prüfen und korrigieren muss, zeigt deutlich mehr mentalen Aufwand, mehr Erschöpfung und mehr Informationsüberlastung. Ein relevanter Anteil der Befragten berichtete bereits von konkreten Brainfry-Symptomen – mentaler Nebel, ein Druckgefühl im Kopf, spürbar langsamere Entscheidungen –, in Bereichen mit besonders hoher Aufsichtsdichte wie Marketing sogar deutlich häufiger als im Durchschnitt.

Der Grund dafür lässt sich mit etablierter Kognitionsforschung erklären, nicht nur mit einem diffusen Gefühl von Überforderung. Drei Mechanismen wirken zusammen: Die Cognitive Load Theory des Bildungspsychologen John Sweller beschreibt, wie das Arbeitsgedächtnis bei zu vielen gleichzeitig zu verarbeitenden Informationseinheiten rapide an Verarbeitungsqualität verliert – und genau das verlangt die parallele Bewertung mehrerer Agenten-Outputs in kurzer Taktung. Die von Roy Baumeister beschriebene Decision Fatigue zeigt, dass jede zusätzliche Entscheidung die Qualität der nächsten senkt, unabhängig von deren Bedeutung – und Dutzende Mikro-Freigaben pro Stunde sind bei mehreren parallelen Agenten der Normalfall, nicht die Ausnahme. Und das von Sophie Leroy geprägte Konzept der „Attention Residue“ beschreibt den mentalen Rückstand, den eine unterbrochene Aufgabe hinterlässt – beim Sprung vom Code-Review-Agenten zum Kundenservice-Agenten zum Recherche-Agenten ein Dauerzustand statt einer Ausnahme. Alle drei Effekte verstärken sich gegenseitig, statt sich nur zu addieren.

Was unter Erschöpfung zuerst wegfällt

Erschöpfung zeigt sich nicht als plötzlicher Ausfall, sondern als schleichende Verschiebung dessen, was noch sorgfältig geprüft und was nur noch durchgewunken wird. Typischerweise trifft es zuerst die kritische Prüfung von plausibel klingenden, aber falschen KI-Ausgaben, weil Halluzinationen keine Warnhinweise tragen. Es trifft die konzentrierte Suche nach Logik- und Edge-Case-Fehlern, die genau die langsame, aufmerksame Prüfung verlangt, die als Erstes wegfällt. Es trifft übersehene Sicherheits- und Compliance-Lücken, die zu den teuersten Fehlern überhaupt zählen. Und es trifft den Blick fürs große Ganze: Jeder Agent optimiert sein Teilziel isoliert einwandfrei, während das eigentliche Geschäftsziel aus dem Blick gerät – genau die Art von Übersicht, die unter Erschöpfung als Erstes geopfert wird, weil sie sich nicht in eine einzelne Freigabeentscheidung pressen lässt.

Wie viel Aufsicht verträgt ein Mensch?

Eine verbindliche Norm für die parallele Führung von KI-Agenten gibt es noch nicht – dafür ist das Feld zu jung. Aus aktueller Forschung zu fatigue-bewussten Freigabeprozessen und aus langjähriger Erfahrung mit „Alert Fatigue“ in Security-Teams lässt sich aber eine brauchbare Faustregel ableiten: Bei hochautonomen Agenten mit klar abgegrenzter Aufgabe und geringen Fehlerfolgekosten sind drei bis vier parallele Agenten pro Person praktikabel. Bei sicherheitskritischem Code, Finanzprozessen oder Kundenkommunikation sinkt der belastbare Wert auf zwei, in besonders sensiblen Bereichen auf einen einzigen. Als Frühwarnsystem eignen sich vier Kennzahlen deutlich besser als reiner Durchsatz: die Entscheidungsdichte pro Stunde, die Fehlerübersehensrate in nachgelagerten Reviews, die Reaktionslatenz bei Freigaben – auffällig kurz wie auffällig lang sind beides Warnsignale – und die Nacharbeitsquote im Tagesverlauf.

Die Fließband-Lektion von 1914

Die Grundfrage ist historisch nicht neu. Als Henry Ford 1914 die durchgängige Fließbandproduktion einführte, senkte die maschinelle Taktung die Montagezeit eines Fahrzeugs drastisch – zugleich machte genau diese Taktung Zehn- bis Zwölf-Stunden-Schichten physiologisch unhaltbar. Ermüdete Arbeiter am getakteten Band produzierten mehr Ausschuss und mehr Fluktuation, was Ford teurer zu stehen kam als eine kürzere Schicht. Die spätere Verkürzung auf acht Stunden war eine nüchterne betriebswirtschaftliche Reaktion, keine Wohltat. Die Übertragung auf das Agenten-Zeitalter liegt nahe: Die Taktung selbst – das Tempo der KI-Agenten – lässt sich kaum drosseln, ohne den Produktivitätsvorteil zu verspielen. Die einzig sinnvolle Stellschraube ist die Dauer der hochkonzentrierten menschlichen Aufsichtsphase, nicht das Tempo der Maschine.

Ein typisches Beispiel

Ein mittelständischer IT-Dienstleister lässt ein Team über den ganzen Tag hinweg mehrere Coding- und Support-Agenten parallel betreuen, ohne die Aufsichtszeit bewusst zu begrenzen. In den letzten beiden Stunden der Schicht steigt die Zahl spät und ohne genauen Blick durchgewunkener Freigaben spürbar an. Ein übersehenes, hartkodiertes Zugangsdatum in generiertem Code fällt erst Wochen später bei einem externen Sicherheitscheck auf – die Kosten für Bereinigung und Nacharbeit übersteigen den vermeintlichen Zeitgewinn der verlängerten Schicht um ein Vielfaches. Als das Unternehmen die Kernzeit für hochkonzentrierte Agenten-Aufsicht auf sechs Stunden begrenzt, feste Pausen nach neunzig bis hundertzwanzig Minuten einführt und asynchrone Freigaben ermöglicht, sinkt die Nacharbeitsquote spürbar, während der wahrgenommene Gesamtoutput stabil bleibt.

Auf den Punkt

Nicht die Nutzung von KI erschöpft, sondern ihre dauerhafte Beaufsichtigung – und diese Erschöpfung folgt nachvollziehbaren kognitionswissenschaftlichen Mustern statt bloßem Empfinden. Wer mehrere KI-Agenten führt, sollte die Aufsichtszeit bewusst begrenzen, die Zahl parallel betreuter Agenten an deren Fehlerfolgekosten ausrichten und Erschöpfung über echte Kennzahlen statt über Bauchgefühl früh erkennen. Wie schon 1914 am Fließband gilt: Eine Taktung, die schneller läuft als der Mensch, der sie beaufsichtigt, ist auf Dauer nicht billiger – sie ist nur später teuer.

(Erstellt mit KI-Unterstützung, redaktionell geprüft)