Eine Zahl zur Zeitersparnis erzählt nicht die ganze Geschichte

Das Versprechen, generative KI spare Zeit, verkürzt eine komplexe Frage häufig auf eine einfache Zahl. Doch eine Aufgabe schneller zu erledigen bedeutet nicht automatisch, dass die Produktivität steigt. Ebenso wichtig ist, ob das Ergebnis korrekt, nützlich und akzeptabel ist und wie viel Nacharbeit anfällt. Wird nur die Ausführungszeit gemessen, können Prüfung, Korrekturen und die Folgen eines Fehlers unberücksichtigt bleiben. Eine Zahl zur Geschwindigkeit allein zeigt daher nicht, ob sich der gesamte Arbeitsablauf verbessert hat. Sie muss im Zusammenhang mit der erledigten Aufgabe und den anschließenden Arbeitsschritten betrachtet werden.

Die verfügbare Evidenz weist auf Ergebnisse in bestimmten Kontexten hin, nicht auf eine einheitliche Quote für alle Berufe. Eine Aussage zur Produktivität sollte deshalb die Fragen aufwerfen, welche Aufgabe untersucht wurde, wer sie ausgeführt hat und welches Ergebnis gezählt wurde. Wissenschaftliche Veröffentlichungen und Forschungszusammenfassungen können bei der Beantwortung helfen, ersetzen aber weder die Beschreibung der Methode noch rechtfertigen sie eine Übertragung auf jedes Werkzeug oder Unternehmen. Ein Ergebnis kann aufschlussreich sein, ohne allgemeingültig zu sein. Wer es sorgfältig einordnet, macht die Grenzen der Studie sichtbar, statt eine Beobachtung aus einem bestimmten Umfeld als Prognose für andere Tätigkeiten zu behandeln.

Welche Aufgaben und Personen wurden untersucht?

Eine Feldstudie mit dem Titel Generative AI at Work untersucht den Einsatz generativer KI-Unterstützung in einem Arbeitsumfeld. Titel und Forschungsgegenstand unterscheiden sie von einem abstrakten Fähigkeitstest: Im Mittelpunkt steht das Zusammenspiel eines Werkzeugs mit Aufgaben, die Beschäftigte erledigen. Trotzdem repräsentiert ein Ergebnis aus einem bestimmten Umfeld nicht automatisch alle Berufe, Organisationen oder KI-Systeme. Dass eine Studie am Arbeitsplatz stattfindet, beschreibt ihren Kontext, macht aber nicht überflüssig zu prüfen, welche Personen, Aufgaben und Bedingungen tatsächlich untersucht wurden.

Eine weitere Untersuchung, die als arXiv-Preprint vorliegt, berichtet über ein randomisiertes Online-Experiment mit 1.174 Erwachsenen im Alter von 25 bis 45 Jahren. Die Teilnehmenden bearbeiteten eine arbeitsähnliche Problemlösungsaufgabe mit oder ohne KI-Assistent und anschließend eine Tätigkeit ohne Unterstützung. Die Zusammenfassung berichtet von Leistungsverbesserungen mit KI bei Teilnehmenden verschiedener Bildungsniveaus und von einem geringeren Ergebnisabstand zwischen den Gruppen bei der unterstützten Aufgabe. Das beschreibt einen begrenzten Test, keine Messung der in einem realen Arbeitstag eingesparten Stunden. Laut Eintrag wurde der Artikel im August 2026 eingereicht. Die Ergebnisse sollten außerdem unter Berücksichtigung des Preprint-Status gelesen werden; dieser ist keine Garantie für einen wissenschaftlichen Konsens. Stichprobe, Abfolge der Aktivitäten und berichtete Ergebnisse bestimmen, welche Aussagen das Experiment stützt.

Leistung, Zeit und Qualität sind unterschiedliche Messgrößen

Beim Vergleich von Studien sollten mindestens drei Fragen getrennt werden: Wurde mehr Arbeit erledigt? Wurde sie in kürzerer Zeit erledigt? Hat sich ihre Qualität verbessert? Ein positives Ergebnis bei einer Messgröße beantwortet die anderen nicht automatisch. Insbesondere lässt eine höhere Punktzahl bei einer experimentellen Aufgabe nicht den Schluss zu, dass die Teilnehmenden weniger Zeit gebraucht haben – es sei denn, die Studie hat diese Zeit gemessen und berichtet. Die Zusammenfassung des hier angeführten arXiv-Experiments nennt die Leistung und eine anschließende Tätigkeit ohne KI; der bereitgestellte Auszug enthält keine Angabe zu eingesparten Minuten. Ein Leistungsergebnis als Zeitersparnis zu behandeln, ginge daher über die Angaben in diesem Auszug hinaus.

Wichtig ist auch die Unterscheidung zwischen der Leistung mit Unterstützung und dem Lernen beziehungsweise der Fähigkeit, ohne Unterstützung zu arbeiten. Laut Zusammenfassung blieb im angeführten Experiment ein Teil der Verbesserung bei Teilnehmenden mit niedrigerem Bildungsniveau in der späteren Tätigkeit ohne Unterstützung erhalten, obwohl ein deutlicher Unterschied zwischen den Gruppen erneut auftrat. Die Autoren bringen die spätere Verbesserung außerdem mit intensiver Nutzung in Verbindung, die mit anhaltendem Einsatz kombiniert wurde. Eine im Moment hilfreiche Antwort zu erhalten ist nicht dasselbe, wie eine übertragbare Fähigkeit zu entwickeln; und ein Ergebnis bei einer bestimmten Aufgabe belegt nicht, dass derselbe Effekt in anderen beruflichen Funktionen auftritt. Die Wirkung der Unterstützung während einer Aufgabe und das spätere eigenständige Arbeiten sind zwei getrennte Fragen.

Zahlen einordnen, ohne sie zu verallgemeinern

Bevor ein Studienergebnis zur Erwartung für ein Team wird, sollten Sie in der Originalstudie folgende Punkte prüfen:

  • Aufgabe: bildet sie reale Arbeit ab oder handelt es sich um eine begrenzte experimentelle Tätigkeit?
  • Teilnehmende: Wie viele Personen nahmen teil, und welche Erfahrung oder Ausbildung hatten sie?
  • Vergleich: Welche Gruppe oder Situation dient als Referenz?
  • Ergebnis: Wurden Zeit, Menge, Qualität, Korrekturen oder spätere Leistung gemessen?
  • Umfeld: Welches Werkzeug kam zum Einsatz, und hing das Ergebnis von besonderen Anweisungen oder Betreuung ab?

Nicht alle diese Einzelheiten stehen in den hier zusammengestellten Forschungsauszügen. Sie dürfen deshalb nicht durch Annahmen ergänzt werden. Das Dokument von Microsoft Research zur KI-Einführung bei der Arbeit hat beispielsweise einen Titel, der Änderungen bei der Einführung sowie Produktivitäts- und Kommunikationsaktivitäten in den Mittelpunkt stellt. Das hier verfügbare Material beschreibt weder seine Ergebnisse noch seine Methode; es kann daher ein Forschungsthema benennen, aber keine konkrete Produktivitätszahl dieser Arbeit zuschreiben. Fehlen methodische Angaben, sollte die Aussage eingegrenzt werden, statt die Darstellung durch Analogien zu vervollständigen. Die Prüfpunkte machen deutlich, was bekannt sein müsste, bevor sich ein Ergebnis aus seinem ursprünglichen Umfeld übertragen lässt.

Eine praktische Entscheidung: den eigenen Arbeitsablauf messen

Für eine Organisation, die ein Werkzeug bewerten möchte, ist es nicht sinnvoll, vorab einen Prozentsatz zu versprechen. Hilfreicher ist ein Vergleich, der die vollständige Aufgabe umfasst. Erfasst werden können die Dauer des gesamten Ablaufs, der Anteil der Arbeit, der korrigiert werden muss, und die Frage, ob das Ergebnis vereinbarte Qualitätskriterien erfüllt. Verglichen werden sollten gleichartige Aufgaben. Außerdem sollte festgehalten werden, wann KI eingesetzt wird, wer die Ergebnisse prüft und welche Arbeitsschritte hinzukommen. So wird die erste generierte Antwort nicht fälschlich mit der abgeschlossenen Arbeit gleichgesetzt.

Bei der Auswertung sind auch der Aufwand für die Aufsicht und die Risiken fehlerhafter oder ungeeigneter Ergebnisse zu berücksichtigen. Eine höhere Geschwindigkeit führt möglicherweise nicht zu einem Nettogewinn, wenn die Prüfung länger dauert oder mehr Fehler auftreten. Umgekehrt kann ein Werkzeug wertvoll sein, weil es Ergebnisse verbessert oder schwierige Aufgaben erleichtert, auch wenn es die benötigte Zeit kaum verringert. Das sind Kriterien für die Gestaltung einer lokalen Bewertung, keine von den hier zitierten Quellen quantifizierten Befunde. Diese Unterscheidung ist wichtig: Ein praktischer Messplan kann nützlich sein, ohne vorzugeben, die Studien lieferten bereits eine allgemeingültige Antwort. Schlussfolgerungen vor Ort sollten an die tatsächlich untersuchten Aufgaben, Kriterien und Arbeitsabläufe gebunden bleiben.

Die verantwortungsvolle Schlussfolgerung

Die untersuchte Forschung rechtfertigt keine allgemeingültige Schlagzeile wie „KI spart Beschäftigten X Zeit“. Sie erlaubt eine begrenztere Schlussfolgerung: Einige Studien untersuchen Leistungsverbesserungen bei bestimmten Aufgaben, und ein Online-Experiment berichtet von Vorteilen mit Unterstützung sowie Veränderungen der Unterschiede zwischen Bildungsgruppen. Die Reichweite jeder Schlussfolgerung endet dort, wo Aufgabe, Bevölkerung und Studienbedingungen nicht mehr vergleichbar sind. Diese Grenze entwertet die Ergebnisse nicht, sondern ermöglicht eine genaue Aussage darüber, was eine Studie belegt und was nicht.

Für Menschen, die solche Werkzeuge einsetzen oder bewerten, ist nicht die abstrakte Frage entscheidend, ob KI die Produktivität erhöht. Sinnvoller ist zu fragen, welches Ergebnis sich bei einer klar definierten Aufgabe für welche Personen verbessert und welcher zusätzliche Prüfaufwand entsteht. Nennt eine Quelle nur eine werbliche Zahl oder ein Ergebnis, ohne die Messgröße zu erläutern, reicht das nicht aus, um die Wirkung in einem anderen Beruf abzuschätzen. Vorsicht bestreitet mögliche Vorteile nicht; sie verhindert, dass eine nur unter bestimmten Bedingungen gestützte Beobachtung als allgemeine Tatsache dargestellt wird. Eine gut belegte Aussage sollte das gemessene Ergebnis benennen und die Grenzen der Evidenz wahren, statt aus einem kontextgebundenen Befund ein Versprechen für jeden Arbeitsplatz zu machen.