Schnelligkeit allein ist kein ausreichender Maßstab

Das Versprechen generativer KI bei der Arbeit wird oft mit Zeitgewinnen beschrieben: schneller Texte verfassen, mehr Dokumente zusammenfassen oder eine Antwort mit weniger Arbeitsschritten vorbereiten. Das können nützliche Ergebnisse sein, doch Zeit bei einer Aufgabe einzusparen bedeutet nicht automatisch, insgesamt mehr Wert in der Arbeit zu schaffen. Für eine solche Schlussfolgerung müsste bekannt sein, welche Aufgabe gemessen wurde, nach welchen Kriterien das Ergebnis beurteilt wurde und was mit der eingesparten Zeit geschah.

Eine praktische Bewertung sollte mindestens das erledigte Arbeitsvolumen und dessen Qualität berücksichtigen. Außerdem sollten Korrekturen, menschliche Prüfung, Fehler und neue Aufgaben einbezogen werden, die bei der Einführung des Werkzeugs entstehen. Wird eine Antwort schneller erstellt, erfordert aber eine umfangreiche Kontrolle, kann die Nettoersparnis kleiner sein als die zunächst eingesparte Zeit. Und wenn mehr produziert wird, aber Qualität oder Autonomie leiden, beschreibt eine einzelne Kennzahl die Wirkung nicht angemessen.

Von der eingesparten Zeit zum Gesamtergebnis

Freigesetzte Zeit ist nur dann ein Gewinn, wenn sie für andere nützliche Aufgaben eingesetzt werden kann, ohne zusätzliche Arbeit an eine andere Stelle des Ablaufs zu verlagern. Ein aussagekräftiger Vergleich sollte deshalb den gesamten Arbeitszyklus berücksichtigen: vom Beginn der Aufgabe bis zu dem Zeitpunkt, an dem das Ergebnis geprüft und einsatzbereit ist. Wer nur den Moment der Erstellung betrachtet, lässt Schritte außer Acht, die ebenfalls Ressourcen beanspruchen und die Bewertung des Nutzens verändern können.

Weite Verbreitung belegt keine Produktivitätssteigerung

Eine von der Europäischen Kommission im Oktober 2025 verbreitete Umfrage ergab, dass jede dritte beschäftigte Person in der Europäischen Union KI-Werkzeuge bei der Arbeit nutzte. Dieselbe Mitteilung beschreibt die Erfahrungen überwiegend positiv, weist jedoch auch darauf hin, dass KI-gestützte Überwachungs- und Managementtechnologien Stress erhöhen und die Autonomie verringern können. Das sind relevante Hinweise zum Verständnis der Einführung und der Erfahrungen von Beschäftigten; für sich genommen sind sie jedoch keine Produktivitätsmessung.

Die Unterscheidung ist wichtig, weil eine Umfrage zur Nutzung oder zu Einschätzungen andere Fragen beantwortet als ein Experiment, das Arbeitsergebnisse mit und ohne Unterstützung vergleicht. Erstere kann beschreiben helfen, wer Werkzeuge nutzt und wie die Erfahrung bewertet wird. Um der KI eine Produktivitätsverbesserung zuzuschreiben, braucht es zusätzlich eine klare Definition des Ergebnisses und einen Vergleich, mit dem sich der Werkzeugeffekt von Faktoren wie Erfahrung, Aufgabe oder Arbeitsorganisation trennen lässt. Die öffentlich verfügbare Zusammenfassung sollte nicht so dargestellt werden, als beantworte sie diese Fragen.

Der Nutzungsanteil sagt etwas darüber aus, wie präsent diese Werkzeuge bei der Arbeit sind, nicht aber darüber, wie stark sie das Ergebnis jeder Aufgabe verändern oder wie das Verhältnis von Nutzen und Kosten ausfällt. Ebenso beschreibt eine positive Erfahrung eine Einschätzung, ersetzt aber keine Messung von Qualität, Menge oder Gesamtzeit. Werden diese Fragen getrennt behandelt, lässt sich der Beitrag der Umfrage anerkennen, ohne ihr Schlussfolgerungen zuzuschreiben, die sie nicht liefert.

Was die beruflichen Studien der ILO beitragen

Die Internationale Arbeitsorganisation hat Analysen zu möglichen Auswirkungen generativer KI auf Umfang und Qualität der Beschäftigung sowie einen verfeinerten Index zur beruflichen Exposition veröffentlicht. Diese Arbeiten sind für die Einordnung der Debatte relevant: Sie helfen zu untersuchen, welche Berufe oder Tätigkeiten betroffen sein könnten. Die Exposition gegenüber einer Technologie bedeutet jedoch weder, dass ein Beruf verschwinden wird, noch, dass seine Produktivität steigt.

Diese Unterscheidung hilft auch bei der Einordnung von Schlagzeilen und Ankündigungen. Eine Expositionskarte kann zeigen, wo eine Technologie möglicherweise zum Einsatz kommen könnte. Sie belegt aber nicht, dass sie in einer realen Situation verwendet wird, bei einer bestimmten Aufgabe gut funktioniert oder dass ihr Nutzen die Kosten und Risiken überwiegt. Die ILO betrachtet das Phänomen mit Blick auf Beschäftigung und Tätigkeiten; eine solche Analyse sollte nicht in eine Kennzahl zur Unternehmensleistung umgedeutet werden, die die Quelle nicht vorlegt.

Mit anderen Worten: Exposition grenzt ein, was untersucht werden sollte; sie ist nicht das Ergebnis einer Leistungsbewertung. Zwischen der Möglichkeit, dass ein Werkzeug bei einer Aufgabe eingesetzt werden könnte, und einer nachgewiesenen Verbesserung liegen Fragen zur Nutzung, Qualität und Arbeitswirkung, die gezielte Analysen erfordern. So wird vermieden, einen Berufsindikator mit einer direkten Produktivitätsmessung gleichzusetzen.

Wie sich eine konkrete Behauptung prüfen lässt

Bevor man eine Produktivitätszahl akzeptiert, sollte man prüfen, ob die Veröffentlichung erklärt, wer teilgenommen hat, welche Arbeit ausgeführt wurde, wie lange die Untersuchung dauerte und wie das Ergebnis bewertet wurde. Zu klären ist auch, ob der Vergleich gewöhnliche Aufgaben oder eng begrenzte Übungen umfasst und ob Personen das Ergebnis anhand festgelegter Kriterien beurteilt haben. Ohne diese Angaben lässt sich nur schwer einschätzen, ob die Verbesserung außerhalb des untersuchten Rahmens bestehen bliebe.

Eine kurze Prüfliste kann verhindern, dass eine eindrucksvolle Demonstration mit verallgemeinerbaren Belegen verwechselt wird:

  • Ergebnis: Werden Zeit, Menge, Qualität oder eine Kombination gemessen? Wird erklärt, wie die Qualität bewertet wird?
  • Vergleich: Gibt es eine Referenzgruppe oder Vergleichsbedingung ohne das Werkzeug?
  • Gesamtkosten: Werden Prüfung, Korrektur, Schulung und Änderungen am Arbeitsablauf berücksichtigt?
  • Umfang: Sind Personengruppe, Aufgabentyp und Dauer angegeben?
  • Unabhängigkeit: Wer finanziert oder veröffentlicht die Studie, und sind Methode und Grenzen einsehbar?

Was sich schließen lässt und was offenbleibt

Die angeführten Erkenntnisse erlauben die Aussage, dass KI-Werkzeuge bereits zur Arbeit eines beträchtlichen Anteils der in der Europäischen Union befragten Bevölkerung gehören und dass die beruflichen Erfahrungen nicht einheitlich ausfallen: Neben positiven Eindrücken weist die Kommission auf Risiken durch Überwachung und Management hin. Die Analysen der ILO bieten einen Rahmen, um die Exposition von Tätigkeiten und Berufen zu untersuchen. Keiner dieser Befunde belegt in der Zusammenfassung der verfügbaren Quellen für sich genommen eine allgemeine, unterm Strich positive Steigerung der Arbeitsproduktivität.

Für Einzelpersonen oder Teams, die solche Werkzeuge erwägen, ist es sinnvoll, einen konkreten, begrenzten Anwendungsfall zu messen: vergleichbare Aufgaben gegenüberstellen, vorab festlegen, was als Qualität gilt, und die gesamte benötigte Zeit einschließlich der Prüfung erfassen. Das kann eine lokale Entscheidung unterstützen, würde aber nicht beweisen, dass das Ergebnis für andere Branchen oder Unternehmen gilt. Die angemessene Schlussfolgerung ist daher zweigeteilt: Es gibt Belege für die Einführung und Gründe, die Auswirkungen auf die Arbeit zu untersuchen; Ausmaß und Reichweite eines Produktivitätsgewinns müssen spezifischer und transparenter bewertet werden.

Ein lokaler Test ist aussagekräftiger, wenn die Aufgaben vergleichbar bleiben und vorab feststeht, wie das Ergebnis bewertet wird. Die Erfassung der gesamten Zeit macht sowohl die Arbeit mit dem Werkzeug als auch die anschließende Prüfung sichtbar; ein vereinbartes Qualitätskriterium verhindert, dass das Ergebnis allein nach seiner Schnelligkeit beurteilt wird. Dennoch gilt der Test nur für den beobachteten Kontext: Er zeigt nicht automatisch, was bei anderen Aufgaben, Teams oder Unternehmen geschehen würde.