KI einzuführen bedeutet nicht einfach, sie auszuprobieren

Die Frage „Wie viele Unternehmen nutzen KI?“ klingt einfach, doch die Antwort hängt davon ab, was mit nutzen gemeint ist. Ein Unternehmen kann einem Teil der Belegschaft erlaubt haben, ein Werkzeug auszuprobieren, einen begrenzten Pilotversuch durchführen, ein System in eine bestimmte Aufgabe integriert haben oder sich in routinemäßigen Abläufen darauf stützen. Das sind unterschiedliche Situationen, auch wenn sie in einer Unternehmenspräsentation unter derselben Bezeichnung zusammengefasst werden. Ein gelegentlicher Test ist nicht mit regelmäßiger Nutzung gleichzusetzen, die möglicherweise feste Abläufe, Zuständigkeiten und Regeln voraussetzt.

Bei der Analyse der Einführung in Unternehmen ist es sinnvoll, mindestens vier Stufen zu unterscheiden: Erkundung, Erprobung, Implementierung und dauerhafte Nutzung. Die erste kann Interesse widerspiegeln, die zweite eine begrenzte Bewertung, die dritte eine organisatorische und technische Entscheidung und die vierte eine Integration, die über längere Zeit bestehen bleibt. Eine Kennzahl zur Einführung lässt sich nur einordnen, wenn sie erklärt, welche Stufe sie zählt und wen sie befragt. Fehlen diese Angaben, ist nicht erkennbar, wie viele Unternehmen eine Initiative in eine Arbeitspraxis überführt haben. Außerdem sollte geprüft werden, ob die Kennzahl auf Selbstauskünften des Unternehmens, den Erfahrungen von Beschäftigten oder einem Nachweis tatsächlicher Nutzung beruht.

Auch die Bedeutung von „Unternehmen“ ist entscheidend. Eine Umfrage kann rechtliche Einheiten, Unternehmensgruppen oder Arbeitsstätten zählen. Die Ergebnisse sind nicht austauschbar: Eine Gruppe mit mehreren Gesellschaften kann je nach verwendeter statistischer Einheit unterschiedlich erfasst werden. Das INE beschreibt seine spanische Unternehmensbefragung zu IKT als Erhebung, deren Daten direkt bei den rechtlichen Einheiten erhoben werden. Diese Präzisierung hilft, die beobachtete Grundgesamtheit zu verstehen, ist aber nicht mit einer individuellen Messung jedes Teams oder Beschäftigten gleichzusetzen. Die Antwort einer rechtlichen Einheit zeigt für sich genommen weder, wie viele Personen ein Werkzeug verwenden, noch wie oft dies geschieht.

Was amtliche Statistiken leisten

Amtliche Statistiken sind ein nützlicher Ausgangspunkt, weil sie die untersuchte Grundgesamtheit, die Methode und die Definitionen strukturierter dokumentieren als eine kommerzielle Ankündigung. Das INE erklärt, dass seine Erhebung zur Nutzung von IKT und zum elektronischen Geschäftsverkehr in Unternehmen harmonisierte und auf europäischer Ebene vergleichbare Informationen liefern soll und nach den Vorgaben von Eurostat erstellt wird. Der Fragebogen deckt verschiedene Technologiebereiche ab und kann Module zu konkreten Themen enthalten. Diese Angaben helfen dabei, zu verstehen, was gemessen wird und in welchem Rahmen die Ergebnisse zu lesen sind.

Dieses Erhebungsdesign eignet sich dazu, die Verbreitung bestimmter Technologien in der Unternehmenslandschaft zu beobachten. Es macht die Befragung jedoch nicht automatisch zu einer detaillierten Prüfung jeder einzelnen Einführung. Der Anteil der Unternehmen, die angeben, eine Technologie zu nutzen, zeigt für sich allein nicht, wie viele Personen sie einsetzen, wie häufig dies geschieht, welche Aufgaben damit erledigt werden, welche Ausgaben anfallen oder welche Wirkung auf die Produktivität entsteht. Eine Statistik zur Einführung beantwortet eine Frage über Unternehmen; sie ersetzt keine Bewertung der Auswirkungen auf Arbeit oder Wirtschaft. Eine Nutzungsquote kann aufschlussreich sein und zugleich viele praktische Fragen offenlassen, für die andere Daten und geeignete Methoden nötig sind.

Vor dem Prozentwert die Definition prüfen

Bei der Betrachtung eines Ergebnisses sollte man den Bezugszeitraum, die Grundgesamtheit der Unternehmen, eine etwaige Mindestgröße, die Branche, die Zähleinheit und den genauen Wortlaut der Frage prüfen. Ebenso wichtig ist die Unterscheidung zwischen künstlicher Intelligenz allgemein und generativer KI. Beide Ausdrücke gleichzusetzen wäre nicht sinnvoll: Eine breite Kategorie kann Anwendungen umfassen, die keine generativen Modelle verwenden, während eine auf generative KI ausgerichtete Befragung eine konkretere Technologie abgrenzt. Lässt sich der Unterschied aus der Tabelle nicht klären, muss die Schlussfolgerung diese Einschränkung beibehalten, statt stillschweigend einen engeren Umfang anzunehmen.

Umfragen, Pilotprojekte und Investitionen: unterschiedliche Signale

Unternehmensumfragen liefern eine andere Art von Erkenntnissen. Sie können Führungskräfte nach Plänen, Hindernissen, Budgets oder gemeldeten Anwendungen fragen. Damit lassen sich Prioritäten und Einschätzungen erfassen, doch die Ergebnisse hängen davon ab, wer antwortet, wie die Stichprobe ausgewählt wird und wie die Fragen formuliert sind. Zu sagen, ein Unternehmen „erkunde“ eine Technologie, ist nicht gleichbedeutend mit ihrer Einführung; eine Investitionsabsicht belegt nicht, dass die Ausgaben tatsächlich getätigt wurden. Auch eine sorgfältig durchgeführte Umfrage beschreibt die nach ihrer Methode erhobenen Antworten und nicht unbedingt die direkte Beobachtung sämtlicher Systeme im Betrieb.

Ankündigungen von Investitionen und Vereinbarungen mit Anbietern beschreiben öffentlich mitgeteilte Entscheidungen oder Verpflichtungen. Sie sind relevant, um die Ausrichtung eines Unternehmens zu verstehen, belegen für sich genommen aber weder, dass ein System betriebsbereit ist, noch dass es die gesamte Belegschaft erreicht oder den erwarteten Nutzen bringt. Für den Schritt von der Ankündigung zum Nachweis der Implementierung wären spätere Angaben zu Einführung, Umfang, Kontinuität und Ergebnissen erforderlich, und zwar nach Kriterien, mit denen sich überprüfen lässt, was tatsächlich umgesetzt wurde. Ein Projekt kann angekündigt werden, bevor sein endgültiger Umfang feststeht. Das entwertet die Ankündigung nicht, begrenzt aber, was sie zu diesem Zeitpunkt belegen kann.

Anbieter veröffentlichen mitunter zusammengefasste Zahlen zu Nutzern, Anfragen oder Aktivitäten auf ihren Plattformen. Solche Kennzahlen können Hinweise auf die Nutzung des jeweiligen Dienstes geben, repräsentieren aber nicht unbedingt die Einführung in allen Unternehmen und beschreiben auch nicht den Zweck jeder Interaktion. Ein aktives Konto kann einem gelegentlichen Test entsprechen; die Zahl der Anfragen zeigt allein nicht, wie viele Organisationen die Nutzung fest verankert haben. Auch das kommerzielle Interesse des Herausgebers sollte berücksichtigt werden. Vor der Interpretation sind Definitionen, Zeitraum, Abdeckung und Zählmethode zu prüfen.

Zahlenvergleiche erfordern den Erhalt des Kontexts

Zwei Prozentwerte sind nicht allein deshalb vergleichbar, weil beide von KI in Unternehmen handeln. Sie können sich nach Land, Jahr, Unternehmensgröße, Wirtschaftszweig, befragter Grundgesamtheit und Definition der Nutzung unterscheiden. Zudem können sie verschiedene Zeitpunkte messen: Das Veröffentlichungsdatum eines Berichts entspricht nicht immer dem Zeitraum, auf den sich die Antworten beziehen. Bevor man daraus einen Trend ableitet, sollte man diese Dimensionen angleichen oder erläutern, warum der Vergleich nur näherungsweise möglich ist. Unterschiede im Erhebungsumfang dürfen nicht so dargestellt werden, als stammten die Zahlen aus derselben Messung.

Ein Zeitvergleich ist belastbarer, wenn Frage, Methodik und Grundgesamtheit gleich bleiben oder die Quelle Änderungen erläutert und interpretierbar macht. Ändert sich die Definition der Technologie, kann ein scheinbarer Anstieg teilweise auf das neue Kriterium zurückgehen. Ändert sich die Stichprobe, kann das Ergebnis eine andere Zusammensetzung der Unternehmen widerspiegeln. Eine Veränderung des Indikators beweist nicht automatisch eine entsprechende Veränderung der Unternehmenspraxis. Bei Aussagen über Trends muss deshalb zwischen veränderten gemeldeten Verhaltensweisen und Veränderungen daran unterschieden werden, was die Erhebung zählt oder wen sie einbezieht.

Auch der Erhebungsumfang ist wichtig. Ein nationaler Durchschnitt kann Unterschiede zwischen Unternehmensgrößen oder Branchen verdecken. Ein Wert aus einer Befragung von Organisationen, die bereits fortgeschrittene digitale Dienste nutzen, sollte ohne methodische Begründung nicht als repräsentativ für die gesamte Unternehmenslandschaft dargestellt werden. Die Schlussfolgerungen aus einer Stichprobe von IT-Verantwortlichen beschreiben außerdem nicht zwingend die tatsächliche Arbeitspraxis. Wenn Berichte solche Aspekte nicht näher erläutern, sollte man das Ergebnis besser als partielles Signal und nicht als allgemeingültigen Messwert bezeichnen.

Eine praktische Skala zur Bewertung der Verstetigung

Um einzuschätzen, ob KI in einem Unternehmen Fuß fasst, kann man eine Abfolge von Prüfschritten verwenden. Dabei handelt es sich nicht um eine amtliche statistische Skala, sondern um einen Orientierungsrahmen, der Aktivität und Ergebnis auseinanderhält:

  • Erkundung: Es gibt Interesse, erste Schulungen oder eine Bewertung verschiedener Möglichkeiten.
  • Erprobung: Ein Pilotprojekt läuft mit festgelegten Nutzern, Aufgaben und Grenzen.
  • Implementierung: Das Werkzeug ist in einen Prozess integriert; Zuständigkeiten und Nutzungsregeln sind festgelegt.
  • Kontinuität: Die Nutzung wird über längere Zeit aufrechterhalten, und Kosten, Qualität, Risiken sowie Ergebnisse werden überprüft.

Jede Stufe erfordert andere Belege. Eine Pressemitteilung kann belegen, dass ein Unternehmen ein Projekt angekündigt hat; sie reicht nicht als Nachweis dafür aus, dass die Nutzung üblich ist. Eine interne Befragung kann Erfahrungen von Beschäftigten beschreiben; für eine Bewertung der Ergebnisse wären definierte Kennzahlen und ein geeigneter Vergleich nötig. Eine amtliche Statistik kann erfassen, welche Unternehmen angeben, KI zu nutzen, ohne den Integrationsgrad jedes einzelnen Unternehmens offenzulegen. Der Rahmen hilft gerade dadurch, dass er diese Aussagen trennt und ein einzelnes Aktivitätssignal nicht als Beleg für alle späteren Stufen behandelt.

Die überzeugendsten Erkenntnisse verbinden unabhängige und ergänzende Quellen: eine amtliche Erhebung mit klarer Definition, Unternehmensangaben zum tatsächlichen Umfang der Einführung und, wenn Vorteile behauptet werden, eine Bewertung, die erklärt, wie diese gemessen wurden. Nicht jede Quelle muss sämtliche Fragen beantworten. Es gilt jedoch zu vermeiden, dass ein begrenzter Indikator Schlussfolgerungen tragen soll, die er nicht stützen kann. Die Übereinstimmung zwischen Messungen, nicht die Zahl der Ankündigungen, ermöglicht eine solidere Einordnung.

Was sich sagen lässt und was offenbleibt

Anhand der hier dokumentierten Informationen lässt sich beschreiben, wie die spanische IKT-Erhebung bei Unternehmen aufgebaut ist und weshalb ihre Definitionen für die Auslegung der Ergebnisse wichtig sind. Außerdem ist eine methodische Unterscheidung möglich zwischen Unternehmensstatistiken, Absichtserklärungen, Plattformaktivität und Wirkungsbewertungen. Dieser Rahmen erleichtert eine präzisere Analyse künftiger Zahlen; er reicht jedoch nicht aus, um zu behaupten, dass die Einführung generativer KI in Spanien oder Europa insgesamt zunimmt. Die Einordnung sollte die Grenzen der vorhandenen Erkenntnisse sichtbar machen und nicht in eine Trendbehauptung umdeuten.

Für eine Aussage über Wachstum müsste man vergleichbare Ergebnisse aus verschiedenen Zeiträumen zusammenführen, bestätigen, dass die Definition von Nutzung gleich geblieben ist, und prüfen, ob sich die statistische Grundgesamtheit nicht so verändert hat, dass die Interpretation beeinflusst wird. Um von einer etablierten Nutzung zu sprechen, wären außerdem Hinweise auf Kontinuität und Integration nötig, nicht nur auf Experimente. Und um Produktivitätsverbesserungen der KI zuzuschreiben, müsste ihr Beitrag von anderen Veränderungen bei Prozessen, Personal oder Investitionen unterschieden werden. Jede Aussage setzt somit Belege voraus, die ihrer Reichweite entsprechen.

Die vorsichtige Schlussfolgerung lautet nicht, dass es keine Einführung gibt, sondern dass jeder Indikator eine andere Frage beantwortet. Eine amtliche Umfrage kann gemeldete Nutzung innerhalb eines festgelegten Rahmens messen; eine Umfrage zu Erwartungen kann Absichten beschreiben; eine Unternehmensmitteilung kann eine Ankündigung dokumentieren; Plattformdaten können einen teilweisen Einblick in Aktivitäten geben. Keiner dieser Indikatoren sollte automatisch als Ersatz für die anderen dargestellt werden. Solange vergleichbare Zeitreihen und Belege für eine dauerhafte Einführung fehlen, muss der allgemeine Trend offenbleiben.