Warum KI-Projekte scheitern – und was die erfolgreichen 5 % anders machen
30 bis 40 Milliarden US-Dollar haben Unternehmen in generative KI investiert. Laut einer MIT-Studie sehen 95 Prozent davon keinen messbaren Ertrag. Was hinter der Zahl steckt – und warum zielgenaue, kleine Modelle der bessere Weg sind.
Auf einen Blick
• Laut der MIT-Studie „State of AI in Business 2025“ erzielen 95 % der Unternehmen keinen messbaren Ertrag aus generativer KI.
• Der Hauptgrund ist nicht die Technik, sondern der Ansatz: Werkzeuge, die nicht dazulernen und nicht zum Prozess passen.
• Erfolgreich sind Unternehmen, die sich auf einen konkreten Schmerzpunkt konzentrieren und die KI tief in den Arbeitsablauf integrieren.
Die Studie: Was das MIT untersucht hat
Im Sommer 2025 veröffentlichte die Initiative NANDA am Massachusetts Institute of Technology (MIT) den Bericht „The GenAI Divide: State of AI in Business 2025“. Die Autoren werteten mehr als 300 öffentlich dokumentierte KI-Initiativen aus, führten 52 strukturierte Interviews und befragten 153 Führungskräfte. Der Untersuchungszeitraum: Januar bis Juni 2025. [1]
Das Ergebnis ist ernüchternd: Trotz Investitionen von 30 bis 40 Milliarden US-Dollar erzielen 95 Prozent der Organisationen keinen messbaren Ertrag. Nur rund 5 Prozent der integrierten KI-Piloten schaffen nennenswerten Mehrwert – der große Rest bleibt ohne messbare Wirkung auf die Gewinn- und Verlustrechnung.
Scheitern wirklich fast alle? Eine Einordnung
Die Zahl ist griffig, und sie verdient eine Einordnung. [3] Der Beobachtungszeitraum war mit rund sechs Monaten kurz, langfristige Effekte erfasst er nicht. Die Stichprobe ist nicht repräsentativ, und „Erfolg“ wurde eng als messbare Wirkung auf die GuV definiert. Produktivitätsgewinne einzelner Mitarbeitender tauchen darin kaum auf – zumal viele von ihnen private KI-Tools nutzen, die in keiner offiziellen Bilanz erscheinen.
Die Kernaussage bleibt trotzdem belastbar: Zwischen dem Ausprobieren von KI und echtem Geschäftsnutzen liegt ein tiefer Graben. Die Studie nennt ihn den „GenAI Divide“.
Fünf Gründe, warum KI-Projekte scheitern
1. Viel ausprobiert, wenig in Betrieb
Allgemeine Werkzeuge wie ChatGPT oder Copilot sind weit verbreitet: Über 80 Prozent der Organisationen haben sie getestet, knapp 40 Prozent setzen sie ein. Sie steigern aber vor allem die Produktivität Einzelner – nicht das Ergebnis des Unternehmens.
Bei maßgeschneiderten, aufgabenspezifischen Lösungen ist der Graben am tiefsten: 60 Prozent der Unternehmen haben solche Lösungen evaluiert, 20 Prozent kamen in die Pilotphase – und nur 5 Prozent in den Produktivbetrieb.
Wichtig: Das heißt nicht, dass Spezialisierung der falsche Weg ist. Es heißt, dass die meisten Speziallösungen zu starr sind, nicht dazulernen und neben dem eigentlichen Prozess stehen. Genau das zeigen die nächsten Gründe.
2. Die Lernlücke: Systeme, die nicht dazulernen
Als Kernproblem identifiziert die Studie eine „Lernlücke“: Die meisten KI-Systeme behalten kein Feedback, passen sich nicht an den Kontext an und werden mit der Zeit nicht besser. Nutzer beklagen, dass die KI nicht aus Korrekturen lernt, bei jeder Anfrage zu viel Kontext braucht und bei Sonderfällen versagt.
Die Folge: Für einfache Aufgaben wie E-Mail-Entwürfe greifen 70 Prozent der Befragten gern zur KI. Bei komplexer, länger laufender Arbeit bevorzugen sie mit 9 zu 1 den Menschen.
Generische Werkzeuge wie ChatGPT sind für Einzelne hervorragend, weil sie flexibel sind. Im Unternehmenseinsatz geraten sie ins Stocken, weil sie nicht aus den Arbeitsabläufen lernen und sich nicht an sie anpassen.
– Sinngemäß nach Aditya Challapally, Hauptautor der MIT-Studie, im Gespräch mit Fortune [2]
3. Zu breit gedacht
Viele Projekte starten mit einer großen Vision: eine KI-Plattform für das ganze Unternehmen, zentral gesteuert von einem KI-Labor. Die Studie zeigt, dass diese Projekte besonders oft stecken bleiben. Erfolgreicher sind Unternehmen, die Verantwortung an die Fachbereiche geben – und sich auf ein konkretes Problem konzentrieren. Challapally beschreibt die erfolgreichen Start-ups so: Sie konzentrieren sich auf einen Schmerzpunkt, setzen ihn gut um und gehen kluge Partnerschaften ein. [2]
4. Das Budget fließt an die falsche Stelle
Mehr als die Hälfte der Budgets für generative KI fließt laut Studie in Vertrieb und Marketing – dorthin, wo Ergebnisse sichtbar sind. Den höchsten Ertrag fanden die Forscher aber im Backoffice: bei der Automatisierung von Routineprozessen, die vorher ausgelagert waren oder externe Dienstleister beschäftigten.
5. Eigenbau ohne Erfahrung
Lösungen, die gemeinsam mit spezialisierten Partnern umgesetzt wurden, erreichten in rund 67 Prozent der Fälle den Produktivbetrieb. Rein intern entwickelte Lösungen schafften das nur in etwa einem Drittel der Fälle.
Randnotiz: die Schatten-KI
Nur 40 Prozent der Unternehmen haben offizielle Lizenzen für KI-Sprachmodelle gekauft. Doch in über 90 Prozent der befragten Unternehmen nutzen Mitarbeitende regelmäßig private KI-Tools für ihre Arbeit. Das zeigt zweierlei: Der Bedarf ist riesig – und Firmendaten landen oft dort, wo niemand sie kontrolliert.
Was die erfolgreichen 5 % anders machen
Die Unternehmen auf der richtigen Seite des Grabens folgen laut Studie einem erkennbaren Muster:
• Sie arbeiten mit spezialisierten Partnern, statt alles selbst zu bauen.
• Sie geben die Verantwortung an die Fachbereiche – an die Menschen, die den Prozess kennen.
• Sie verlangen tiefe Integration in ihre Abläufe und messen Lösungen an betrieblichen Ergebnissen, nicht an Modell-Benchmarks.
• Sie setzen auf Systeme, die Kontext behalten und aus Feedback lernen.
Der ENKO-Ansatz: zielgenau statt Gießkanne
Liest man die Studie genau, ergibt sich ein klares Bild: Erfolgreich ist nicht, wer das größte Modell einkauft, sondern wer ein konkretes Problem präzise löst – und dafür sorgt, dass die Lösung mit jedem Tag besser wird. Genau so arbeiten wir.
Warum KI-Projekte scheitern | So arbeiten wir bei ENKO
Generisches Werkzeug ohne Prozessbezug | Kleines Modell, trainiert auf genau eine Aufgabe in Ihrem Prozess
Das System lernt nicht dazu | Korrekturen Ihrer Fachleute fließen in die nächste Trainingsrunde – das Modell wird im Betrieb besser
Zu breit angesetzt | Ein Schmerzpunkt mit bezifferbaren Kosten – dann der nächste
Erfolg ist nicht messbar | Erfolgskriterien vor dem Start: Erkennungsrate, Fehlalarme, Durchlaufzeit, eingesparte Stunden
Pilot steht neben dem Prozess | Integration in Business Central, BDE und QM-Systeme – dort, wo die Arbeit passiert
Eigenbau ohne Erfahrung | Partner mit über 25 Jahren Prozesserfahrung – plus Enablement, damit das Wissen in Ihrem Team bleibt
Sorge um die eigenen Daten | Betrieb lokal oder in Rechenzentren in Deutschland bzw. der EU
Klein, aber zielgenau
Statt ein großes Sprachmodell auf alles loszulassen, setzen wir kleine, spezialisierte Modelle genau dort ein, wo sie messbaren Nutzen stiften: bei der Sichtprüfung, der Klassifizierung von Reklamationen, dem Auslesen von Belegen oder der Erklärung von Fehlercodes. Ein Modell mit einer klaren Aufgabe ist schneller, günstiger im Betrieb und vor allem überprüfbar.
Lernen im laufenden Betrieb
Die Lernlücke schließen wir mit einem einfachen Prinzip: Das Modell trifft einen Vorschlag, Ihre Fachleute bestätigen oder korrigieren. Jede Korrektur wird Trainingsmaterial für die nächste Runde. Unklare Fälle landen beim Menschen, nicht im Durchwinken. So wächst die Qualität mit jedem Durchlauf – und das Vertrauen der Mitarbeitenden gleich mit.
Beispiel: Reklamationen vorsortieren
Eingehende Reklamationen werden heute gelesen, einer Fehlerart zugeordnet und an die richtige Stelle weitergeleitet – von Hand. Ein kleines Modell übernimmt die Vorsortierung direkt im QM-System. Das Qualitätsteam prüft die Vorschläge, korrigiert, wo nötig, und jede Korrektur verbessert das Modell. Gemessen wird von Anfang an: Wie oft liegt das Modell richtig, wie viel Zeit spart das Team?
Im Prozess statt daneben
Eine KI, für die Mitarbeitende ein weiteres Fenster öffnen müssen, wird selten genutzt. Deshalb integrieren wir die Ergebnisse dort, wo ohnehin gearbeitet wird: im ERP, in der Betriebsdatenerfassung, im Qualitätsmanagement. Das ist der Teil, an dem die meisten Projekte scheitern – und der Teil, den wir aus über 25 Jahren Software- und ERP-Projekten im Mittelstand am besten kennen.
Checkliste: sechs Fragen vor dem Start Ihres KI-Projekts
1. Welches konkrete Problem lösen wir – und was kostet es uns heute?
2. Woran erkennen wir nach drei Monaten, ob sich das Projekt lohnt?
3. Welche Daten liegen vor, und wer im Haus kann sie fachlich bewerten?
4. Wie lernt das System aus Korrekturen?
5. In welches bestehende System fließt das Ergebnis?
6. Wo werden unsere Daten verarbeitet – und wer hat Zugriff?
Fazit
95 Prozent sind kein Naturgesetz. Die MIT-Studie zeigt vor allem, wie KI-Projekte nicht funktionieren: zu breit, zu generisch, ohne Lernschleife und ohne Anschluss an den Prozess. Wer dagegen mit einem konkreten Problem startet, ein kleines Modell zielgenau darauf trainiert, den Erfolg von Anfang an misst und die Lösung dort integriert, wo gearbeitet wird, hat die besten Voraussetzungen, auf der richtigen Seite des Grabens zu landen.
Quellen
1. Challapally, A.; Pease, C.; Raskar, R.; Chari, P.: „The GenAI Divide: State of AI in Business 2025“, MIT NANDA, Juli 2025, Bericht (PDF) – https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
2. Fortune: „MIT report: 95% of generative AI pilots at companies are failing“, 18.08.2025, via Yahoo Finance – https://finance.yahoo.com/news/mit-report-95-generative-ai-105412686.html
3. KI im Personalwesen: „MIT-Studie State of AI in Business 2025: Scheitern wirklich fast alle?“, ki-im-personalwesen.de – https://www.ki-im-personalwesen.de/mit-studie-state-of-ai-in-business-2025-scheitern-wirklich-fast-alle/
