Menschlicher Kontrollpunkt: Erfolgreiche KI-Fallstudien bewahren die menschliche Prüfung und verlagern die Aufsicht auf Ausnahmen, anstatt Verantwortung abzuschaffen.
Kontaktklassifizierung: Chime automatisierte die Klassifizierung und Prüfung von Anrufen und half den Mitarbeitenden, sich auf die Kundinnen und Kunden zu konzentrieren, während die Modellgenauigkeit und Verschlechterungen überwacht wurden.
Fortschritte bei Prognosen: Die agentenbasierte KI von Amazon verringerte die Zeit für die Nachfrageplanung um 80 Prozent und den Prognosefehler um 40 Prozent – durch sauberere und sichtbare Daten.
Workflow-Integration: ACV Auctions verkürzte die Dauer des Fahrzeugverkaufsprozesses um zwei Drittel, indem Eingang, Bewertung, Vermarktung, Transaktionen und Abwicklung miteinander verbunden wurden.
Vertrauen schaffen: Die Teams erreichten Akzeptanz, indem sie klein anfingen, messbare Ergebnisse zeigten, unübersichtliche Daten vereinfachten und die Beteiligten während der gesamten Einführung in die Verantwortung nahmen.
Fallstudien zu KI gibt es meist in zwei Varianten: vage Erfolgsgeschichten ohne konkrete Zahlen oder Hype-Texte, die den schwierigen Teil einfach überspringen.
Die jüngste Veranstaltung von DPM, „KI in der Praxis“, wurde konzipiert, um beides zu vermeiden. Drei Führungskräfte — eine aus einer Fintech-Kundenserviceorganisation, eine aus Amazons Bereich der Bedarfsplanung und eine von einem Online-Marktplatz, auf dem Autohäuser Gebrauchtwagen kaufen und verkaufen — zeigten die KI-Systeme, die sie tatsächlich entwickelt hatten, die dabei aufgetretenen Probleme und die daraus hervorgegangenen Zahlen.
Chris Hernandez, Senior Manager für KI-Operationen bei Chime, eröffnete die Sitzung mit einer Präsentation darüber, wie sein Team die Klassifizierung von Kontaktgründen bei Kundenserviceanrufen automatisiert hat. Aniket Ghonge, Senior Supply Chain Manager bei Amazon, stellte anschließend die agentenbasierte KI-Plattform vor, die er allein entwickelt hatte, um die Bedarfsplanung zu verbessern. Und Anika Banakh, Director of Technology Program Management bei ACV Auctions, schloss die Veranstaltung mit der durchgängigen digitalen Betriebsplattform ab, die ihr Team zur Modernisierung des Fahrzeugverkaufs entwickelt hatte.
Oberflächlich betrachtet haben die drei Projekte wenig gemeinsam. Doch alle verband ein gemeinsames Thema: Keines dieser Teams behandelte KI als etwas, das man einrichtet und anschließend sich selbst überlässt. Jedes System behielt eine menschliche Kontrollinstanz bei, selbst nachdem die manuelle Arbeit weggefallen war.
Mit KI mehr Fokus für die Mitarbeiter im direkten Kundenkontakt schaffen
Hernandez' Team begann damit zu untersuchen, was Callcenter-Mitarbeiter während eines Kundengesprächs tatsächlich taten, und es war mehr als nur das Lösen des Kundenproblems. Die Mitarbeiter machten sich auch Notizen und versuchten, das Gespräch dem richtigen Kontaktgrund zuzuordnen — aus mehr als 1.500 möglichen Kategorien — und das alles, während das Gespräch noch lief.
„Wir hatten mehr als 1.500 verschiedene Varianten von Kontaktgründen, aus denen sie auswählen sollten“, sagte Hernandez. „Und zu wissen, welcher davon der richtige war, war immer schwierig.“ Der Prozess war manuell, uneinheitlich und fehleranfällig und lenkte die Aufmerksamkeit vom Gesprächspartner am anderen Ende der Leitung ab.
Das Team entwickelte einen Klassifikator, der ein LLM nutzte, um Gesprächstranskriptionen zu überprüfen und den Kontaktgrund automatisch anzuwenden. Daraus entstand ein zweites, ungeplantes Projekt: Hernandez' Team verbrachte nun viel Zeit damit zu überprüfen, dass der Klassifikator keine Halluzinationen erzeugte und wie erwartet funktionierte. Deshalb entwickelten sie eine zweite KI-Pipeline, die ausschließlich die erste prüfte. Dieses System „gruppiert die wiederkehrenden Fehler, erkennt die Fehler, führt auch seine Tests durch und präsentiert meinem Team die Ergebnisse“, anstatt dass eine Person jeden einzelnen Fall überprüfen musste.
Der Weg dorthin war nicht einfach. Hernandez zufolge läuft jede Modellentscheidung auf drei Stellschrauben hinaus: Geschwindigkeit, Genauigkeit und Kosten. Ein kleineres, günstigeres Modell lieferte schnelle Ergebnisse, war aber weniger genau; ein größeres Modell, das mit der Komplexität umgehen konnte, war teurer. Nachdem das Prompt Engineering an eine Grenze gestoßen war, setzte das Team auf abrufbasierte Ansätze und Stapelverarbeitung, um die Kosten zu kontrollieren. Außerdem musste es einen „goldenen Datensatz“ aufbauen und kontinuierlich pflegen — eine verlässliche Quelle der Wahrheit, an der sich die Genauigkeit des Klassifikators messen ließ, selbst während sich die zugrunde liegenden Kontaktgründe ständig änderten.
Akzeptanz entstand, indem die Taxonomie selbst hinterfragt wurde, nicht nur das Modell. „Manchmal denken wir, man könnte einfach jede Lösung mit KI versehen und damit wäre alles erledigt“, sagte Hernandez. „Aber aus guten Eingabedaten entstehen gute Ausgabedaten. Und wenn die Eingabedaten schlecht sind, werden auch die Ausgabedaten schlecht.“ Das führte dazu, dass das Team seine Liste mit mehr als 1.500 Kontaktgründen vereinfachte, statt das Modell dazu zu bringen, damit umzugehen.
Zu den Ergebnissen gehörten Einsparungen bei der Gesprächsbearbeitung und eine effizientere Nachbearbeitung von Anrufen. Hernandez machte jedoch deutlich, worauf es am meisten ankam: den Mitarbeitern Zeit zurückzugeben, damit sie sich auf den Kunden und nicht auf die Büroarbeit konzentrieren konnten. „Wann immer wir Aufgaben automatisieren, entfernen wir die Kontrollinstanz nicht wirklich, sondern verlagern sie“, sagte er. „KI ist ein Multiplikator, um lästige Routinearbeit zu beseitigen, aber der Mensch im Prozess sorgt dafür, dass dieser Multiplikator tatsächlich vertrauenswürdig ist.“
Dieses Gleichgewicht zeigt sich direkt darin, wie die Prüf-Pipeline heute funktioniert. Anstatt darauf zu vertrauen, dass das System Änderungen direkt in die Produktion überführt, erstellt es einen wöchentlichen Bericht, der aufzeigt, wo Rückschritte oder Testfehler aufgetreten sind, sodass Hernandez' Team genau weiß, worauf es sich konzentrieren muss. „Dort finden wir das richtige Gleichgewicht“, sagte er, „indem wir versuchen, ein LLM als Prüfer und verschiedene Fähigkeiten zu nutzen, um mehr zu erweitern und zu übernehmen, ohne Risiken für das Unternehmen einzuführen.“
Automatisierung der Lieferkettenplanung mit agentenbasierter KI
Ghonges Team arbeitet mit Tausenden von Lieferanten und Partnern, und die für die Bedarfsprognose jedes einzelnen benötigten Daten waren über CRM-Software, Projektmanagement-Tools und Excel-Tabellen verstreut — ohne einheitliche Bezeichnungen von einem System zum nächsten. „Es gab keine Kontrolle über die Daten, weil die Datenpipelines aus unterschiedlichen Softwarelösungen kommen, mit unterschiedlichen Verantwortlichen und Benutzern“, sagte er.
Die manuelle Abstimmung all dieser Daten nahm Ghonge 16 bis 20 Stunden pro Woche in Anspruch – zu einem Zeitpunkt, als das Unternehmen noch vergleichsweise klein war. „Das war für mich verrückt“, sagte er. Also begann er zu experimentieren, zunächst mit einem Excel-Prototyp, um zu testen, ob der Ansatz funktionieren könnte. Das half, aber nicht vollständig. Daraufhin wandte er sich der agentenbasierten KI zu und entwickelte das System selbst – mit Erfahrung in der Erstellung von Dashboards und der Formulierung von Produktanforderungen, aber ohne formale Ausbildung im Engineering.
Die Einführung begann im kleinen Rahmen – Ghonge war der einzige Nutzer – und wuchs über informelle Kanäle: Geschäftsbesprechungen, gemeinsame Mittagssitzungen zum Lernen und Mundpropaganda. Vier Monate später hatte die Plattform mehr als 75 Nutzer und Tausende von Aufrufen.
Die Ergebnisse waren erheblich. Was früher 20 Stunden dauerte, nimmt nun zwei Stunden in Anspruch – eine Reduzierung der Zeit zur Erstellung einer Nachfrageprognose um 80 %, begleitet von einer Reduzierung des Prognosefehlers um 40 %. „Die größte Verbesserung ist eine Reduzierung der für die Erstellung der Nachfrage benötigten Zeit um 80 % bei gleichzeitig hoher Genauigkeit“, sagte Ghonge. „Außerdem haben wir eine Reduzierung des [Prognose-]Fehlers um etwa 40 % festgestellt.“ Das System verschaffte dem Team außerdem eine Transparenz, die es zuvor nie hatte – die Möglichkeit, genau aufzuschlüsseln, welche Lieferantenmerkmale Tausende monatlicher Änderungen verursachten, anstatt zu raten.
Das Vertrauen entstand nicht durch das KI-Label. Es entstand durch Transparenz. Als aus Projektmanagementdaten 18.000 Zeilen exportiert wurden, die tatsächlich nur 600 bis 700 echte Tickets darstellten, analysierte und konsolidierte Ghonges System dieses Durcheinander in einer übersichtlichen Tabelle, die Nutzer direkt prüfen konnten, anstatt das Quelltool Ticket für Ticket durchsuchen zu müssen. „Anstatt jedes Mal für jedes Ticket in das Tool zu gehen, können sie jetzt alles problemlos in einem System sehen“, sagte er. Die Nutzer konnten außerdem jede beliebige vorherige Woche aufrufen und mit der aktuellen vergleichen und dabei beobachten, wie die Prognosefehler im Laufe der Zeit zurückgingen – ein Beweis dafür, dass das System tatsächlich funktionierte und nicht nur automatisierte.
Ghonge schrieb der KI außerdem etwas zu, das er ursprünglich nicht eingeplant hatte: Dokumentation. Nachdem er begonnen hatte, die KI aufzufordern, seine eigenen Bereitstellungen und den dafür aufgewendeten Zeitaufwand zu verfolgen, konnte er seinen eigenen Entwicklungsprozess im Nachhinein quantifizieren – bis hin zur Anzahl der dafür erforderlichen Eingaben.
Aufbau einer KI-gestützten digitalen Betriebsplattform
Banakhs Team machte sich daran, den gesamten Verkaufsprozess für Fahrzeuge neu zu gestalten – wie Fahrzeuge auf den Markt gebracht, bewertet, vermarktet, mit Käufern zusammengebracht, verkauft, ausgeliefert und transportiert werden – und ihn als einen vernetzten digitalen Prozess abzubilden, anstelle des traditionellen Branchenmodells: Ein Kunde bringt einmal pro Woche ein Auto zu einer stationären Auktion und hofft, dass es an diesem Tag verkauft wird.
„Wir haben kürzlich für einen unserer wichtigsten Partner einen vollständig intelligenten digitalen durchgängigen Arbeitsablauf entwickelt, der die Erfassung von Fahrzeugdaten, die Inspektion, die Bewertung, die Vermarktung, die Suche nach Käufern, die Transaktion und die Abwicklung umfasst“, sagte Banakh. „Im Grunde ist alles zu einem durchgängigen Prozess verschmolzen.“
Der schwierigste Teil war nicht die Technologie. Es war die Branche selbst. „Der menschliche Faktor ist in dieser Branche bekanntermaßen digitalfeindlich“, sagte Banakh. „Ich sehe immer noch Händler mit Stift und Papier herumlaufen, um etwas zu dokumentieren.“ Das bedeutete, dass das Projekt mehr als eine Prozessänderung erforderte – es brauchte das, was Banakh als einen Paradigmenwechsel bei den grundlegenden Verhaltensweisen bezeichnete, und dabei kann leicht etwas schiefgehen.
Aufgrund des engen Zeitplans setzte Banakhs Team KI ein, um verschiedene Persönlichkeiten von Interessengruppen zu simulieren und gemeinsam zu erörtern, wie der Arbeitsablauf gestaltet werden sollte. „Im Grunde haben wir den Entwurf des Arbeitsablaufs gemeinsam erstellt“, sagte sie. „Anschließend wurde er unserem Partner zur Validierung vorgelegt. Dadurch wurden die Gespräche wirklich beschleunigt“ – langsame Validierungstreffen mit jeweils nur einer Person wurden durch einen Entwurf ersetzt, auf den der Partner direkt reagieren konnte.
Das Projekt befindet sich noch in einer frühen Pilotphase, daher konnte Banakh nur begrenzte Zahlen nennen. Das wichtigste Ergebnis stach jedoch hervor: Die Durchlaufzeit ist bereits um zwei Drittel gesunken, obwohl das System noch nicht vollständig optimiert wurde. „Die Durchlaufzeit ist derzeit um zwei Drittel reduziert, und wir haben noch nicht einmal vollständig optimiert“, sagte sie und fügte hinzu, dass anschließend auch mit einer Reduzierung der Kosten, der Wertminderung der Vermögenswerte und des menschlichen Arbeitsaufwands gerechnet werde.
Um skeptische Interessengruppen zu gewinnen, war kein aggressiver Verkaufsansatz erforderlich. „Man spricht über die Gründe und den ROI, und echte Geschäftsleute sind überzeugt, sobald sie das Ergebnis sehen“, sagte Banakh. Für Händler, die ihre Abläufe lieber auf die bisherige Weise fortführen möchten, ist das ebenfalls in Ordnung – das System ist für Partner konzipiert, die landesweit skalieren möchten, und nicht dafür, jeden Arbeitsablauf zu ersetzen, der für jemanden bereits funktioniert.
Die gemeinsame Verbindung
Unterschiedliche Branchen, unterschiedliche Tools, unterschiedliche Größenordnungen – aber dieselbe zugrunde liegende Disziplin. Hernandez' Team entwickelte ein zweites KI-System, nur um sicherzustellen, dass das erste zuverlässig blieb. Ghonge baute Transparenz in seine Plattform ein, damit Nutzer die Daten selbst überprüfen konnten, anstatt die Ergebnisse einfach als gegeben hinzunehmen. Banakhs Team sorgte für eine „enge Übergabe bei jedem Schritt“, wobei ein Programmmanager dafür verantwortlich war, Anomalien zu erkennen, die bei einer rein menschlichen Überprüfung sonst möglicherweise übersehen worden wären.
Keines dieser Teams erhielt Unterstützung, indem es AI als Konzept anpries. Sie erreichten dies, indem sie etwas Kleines auf den Weg brachten, dessen Funktionieren bewiesen und die Ergebnisse für sich sprechen ließen. Wie Banakh es ausdrückte: „Wahre Geschäftsleute lassen sich überzeugen, wenn sie das Ergebnis sehen.“ Das ist das Muster hinter allen drei Fallstudien: Es geht weniger um die AI selbst als um die Disziplin, gemeinsam mit ihr Vertrauen in das System einzubauen.
Möchten Sie mehr Einblicke wie diese? Melden Sie sich für ein kostenloses DPM-Konto an, um von weiteren Experten wie diesen zu hören und als Erste über bevorstehende Veranstaltungen informiert zu werden.
