Mänsklig kontrollpunkt: Framgångsrika AI-fallstudier behåller mänsklig granskning och flyttar tillsynen till undantag i stället för att eliminera ansvaret.
Klassificering av kontakter: Chime automatiserade klassificering och granskning av samtal, vilket hjälpte handläggarna att fokusera på kunderna samtidigt som modellens precision och försämringar över tid övervakades.
Förbättrad prognostisering: Amazons agentbaserade AI minskade tiden för efterfrågeplanering med 80 procent och prognosfelet med 40 procent genom renare och synliga data.
Integration av arbetsflöden: ACV Auctions minskade omloppstiden för fordonsförsäljning med två tredjedelar genom att koppla samman mottagning, värdering, marknadsföring, transaktioner och leverans.
Att bygga förtroende: Teamen skapade användning genom att börja i liten skala, visa mätbara resultat, förenkla röriga data och hålla intressenter ansvariga under hela införandet.
AI-fallstudier brukar komma i två varianter: vaga framgångshistorier utan några siffror, eller hajpade texter som hoppar direkt förbi den svåra delen.
DPM:s senaste evenemang, AI i verkligheten, skapades för att undvika båda. Tre ledare — en från en fintechorganisation inom kundservice, en från Amazons område för efterfrågeplanering och en från en onlinemarknadsplats där bilhandlare köper och säljer begagnade bilar — gick igenom de AI-system de faktiskt byggt, problemen de stötte på och siffrorna som kom ut på andra sidan.
Chris Hernandez, senior chef för AI-verksamheten på Chime, inledde sessionen med att berätta hur hans team automatiserade klassificeringen av kontaktorsaker för kundservicesamtal. Aniket Ghonge, senior försörjningskedjechef på Amazon, följde med den agentiska AI-plattform han byggde på egen hand för att lösa problem inom efterfrågeplanering. Och Anika Banakh, chef för teknisk programhantering på ACV Auctions, avslutade med den heltäckande digitala verksamhetsmotor som hennes team byggde för att modernisera fordonsförsäljningen.
De tre projekten har vid första anblicken inte mycket gemensamt. Men ett tema genomsyrade dem alla: inget av dessa team behandlade AI som något man konfigurerar och sedan lämnar. Alla system behöll en mänsklig kontrollpunkt, även efter att det manuella arbetet hade försvunnit.
Frigör fokus för personalen i frontlinjen med AI
Hernandez team började med att studera vad kundtjänstmedarbetare faktiskt gjorde under ett kundsamtal, och det handlade om mer än att lösa kundens problem. Medarbetarna antecknade också och försökte märka samtalet med rätt kontaktorsak — bland fler än 1 500 möjliga kategorier — samtidigt som samtalet fortfarande pågick.
"Vi hade över femtonhundra olika varianter av kontaktorsaker som de skulle välja mellan", sade Hernandez. "Och det var alltid svårt att veta vilken som var rätt." Processen var manuell, inkonsekvent och felbenägen, och den tog uppmärksamhet från medlemmen i andra änden av samtalet.
Teamet byggde en klassificerare som använde en LLM för att granska transkriberingar av samtal och automatiskt tillämpa kontaktorsaken. Det arbetet ledde till ett andra, oplanerat projekt: Hernandez team lade nu betydande tid på att kontrollera att klassificeraren inte hallucinerade och fungerade som förväntat. Därför byggde de en andra AI-pipeline enbart för att granska den första. Systemet "grupperar återkommande fel, upptäcker felen, genomför också sina tester och presenterar resultaten för mitt team" i stället för att kräva att en person granskar varje ärende.
Det var inte enkelt att nå dit. Hernandez sade att varje modellbeslut i grunden handlar om tre reglage: hastighet, noggrannhet och kostnad. En mindre och billigare modell gav snabba resultat men sämre noggrannhet; en större modell som kunde hantera komplexiteten innebar en högre prislapp. När promptteknik nådde en gräns vände sig teamet till hämtbaserade metoder och batchbearbetning för att hantera kostnaderna. De var också tvungna att bygga och kontinuerligt underhålla en "gyllene datamängd" — en tillförlitlig sanningskälla att mäta klassificerarens noggrannhet mot, även när de underliggande kontaktorsakerna fortsatte att förändras.
Förankringen kom genom att ifrågasätta själva taxonomin, inte bara modellen. "Ibland tänker vi att man kan lägga AI ovanpå varje lösning och att det ska vara den slutgiltiga lösningen", sade Hernandez. "Men bra data in ger bra data ut. Och om du har dålig data in kommer du att få dålig data ut." Det ledde teamet till att förenkla listan med över 1 500 kontaktorsaker i stället för att be modellen arbeta runt den.
Resultaten omfattade besparingar i samtalshanteringen och förbättrat efterarbete efter samtal, men Hernandez var tydlig med vad som betydde mest: att ge medarbetarna tid tillbaka så att de kunde fokusera på medlemmen, inte på pappersarbetet. "Varje gång vi automatiserar uppgifter tog vi egentligen inte bort kontrollpunkten, vi flyttade den", sade han. "AI är en multiplikator för att rensa bort rutinjobb, men människan i loopen är det som gör multiplikatorn verkligt tillförlitlig."
Den balansen syns direkt i hur granskningspipelinen fungerar i dag. I stället för att lita på att systemet skickar ändringar direkt till produktion genererar det en veckorapport som markerar var regressioner eller testfel har inträffat, så att Hernandez team vet exakt var de ska fokusera. "Det är där vi hittar balansen", sade han, "genom att försöka utnyttja LLM som bedömare och olika funktioner för att kunna utöka och ta oss an mer utan att införa någon risk för verksamheten."
Automatisera planeringen av försörjningskedjan med agentisk AI
Ghonges team arbetar med tusentals leverantörer och partner, och de data som behövdes för att prognostisera efterfrågan för var och en av dem var utspridda i CRM-programvara, projektledningsverktyg och Excel-ark — utan någon konsekvens i hur de var märkta från ett system till nästa. "Det fanns ingen kontroll över data eftersom datapipelines kom från olika programvaror, med olika ägare och användare", sade han.
Att sammanställa allt manuellt tog Ghonge 16 till 20 timmar i veckan, vid en tidpunkt då verksamheten fortfarande var relativt liten. "Det var galet för mig", sade han. Därför började han experimentera, först med en Excel-prototyp för att testa om metoden kunde fungera. Det hjälpte, men inte helt. Då vände han sig till agentisk AI och byggde systemet själv, med bakgrund inom arbete med instrumentpaneler och produktkrav men utan formell ingenjörsutbildning.
Införandet började i liten skala — Ghonge var den enda användaren — och växte genom informella kanaler: verksamhetsmöten, lunchseminarier och rekommendationer från person till person. Fyra månader senare hade plattformen fler än 75 användare och tusentals visningar.
Resultaten var betydande. Det som tidigare tog 20 timmar tar nu två, vilket innebär en minskning med 80 % av tiden för att skapa en efterfrågeprognos, tillsammans med en minskning med 40 % av prognosfelet. "Den största effekten är ungefär 80 % mindre tid som krävs för att skapa en efterfrågeprognos och en hög noggrannhet", sade Ghonge. "Vi såg också en minskning av [prognosfelet] med ungefär 40 %." Systemet gav dessutom teamet en insyn som de aldrig tidigare hade haft — möjligheten att exakt se vilka leverantörsegenskaper som drev tusentals månatliga förändringar, i stället för att gissa.
Förtroendet kom inte från AI-märkningen. Det kom från transparens. När projektledningsdata exporterades som 18 000 rader som i själva verket motsvarade bara 600 till 700 verkliga ärenden, tolkade och sammanförde Ghonges system röran till en ren tabell som användarna kunde granska direkt, i stället för att gå igenom källverktyget ärende för ärende. "I stället för att gå till verktyget varje gång för varje ärende kan de nu enkelt se allt i ett system", sade han. Användarna kunde också ta fram valfri tidigare vecka och jämföra den med den aktuella, samt följa hur prognosfelen minskade över tid — ett bevis på att systemet faktiskt fungerade och inte bara automatiserade.
Ghonge tillskrev också AI något som han ursprungligen inte hade planerat för: dokumentation. När han började be AI:n att följa hans egna driftsättningar och den tid han lade ner kunde han i efterhand kvantifiera sin egen utvecklingsprocess — ända ner till antalet instruktioner som krävdes för att nå dit.
Att bygga en AI-driven motor för digital verksamhet
Banakhs team satte sig för att tänka om kring hela fordonsförsäljningsresan — hur fordon tas ut på marknaden, värderas, presenteras, matchas med köpare, säljs, levereras och transporteras — som en sammanhängande digital process i stället för branschens traditionella modell: att en kund tar en bil till en fysisk auktion en gång i veckan och hoppas att den säljs samma dag.
"Vi har nyligen byggt ett komplett intelligent digitalt arbetsflöde från början till slut för en av våra kärnpartner, inklusive: insamling av fordonsdata, inspektion, värdering, presentation, köparidentifiering, transaktion och leverans", sade Banakh. "Allt har verkligen omvandlats till en enda kontinuerlig process."
Det svåraste var inte tekniken. Det var själva branschen. "Den mänskliga faktorn är ökänd för att vara digitalt motvillig i den här branschen", sade Banakh. "Jag ser fortfarande återförsäljare gå omkring med penna och papper för dokumentation." Det innebar att projektet krävde mer än en processförändring — det behövde det som Banakh kallade ett paradigmskifte i centrala beteenden, vilket är lätt att göra fel.
Med en snäv tidsplan använde Banakhs team AI för att simulera en rad olika intressenters personligheter och diskutera hur arbetsflödet borde sättas samman. "I princip slutade det med att vi samskapade ett utkast till arbetsflödet", sade hon. "Sedan presenterades det för vår partner för validering. Och det påskyndade verkligen diskussionerna" — långsamma valideringsmöten en i taget ersattes med ett utkast som partnern kunde reagera direkt på.
Projektet befinner sig fortfarande i ett tidigt pilotstadium, så Banakh kunde bara dela med sig av begränsade siffror, men huvudresultatet var tydligt: cykeltiden har redan minskat med två tredjedelar, innan systemet ens har optimerats helt. "Cykeltiden har minskat med två tredjedelar just nu, och vi har inte ens optimerat det fullt ut", sade hon och tillade att minskningar av kostnader, tillgångars värdeminskning och mänskligt arbete förväntas följa.
Att få skeptiska intressenter med på tåget krävde ingen hård försäljning. "Man talar om logiken och avkastningen på investeringen, och riktiga affärsmänniskor övertygas när de ser resultatet", sade Banakh. För återförsäljare som föredrar att fortsätta göra saker på det gamla sättet går det också bra — systemet är byggt för partner som vill skala upp nationellt, inte för att ersätta varje arbetsflöde som redan fungerar för någon.
Den gemensamma nämnaren
Olika branscher, olika verktyg, olika skalor — men samma grundläggande disciplin. Hernandez team byggde ett andra AI-system enbart för att hålla det första ärligt. Ghonge byggde in insyn i sin plattform så att användarna själva kunde verifiera uppgifterna i stället för att blint lita på resultatet. Banakhs team såg till att ha en "varm överlämning i varje steg", med en programledare som ansvarade för att upptäcka avvikelser som mänsklig granskning annars kunde missa.
Inget av dessa team fick stöd genom att presentera AI som ett koncept. De fick det genom att lansera något litet, bevisa att det fungerade och låta resultaten tala för sig själva. Som Banakh uttryckte det: ”riktiga affärsmänniskor blir övertygade när de ser resultatet.” Det är mönstret bakom alla tre fallstudierna: det handlar mindre om AI i sig och mer om disciplinen att bygga in förtroende i systemet tillsammans med det.
Vill du ha fler insikter som dessa? Registrera dig för ett kostnadsfritt DPM-konto för att ta del av fler experters perspektiv och bli först med att få veta om kommande evenemang.
