Vertrouwen in AI is geen gevoel—het is iets waarvoor je bewust kunt ontwerpen (of dat je per ongeluk kunt ondermijnen). In deze aflevering gaat Galen in gesprek met Cal Al-Dhubaib over ‘vertrouwensengineering’: een gedeelde gereedschapskist die multidisciplinaire teams (engineering, UX, governance, risico en bedrijfsvoering) helpt om over dezelfde vertrouwensrisico’s in dezelfde taal te praten. Ze bespreken waarom ‘saaie AI veilige AI is’, hoe vangrails en overdrachten aan mensen daadwerkelijk vertrouwen behouden, en waarom de grootste problemen vaak niet in het model zitten, maar in de systemen (en prikkels) eromheen.
Je hoort ook praktijkvoorbeelden van vertrouwen dat de verkeerde kant opgaat—van bevooroordeelde uitkomsten en gehallucineerde ‘psychologische manipulatie’ tot door AI ondersteunde opleveringen die tot nauwkeurigheidsproblemen leiden—en wat projectleiders kunnen doen om te voorkomen dat er met de vinger wordt gewezen wanneer dat gebeurt.
Wat je leert
- Wat ‘vertrouwensengineering’ is—en waarom het in feite een gedeeld communicatiekader is, niet alleen een technische checklist
- Waarom ‘minder AI’ (strategische AI-minimalisatie) de meest verantwoorde en effectieve aanpak kan zijn
- Hoe je AI-ervaringen ontwerpt met verwachtingsmanagement, beslissingsontwerp, governance en vertrouwensinfrastructuur
- Waarom duidelijk eigenaarschap belangrijk is: gedeelde verantwoordelijkheid vereist nog steeds één verantwoordelijke eigenaar
- Praktische manieren om vertrouwen te meten aan de hand van incidentpreventie, observeerbaarheid en signalen uit gebruikersgedrag
- Hoe vertrouwen verschilt tussen culturen en contexten—en waarom er geen universele definitie is om te ‘coderen’
Belangrijkste inzichten
- Vertrouwen faalt standaard wanneer niemand eigenaar is. Cal formuleert het onomwonden: wanneer vertrouwen ‘ieders taak’ is, wordt het ‘niemands taak’. Teams hebben een aangewezen eigenaar nodig die ervoor zorgt dat de juiste vragen worden gesteld—vooral wanneer dingen ingewikkeld worden en de schuldvraag rondgaat.
- ‘Saaie AI’ is geen achteruitgang—het is risicobeheer. De veiligste AI is vaak de minst spectaculaire: beperkt afgebakend, gebaseerd op gecontroleerde gegevens en ontworpen met uitwegen. Als je AI-ervaring eindeloos open probeert te zijn, kun je gebruikers overweldigen en het risico vergroten.
- Gebruik ‘strategische AI-minimalisatie’ om resultaten te beschermen. In het project voor het verwerken van transcripties was een nauwkeurigheid van 90% niet de winst—weten welke 10% faalt was dat wel. Ze stuurden invoer met een hoger risico (zoals bepaalde internationale of niet-standaardtranscripties) naar een wachtrij voor menselijke beoordeling, in plaats van op automatisering te gokken.
- Vangrails zijn niet alleen technisch—ze zijn ook ervaringsontwerp. Het voorbeeld van Behr Paint en ‘Chat Hue’ laat zien hoe vertrouwen wordt opgebouwd met bewuste grenzen: het kan kleuren aanbevelen, maar draagt het over aan mensen voor advies met grotere gevolgen (zoals mengen of aanbrengen) en vermijdt onveilige of niet bij het merk passende resultaten.
- Governance draait om drie vragen, niet om een document van 200 pagina’s. Cal geeft het praktisch weer:
- Wat heb je vooraf gedaan om schade te beperken?
- Hoe weet je dat het in productie fouten maakt (observeerbaarheid)?
- Wat doe je wanneer het faalt—en heb je dat plan aan stresstests onderworpen?
- Vertrouwen meten kan verrassend vertrouwd zijn. Naast het ‘voorkomen van incidenten’ blijkt vertrouwen uit de vraag of gebruikers hun doelen kunnen bereiken, of ze terugkomen en waar ze afhaken. Als de tool niet nuttig is, zullen mensen er geen tijd aan willen besteden op basis van ‘vertrouwen’.
- Soms ligt het vertrouwensprobleem bij menselijke prikkels, niet bij de AI. Wanneer iemands bonus of prestaties op het spel staan, kan die persoon gemotiveerd zijn om AI-aanbevelingen af te wijzen (of te saboteren). Vertrouwensengineering moet daarom ook organisatieontwerp omvatten, niet alleen modelontwerp.
- Er is geen enkele morele ‘waarheid’ om te coderen. Het voorbeeld van ethiek rond zelfrijdende auto’s brengt het grotere idee goed over: vertrouwen en ethiek verschillen per culturele context. AI kan vertrouwen niet op magische wijze beter ‘oplossen’ dan mensen als mensen het in de eerste plaats niet eens zijn over wat vertrouwen zou moeten betekenen.
Hoofdstukken
- 00:00 – Wat is vertrouwenstechniek?
- 03:58 – Wie is verantwoordelijk voor vertrouwen?
- 05:27 – AI-incidentendatabase
- 08:41 – Risico’s in gereguleerde sectoren
- 10:34 – Strategische AI-minimalisatie
- 12:11 – Vertrouwenstechniek gedefinieerd
- 15:29 – Rechtvaardigheid definiëren
- 17:10 – Vier pijlers van vertrouwen
- 18:03 – De casus van Behr Paint
- 23:15 – Fouten in spraak-AI
- 25:53 – Governance in de praktijk
- 31:31 – Met de vinger wijzen voorkomen
- 35:31 – Vertrouwen meten
- 37:46 – AI, ethiek & cultuur
- 42:13 – Waarom vertrouwen een raamwerk is
Maak kennis met onze gast

Cal is een wereldwijd erkende datawetenschapper, ondernemer en innovator op het gebied van verantwoorde kunstmatige intelligentie voor sterk gereguleerde omgevingen, waaronder de gezondheidszorg, energie en financiële dienstverlening. Hij geeft leiding aan AI en datawetenschap bij Further, een partner voor digitale transformatie die enkele van ’s werelds bekendste merken helpt om met data en AI slimmere, meer gepersonaliseerde klantreizen te creëren.
Voordat hij bij Further kwam, richtte Cal Pandata op en liet hij het bedrijf groeien. Pandata is een bedrijf voor AI-ontwerp en -ontwikkeling dat samenwerkte met organisaties zoals Cleveland Clinic, Progressive Insurance en FirstEnergy en in 2024 door Further werd overgenomen. Hij is een veelgevraagd spreker op het gebied van AI-innovatie, governance en geletterdheid en bereikt duizenden leiders tijdens grote branche-evenementen, waaronder MAICON, ODSC, AI Summit, TDWI en DataCamp.
Bronnen uit deze aflevering:
- Word lid van de community van Digital Project Manager
- Abonneer je op de nieuwsbrief om onze nieuwste artikelen en podcasts te ontvangen
- Kom in contact met Cal via LinkedIn
- Bekijk Further
- AI-incidentendatabase
Gerelateerde artikelen en podcasts:
Galen Low: Wat is vertrouwen in engineering en hoe leidt het tot veilige AI-oplossingen en -ervaringen?
Cal Al-Dhubaib: Het is een gedeelde communicatietoolkit die verschillende persona's helpt die samenwerken aan het ontwerp en de invoering van AI-oplossingen, zodat ze productiever kunnen praten over het behouden van vertrouwen. Er moest een gedeelde manier komen waarop al deze mensen over hetzelfde konden praten en een vergelijkbaar begrip konden ontwikkelen van de manieren waarop vertrouwen door AI kan worden geschonden, en vervolgens van de toolkits om zich daartegen te verdedigen.
Galen Low: Hoe kan een projectteam de verantwoordelijkheid voor het opbouwen van vertrouwen in hun oplossingen delen en voorkomen dat mensen naar elkaar wijzen?
Cal Al-Dhubaib: Een interessant aspect van verantwoordelijkheid is dat, als het ieders verantwoordelijkheid is, niemand er eigenaar van is. Uiteindelijk heb je dus iemand nodig die dit aspect op zich neemt. We hebben daadwerkelijk aan elk van deze AI-projecten iemand toegewezen, zodat we zeker weten dat we de juiste vragen stellen.
Galen Low: Hoe lang denk je dat het duurt voordat AI het menselijke concept van vertrouwen beter begrijpt dan mensen zelf?
Cal Al-Dhubaib: Ik denk echt dat de definitie van AI zo circulair is. Hoe kan AI vertrouwen beter begrijpen dan mensen? Dat weet ik niet, maar ook —
Galen Low: Welkom bij de podcast van The Digital Project Manager — de show die leiders op het gebied van oplevering helpt slimmer te werken, soepeler te leveren en hun teams met vertrouwen te leiden in het tijdperk van AI. Ik ben Galen, en elke week duiken we in echte strategieën, opkomende trends, bewezen raamwerken en af en toe een waargebeurd verhaal uit de frontlinie van projecten. Of je nu enorme transformatieprojecten aanstuurt, AI-workflows in goede banen leidt of gewoon probeert de chaos onder controle te houden, je bent hier aan het juiste adres. Laten we beginnen.
Oké, vandaag hebben we het over hoe vertrouwen kan worden ingebouwd in AI-aangedreven ervaringen, waarom dat zo belangrijk is voor organisaties die AI-oplossingen uitrollen in gereguleerde sectoren, en welke rol het projectteam — en vooral de projectleider — speelt bij het creëren van dat vertrouwen.
Vandaag heb ik Cal Al-Dhubaib bij me, hoofd AI & datawetenschap bij Further, een bedrijf dat helpt klantbelevingen te transformeren met data en AI. Cal is expert op het gebied van AI en datawetenschap, ondernemer, veelgevraagd spreker in het openbaar en de nieuwe presentator van de Open Data Science-podcast. Hij gebruikt zijn diepgaande ervaring in datawetenschap om organisaties te helpen de kloof tussen AI-innovatie en ethische verantwoordelijkheid te overbruggen, zodat hun AI-uitrol aansluit bij hun waarden en doelstellingen.
Door zijn werk in de technologiesector van Cleveland is Cal bovendien erkend als een van Crane Cleveland's top 20 onder de twintig, als opmerkelijke immigrant-leider en opmerkelijke technologiebestuurder, terwijl hij ook vier keer winnaar is geweest van de Cleveland Smart 50 Awards.
Cal, heel erg bedankt dat je vandaag bij me bent.
Cal Al-Dhubaib: Galen, bedankt voor de uitnodiging. Ik kijk uit naar dit gesprek.
Galen Low: Ik ook. Ik heb onze gesprekken ter voorbereiding hierop erg leuk gevonden. Jij weet absoluut waar je het over hebt. Je bent al een tijdje actief in dit circuit. Gefeliciteerd met je rol als presentator van de Open Data Science-podcast. Er gebeuren veel mooie dingen bij jou.
Ik weet dat je hier diep in zit en er gepassioneerd over bent, en ik hoop dat dit gesprek onverwachte kanten opgaat. Maar voor het geval dat: dit is de routekaart die ik vandaag voor ons heb geschetst. Om te beginnen wilde ik je mening vragen over een grote, prangende vraag waarvan mijn luisteraars het antwoord willen weten.
Daarna wil ik dat uitpakken en het over drie dingen hebben. Ten eerste wil ik bespreken wat het betekent om vertrouwen in een AI-oplossing te ontwerpen en wat de verantwoordelijkheid van het projectteam is om het vertrouwen in de oplossingen die het ontwerpt te handhaven. Daarna wil ik manieren verkennen waarop vertrouwen kan worden gemeten en gecontroleerd, vooral binnen het kader van gereguleerde sectoren, maar ook verder dan alleen naleving.
Tot slot wil ik jouw visie horen op de toekomst en op hoe onze kijk op vertrouwen de komende jaren kan evolueren, naarmate we collectief beter begrijpen hoe met onze gegevens wordt omgegaan en waarvoor ze kunnen worden gebruikt in het tijdperk van AI. Dat was veel. Hoe klinkt dat voor jou?
Cal Al-Dhubaib: O ja. We gaan heel veel terrein bestrijken. Het is ambitieus en ik doe mee.
Galen Low: Geweldig. Laten we erin duiken. Ik wilde beginnen met één grote, lastige vraag. Een van de grote onderwerpen waar jij over praat, is het idee om vertrouwen in AI-oplossingen en -ervaringen te ontwerpen, vooral omdat gebruikers, bedrijven en toezichthoudende organisaties AI niet volledig zullen invoeren als ze niet kunnen vertrouwen op wat het zal doen.
Mijn lastige vraag is deze: wanneer je AI-oplossingen bouwt en uitrolt, wie is er dan eigenaar van vertrouwen als vereiste voor de oplossing, en wat gebeurt er wanneer dat vertrouwen ontbreekt in een AI-aangedreven ervaring?
Cal Al-Dhubaib: Het eenvoudige antwoord daarop is: standaard is niemand er eigenaar van, en dat is het grote probleem. Dat probeer ik op te lossen met de cursus die ik aan het ontwikkelen ben over vertrouwenstechniek.
En eerlijk gezegd doet het me denken aan de beginjaren van datawetenschap, toen iemand binnen analytics er eigenaar van kon zijn, of iemand binnen IT, of iemand binnen financiën. Het maakte niet zo veel uit waar het was ondergebracht, zolang er maar duidelijk eigenaarschap was over wie verantwoordelijk en aanspreekbaar was voor die capaciteit.
Hetzelfde geldt dus voor het ontwerpen van vertrouwen in deze AI-oplossingen. En je raadt het waarschijnlijk al: als het geen onderdeel is van het ontwerpproces, leidt de oplossing uiteindelijk tot onbedoelde gevolgen. Er is dus geen gebrek aan voorbeelden. Een van de bronnen die ik vaak aanhaal en waarnaar ik mensen verwijs, is de AI Incident Database. Ik heb net de meest recente cijfers bekeken voor heel 2025.
En niet verrassend is het aantal incidenten jaar na jaar zonder uitzondering blijven stijgen.
Galen Low: Interessant. Kun je meer vertellen over hoe de database een incident benadert of definieert?
Cal Al-Dhubaib: Ik vind het geweldig, omdat ze nieuwsbronnen doorspitten en een incident vanuit meerdere perspectieven bekijken.
Als meerdere onafhankelijke nieuwsbronnen een bepaald verhaal hebben behandeld, bundelen ze alles tot één incident en kun je alle berichtgeving eromheen bekijken. Een vroeg voorbeeld hiervan was de lancering van de creditcard van Apple, die aanvankelijk onder gelijke omstandigheden lagere kredietlimieten aan vrouwen dan aan mannen gaf.
En er zijn recentere voorbeelden in die incidentendatabase, zoals het geval van AnyScale. Zij staan bekend om hun oplossing voor het coderen met agents en hadden een probleem waarbij gebruikers willekeurig werden buitengesloten. Hun AI-aangedreven chatbot gaf vervolgens ironisch genoeg een verzonnen antwoord. Daardoor raakten gebruikers juist verder in de war.
Ze voelden zich gemanipuleerd en annuleerden uiteindelijk hun abonnementen. En nog afgelopen herfst had een van de vier grote adviesbureaus een bepaald opleveringsproduct ingediend. Dit was niet eens een AI-oplossing; AI was alleen gebruikt bij het maken ervan. Het product werd ingediend bij de Australische overheid en bevatte aanzienlijke nauwkeurigheidsproblemen als gevolg van hallucinaties.
We hebben dus voorbeelden die teruggaan tot 2016 en 2017, de beginjaren van machine learning, en we zien de afgelopen jaren een groeiend aantal incidenten. Al deze incidenten worden geregistreerd en gevolgd in de AI Incident Database.
Galen Low: Wat ik goed vind aan de drie voorbeelden die je gaf, is dat ze een bepaald spectrum aan incidenten bestrijken. Ten eerste is er een soort vooroordeel dat waarschijnlijk is geprogrammeerd, toch? Het komt niet zomaar uit het niets. Het zit waarschijnlijk in de trainingsdata.
Cal Al-Dhubaib: Absoluut, het bestaat in onze gegevens.
Galen Low: Het tweede voorbeeld ging meer over, denk ik, AI-manipulatie. Dat is de beste term ervoor. Alsof het systeem zegt: nee, jij bent eigenlijk het probleem, dus we sluiten je buiten. En dan denk je: o, AI is blijkbaar slimmer dan ik; misschien zou ik moeten worden buitengesloten. Wacht, nee, dat zou ik niet moeten worden.
Cal Al-Dhubaib: O ja, je hebt gelijk. Daar had ik nog niet zo over nagedacht.
Galen Low: Precies. En dan vind ik het derde voorbeeld ook interessant, omdat het laat zien hoe nauwkeurigheid kan ontsporen. Het heeft te maken met hallucinaties, met mensen in de besluitvormingslus, met vertrouwen en met onze zorgvuldigheid.
Cal Al-Dhubaib: Honderd procent.
Galen Low: Ik denk dat dit een heel goed vertrekpunt is voor dit gesprek, omdat ik hoop dat we al die onderwerpen en meer kunnen behandelen.
Het gaat om veel meer dan alleen: we zijn transparant over wat we met je gegevens doen. Het gaat om veel meer dan dat als het gaat om wat een oplossing betrouwbaar maakt. Misschien kunnen we even uitzoomen en dit verder bekijken. Jij richt je sterk op zwaar gereguleerde sectoren.
Denk aan gezondheidszorg, financiële dienstverlening en defensie. Sectoren waarin ethisch en verantwoord gebruik van gevoelige gegevens niet alleen het juiste is om te doen, maar waarin er ook ernstige gevolgen zijn voor niet-naleving. En als we dat uitbreiden naar het idee van vertrouwen — dus niet alleen gegevensprivacy en gegevensbeveiliging — zijn twee ideeën die ik in jouw werk heb gezien het concept van vertrouwenstechniek en het idee dat saaie AI veilige AI is.
Cal Al-Dhubaib: Dat vind ik geweldig. We proberen het glanzender te maken dan het is, en ik heb dit al vroeg in mijn loopbaan geleerd. Het kenmerk van werken in deze zwaar gereguleerde omgevingen is dat de kosten van een fout hoog zijn. En met AI-systemen krijg je trouwens één garantie: ze maken fouten.
Galen Low: Daar zit wat in.
Cal Al-Dhubaib: Ik herinner me dat ik in het begin met ziekenhuissystemen werkte en liet zien hoe we machine learning konden gebruiken om verschillende voorspellende modellen te bouwen. Vervolgens begonnen we te bespreken dat we ervoor moesten zorgen dat die modellen goed presteerden voor alle demografische groepen.
Je wilt bijvoorbeeld niet dat het systeem slechter presteert voor bepaalde minderheidsgroepen en daardoor problemen veroorzaakt. Wat er in die eerste jaren gebeurde — ik heb het over 2016, 2017 en 2018 — was dat de reactie soms luidde: dat klinkt als een enorme aansprakelijkheid en we weten niet zeker of de opbrengst die we voor de hele bevolking zouden behalen dit project wel rechtvaardigt.
Veel projecten belandden daardoor op de plank, omdat de risicotolerantie simpelweg ontbrak en er geen bevredigende manier was om te zeggen: één, twee, drie, vier — zo pak je dit aan.
Galen Low: Ik sprak met anderen hierover. Ik had Lauren Wallace in de podcast en we hadden het over het idee dat bedrijven die in zwaar gereguleerde sectoren opereren, een ingebouwde risicomaatstaf hebben.
Ze hebben toleranties gedefinieerd. Het verbaast me dus niet echt dat ze zeggen: oké, dit gaat onze risicotolerantie en risicodrempel te boven. We kunnen niet verdergaan. Zo werken we nu eenmaal. Het betekent niet dat de technologie slecht is of dat iemand iets verkeerd heeft gedaan, maar we kunnen dit risico niet nemen totdat de technologie, onze gegevens, ons beleid en uiteindelijk de wetgeving er klaar voor zijn.
Ik vind dat eigenlijk bewonderenswaardig. Het is veilig en saai. Veel mensen zouden zeggen: wat zonde, wat een verspilling. Maar het is nog steeds een stap in de goede richting en een pauze om de juiste redenen, in plaats van er blind in te vliegen.
Cal Al-Dhubaib: Honderd procent. Een grappige uitspraak die ik hoorde en die echt bij me is blijven hangen, is: soms is de beste AI minder AI.
Een van de dingen waar ik over praat, is strategische AI-minimalisatie. Als recent voorbeeld werkten we met een instelling voor hoger onderwijs aan het verwerken van studenttranscripties. We wilden verder gaan dan traditionele robotische procesautomatisering en op extractie met grote taalmodellen gebaseerde technologie gebruiken voor een hogere nauwkeurigheid.
Deze transcripties komen in enorm veel verschillende formaten binnen. Het beste resultaat dat we konden behalen was 90 procent nauwkeurigheid, wat in deze context behoorlijk goed is voor een AI-oplossing. Hun eerste vraag was: goed, gedurende welke 10 procent van de tijd zit het systeem fout? Dat is logisch. Anders ga je gewoon naar het casino, rol je met de dobbelstenen en krijg je één op de tien keer een fout. Daar kun je geen bedrijf op runnen.
Wat we uiteindelijk deden, was onderzoeken wanneer de AI waarschijnlijk fouten zou maken. Sommige transcripties kwamen van internationale instellingen en andere kwamen uit een trimesterstelsel in plaats van een kwartalenstelsel. Vervolgens maakten we een lijst met regels: als het transcript van een van deze bronnen komt, sturen we het naar een handmatige wachtrij. De AI verwerkt de rest.
We automatiseren dus niet honderd procent van de workflow, maar wel genoeg op een gebied waar het veilig is en waar je waarschijnlijk een nauwkeuriger resultaat krijgt in het onderdeel dat je vertrouwt. Dat is slechts één voorbeeld van vertrouwenstechniek in de praktijk.
Galen Low: Misschien kunnen we daarop ingaan, want ik vind het geweldig dat je bezig bent met een cursus over vertrouwenstechniek voor LinkedIn Learning. Kun je ons een definitie geven? Wat is vertrouwenstechniek en hoe leidt het tot veilige AI-oplossingen en -ervaringen?
Cal Al-Dhubaib: Het is een gedeelde communicatietoolkit die verschillende persona's helpt die samenwerken aan het ontwerp en de invoering van AI-oplossingen, zodat ze productiever kunnen praten over het behouden van vertrouwen.
Ik merkte dat verschillende mensen het vertrouwensprobleem vanuit verschillende invalshoeken benaderden en niet allemaal dezelfde taal spraken. Je hebt AI-engineers, van wie velen inmiddels bekend zijn met statistische problemen zoals statistisch schadelijke vooroordelen in gegevenssets. Maar je hebt ook risicomanagementspecialisten en auditors, die kijken naar de blootstelling van de organisatie aan risico's.
Je hebt governance-specialisten die nadenken over hoe je aannames documenteert. Je hebt ontwerpers van gebruikerservaringen die nadenken over de manier waarop mensen met het systeem omgaan. En je hebt zakelijke belanghebbenden die de vereisten en het bedrijfsprobleem definiëren.
Er moest een gedeelde manier komen waarop al deze mensen over hetzelfde konden praten en een vergelijkbaar begrip konden ontwikkelen van de manieren waarop vertrouwen door AI kan worden geschonden, en vervolgens van de toolkits om zich daartegen te verdedigen.
Galen Low: Ik vind het geweldig dat het een gedeelde taal en een raamwerk is om sommige van deze problemen vast te stellen en bijna stap voor stap op te lossen.
Wat ik er mooi aan vind, is dat je het eerder had over datawetenschap en de rol van de data-analist. In bepaalde omgevingen, vooral bij klantbeleving, hoor je vaak: laat gewoon iemand van data komen, die lost alles op. Het is hun verantwoordelijkheid en het is gecentraliseerd.
Ze zijn verantwoordelijk voor datacleanliness, gegevensnauwkeurigheid en al het andere. Iedereen ontdekt echter snel dat het niet bij één persoon kan liggen. Het is teamwerk. Het is samenwerkingswerk. Ik vind het mooi dat dit een crossfunctioneel raamwerk is om mensen samen te laten werken.
Cal Al-Dhubaib: Honderd procent.
Galen Low: Dit sluit ook aan bij wat je zei over het strategisch minimaliseren van AI: het hoeft niet alles of niets te zijn. Is deze workflow honderd procent AI of geen AI? Volgens mij past dat perfect bij het idee dat er samenwerking is tussen AI en mensen. Zoals het er vandaag voorstaat, moeten we allemaal AI begrijpen en een gedeelde woordenschat hebben om zinvolle gesprekken te voeren tijdens het ontwerp- en implementatieproces.
We moeten elkaar ook begrijpen. Dat is herkenbaar. Projectmanagers zijn bijvoorbeeld dol op methodologieën. We denken: welke methodologie is het beste voor dit project? Soms duiken we te diep in details en specificaties.
Maar in de kern is het gewoon bedoeld om samen op één lijn te komen over samenwerken en iets opleveren. Ik denk dan: verdorie, ik heb dit nodig — of om te vertalen tussen belanghebbenden zodat we allemaal over hetzelfde praten. Iedereen is vast wel eens betrokken geweest bij een project waarin dingen simpelweg verloren gingen in de vertaling.
We hebben allemaal verschillende specialisaties.
Cal Al-Dhubaib: Het is makkelijk om aan te nemen: dat is afgedekt.
Galen Low: En dat vind ik hier zo goed aan. Het maakt er een teamsport van. Dit is een raamwerk voor vertrouwenstechniek. We doen dit allemaal samen. Ik kan me voorstellen dat privacy er ook onder valt, maar hetzelfde geldt voor toegankelijkheid en andere zaken die niemand alleen kan bezitten binnen een complexe oplossing, zelfs niet binnen eenvoudige oplossingen.
Cal Al-Dhubaib: Een eenvoudig voorbeeld is het concept van eerlijkheid bij het bouwen van een model voor toelating van studenten. Daar hebben we onlangs mee te maken gehad. Een deel van de vereiste was dat het model voor verschillende demografische groepen aan de kwaliteitseisen moest voldoen.
De klant vroeg: hoe ga je dat vaststellen? Wij antwoorden dan: we moeten eerst begrijpen hoe jullie eerlijkheid definiëren, want er zijn 22 verschillende manieren om eerlijkheid te berekenen. Eerlijk gezegd valt dat buiten de verantwoordelijkheid van de engineer. Ik kan je vertellen welke formules er zijn en hoe je die op verschillende manieren berekent.
Maar ik heb jullie nodig om te zeggen: wat is jullie beleid? Hoe hanteren jullie deze definitie en wat is voor jullie correct?
Galen Low: Er zijn veel mensen die AI pessimistisch bekijken of sombere voorspellingen doen over hoe AI ons een bepaalde richting op zal sturen zonder onze invloed.
Maar volgens mij gebeurt ook het omgekeerde. AI dwingt ons te kijken naar dingen die we al tientallen jaren doen. Zijn ze ethisch? Zijn ze eerlijk? Hebben we gewoon beslissingen uit de losse pols genomen? Nu moeten we een keuze maken. Net zoals ontwerpers van autonome voertuigen al lange tijd moeten beslissen of een auto beter tegen een school kan botsen of tegen een veld met twee huizen.
Het is geen comfortabele beslissing, maar er is beleid voor. We zeggen: het is een kwestie van oordeel, geval per geval, enzovoort. We maken het voor onszelf wat zachter, maar —
Cal Al-Dhubaib: Het kan inderdaad zo ernstig zijn, maar het kan ook veel eenvoudiger en alledaagser zijn. Deze systemen zijn vaak zo open — vooral generatieve AI-systemen.
Je kunt bijna alles aan zo'n oplossing vragen, en wat we zien is dat dit de consument kan overweldigen.
Galen Low: Interessant.
Cal Al-Dhubaib: Het is juist prettig om een beperkt beeld te hebben van wat ik met deze tool kan doen. Ik werk met vier pijlers binnen vertrouwenstechniek: verwachtingsmanagement, beslissingsontwerp, governance en het beheer van de vertrouwensinfrastructuur. Die laatste pijler gaat over je hulpmiddelen, je risico's en hoe je dit allemaal technisch inricht. Maar als we teruggaan naar die openheid en het beslissingsontwerp: hoe geef je gebruikers precies genoeg informatie en precies genoeg begrenzingen, zodat ze weten hoe ze het systeem goed kunnen gebruiken?
Galen Low: Kunnen we enkele voorbeelden bespreken? Ik vind die vier pijlers geweldig: verwachtingsmanagement en beslissingsontwerp zijn bijzonder interessant. Als we een voorbeeld uitwerken en daarna misschien uitzoomen naar wie erbij betrokken moet zijn om dat vertrouwensniveau in de ervaring te bereiken.
Cal Al-Dhubaib: Ik geef een heel eenvoudig voorbeeld, omdat het makkelijk is om over leven en dood of heropnames van patiënten te praten. Ik wil een voorbeeld geven waar we publiekelijk over kunnen praten, omdat het geen casestudy is.
Het gaat om een bedrijf dat je misschien kent: Behr Paint.
Galen Low: Ja.
Cal Al-Dhubaib: Heel bekend. Je gaat naar Home Depot en daar staat zo'n grote presentatie. Ze ontdekten dat een van de grootste afhaakmomenten bij consumenten het overweldigd raken door de keuze aan kleuren was. Ondanks al mijn ervaring met verf ben ik persoonlijk niet bijzonder goed met kleuren.
Mijn kleurenpalet bestaat misschien uit tien kleuren. Ik raak volledig overweldigd als ik moet kiezen welke variant van Eggshell White ik wil. Daarom besloten ze een generatieve ervaring rond productselectie te bouwen. Dat is minder triviaal dan het klinkt, omdat de oplossing rekening moet houden met kleurwetenschap, stijlgidsen en producten die daadwerkelijk bestaan.
We moesten onderweg ook beslissingen nemen over welk soort advies wel en niet acceptabel was. Een kleur selecteren is prima. Bepalen hoe je verf formuleert, mengt of aanbrengt, wilden ze bijvoorbeeld aan strengere kwaliteitscontrole onderwerpen. Als het gesprek die kant op begint te gaan, krijgt de gebruiker daarom snel een melding met een hulplijn voor die specifieke vraag.
Galen Low: Oké, interessant.
Het is eigenlijk een soort 90-10-regel: stop hier, ga niet verder en verzin niets, want arme AI staat zo onder druk om alle antwoorden te hebben. In plaats daarvan sturen we de gebruiker naar een menselijk traject.
Cal Al-Dhubaib: Daarnaast moesten we ervoor zorgen dat het systeem nooit verf van concurrenten aanbeveelt. Het mag ook niet worden uitgelokt om dingen te zeggen die je niet wilt, waarna iemand er een screenshot van maakt en die overal op internet plaatst.
Galen Low: Ja.
Cal Al-Dhubaib: Dit is dus een goed voorbeeld van enkele elementen van vertrouwenstechniek. We hebben beslissingsontwerp: welke beslissing proberen we uiteindelijk te beïnvloeden en welke begrenzingen horen daarbij? Hoe beheren we de verwachtingen van de gebruiker over wat die met de tool kan en niet kan doen? Dat alles gebeurt met passende governance op de achtergrond en wordt aan onze belanghebbenden gecommuniceerd in een gebruiksvriendelijke systeemkaart.
Galen Low: De interface was conversatiegericht, klopt dat?
Cal Al-Dhubaib: Ja. Als je naar behrpaint.com gaat — gratis reclame — verschijnt er een chatbot met de vraag: hallo, hoe kan ik je helpen? Hij heet Chat Hue.
Galen Low: Die is goed. Het is een uitstekend voorbeeld van alles wat je noemde. Je had het over kleurentheorie. Er is een specialist in het projectteam die weet dat bepaalde kleuren niet goed samengaan voor mensen met een beperkt kleurenspectrum in hun zicht, maar de toon is niet veroordelend. Het systeem zegt niet: paars en groen gaan niet samen, wat ben je aan het denken?
Cal Al-Dhubaib: Als je dat probeert, begeleidt het systeem je vriendelijk naar een aantal bijpassende kleuren die je zou kunnen overwegen.
Galen Low: En dan is er een soort tekstschrijver of taalkundige die zich afvraagt hoe je dit moet uitleggen.
Cal Al-Dhubaib: De merkstem?
Galen Low: Ja, de merkstem. En ik neem aan dat het systeem is getraind op de kleurencatalogus van Behr.
Cal Al-Dhubaib: Ja. Dit hangt natuurlijk allemaal af van actuele digitale productgegevens. Een groot onderdeel van dit initiatief is dus ervoor zorgen dat alles geschikt, bijgewerkt, beheerd en toegewezen is. We werken aan een vergelijkbare ervaring voor een andere klant in de financiële dienstverlening, maar dan voor het navigeren door een interne kennisbank.
Een groot deel van de oplossing bestaat niet alleen uit het ontwerpen van de manier waarop het AI-model informatie ophaalt, maar ook uit mensgestuurde processen voor de vraag wie eigenaar is van die database of kennisbank en hoe die in de loop van de tijd wordt bijgewerkt.
Galen Low: Dat is echt interessant.
Cal Al-Dhubaib: Een belangrijk onderdeel is dus ook het hebben van mensgestuurde processen die de gegevens actueel houden waarvan het AI-systeem afhankelijk is.
Galen Low: En het draait om die samenwerking. Het hoeft niet alles of niets te zijn waarbij AI zichzelf onderhoudt, repareert, test, controleert en bijwerkt. Er is nog steeds een rol voor mensen.
Cal Al-Dhubaib: Sommige mensen die beter zouden moeten weten, promoten het idee dat AI alles gaat uitvoeren met AI-agents voor AI-agents. Eerlijk gezegd vereisen alle productiegevallen die ik ben tegengekomen een gezonde dosis menselijke tussenkomst en bijsturing, waarbij AI wordt aangestuurd en mensen bepalen wat er bovenop moet gebeuren.
Galen Low: Dat klinkt realistisch. Wie weet waar de technologie naartoe gaat, maar ik denk: agents die agents beheren — dat verkoopt, omdat de grootste kostenpost van organisaties meestal het personeel is. Dan klinkt het alsof je geen medewerkers nodig hebt.
Een grapje natuurlijk. Je zult waarschijnlijk nog steeds personeel nodig hebben. De technologie kan je mogelijk helpen dat doel te bereiken, maar dat is de marketinghype.
Cal Al-Dhubaib: Het is erg verleidelijk.
Galen Low: Zeker. Ik vraag me af of we enkele anti-voorbeelden kunnen bespreken van ervaringen die we misschien zelf gebruiken en die niet echt moeite doen om vertrouwen op te bouwen, maar meer een zwarte doos zijn. Welke elementen van een ervaring laten zien dat vertrouwen er niet in is ontworpen?
Cal Al-Dhubaib: Ik verwijs graag naar incidenten in de AI Incident Database. Ik noemde er eerder al een paar, maar een leuk voorbeeld is McDonald's, dat problemen had met spraakbestellingen in de drive-through. Ze werkten samen met een bekende softwareconsultancy en moesten het systeem vorig jaar uiteindelijk stopzetten, omdat het niet consistent nauwkeurige bestellingen kon plaatsen.
Ik denk niet dat dit zozeer een mislukking van de technologie was, maar eerder een mislukking om de juiste begrenzingen rond de technologie te plaatsen. Domino's laat daarentegen zien dat 80 procent van hun telefonische bestellingen inmiddels door een AI-systeem wordt afgehandeld.
Galen Low: Wauw.
Cal Al-Dhubaib: Wat ik interessant vind aan het contrast tussen die twee verhalen, is dat er bij het ene een poging was om alles volledig door AI te laten doen, terwijl er bij het andere mensen live gesprekken superviseerden en het overnamen wanneer het AI-systeem een accent niet begreep of een persoon niet kon volgen. Er waren passende controlemaatregelen om te waarborgen dat bestellingen bleven overeenkomen met wat de gebruiker had gezegd.
Mislukkingen ontstaan dus niet omdat de technologie niet werkt. We weten dat AI een inherente foutmarge heeft. De problemen ontstaan doordat de juiste systemen eromheen niet zijn ontworpen.
Galen Low: Ik vind het idee interessant dat het niet alles of niets hoeft te zijn.
Ik zet mijn projectmanagerspet op. Stel je voor dat je degene bent die een budget van miljoenen hebt gebruikt om spraakbestellingen voor McDonald's te bouwen, en uiteindelijk moet zeggen: nee, het is niet goed genoeg. Daarna ligt het op een plank stof te verzamelen. Dat is geen mislukking.
Waarschijnlijk was het de verkeerde toepassing gezien de richting waarin de technologie zich ontwikkelt. De verkeerde reactie zou zijn: AI werkt niet, laten we teruggaan naar een callcenter dat voor honderd procent uit menselijke bestellingsmedewerkers bestaat. In plaats daarvan kun je een hybride model gebruiken, zoals we dat vaak zien bij klantbeleving: chatbots die na tientallen jaren nog steeds een gesprek aan een mens overdragen wanneer het echt niet verder komt.
Cal Al-Dhubaib: In sommige ontwerppraktijken proberen we het AI-systeem minder risicovol te maken. De eenvoudigste aanpak is: laten we callcentermedewerkers toegang geven tot generatieve AI. Die AI kan live transcripties of chatgesprekken raadplegen en aanbevelingen samenvatten, of medewerkers kunnen de tool gewoon bevragen. Zij doen het vervolgens namens de gebruiker en kunnen een deskundig oordeel vellen.
Ze kunnen sneller en effectiever werken, maar vormen tegelijk de veiligheidslaag. Soms kun je een filter inbouwen voor de vraag of AI geschikt is, in plaats van een AI-ervaring volledig en zonder voorwaarden te lanceren. Je kunt ook triggers instellen die zaken doorsturen. Er zal altijd een balans zijn met mensen in de besluitvormingslus.
Wanneer ik met klanten over governance praat, zeg ik dat je bij AI-systemen drie basisvragen moet beantwoorden. Ten eerste: wat heb je vooraf gedaan om te testen en vast te stellen dat je mogelijke schade of inherente risico's hebt beperkt? Ten tweede: hoe weet je, zodra het systeem in productie is, wanneer het een fout maakt? Dat is observeerbaarheid. Wat zijn je criteria voor de begrenzingen, wat zijn je diagnostische gegevens en hoe weet je wanneer het systeem niet aan de verwachtingen voldoet? De derde vraag — de belangrijkste en vaak over het hoofd geziene vraag — is: wat doe je dan?
Heb je dat plan daadwerkelijk aan stresstests onderworpen? Stel dat je dat hypothetische bestelsysteem voor McDonald's hebt en hebt gezegd: zodra bepaalde triggers optreden, neemt een mens het over. Hoe snel kan die persoon begrijpen wat er is gebeurd?
Galen Low: Precies.
Cal Al-Dhubaib: Zijn er de juiste ervaringen, interfaces en hulpmiddelen om snel te kunnen lezen wat er is gebeurd en de mogelijke problemen vast te stellen? En kun je dat op een soepele manier doen die het vertrouwen van de consument behoudt?
Galen Low: Het is eigenlijk de grootste stresstest om het in een fastfoodrestaurant te plaatsen. Bij een callcenter over een verzekeringspolis is het acceptabel om drie minuten in de wacht te staan.
Cal Al-Dhubaib: Ik zou geen drie minuten in de wacht willen staan voor een grote bestelling.
Galen Low: Precies. En je vraagt enorm veel van een personeelsbestand dat meestal vrij onervaren is. Mensen bereiden eten, nemen tegelijk bestellingen aan en proberen binnen een minuut een transcript van een AI-gesprek in de drive-through te begrijpen. Wanneer ik bij McDonald's of een vergelijkbaar restaurant kom, kijk ik altijd naar het scherm met de aftelling. Dan denk ik: ze hebben nog maar vijftien seconden voordat de bestelling buiten de tolerantie valt.
Het is een zeer stressvolle en realtime toepassing. Een deel van mij is blij dat mensen dit proberen. Het zal niet altijd werken. Je zei eerder dat het aantal incidenten in de database stijgt. Komt dat doordat de technologie simpelweg niet werkt of slechter wordt? Of gebruiken en implementeren meer mensen de technologie, waardoor er meer fouten en verhalen zijn?
Cal Al-Dhubaib: Volgens mij is het een combinatie van twee dingen. Het wordt makkelijker om dit soort hulpmiddelen en systemen te bouwen, waardoor het toepassingsgebied groter wordt.
Zelfs als ons vermogen om risico's te beheren is verbeterd, is het eigenlijk een goed teken dat het aantal incidenten niet exponentieel stijgt in hetzelfde tempo als de invoering van AI. Daarnaast worden we beter in het herkennen van AI-problemen. Volgens mij zijn we het tijdperk van vanzelfsprekend vertrouwen in digitale informatie voorbij.
Deepfakes waren enkele jaren geleden zeer zorgwekkend en dat zijn ze nog steeds. Maar de gemiddelde persoon is alerter geworden en denkt: misschien is dit AI. Ga naar vrijwel elke discussie op sociale media, klik op de reacties en je ziet mensen vragen of iets door AI is gemaakt. De gemiddelde persoon begint informatie steeds kritischer te bekijken.
Galen Low: Dat vind ik goed. Vroeger werd het als vanzelfsprekend beschouwd dat we digitale ervaringen vertrouwden. We vertrouwden Google, nieuwsmedia en onze nieuwsbronnen. Nu is alles wat anders, misschien niet op een slechte manier. We zijn kritischer en denken beter na.
Cal Al-Dhubaib: Daardoor kunnen we deze problemen herkennen.
Galen Low: En verbeteren. Uiteindelijk kunnen we ook vaststellen en bespreken wanneer het misschien gewoon een menselijk beleid was dat vanaf het begin al oneerlijk was.
Ik vraag me af of we daarop kunnen ingaan. We hebben het over vertrouwen als een gedeelde, crossfunctionele verantwoordelijkheid. De teams die deze systemen bouwen veranderen. Misschien zit er een taalkundige in het team en zijn er datawetenschappers. Ik vind het idee van de toolkit voor vertrouwenstechniek goed, maar de dynamiek binnen teams en de verwachtingen veranderen ook.
Hoe kan een projectteam de verantwoordelijkheid voor het opbouwen van vertrouwen in zijn oplossingen delen? Hoe voorkom je dat mensen naar elkaar wijzen of elkaar voor de bus gooien? Ik kan me voorstellen hoe dat gaat: het McDonald's-project komt negatief in het nieuws en iedereen wijst naar elkaar. Dat komt doordat datawetenschap dit niet heeft gedaan, of de taalkundige, of de code was verkeerd. Welke elementen van teamdynamiek zorgen ervoor dat het echt een gedeelde verantwoordelijkheid wordt, waarbij iedereen eigenaarschap en aanspreekbaarheid voelt in plaats van meteen schuldigen aan te wijzen?
Cal Al-Dhubaib: Een interessant aspect van verantwoordelijkheid is dat, als het ieders verantwoordelijkheid is, niemand er eigenaar van is. Uiteindelijk heb je dus iemand nodig die dit aspect op zich neemt.
Iets waarin we bij Further hebben geïnvesteerd en waar ik bijzonder enthousiast over ben, zijn kwalificaties voor AI-governance. We zijn lid van IAPP, de International Association of Privacy Professionals. Zij waren een van de eerste grootschalige verenigingen met geloofwaardigheid op dit gebied. Ze hadden certificeringen voor privacyprofessionals en privacy-engineers.
Ze lanceerden een certificering voor AI-governanceprofessionals, omdat ze erkenden dat mensen vanuit de rechten, engineering, privacy, beveiliging of cybersecurity konden komen, maar de rest moesten leren. Dit heeft mijn raamwerk voor vertrouwenstechniek mede geïnspireerd.
Maar terug naar deze AI-governanceprofessionals: we hebben er daadwerkelijk één toegewezen aan elk AI-project, zodat we zeker weten dat we de juiste vragen stellen.
Galen Low: Dat was mijn volgende vraag. Bij digitale projecten is het vaak de projectmanager die uiteindelijk verantwoordelijk wordt gehouden, omdat we meestal in het midden staan van allerlei zeer slimme specialisten die hun eigen werk doen.
Het samenbrengen van alles, het begrijpen van de vereisten en het begrijpen van de risico's komt vaak bij ons terecht. Maar nu is die verantwoordelijkheid geëxplodeerd. Ik vind het idee goed van een bedrijf met een chief privacy officer, omdat dat duidelijk eigenaarschap creëert. Wat jij beschrijft — iemand op elk project die eigenaar is van governance, ongeacht diens achtergrond — is precies wat nodig is.
De verantwoordelijkheid moet ergens landen, zelfs wanneer vertrouwen een gedeelde taal en een crossfunctionele verantwoordelijkheid is.
Cal Al-Dhubaib: Honderd procent. Soms horen klanten dit en denken ze: dat klinkt als veel te veel werk.
Het doel is juist om de totale hoeveelheid werk te verminderen. Het gaat om zinvolle wrijving: stoppen en vragen waar het waarschijnlijk misgaat, vergelijkbare projecten bekijken, mogelijke faalwijzen onderzoeken en bepalen hoe waarschijnlijk het is dat er iets fout gaat.
Wat kost het als het fout gaat? En waar moeten we het meeste investeren om deze vertrouwensrisico's te beperken?
Galen Low: Dat is wat ik mooi vind aan gereguleerde sectoren. Ze hebben het idee van behulpzame wrijving en vinden het acceptabel om te pauzeren. In sommige start-ups is het alleen maar: vooruit, vooruit, vooruit. Als we pauzeren, falen we. Een organisatie die zegt: laten we hier goed over nadenken en de totale waarde afwegen tegen het totale risico, kijkt verder dan alleen het opleveren en live zetten van iets.
Krijgen we straks rechtszaak na rechtszaak? Overtreden we regels? Krijgen we boetes? Gaan mensen ons op Reddit afkraken?
Cal Al-Dhubaib: Dat wil je niet.
Galen Low: Daar zie je waar vertrouwen ligt. Het is opgeschreven. Ik kan me niet voorstellen dat ik op elk project iemand kan zetten die governance bezit.
Waarschijnlijk gebeurt er in eerste instantie dat iemand governance voor zeventig projecten krijgt toegewezen en over al die projecten wordt uitgesmeerd. Maar ik hoop dat de waardering voor die persoon in de loop van de tijd groeit.
Cal Al-Dhubaib: Zeker. Ik denk dat dit een nieuwe beroepscategorie is. AI-controle, AI-kwaliteitsborging en AI-risicomanagement zijn groeifuncties naarmate AI verder wordt ingevoerd. Het goede nieuws is dat het vooral een rol is waarin je vragen stelt. De kunst is de juiste vragen stellen, zodat alle anderen zich daarop kunnen afstemmen.
Galen Low: Geweldig.
We praten over vertrouwen als vereiste. Iemand kan er eigenaar van zijn, maar kan het ook worden gemeten? Kan een projectteam weten of het een betrouwbare ervaring heeft bereikt? Kun je dat onderweg meten?
Cal Al-Dhubaib: Dat is een goede vraag.
Een deel hiervan staat in dienst van het voorkomen van incidenten. Je zou kunnen zeggen dat het aantal incidenten een mogelijke maatstaf is. Maar je kunt ook interessante dingen doen met analyse van gebruikersgedrag, vooral wanneer je de oplossing in een toepassing inbouwt.
De eenvoudigste vorm is: bereikt de gebruiker zijn doel? In ons Chat Hue-voorbeeld: komen gebruikers daadwerkelijk bij de oproep tot actie, bijvoorbeeld door op meer informatie over een bepaalde verfspecificatie te klikken? Zo kun je zien of je oplossing effectief is.
Voltooien mensen de interacties en komen ze terug naar de tool?
Galen Low: Dat vind ik ook goed, omdat het dingen zijn die we al kennen: het risicoprofiel, wat er fout kan gaan en of we in die incidentendatabase terechtkomen. En daarnaast doel en succes: levert het ontwerp van de gebruikerservaring waarde op? Waar zit wrijving? Komt dat door vertrouwen, doordat de AI niet uitlegbaar is, doordat we niet hebben uitgelegd hoe je de tool gebruikt of doordat er te veel opties zijn?
Cal Al-Dhubaib: We zijn simpelweg niet nuttig als we geen resultaat opleveren, en dat is ook onderdeel van vertrouwen.
Galen Low: Dat is eerlijk. Ik vertrouw mijn tijd hier niet aan toe als het niet het resultaat oplevert dat ik wil. Dan bestel ik mijn Big Mac wel bij een mens. Ik dacht dat we konden afronden door naar de niet zo verre toekomst te kijken.
In andere gesprekken heb ik je horen zeggen dat het soms niet gaat om de vraag of AI kan worden vertrouwd, maar of de mensen in de besluitvormingslus kunnen worden vertrouwd. Je noemde een platform waarop beslissingen gekoppeld waren aan de bonus van een medewerker. Daardoor ontstond een inherent en zeer zelfzuchtig vooroordeel, misschien zelfs onzichtbaar of onbewust.
Cal Al-Dhubaib: Ze waren gemotiveerd om de aanbevelingen van de AI niet te vertrouwen.
Galen Low: Omdat hun bonus eraan gekoppeld was.
Cal Al-Dhubaib: Ja. Ze vertrouwden de AI niet.
Galen Low: Mijn conclusie was dat mensen vertrouwen belangrijk vinden, maar er soms erg slecht in zijn. We zijn slecht in vertrouwen en slecht in betrouwbaar zijn. Ik weet niet zeker of ik het zo wilde vragen, maar ik doe het toch: hoe lang denk je dat het duurt voordat AI het menselijke concept van vertrouwen beter begrijpt dan mensen?
En wat zouden de gevolgen zijn als dat gebeurt?
Cal Al-Dhubaib: Ik denk dat de definitie van AI erg circulair is, vooral wanneer je nadenkt over hoe sommige mensen kunstmatige algemene intelligentie definiëren. Het idee is dat het een AI-systeem is dat alles kan doen wat een voldoende getraind mens kan doen.
Wij zijn een soort die hulpmiddelen gebruikt. Mijn vermogen om vandaag werk te verrichten en een LinkedIn-bericht te schrijven wordt mede bepaald door mijn vermogen om AI te gebruiken. Mijn menselijke capaciteit wordt dus gedefinieerd door mijn eigen vakinhoudelijke expertise plus mijn AI-hulpmiddel. Het is een heel circulair concept.
Hoe kan AI vertrouwen beter begrijpen dan mensen? Dat weet ik niet. Vertrouwen is bovendien zo subjectief. Het ziet er in verschillende contexten en morele referentiekaders anders uit. Een goed voorbeeld dat ik in mijn cursus introduceer, is een onderzoek van MIT naar de ethiek van beslissingen door zelfrijdende auto's.
De website heet Moral Machine. Je krijgt scenario's waarin je niets doet of de auto laat uitwijken. In beide gevallen zullen bepaalde mensen schade oplopen. Er zijn verschillende combinaties.
Galen Low: Trolleyproblemen.
Cal Al-Dhubaib: Precies. Aan de ene kant kan een oma de straat oversteken en aan de andere kant kunnen drie kinderen op het zebrapad spelen. Of iemand steekt illegaal over terwijl iemand anders zich aan de regels houdt.
Galen Low: Interessant.
Cal Al-Dhubaib: Ze onderzochten veel verschillende scenario's en analyseerden de gegevens toen ze een grotere steekproef uit verschillende delen van de wereld hadden. Ze ontdekten verschillende clusters met gedeelde waarden in westerse, Zuid-Amerikaanse en Aziatische landen.
De morele kaders waren in die gebieden allemaal geldig, maar onderling fundamenteel onverenigbaar. In westerse landen waardeerden mensen gemiddeld het redden van een groter aantal levens. In Aziatische culturen woog één oudere persoon soms zwaarder dan een willekeurig aantal mensen aan de andere kant.
Galen Low: Interessant.
Cal Al-Dhubaib: Dat was hun meest voorkomende morele referentiekader. Individuele voorkeuren verschillen natuurlijk, maar er bestaat geen universele morele waarheid voor hoe vertrouwen eruitziet. Ik weet dat goed, want ik kom oorspronkelijk uit Saudi-Arabië en mijn moeder is Amerikaans. Ik ben opgegroeid tussen twee culturen die vaak onverenigbaar zijn. Hoe laat je een AI-systeem hiermee omgaan als mensen er zelf al niet uitkomen en het zo subjectief is?
Galen Low: Dat is eigenlijk een interessante plek om te eindigen. Het gaat misschien niet zozeer om vertrouwen en één definitie van wat betrouwbaar is. De vraag had misschien moeten zijn: wanneer begrijpt AI menselijke cultuur beter dan mensen? Misschien hoeft AI daar niet zo ver meer voor te gaan. Overal waar ik kijk, zie ik culturele patronen, en misschien is dat wel een bepalend kenmerk.
Cal Al-Dhubaib: Dat is het ook. We moeten ons inspannen om te begrijpen dat het nooit zwart-wit is. Je zult altijd aannames moeten doen.
Galen Low: Wat zeggen ze ook alweer? AI is een geweldige spiegel, en tegelijk een vergrootglas. Het dwingt ons naar onszelf te kijken.
Vertrouwen maakt daar deel van uit. Het kan betekenen dat gebruikers hun doel bereiken zonder frustratie. Het kan betekenen dat je een aanvaardbare grens van schade of risico hanteert.
Cal Al-Dhubaib: Je moet definiëren wat correct is, welke aannames je wilt vastleggen, of je interacties wel of niet afdwingt, of dat je de gebruiker misschien bewust laat kiezen tussen de ene en de andere optie.
Dat zijn allemaal ontwerpkeuzes die onderdeel kunnen zijn van vertrouwenstechniek.
Galen Low: Daarom vind ik vertrouwenstechniek als toolkit en raamwerk zo goed. We komen niet in een vacuüm tot een oplossing. We moeten hierover gesprekken voeren.
Cal Al-Dhubaib: Absoluut.
Galen Low: Cal, ontzettend bedankt dat je in de show was. Waar kunnen mensen meer leren over je cursus wanneer die uitkomt? Hoe kunnen ze meer over jou te weten komen?
Cal Al-Dhubaib: Ik ben erg actief op LinkedIn. Dat is waarschijnlijk mijn beste platform. Je kunt me daar vinden; binnenkort kondig ik meer details aan.
Galen Low: Geweldig. Ik voeg zeker een link naar je profiel toe en zal ook de link naar de incidentendatabase opnemen. Die is zeker een goede scan waard. Een uitstekend gespreksonderwerp. Cal, bedankt voor dit goede gesprek.
Cal Al-Dhubaib: Bedankt dat ik erbij mocht zijn, Galen.
Galen Low: Goed, mensen, dat was de aflevering van vandaag van de podcast van The Digital Project Manager. Als je dit gesprek interessant vond, abonneer je dan via het platform waarop je luistert. En als je nog meer praktische inzichten, casestudy's en draaiboeken wilt, ga dan naar thedigitalprojectmanager.com.
Tot de volgende keer. Bedankt voor het luisteren.
