In dit blogbericht onderzoeken we of de Turing-test een geschikte maatstaf is voor het evalueren van de intelligentie van kunstmatige intelligentie, en verkennen we de beperkingen en mogelijke verbeterpunten ervan.
In 2014 kwam het nieuws dat "Eugene Goostman", een chatbot ontwikkeld door Russische programmeurs, de Turing-test had doorstaan als een schok en zorgde het voor veel verwarring. Dit was een duidelijke demonstratie dat kunstmatige intelligentie niet langer slechts een product is van een denkbeeldige toekomstige samenleving die alleen in sciencefictionfilms voorkomt. AI is al diep verankerd in ons leven en ontwikkelt zich in een razend tempo, in lijn met Ray Kurzweils "Wet van de Versnellende Rendementen". We kunnen echter niet zomaar toekijken hoe AI, die zich in een oogwenk ontwikkelt, zich stevig in de samenleving vestigt. We moeten vaststellen of AI daadwerkelijk kan denken zoals mensen, en we moeten ook nadenken over de richting waarin het zich in de toekomst zou moeten ontwikkelen.
Deze kwesties hangen samen met de Turingtest. De Turingtest is een evaluatiemethode die voortkomt uit de vraag: "Is het mogelijk om een computer te creëren waarvan we kunnen zeggen dat hij intelligentie en een bewustzijn bezit?" Het is algemeen bekend dat Alan Turing de test in 1950 voorstelde om de vraag te beantwoorden: "Kunnen machines denken?" Turing herformuleerde de vraag echter als: "Kunnen machines zich op dezelfde manier gedragen als mensen?" toen hij het experiment ontwierp. De test wordt uitgevoerd door een jury die vragen stelt aan zowel een mens als een AI, waarna wordt bepaald wiens antwoorden menselijker zijn. Bij de Turingtest mogen verschillende methoden worden gebruikt om de jury te misleiden, en het is toegestaan om de reactietijd te vertragen of het gesprek in een chat-achtige vorm voort te zetten. Bovendien wordt de test als geslaagd beschouwd als de AI ongeveer 30% van de juryleden kan misleiden binnen de beperkte reikwijdte en het onderwerp van de discussie.
Ik heb me afgevraagd of een Turing-test met deze voorwaarden en regels wel een geschikte maatstaf is voor het beoordelen van de intelligentie van kunstmatige intelligentie. Met andere woorden, ik ben van mening dat de Turing-test niet geschikt is voor het evalueren van AI. Ter ondersteuning van dit standpunt zal ik drie argumenten presenteren en de "omgekeerde Turing-test" als oplossing voorstellen. Voordat ik dat doe, is het echter noodzakelijk om eerst andere opmerkelijke voorbeelden van AI te bekijken die de Turing-test hebben doorstaan, naast "Eugene Goostman".
"ELIZA", ontwikkeld door Joseph Weizenbaum in 1966, is het bekendste voorbeeld van vroege programma's voor natuurlijke taalverwerking. Deze AI was ontworpen om belangrijke trefwoorden in ingevoerde zinnen te herkennen en overeenkomstige antwoorden te geven; als er geen geschikte trefwoorden werden gevonden, herhaalde het de woorden van de gebruiker of gaf het een algemeen antwoord.
Er is ook nog "PARRY", ontwikkeld door Kenneth Colby in 1972. Deze AI was gemodelleerd naar de gespreksstijl van een paranoïde patiënt, en er werden zelfs experimenten uitgevoerd waarbij verschillende psychiaters probeerden onderscheid te maken tussen echte patiënten en PARRY.
Hierna zal ik onderzoeken waarom de Turing-test geen geschikte maatstaf is voor het evalueren van AI.
Ten eerste meet de Turing-test intelligentie op zich niet nauwkeurig. Met andere woorden, in plaats van te evalueren hoe intelligent een AI denkt, bepaalt deze test aan de hand van een gesprek of de AI zich als een mens gedraagt. Daar zitten twee problemen aan.
Ten eerste gedragen niet alle mensen zich altijd intelligent. Hier verwijst "intelligent" naar intellectuele activiteit die het begrijpen van een fenomeen of object en het rationeel verwerken ervan omvat. Bovendien kunnen sommige intellectuele vermogens van AI zich volgens het artikel van Alan Turing op een andere manier manifesteren dan die van mensen. Simpel gezegd: als een AI een probleem oplost dat mensen niet kunnen oplossen, is de beoordelaar eerder geneigd te beseffen dat de andere partij een computer is. Uiteindelijk schiet de Turing-test tekort in het correct beoordelen van vormen van intelligentie die de menselijke capaciteiten overstijgen.
Ten tweede zijn de evaluatiecriteria van de Turing-test subjectief en de experimentele omstandigheden te restrictief. Met andere woorden, de testresultaten kunnen aanzienlijk worden beïnvloed door de houding, ervaring, vaardigheden en kennis van de evaluator in plaats van door het werkelijke intelligentieniveau van de AI, waardoor objectiviteit moeilijk te garanderen is.
Uiteindelijk is het een persoon die bepaalt of iets een AI of een mens is, waardoor het moeilijk is om de subjectiviteit van de beoordelaar volledig uit te sluiten. Bovendien zijn de vragen die binnen de beperkte tijd van ongeveer vijf minuten gesteld worden ook zeer beperkt. Zolang de beoordelaar een mens is, bestaat er altijd de mogelijkheid dat hij of zij beïnvloed wordt door diverse externe factoren.
Bovendien zijn de meeste AI's die deelnemen aan de Turing-test gemodelleerd naar mensen met specifieke situaties of kenmerken. Zelfs als een AI de test doorstaat, is het daarom moeilijk te concluderen dat deze zich in het algemeen op dezelfde manier gedraagt als mensen. Zo werd "Eugene Goostman", die eerder al werd genoemd, ontwikkeld vanuit de veronderstelling dat het een 13-jarige jongen uit Oekraïne was. Dit was een bewuste poging om een situatie te creëren waarin zelfs enigszins gebrekkig Engels als natuurlijk zou worden geaccepteerd. "PARRY" werd gemodelleerd naar een paranoïde patiënt en "ELIZA" werd ontworpen om een professionele psycholoog na te bootsen.
Op deze manier, wanneer een AI is ingesteld om een mens met specifieke kenmerken te representeren en vervolgens een gesprek aangaat, beoordelen de juryleden de AI met die kenmerken in gedachten. Zelfs als er bijvoorbeeld een ietwat vreemde reactie optreedt tijdens een gesprek met een AI die is geprogrammeerd om een persoon met een psychische aandoening te representeren, zullen de juryleden die waarschijnlijk accepteren als een natuurlijke reactie die consistent is met die karakterisering. Met andere woorden, hoewel juryleden geacht worden onbevooroordeeld te beoordelen, bevinden ze zich in werkelijkheid in een omgeving waar dat moeilijk is.
Natuurlijk kunnen mensen met een psychische aandoening wel degelijk denken. Maar het feit dat een AI die is gemodelleerd naar een persoon met een psychische aandoening de Turing-test doorstaat, betekent niet dat deze AI "menselijker" denkt dan een mens. Om trouw te blijven aan de vraag van Alan Turing – "Kan een machine zich gedragen zoals een mens?" – moet de test worden ontworpen op basis van algemene situaties die voor de meeste mensen acceptabel zijn.
Ten derde kan AI de Turing-test doorstaan door simpelweg symbolen te manipuleren in plaats van de inhoud daadwerkelijk te begrijpen. Een treffend voorbeeld hiervan is "ELIZA". Om over een onderwerp na te denken, moet een mens dat onderwerp begrijpen en oordelen vellen op basis van relevante ervaring. Om die reden betoogde filosoof John Searle ook dat de Turing-test op zichzelf niet kan bewijzen of een machine daadwerkelijk denkt.
Bovendien kan kunstmatige intelligentie, doordat ze werkt volgens vooraf bepaalde algoritmen, gemakkelijk fouten aan het licht brengen wanneer ze met onverwachte situaties wordt geconfronteerd. Het volgende voorbeeld illustreert dit.
Gesprekspartner: Steunt u Bill Clinton nog steeds?
Rechter: Ik heb Clinton nog nooit ontmoet.
Gesprekspartner: Je hebt echt een hekel aan Bill Clinton. Tenminste, dat is duidelijk. Volgens mij lijken de meeste mensen er tot nu toe gewoon geen interesse in te hebben getoond of er niet veel over nagedacht te hebben.
Rechter: Heeft u 'The Martian' gezien?
Gesprekspartner: Laten we het rustig aan doen. Ik ben hier niet om domme vragen te beantwoorden. Daar ging het niet om. Waar hadden we het ook alweer over? Juist. Betekent wat je net zei dat de onderliggende problemen – zoals Whitewater en de speciale aanklager – ernstig zijn?
Dit gesprek vindt plaats tussen een rechter en "Catherine", een AI die is ontworpen om een dialoog voort te zetten op basis van voorgeprogrammeerde informatie over gebeurtenissen die de dag voor de Turing-test in het nieuws waren gekomen. Als de rechter het politieke gesprek over Bill Clinton had voortgezet, zou de dialoog vrij natuurlijk zijn verlopen. Toen de rechter echter plotseling van onderwerp veranderde, kon de AI het ongeprogrammeerde onderwerp niet goed verwerken en vertoonde de bovenstaande fout.
We kunnen dus niet concluderen dat een AI zich als een mens gedraagt, simpelweg omdat het tot een bepaald niveau van communicatie in staat is. Hoewel het oppervlakkig gezien een mensachtig gesprek lijkt te voeren, begrijpt het de inhoud niet echt, maar reageert het slechts op een manier die menselijk overkomt. Daarom voldoet het niet aan het eerder gedefinieerde concept van 'intelligentie'. De huidige Turing-test, die AI-systemen goedkeurt die menselijk gedrag slechts nabootsen zonder de betekenis ervan te begrijpen, kent duidelijke beperkingen.
Doordat de Turing-test AI evalueert door deze te vergelijken met mensen, is het een betekenisvol experiment dat de grens tussen mens en AI verkent. Gezien het feit dat mensen zelf de essentie van denken of de geest niet duidelijk kunnen definiëren, is deze poging op zich al van grote waarde. Aan de andere kant, omdat AI op basis van relatief eenvoudige structuren en principes werkt, is het mogelijk om het tot op zekere hoogte te meten en te analyseren, zij het niet perfect.
De Turing-test is echter geen accurate maatstaf voor intelligentie, en de evaluatiecriteria zijn bovendien te subjectief. Een nadere blik op het daadwerkelijke testproces laat zien dat het moeilijk te beschouwen is als een omgeving die de intelligentie van een AI volledig kan beoordelen. Zelfs als meerdere beoordelaars deelnemen en een instelling toezicht houdt op het evaluatieproces, is het aantal beoordelaars beperkt en is het niet eenvoudig om tot een objectieve conclusie te komen die alle variabelen in aanmerking neemt. Er zijn dus fundamentele beperkingen aan het verkrijgen van een perfect resultaat dat door iedereen geaccepteerd kan worden.
De Turing-test is van groot belang omdat deze aantoonde dat AI tot op zekere hoogte de cognitieve vaardigheden kan repliceren die ooit als uniek voor de mens werden beschouwd. Daarom is het, in plaats van deze test volledig te verwerpen, nodig om evaluatiecriteria en -procedures vast te stellen die nauwkeuriger en acceptabeler zijn voor een breder publiek dan de huidige methoden.
In dit verband wil ik de "omgekeerde Turing-test" als alternatief voorstellen. Bij de omgekeerde Turing-test is de evaluator een computer in plaats van een mens. Met andere woorden, het is een methode waarbij een computer een mens of een andere computer evalueert tijdens een interactie ermee. Het introduceren van deze aanpak in bestaande tests zou het probleem van menselijke subjectiviteit verminderen en evaluaties in een objectievere omgeving mogelijk maken. Natuurlijk brengt het feit dat de evaluator een AI is ook de mogelijkheid van nieuwe problemen met zich mee.
Ongeacht het onderwerp zullen tests die ontworpen zijn voor evaluatie en beoordeling waarschijnlijk niet iedereen tevreden stellen, en het is niet eenvoudig om perfecte criteria vast te stellen die iedereen kan accepteren. Daarom moeten we voortdurend zoeken naar manieren om ze te verbeteren. In het bijzonder moet de Turing-test, als cruciale evaluatiemethode die de toekomst van de industrie en de richting van de ontwikkeling van AI-technologie aanzienlijk kan beïnvloeden, evolueren naar een efficiëntere en betrouwbaardere vorm.
Kunstmatige intelligentie (AI) ontwikkelt zich tegenwoordig in een ongekend tempo en wordt al in elk aspect van ons dagelijks leven gebruikt. Bij de beoordeling van dergelijke AI moeten we niet alleen kijken naar het vermogen om mensen te misleiden, maar vooral naar het vermogen om betekenis te begrijpen, context te vatten en op een natuurlijke manier te communiceren in uiteenlopende situaties. Omdat dit geen vakgebied is met duidelijk gedefinieerde "juiste antwoorden" zoals bij een wiskundige opgave, is het vaststellen van objectieve criteria natuurlijk niet eenvoudig. Niettemin moet de Turing-test, om AI te kunnen beoordelen die in de toekomst met mensen zal samenleven, verder worden ontwikkeld om ethische factoren en het vermogen tot effectieve communicatie volledig in overweging te nemen.