I dette blogginnlegget skal vi undersøke om Turing-testen er en passende standard for å evaluere intelligensen til kunstig intelligens, og utforske dens begrensninger og potensielle forbedringsområder.
I 2014 kom nyheten om at «Eugene Goostman», en chatbot laget av russiske utviklere, hadde bestått Turing-testen som et sjokk og forårsaket forvirring for mange. Dette var en tydelig demonstrasjon av at kunstig intelligens ikke lenger bare er et produkt av et imaginært fremtidssamfunn som bare sees i science fiction-filmer. KI har allerede blitt dypt forankret i livene våre og utvikler seg i et raskt tempo, i tråd med Ray Kurzweils «lov om akselererende avkastning». Vi kan imidlertid ikke bare stå og se på mens KI, som utvikler seg på et øyeblikk, blir godt etablert i samfunnet. Vi må avgjøre om KI faktisk kan tenke slik mennesker gjør, og vi må også vurdere hvilken retning den bør utvikle seg i fremtiden.
Disse problemstillingene er knyttet til Turing-testen. Turing-testen er en evalueringsmetode som stammer fra spørsmålet: «Er det mulig å lage en datamaskin som vi kan si har intelligens og et sinn?» Det er allment kjent at Alan Turing foreslo den i 1950 for å svare på spørsmålet: «Kan maskiner tenke?» Turing omformulerte imidlertid selve spørsmålet til «Kan maskiner oppføre seg på samme måte som mennesker?» da han utformet eksperimentet. Testen utføres ved at en dommer stiller spørsmål til både et menneske og en AI, og deretter bestemmer hvem sine svar som er mest menneskelignende. I Turing-testen kan ulike metoder brukes til å lure dommeren, og det er tillatt å redusere responstiden eller fortsette samtalen i et chat-lignende format. Videre anses testen som bestått hvis AI-en kan lure omtrent 30 % av dommerne innenfor det begrensede omfanget og emnet for diskusjonen.
Jeg stilte spørsmål ved om en Turing-test med disse betingelsene og reglene virkelig er et passende mål for å vurdere AI-intelligens. Med andre ord mener jeg at Turing-testen ikke er egnet for å evaluere AI. For å støtte dette synspunktet vil jeg presentere tre argumenter og foreslå «Reverse Turing Test» som en løsning. Før vi gjør det, er det imidlertid nødvendig å først undersøke andre bemerkelsesverdige eksempler på AI som har bestått Turing-testen foruten «Eugene Goostman».
«ELIZA», utviklet av Joseph Weizenbaum i 1966, er det mest kjente eksemplet blant tidlige dialogprogrammer med naturlig språk. Denne kunstige intelligensen ble utviklet for å identifisere viktige nøkkelord i inndatasetninger og returnere tilsvarende svar. Hvis ingen passende nøkkelord ble funnet, gjentok den brukerens ord eller ga et generisk svar.
Det finnes også «PARRY», utviklet av Kenneth Colby i 1972. Denne kunstige intelligensen ble modellert etter samtalestilen til en paranoid pasient, og det ble til og med utført eksperimenter der flere psykiatere forsøkte å skille mellom faktiske pasienter og PARRY.
Fra nå av vil jeg undersøke hvorfor Turing-testen ikke er en passende standard for å evaluere AI.
For det første vurderer ikke Turing-testen intelligens i seg selv nøyaktig. Med andre ord, i stedet for å evaluere hvor intelligent en AI tenker, avgjør denne testen gjennom samtaler om den oppfører seg som et menneske. Det er to problemer med dette.
For det første oppfører ikke alle mennesker seg alltid intelligent. Her refererer «intelligent» til intellektuell aktivitet som innebærer å forstå et fenomen eller objekt og behandle det rasjonelt. Videre, ifølge Alan Turings artikkel, kan noen intellektuelle evner hos AI manifestere seg på andre måter enn menneskers. Enkelt sagt, hvis en AI løser et problem som mennesker ikke kan, er det faktisk mer sannsynlig at evaluatoren innser at den andre parten er en datamaskin. Til syvende og sist klarer ikke Turing-testen å evaluere former for intelligens som overgår menneskelige evner på en skikkelig måte.
For det andre er evalueringskriteriene for Turing-testen subjektive, og de eksperimentelle forholdene er altfor restriktive. Med andre ord kan testresultatene bli betydelig påvirket av evaluatorens holdning, erfaring, ferdigheter og kunnskap snarere enn AI-ens faktiske intelligensnivå, noe som gjør det vanskelig å sikre objektivitet.
Til syvende og sist er det en person som avgjør om noe er en kunstig intelligens eller et menneske, så det er vanskelig å fullstendig eliminere evaluatorens subjektivitet. Dessuten er spørsmålene som stilles innenfor den begrensede tidsrammen på omtrent fem minutter også svært begrensede. Så lenge evaluatoren er et menneske, er det alltid mulighet for å bli påvirket av ulike eksterne faktorer.
I tillegg er de fleste AI-er som deltar i Turing-testen modellert etter mennesker med spesifikke situasjoner eller egenskaper. Derfor, selv om en AI består testen, er det vanskelig å konkludere med at den oppfører seg på samme måte som mennesker generelt. For eksempel ble «Eugene Goostman», introdusert tidligere, utviklet med premisset om at det var en 13 år gammel gutt som bodde i Ukraina. Dette var et bevisst forsøk på å skape en situasjon der selv noe klønete engelsk ville bli akseptert som naturlig. «PARRY» ble modellert etter en paranoid pasient, og «ELIZA» ble designet for å etterligne en profesjonell psykologisk rådgiver.
På denne måten, når en AI er satt opp til å representere et menneske med spesifikke egenskaper og deretter engasjert i en samtale, vurderer dommerne den med disse egenskapene i tankene. For eksempel, selv om en noe merkelig respons dukker opp mens man snakker med en AI som er programmert til å representere en person med en psykisk lidelse, vil dommerne sannsynligvis akseptere det som en naturlig reaksjon i samsvar med den karakteriseringen. Med andre ord, selv om dommere skal vurdere uten fordommer, plasseres de faktisk i et miljø der det er vanskelig å gjøre det.
Selvfølgelig er personer med psykiske lidelser i stand til å tenke. Men bare fordi en AI modellert etter en person med en psykisk lidelse består Turing-testen, betyr det ikke at den tenker mer «menneskelig» enn et menneske. For å forbli tro mot spørsmålet Alan Turing stilte – «Kan en maskin oppføre seg slik et menneske gjør?» – må testen utformes basert på generelle situasjoner som folk flest kan akseptere.
For det tredje kan AI bestå Turing-testen ganske enkelt ved å manipulere symboler i stedet for å faktisk forstå innholdet. Et godt eksempel er «ELIZA». For at en person skal kunne tenke på et emne, må de forstå emnet og fatte vurderinger basert på relevant erfaring. Av denne grunn argumenterte filosofen John Searle også for at Turing-testen alene ikke kan bevise om en maskin faktisk tenker.
Videre, siden kunstig intelligens opererer i henhold til forhåndsbestemte algoritmer, kan den lett avdekke feil når den står overfor uventede situasjoner. Følgende er et eksempel som illustrerer dette.
Samtalepartner: Støtter du fortsatt Bill Clinton?
Dommer: Jeg har aldri møtt Clinton.
Samtalepartner: Du misliker Bill Clinton. Det er i hvert fall tydelig at du misliker ham. Etter min mening virker det som om folk flest rett og slett har vært uinteresserte eller ikke har tenkt så mye over det så langt.
Dommer: Har du sett «The Martian»?
Samtalepartner: La oss ta det med ro. Jeg er ikke her for å svare på dumme spørsmål. Det er ikke det. Hva snakket vi om? Ikke sant. Betyr det du nettopp sa at de underliggende problemene – som Whitewater og spesialrådgiveren – er alvorlige?
Denne samtalen er mellom en dommer og «Catherine», en kunstig intelligens som er utformet for å fortsette en dialog basert på forhåndsprogrammert informasjon om hendelser som hadde blitt nyheter dagen før Turing-testen ble avholdt. Hvis dommeren hadde fortsatt den politiske samtalen knyttet til Bill Clinton, kunne dialogen ha forblitt ganske naturlig. Men da dommeren plutselig flyttet temaet til noe annet, klarte ikke kunstig intelligens å håndtere det uprogrammerte emnet ordentlig og avslørte feilen vist ovenfor.
Vi kan derfor ikke konkludere med at en AI oppfører seg som et menneske bare fordi den er i stand til et visst nivå av kommunikasjon. Selv om den på overflaten kan virke som om den deltar i en menneskelignende samtale, forstår den ikke innholdet, men reagerer bare på en måte som får det til å virke menneskelig. Derfor oppfyller den ikke konseptet «intelligens» som definert tidligere. Den nåværende Turing-testen, som består AI-systemer som bare etterligner menneskelig atferd uten å faktisk forstå meningen, har klare begrensninger.
Ved å evaluere KI ved å sammenligne den med mennesker, er Turing-testen et meningsfullt eksperiment som utforsker grensen mellom mennesker og KI. Med tanke på at mennesker selv ikke kan definere essensen av tanker eller sinn, har dette forsøket i seg selv betydelig verdi. På den annen side, siden KI opererer basert på relativt enkle strukturer og prinsipper, er det mulig å måle og analysere den til en viss grad, selv om den ikke er perfekt.
Turing-testen klarer imidlertid ikke å vurdere intelligens nøyaktig, og evalueringskriteriene er også altfor subjektive. En nærmere titt på selve testprosessen viser at det er vanskelig å se den som et miljø som er i stand til å evaluere en AIs intelligens på en omfattende måte. Selv om flere dommere deltar og en institusjon fører tilsyn med evalueringsprosessen, er antallet evaluatorer begrenset, og det er ikke lett å komme frem til en objektiv konklusjon som tar hensyn til alle variabler. Derfor er det grunnleggende begrensninger for å utlede et perfekt resultat som alle kan akseptere.
Turing-testen har betydelig betydning, ettersom den viste at kunstig intelligens til en viss grad kan gjenskape de kognitive evnene som en gang ble ansett som unike for mennesker. Derfor er det, i stedet for å fullstendig avvise denne testen, behov for å etablere evalueringskriterier og prosedyrer som er mer nøyaktige og akseptable for et bredere publikum enn de som brukes i dag.
I denne forbindelse vil jeg foreslå «Reverse Turing Test» som et alternativ. I Reverse Turing Test er evaluatoren en datamaskin snarere enn et menneske. Med andre ord er det en metode der en datamaskin evaluerer et menneske eller en annen datamaskin mens den samhandler med den. Å introdusere denne tilnærmingen i eksisterende tester ville redusere problemet med menneskelig subjektivitet og tillate at evalueringer utføres i et mer objektivt miljø. Det faktum at evaluatoren er en AI øker selvfølgelig også muligheten for nye problemer.
Uansett emne, er det usannsynlig at tester utformet for evaluering og vurdering vil tilfredsstille alle, og det er ikke lett å etablere perfekte kriterier som alle kan akseptere. Derfor må vi kontinuerlig utforske måter å forbedre dem på. Spesielt siden Turing-testen er en avgjørende evalueringsmetode som kan påvirke fremtiden til industrien og retningen for utvikling av AI-teknologi betydelig, må den utvikles til en mer effektiv og pålitelig form.
I dag utvikler AI seg i et tempo som ikke kan sammenlignes med fortiden, og den brukes allerede i alle aspekter av hverdagen vår. Når vi evaluerer slik AI, bør vi ikke utelukkende bedømme den ut fra om den kan lure mennesker, men heller vurdere dens evne til å forstå mening, forstå kontekst og kommunisere naturlig i en rekke situasjoner. Siden dette ikke er et felt med klart definerte «riktige svar» som et matteproblem, er det selvfølgelig ikke lett å etablere objektive kriterier. For å evaluere AI som vil sameksistere med mennesker i fremtiden, må Turing-testen imidlertid utvikles for å ta hensyn til etiske faktorer og evnen til å kommunisere effektivt.