I dette blogindlæg vil vi undersøge, om Turing-testen er en passende standard til evaluering af kunstig intelligens, og udforske dens begrænsninger og potentielle forbedringsområder.
I 2014 kom nyheden om, at "Eugene Goostman", en chatbot skabt af russiske udviklere, havde bestået Turing-testen, som et chok og forårsagede forvirring for mange mennesker. Dette var en klar demonstration af, at kunstig intelligens ikke længere blot er et produkt af et imaginært fremtidssamfund, som kun ses i science fiction-film. AI er allerede dybt forankret i vores liv og udvikler sig i et hurtigt tempo, i tråd med Ray Kurzweils "Lov om accelererende afkast". Vi kan dog ikke bare stå og se på, mens AI, som udvikler sig på et øjeblik, bliver solidt etableret i samfundet. Vi er nødt til at afgøre, om AI rent faktisk kan tænke som mennesker, og vi skal også overveje, hvilken retning den skal udvikle sig i fremtiden.
Disse problemstillinger er knyttet til Turing-testen. Turing-testen er en evalueringsmetode, der stammer fra spørgsmålet: "Er det muligt at skabe en computer, som vi kan sige besidder intelligens og et sind?" Det er almindeligt kendt, at Alan Turing foreslog den i 1950 for at besvare spørgsmålet: "Kan maskiner tænke?" Turing omformulerede dog selve spørgsmålet til "Kan maskiner opføre sig på samme måde som mennesker?", da han designede eksperimentet. Testen udføres ved, at en dommer stiller spørgsmål til både et menneske og en AI og derefter bestemmer, hvis svar er mest menneskelignende. I Turing-testen kan forskellige metoder bruges til at narre dommeren, og det er tilladt at sænke svartiderne eller fortsætte samtalen i et chatlignende format. Desuden anses testen for bestået, hvis AI'en kan narre cirka 30% af dommerne inden for det begrænsede omfang og emne for diskussionen.
Jeg satte spørgsmålstegn ved, om en Turing-test med disse betingelser og regler virkelig er et passende mål til at vurdere AI-intelligens. Med andre ord mener jeg, at Turing-testen ikke er egnet til at evaluere AI. For at understøtte dette synspunkt vil jeg præsentere tre argumenter og foreslå "Reverse Turing-testen" som en løsning. Før vi gør det, er det dog nødvendigt først at undersøge andre bemærkelsesværdige eksempler på AI, der har bestået Turing-testen, udover "Eugene Goostman".
"ELIZA", udviklet af Joseph Weizenbaum i 1966, er det mest kendte eksempel blandt tidlige programmer til dialog med naturligt sprog. Denne kunstige intelligens blev designet til at identificere nøgleord i inputsætninger og returnere tilsvarende svar; hvis der ikke blev fundet passende nøgleord, gentog den brugerens ord eller gav et generisk svar.
Der findes også "PARRY", udviklet af Kenneth Colby i 1972. Denne kunstige intelligens blev modelleret efter en paranoid patients samtalestil, og der blev endda udført eksperimenter, hvor adskillige psykiatere forsøgte at skelne mellem faktiske patienter og PARRY.
Fra nu af vil jeg undersøge, hvorfor Turing-testen ikke er en passende standard til evaluering af kunstig intelligens.
For det første vurderer Turing-testen ikke intelligens i sig selv nøjagtigt. Med andre ord, i stedet for at evaluere hvor intelligent en AI tænker, afgør denne test gennem samtaler, om den opfører sig som et menneske. Der er to problemer med dette.
For det første opfører ikke alle mennesker sig altid intelligent. Her refererer "intelligent" til intellektuel aktivitet, der involverer at forstå et fænomen eller objekt og bearbejde det rationelt. Desuden kan nogle af AI's intellektuelle evner ifølge Alan Turings artikel manifestere sig på måder, der er forskellige fra menneskers. Kort sagt, hvis en AI løser et problem, som mennesker ikke kan, er evaluatoren faktisk mere tilbøjelig til at indse, at den anden part er en computer. I sidste ende undlader Turing-testen at evaluere former for intelligens, der overgår menneskelige evner, korrekt.
For det andet er evalueringskriterierne for Turing-testen subjektive, og de eksperimentelle betingelser er alt for restriktive. Med andre ord kan testresultaterne blive betydeligt påvirket af evaluatorens holdning, erfaring, færdigheder og viden snarere end AI'ens faktiske intelligensniveau, hvilket gør det vanskeligt at sikre objektivitet.
I sidste ende er den enhed, der afgør, om noget er en AI eller et menneske, en person, så det er vanskeligt fuldstændigt at udelukke evaluatorens subjektivitet. Desuden er de spørgsmål, der stilles inden for den begrænsede tidsramme på cirka fem minutter, også meget begrænsede. Så længe evaluatoren er et menneske, er der altid mulighed for at blive påvirket af forskellige eksterne faktorer.
Derudover er de fleste AI'er, der deltager i Turing-testen, modelleret efter mennesker med specifikke situationer eller karakteristika. Derfor er det vanskeligt at konkludere, at en AI opfører sig på samme måde som mennesker generelt, selvom den består testen. For eksempel blev "Eugene Goostman", der blev introduceret tidligere, udviklet med den forudsætning, at det var en 13-årig dreng, der boede i Ukraine. Dette var et bevidst forsøg på at skabe en situation, hvor selv noget klodset engelsk ville blive accepteret som naturligt. "PARRY" var modelleret efter en paranoid patient, og "ELIZA" var designet til at efterligne en professionel psykologisk rådgiver.
På denne måde, når en AI er sat op til at repræsentere et menneske med specifikke karakteristika og derefter deltager i en samtale, evaluerer dommerne den med disse karakteristika i tankerne. For eksempel, selvom der opstår en noget mærkelig reaktion under en samtale med en AI, der er programmeret til at repræsentere en person med en psykisk sygdom, er det sandsynligt, at dommerne accepterer det som en naturlig reaktion, der er i overensstemmelse med denne karakterisering. Med andre ord, selvom dommere formodes at evaluere uden bias, placeres de faktisk i et miljø, hvor det er vanskeligt at gøre det.
Selvfølgelig er mennesker med psykiske sygdomme i stand til at tænke. Men bare fordi en AI, der er modelleret efter en person med en psykisk sygdom, består Turing-testen, betyder det ikke, at den tænker mere "menneskelignende" end et menneske. For at forblive tro mod det spørgsmål, som Alan Turing stillede - "Kan en maskine opføre sig på samme måde som et menneske?" - skal testen designes ud fra generelle situationer, som de fleste mennesker kan acceptere.
For det tredje kan AI bestå Turing-testen blot ved at manipulere symboler i stedet for rent faktisk at forstå indholdet. Et godt eksempel er "ELIZA". For at en person kan tænke over et emne, skal de forstå emnet og foretage vurderinger baseret på relevant erfaring. Af denne grund argumenterede filosoffen John Searle også for, at Turing-testen alene ikke kan bevise, om en maskine rent faktisk tænker.
Da kunstig intelligens desuden fungerer efter forudbestemte algoritmer, kan den nemt afsløre fejl, når den står over for uventede situationer. Følgende er et eksempel, der illustrerer dette.
Samtalepartner: Støtter du stadig Bill Clinton?
Dommer: Jeg har aldrig mødt Clinton.
Samtalepartner: Du kan virkelig ikke lide Bill Clinton. Det er i hvert fald tydeligt, at du ikke kan lide ham. Efter min mening virker det som om, at de fleste simpelthen har været uinteresserede eller ikke har tænkt meget over det indtil videre.
Dommer: Har du set 'The Martian'?
Samtalepartner: Lad os tage den med ro. Jeg er ikke her for at svare på dumme spørgsmål. Det er ikke det. Hvad talte vi om? Ja. Betyder det, du lige sagde, at de underliggende problemer – som Whitewater og den særlige anklager – er alvorlige?
Denne samtale foregår mellem en dommer og "Catherine", en kunstig intelligens, der er designet til at fortsætte en dialog baseret på forudprogrammeret information om begivenheder, der var blevet nyheder dagen før Turing-testen blev afholdt. Hvis dommeren havde fortsat den politiske samtale relateret til Bill Clinton, kunne dialogen være forblevet ret naturlig. Men da dommeren pludselig skiftede emne til noget andet, var kunstig intelligens ude af stand til at håndtere det uprogrammerede emne korrekt og afslørede fejlen vist ovenfor.
Vi kan derfor ikke konkludere, at en AI opfører sig som et menneske, blot fordi den er i stand til at kommunikere på et vist niveau. Selvom den på overfladen kan synes at engagere sig i en menneskelignende samtale, forstår den faktisk ikke indholdet, men reagerer blot på en måde, der får det til at virke menneskeligt. Derfor lever den ikke op til begrebet "intelligens", som defineret tidligere. Den nuværende Turing-test, som består AI-systemer, der blot efterligner menneskelig adfærd uden rent faktisk at forstå meningen, har klare begrænsninger.
Idet Turing-testen evaluerer AI ved at sammenligne den med mennesker, er den et meningsfuldt eksperiment, der udforsker grænsen mellem mennesker og AI. I betragtning af at mennesker selv ikke klart kan definere essensen af tanker eller sind, har dette forsøg i sig selv betydelig værdi. På den anden side, da AI opererer baseret på relativt simple strukturer og principper, er det muligt at måle og analysere den til en vis grad, omend ikke perfekt.
Turing-testen formår dog ikke at vurdere intelligens præcist, og dens evalueringskriterier er også alt for subjektive. Et nærmere kig på selve testprocessen afslører, at det er vanskeligt at se den som et miljø, der er i stand til omfattende at evaluere en AI's intelligens. Selv hvis flere dommere deltager, og en institution fører tilsyn med evalueringsprocessen, er antallet af evaluatorer begrænset, og det er ikke let at nå frem til en objektiv konklusion, der tager alle variabler i betragtning. Derfor er der grundlæggende begrænsninger for at udlede et perfekt resultat, som alle kan acceptere.
Turing-testen har stor betydning, da den viste, at kunstig intelligens i et vist omfang kan replikere de kognitive evner, der engang blev anset for at være unikke for mennesker. Derfor er der, i stedet for fuldstændigt at afvise denne test, behov for at etablere evalueringskriterier og -procedurer, der er mere præcise og acceptable for et bredere publikum end dem, der anvendes i øjeblikket.
I den forbindelse vil jeg gerne foreslå "Reverse Turing Test" som et alternativ. I Reverse Turing Test er evaluatoren en computer snarere end et menneske. Med andre ord er det en metode, hvor en computer evaluerer et menneske eller en anden computer, mens den interagerer med det. Introduktion af denne tilgang i eksisterende tests ville reducere problemet med menneskelig subjektivitet og give mulighed for at udføre evalueringer i et mere objektivt miljø. Det faktum, at evaluatoren er en AI, rejser naturligvis også muligheden for nye problemstillinger.
Uanset emnet er det usandsynligt, at tests designet til evaluering og bedømmelse vil tilfredsstille alle, og det er ikke let at fastsætte perfekte kriterier, som alle kan acceptere. Derfor skal vi løbende undersøge måder at forbedre dem på. Især da Turing-testen er en afgørende evalueringsmetode, der kan have betydelig indflydelse på industriens fremtid og retningen for AI-teknologiudvikling, skal den udvikle sig til en mere effektiv og pålidelig form.
I dag udvikler kunstig intelligens sig i et tempo, der er uforligneligt med fortiden, og den anvendes allerede i alle aspekter af vores dagligdag. Når vi evaluerer sådan kunstig intelligens, bør vi ikke udelukkende bedømme den ud fra, om den kan bedrage mennesker, men snarere vurdere dens evne til at forstå mening, forstå kontekst og kommunikere naturligt på tværs af en række forskellige situationer. Da dette ikke er et felt med klart definerede "korrekte svar" som et matematikproblem, er det naturligvis ikke let at fastsætte objektive kriterier. For at evaluere kunstig intelligens, der vil sameksistere med mennesker i fremtiden, skal Turing-testen ikke desto mindre udvikles til at tage etiske faktorer og evnen til at kommunikere effektivt i betragtning.