En aquesta entrada del blog, examinarem si el test de Turing és un estàndard adequat per avaluar la intel·ligència de la intel·ligència artificial i explorarem les seves limitacions i possibles àrees de millora.
El 2014, la notícia que "Eugene Goostman", un chatbot creat per desenvolupadors russos, havia superat el test de Turing va ser un xoc i va causar confusió a molta gent. Això va ser una clara demostració que la intel·ligència artificial ja no és simplement un producte d'una societat futura imaginària que només es veu a les pel·lícules de ciència-ficció. La IA ja s'ha integrat profundament a les nostres vides i avança a un ritme ràpid, d'acord amb la "Llei dels Retorns Accelerats" de Ray Kurzweil. Tanmateix, no podem simplement quedar-nos de braços plegats i observar com la IA, que evoluciona en un obrir i tancar d'ulls, s'estableix fermament a la societat. Hem de determinar si la IA pot realment pensar com els humans, i també hem de considerar la direcció en què s'hauria de desenvolupar en el futur.
Aquests problemes estan relacionats amb el test de Turing. El test de Turing és un mètode d'avaluació que es va originar a partir de la pregunta: "És possible crear un ordinador que puguem dir que posseeix intel·ligència i ment?". Se sap que Alan Turing el va proposar el 1950 per respondre a la pregunta: "Poden les màquines pensar?". Tanmateix, Turing va reformular la pregunta com "Poden les màquines comportar-se de la mateixa manera que ho fan els humans?" en dissenyar l'experiment. La prova es duu a terme fent que un jutge plantegi preguntes tant a un humà com a una IA, i després es determini quines respostes són més semblants a les humanes. En el test de Turing, es poden utilitzar diversos mètodes per enganyar el jutge, i es permet alentir els temps de resposta o continuar la conversa en un format similar a un xat. A més, la prova es considera aprovada si la IA pot enganyar aproximadament el 30% dels jutges dins de l'abast i el tema limitats de la discussió.
Em vaig qüestionar si un test de Turing amb aquestes condicions i regles és realment una mesura adequada per avaluar la intel·ligència de la IA. En altres paraules, crec que el test de Turing no és adequat per avaluar la IA. Per donar suport a aquest punt de vista, presentaré tres arguments i proposaré el "test de Turing invers" com a solució. Abans de fer-ho, però, cal examinar primer altres exemples notables d'IA que han superat el test de Turing a més d'"Eugene Goostman".
«ELIZA», desenvolupada per Joseph Weizenbaum el 1966, és l'exemple més conegut entre els primers programes de diàleg en llenguatge natural. Aquesta IA va ser dissenyada per identificar paraules clau en frases d'entrada i retornar les respostes corresponents; si no es trobaven paraules clau adequades, repetia les paraules de l'usuari o proporcionava una resposta genèrica.
També hi ha "PARRY", desenvolupat per Kenneth Colby el 1972. Aquesta IA es va modelar segons l'estil conversacional d'un pacient paranoic, i fins i tot es van dur a terme experiments en què diversos psiquiatres van intentar distingir entre pacients reals i PARRY.
A partir d'aquí, examinaré per què el test de Turing no és un estàndard adequat per avaluar la IA.
En primer lloc, el test de Turing no avalua amb precisió la intel·ligència en si mateixa. En altres paraules, en lloc d'avaluar la intel·ligència amb què pensa una IA, aquest test determina mitjançant la conversa si es comporta com un humà. Això presenta dos problemes.
En primer lloc, no tots els humans es comporten sempre de manera intel·ligent. Aquí, "intel·ligent" es refereix a l'activitat intel·lectual que implica comprendre un fenomen o objecte i processar-lo racionalment. A més, segons l'article d'Alan Turing, algunes habilitats intel·lectuals de la IA poden manifestar-se de maneres diferents a les dels humans. En poques paraules, si una IA resol un problema que els humans no poden, és més probable que l'avaluador s'adoni que l'altra part és un ordinador. En definitiva, el test de Turing no aconsegueix avaluar correctament les formes d'intel·ligència que superen les capacitats humanes.
En segon lloc, els criteris d'avaluació del test de Turing són subjectius i les condicions experimentals són massa restrictives. En altres paraules, els resultats del test poden estar significativament influenciats per l'actitud, l'experiència, les habilitats i els coneixements de l'avaluador en lloc del nivell real d'intel·ligència de la IA, cosa que dificulta garantir l'objectivitat.
En última instància, l'entitat que determina si alguna cosa és una IA o un humà és una persona, per la qual cosa és difícil eliminar completament la subjectivitat de l'avaluador. A més, les preguntes que es fan dins del termini limitat d'uns cinc minuts també són molt restringides. Sempre que l'avaluador sigui humà, sempre hi ha la possibilitat de ser influenciat per diversos factors externs.
A més, la majoria de les IA que participen en el test de Turing estan modelades a partir d'humans amb situacions o característiques específiques. Per tant, fins i tot si una IA supera el test, és difícil concloure que es comporta de la mateixa manera que els humans en general. Per exemple, "Eugene Goostman", presentat anteriorment, es va desenvolupar amb la premissa que era un nen de 13 anys que vivia a Ucraïna. Aquest va ser un intent deliberat de crear una situació on fins i tot un anglès una mica maldestre s'acceptés com a natural. "PARRY" es va modelar a partir d'un pacient paranoic i "ELIZA" es va dissenyar per imitar un assessor psicològic professional.
D'aquesta manera, quan una IA es configura per representar un humà amb característiques específiques i després participa en una conversa, els jutges l'avaluen tenint en compte aquestes característiques. Per exemple, fins i tot si sorgeix una resposta una mica estranya mentre es conversa amb una IA programada per representar una persona amb una malaltia mental, és probable que els jutges l'acceptin com una reacció natural coherent amb aquesta caracterització. En altres paraules, mentre que se suposa que els jutges han d'avaluar sense biaix, en realitat es troben en un entorn on fer-ho és difícil.
Per descomptat, les persones amb malalties mentals són capaces de pensar. Tanmateix, el fet que una IA modelada a partir d'una persona amb una malaltia mental superi el test de Turing no vol dir que pensi més "humànicament" que un humà. Per mantenir-se fidel a la pregunta plantejada per Alan Turing: "Pot una màquina comportar-se de la mateixa manera que ho fa un humà?", el test s'ha de dissenyar a partir de situacions generals que la majoria de la gent pugui acceptar.
En tercer lloc, la IA pot superar el test de Turing simplement manipulant símbols en lloc d'entendre realment el contingut. Un bon exemple és «ELIZA». Perquè una persona pensi sobre un tema, ha d'entendre aquest tema i emetre judicis basats en l'experiència rellevant. Per aquest motiu, el filòsof John Searle també va argumentar que el test de Turing per si sol no pot demostrar si una màquina realment pensa.
A més, com que la intel·ligència artificial funciona segons algoritmes predeterminats, pot revelar fàcilment errors quan s'enfronta a situacions inesperades. El següent és un exemple que ho il·lustra.
Interlocutor: Encara doneu suport a Bill Clinton?
Jutge: No he conegut mai Clinton.
Interlocutor: Realment no t'agrada Bill Clinton. Almenys, està clar que no t'agrada. Al meu entendre, sembla que la majoria de la gent simplement no hi ha tingut gaire interès o no hi ha pensat gaire fins ara.
Jutge: Has vist "El Marcià"?
Interlocutor: Tranquil·litzem-nos. No estic aquí per respondre preguntes estúpides. No és això. De què parlàvem? D'acord. El que acabes de dir vol dir que els problemes de fons —com Whitewater i el fiscal especial— són greus?
Aquesta conversa és entre un jutge i "Catherine", una IA dissenyada per continuar un diàleg basat en informació preprogramada sobre esdeveniments que s'havien convertit en notícia el dia abans de la prova de Turing. Si el jutge hagués continuat la conversa política relacionada amb Bill Clinton, el diàleg podria haver estat força natural. Tanmateix, quan el jutge va canviar de tema de sobte, la IA no va poder gestionar correctament el tema no programat i va revelar l'error que es mostra més amunt.
Per tant, no podem concloure que una IA es comporta com un humà simplement perquè és capaç d'un cert nivell de comunicació. Tot i que superficialment pot semblar que participa en una conversa similar a la d'un humà, en realitat no entén el contingut, sinó que simplement respon d'una manera que el fa semblar humà. Per tant, no compleix el concepte d'"intel·ligència" tal com s'ha definit anteriorment. L'actual test de Turing, que supera els sistemes d'IA que simplement imiten el comportament humà sense entendre realment el significat, té limitacions clares.
En la mesura que avalua la IA comparant-la amb els humans, el test de Turing és un experiment significatiu que explora la frontera entre els humans i la IA. Tenint en compte que els humans mateixos no poden definir clarament l'essència del pensament o de la ment, aquest intent en si mateix té un valor significatiu. D'altra banda, com que la IA funciona a partir d'estructures i principis relativament simples, és possible mesurar-la i analitzar-la fins a cert punt, encara que no sigui perfectament.
Tanmateix, el test de Turing no aconsegueix avaluar amb precisió la intel·ligència, i els seus criteris d'avaluació també són massa subjectius. Una anàlisi més detallada del procés de prova real revela que és difícil veure'l com un entorn capaç d'avaluar de manera exhaustiva la intel·ligència d'una IA. Fins i tot si hi participen diversos jutges i una institució supervisa el procés d'avaluació, el nombre d'avaluadors és limitat i no és fàcil arribar a una conclusió objectiva que tingui en compte totes les variables. Per tant, hi ha limitacions fonamentals per obtenir un resultat perfecte que tothom pugui acceptar.
El test de Turing té una importància significativa, ja que va demostrar que la IA pot, fins a cert punt, replicar les habilitats cognitives que abans es consideraven exclusives dels humans. Per tant, en lloc de descartar completament aquest test, cal establir criteris i procediments d'avaluació que siguin més precisos i acceptables per a un públic més ampli que els que s'utilitzen actualment.
En aquest sentit, m'agradaria proposar el "test de Turing invers" com a alternativa. En el test de Turing invers, l'avaluador és un ordinador en lloc d'un humà. En altres paraules, és un mètode en què un ordinador avalua un humà o un altre ordinador mentre interactua amb ell. Introduir aquest enfocament en els tests existents reduiria el problema de la subjectivitat humana i permetria dur a terme les avaluacions en un entorn més objectiu. Per descomptat, el fet que l'avaluador sigui una IA també planteja la possibilitat de nous problemes.
Independentment de la matèria, és poc probable que les proves dissenyades per a l'avaluació i el judici satisfacin tothom, i no és fàcil establir criteris perfectes que tothom pugui acceptar. Per tant, hem d'explorar contínuament maneres de millorar-los. En particular, atès que el test de Turing és un mètode d'avaluació crucial que podria influir significativament en el futur de la indústria i la direcció del desenvolupament de la tecnologia d'IA, ha d'evolucionar cap a una forma més eficient i fiable.
Avui dia, la IA avança a un ritme incomparable amb el passat i ja s'utilitza en tots els aspectes de la nostra vida quotidiana. A l'hora d'avaluar aquesta IA, no l'hem de jutjar només per si pot enganyar els humans, sinó per la seva capacitat d'entendre el significat, comprendre el context i comunicar-se de manera natural en una varietat de situacions. Per descomptat, com que aquest no és un camp amb "respostes correctes" clarament definides com un problema matemàtic, establir criteris objectius no és fàcil. No obstant això, per avaluar la IA que coexistirà amb els humans en el futur, el test de Turing ha d'evolucionar per considerar de manera exhaustiva els factors ètics i la capacitat de comunicar-se de manera eficaç.