Poate testul Turing să evalueze cu adevărat inteligența artificială?

În această postare pe blog, vom examina dacă testul Turing este un standard potrivit pentru evaluarea inteligenței artificiale și vom explora limitele sale și potențialele domenii de îmbunătățire.

 

În 2014, vestea că „Eugene Goostman”, un chatbot creat de dezvoltatori ruși, a trecut testul Turing, a fost un șoc și a provocat confuzie pentru mulți oameni. Aceasta a fost o demonstrație clară a faptului că inteligența artificială nu mai este doar un produs al unei societăți imaginare din viitor, văzută doar în filmele science fiction. IA este deja profund înrădăcinată în viețile noastre și avansează într-un ritm rapid, în conformitate cu „Legea accelerării randamentelor” a lui Ray Kurzweil. Cu toate acestea, nu putem pur și simplu să stăm deoparte și să privim cum IA, care evoluează într-o clipă, se stabilește ferm în societate. Trebuie să stabilim dacă IA poate într-adevăr să gândească așa cum o fac oamenii și trebuie să luăm în considerare și direcția în care ar trebui să se dezvolte în viitor.
Aceste probleme sunt legate de Testul Turing. Testul Turing este o metodă de evaluare care își are originea în întrebarea: „Este posibil să creăm un computer despre care putem spune că posedă inteligență și minte?”. Se știe că Alan Turing l-a propus în 1950 pentru a răspunde la întrebarea „Pot mașinile să gândească?”. Cu toate acestea, Turing a reformulat întrebarea în sine atunci când a conceput experimentul, astfel: „Se pot comporta mașinile în același mod în care se comportă oamenii?”. Testul se realizează prin ruga un judecător să adreseze întrebări atât unui om, cât și unei inteligențe artificiale, apoi să se determine ale căror răspunsuri sunt mai apropiate de cele umane. În Testul Turing, se pot folosi diverse metode pentru a înșela judecătorul și este permisă încetinirea timpilor de răspuns sau continuarea conversației într-un format asemănător chat-ului. În plus, testul este considerat promovat dacă inteligența artificială poate înșela aproximativ 30% dintre judecători în limitele domeniului de aplicare și ale subiectului discuției.
M-am întrebat dacă un test Turing cu aceste condiții și reguli este cu adevărat o măsură adecvată pentru evaluarea inteligenței IA. Cu alte cuvinte, cred că testul Turing nu este potrivit pentru evaluarea IA. Pentru a susține această opinie, voi prezenta trei argumente și voi propune „Testul Turing invers” ca soluție. Înainte de a face acest lucru, însă, este necesar să examinăm mai întâi alte exemple notabile de IA care au trecut testul Turing, în afară de „Eugene Goostman”.
„ELIZA”, dezvoltată de Joseph Weizenbaum în 1966, este cel mai cunoscut exemplu printre primele programe de dialog în limbaj natural. Această inteligență artificială a fost concepută pentru a identifica cuvintele cheie din propozițiile de intrare și a returna răspunsurile corespunzătoare; dacă nu se găseau cuvinte cheie adecvate, repeta cuvintele utilizatorului sau oferea un răspuns generic.
Există și „PARRY”, dezvoltată de Kenneth Colby în 1972. Această inteligență artificială a fost modelată după stilul conversațional al unui pacient paranoic și au fost efectuate chiar și experimente în care mai mulți psihiatri au încercat să facă distincția între pacienții reali și PARRY.
De acum înainte, voi examina de ce testul Turing nu este un standard potrivit pentru evaluarea IA.
În primul rând, testul Turing nu evaluează cu exactitate inteligența în sine. Cu alte cuvinte, în loc să evalueze cât de inteligent gândește o IA, acest test determină prin conversație dacă se comportă ca un om. Există două probleme legate de acest lucru.
În primul rând, nu toți oamenii se comportă întotdeauna inteligent. Aici, „inteligent” se referă la activitatea intelectuală care implică înțelegerea unui fenomen sau obiect și procesarea acestuia rațional. Mai mult, conform lucrării lui Alan Turing, unele abilități intelectuale ale IA se pot manifesta în moduri diferite de cele ale oamenilor. Simplu spus, dacă o IA rezolvă o problemă pe care oamenii nu o pot rezolva, evaluatorul este de fapt mai predispus să realizeze că cealaltă parte este un computer. În cele din urmă, testul Turing nu reușește să evalueze corect formele de inteligență care depășesc capacitățile umane.
În al doilea rând, criteriile de evaluare ale testului Turing sunt subiective, iar condițiile experimentale sunt excesiv de restrictive. Cu alte cuvinte, rezultatele testului pot fi influențate semnificativ de atitudinea, experiența, abilitățile și cunoștințele evaluatorului, mai degrabă decât de nivelul real de inteligență al inteligenței artificiale, ceea ce face dificilă asigurarea obiectivității.

În cele din urmă, entitatea care stabilește dacă ceva este o inteligență artificială sau o ființă umană este o persoană, așa că este dificil să se elimine complet subiectivitatea evaluatorului. În plus, întrebările adresate în intervalul de timp limitat de aproximativ cinci minute sunt, de asemenea, foarte restricționate. Atâta timp cât evaluatorul este o ființă umană, există întotdeauna posibilitatea de a fi influențat de diverși factori externi.
În plus, majoritatea inteligențelor artificiale care participă la testul Turing sunt modelate după oameni cu situații sau caracteristici specifice. Prin urmare, chiar dacă o inteligență artificială trece testul, este dificil de concluzionat că se comportă în același mod ca oamenii în general. De exemplu, „Eugene Goostman”, introdus anterior, a fost dezvoltat pornind de la premisa că era un băiat de 13 ani care locuia în Ucraina. Aceasta a fost o încercare deliberată de a crea o situație în care chiar și o engleză oarecum stângace ar fi acceptată ca fiind naturală. „PARRY” a fost modelat după un pacient paranoic, iar „ELIZA” a fost conceput pentru a imita un consilier psihologic profesionist.
În acest fel, atunci când o inteligență artificială este configurată să reprezinte o ființă umană cu caracteristici specifice și apoi este angajată într-o conversație, judecătorii o evaluează având în vedere aceste caracteristici. De exemplu, chiar dacă apare un răspuns oarecum ciudat în timpul conversației cu o inteligență artificială programată să reprezinte o persoană cu o boală mintală, judecătorii sunt predispuși să îl accepte ca o reacție naturală, în concordanță cu acea caracterizare. Cu alte cuvinte, deși judecătorii ar trebui să evalueze fără părtinire, ei sunt de fapt plasați într-un mediu în care acest lucru este dificil.
Desigur, persoanele cu boli mintale sunt capabile să gândească. Totuși, doar pentru că o inteligență artificială modelată după o persoană cu o boală mintală trece testul Turing nu înseamnă că gândește mai „uman” decât un om. Pentru a rămâne fideli întrebării puse de Alan Turing - „Se poate comporta o mașină așa cum se comportă un om?” - testul trebuie conceput pe baza unor situații generale pe care majoritatea oamenilor le pot accepta.
În al treilea rând, inteligența artificială poate trece testul Turing pur și simplu manipulând simboluri, în loc să înțeleagă efectiv conținutul. Un exemplu excelent este „ELIZA”. Pentru ca o persoană să gândească la un subiect, trebuie să înțeleagă acel subiect și să emită judecăți bazate pe experiența relevantă. Din acest motiv, filosoful John Searle a susținut, de asemenea, că testul Turing nu poate dovedi, de unul singur, dacă o mașină chiar gândește.
În plus, întrucât inteligența artificială funcționează conform unor algoritmi predeterminați, aceasta poate dezvălui cu ușurință erori atunci când se confruntă cu situații neașteptate. Următorul exemplu ilustrează acest lucru.
Interlocutor: Îl mai susțineți pe Bill Clinton?
Judecător: Nu l-am întâlnit niciodată pe Clinton.
Interlocutor: Îl antipatizezi cu adevărat pe Bill Clinton. Cel puțin, e clar că îl antipatizezi. În opinia mea, se pare că majoritatea oamenilor pur și simplu au fost neinteresați sau nu s-au gândit prea mult la asta până acum.
Judecător: Ați văzut „Marțianul”?
Interlocutor: Hai să o luăm ușor. Nu sunt aici să răspund la întrebări stupide. Nu e vorba despre asta. Despre ce vorbeam? Corect. Ceea ce tocmai ați spus înseamnă că problemele de fond - cum ar fi Whitewater și procurorul special - sunt serioase?
Această conversație este între un judecător și „Catherine”, o inteligență artificială concepută să continue un dialog bazat pe informații preprogramate despre evenimente care deveniseră știri cu o zi înainte de susținerea Testului Turing. Dacă judecătorul ar fi continuat conversația politică legată de Bill Clinton, dialogul ar fi putut rămâne destul de natural. Cu toate acestea, când judecătorul a schimbat brusc subiectul, inteligența artificială nu a putut gestiona corect subiectul neprogramat și a dezvăluit eroarea prezentată mai sus.
Prin urmare, nu putem concluziona că o IA se comportă ca un om doar pentru că este capabilă de un anumit nivel de comunicare. Deși la suprafață poate părea că se angajează într-o conversație asemănătoare cu cea umană, nu înțelege de fapt conținutul, ci doar răspunde într-un mod care îl face să pară uman. Prin urmare, nu se încadrează în conceptul de „inteligență” așa cum a fost definit anterior. Actualul test Turing, care trece testele sistemelor de IA care doar imită comportamentul uman fără a înțelege de fapt semnificația, are limitări clare.
Prin faptul că evaluează inteligența artificială prin compararea acesteia cu oamenii, testul Turing este un experiment semnificativ care explorează granița dintre oameni și inteligența artificială. Având în vedere că oamenii înșiși nu pot defini clar esența gândirii sau a minții, această încercare în sine are o valoare semnificativă. Pe de altă parte, deoarece inteligența artificială funcționează pe baza unor structuri și principii relativ simple, este posibil să o măsurăm și să o analizăm într-o anumită măsură, chiar dacă nu perfect.
Cu toate acestea, testul Turing nu reușește să evalueze cu exactitate inteligența, iar criteriile sale de evaluare sunt, de asemenea, excesiv de subiective. O analiză mai atentă a procesului de testare real arată că este dificil să îl considerăm un mediu capabil să evalueze în mod cuprinzător inteligența unei IA. Chiar dacă participă mai mulți judecători și o instituție supraveghează procesul de evaluare, numărul evaluatorilor este limitat și nu este ușor să se ajungă la o concluzie obiectivă care să ia în considerare toate variabilele. Prin urmare, există limitări fundamentale pentru a obține un rezultat perfect pe care toată lumea să îl poată accepta.
Testul Turing are o importanță semnificativă prin faptul că a demonstrat că inteligența artificială poate, într-o anumită măsură, reproduce abilitățile cognitive considerate odinioară specifice oamenilor. Prin urmare, în loc să se respingă complet acest test, este nevoie să se stabilească criterii și proceduri de evaluare mai precise și acceptabile pentru un public mai larg decât cele utilizate în prezent.
În acest sens, aș dori să propun „Testul Turing Invers” ca alternativă. În acest test, evaluatorul este un computer și nu o ființă umană. Cu alte cuvinte, este o metodă prin care un computer evaluează o ființă umană sau un alt computer în timp ce interacționează cu acesta. Introducerea acestei abordări în testele existente ar reduce problema subiectivității umane și ar permite efectuarea evaluărilor într-un mediu mai obiectiv. Desigur, faptul că evaluatorul este o inteligență artificială ridică și posibilitatea apariției unor noi probleme.
Indiferent de subiect, testele concepute pentru evaluare și judecată sunt puțin probabil să satisfacă pe toată lumea și nu este ușor să se stabilească criterii perfecte pe care toată lumea să le poată accepta. Prin urmare, trebuie să explorăm în permanență modalități de a le îmbunătăți. În special, deoarece testul Turing este o metodă de evaluare crucială care ar putea influența semnificativ viitorul industriei și direcția dezvoltării tehnologiei IA, acesta trebuie să evolueze într-o formă mai eficientă și mai fiabilă.
Astăzi, IA avansează într-un ritm incomparabil cu trecutul și este deja utilizată în fiecare aspect al vieții noastre de zi cu zi. Atunci când evaluăm o astfel de IA, nu ar trebui să o judecăm doar pe baza faptului dacă poate înșela oamenii, ci mai degrabă să evaluăm capacitatea sa de a înțelege sensul, de a înțelege contextul și de a comunica natural într-o varietate de situații. Desigur, deoarece acesta nu este un domeniu cu „răspunsuri corecte” clar definite, precum o problemă de matematică, stabilirea unor criterii obiective nu este ușoară. Cu toate acestea, pentru a evalua IA care va coexista cu oamenii în viitor, testul Turing trebuie să evolueze pentru a lua în considerare în mod cuprinzător factorii etici și capacitatea de a comunica eficient.

 

Despre autor