Vai Tjūringa tests tiešām var novērtēt mākslīgo intelektu?

Šajā emuāra ierakstā mēs aplūkosim, vai Tjūringa tests ir piemērots standarts mākslīgā intelekta novērtēšanai, kā arī izpētīsim tā ierobežojumus un potenciālās uzlabošanas jomas.

 

2014. gadā ziņas, ka krievu izstrādātāju izveidotais tērzēšanas robots “Eugene Gustman” ir izturējis Tjūringa testu, bija šokējošas un daudziem cilvēkiem radīja apjukumu. Tas bija skaidrs pierādījums tam, ka mākslīgais intelekts vairs nav tikai iedomātas nākotnes sabiedrības produkts, ko var redzēt tikai zinātniskās fantastikas filmās. Mākslīgais intelekts jau ir dziļi iesakņojies mūsu dzīvē un strauji attīstās saskaņā ar Reja Kurcveila “Paātrinātās atgriešanās likumu”. Tomēr mēs nevaram vienkārši stāvēt malā un vērot, kā mākslīgais intelekts, kas attīstās acumirklī, nostiprinās sabiedrībā. Mums jānoskaidro, vai mākslīgais intelekts patiešām spēj domāt tāpat kā cilvēki, un jāapsver arī virziens, kādā tam vajadzētu attīstīties nākotnē.
Šie jautājumi ir saistīti ar Tjūringa testu. Tjūringa tests ir novērtēšanas metode, kas radusies no jautājuma: "Vai ir iespējams izveidot datoru, par kuru varam teikt, ka tam piemīt intelekts un prāts?". Ir plaši zināms, ka Alans Tjūrings to ierosināja 1950. gadā, lai atbildētu uz jautājumu "Vai mašīnas var domāt?". Tomēr Tjūrings, izstrādājot eksperimentu, pārfrāzēja pašu jautājumu kā "Vai mašīnas var uzvesties tāpat kā cilvēki?". Tests tiek veikts, liekot tiesnesim uzdot jautājumus gan cilvēkam, gan mākslīgajam intelektam (MI), un pēc tam nosakot, kura atbildes ir cilvēciskākas. Tjūringa testā var izmantot dažādas metodes, lai maldinātu tiesnesi, un ir atļauts palēnināt atbildes laiku vai turpināt sarunu tērzēšanai līdzīgā formātā. Turklāt tests tiek uzskatīts par nokārtotu, ja MI var apmānīt aptuveni 30% tiesnešu ierobežotajā diskusijas apjomā un tēmā.
Es apšaubīju, vai Tjūringa tests ar šiem nosacījumiem un noteikumiem patiešām ir piemērots mērs mākslīgā intelekta novērtēšanai. Citiem vārdiem sakot, es uzskatu, ka Tjūringa tests nav piemērots mākslīgā intelekta novērtēšanai. Lai pamatotu šo viedokli, es izvirzīšu trīs argumentus un kā risinājumu piedāvāšu "apgriezto Tjūringa testu". Tomēr pirms tam ir vispirms jāizpēta citi ievērojami mākslīgā intelekta piemēri, kas ir izturējuši Tjūringa testu, ne tikai "Jūdžins Gustmans".
“ELIZA”, ko 1966. gadā izstrādāja Džozefs Veizenbaums, ir visplašāk pazīstamākais piemērs starp agrīnajām dabiskās valodas dialoga programmām. Šis mākslīgais intelekts bija paredzēts, lai ievadītajos teikumos identificētu galvenos atslēgvārdus un atgrieztu atbilstošas ​​atbildes; ja atbilstoši atslēgvārdi netika atrasti, tas atkārtotu lietotāja vārdus vai sniegtu vispārīgu atbildi.
Pastāv arī “PARRY”, ko 1972. gadā izstrādāja Kenets Kolbijs. Šis mākslīgais intelekts tika modelēts pēc paranoiska pacienta sarunvalodas stila, un tika veikti pat eksperimenti, kuros vairāki psihiatri mēģināja atšķirt īstus pacientus no PARRY.
Turpmāk es aplūkošu, kāpēc Tjūringa tests nav piemērots standarts mākslīgā intelekta novērtēšanai.
Pirmkārt, Tjūringa tests precīzi nenovērtē pašu intelektu. Citiem vārdiem sakot, tā vietā, lai novērtētu, cik inteliģenti mākslīgais intelekts domā, šis tests ar sarunas palīdzību nosaka, vai tas uzvedas kā cilvēks. Ar šo ir divas problēmas.
Pirmkārt, ne visi cilvēki vienmēr uzvedas inteliģenti. Šeit “inteliģents” attiecas uz intelektuālu darbību, kas ietver parādības vai objekta izpratni un tā racionālu apstrādi. Turklāt, saskaņā ar Alana Tjūringa rakstu, dažas mākslīgā intelekta intelektuālās spējas var izpausties citādi nekā cilvēku spējas. Vienkārši sakot, ja mākslīgais intelekts atrisina problēmu, ko cilvēki nevar, vērtētājs, visticamāk, sapratīs, ka otra puse ir dators. Galu galā Tjūringa tests nespēj pareizi novērtēt intelekta formas, kas pārsniedz cilvēka spējas.
Otrkārt, Tjūringa testa vērtēšanas kritēriji ir subjektīvi, un eksperimenta apstākļi ir pārāk ierobežojoši. Citiem vārdiem sakot, testa rezultātus var būtiski ietekmēt vērtētāja attieksme, pieredze, prasmes un zināšanas, nevis mākslīgā intelekta faktiskais intelekta līmenis, kas apgrūtina objektivitātes nodrošināšanu.

Galu galā subjekts, kas nosaka, vai kaut kas ir mākslīgais intelekts vai cilvēks, ir persona, tāpēc ir grūti pilnībā izslēgt vērtētāja subjektivitāti. Turklāt jautājumi, kas tiek uzdoti ierobežotajā aptuveni piecu minūšu laikā, arī ir ļoti ierobežoti. Kamēr vien vērtētājs ir cilvēks, vienmēr pastāv iespēja, ka viņu ietekmē dažādi ārēji faktori.
Turklāt lielākā daļa Tjūringa testā iesaistīto mākslīgo intelektu (MI) ir veidoti pēc cilvēku parauga ar noteiktām situācijām vai īpašībām. Tāpēc pat ja MI iztur testu, ir grūti secināt, ka tas uzvedas tāpat kā cilvēki kopumā. Piemēram, iepriekš iepazīstinātais tēls “Jūdžīns Gustmans” tika izstrādāts ar pieņēmumu, ka tas ir 13 gadus vecs zēns, kas dzīvo Ukrainā. Tas bija apzināts mēģinājums radīt situāciju, kurā pat nedaudz neveikla angļu valoda tiktu pieņemta kā dabiska. “PARRY” tika veidots pēc paranoiska pacienta parauga, un “ELIZA” tika veidota, lai atdarinātu profesionālu psiholoģisko konsultantu.
Tādā veidā, kad mākslīgais intelekts tiek iestatīts, lai attēlotu cilvēku ar noteiktām īpašībām, un pēc tam iesaistās sarunā, tiesneši to novērtē, ņemot vērā šīs īpašības. Piemēram, pat ja sarunā ar mākslīgo intelektu, kas ieprogrammēts attēlot cilvēku ar garīgām slimībām, rodas nedaudz dīvaina reakcija, tiesneši, visticamāk, to pieņems kā dabisku reakciju, kas atbilst šim raksturojumam. Citiem vārdiem sakot, lai gan tiesnešiem ir jāvērtē bez aizspriedumiem, viņi faktiski tiek novietoti vidē, kur to ir grūti izdarīt.
Protams, cilvēki ar garīgām slimībām spēj domāt. Tomēr tas, ka mākslīgais intelekts, kas veidots pēc cilvēka ar garīgām slimībām parauga, nokārto Tjūringa testu, nenozīmē, ka tas domā “līdzīgāk” nekā cilvēks. Lai paliktu uzticīgs Alana Tjūringa uzdotajam jautājumam — “Vai mašīna var uzvesties tāpat kā cilvēks?” —, tests ir jāizstrādā, balstoties uz vispārīgām situācijām, kuras var pieņemt lielākā daļa cilvēku.
Treškārt, mākslīgais intelekts var nokārtot Tjūringa testu, vienkārši manipulējot ar simboliem, nevis faktiski izprotot saturu. Spilgts piemērs ir “ELIZA”. Lai cilvēks domātu par kādu tēmu, viņam ir jāsaprot šī tēma un jāizdara spriedumi, pamatojoties uz atbilstošu pieredzi. Šī iemesla dēļ filozofs Džons Sērls arī apgalvoja, ka Tjūringa tests vien nevar pierādīt, vai mašīna patiešām domā.
Turklāt, tā kā mākslīgais intelekts darbojas saskaņā ar iepriekš noteiktiem algoritmiem, tas var viegli atklāt kļūdas negaidītās situācijās. Turpmāk sniegts piemērs, kas to ilustrē.
Sarunu biedrs: Vai jūs joprojām atbalstāt Bilu Klintonu?
Tiesnesis: Es nekad neesmu saticis Klintoni.
Sarunu biedrs: Jums tiešām nepatīk Bils Klintons. Vismaz ir skaidrs, ka jūs viņu neieredzat. Manuprāt, šķiet, ka lielākajai daļai cilvēku tas vienkārši nav bijis interesanti vai arī viņi līdz šim nav par to daudz domājuši.
Tiesnesis: Vai esat redzējis filmu "Marsietis"?
Sarunu biedrs: Atvieglosim lietas. Es neesmu šeit, lai atbildētu uz muļķīgiem jautājumiem. Tas nav tas. Par ko mēs runājām? Tieši tā. Vai tas, ko jūs tikko teicāt, nozīmē, ka pamatā esošās problēmas — piemēram, Vaitvoters un īpašais prokurors — ir nopietnas?
Šī saruna notiek starp tiesnesi un "Katrīnu" – mākslīgo intelektu, kas paredzēts, lai turpinātu dialogu, pamatojoties uz iepriekš ieprogrammētu informāciju par notikumiem, kas kļuva par ziņām dienu pirms Tjūringa testa. Ja tiesnesis būtu turpinājis politisko sarunu saistībā ar Bilu Klintoni, dialogs varētu būt palicis diezgan dabisks. Tomēr, kad tiesnesis pēkšņi pārcēla tēmu uz kaut ko citu, mākslīgais intelekts nespēja pareizi apstrādāt neieprogrammēto tēmu un atklāja iepriekš parādīto kļūdu.
Tādējādi mēs nevaram secināt, ka mākslīgais intelekts (MI) uzvedas kā cilvēks tikai tāpēc, ka tas spēj sasniegt noteiktu komunikācijas līmeni. Lai gan virspusēji var šķist, ka tas iesaistās cilvēkam līdzīgā sarunā, tas patiesībā nesaprot saturu, bet tikai reaģē tādā veidā, kas liek tam šķist cilvēciskam. Tādēļ tas neatbilst iepriekš definētajam "intelekta" jēdzienam. Pašreizējam Tjūringa testam, kas iztur MI sistēmas, kuras tikai atdarina cilvēka uzvedību, faktiski nesaprotot nozīmi, ir skaidri ierobežojumi.
Tjūringa tests, kas novērtē mākslīgo intelektu (MI), salīdzinot to ar cilvēkiem, ir jēgpilns eksperiments, kas pēta robežu starp cilvēkiem un MI. Ņemot vērā, ka cilvēki paši nevar skaidri definēt domu vai prāta būtību, šim mēģinājumam pašam par sevi ir būtiska vērtība. No otras puses, tā kā MI darbojas, pamatojoties uz relatīvi vienkāršām struktūrām un principiem, to ir iespējams zināmā mērā izmērīt un analizēt, pat ja ne perfekti.
Tomēr Tjūringa tests nespēj precīzi novērtēt intelektu, un tā vērtēšanas kritēriji ir arī pārāk subjektīvi. Rūpīgāk aplūkojot faktisko testēšanas procesu, atklājas, ka to ir grūti uzskatīt par vidi, kas spēj visaptveroši novērtēt mākslīgā intelekta intelektu. Pat ja piedalās vairāki tiesneši un iestāde pārrauga vērtēšanas procesu, vērtētāju skaits ir ierobežots, un nav viegli nonākt pie objektīva secinājuma, kurā ņemti vērā visi mainīgie. Tāpēc pastāv būtiski ierobežojumi, lai iegūtu perfektu rezultātu, ko visi varētu pieņemt.
Tjūringa testam ir būtiska nozīme, jo tas parādīja, ka mākslīgais intelekts zināmā mērā var atkārtot kognitīvās spējas, kas kādreiz tika uzskatītas par unikālām cilvēkiem. Tāpēc, tā vietā, lai pilnībā noraidītu šo testu, ir jāizveido precīzāki un pieņemamāki plašākai auditorijai nekā pašlaik izmantotie.
Šajā sakarā es vēlētos ierosināt "Apgrieztā Tjūringa testu" kā alternatīvu. Apgrieztajā Tjūringa testā vērtētājs ir dators, nevis cilvēks. Citiem vārdiem sakot, tā ir metode, kurā dators novērtē cilvēku vai citu datoru, mijiedarbojoties ar to. Šīs pieejas ieviešana esošajos testos mazinātu cilvēka subjektivitātes problēmu un ļautu veikt novērtējumus objektīvākā vidē. Protams, fakts, ka vērtētājs ir mākslīgais intelekts, rada arī jaunu problēmu iespējamību.
Neatkarīgi no tēmas, testi, kas paredzēti novērtēšanai un spriedumam, diez vai apmierinās visus, un nav viegli noteikt perfektus kritērijus, ko visi varētu pieņemt. Tāpēc mums ir pastāvīgi jāpēta veidi, kā tos uzlabot. Jo īpaši, tā kā Tjūringa tests ir būtiska novērtēšanas metode, kas varētu būtiski ietekmēt nozares nākotni un mākslīgā intelekta tehnoloģiju attīstības virzienu, tam ir jāattīstās efektīvākā un uzticamākā formā.
Mūsdienās mākslīgais intelekts (MI) attīstās tempā, kas nav salīdzināms ar pagātni, un tas jau tiek izmantots visos mūsu ikdienas dzīves aspektos. Vērtējot šādu MI, mums nevajadzētu spriest tikai par to, vai tas spēj maldināt cilvēkus, bet gan novērtēt tā spēju saprast nozīmi, aptvert kontekstu un dabiski sazināties dažādās situācijās. Protams, tā kā šī nav joma ar skaidri definētām "pareizajām atbildēm", piemēram, matemātikas uzdevumā, objektīvu kritēriju noteikšana nav vienkārša. Tomēr, lai novērtētu MI, kas nākotnē pastāvēs līdzās cilvēkiem, Tjūringa testam ir jāattīstās, lai visaptveroši ņemtu vērā ētiskos faktorus un spēju efektīvi sazināties.

 

Par autoru