Šiame tinklaraščio įraše nagrinėsime, ar Turingo testas yra tinkamas dirbtinio intelekto intelekto vertinimo standartas, ir išnagrinėsime jo apribojimus bei galimas tobulinimo sritis.
2014 m. žinia, kad rusų kūrėjų sukurtas pokalbių robotas „Eugene'as Goostmanas“ išlaikė Turingo testą, daugeliui žmonių buvo šokas ir sukėlė painiavą. Tai buvo aiškus įrodymas, kad dirbtinis intelektas nebėra tik įsivaizduojamos ateities visuomenės, matomos tik mokslinės fantastikos filmuose, produktas. Dirbtinis intelektas jau giliai įsitvirtino mūsų gyvenime ir sparčiai tobulėja, vadovaudamasis Ray'aus Kurzweilo „Greitėjančios grąžos dėsniu“. Tačiau negalime tiesiog stovėti ir stebėti, kaip akimirksniu besivystantis dirbtinis intelektas tvirtai įsitvirtina visuomenėje. Turime nustatyti, ar dirbtinis intelektas iš tiesų gali mąstyti taip, kaip žmonės, ir apsvarstyti, kuria kryptimi jis turėtų vystytis ateityje.
Šie klausimai yra susiję su Turingo testu. Turingo testas yra vertinimo metodas, kilęs iš klausimo: „Ar įmanoma sukurti kompiuterį, kuris, galėtume teigti, turėtų intelektą ir protą?“. Visuotinai žinoma, kad Alanas Turingas jį pasiūlė 1950 m., norėdamas atsakyti į klausimą „Ar mašinos gali mąstyti?“. Tačiau Turingas, kurdamas eksperimentą, patį klausimą perfrazavo taip: „Ar mašinos gali elgtis taip pat, kaip ir žmonės?“. Testas atliekamas teisėjui užduodant klausimus ir žmogui, ir dirbtiniam intelektui, o tada nustatant, kieno atsakymai labiau panašūs į žmogiškus. Turingo teste gali būti naudojami įvairūs metodai, siekiant apgauti teisėją, ir leidžiama sulėtinti reakcijos laiką arba tęsti pokalbį panašiu į pokalbį formatu. Be to, testas laikomas išlaikytu, jei dirbtinis intelektas gali apgauti maždaug 30 % teisėjų, atsižvelgdamas į ribotą diskusijos apimtį ir temą.
Aš abejojau, ar Turingo testas su šiomis sąlygomis ir taisyklėmis yra tikrai tinkamas matas dirbtinio intelekto intelektui įvertinti. Kitaip tariant, manau, kad Turingo testas netinka dirbtiniam intelektui įvertinti. Šiam požiūriui pagrįsti pateiksiu tris argumentus ir kaip sprendimą pasiūlysiu „atvirkštinį Turingo testą“. Tačiau prieš tai darant būtina pirmiausia išnagrinėti kitus žymius dirbtinio intelekto pavyzdžius, kurie išlaikė Turingo testą, be „Eugene'o Goostmano“.
„ELIZA“, kurią 1966 m. sukūrė Josephas Weizenbaumas, yra plačiausiai žinomas ankstyvųjų natūralios kalbos dialogo programų pavyzdys. Šis dirbtinis intelektas buvo sukurtas tam, kad atpažintų pagrindinius raktinius žodžius įvestuose sakiniuose ir pateiktų atitinkamus atsakymus; jei tinkamų raktinių žodžių nerastų, jis pakartotų vartotojo žodžius arba pateiktų bendrinį atsakymą.
Taip pat yra „PARRY“, kurį 1972 m. sukūrė Kennethas Colby. Šis dirbtinis intelektas buvo modeliuojamas pagal paranojiško paciento pokalbio stilių, ir netgi buvo atlikti eksperimentai, kuriuose keli psichiatrai bandė atskirti tikrus pacientus nuo PARRY.
Nuo šiol nagrinėsiu, kodėl Turingo testas nėra tinkamas standartas dirbtiniam intelektui įvertinti.
Pirma, Turingo testas netiksliai įvertina patį intelektą. Kitaip tariant, užuot vertinęs, kiek protingai DI mąsto, šis testas per pokalbį nustato, ar jis elgiasi kaip žmogus. Tai turi dvi problemas.
Pirma, ne visi žmonės visada elgiasi protingai. Čia „protingas“ reiškia intelektinę veiklą, apimančią reiškinio ar objekto supratimą ir racionalų jo apdorojimą. Be to, remiantis Alano Turingo straipsniu, kai kurie DI intelektiniai gebėjimai gali pasireikšti kitaip nei žmonių. Paprastai tariant, jei DI išsprendžia problemą, kurios negali išspręsti žmonės, vertintojas labiau linkęs suprasti, kad kita šalis yra kompiuteris. Galiausiai, Turingo testas netinkamai įvertina intelekto formas, kurios viršija žmogaus galimybes.
Antra, Turingo testo vertinimo kriterijai yra subjektyvūs, o eksperimentinės sąlygos pernelyg ribojančios. Kitaip tariant, testo rezultatus gali smarkiai paveikti vertintojo požiūris, patirtis, įgūdžiai ir žinios, o ne tikrasis dirbtinio intelekto intelekto lygis, todėl sunku užtikrinti objektyvumą.
Galiausiai subjektas, nustatantis, ar kažkas yra dirbtinis intelektas, ar žmogus, yra asmuo, todėl sunku visiškai pašalinti vertintojo subjektyvumą. Be to, per ribotą maždaug penkių minučių laiką užduodami klausimai taip pat yra labai riboti. Kol vertintojas yra žmogus, visada yra galimybė, kad jį įtakos turės įvairūs išoriniai veiksniai.
Be to, dauguma Turingo teste dalyvaujančių dirbtinių intelektų yra sukurti pagal žmones, turinčius specifinių situacijų ar savybių. Todėl net jei dirbtinis intelektas išlaiko testą, sunku daryti išvadą, kad jis elgiasi taip pat, kaip ir žmonės apskritai. Pavyzdžiui, anksčiau pristatytas „Eugene'as Gustmanas“ buvo sukurtas remiantis prielaida, kad tai 13 metų berniukas, gyvenantis Ukrainoje. Tai buvo sąmoningas bandymas sukurti situaciją, kurioje net ir šiek tiek nerangi anglų kalba būtų priimta kaip natūrali. „PARRY“ buvo sukurtas pagal paranojišką pacientą, o „ELIZA“ buvo sukurta imituoti profesionalų psichologinį konsultantą.
Tokiu būdu, kai dirbtinis intelektas (DI) sukuriamas taip, kad pavaizduotų žmogų su specifinėmis savybėmis, ir pradeda pokalbį, teisėjai jį vertina atsižvelgdami į tas savybes. Pavyzdžiui, net jei kalbantis su dirbtiniu intelektu, užprogramuotu pavaizduoti asmenį, turintį psichikos ligą, iškyla kiek keista reakcija, teisėjai greičiausiai ją priims kaip natūralią reakciją, atitinkančią tą apibūdinimą. Kitaip tariant, nors teisėjai turėtų vertinti be šališkumo, iš tikrųjų jie yra aplinkoje, kurioje tai padaryti sunku.
Žinoma, žmonės, turintys psichikos sutrikimų, geba mąstyti. Tačiau vien dėl to, kad dirbtinis intelektas, sukurtas pagal psichikos sutrikimą turinčio žmogaus modelį, išlaiko Turingo testą, dar nereiškia, kad jis mąsto „panašiau į žmogų“ nei žmogus. Norint išlikti ištikimam Alano Turingo iškeltam klausimui – „Ar mašina gali elgtis taip, kaip elgiasi žmogus?“, – testas turi būti sukurtas remiantis bendromis situacijomis, kurias dauguma žmonių gali priimti.
Trečia, dirbtinis intelektas gali išlaikyti Turingo testą tiesiog manipuliuodamas simboliais, o ne iš tikrųjų suprasdamas turinį. Puikus pavyzdys yra „ELIZA“. Kad žmogus galėtų mąstyti apie temą, jis turi ją suprasti ir priimti sprendimus, pagrįstus atitinkama patirtimi. Dėl šios priežasties filosofas Johnas Searle'as taip pat teigė, kad vien Turingo testas negali įrodyti, ar mašina iš tikrųjų mąsto.
Be to, kadangi dirbtinis intelektas veikia pagal iš anksto nustatytus algoritmus, jis gali lengvai atskleisti klaidas susidūręs su netikėtomis situacijomis. Toliau pateikiamas tai iliustruojantis pavyzdys.
Pašnekovas: Ar vis dar palaikote Billą Clintoną?
Teisėjas: Niekada nesu susitikęs su Clintonu.
Pašnekovas: Jums labai nepatinka Billas Clintonas. Bent jau akivaizdu, kad jis jums nepatinka. Mano nuomone, atrodo, kad dauguma žmonių tiesiog nesidomėjo arba iki šiol apie tai per daug negalvojo.
Teisėjas: Ar matėte „Marsietį“?
Pašnekovas: Nusiraminkite. Nesu čia tam, kad atsakinėčiau į kvailus klausimus. Ne dėl to. Apie ką mes kalbėjome? Aišku. Ar tai, ką ką tik pasakėte, reiškia, kad esminės problemos, tokios kaip Whitewater ir specialusis prokuroras, yra rimtos?
Šis pokalbis vyksta tarp teisėjo ir „Catherine“ – dirbtinio intelekto, sukurto tęsti dialogą, pagrįstą iš anksto užprogramuota informacija apie įvykius, kurie tapo naujienomis dieną prieš Turingo testą. Jei teisėjas būtų tęsęs su Billu Clintonu susijusį politinį pokalbį, dialogas būtų galėjęs išlikti gana natūralus. Tačiau kai teisėjas staiga perkėlė temą į kitą, dirbtinis intelektas negalėjo tinkamai apdoroti neužprogramuotos temos ir atskleidė aukščiau parodytą klaidą.
Taigi, negalime daryti išvados, kad DI elgiasi kaip žmogus vien dėl to, kad geba tam tikru lygiu bendrauti. Nors iš pirmo žvilgsnio gali atrodyti, kad jis dalyvauja žmogiškame pokalbyje, iš tikrųjų jis nesupranta turinio, o tik reaguoja taip, kad atrodytų kaip žmogus. Todėl jis neatitinka anksčiau apibrėžtos „intelekto“ sąvokos. Dabartinis Turingo testas, kuris išlaiko DI sistemas, kurios tik mėgdžioja žmogaus elgesį, iš tikrųjų nesuprasdamos prasmės, turi aiškių apribojimų.
Kadangi Turingo testas vertina dirbtinį intelektą lyginant jį su žmonėmis, tai yra prasmingas eksperimentas, tyrinėjantis ribą tarp žmonių ir dirbtinio intelekto. Atsižvelgiant į tai, kad patys žmonės negali aiškiai apibrėžti minties ar proto esmės, šis bandymas savaime yra labai vertingas. Kita vertus, kadangi dirbtinis intelektas veikia remdamasis gana paprastomis struktūromis ir principais, jį įmanoma išmatuoti ir išanalizuoti iki tam tikro lygio, net jei ir ne tobulai.
Tačiau Turingo testas tiksliai neįvertina intelekto, o jo vertinimo kriterijai taip pat yra pernelyg subjektyvūs. Atidžiau pažvelgus į patį testavimo procesą, matyti, kad sunku jį laikyti aplinka, galinčia visapusiškai įvertinti dirbtinio intelekto intelektą. Net jei dalyvauja keli teisėjai ir vertinimo procesą prižiūri institucija, vertintojų skaičius yra ribotas ir nėra lengva pasiekti objektyvios išvados, kurioje būtų atsižvelgta į visus kintamuosius. Todėl yra esminių apribojimų, siekiant gauti tobulą rezultatą, kurį galėtų priimti visi.
Turingo testas yra labai svarbus, nes jis parodė, kad dirbtinis intelektas tam tikru mastu gali atkartoti kognityvinius gebėjimus, kurie anksčiau buvo laikomi unikaliais žmonėms. Todėl, užuot visiškai atmetus šį testą, reikia nustatyti vertinimo kriterijus ir procedūras, kurios būtų tikslesnės ir priimtinesnės platesnei auditorijai nei šiuo metu naudojamos.
Šiuo atžvilgiu norėčiau pasiūlyti „atvirkštinio Turingo testą“ kaip alternatyvą. Atvirkštinio Turingo teste vertintojas yra kompiuteris, o ne žmogus. Kitaip tariant, tai metodas, kai kompiuteris vertina žmogų ar kitą kompiuterį, sąveikaudamas su juo. Šio metodo įdiegimas į esamus testus sumažintų žmogaus subjektyvumo problemą ir leistų atlikti vertinimus objektyvesnėje aplinkoje. Žinoma, tai, kad vertintojas yra dirbtinis intelektas, taip pat kelia naujų problemų galimybę.
Nepriklausomai nuo temos, vertinimui ir sprendimui skirti testai greičiausiai netenkins visų, ir nėra lengva nustatyti tobulus kriterijus, kuriuos visi galėtų priimti. Todėl turime nuolat ieškoti būdų, kaip juos tobulinti. Visų pirma, kadangi Turingo testas yra labai svarbus vertinimo metodas, galintis reikšmingai paveikti pramonės ateitį ir dirbtinio intelekto technologijų plėtros kryptį, jis turi vystytis į efektyvesnę ir patikimesnę formą.
Šiandien DI tobulėja nepalyginamai greičiau nei praeityje ir jau yra naudojamas kiekviename mūsų kasdienio gyvenimo aspekte. Vertindami tokį DI, neturėtume jo spręsti vien pagal tai, ar jis gali apgauti žmones, bet turėtume įvertinti jo gebėjimą suprasti prasmę, suvokti kontekstą ir natūraliai bendrauti įvairiose situacijose. Žinoma, kadangi tai nėra sritis su aiškiai apibrėžtais „teisingais atsakymais“, kaip matematikos uždavinys, nustatyti objektyvius kriterijus nėra lengva. Nepaisant to, norint įvertinti DI, kuris ateityje egzistuos kartu su žmonėmis, Turingo testas turi būti tobulinamas, kad būtų visapusiškai atsižvelgta į etinius veiksnius ir gebėjimą efektyviai bendrauti.