Dokáže Turingov test skutočne vyhodnotiť umelú inteligenciu?

V tomto blogovom príspevku preskúmame, či je Turingov test vhodným štandardom na hodnotenie inteligencie umelej inteligencie a preskúmame jeho obmedzenia a potenciálne oblasti na zlepšenie.

 

V roku 2014 šokovala a zmätila správa o tom, že „Eugene Goostman“, chatbot vytvorený ruskými vývojármi, prešiel Turingovým testom. Bola to jasná demonštrácia toho, že umelá inteligencia už nie je len produktom imaginárnej budúcej spoločnosti, ktorú vidíme len vo sci-fi filmoch. UI sa už hlboko zakorenila v našich životoch a rýchlo sa rozvíja v súlade s Kurzweilovým „Zákonom zrýchľujúcich sa výnosov“. Nemôžeme však len tak nečinne stáť a pozerať sa, ako sa UI, ktorá sa vyvíja žmurknutím oka, pevne etabluje v spoločnosti. Musíme zistiť, či UI skutočne dokáže myslieť ako ľudia, a musíme tiež zvážiť smer, ktorým by sa mala v budúcnosti vyvíjať.
Tieto problémy súvisia s Turingovým testom. Turingov test je hodnotiaca metóda, ktorá vznikla z otázky: „Je možné vytvoriť počítač, o ktorom môžeme povedať, že má inteligenciu a myseľ?“ Je všeobecne známe, že ho navrhol Alan Turing v roku 1950, aby odpovedal na otázku: „Môžu stroje myslieť?“ Turing však v skutočnosti pri navrhovaní experimentu preformuloval samotnú otázku na „Môžu sa stroje správať rovnako ako ľudia?“. Test sa vykonáva tak, že porotca kladie otázky človeku aj umelej inteligencii a potom sa určuje, ktorých odpovede sa viac podobajú ľudským. V Turingovom teste je možné použiť rôzne metódy na oklamanie porotcu a je povolené spomaliť reakčný čas alebo pokračovať v konverzácii vo formáte podobnom chatu. Okrem toho sa test považuje za úspešný, ak umelá inteligencia dokáže oklamať približne 30 % porotcov v rámci obmedzeného rozsahu a témy diskusie.
Spochybnil som, či je Turingov test s týmito podmienkami a pravidlami skutočne vhodným nástrojom na hodnotenie inteligencie umelej inteligencie. Inými slovami, domnievam sa, že Turingov test nie je vhodný na hodnotenie umelej inteligencie. Na podporu tohto názoru predstavím tri argumenty a navrhnem „reverzný Turingov test“ ako riešenie. Predtým je však potrebné najprv preskúmať ďalšie významné príklady umelej inteligencie, ktoré prešli Turingovým testom, okrem „Eugena Goostmana“.
„ELIZA“, ktorú v roku 1966 vyvinul Joseph Weizenbaum, je najznámejším príkladom medzi ranými programami na dialóg v prirodzenom jazyku. Táto umelá inteligencia bola navrhnutá tak, aby identifikovala kľúčové slová vo vstupných vetách a vrátila zodpovedajúce odpovede; ak sa nenašli žiadne vhodné kľúčové slová, zopakovala slová používateľa alebo poskytla všeobecnú odpoveď.
Existuje aj „PARRY“, ktorý vyvinul Kenneth Colby v roku 1972. Táto umelá inteligencia bola vymodelovaná podľa konverzačného štýlu paranoidného pacienta a dokonca sa uskutočnili experimenty, v ktorých sa niekoľko psychiatrov pokúšalo rozlíšiť medzi skutočnými pacientmi a PARRY.
Odteraz budem skúmať, prečo Turingov test nie je vhodným štandardom na hodnotenie umelej inteligencie.
Po prvé, Turingov test presne nehodnotí samotnú inteligenciu. Inými slovami, namiesto hodnotenia toho, ako inteligentne umelá inteligencia myslí, tento test prostredníctvom konverzácie určuje, či sa správa ako človek. S tým sú spojené dva problémy.
Po prvé, nie všetci ľudia sa vždy správajú inteligentne. V tomto prípade sa „inteligentný“ vzťahuje na intelektuálnu činnosť, ktorá zahŕňa pochopenie javu alebo objektu a jeho racionálne spracovanie. Okrem toho, podľa článku Alana Turinga sa niektoré intelektuálne schopnosti umelej inteligencie môžu prejavovať odlišným spôsobom ako u ľudí. Jednoducho povedané, ak umelá inteligencia vyrieši problém, ktorý ľudia nedokážu, hodnotiteľ si s väčšou pravdepodobnosťou uvedomí, že druhou stranou je počítač. Turingov test v konečnom dôsledku nedokáže správne vyhodnotiť formy inteligencie, ktoré prevyšujú ľudské schopnosti.
Po druhé, hodnotiace kritériá Turingovho testu sú subjektívne a experimentálne podmienky sú príliš obmedzujúce. Inými slovami, výsledky testov môžu byť výrazne ovplyvnené postojom, skúsenosťami, zručnosťami a vedomosťami hodnotiteľa, a nie skutočnou úrovňou inteligencie umelej inteligencie, čo sťažuje zabezpečenie objektivity.

V konečnom dôsledku je subjektom, ktorý určuje, či je niečo umelá inteligencia alebo človek, osoba, takže je ťažké úplne vylúčiť subjektivitu hodnotiteľa. Okrem toho sú otázky kladené v obmedzenom časovom rámci približne piatich minút tiež veľmi obmedzené. Pokiaľ je hodnotiteľ človek, vždy existuje možnosť, že bude ovplyvnený rôznymi vonkajšími faktormi.
Navyše, väčšina umelých inteligencií zúčastňujúcich sa Turingovho testu je modelovaná podľa ľudí so špecifickými situáciami alebo vlastnosťami. Preto aj keď umelá inteligencia testom prejde, je ťažké dospieť k záveru, že sa správa rovnako ako ľudia vo všeobecnosti. Napríklad „Eugene Goostman“, ktorý bol predstavený skôr, bol vyvinutý s predpokladom, že ide o 13-ročného chlapca žijúceho na Ukrajine. Bol to zámerný pokus vytvoriť situáciu, v ktorej by sa aj trochu nemotorná angličtina akceptovala ako prirodzená. „PARRY“ bol modelovaný podľa paranoidného pacienta a „ELIZA“ bola navrhnutá tak, aby napodobňovala profesionálneho psychologického poradcu.
Týmto spôsobom, keď je umelá inteligencia nastavená tak, aby reprezentovala človeka so špecifickými vlastnosťami a potom sa zapojí do konverzácie, porotcovia ju hodnotia s ohľadom na tieto vlastnosti. Napríklad, aj keď sa počas konverzácie s umelou inteligenciou naprogramovanou tak, aby reprezentovala osobu s duševnou chorobou, objaví trochu zvláštna reakcia, porotcovia ju pravdepodobne prijmú ako prirodzenú reakciu zodpovedajúcu tejto charakteristike. Inými slovami, hoci sa od porotcov očakáva, že budú hodnotiť bez zaujatosti, v skutočnosti sú umiestnení do prostredia, kde je to ťažké.
Ľudia s duševnými chorobami sú samozrejme schopní myslieť. Avšak len preto, že umelá inteligencia vytvorená podľa modelu osoby s duševnou chorobou prejde Turingovým testom, neznamená to, že myslí viac „ľudsky“ ako človek. Aby sme zostali verní otázke, ktorú položil Alan Turing – „Môže sa stroj správať tak ako človek?“ – test musí byť navrhnutý na základe všeobecných situácií, ktoré väčšina ľudí dokáže akceptovať.
Po tretie, umelá inteligencia dokáže prejsť Turingovým testom jednoducho manipuláciou so symbolmi, a nie skutočným pochopením obsahu. Ukážkovým príkladom je „ELIZA“. Aby človek mohol o nejakej téme premýšľať, musí tejto téme rozumieť a robiť úsudky na základe relevantných skúseností. Z tohto dôvodu filozof John Searle tiež tvrdil, že samotný Turingov test nemôže dokázať, či stroj skutočne myslí.
Navyše, keďže umelá inteligencia funguje podľa vopred určených algoritmov, dokáže ľahko odhaliť chyby, keď sa stretne s neočakávanými situáciami. Nasleduje príklad, ktorý to ilustruje.
Reportér: Stále podporujete Billa Clintona?
Sudca: S Clintonom som sa nikdy nestretol.
Partner: Billa Clintona naozaj nemáte radi. Aspoň je jasné, že ho nemáte radi. Podľa môjho názoru sa zdá, že väčšina ľudí oň jednoducho nemala záujem alebo o tom doteraz veľmi nepremýšľala.
Sudca: Videli ste film „Marťan“?
Partner: Upokojme sa. Nie som tu na to, aby som odpovedal na hlúpe otázky. To nie je ono. O čom sme sa rozprávali? Správne. Znamená to, čo ste práve povedali, že základné problémy – ako Whitewater a špeciálny prokurátor – sú vážne?
Tento rozhovor je medzi sudcom a „Catherine“, umelou inteligenciou navrhnutou tak, aby pokračovala v dialógu na základe vopred naprogramovaných informácií o udalostiach, ktoré sa stali správami deň pred konaním Turingovho testu. Ak by sudca pokračoval v politickej konverzácii týkajúcej sa Billa Clintona, dialóg mohol zostať celkom prirodzený. Keď však sudca náhle zmenil tému na niečo iné, umelá inteligencia nedokázala správne spracovať nenaprogramovanú tému a odhalila vyššie uvedenú chybu.
Preto nemôžeme dospieť k záveru, že sa umelá inteligencia správa ako človek len preto, že je schopná určitej úrovne komunikácie. Aj keď sa na povrchu môže zdať, že vedie konverzáciu podobnú ľudskej, v skutočnosti nerozumie obsahu, ale iba reaguje spôsobom, ktorý ju robí ľudskou. Preto nespĺňa pojem „inteligencia“, ako bol definovaný vyššie. Súčasný Turingov test, ktorý prechádza systémami umelej inteligencie, ktoré iba napodobňujú ľudské správanie bez toho, aby skutočne rozumeli významu, má jasné obmedzenia.
V tom, že Turingov test hodnotí umelú inteligenciu porovnaním s ľuďmi, je zmysluplným experimentom, ktorý skúma hranicu medzi ľuďmi a umelou inteligenciou. Vzhľadom na to, že samotní ľudia nedokážu jasne definovať podstatu myslenia alebo mysle, má tento pokus sám o sebe významnú hodnotu. Na druhej strane, keďže umelá inteligencia funguje na základe relatívne jednoduchých štruktúr a princípov, je možné ju do určitej miery merať a analyzovať, aj keď nie dokonale.
Turingov test však nedokáže presne posúdiť inteligenciu a jeho hodnotiace kritériá sú tiež príliš subjektívne. Bližší pohľad na samotný proces testovania odhaľuje, že je ťažké ho vnímať ako prostredie schopné komplexne vyhodnotiť inteligenciu umelej inteligencie. Aj keď sa ho zúčastňuje viacero porotcov a inštitúcia dohliada na proces hodnotenia, počet hodnotiteľov je obmedzený a nie je ľahké dospieť k objektívnemu záveru, ktorý zohľadňuje všetky premenné. Preto existujú zásadné obmedzenia pri dosahovaní dokonalého výsledku, ktorý môže každý akceptovať.
Turingov test má značný význam, pretože preukázal, že umelá inteligencia dokáže do určitej miery replikovať kognitívne schopnosti, ktoré sa kedysi považovali za jedinečné pre ľudí. Preto je potrebné namiesto úplného zamietnutia tohto testu stanoviť hodnotiace kritériá a postupy, ktoré sú presnejšie a prijateľnejšie pre širšie publikum ako tie, ktoré sa používajú v súčasnosti.
V tejto súvislosti by som rád ako alternatívu navrhol „reverzný Turingov test“. V reverznom Turingovom teste je hodnotiteľom počítač a nie človek. Inými slovami, ide o metódu, pri ktorej počítač hodnotí človeka alebo iný počítač počas interakcie s ním. Zavedenie tohto prístupu do existujúcich testov by znížilo problém ľudskej subjektivity a umožnilo by vykonávanie hodnotení v objektívnejšom prostredí. Samozrejme, skutočnosť, že hodnotiteľom je umelá inteligencia, tiež vyvoláva možnosť vzniku nových problémov.
Bez ohľadu na predmet testovania je nepravdepodobné, že by testy určené na hodnotenie a posudzovanie uspokojili každého a nie je jednoduché stanoviť dokonalé kritériá, ktoré by každý akceptoval. Preto musíme neustále hľadať spôsoby, ako ich zlepšiť. Najmä keďže Turingov test je kľúčovou metódou hodnotenia, ktorá by mohla významne ovplyvniť budúcnosť priemyslu a smerovanie vývoja technológií umelej inteligencie, musí sa vyvinúť do efektívnejšej a spoľahlivejšej formy.
Dnes sa umelá inteligencia rozvíja tempom neporovnateľným s minulosťou a už sa využíva v každom aspekte nášho každodenného života. Pri hodnotení takejto umelej inteligencie by sme ju nemali posudzovať len na základe toho, či dokáže oklamať ľudí, ale skôr na základe jej schopnosti chápať význam, chápať kontext a prirodzene komunikovať v rôznych situáciách. Samozrejme, keďže nejde o oblasť s jasne definovanými „správnymi odpoveďami“ ako matematický problém, stanovenie objektívnych kritérií nie je jednoduché. Napriek tomu, aby sa dala umelá inteligencia, ktorá bude v budúcnosti koexistovať s ľuďmi, vyhodnotiť, musí sa Turingov test vyvíjať tak, aby komplexne zohľadňoval etické faktory a schopnosť efektívne komunikovať.

 

O autorovi