V tomto blogovém příspěvku se podíváme na to, zda je Turingův test vhodným standardem pro hodnocení inteligence umělé inteligence, a prozkoumáme jeho omezení a potenciální oblasti pro zlepšení.
V roce 2014 šokovala a zmatila mnoho lidí zpráva o tom, že „Eugene Goostman“, chatbot vytvořený ruskými vývojáři, prošel Turingovým testem. Byla to jasná demonstrace toho, že umělá inteligence již není jen produktem imaginární budoucí společnosti, kterou lze vidět pouze ve sci-fi filmech. Umělá inteligence se již hluboce zakořenila v našich životech a v souladu s Kurzweilovým „Zákonem zrychlujících se výnosů“ se rychle rozvíjí. Nemůžeme však jen tak nečinně přihlížet, jak se umělá inteligence, která se vyvíjí mrknutím oka, pevně etabluje ve společnosti. Musíme zjistit, zda umělá inteligence skutečně dokáže myslet jako lidé, a musíme také zvážit směr, kterým by se měla v budoucnu vyvíjet.
Tyto problémy souvisí s Turingovým testem. Turingův test je hodnotící metoda, která vznikla z otázky: „Je možné vytvořit počítač, o kterém můžeme říci, že má inteligenci a mysl?“ Je všeobecně známo, že jej navrhl Alan Turing v roce 1950, aby odpověděl na otázku: „Mohou stroje myslet?“ Turing však při navrhování experimentu otázku přeformuloval jako „Mohou se stroje chovat stejným způsobem jako lidé?“. Test se provádí tak, že soudce klade otázky člověku i umělé inteligenci a poté se určuje, čí odpovědi se více podobají lidským. V Turingově testu lze k oklamání soudce použít různé metody a je přípustné zpomalit dobu odezvy nebo pokračovat v konverzaci ve formátu podobném chatu. Test se dále považuje za úspěšný, pokud umělá inteligence dokáže oklamat přibližně 30 % soudců v rámci omezeného rozsahu a tématu diskuse.
Zpochybnil jsem, zda je Turingův test s těmito podmínkami a pravidly skutečně vhodným měřítkem pro posouzení inteligence umělé inteligence. Jinými slovy, domnívám se, že Turingův test není vhodný pro hodnocení umělé inteligence. Na podporu tohoto názoru představím tři argumenty a jako řešení navrhnu „reverzní Turingův test“. Než tak učiním, je však nutné nejprve prozkoumat další významné příklady umělé inteligence, které Turingovým testem prošly, kromě „Eugena Goostmana“.
„ELIZA“, vyvinutá Josephem Weizenbaumem v roce 1966, je nejznámějším příkladem mezi ranými programy pro dialog v přirozeném jazyce. Tato umělá inteligence byla navržena tak, aby identifikovala klíčová slova ve vstupních větách a vracela odpovídající odpovědi; pokud nebyla nalezena žádná vhodná klíčová slova, opakovala slova uživatele nebo poskytovala obecnou odpověď.
Existuje také „PARRY“, který vyvinul Kenneth Colby v roce 1972. Tato umělá inteligence byla modelována podle konverzačního stylu paranoidního pacienta a byly dokonce provedeny experimenty, v nichž se několik psychiatrů pokoušelo rozlišit mezi skutečnými pacienty a PARRY.
Odteď se budu zabývat tím, proč Turingův test není vhodným standardem pro hodnocení umělé inteligence.
Zaprvé, Turingův test sám o sobě přesně nehodnotí inteligenci. Jinými slovy, spíše než aby hodnotil, jak inteligentně umělá inteligence myslí, tento test prostřednictvím konverzace určuje, zda se chová jako člověk. S tím jsou dva problémy.
Zaprvé, ne všichni lidé se vždy chovají inteligentně. „Inteligentní“ se zde vztahuje na intelektuální činnost, která zahrnuje pochopení jevu nebo objektu a jeho racionální zpracování. Dále, podle článku Alana Turinga se některé intelektuální schopnosti umělé inteligence mohou projevovat odlišným způsobem než u lidí. Jednoduše řečeno, pokud umělá inteligence vyřeší problém, který lidé nedokážou, hodnotitel si s větší pravděpodobností uvědomí, že druhou stranou je počítač. Turingův test nakonec nedokáže správně vyhodnotit formy inteligence, které překračují lidské schopnosti.
Za druhé, hodnotící kritéria Turingova testu jsou subjektivní a experimentální podmínky jsou příliš restriktivní. Jinými slovy, výsledky testu mohou být významně ovlivněny postojem, zkušenostmi, dovednostmi a znalostmi hodnotitele spíše než skutečnou úrovní inteligence umělé inteligence, což ztěžuje zajištění objektivity.
V konečném důsledku je subjektem, který určuje, zda je něco umělá inteligence nebo člověk, člověk, takže je obtížné zcela vyloučit subjektivitu hodnotitele. Navíc otázky kladené v omezeném časovém rámci přibližně pěti minut jsou také velmi omezené. Pokud je hodnotitel člověk, vždy existuje možnost, že bude ovlivněn různými vnějšími faktory.
Většina umělých inteligencí účastnících se Turingova testu je navíc modelována podle lidí se specifickými situacemi nebo charakteristikami. Proto i když umělá inteligence testem projde, je obtížné dojít k závěru, že se chová stejně jako lidé obecně. Například „Eugene Goostman“, představený dříve, byl vyvinut s předpokladem, že se jedná o třináctiletého chlapce žijícího na Ukrajině. Jednalo se o záměrný pokus vytvořit situaci, kdy by i poněkud neohrabaná angličtina byla akceptována jako přirozená. „PARRY“ byl modelován podle paranoidního pacienta a „ELIZA“ byla navržena tak, aby napodobovala profesionálního psychologického poradce.
Tímto způsobem, když je umělá inteligence nastavena tak, aby reprezentovala člověka se specifickými vlastnostmi, a poté se zapojí do konverzace, porotci ji hodnotí s ohledem na tyto vlastnosti. Například i když se při konverzaci s umělou inteligencí naprogramovanou tak, aby reprezentovala osobu s duševním onemocněním, objeví poněkud zvláštní reakce, porotci ji pravděpodobně přijmou jako přirozenou reakci v souladu s touto charakteristikou. Jinými slovy, ačkoli se od porotců očekává, že budou hodnotit bez zaujatosti, ve skutečnosti jsou umístěni do prostředí, kde je to obtížné.
Lidé s duševním onemocněním jsou samozřejmě schopni myslet. Nicméně jen proto, že umělá inteligence vytvořená podle modelu člověka s duševním onemocněním projde Turingovým testem, neznamená to, že myslí více „lidsky“ než člověk. Abychom zůstali věrni otázce, kterou položil Alan Turing – „Může se stroj chovat tak, jako se chová člověk?“ – musí být test navržen na základě obecných situací, které většina lidí dokáže akceptovat.
Za třetí, umělá inteligence může projít Turingovým testem pouhou manipulací se symboly, spíše než skutečným pochopením obsahu. Ukázkovým příkladem je „ELIZA“. Aby člověk mohl o nějakém tématu přemýšlet, musí tomuto tématu rozumět a činit úsudky na základě relevantních zkušeností. Z tohoto důvodu filozof John Searle také tvrdil, že Turingův test sám o sobě nemůže dokázat, zda stroj skutečně myslí.
Navíc, protože umělá inteligence funguje podle předem určených algoritmů, dokáže snadno odhalit chyby, když se setká s neočekávanými situacemi. Následuje příklad, který to ilustruje.
Partner: Stále podporujete Billa Clintona?
Soudce: S Clintonem jsem se nikdy nesetkal.
Partner: Opravdu nemáte rádi Billa Clintona. Alespoň je jasné, že ho nemáte rádi. Podle mého názoru se zdá, že většina lidí o něj prostě neměla zájem nebo o tom dosud moc nepřemýšlela.
Soudce: Viděl jsi film 'Marťan'?
Partner: Klidně. Nejsem tu od toho, abych odpovídal na hloupé otázky. To není ono. O čem jsme se bavili? Správně. Znamená to, co jste právě řekl, že ty základní problémy – jako Whitewater a zvláštní vyšetřovatel – jsou vážné?
Tento rozhovor je mezi soudcem a „Catherine“, umělou inteligencí navrženou k pokračování dialogu na základě předem naprogramovaných informací o událostech, které se staly zprávami den před konáním Turingova testu. Pokud by soudce pokračoval v politické konverzaci týkající se Billa Clintona, dialog mohl zůstat zcela přirozený. Když však soudce náhle změnil téma na něco jiného, umělá inteligence nebyla schopna s nenaprogramovaným tématem správně zacházet a odhalila výše uvedenou chybu.
Nemůžeme tedy dojít k závěru, že se umělá inteligence chová jako člověk jen proto, že je schopna určité úrovně komunikace. I když se na povrchu může zdát, že vede konverzaci podobnou lidské, ve skutečnosti nerozumí obsahu, ale pouze reaguje způsobem, který ji činí lidskou. Proto nesplňuje koncept „inteligence“, jak byl definován dříve. Současný Turingův test, který prochází systémy umělé inteligence, jež pouze napodobují lidské chování, aniž by skutečně chápaly jeho význam, má jasná omezení.
V tom, že Turingův test hodnotí umělou inteligenci porovnáním s lidmi, je smysluplným experimentem, který zkoumá hranici mezi lidmi a umělou inteligencí. Vzhledem k tomu, že lidé sami nedokážou jasně definovat podstatu myšlení nebo mysli, má tento pokus sám o sobě značnou hodnotu. Na druhou stranu, protože umělá inteligence funguje na základě relativně jednoduchých struktur a principů, je možné ji do určité míry měřit a analyzovat, i když ne dokonale.
Turingův test však nedokáže přesně posoudit inteligenci a jeho hodnotící kritéria jsou také příliš subjektivní. Bližší pohled na skutečný proces testování ukazuje, že je obtížné jej vnímat jako prostředí schopné komplexně vyhodnotit inteligenci umělé inteligence. I když se testu účastní více porotců a proces hodnocení dohlíží určitá instituce, počet hodnotitelů je omezený a není snadné dospět k objektivnímu závěru, který zohledňuje všechny proměnné. Proto existují zásadní omezení pro dosažení dokonalého výsledku, který by mohl přijmout každý.
Turingův test má značný význam, protože prokázal, že umělá inteligence dokáže do určité míry replikovat kognitivní schopnosti, které byly dříve považovány za jedinečné pro člověka. Proto je namísto úplného odmítnutí tohoto testu nutné stanovit hodnotící kritéria a postupy, které budou přesnější a přijatelnější pro širší publikum než ty, které se používají v současnosti.
V tomto ohledu bych rád jako alternativu navrhl „reverzní Turingův test“. V reverzním Turingově testu je hodnotitelem počítač, nikoli člověk. Jinými slovy, jedná se o metodu, při které počítač hodnotí člověka nebo jiný počítač během interakce s ním. Zavedení tohoto přístupu do stávajících testů by snížilo problém lidské subjektivity a umožnilo by provádět hodnocení v objektivnějším prostředí. Skutečnost, že hodnotitelem je umělá inteligence, samozřejmě také zvyšuje možnost vzniku nových problémů.
Bez ohledu na téma testy určené k hodnocení a posuzování pravděpodobně neuspokojí každého a není snadné stanovit dokonalá kritéria, která by každý přijal. Proto musíme neustále hledat způsoby, jak je zlepšovat. Zejména proto, že Turingův test je klíčovou hodnotící metodou, která by mohla významně ovlivnit budoucnost průmyslu a směr vývoje technologií umělé inteligence, musí se vyvinout do efektivnější a spolehlivější formy.
Dnes se umělá inteligence vyvíjí tempem nesrovnatelným s minulostí a již se využívá v každém aspektu našeho každodenního života. Při hodnocení takové umělé inteligence bychom ji neměli posuzovat pouze na základě toho, zda dokáže lidi oklamat, ale spíše na základě její schopnosti chápat význam, chápat kontext a přirozeně komunikovat v různých situacích. Samozřejmě, protože se nejedná o oblast s jasně definovanými „správnými odpověďmi“ jako matematický problém, stanovení objektivních kritérií není snadné. Nicméně pro hodnocení umělé inteligence, která bude v budoucnu koexistovat s lidmi, se musí Turingův test vyvíjet tak, aby komplexně zohledňoval etické faktory a schopnost efektivně komunikovat.