Valóban értékelheti a Turing-teszt a mesterséges intelligenciát?

Ebben a blogbejegyzésben megvizsgáljuk, hogy a Turing-teszt alkalmas-e a mesterséges intelligencia intelligenciájának értékelésére, valamint feltárjuk a korlátait és a fejlesztési lehetőségeket.

 

2014-ben sokkoló és zavart keltő hír volt, hogy az orosz fejlesztők által létrehozott „Eugene Goostman” chatbot átment a Turing-teszten. Ez egyértelműen bizonyította, hogy a mesterséges intelligencia már nem csupán egy képzeletbeli jövőbeli társadalom terméke, amelyet csak a sci-fi filmekben láthatunk. A mesterséges intelligencia már mélyen beágyazódott az életünkbe, és rohamos ütemben fejlődik, összhangban Ray Kurzweil „A gyorsuló visszatérés törvényével”. Azonban nem nézhetjük tétlenül, ahogy a szempillantás alatt fejlődő mesterséges intelligencia szilárdan megtelepedik a társadalomban. Meg kell határoznunk, hogy a mesterséges intelligencia valóban képes-e úgy gondolkodni, mint az emberek, és azt is meg kell fontolnunk, hogy milyen irányba kellene fejlődnie a jövőben.
Ezek a kérdések a Turing-teszthez kapcsolódnak. A Turing-teszt egy értékelési módszer, amely a következő kérdésből ered: „Lehetséges-e olyan számítógépet létrehozni, amelyről elmondhatjuk, hogy intelligenciával és elmével rendelkezik?” Köztudott, hogy Alan Turing 1950-ben javasolta a „Tudnak-e a gépek gondolkodni?” kérdés megválaszolására. Turing azonban a kísérlet tervezésekor a kérdést átfogalmazta: „Tudnak-e a gépek ugyanúgy viselkedni, mint az emberek?”. A tesztet úgy végzik, hogy egy bíró kérdéseket tesz fel egy embernek és egy mesterséges intelligenciának is, majd megállapítják, hogy kinek a válaszai hasonlítanak inkább az emberire. A Turing-tesztben különféle módszerek alkalmazhatók a bíró megtévesztésére, és megengedett a válaszidő lelassítása vagy a beszélgetés csevegésszerű formátumban történő folytatása. Továbbá a tesztet sikeresnek tekintik, ha a mesterséges intelligencia a bírák körülbelül 30%-át meg tudja téveszteni a beszélgetés korlátozott terjedelmén és témáján belül.
Megkérdőjeleztem, hogy egy ilyen feltételekkel és szabályokkal végzett Turing-teszt valóban megfelelő mérőszám-e a mesterséges intelligencia intelligenciájának értékelésére. Más szóval, úgy vélem, hogy a Turing-teszt nem alkalmas a mesterséges intelligencia értékelésére. E nézet alátámasztására három érvet fogok bemutatni, és megoldásként a „fordított Turing-tesztet” javaslom. Mielőtt azonban ezt megtenném, először meg kell vizsgálnunk a Turing-teszten átmenő más figyelemre méltó mesterséges intelligencia példákat „Eugene Goostman” mellett.
A Joseph Weizenbaum által 1966-ban kifejlesztett „ELIZA” a korai természetes nyelvi párbeszédprogramok legismertebb példája. Ezt a mesterséges intelligenciát úgy tervezték, hogy azonosítsa a kulcsszavakat a bemeneti mondatokban, és a megfelelő válaszokat adja vissza; ha nem talált megfelelő kulcsszavakat, megismételte a felhasználó szavait, vagy általános választ adott.
Létezik a „PARRY” is, amelyet Kenneth Colby fejlesztett ki 1972-ben. Ezt a mesterséges intelligenciát egy paranoid beteg beszélgetési stílusa alapján modellezték, sőt olyan kísérleteket is végeztek, amelyekben több pszichiáter megpróbált különbséget tenni a valódi betegek és a PARRY között.
Innentől kezdve azt vizsgálom meg, hogy miért nem alkalmas standard a Turing-teszt a mesterséges intelligencia értékelésére.
Először is, a Turing-teszt nem méri fel pontosan magát az intelligenciát. Más szóval, ahelyett, hogy azt mérné, mennyire intelligensen gondolkodik egy mesterséges intelligencia, ez a teszt beszélgetésen keresztül azt vizsgálja, hogy úgy viselkedik-e, mint egy ember. Ezzel két probléma van.
Először is, nem minden ember viselkedik intelligensen. Itt az „intelligens” olyan intellektuális tevékenységre utal, amely magában foglalja egy jelenség vagy tárgy megértését és racionális feldolgozását. Továbbá Alan Turing tanulmánya szerint a mesterséges intelligencia egyes intellektuális képességei az emberekétől eltérő módon nyilvánulhatnak meg. Egyszerűen fogalmazva, ha egy mesterséges intelligencia megold egy olyan problémát, amelyet az emberek nem tudnak, az értékelő valójában nagyobb valószínűséggel rájön, hogy a másik fél egy számítógép. Végső soron a Turing-teszt nem értékeli megfelelően az emberi képességeket meghaladó intelligenciaformákat.
Másodszor, a Turing-teszt értékelési kritériumai szubjektívek, a kísérleti feltételek pedig túlságosan korlátozóak. Más szóval, a teszteredményeket jelentősen befolyásolhatja az értékelő hozzáállása, tapasztalata, készségei és tudása, nem pedig a mesterséges intelligencia tényleges intelligenciaszintje, ami megnehezíti az objektivitás biztosítását.

Végső soron az a személy, amely meghatározza, hogy valami mesterséges intelligencia vagy ember-e, egy személy, így nehéz teljesen kiküszöbölni az értékelő szubjektivitását. Továbbá a körülbelül öt perces korlátozott időkereten belül feltett kérdések is nagyon korlátozottak. Amíg az értékelő ember, mindig fennáll annak a lehetősége, hogy különféle külső tényezők befolyásolják.
Ezenkívül a Turing-tesztben részt vevő legtöbb mesterséges intelligencia (MI) meghatározott helyzetekben vagy jellemzőkkel rendelkező emberekről mintázódik. Ezért még ha egy MI át is megy a teszten, nehéz arra a következtetésre jutni, hogy ugyanúgy viselkedik, mint az emberek általában. Például a korábban bemutatott „Eugene Goostman”-t azzal a feltételezéssel fejlesztették ki, hogy egy 13 éves, Ukrajnában élő fiúról van szó. Ez egy szándékos kísérlet volt arra, hogy olyan helyzetet teremtsenek, ahol még a kissé esetlen angol nyelvet is természetesnek fogadják el. A „PARRY”-t egy paranoiás betegről mintázták, az „ELIZA”-t pedig egy profi pszichológiai tanácsadó utánzására tervezték.
Így, amikor egy mesterséges intelligenciát úgy állítanak be, hogy egy adott tulajdonságokkal rendelkező embert képviseljen, majd beszélgetésbe bocsátkozik vele, a bírák ezeket a tulajdonságokat szem előtt tartva értékelik. Például, még ha egy kissé furcsa válasz is merül fel egy mentális betegségben szenvedő személyt ábrázoló mesterséges intelligenciával folytatott beszélgetés során, a bírák valószínűleg természetes reakcióként fogadják el azt, amely összhangban van az adott jellemzéssel. Más szóval, bár a bíráknak elfogulatlanul kell értékelniük, valójában olyan környezetbe kerülnek, ahol ez nehéz.
Természetesen a mentális betegségben szenvedők is képesek gondolkodni. Azonban az, hogy egy mentális betegségben szenvedő személyről mintázott mesterséges intelligencia átmegy a Turing-teszten, nem jelenti azt, hogy „emberibb módon” gondolkodik, mint egy ember. Ahhoz, hogy hűek maradjunk Alan Turing által feltett kérdéshez – „Tud-e egy gép úgy viselkedni, mint egy ember?” –, a tesztet olyan általános helyzetek alapján kell megtervezni, amelyeket az emberek többsége el tud fogadni.
Harmadszor, a mesterséges intelligencia a Turing-tesztet egyszerűen szimbólumok manipulálásával is át tudja menni, ahelyett, hogy ténylegesen megértené a tartalmat. Erre kiváló példa az „ELIZA”. Ahhoz, hogy valaki egy témáról gondolkodjon, meg kell értenie azt a témát, és releváns tapasztalatai alapján kell ítéletet hoznia. Emiatt John Searle filozófus azt is állította, hogy a Turing-teszt önmagában nem tudja bizonyítani, hogy egy gép valóban gondolkodik-e.
Továbbá, mivel a mesterséges intelligencia előre meghatározott algoritmusok szerint működik, könnyen felfedheti a hibákat váratlan helyzetekben. A következő példa ezt illusztrálja.
Beszélgetőpartner: Még mindig támogatja Bill Clintont?
Bíró: Soha nem találkoztam Clintonnal.
Beszélgetőpartner: Tényleg nem kedveled Bill Clintont. Legalábbis az egyértelmű, hogy nem kedveled. Véleményem szerint úgy tűnik, hogy a legtöbb embert egyszerűen nem érdekelte, vagy eddig nem gondoltak rá eléggé.
Bíró: Láttad a „Marslakót”?
Beszélgetőpartner: Nyugodjunk meg. Nem azért vagyok itt, hogy buta kérdésekre válaszoljak. Nem erről van szó. Miről is beszéltünk? Rendben. Amit az előbb mondott, az azt jelenti, hogy az alapvető problémák – mint például Whitewater és a különleges ügyész – komolyak?
Ez a beszélgetés egy bíró és „Catherine” között zajlik, egy mesterséges intelligencia között, amelyet arra terveztek, hogy előre beprogramozott információk alapján folytasson párbeszédet olyan eseményekről, amelyek a Turing-teszt előtti napon váltak hírekké. Ha a bíró folytatta volna a Bill Clintonnal kapcsolatos politikai beszélgetést, a párbeszéd egészen természetes maradhatott volna. Amikor azonban a bíró hirtelen másra terelte a témát, a mesterséges intelligencia nem tudta megfelelően kezelni a beprogramozatlan témát, és felfedte a fent látható hibát.
Így nem következtethetjük ki, hogy egy MI úgy viselkedik, mint egy ember, pusztán azért, mert képes egy bizonyos szintű kommunikációra. Bár felszínesen úgy tűnhet, hogy emberszerű beszélgetést folytat, valójában nem érti a tartalmat, hanem csupán úgy reagál, hogy emberinek tűnjön. Ezért nem felel meg a korábban meghatározott „intelligencia” fogalmának. A jelenlegi Turing-teszt, amely átmegy azokon a MI-rendszereken, amelyek csupán utánozzák az emberi viselkedést anélkül, hogy ténylegesen megértenék a jelentését, egyértelmű korlátokkal rendelkezik.
Mivel a mesterséges intelligenciát az emberekhez képest értékeli, a Turing-teszt egy értelmes kísérlet, amely az ember és a mesterséges intelligencia közötti határvonalat tárja fel. Figyelembe véve, hogy az emberek maguk nem tudják egyértelműen meghatározni a gondolkodás vagy az elme lényegét, ez a kísérlet önmagában is jelentős értékkel bír. Másrészt, mivel a mesterséges intelligencia viszonylag egyszerű struktúrák és elvek alapján működik, bizonyos mértékig mérhető és elemezhető, még ha nem is tökéletesen.
A Turing-teszt azonban nem méri fel pontosan az intelligenciát, és az értékelési kritériumai is túlságosan szubjektívek. A tényleges tesztelési folyamat közelebbről megvizsgálva kiderül, hogy nehéz olyan környezetként tekinteni rá, amely képes átfogóan értékelni egy mesterséges intelligencia intelligenciáját. Még ha több bíró is vesz részt, és egy intézmény felügyeli az értékelési folyamatot, az értékelők száma korlátozott, és nem könnyű objektív következtetésre jutni, amely minden változót figyelembe vesz. Ezért alapvető korlátai vannak annak, hogy tökéletes, mindenki által elfogadható eredményt kapjunk.
A Turing-teszt jelentős jelentőséggel bír, mivel kimutatta, hogy a mesterséges intelligencia bizonyos mértékig képes reprodukálni azokat a kognitív képességeket, amelyeket egykor csak az emberre tartottak. Ezért a teszt teljes elvetése helyett olyan értékelési kritériumokat és eljárásokat kell létrehozni, amelyek pontosabbak és szélesebb közönség számára elfogadhatóak, mint a jelenleg használtak.
Ezzel kapcsolatban alternatívaként a „fordított Turing-tesztet” javasolnám. A fordított Turing-tesztben az értékelő egy számítógép, nem pedig egy ember. Más szóval, ez egy olyan módszer, amelyben egy számítógép egy embert vagy egy másik számítógépet értékel, miközben interakcióba lép vele. Ennek a megközelítésnek a bevezetése a meglévő tesztekbe csökkentené az emberi szubjektivitás problémáját, és lehetővé tenné az értékelések objektívebb környezetben történő elvégzését. Természetesen az a tény, hogy az értékelő egy mesterséges intelligencia, új problémák lehetőségét is felveti.
Témától függetlenül az értékelésre és megítélésre tervezett tesztek valószínűleg nem fognak mindenkit kielégíteni, és nem könnyű olyan tökéletes kritériumokat meghatározni, amelyeket mindenki elfogad. Ezért folyamatosan keresnünk kell a fejlesztésük módjait. Különösen, mivel a Turing-teszt egy kulcsfontosságú értékelési módszer, amely jelentősen befolyásolhatja az ipar jövőjét és a mesterséges intelligencia technológiai fejlődésének irányát, hatékonyabb és megbízhatóbb formává kell fejlődnie.
Napjainkban a mesterséges intelligencia a múltéhoz képest páratlan ütemben fejlődik, és máris a mindennapi életünk minden területén hasznosítják. Az ilyen mesterséges intelligencia értékelésekor nem szabad kizárólag az alapján ítélnünk, hogy képes-e megtéveszteni az embereket, hanem inkább azt kell vizsgálnunk, hogy képes-e megérteni a jelentést, megragadni a kontextust, és természetes módon kommunikálni a legkülönfélébb helyzetekben. Természetesen, mivel ez nem egy olyan terület, ahol egyértelműen meghatározott „helyes válaszok” vannak, mint egy matematikai feladatnál, az objektív kritériumok felállítása nem könnyű. Mindazonáltal ahhoz, hogy a jövőben az emberekkel együtt létező mesterséges intelligenciát értékelni lehessen, a Turing-tesztnek fejlődnie kell, hogy átfogóan figyelembe vegye az etikai tényezőket és a hatékony kommunikáció képességét.

 

A szerzőről