Voiko Turingin testi todella arvioida tekoälyä?

Tässä blogikirjoituksessa tarkastelemme, onko Turingin testi sopiva standardi tekoälyn älykkyyden arviointiin, ja tutkimme sen rajoituksia ja mahdollisia parannuskohteita.

 

Vuonna 2014 uutinen venäläisten kehittäjien luoman chatbotin ”Eugene Goostmanin” Turingin testin läpäisemisestä oli shokki ja hämmentävä kokemus monille ihmisille. Tämä oli selvä osoitus siitä, että tekoäly ei ole enää pelkkä kuvitteellisen tulevaisuuden yhteiskunnan tuote, jota nähdään vain tieteiselokuvissa. Tekoäly on jo juurtunut syvälle elämäämme ja kehittyy nopeasti Ray Kurzweilin ”kiihtyvän paluun lain” mukaisesti. Emme kuitenkaan voi vain katsoa sivusta, kuinka silmänräpäyksessä kehittyvä tekoäly vakiintuu yhteiskunnassa. Meidän on selvitettävä, pystyykö tekoäly todella ajattelemaan kuten ihmiset, ja meidän on myös pohdittava, mihin suuntaan sen tulisi kehittyä tulevaisuudessa.
Nämä kysymykset liittyvät Turingin testiin. Turingin testi on arviointimenetelmä, joka sai alkunsa kysymyksestä: "Onko mahdollista luoda tietokone, jolla voidaan sanoa olevan älykkyys ja mieli?". On yleisesti tiedossa, että Alan Turing ehdotti sitä vuonna 1950 vastaamaan kysymykseen "Voivatko koneet ajatella?". Turing kuitenkin muotoili kysymyksen uudelleen muotoon "Voivatko koneet käyttäytyä samalla tavalla kuin ihmiset?" suunnitellessaan koetta. Testi suoritetaan siten, että tuomari esittää kysymyksiä sekä ihmiselle että tekoälylle ja sitten määritetään, kumman vastaukset ovat ihmismäisempiä. Turingin testissä tuomaria voidaan hämätä eri menetelmillä, ja on sallittua hidastaa vastausaikoja tai jatkaa keskustelua chat-tyyppisessä muodossa. Lisäksi testi katsotaan läpäistyksi, jos tekoäly pystyy hämäämään noin 30 % tuomareista keskustelun rajoitetun laajuuden ja aiheen rajoissa.
Kyseenalaistin, onko Turingin testi näillä ehdoilla ja säännöillä todella sopiva mittari tekoälyn älykkyyden arvioimiseen. Toisin sanoen uskon, että Turingin testi ei sovellu tekoälyn arviointiin. Tämän näkemyksen tueksi esitän kolme argumenttia ja ehdotan ratkaisuksi "käänteistä Turingin testiä". Ennen kuin teen niin, on kuitenkin ensin tarkasteltava muita merkittäviä esimerkkejä tekoälystä, jotka ovat läpäisseet Turingin testin "Eugene Goostmanin" lisäksi.
Joseph Weizenbaumin vuonna 1966 kehittämä ”ELIZA” on tunnetuin esimerkki varhaisista luonnollisen kielen dialogiohjelmista. Tämä tekoäly suunniteltiin tunnistamaan avainsanat syötetyistä lauseista ja palauttamaan vastaavat vastaukset. Jos sopivia avainsanoja ei löytynyt, se toisti käyttäjän sanat tai antoi yleisen vastauksen.
On myös olemassa "PARRY", jonka Kenneth Colby kehitti vuonna 1972. Tämä tekoäly mallinnettiin vainoharhaisen potilaan keskustelutyylin mukaan, ja jopa tehtiin kokeita, joissa useat psykiatrit yrittivät erottaa oikeat potilaat ja PARRYn.
Jatkossa tarkastelen, miksi Turingin testi ei ole sopiva standardi tekoälyn arviointiin.
Ensinnäkin Turingin testi ei arvioi älykkyyttä itsessään tarkasti. Toisin sanoen, sen sijaan, että testi arvioisi tekoälyn ajattelukykyä, se määrittää keskustelun kautta, käyttäytyykö se ihmisen tavoin. Tässä on kaksi ongelmaa.
Ensinnäkin kaikki ihmiset eivät aina käyttäydy älykkäästi. Tässä "älykäs" viittaa älylliseen toimintaan, johon liittyy ilmiön tai kohteen ymmärtäminen ja sen rationaalinen käsittely. Lisäksi Alan Turingin artikkelin mukaan jotkut tekoälyn älylliset kyvyt voivat ilmetä eri tavoin kuin ihmisten kyvyt. Yksinkertaisesti sanottuna, jos tekoäly ratkaisee ongelman, jota ihmiset eivät pysty ratkaisemaan, arvioija todennäköisemmin huomaa, että toinen osapuoli on tietokone. Viime kädessä Turingin testi ei pysty arvioimaan kunnolla älykkyyden muotoja, jotka ylittävät ihmisen kyvyt.
Toiseksi Turingin testin arviointikriteerit ovat subjektiivisia ja kokeelliset olosuhteet liian rajoittavia. Toisin sanoen testituloksiin voivat vaikuttaa merkittävästi arvioijan asenne, kokemus, taidot ja tieto pikemminkin kuin tekoälyn todellinen älykkyystaso, mikä vaikeuttaa objektiivisuuden varmistamista.

Viime kädessä se taho, joka määrittää, onko jokin tekoäly vai ihminen, on ihminen, joten arvioijan subjektiivisuutta on vaikea täysin poistaa. Lisäksi noin viiden minuutin rajallisessa ajassa esitettävät kysymykset ovat hyvin rajattuja. Niin kauan kuin arvioija on ihminen, on aina mahdollista, että erilaiset ulkoiset tekijät vaikuttavat häneen.
Lisäksi useimmat Turingin testiin osallistuvat tekoälyt on mallinnettu tiettyjä tilanteita tai ominaisuuksia omaavien ihmisten mukaan. Siksi, vaikka tekoäly läpäisisi testin, on vaikea päätellä, että se käyttäytyy samalla tavalla kuin ihmiset yleensä. Esimerkiksi aiemmin esitelty "Eugene Goostman" kehitettiin olettaen, että kyseessä oli 13-vuotias Ukrainassa asuva poika. Tämä oli tarkoituksellinen yritys luoda tilanne, jossa jopa hieman kömpelö englanti hyväksyttäisiin luonnollisena. "PARRY" mallinnettiin vainoharhaisen potilaan mukaan ja "ELIZA" suunniteltiin jäljittelemään ammattimaista psykologista neuvonantajaa.
Tällä tavoin, kun tekoäly asetetaan edustamaan tiettyjä ominaisuuksia omaavaa ihmistä ja sitten osallistutaan keskusteluun, tuomarit arvioivat sitä nämä ominaisuudet mielessä pitäen. Esimerkiksi, vaikka keskustelussa mielenterveysongelmaista henkilöä edustamaan ohjelmoidun tekoälyn kanssa ilmenisi hieman outo reaktio, tuomarit todennäköisesti hyväksyvät sen luonnollisena reaktiona, joka on yhdenmukainen kyseisen luonnehdinnan kanssa. Toisin sanoen, vaikka tuomareiden oletetaan arvioivan puolueettomasti, heidät itse asiassa sijoitetaan ympäristöön, jossa se on vaikeaa.
Mielenterveysongelmista kärsivät ihmiset pystyvät toki ajattelemaan. Se, että mielenterveysongelmista kärsivän henkilön mukaan mallinnettu tekoäly läpäisee Turingin testin, ei kuitenkaan tarkoita, että se ajattelee "ihmismäisemmin" kuin ihminen. Pysyäkseen uskollisena Alan Turingin esittämälle kysymykselle – "Voiko kone käyttäytyä samalla tavalla kuin ihminen?" – testi on suunniteltava yleisten tilanteiden perusteella, jotka suurin osa ihmisistä voi hyväksyä.
Kolmanneksi, tekoäly voi läpäistä Turingin testin yksinkertaisesti manipuloimalla symboleja sen sijaan, että se itse asiassa ymmärtäisi sisällön. Hyvä esimerkki tästä on ”ELIZA”. Jotta ihminen voi ajatella jostakin aiheesta, hänen on ymmärrettävä se ja tehtävä arvioita asiaankuuluvan kokemuksen perusteella. Tästä syystä filosofi John Searle väitti myös, että pelkkä Turingin testi ei voi todistaa, ajatteleeko kone todella.
Lisäksi, koska tekoäly toimii ennalta määrättyjen algoritmien mukaisesti, se voi helposti paljastaa virheitä odottamattomissa tilanteissa. Seuraava esimerkki havainnollistaa tätä.
Keskustelukumppani: Tuetko edelleen Bill Clintonia?
Tuomari: En ole koskaan tavannut Clintonia.
Keskustelukumppani: Et todellakaan pidä Bill Clintonista. Ainakin on selvää, ettet pidä hänestä. Mielestäni useimmat ihmiset eivät ole yksinkertaisesti olleet kiinnostuneita tai eivät ole ajatelleet asiaa paljoakaan tähän mennessä.
Tuomari: Oletko nähnyt elokuvan 'Marsilainen'?
Keskustelukumppani: Otetaan rauhallisesti. En ole täällä vastaamassa tyhmiin kysymyksiin. Ei siinä kaikki. Mistä me puhuimme? Aivan. Tarkoittaako juuri sanomasi, että taustalla olevat ongelmat – kuten Whitewater ja erikoissyyttäjä – ovat vakavia?
Tämä keskustelu käydään tuomarin ja ”Catherinen” välillä. ”Catherine” on tekoäly, joka on suunniteltu jatkamaan vuoropuhelua ennalta ohjelmoitujen tietojen perusteella tapahtumista, jotka olivat tulleet uutisiksi päivää ennen Turingin testiä. Jos tuomari olisi jatkanut Bill Clintoniin liittyvää poliittista keskustelua, vuoropuhelu olisi voinut pysyä varsin luonnollisena. Kun tuomari kuitenkin yhtäkkiä siirtyi aiheeseen, tekoäly ei pystynyt käsittelemään ohjelmoimatonta aihetta kunnolla ja paljasti yllä olevan virheen.
Emme siis voi päätellä, että tekoäly käyttäytyy ihmisen tavoin pelkästään siksi, että se kykenee tiettyyn kommunikointitasoon. Vaikka se saattaa pinnalta näyttää siltä, ​​että se käy ihmisen kaltaista keskustelua, se ei todellisuudessa ymmärrä sisältöä, vaan ainoastaan ​​reagoi tavalla, joka saa sen vaikuttamaan inhimilliseltä. Siksi se ei täytä aiemmin määriteltyä "älykkyyden" käsitettä. Nykyisellä Turingin testillä, joka läpäisee tekoälyjärjestelmät, jotka vain matkivat ihmisen käyttäytymistä ymmärtämättä sen merkitystä, on selkeitä rajoituksia.
Koska Turingin testi arvioi tekoälyä vertaamalla sitä ihmisiin, se on merkityksellinen koe, joka tutkii ihmisten ja tekoälyn välistä rajaa. Koska ihmiset itse eivät pysty selkeästi määrittelemään ajatuksen tai mielen olemusta, tällä yrityksellä itsessään on merkittävä arvo. Toisaalta, koska tekoäly toimii suhteellisen yksinkertaisten rakenteiden ja periaatteiden pohjalta, sitä on mahdollista mitata ja analysoida tietyssä määrin, vaikkakaan ei täydellisesti.
Turingin testi ei kuitenkaan pysty arvioimaan älykkyyttä tarkasti, ja sen arviointikriteerit ovat myös liian subjektiivisia. Lähempi tarkastelu varsinaiseen testausprosessiin paljastaa, että sitä on vaikea pitää ympäristönä, joka kykenee arvioimaan tekoälyn älykkyyttä kokonaisvaltaisesti. Vaikka useita tuomareita osallistuisi ja laitos valvoisi arviointiprosessia, arvioijien määrä on rajallinen, eikä ole helppo päästä objektiiviseen johtopäätökseen, joka ottaa huomioon kaikki muuttujat. Siksi täydellisen ja kaikkien hyväksymän tuloksen johtamiselle on perustavanlaatuisia rajoituksia.
Turingin testi on erittäin tärkeä, koska se osoitti tekoälyn pystyvän jossain määrin kopioimaan aiemmin ihmisille ainutlaatuisina pidettyjä kognitiivisia kykyjä. Siksi testin täydellisen hylkäämisen sijaan on tarpeen luoda arviointikriteerit ja -menettelyt, jotka ovat tarkempia ja laajemmalle yleisölle hyväksyttäviä kuin nykyisin käytössä olevat.
Tässä mielessä ehdotan vaihtoehtoiseksi menetelmäksi "käänteistä Turingin testiä". Käänteisessä Turingin testissä arvioijana toimii tietokone eikä ihminen. Toisin sanoen se on menetelmä, jossa tietokone arvioi ihmistä tai toista tietokonetta ollessaan vuorovaikutuksessa sen kanssa. Tämän lähestymistavan lisääminen olemassa oleviin testeihin vähentäisi ihmisen subjektiivisuuden ongelmaa ja mahdollistaisi arviointien suorittamisen objektiivisemmassa ympäristössä. Luonnollisesti se, että arvioijana toimii tekoäly, herättää myös uusia kysymyksiä.
Aiheesta riippumatta arviointiin ja harkintaan suunnitellut testit eivät todennäköisesti tyydytä kaikkia, eikä ole helppoa laatia täydellisiä kriteerejä, jotka kaikki voivat hyväksyä. Siksi meidän on jatkuvasti tutkittava tapoja parantaa niitä. Erityisesti koska Turingin testi on ratkaiseva arviointimenetelmä, joka voi vaikuttaa merkittävästi teollisuuden tulevaisuuteen ja tekoälyteknologian kehityksen suuntaan, sitä on kehitettävä tehokkaampaan ja luotettavampaan muotoon.
Nykyään tekoäly kehittyy ennennäkemättömällä vauhdilla, ja sitä hyödynnetään jo jokapäiväisessä elämässämme. Tällaista tekoälyä arvioitaessa meidän ei pitäisi tuomita sitä pelkästään sen perusteella, pystyykö se harhauttamaan ihmisiä, vaan pikemminkin arvioida sen kykyä ymmärtää merkitystä, tarttua kontekstiin ja kommunikoida luonnollisesti erilaisissa tilanteissa. Koska tämä ei ole ala, jolla on selkeästi määriteltyjä "oikeita vastauksia" kuten matemaattisissa tehtävissä, objektiivisten kriteerien asettaminen ei tietenkään ole helppoa. Jotta tekoälyä, joka tulee tulevaisuudessa elämään ihmisten rinnalla, Turingin testiä on kuitenkin kehitettävä siten, että se ottaa kattavasti huomioon eettiset tekijät ja kyvyn kommunikoida tehokkaasti.

 

Kirjailijasta