У овом блог посту, испитаћемо да ли је Тјурингов тест одговарајући стандард за процену интелигенције вештачке интелигенције и истражити његова ограничења и потенцијалне области за побољшање.
Године 2014, вест да је „Јуџин Густман“, четбот кога су креирали руски програмери, прошао Тјурингов тест била је шокантна и изазвала је збуњеност код многих људи. Ово је била јасна демонстрација да вештачка интелигенција више није само производ имагинарног будућег друштва виђеног само у научнофантастичним филмовима. Вештачка интелигенција је већ дубоко укорењена у нашим животима и напредује брзим темпом, у складу са „Законом убрзаног приноса“ Реја Курцвајла. Међутим, не можемо само да стојимо по страни и гледамо како се вештачка интелигенција, која се развија у трен ока, чврсто учвршћује у друштву. Морамо да утврдимо да ли вештачка интелигенција заиста може да размишља као људи, а такође морамо размотрити и правац у којем би требало да се развија у будућности.
Ова питања су повезана са Тјуринговим тестом. Тјурингов тест је метода процене која је настала из питања: „Да ли је могуће створити рачунар за који можемо рећи да поседује интелигенцију и ум?“ Опште је познато да га је Алан Тјуринг предложио 1950. године како би одговорио на питање „Могу ли машине да мисле?“ Међутим, Тјуринг је заправо преформулисао само питање као „Могу ли се машине понашати на исти начин као људи?“ приликом дизајнирања експеримента. Тест се спроводи тако што судија поставља питања и човеку и вештачкој интелигенцији, а затим утврђује чији су одговори сличнији људским. У Тјуринговом тесту, могу се користити различите методе за обмањивање судије, а дозвољено је успорити време одзива или наставити разговор у формату сличном ћаскању. Штавише, тест се сматра положеним ако вештачка интелигенција може да обмане приближно 30% судија у оквиру ограниченог обима и теме дискусије.
Питао сам се да ли је Тјурингов тест са овим условима и правилима заиста одговарајућа мера за процену интелигенције вештачке интелигенције. Другим речима, верујем да Тјурингов тест није погодан за процену вештачке интелигенције. Да бих поткрепио овај став, представићу три аргумента и предложити „обрнути Тјурингов тест“ као решење. Међутим, пре него што то учиним, неопходно је прво испитати друге значајне примере вештачке интелигенције који су прошли Тјурингов тест, поред „Јуџина Густмана“.
„ЕЛИЗА“, коју је развио Џозеф Вајценбаум 1966. године, најпознатији је пример међу раним програмима за дијалог на природном језику. Ова вештачка интелигенција је дизајнирана да идентификује кључне речи у унетим реченицама и врати одговарајуће одговоре; ако нису пронађене одговарајуће кључне речи, понављала би речи корисника или давала генерички одговор.
Постоји и „PARRY“, који је развио Кенет Колби 1972. године. Ова вештачка интелигенција је моделирана по узору на конверзацијски стил параноидног пацијента, а чак су спроведени и експерименти у којима је неколико психијатара покушало да разликује стварне пацијенте од PARRY-ја.
Одавде ћу испитати зашто Тјурингов тест није одговарајући стандард за процену вештачке интелигенције.
Прво, Тјурингов тест не процењује прецизно саму интелигенцију. Другим речима, уместо да процењује колико интелигентно вештачка интелигенција размишља, овај тест кроз разговор утврђује да ли се понаша као човек. Постоје два проблема са овим.
Прво, не понашају се сви људи увек интелигентно. Овде се „интелигентно“ односи на интелектуалну активност која укључује разумевање феномена или објекта и његову рационалну обраду. Штавише, према раду Алана Тјуринга, неке интелектуалне способности вештачке интелигенције могу се манифестовати на начине који се разликују од људских. Једноставно речено, ако вештачка интелигенција реши проблем који људи не могу, евалуатор ће заправо вероватније схватити да је друга страна рачунар. На крају крајева, Тјурингов тест не успева да правилно процени облике интелигенције који превазилазе људске способности.
Друго, критеријуми за евалуацију Тјуринговог теста су субјективни, а експериментални услови су превише рестриктивни. Другим речима, на резултате теста могу значајно утицати став, искуство, вештине и знање евалуатора, а не стварни ниво интелигенције вештачке интелигенције, што отежава обезбеђивање објективности.
На крају крајева, ентитет који одређује да ли је нешто вештачка интелигенција или човек је особа, тако да је тешко потпуно елиминисати субјективност евалуатора. Штавише, питања постављена у ограниченом временском оквиру од око пет минута су такође веома ограничена. Све док је евалуатор човек, увек постоји могућност да на њега утичу различити спољни фактори.
Поред тога, већина вештачких интелигенција које учествују у Тјуринговом тесту моделиране су по узору на људе са специфичним ситуацијама или карактеристикама. Стога, чак и ако вештачка интелигенција прође тест, тешко је закључити да се понаша на исти начин као и људи уопште. На пример, „Јуџин Густман“, представљен раније, развијен је са претпоставком да је у питању тринаестогодишњи дечак који живи у Украјини. Ово је био намерни покушај да се створи ситуација у којој би се чак и помало неспретан енглески језик прихватао као природан. „ПАРИ“ је моделиран по узору на параноидног пацијента, а „ЕЛИЗА“ је дизајнирана да имитира професионалног психолошког саветника.
На овај начин, када се вештачка интелигенција подеси да представља човека са одређеним карактеристикама, а затим се укључи у разговор, судије је процењују имајући у виду те карактеристике. На пример, чак и ако се појави помало чудан одговор током разговора са вештачком интелигенцијом програмираном да представља особу са менталном болешћу, судије ће га вероватно прихватити као природну реакцију у складу са том карактеризацијом. Другим речима, иако се од судија очекује да процењују без пристрасности, они су заправо стављени у окружење у којем је то тешко учинити.
Наравно, људи са менталним болестима су способни да размишљају. Међутим, само зато што вештачка интелигенција направљена по узору на особу са менталном болешћу пролази Тјурингов тест не значи да размишља „сличније људима“ од човека. Да би остали верни питању које је поставио Алан Тјуринг – „Може ли се машина понашати као човек?“ – тест мора бити дизајниран на основу општих ситуација које већина људи може да прихвати.
Треће, вештачка интелигенција може да прође Тјурингов тест једноставним манипулисањем симболима уместо да заправо разуме садржај. Главни пример је „ЕЛИЗА“. Да би особа размишљала о некој теми, мора да разуме ту тему и да доноси судове на основу релевантног искуства. Из тог разлога, филозоф Џон Серл је такође тврдио да сам Тјурингов тест не може да докаже да ли машина заиста размишља.
Штавише, пошто вештачка интелигенција функционише према унапред одређеним алгоритмима, она може лако открити грешке када се суочи са неочекиваним ситуацијама. Следи пример који то илуструје.
Саговорник: Да ли и даље подржавате Била Клинтона?
Судија: Никада нисам упознао Клинтона.
Саговорник: Ви заиста не волите Била Клинтона. Барем је јасно да га не волите. По мом мишљењу, изгледа као да већина људи једноставно није била заинтересована или до сада није много размишљала о томе.
Судија: Јесте ли гледали филм „Марцијанац“?
Саговорник: Хајде да се опустимо. Нисам овде да одговарам на глупа питања. Није то то. О чему смо причали? Тачно. Да ли то што сте управо рекли значи да су основни проблеми – попут Вајтвотера и специјалног тужиоца – озбиљни?
Овај разговор је између судије и „Кетрин“, вештачке интелигенције дизајниране да настави дијалог на основу унапред програмираних информација о догађајима који су постали вести дан пре одржавања Тјуринговог теста. Да је судија наставио политички разговор везан за Била Клинтона, дијалог је могао остати сасвим природан. Међутим, када је судија изненада променио тему на нешто друго, вештачка интелигенција није била у стању да правилно обради непрограмирану тему и открила је горе приказану грешку.
Стога, не можемо закључити да се вештачка интелигенција понаша као човек само зато што је способна за одређени ниво комуникације. Иако на површини може изгледати као да се бави људским разговором, она заправо не разуме садржај већ само реагује на начин који делује људски. Стога, не испуњава концепт „интелигенције“ како је раније дефинисано. Тренутни Тјурингов тест, који пролази системе вештачке интелигенције који само имитирају људско понашање без стварног разумевања значења, има јасна ограничења.
Пошто процењује вештачку интелигенцију упоређујући је са људима, Тјурингов тест је значајан експеримент који истражује границу између људи и вештачке интелигенције. С обзиром на то да сами људи не могу јасно да дефинишу суштину мисли или ума, овај покушај сам по себи има значајну вредност. С друге стране, пошто вештачка интелигенција функционише на основу релативно једноставних структура и принципа, могуће ју је мерити и анализирати до одређене мере, чак и ако не савршено.
Међутим, Тјурингов тест не успева прецизно да процени интелигенцију, а његови критеријуми за процену су такође превише субјективни. Пажљивији поглед на сам процес тестирања открива да га је тешко посматрати као окружење способно за свеобухватну процену интелигенције вештачке интелигенције. Чак и ако учествује више судија и институција надгледа процес процене, број евалуатора је ограничен и није лако доћи до објективног закључка који узима у обзир све варијабле. Стога постоје фундаментална ограничења у добијању савршеног резултата који сви могу да прихвате.
Тјурингов тест је од значаја јер је показао да вештачка интелигенција може, до одређене мере, да реплицира когнитивне способности које су се некада сматрале јединственим за људе. Стога, уместо потпуног одбацивања овог теста, потребно је успоставити критеријуме и процедуре евалуације који су тачнији и прихватљивији широј публици од оних који се тренутно користе.
У том смислу, желео бих да предложим „Обрнути Тјурингов тест“ као алтернативу. У обрнутом Тјуринговом тесту, евалуатор је рачунар, а не човек. Другим речима, то је метода у којој рачунар евалуира човека или други рачунар док интерагује са њим. Увођење овог приступа у постојеће тестове смањило би проблем људске субјективности и омогућило би да се евалуације спроводе у објективнијем окружењу. Наравно, чињеница да је евалуатор вештачка интелигенција такође отвара могућност нових проблема.
Без обзира на тему, тестови осмишљени за процену и процену вероватно неће задовољити све, и није лако успоставити савршене критеријуме које сви могу прихватити. Стога морамо континуирано истраживати начине за њихово побољшање. Посебно, с обзиром на то да је Тјурингов тест кључна метода процене која би могла значајно утицати на будућност индустрије и правац развоја технологије вештачке интелигенције, он мора еволуирати у ефикаснији и поузданији облик.
Данас, вештачка интелигенција напредује темпом који се не може упоредити са прошлошћу и већ се користи у сваком аспекту нашег свакодневног живота. Приликом процене такве вештачке интелигенције, не би требало да је судимо искључиво на основу тога да ли може да обмане људе, већ да проценимо њену способност да разуме значење, схвати контекст и природно комуницира у различитим ситуацијама. Наравно, пошто ово није област са јасно дефинисаним „тачним одговорима“ попут математичког проблема, успостављање објективних критеријума није лако. Ипак, да би се проценила вештачка интелигенција која ће коегзистирати са људима у будућности, Тјурингов тест мора да се развије како би свеобухватно узео у обзир етичке факторе и способност ефикасне комуникације.