Може ли тестът на Тюринг наистина да оцени изкуствения интелект?

В тази публикация в блога ще разгледаме дали тестът на Тюринг е подходящ стандарт за оценка на интелигентността на изкуствения интелект и ще проучим неговите ограничения и потенциални области за подобрение.

 

През 2014 г. новината, че „Юджийн Густман“, чатбот, създаден от руски разработчици, е преминал теста на Тюринг, беше шокираща и предизвика объркване у много хора. Това беше ясна демонстрация, че изкуственият интелект вече не е просто продукт на въображаемо бъдещо общество, виждано само в научнофантастичните филми. Изкуственият интелект вече е дълбоко вкоренен в живота ни и се развива с бързи темпове, в съответствие със „Закона за ускоряващата се възвръщаемост“ на Рей Курцвейл. Не можем обаче просто да стоим безучастно и да гледаме как изкуственият интелект, който се развива за миг, се установява здраво в обществото. Трябва да определим дали изкуственият интелект наистина може да мисли като хората и трябва да обмислим посоката, в която трябва да се развива в бъдеще.
Тези проблеми са свързани с теста на Тюринг. Тестът на Тюринг е метод за оценка, който произлиза от въпроса: „Възможно ли е да се създаде компютър, за който можем да кажем, че притежава интелигентност и разум?“ Общоизвестно е, че Алън Тюринг го е предложил през 1950 г., за да отговори на въпроса „Могат ли машините да мислят?“. Всъщност обаче Тюринг е преформулирал самия въпрос като „Могат ли машините да се държат по същия начин като хората?“, когато е проектирал експеримента. Тестът се провежда, като съдия задава въпроси както на човек, така и на изкуствен интелект, след което се определя чии отговори са по-човешки. В теста на Тюринг могат да се използват различни методи за заблуда на съдията и е допустимо да се забави времето за реакция или да се продължи разговорът в чат-подобен формат. Освен това тестът се счита за успешен, ако изкуственият интелект може да заблуди приблизително 30% от съдиите в рамките на ограничения обхват и тема на дискусията.
Поставих под въпрос дали тестът на Тюринг с тези условия и правила е наистина подходяща мярка за оценка на интелигентността на ИИ. С други думи, смятам, че тестът на Тюринг не е подходящ за оценка на ИИ. В подкрепа на това мнение ще представя три аргумента и ще предложа „Обратния тест на Тюринг“ като решение. Преди да направя това обаче, е необходимо първо да разгледам други забележителни примери за ИИ, които са преминали теста на Тюринг, освен „Юджийн Густман“.
„ELIZA“, разработена от Джоузеф Вайценбаум през 1966 г., е най-широко известният пример сред ранните програми за диалог на естествен език. Този изкуствен интелект е проектиран да идентифицира ключови думи във въведените изречения и да връща съответните отговори; ако не бъдат намерени подходящи ключови думи, той повтаря думите на потребителя или предоставя общ отговор.
Съществува и „PARRY“, разработен от Кенет Колби през 1972 г. Този изкуствен интелект е моделиран по подобие на разговорния стил на параноичен пациент и дори са проведени експерименти, в които няколко психиатри се опитват да разграничат действителните пациенти от PARRY.
Оттук нататък ще разгледам защо тестът на Тюринг не е подходящ стандарт за оценка на изкуствен интелект.
Първо, тестът на Тюринг не оценява точно самата интелигентност. С други думи, вместо да оценява колко интелигентно мисли един изкуствен интелект, този тест определя чрез разговор дали той се държи като човек. Има два проблема с това.
Първо, не всички хора винаги се държат интелигентно. Тук „интелигентен“ се отнася до интелектуална дейност, която включва разбиране на дадено явление или обект и рационалната му обработка. Освен това, според статията на Алън Тюринг, някои интелектуални способности на ИИ могат да се проявяват по начини, различни от тези на хората. Казано по-просто, ако ИИ реши проблем, който хората не могат, оценителят е по-вероятно да осъзнае, че другата страна е компютър. В крайна сметка, тестът на Тюринг не успява да оцени правилно формите на интелигентност, които надхвърлят човешките възможности.
Второ, критериите за оценка на теста на Тюринг са субективни, а експерименталните условия са прекалено ограничаващи. С други думи, резултатите от теста могат да бъдат значително повлияни от отношението, опита, уменията и знанията на оценяващия, а не от действителното ниво на интелигентност на изкуствения интелект, което затруднява осигуряването на обективност.

В крайна сметка, обектът, който определя дали нещо е изкуствен интелект или човек, е човек, така че е трудно напълно да се елиминира субективността на оценяващия. Освен това, въпросите, задавани в рамките на ограничения период от около пет минути, също са много ограничени. Докато оценяващият е човек, винаги съществува възможност да бъде повлиян от различни външни фактори.
Освен това, повечето изкуствени интелекти, участващи в теста на Тюринг, са моделирани по подобие на хора със специфични ситуации или характеристики. Следователно, дори ако даден изкуствен интелект премине теста, е трудно да се заключи, че той се държи по същия начин като хората като цяло. Например, „Юджийн Густман“, представен по-рано, е разработен с предпоставката, че е 13-годишно момче, живеещо в Украйна. Това е умишлен опит да се създаде ситуация, в която дори донякъде тромав английски би бил приет като естествен. „ПАРИ“ е моделиран по подобие на параноичен пациент, а „ЕЛИЗА“ е проектирана да имитира професионален психологически консултант.
По този начин, когато един изкуствен интелект е настроен да представлява човек със специфични характеристики и след това е ангажиран в разговор, съдиите го оценяват, имайки предвид тези характеристики. Например, дори ако се появи донякъде странен отговор, докато се разговаря с изкуствен интелект, програмиран да представлява човек с психично заболяване, съдиите вероятно ще го приемат като естествена реакция, съответстваща на тази характеристика. С други думи, макар че съдиите би трябвало да оценяват безпристрастно, те всъщност са поставени в среда, където това е трудно.
Разбира се, хората с психични заболявания са способни да мислят. Само защото изкуствен интелект, моделиран по подобие на човек с психично заболяване, преминава теста на Тюринг, не означава, че той мисли по-„човекоподобно“ от човека. За да останем верни на въпроса, поставен от Алън Тюринг – „Може ли машина да се държи по начина, по който се държи човек?“ – тестът трябва да бъде проектиран въз основа на общи ситуации, които мнозинството от хората могат да приемат.
Трето, изкуственият интелект може да премине теста на Тюринг, просто като манипулира символи, вместо реално да разбира съдържанието. Отличен пример е „ЕЛИЗА“. За да може човек да мисли по дадена тема, той трябва да я разбира и да прави преценки въз основа на съответния опит. Поради тази причина философът Джон Сърл също твърди, че тестът на Тюринг сам по себе си не може да докаже дали една машина действително мисли.
Освен това, тъй като изкуственият интелект работи по предварително определени алгоритми, той може лесно да разкрие грешки, когато се сблъска с неочаквани ситуации. Следва пример, илюстриращ това.
Събеседник: Все още ли подкрепяте Бил Клинтън?
Съдия: Никога не съм срещал Клинтън.
Събеседник: Вие наистина не харесвате Бил Клинтън. Поне е ясно, че не го харесвате. Според мен изглежда, че повечето хора просто не са се интересували или не са се замисляли много досега.
Съдия: Гледали ли сте „Марсианецът“?
Събеседник: Нека не се притесняваме. Не съм тук, за да отговарям на глупави въпроси. Не е това. За какво говорихме? Точно така. Това, което току-що казахте, означава ли, че основните проблеми – като Уайтвотър и специалния прокурор – са сериозни?
Този разговор е между съдия и „Катрин“ – изкуствен интелект, проектиран да продължи диалог, базиран на предварително програмирана информация за събития, станали новина в деня преди провеждането на теста на Тюринг. Ако съдията беше продължил политическия разговор, свързан с Бил Клинтън, диалогът можеше да остане съвсем естествен. Когато обаче съдията внезапно промени темата към нещо друго, изкуственият интелект не успя да се справи правилно с непрограмираната тема и разкри показаната по-горе грешка.
Следователно, не можем да заключим, че един изкуствен интелект се държи като човек, само защото е способен на определено ниво на комуникация. Макар че на пръв поглед може да изглежда, че участва в разговор, подобен на човешки, той всъщност не разбира съдържанието, а просто реагира по начин, който го прави да изглежда човешко. Следователно, той не отговаря на концепцията за „интелигентност“, както е дефинирана по-рано. Настоящият тест на Тюринг, който преминава през системи с изкуствен интелект, които само имитират човешко поведение, без всъщност да разбират значението, има ясни ограничения.
Тъй като оценява ИИ чрез сравняване с хората, тестът на Тюринг е смислен експеримент, който изследва границата между хората и ИИ. Като се има предвид, че самите хора не могат ясно да дефинират същността на мисълта или ума, този опит сам по себе си има значителна стойност. От друга страна, тъй като ИИ работи въз основа на относително прости структури и принципи, е възможно да се измери и анализира до известна степен, дори и не перфектно.
Тестът на Тюринг обаче не успява да оцени точно интелигентността, а критериите му за оценка са и прекалено субективни. По-внимателният поглед върху действителния процес на тестване разкрива, че е трудно да се разглежда като среда, способна да оцени цялостно интелигентността на изкуствения интелект. Дори ако участват множество съдии и институция наблюдава процеса на оценяване, броят на оценителите е ограничен и не е лесно да се стигне до обективно заключение, което взема предвид всички променливи. Следователно, съществуват фундаментални ограничения за получаването на перфектен резултат, който всеки може да приеме.
Тестът на Тюринг е от съществено значение, тъй като демонстрира, че изкуственият интелект може до известна степен да възпроизведе когнитивните способности, считани някога за уникални за хората. Следователно, вместо напълно да се отхвърля този тест, е необходимо да се установят критерии и процедури за оценка, които са по-точни и приемливи за по-широка аудитория от използваните в момента.
В тази връзка бих искал да предложа „Обратния тест на Тюринг“ като алтернатива. В обратния тест на Тюринг оценителят е компютър, а не човек. С други думи, това е метод, при който компютър оценява човек или друг компютър, докато взаимодейства с него. Въвеждането на този подход в съществуващите тестове би намалило проблема с човешката субективност и би позволило оценките да се провеждат в по-обективна среда. Разбира се, фактът, че оценителят е изкуствен интелект, също повдига възможността за нови проблеми.
Независимо от темата, тестовете, предназначени за оценка и преценка, е малко вероятно да задоволят всички и не е лесно да се установят перфектни критерии, които всеки може да приеме. Следователно, трябва непрекъснато да проучваме начини за тяхното подобряване. По-специално, тъй като тестът на Тюринг е ключов метод за оценка, който би могъл значително да повлияе на бъдещето на индустрията и посоката на развитие на технологиите за изкуствен интелект, той трябва да се развие в по-ефективна и надеждна форма.
Днес изкуственият интелект се развива с темпове, несравними с миналото, и вече се използва във всеки аспект от нашето ежедневие. Когато оценяваме такъв изкуствен интелект, не бива да го съдим единствено по това дали може да заблуди хората, а по-скоро да оценим способността му да разбира смисъла, да схваща контекста и да общува естествено в различни ситуации. Разбира се, тъй като това не е област с ясно дефинирани „верни отговори“ като математическа задача, установяването на обективни критерии не е лесно. Въпреки това, за да се оцени изкуственият интелект, който ще съществува съвместно с хората в бъдеще, тестът на Тюринг трябва да се развие, за да вземе предвид всеобхватно етичните фактори и способността за ефективна комуникация.

 

За автора