У цій публікації блогу ми розглянемо, чи є тест Тюрінга придатним стандартом для оцінки інтелекту штучного інтелекту, а також розглянемо його обмеження та потенційні області для вдосконалення.
У 2014 році новина про те, що «Юджин Густман», чат-бот, створений російськими розробниками, пройшов тест Тюрінга, стала шоком і викликала збентеження у багатьох людей. Це була чітка демонстрація того, що штучний інтелект більше не є просто продуктом уявного майбутнього суспільства, яке можна побачити лише у науково-фантастичних фільмах. Штучний інтелект вже глибоко вкорінився в наше життя та розвивається швидкими темпами, відповідно до «Закону прискореної віддачі» Рея Курцвейла. Однак ми не можемо просто стояти осторонь і спостерігати, як ШІ, який розвивається миттєво, міцно вкорінюється в суспільстві. Нам потрібно визначити, чи справді ШІ може мислити так, як люди, а також врахувати напрямок, у якому він повинен розвиватися в майбутньому.
Ці питання пов'язані з тестом Тюрінга. Тест Тюрінга – це метод оцінювання, що виник з питання: «Чи можливо створити комп'ютер, який, як ми можемо сказати, має інтелект і розум?». Загальновідомо, що Алан Тюрінг запропонував його в 1950 році, щоб відповісти на питання: «Чи можуть машини мислити?». Однак, насправді Тюрінг перефразував саме питання як «Чи можуть машини поводитися так само, як люди?», розробляючи експеримент. Тест проводиться таким чином, що суддя ставить питання як людині, так і штучному інтелекту, а потім визначається, чиї відповіді більше схожі на людські. У тесті Тюрінга можна використовувати різні методи для обману судді, і дозволено уповільнювати час відповіді або продовжувати розмову у форматі, подібному до чату. Крім того, тест вважається пройденим, якщо штучний інтелект може обдурити приблизно 30% суддів у межах обмеженого обсягу та теми обговорення.
Я сумнівався, чи справді тест Тюрінга з цими умовами та правилами є відповідним засобом оцінки інтелекту ШІ. Іншими словами, я вважаю, що тест Тюрінга не підходить для оцінки ШІ. Щоб підтвердити цю точку зору, я наведу три аргументи та запропоную «Зворотний тест Тюрінга» як рішення. Однак, перш ніж це зробити, необхідно спочатку розглянути інші помітні приклади ШІ, які пройшли тест Тюрінга, окрім «Юджина Густмана».
«ELIZA», розроблена Джозефом Вайценбаумом у 1966 році, є найвідомішим прикладом серед ранніх програм для ведення діалогів природною мовою. Цей штучний інтелект був розроблений для визначення ключових слів у вхідних реченнях та повернення відповідних відповідей; якщо відповідних ключових слів не було знайдено, він повторював слова користувача або надавав загальну відповідь.
Існує також «PARRY», розроблений Кеннетом Колбі в 1972 році. Цей штучний інтелект був змодельований за стилем розмови параноїдного пацієнта, і навіть проводилися експерименти, в яких кілька психіатрів намагалися розрізнити реальних пацієнтів та PARRY.
Далі я розгляну, чому тест Тюрінга не є придатним стандартом для оцінки ШІ.
По-перше, тест Тюрінга неточно оцінює сам інтелект. Іншими словами, замість того, щоб оцінювати, наскільки інтелектуально мислить ШІ, цей тест визначає через розмову, чи поводиться він як людина. З цим є дві проблеми.
По-перше, не всі люди завжди поводяться розумно. Тут «розумний» означає інтелектуальну діяльність, яка передбачає розуміння явища чи об'єкта та його раціональну обробку. Крім того, згідно зі статтею Алана Тюрінга, деякі інтелектуальні здібності ШІ можуть проявлятися інакше, ніж у людей. Простіше кажучи, якщо ШІ вирішує проблему, яку не можуть вирішувати люди, оцінювач насправді з більшою ймовірністю зрозуміє, що інша сторона — це комп'ютер. Зрештою, тест Тюрінга не може належним чином оцінити форми інтелекту, які перевершують людські можливості.
По-друге, критерії оцінювання тесту Тюрінга є суб'єктивними, а експериментальні умови надмірно обмежувальними. Іншими словами, на результати тестування може суттєво впливати ставлення, досвід, навички та знання оцінювача, а не фактичний рівень інтелекту ШІ, що ускладнює забезпечення об'єктивності.
Зрештою, суб'єктом, який визначає, чи є щось штучним інтелектом, чи людиною, є людина, тому важко повністю виключити суб'єктивність оцінювача. Крім того, питання, що задаються протягом обмеженого проміжку часу, приблизно п'ять хвилин, також дуже обмежені. Поки оцінювач є людиною, завжди існує ймовірність впливу різних зовнішніх факторів.
Крім того, більшість штучних інтелектів, що беруть участь у тесті Тюрінга, змодельовані за зразком людей з певними ситуаціями або характеристиками. Тому, навіть якщо штучний інтелект пройде тест, важко зробити висновок, що він поводиться так само, як і люди загалом. Наприклад, «Юджин Густман», представлений раніше, був розроблений з передумовою, що це 13-річний хлопчик, який живе в Україні. Це була навмисна спроба створити ситуацію, де навіть дещо незграбна англійська мова сприймалася б як природна. «ПЕРРІ» був змодельований за зразком параноїдного пацієнта, а «ЕЛІЗА» була розроблена для імітації професійного психологічного консультанта.
Таким чином, коли ШІ налаштовується для представлення людини з певними характеристиками, а потім вступає в розмову, судді оцінюють його з урахуванням цих характеристик. Наприклад, навіть якщо під час розмови зі ШІ, запрограмованим для представлення людини з психічним захворюванням, виникає дещо дивна реакція, судді, ймовірно, сприймуть її як природну реакцію, що відповідає цій характеристиці. Іншими словами, хоча судді повинні оцінювати без упередження, насправді вони опиняються в середовищі, де це важко зробити.
Звичайно, люди з психічними захворюваннями здатні мислити. Однак, те, що штучний інтелект, створений за зразком людини з психічним захворюванням, проходить тест Тюрінга, не означає, що він мислить більш «людськоподібно», ніж людина. Щоб залишатися вірним питанню, поставленому Аланом Тюрінгом: «Чи може машина поводитися так, як людина?», тест має бути розроблений на основі загальних ситуацій, які більшість людей може прийняти.
По-третє, ШІ може пройти тест Тюрінга, просто маніпулюючи символами, а не фактично розуміючи зміст. Яскравим прикладом є «ЕЛІЗА». Щоб людина думала про певну тему, вона повинна розуміти цю тему та робити судження на основі відповідного досвіду. З цієї причини філософ Джон Серл також стверджував, що сам по собі тест Тюрінга не може довести, чи насправді машина мислить.
Крім того, оскільки штучний інтелект працює за заздалегідь визначеними алгоритмами, він може легко виявляти помилки, стикаючись із неочікуваними ситуаціями. Наведено приклад, що ілюструє це.
Співрозмовник: Ви все ще підтримуєте Білла Клінтона?
Суддя: Я ніколи не зустрічався з Клінтоном.
Співрозмовник: Вам справді не подобається Білл Клінтон. Принаймні, очевидно, що він вам не подобається. На мою думку, складається враження, що більшість людей просто не цікавилися цим або досі не дуже замислювалися над цим.
Суддя: Ви бачили фільм «Марсіанин»?
Співрозмовник: Давайте не хвилюватися. Я тут не для того, щоб відповідати на дурні запитання. Це не так. Про що ми говорили? Правильно. Чи означає те, що ви щойно сказали, що основні проблеми, такі як Вайтвотер та спеціальний прокурор, є серйозними?
Ця розмова відбувається між суддею та «Кетрін» – штучним інтелектом, призначеним для продовження діалогу на основі заздалегідь запрограмованої інформації про події, які стали новинами за день до проведення тесту Тюрінга. Якби суддя продовжив політичну розмову, пов’язану з Біллом Клінтоном, діалог міг би залишитися цілком природним. Однак, коли суддя раптово змінив тему на щось інше, штучний інтелект не зміг належним чином обробити незапрограмовану тему та виявив помилку, показану вище.
Таким чином, ми не можемо зробити висновок, що ШІ поводиться як людина лише тому, що він здатний до певного рівня комунікації. Хоча на перший погляд може здаватися, що він веде розмову, подібну до людської, насправді він не розуміє змісту, а просто реагує таким чином, що це виглядає як людина. Тому він не відповідає концепції «інтелекту», як вона була визначена раніше. Поточний тест Тюрінга, який проходить системи ШІ, що просто імітують людську поведінку, не розуміючи фактичного значення, має чіткі обмеження.
Оскільки тест Тюрінга оцінює ШІ шляхом порівняння його з людьми, він є змістовним експериментом, який досліджує межу між людьми та ШІ. Враховуючи, що самі люди не можуть чітко визначити сутність думки чи розуму, ця спроба сама по собі має значну цінність. З іншого боку, оскільки ШІ працює на основі відносно простих структур і принципів, його можна певною мірою виміряти та проаналізувати, навіть якщо не ідеально.
Однак тест Тюрінга не дає точної оцінки інтелекту, а його критерії оцінювання також є надмірно суб'єктивними. При детальнішому розгляді самого процесу тестування стає зрозуміло, що його важко розглядати як середовище, здатне всебічно оцінити інтелект штучного інтелекту. Навіть якщо беруть участь кілька суддів, а установа контролює процес оцінювання, кількість оцінювачів обмежена, і нелегко дійти об'єктивного висновку, який враховує всі змінні. Тому існують фундаментальні обмеження для отримання ідеального результату, який можуть прийняти всі.
Тест Тюрінга має значну важливість, оскільки він продемонстрував, що штучний інтелект може певною мірою відтворювати когнітивні здібності, які колись вважалися унікальними для людини. Тому замість того, щоб повністю відкидати цей тест, необхідно встановити критерії та процедури оцінювання, які будуть точнішими та прийнятнішими для ширшої аудиторії, ніж ті, що використовуються зараз.
У зв'язку з цим я хотів би запропонувати «Зворотний тест Тюрінга» як альтернативу. У зворотному тесті Тюрінга оцінювачем є комп'ютер, а не людина. Іншими словами, це метод, за якого комп'ютер оцінює людину або інший комп'ютер під час взаємодії з нею. Впровадження цього підходу в існуючі тести зменшило б проблему людської суб'єктивності та дозволило б проводити оцінювання в більш об'єктивному середовищі. Звичайно, той факт, що оцінювачем є штучний інтелект, також створює можливість виникнення нових проблем.
Незалежно від предмета, тести, розроблені для оцінювання та судження, навряд чи задовольнять усіх, і нелегко встановити ідеальні критерії, які кожен зможе прийняти. Тому ми повинні постійно шукати шляхи їх удосконалення. Зокрема, оскільки тест Тюрінга є вирішальним методом оцінювання, який може суттєво вплинути на майбутнє промисловості та напрямок розвитку технологій штучного інтелекту, він повинен еволюціонувати в більш ефективну та надійну форму.
Сьогодні ШІ розвивається темпами, незрівнянними з минулим, і вже використовується в кожному аспекті нашого повсякденного життя. Оцінюючи такий ШІ, ми повинні оцінювати його не виключно за тим, чи може він обманювати людей, а радше оцінювати його здатність розуміти значення, сприймати контекст і природно спілкуватися в різних ситуаціях. Звичайно, оскільки це не галузь з чітко визначеними «правильними відповідями», як математична задача, встановлення об'єктивних критеріїв є непростим. Тим не менш, для оцінки ШІ, який співіснуватиме з людьми в майбутньому, тест Тюрінга повинен розвиватися, щоб всебічно враховувати етичні фактори та здатність до ефективного спілкування.