W tym wpisie na blogu sprawdzimy, czy test Turinga jest odpowiednim standardem oceny inteligencji sztucznej inteligencji, a także przyjrzymy się jego ograniczeniom i potencjalnym obszarom udoskonalenia.
W 2014 roku wiadomość o tym, że „Eugene Goostman”, chatbot stworzony przez rosyjskich programistów, zdał test Turinga, była szokiem i wywołała konsternację u wielu osób. Stanowiło to wyraźny dowód na to, że sztuczna inteligencja nie jest już jedynie produktem wyimaginowanego społeczeństwa przyszłości, widzianego jedynie w filmach science fiction. Sztuczna inteligencja jest już głęboko zakorzeniona w naszym życiu i rozwija się w szybkim tempie, zgodnie z „Prawem Przyspieszających Nawrotów” Raya Kurzweila. Nie możemy jednak po prostu stać i patrzeć, jak sztuczna inteligencja, która ewoluuje w mgnieniu oka, umacnia swoją pozycję w społeczeństwie. Musimy ustalić, czy sztuczna inteligencja rzeczywiście potrafi myśleć tak jak ludzie, a także zastanowić się, w jakim kierunku powinna się rozwijać w przyszłości.
Te kwestie są powiązane z testem Turinga. Test Turinga to metoda oceny, która wywodzi się z pytania: „Czy możliwe jest stworzenie komputera, o którym moglibyśmy powiedzieć, że posiada inteligencję i umysł?”. Powszechnie wiadomo, że Alan Turing zaproponował ją w 1950 roku, aby odpowiedzieć na pytanie: „Czy maszyny potrafią myśleć?”. Jednak Turing, projektując eksperyment, przeformułował samo pytanie: „Czy maszyny mogą zachowywać się tak samo jak ludzie?”. Test przeprowadza się, zadając pytania zarówno człowiekowi, jak i sztucznej inteligencji, a następnie ustalając, czyje odpowiedzi są bardziej ludzkie. W teście Turinga można zastosować różne metody, aby oszukać sędziego, a dopuszczalne jest spowolnienie czasu odpowiedzi lub kontynuowanie rozmowy w formacie przypominającym czat. Co więcej, test uznaje się za zaliczony, jeśli sztucznej inteligencji uda się oszukać około 30% sędziów w ograniczonym zakresie i temacie dyskusji.
Wątpiłem, czy test Turinga z tymi warunkami i regułami jest rzeczywiście odpowiednią miarą do oceny inteligencji SI. Innymi słowy, uważam, że test Turinga nie nadaje się do oceny SI. Aby poprzeć ten pogląd, przedstawię trzy argumenty i zaproponuję „odwrotny test Turinga” jako rozwiązanie. Zanim to jednak nastąpi, konieczne jest najpierw przeanalizowanie innych znaczących przykładów SI, które przeszły test Turinga, poza „Eugene’em Goostmanem”.
„ELIZA”, opracowana przez Josepha Weizenbauma w 1966 roku, jest najbardziej znanym przykładem wczesnych programów dialogowych w języku naturalnym. Ta sztuczna inteligencja została zaprojektowana w celu identyfikowania kluczowych słów kluczowych w zdaniach wejściowych i zwracania odpowiadających im odpowiedzi; jeśli nie znaleziono odpowiednich słów kluczowych, powtarzała słowa użytkownika lub udzielała ogólnej odpowiedzi.
Istnieje również system „PARRY”, opracowany w 1972 roku przez Kennetha Colby’ego. Ten system sztucznej inteligencji został opracowany na podstawie stylu konwersacji pacjenta z paranoją. Przeprowadzono nawet eksperymenty, w których kilku psychiatrów próbowało odróżnić rzeczywistych pacjentów od systemu PARRY.
Od tego momentu postaram się wykazać, dlaczego test Turinga nie jest odpowiednim standardem oceny sztucznej inteligencji.
Po pierwsze, test Turinga nie ocenia dokładnie samej inteligencji. Innymi słowy, zamiast oceniać inteligencję myślenia sztucznej inteligencji, test ten określa poprzez rozmowę, czy zachowuje się ona jak człowiek. Wiąże się to z dwoma problemami.
Po pierwsze, nie wszyscy ludzie zawsze zachowują się inteligentnie. W tym przypadku „inteligentny” odnosi się do aktywności intelektualnej, która polega na zrozumieniu zjawiska lub obiektu i racjonalnym jego przetworzeniu. Co więcej, zgodnie z artykułem Alana Turinga, niektóre zdolności intelektualne sztucznej inteligencji mogą przejawiać się w sposób odmienny od zdolności ludzkich. Mówiąc prościej, jeśli sztuczna inteligencja rozwiąże problem, którego ludzie nie potrafią rozwiązać, osoba oceniająca z większym prawdopodobieństwem dostrzeże, że druga strona jest komputerem. Ostatecznie test Turinga nie potrafi prawidłowo ocenić form inteligencji przewyższających ludzkie możliwości.
Po drugie, kryteria oceny testu Turinga są subiektywne, a warunki eksperymentalne nadmiernie restrykcyjne. Innymi słowy, na wyniki testu może znacząco wpływać postawa, doświadczenie, umiejętności i wiedza osoby oceniającej, a nie rzeczywisty poziom inteligencji sztucznej inteligencji, co utrudnia zapewnienie obiektywizmu.
Ostatecznie podmiotem decydującym o tym, czy coś jest sztuczną inteligencją, czy człowiekiem, jest osoba, dlatego trudno całkowicie wyeliminować subiektywność oceniającego. Co więcej, pytania zadawane w ograniczonym czasie około pięciu minut są również bardzo ograniczone. Dopóki oceniający jest człowiekiem, zawsze istnieje możliwość, że ulegnie wpływom różnych czynników zewnętrznych.
Ponadto większość SI biorących udział w teście Turinga jest wzorowana na ludziach o określonych sytuacjach lub cechach. Dlatego nawet jeśli SI przejdzie test, trudno stwierdzić, że zachowuje się tak samo jak ludzie w ogóle. Na przykład, przedstawiony wcześniej „Eugene Goostman” został stworzony z założeniem, że jest 13-letnim chłopcem mieszkającym na Ukrainie. Było to celowe działanie mające na celu stworzenie sytuacji, w której nawet nieco niezdarny angielski byłby akceptowany jako naturalny. „PARRY” został wzorowany na pacjencie z paranoją, a „ELIZA” miała naśladować profesjonalnego psychologa.
W ten sposób, gdy sztuczna inteligencja jest skonfigurowana do reprezentowania osoby o określonych cechach, a następnie angażuje się w rozmowę, sędziowie oceniają ją, biorąc pod uwagę te cechy. Na przykład, nawet jeśli podczas rozmowy z SI zaprogramowaną do reprezentowania osoby z chorobą psychiczną pojawi się nieco dziwna reakcja, sędziowie prawdopodobnie zaakceptują ją jako naturalną reakcję, zgodną z tą charakterystyką. Innymi słowy, chociaż sędziowie powinni oceniać bezstronnie, w rzeczywistości znajdują się w środowisku, w którym jest to trudne.
Oczywiście, osoby z chorobami psychicznymi są zdolne do myślenia. Jednak to, że sztuczna inteligencja wzorowana na osobie z chorobą psychiczną zda test Turinga, nie oznacza, że myśli ona bardziej „po ludzku” niż człowiek. Aby pozostać wiernym pytaniu zadanemu przez Alana Turinga – „Czy maszyna może zachowywać się tak jak człowiek?” – test musi być zaprojektowany w oparciu o ogólne sytuacje, które większość ludzi jest w stanie zaakceptować.
Po trzecie, sztuczna inteligencja może zdać test Turinga, po prostu manipulując symbolami, zamiast faktycznie rozumieć treść. Doskonałym przykładem jest „ELIZA”. Aby człowiek mógł myśleć o danym temacie, musi go zrozumieć i formułować osądy w oparciu o odpowiednie doświadczenie. Z tego powodu filozof John Searle argumentował również, że sam test Turinga nie może udowodnić, że maszyna faktycznie myśli.
Co więcej, ponieważ sztuczna inteligencja działa według z góry określonych algorytmów, może łatwo wykrywać błędy w nieoczekiwanych sytuacjach. Poniżej znajduje się przykład ilustrujący to zjawisko.
Rozmówca: Czy nadal popierasz Billa Clintona?
Sędzia: Nigdy nie spotkałem Clintona.
Rozmówca: Naprawdę nie lubisz Billa Clintona. A przynajmniej widać, że go nie lubisz. Moim zdaniem, wygląda na to, że większość ludzi po prostu nie była nim zainteresowana albo do tej pory nie poświęciła mu zbyt wiele uwagi.
Sędzia: Widziałeś „Marsjanina”?
Rozmówca: Spokojnie. Nie jestem tu po to, żeby odpowiadać na głupie pytania. Nie o to chodzi. O czym rozmawialiśmy? Jasne. Czy to, co właśnie powiedziałeś, oznacza, że kwestie leżące u podstaw – takie jak Whitewater i prokurator specjalny – są poważne?
Ta rozmowa toczy się między sędzią a „Catherine”, sztuczną inteligencją zaprojektowaną do kontynuowania dialogu w oparciu o zaprogramowane informacje o wydarzeniach, które stały się wiadomością dzień przed testem Turinga. Gdyby sędzia kontynuował rozmowę polityczną dotyczącą Billa Clintona, dialog mógłby potoczyć się zupełnie naturalnie. Jednak gdy sędzia nagle zmienił temat, sztuczna inteligencja nie była w stanie prawidłowo obsłużyć niezaprogramowanego tematu i ujawniła błąd pokazany powyżej.
Nie możemy zatem stwierdzić, że sztuczna inteligencja zachowuje się jak człowiek tylko dlatego, że jest zdolna do pewnego poziomu komunikacji. Choć na pierwszy rzut oka może sprawiać wrażenie, że prowadzi konwersację przypominającą ludzką, w rzeczywistości nie rozumie treści, a jedynie reaguje w sposób, który sprawia, że wydaje się być człowiekiem. W związku z tym nie spełnia ona wcześniej zdefiniowanej koncepcji „inteligencji”. Obecny test Turinga, który przechodzi testy systemów sztucznej inteligencji jedynie naśladujących ludzkie zachowanie bez faktycznego rozumienia jego znaczenia, ma wyraźne ograniczenia.
Test Turinga, oceniając sztuczną inteligencję poprzez porównanie jej z ludźmi, stanowi wartościowy eksperyment badający granicę między ludźmi a sztuczną inteligencją. Biorąc pod uwagę, że sami ludzie nie potrafią jednoznacznie zdefiniować istoty myśli ani umysłu, próba ta sama w sobie ma istotną wartość. Z drugiej strony, ponieważ sztuczna inteligencja działa w oparciu o stosunkowo proste struktury i zasady, możliwe jest jej mierzenie i analizowanie do pewnego stopnia, nawet jeśli nie w sposób doskonały.
Jednak test Turinga nie pozwala na precyzyjną ocenę inteligencji, a jego kryteria oceny są również nadmiernie subiektywne. Bliższe przyjrzenie się samemu procesowi testowania ujawnia, że trudno go postrzegać jako środowisko umożliwiające kompleksową ocenę inteligencji sztucznej inteligencji. Nawet jeśli w procesie oceny uczestniczy wielu sędziów, a instytucja nadzoruje proces, liczba oceniających jest ograniczona i trudno jest wyciągnąć obiektywny wniosek uwzględniający wszystkie zmienne. Dlatego też istnieją fundamentalne ograniczenia w uzyskaniu idealnego wyniku, który każdy mógłby zaakceptować.
Test Turinga ma istotne znaczenie, ponieważ wykazał, że sztuczna inteligencja może do pewnego stopnia odtworzyć zdolności poznawcze, które kiedyś uważano za unikalne dla ludzi. Dlatego zamiast całkowicie odrzucać ten test, należy opracować kryteria i procedury oceny, które będą dokładniejsze i akceptowalne dla szerszego grona odbiorców niż te obecnie stosowane.
W tym kontekście chciałbym zaproponować „Odwrotny Test Turinga” jako alternatywę. W Odwrotnym Teście Turinga oceniającym jest komputer, a nie człowiek. Innymi słowy, jest to metoda, w której komputer ocenia człowieka lub inny komputer podczas interakcji z nim. Wprowadzenie tego podejścia do istniejących testów zmniejszyłoby problem subiektywności ludzkiej i umożliwiłoby przeprowadzanie ocen w bardziej obiektywnym środowisku. Oczywiście fakt, że oceniającym jest sztuczna inteligencja, stwarza również możliwość pojawienia się nowych problemów.
Niezależnie od tematu, testy zaprojektowane do oceny i osądu raczej nie zadowolą wszystkich, a ustalenie idealnych kryteriów, które każdy mógłby zaakceptować, nie jest łatwe. Dlatego musimy stale poszukiwać sposobów ich doskonalenia. W szczególności, ponieważ test Turinga jest kluczową metodą oceny, która może znacząco wpłynąć na przyszłość przemysłu i kierunek rozwoju technologii sztucznej inteligencji, musi on ewoluować w kierunku bardziej wydajnej i niezawodnej formy.
Obecnie sztuczna inteligencja rozwija się w tempie nieporównywalnym z przeszłością i jest już wykorzystywana w każdym aspekcie naszego codziennego życia. Oceniając taką sztuczną inteligencję, nie powinniśmy oceniać jej wyłącznie pod kątem tego, czy potrafi oszukać ludzi, ale raczej jej zdolności do rozumienia znaczenia, rozumienia kontekstu i naturalnej komunikacji w różnorodnych sytuacjach. Oczywiście, ponieważ nie jest to dziedzina z jasno określonymi „poprawnymi odpowiedziami”, jak w przypadku zadań matematycznych, ustalenie obiektywnych kryteriów nie jest łatwe. Niemniej jednak, aby ocenić sztuczną inteligencję, która będzie współistnieć z ludźmi w przyszłości, test Turinga musi ewoluować, aby kompleksowo uwzględniać czynniki etyczne i zdolność do skutecznej komunikacji.