Μπορεί το τεστ Turing να αξιολογήσει πραγματικά την τεχνητή νοημοσύνη;

Σε αυτήν την ανάρτηση ιστολογίου, θα εξετάσουμε εάν το Τεστ Τούρινγκ αποτελεί κατάλληλο πρότυπο για την αξιολόγηση της νοημοσύνης της τεχνητής νοημοσύνης και θα διερευνήσουμε τους περιορισμούς του και τους πιθανούς τομείς βελτίωσης.

 

Το 2014, η είδηση ​​ότι ο «Eugene Goostman», ένα chatbot που δημιουργήθηκε από Ρώσους προγραμματιστές, είχε περάσει το Τεστ Τούρινγκ, προκάλεσε σοκ και σύγχυση σε πολλούς ανθρώπους. Αυτή ήταν μια σαφής απόδειξη ότι η τεχνητή νοημοσύνη δεν είναι πλέον απλώς ένα προϊόν μιας φανταστικής μελλοντικής κοινωνίας που βλέπουμε μόνο σε ταινίες επιστημονικής φαντασίας. Η τεχνητή νοημοσύνη έχει ήδη ενσωματωθεί βαθιά στη ζωή μας και προχωρά με ταχύ ρυθμό, σύμφωνα με τον «Νόμο των Επιταχυνόμενων Αποδόσεων» του Ray Kurzweil. Ωστόσο, δεν μπορούμε απλώς να μείνουμε άπραγοι και να παρακολουθούμε καθώς η τεχνητή νοημοσύνη, η οποία εξελίσσεται στο άψε σβήσε, εδραιώνεται σταθερά στην κοινωνία. Πρέπει να προσδιορίσουμε εάν η τεχνητή νοημοσύνη μπορεί πράγματι να σκέφτεται όπως οι άνθρωποι και πρέπει επίσης να εξετάσουμε την κατεύθυνση προς την οποία θα πρέπει να αναπτυχθεί στο μέλλον.
Αυτά τα ζητήματα συνδέονται με το Τεστ Τούρινγκ. Το Τεστ Τούρινγκ είναι μια μέθοδος αξιολόγησης που προέκυψε από το ερώτημα: «Είναι δυνατόν να δημιουργήσουμε έναν υπολογιστή που μπορούμε να πούμε ότι διαθέτει νοημοσύνη και μυαλό;» Είναι ευρέως γνωστό ότι ο Άλαν Τούρινγκ το πρότεινε το 1950 για να απαντήσει στο ερώτημα «Μπορούν οι μηχανές να σκέφτονται;» Ωστόσο, ο Τούρινγκ στην πραγματικότητα αναδιατύπωσε το ίδιο το ερώτημα ως «Μπορούν οι μηχανές να συμπεριφέρονται με τον ίδιο τρόπο που συμπεριφέρονται οι άνθρωποι;» κατά τον σχεδιασμό του πειράματος. Το τεστ διεξάγεται ζητώντας από έναν κριτή να θέτει ερωτήσεις τόσο σε έναν άνθρωπο όσο και σε μια Τεχνητή Νοημοσύνη, και στη συνέχεια να προσδιορίζει ποια από τις απαντήσεις είναι πιο ανθρώπινες. Στο Τεστ Τούρινγκ, μπορούν να χρησιμοποιηθούν διάφορες μέθοδοι για να εξαπατηθεί ο κριτής και επιτρέπεται η επιβράδυνση των χρόνων απόκρισης ή η συνέχιση της συζήτησης σε μορφή συνομιλίας. Επιπλέον, το τεστ θεωρείται επιτυχές εάν η Τεχνητή Νοημοσύνη μπορεί να εξαπατήσει περίπου το 30% των κριτών εντός του περιορισμένου πεδίου εφαρμογής και του θέματος της συζήτησης.
Αμφισβήτησα κατά πόσον ένα Τεστ Τούρινγκ με αυτές τις συνθήκες και τους κανόνες είναι πραγματικά ένα κατάλληλο μέτρο για την αξιολόγηση της νοημοσύνης της Τεχνητής Νοημοσύνης. Με άλλα λόγια, πιστεύω ότι το Τεστ Τούρινγκ δεν είναι κατάλληλο για την αξιολόγηση της Τεχνητής Νοημοσύνης. Για να υποστηρίξω αυτήν την άποψη, θα παρουσιάσω τρία επιχειρήματα και θα προτείνω το «Αντίστροφο Τεστ Τούρινγκ» ως λύση. Πριν το κάνω αυτό, ωστόσο, είναι απαραίτητο να εξετάσουμε πρώτα άλλα αξιοσημείωτα παραδείγματα Τεχνητής Νοημοσύνης που έχουν περάσει το Τεστ Τούρινγκ εκτός από τον «Γιούτζιν Γκούστμαν».
Το «ELIZA», που αναπτύχθηκε από τον Joseph Weizenbaum το 1966, είναι το πιο γνωστό παράδειγμα μεταξύ των πρώιμων προγραμμάτων διαλόγου φυσικής γλώσσας. Αυτή η Τεχνητή Νοημοσύνη σχεδιάστηκε για να εντοπίζει βασικές λέξεις-κλειδιά σε προτάσεις εισόδου και να επιστρέφει αντίστοιχες απαντήσεις. Εάν δεν βρίσκονταν κατάλληλες λέξεις-κλειδιά, επαναλάμβανε τις λέξεις του χρήστη ή παρείχε μια γενική απάντηση.
Υπάρχει επίσης το «PARRY», που αναπτύχθηκε από τον Kenneth Colby το 1972. Αυτή η τεχνητή νοημοσύνη μοντελοποιήθηκε σύμφωνα με το στυλ συνομιλίας ενός παρανοϊκού ασθενούς, και μάλιστα διεξήχθησαν πειράματα στα οποία αρκετοί ψυχίατροι προσπάθησαν να διακρίνουν μεταξύ πραγματικών ασθενών και του PARRY.
Από εδώ και στο εξής, θα εξετάσω γιατί το Τεστ Τούρινγκ δεν αποτελεί κατάλληλο πρότυπο για την αξιολόγηση της Τεχνητής Νοημοσύνης.
Καταρχάς, το Τεστ Τούρινγκ δεν αξιολογεί με ακρίβεια την ίδια την νοημοσύνη. Με άλλα λόγια, αντί να αξιολογεί πόσο έξυπνα σκέφτεται μια Τεχνητή Νοημοσύνη, αυτό το τεστ καθορίζει μέσω συζήτησης αν συμπεριφέρεται σαν άνθρωπος. Υπάρχουν δύο προβλήματα με αυτό.
Καταρχάς, δεν συμπεριφέρονται πάντα όλοι οι άνθρωποι με έξυπνο τρόπο. Εδώ, ο όρος «έξυπνος» αναφέρεται σε μια πνευματική δραστηριότητα που περιλαμβάνει την κατανόηση ενός φαινομένου ή αντικειμένου και την ορθολογική επεξεργασία του. Επιπλέον, σύμφωνα με την εργασία του Alan Turing, ορισμένες πνευματικές ικανότητες της Τεχνητής Νοημοσύνης μπορεί να εκδηλωθούν με τρόπους διαφορετικούς από αυτούς των ανθρώπων. Με απλά λόγια, εάν μια Τεχνητή Νοημοσύνη λύνει ένα πρόβλημα που οι άνθρωποι δεν μπορούν, ο αξιολογητής είναι στην πραγματικότητα πιο πιθανό να συνειδητοποιήσει ότι το άλλο μέρος είναι ένας υπολογιστής. Τελικά, το Τεστ Turing αποτυγχάνει να αξιολογήσει σωστά μορφές νοημοσύνης που ξεπερνούν τις ανθρώπινες δυνατότητες.
Δεύτερον, τα κριτήρια αξιολόγησης του Τεστ Turing είναι υποκειμενικά και οι πειραματικές συνθήκες είναι υπερβολικά περιοριστικές. Με άλλα λόγια, τα αποτελέσματα του τεστ μπορούν να επηρεαστούν σημαντικά από τη στάση, την εμπειρία, τις δεξιότητες και τις γνώσεις του αξιολογητή και όχι από το πραγματικό επίπεδο νοημοσύνης της Τεχνητής Νοημοσύνης, γεγονός που καθιστά δύσκολη τη διασφάλιση της αντικειμενικότητας.

Τελικά, η οντότητα που καθορίζει αν κάτι είναι Τεχνητή Νοημοσύνη ή άνθρωπος είναι ένα άτομο, επομένως είναι δύσκολο να εξαλειφθεί εντελώς η υποκειμενικότητα του αξιολογητή. Επιπλέον, οι ερωτήσεις που τίθενται εντός του περιορισμένου χρονικού πλαισίου των περίπου πέντε λεπτών είναι επίσης πολύ περιορισμένες. Εφόσον ο αξιολογητής είναι άνθρωπος, υπάρχει πάντα η πιθανότητα να επηρεαστεί από διάφορους εξωτερικούς παράγοντες.
Επιπλέον, οι περισσότερες Τεχνητές Νοημοσύνης που συμμετέχουν στο Τεστ Τούρινγκ έχουν ως πρότυπο ανθρώπους με συγκεκριμένες καταστάσεις ή χαρακτηριστικά. Επομένως, ακόμη και αν μια Τεχνητή Νοημοσύνη περάσει το τεστ, είναι δύσκολο να συμπεράνουμε ότι συμπεριφέρεται με τον ίδιο τρόπο όπως οι άνθρωποι γενικά. Για παράδειγμα, το «Eugene Goostman», που παρουσιάστηκε νωρίτερα, αναπτύχθηκε με την προϋπόθεση ότι ήταν ένα 13χρονο αγόρι που ζούσε στην Ουκρανία. Αυτή ήταν μια σκόπιμη προσπάθεια να δημιουργηθεί μια κατάσταση όπου ακόμη και τα κάπως αδέξια αγγλικά θα γίνονταν αποδεκτά ως φυσικά. Το «PARRY» διαμορφώθηκε με βάση έναν παρανοϊκό ασθενή και το «ELIZA» σχεδιάστηκε για να μιμείται έναν επαγγελματία ψυχολόγο.
Με αυτόν τον τρόπο, όταν μια Τεχνητή Νοημοσύνη (ΤΝ) έχει ρυθμιστεί να αναπαραστήσει έναν άνθρωπο με συγκεκριμένα χαρακτηριστικά και στη συνέχεια συμμετέχει σε συζήτηση, οι κριτές την αξιολογούν έχοντας κατά νου αυτά τα χαρακτηριστικά. Για παράδειγμα, ακόμη και αν προκύψει μια κάπως παράξενη αντίδραση κατά τη διάρκεια μιας συζήτησης με μια ΤΝ προγραμματισμένη να αναπαραστήσει ένα άτομο με ψυχική ασθένεια, οι κριτές είναι πιθανό να την αποδεχτούν ως μια φυσική αντίδραση που συνάδει με αυτόν τον χαρακτηρισμό. Με άλλα λόγια, ενώ οι κριτές υποτίθεται ότι αξιολογούν χωρίς προκατάληψη, στην πραγματικότητα τοποθετούνται σε ένα περιβάλλον όπου αυτό είναι δύσκολο.
Φυσικά, τα άτομα με ψυχικές ασθένειες είναι ικανά να σκέφτονται. Ωστόσο, μόνο και μόνο επειδή μια Τεχνητή Νοημοσύνη που έχει σχεδιαστεί σύμφωνα με το πρότυπο ενός ατόμου με ψυχική ασθένεια περνάει το Τεστ Τούρινγκ δεν σημαίνει ότι σκέφτεται περισσότερο «ανθρώπινα» από έναν άνθρωπο. Για να παραμείνουμε πιστοί στο ερώτημα που έθεσε ο Άλαν Τούρινγκ - «Μπορεί μια μηχανή να συμπεριφέρεται όπως ένας άνθρωπος;» - το τεστ πρέπει να σχεδιαστεί με βάση γενικές καταστάσεις που η πλειοψηφία των ανθρώπων μπορεί να αποδεχτεί.
Τρίτον, η Τεχνητή Νοημοσύνη μπορεί να περάσει το Τεστ Τούρινγκ απλώς χειριζόμενος σύμβολα αντί να κατανοεί στην πραγματικότητα το περιεχόμενο. Ένα χαρακτηριστικό παράδειγμα είναι η «ΕΛΙΖΑ». Για να σκεφτεί κάποιος ένα θέμα, πρέπει να το κατανοήσει και να κάνει κρίσεις με βάση τη σχετική εμπειρία. Για αυτόν τον λόγο, ο φιλόσοφος John Searle υποστήριξε επίσης ότι το Τεστ Τούρινγκ από μόνο του δεν μπορεί να αποδείξει εάν μια μηχανή σκέφτεται πραγματικά.
Επιπλέον, δεδομένου ότι η τεχνητή νοημοσύνη λειτουργεί σύμφωνα με προκαθορισμένους αλγόριθμους, μπορεί εύκολα να αποκαλύψει σφάλματα όταν αντιμετωπίζει απρόβλεπτες καταστάσεις. Ακολουθεί ένα παράδειγμα που το καταδεικνύει αυτό.
Συνομιλητής: Εξακολουθείτε να υποστηρίζετε τον Μπιλ Κλίντον;
Δικαστής: Δεν έχω γνωρίσει ποτέ τον Κλίντον.
Συνομιλητής: Αντιπαθείτε πραγματικά τον Μπιλ Κλίντον. Τουλάχιστον, είναι σαφές ότι τον αντιπαθείτε. Κατά τη γνώμη μου, φαίνεται ότι οι περισσότεροι άνθρωποι απλώς δεν ενδιαφέρονται ή δεν το έχουν σκεφτεί πολύ μέχρι στιγμής.
Δικαστής: Έχετε δει τον «Αρειανό»;
Συνομιλητής: Ας το πάρουμε χαλαρά. Δεν είμαι εδώ για να απαντήσω σε ηλίθιες ερωτήσεις. Δεν είναι αυτό. Για τι πράγμα μιλούσαμε; Σωστά. Αυτό που μόλις είπατε σημαίνει ότι τα υποκείμενα ζητήματα - όπως ο Γουάιτγουοτερ και ο ειδικός σύμβουλος - είναι σοβαρά;
Αυτή η συζήτηση είναι μεταξύ ενός δικαστή και της «Κατερίνας», μιας Τεχνητής Νοημοσύνης που έχει σχεδιαστεί για να συνεχίζει έναν διάλογο βασισμένο σε προγραμματισμένες πληροφορίες σχετικά με γεγονότα που είχαν γίνει είδηση ​​την προηγούμενη ημέρα της διεξαγωγής του Τεστ Τούρινγκ. Εάν ο δικαστής είχε συνεχίσει την πολιτική συζήτηση που σχετίζεται με τον Μπιλ Κλίντον, ο διάλογος θα μπορούσε να είχε παραμείνει αρκετά φυσικός. Ωστόσο, όταν ο δικαστής ξαφνικά άλλαξε το θέμα, η Τεχνητή Νοημοσύνη δεν μπόρεσε να χειριστεί σωστά το μη προγραμματισμένο θέμα και αποκάλυψε το σφάλμα που φαίνεται παραπάνω.
Επομένως, δεν μπορούμε να συμπεράνουμε ότι μια Τεχνητή Νοημοσύνη συμπεριφέρεται σαν άνθρωπος απλώς και μόνο επειδή είναι ικανή για ένα ορισμένο επίπεδο επικοινωνίας. Ενώ μπορεί να φαίνεται ότι συμμετέχει σε ανθρώπινη συνομιλία επιφανειακά, στην πραγματικότητα δεν κατανοεί το περιεχόμενο, αλλά απλώς αντιδρά με τρόπο που το κάνει να φαίνεται ανθρώπινο. Επομένως, δεν ανταποκρίνεται στην έννοια της «νοημοσύνης» όπως ορίστηκε προηγουμένως. Το τρέχον Τεστ Turing, το οποίο περνάει με επιτυχία συστήματα Τεχνητής Νοημοσύνης που απλώς μιμούνται την ανθρώπινη συμπεριφορά χωρίς να κατανοούν στην πραγματικότητα το νόημα, έχει σαφείς περιορισμούς.
Το Τεστ Τούρινγκ, το οποίο αξιολογεί την Τεχνητή Νοημοσύνη συγκρίνοντάς την με τους ανθρώπους, αποτελεί ένα ουσιαστικό πείραμα που διερευνά τα όρια μεταξύ ανθρώπων και Τεχνητής Νοημοσύνης. Λαμβάνοντας υπόψη ότι οι ίδιοι οι άνθρωποι δεν μπορούν να ορίσουν με σαφήνεια την ουσία της σκέψης ή του νου, αυτή η προσπάθεια από μόνη της έχει σημαντική αξία. Από την άλλη πλευρά, δεδομένου ότι η Τεχνητή Νοημοσύνη λειτουργεί με βάση σχετικά απλές δομές και αρχές, είναι δυνατό να μετρηθεί και να αναλυθεί σε κάποιο βαθμό, ακόμη και αν όχι τέλεια.
Ωστόσο, το Τεστ Τούρινγκ δεν αξιολογεί με ακρίβεια τη νοημοσύνη και τα κριτήρια αξιολόγησής του είναι επίσης υπερβολικά υποκειμενικά. Μια πιο προσεκτική ματιά στην πραγματική διαδικασία δοκιμών αποκαλύπτει ότι είναι δύσκολο να τη θεωρήσουμε ως ένα περιβάλλον ικανό να αξιολογήσει ολοκληρωμένα τη νοημοσύνη μιας Τεχνητής Νοημοσύνης. Ακόμα κι αν συμμετέχουν πολλοί κριτές και ένα ίδρυμα επιβλέπει τη διαδικασία αξιολόγησης, ο αριθμός των αξιολογητών είναι περιορισμένος και δεν είναι εύκολο να καταλήξουμε σε ένα αντικειμενικό συμπέρασμα που να λαμβάνει υπόψη όλες τις μεταβλητές. Επομένως, υπάρχουν θεμελιώδεις περιορισμοί στην εξαγωγή ενός τέλειου αποτελέσματος που όλοι μπορούν να αποδεχτούν.
Το Τεστ Τούρινγκ έχει σημαντική σημασία, καθώς απέδειξε ότι η Τεχνητή Νοημοσύνη μπορεί, σε κάποιο βαθμό, να αναπαράγει τις γνωστικές ικανότητες που κάποτε θεωρούνταν μοναδικές για τον άνθρωπο. Επομένως, αντί να απορριφθεί εντελώς αυτό το τεστ, υπάρχει ανάγκη να καθοριστούν κριτήρια και διαδικασίες αξιολόγησης που να είναι πιο ακριβή και αποδεκτά σε ένα ευρύτερο κοινό από αυτά που χρησιμοποιούνται σήμερα.
Από αυτή την άποψη, θα ήθελα να προτείνω το «Reverse Turing Test» ως εναλλακτική λύση. Στο Reverse Turing Test, ο αξιολογητής είναι ένας υπολογιστής και όχι ένας άνθρωπος. Με άλλα λόγια, είναι μια μέθοδος κατά την οποία ένας υπολογιστής αξιολογεί έναν άνθρωπο ή έναν άλλο υπολογιστή ενώ αλληλεπιδρά με αυτόν. Η εισαγωγή αυτής της προσέγγισης σε υπάρχουσες δοκιμές θα μείωνε το πρόβλημα της ανθρώπινης υποκειμενικότητας και θα επέτρεπε τη διεξαγωγή αξιολογήσεων σε ένα πιο αντικειμενικό περιβάλλον. Φυσικά, το γεγονός ότι ο αξιολογητής είναι μια Τεχνητή Νοημοσύνη εγείρει επίσης την πιθανότητα νέων ζητημάτων.
Ανεξάρτητα από το θέμα, οι δοκιμές που έχουν σχεδιαστεί για αξιολόγηση και κρίση είναι απίθανο να ικανοποιήσουν τους πάντες και δεν είναι εύκολο να καθοριστούν τέλεια κριτήρια που να μπορούν να αποδεχτούν όλοι. Επομένως, πρέπει να διερευνούμε συνεχώς τρόπους για να τα βελτιώσουμε. Συγκεκριμένα, δεδομένου ότι το Τεστ Turing είναι μια κρίσιμη μέθοδος αξιολόγησης που θα μπορούσε να επηρεάσει σημαντικά το μέλλον της βιομηχανίας και την κατεύθυνση της ανάπτυξης της τεχνολογίας Τεχνητής Νοημοσύνης, πρέπει να εξελιχθεί σε μια πιο αποτελεσματική και αξιόπιστη μορφή.
Σήμερα, η Τεχνητή Νοημοσύνη (ΤΝ) εξελίσσεται με ρυθμούς ασύγκριτους με το παρελθόν και ήδη χρησιμοποιείται σε κάθε πτυχή της καθημερινότητάς μας. Κατά την αξιολόγηση μιας τέτοιας ΤΝ, δεν θα πρέπει να την κρίνουμε αποκλειστικά με βάση το αν μπορεί να εξαπατήσει τους ανθρώπους, αλλά μάλλον να αξιολογούμε την ικανότητά της να κατανοεί το νόημα, να κατανοεί το πλαίσιο και να επικοινωνεί φυσικά σε μια ποικιλία καταστάσεων. Φυσικά, δεδομένου ότι αυτός δεν είναι ένας τομέας με σαφώς καθορισμένες «σωστές απαντήσεις» όπως ένα μαθηματικό πρόβλημα, ο καθορισμός αντικειμενικών κριτηρίων δεν είναι εύκολος. Παρ 'όλα αυτά, για την αξιολόγηση της ΤΝ που θα συνυπάρχει με τους ανθρώπους στο μέλλον, το Τεστ Τούρινγκ πρέπει να εξελιχθεί ώστε να λαμβάνει υπόψη συνολικά ηθικούς παράγοντες και την ικανότητα αποτελεσματικής επικοινωνίας.

 

Σχετικά με τον Συγγραφέα