Kann der Turing-Test künstliche Intelligenz wirklich bewerten?

In diesem Blogbeitrag werden wir untersuchen, ob der Turing-Test ein geeigneter Standard zur Bewertung der Intelligenz künstlicher Intelligenz ist, und seine Grenzen sowie mögliche Verbesserungsbereiche erforschen.

 

2014 sorgte die Nachricht, dass der von russischen Entwicklern geschaffene Chatbot „Eugene Goostman“ den Turing-Test bestanden hatte, für Aufsehen und Verwirrung. Dies bewies eindrucksvoll, dass künstliche Intelligenz (KI) nicht länger nur ein Produkt einer imaginären Zukunftsvision aus Science-Fiction-Filmen ist. KI ist bereits tief in unseren Alltag integriert und entwickelt sich rasant, ganz im Sinne von Ray Kurzweils „Gesetz der beschleunigten Renditen“. Wir können jedoch nicht tatenlos zusehen, wie sich KI in Sekundenschnelle weiterentwickelt und sich in der Gesellschaft etabliert. Wir müssen herausfinden, ob KI tatsächlich wie Menschen denken kann und welche Richtung ihre zukünftige Entwicklung einschlagen sollte.
Diese Problematik steht im Zusammenhang mit dem Turing-Test. Der Turing-Test ist eine Bewertungsmethode, die auf der Frage basiert: „Ist es möglich, einen Computer zu entwickeln, dem man Intelligenz und ein Bewusstsein zuschreiben kann?“ Bekanntlich schlug Alan Turing ihn 1950 vor, um die Frage „Können Maschinen denken?“ zu beantworten. Tatsächlich formulierte Turing die Frage jedoch um: „Können Maschinen sich so verhalten wie Menschen?“ Beim Entwurf des Experiments stellte ein Prüfer sowohl einem Menschen als auch einer KI Fragen und bewertete anschließend, wessen Antworten menschenähnlicher waren. Im Turing-Test sind verschiedene Methoden erlaubt, den Prüfer zu täuschen. So ist es beispielsweise zulässig, die Antwortzeiten zu verlangsamen oder das Gespräch in einem Chat-ähnlichen Format fortzuführen. Der Test gilt als bestanden, wenn die KI innerhalb des begrenzten Rahmens und Themas der Diskussion etwa 30 % der Prüfer täuschen kann.
Ich habe hinterfragt, ob ein Turing-Test unter diesen Bedingungen und Regeln tatsächlich ein geeignetes Maß zur Beurteilung der Intelligenz von KI darstellt. Anders ausgedrückt: Ich glaube, der Turing-Test ist nicht geeignet, KI zu evaluieren. Um diese Ansicht zu untermauern, werde ich drei Argumente anführen und den „umgekehrten Turing-Test“ als Lösung vorschlagen. Zuvor ist es jedoch notwendig, neben „Eugene Goostman“ weitere bemerkenswerte Beispiele von KI zu untersuchen, die den Turing-Test bestanden haben.
„ELIZA“, 1966 von Joseph Weizenbaum entwickelt, ist das bekannteste Beispiel für ein frühes Programm zur Verarbeitung natürlicher Sprache. Diese KI war darauf ausgelegt, Schlüsselwörter in eingegebenen Sätzen zu erkennen und entsprechende Antworten zu liefern. Wurden keine passenden Schlüsselwörter gefunden, wiederholte sie die Worte des Benutzers oder gab eine Standardantwort.
Außerdem gibt es „PARRY“, das 1972 von Kenneth Colby entwickelt wurde. Diese KI wurde nach dem Gesprächsstil eines paranoiden Patienten modelliert, und es wurden sogar Experimente durchgeführt, in denen mehrere Psychiater versuchten, zwischen echten Patienten und PARRY zu unterscheiden.
Im Folgenden werde ich untersuchen, warum der Turing-Test kein geeigneter Standard zur Bewertung von KI ist.
Erstens misst der Turing-Test die Intelligenz selbst nicht präzise. Anders ausgedrückt: Anstatt zu bewerten, wie intelligent eine KI denkt, ermittelt dieser Test anhand von Konversationen, ob sie sich wie ein Mensch verhält. Das birgt zwei Probleme.
Erstens verhalten sich nicht alle Menschen stets intelligent. „Intelligenz“ bezieht sich hier auf intellektuelle Tätigkeit, die das Verstehen und rationale Verarbeiten eines Phänomens oder Objekts umfasst. Laut Alan Turings Arbeit können sich manche intellektuellen Fähigkeiten von KI anders manifestieren als die des Menschen. Vereinfacht gesagt: Löst eine KI ein Problem, das Menschen nicht lösen können, erkennt der Beurteiler eher, dass es sich um einen Computer handelt. Letztendlich ist der Turing-Test ungeeignet, Intelligenzformen, die menschliche Fähigkeiten übertreffen, angemessen zu bewerten.
Zweitens sind die Bewertungskriterien des Turing-Tests subjektiv und die Versuchsbedingungen zu restriktiv. Anders ausgedrückt: Die Testergebnisse können maßgeblich von der Einstellung, Erfahrung, den Fähigkeiten und dem Wissen des Bewertenden beeinflusst werden und spiegeln weniger die tatsächliche Intelligenz der KI wider, was die Gewährleistung von Objektivität erschwert.

Letztendlich entscheidet ein Mensch darüber, ob es sich um eine KI oder einen Menschen handelt. Daher lässt sich die Subjektivität des Bewertenden nur schwer vollständig ausschließen. Hinzu kommt, dass die innerhalb des begrenzten Zeitraums von etwa fünf Minuten gestellten Fragen stark eingeschränkt sind. Solange der Bewertende ein Mensch ist, besteht stets die Möglichkeit, von verschiedenen externen Faktoren beeinflusst zu werden.
Zudem sind die meisten KIs, die am Turing-Test teilnehmen, nach menschlichen Vorbildern mit spezifischen Lebenssituationen oder Eigenschaften modelliert. Selbst wenn eine KI den Test besteht, lässt sich daher nicht schlussfolgern, dass sie sich generell wie Menschen verhält. Beispielsweise wurde „Eugene Goostman“, der bereits erwähnt wurde, mit der Prämisse entwickelt, dass er ein 13-jähriger Junge aus der Ukraine ist. Dies war ein bewusster Versuch, eine Situation zu schaffen, in der selbst etwas holpriges Englisch als natürlich akzeptiert wird. „PARRY“ wurde nach dem Vorbild eines paranoiden Patienten entwickelt, und „ELIZA“ wurde so konzipiert, dass sie eine professionelle psychologische Beraterin simuliert.
Wenn eine KI so programmiert wird, dass sie einen Menschen mit bestimmten Eigenschaften repräsentiert und anschließend ein Gespräch führt, bewerten die Juroren sie unter Berücksichtigung dieser Eigenschaften. Selbst wenn beispielsweise eine KI, die eine Person mit einer psychischen Erkrankung darstellen soll, eine etwas ungewöhnliche Antwort gibt, werden die Juroren diese wahrscheinlich als natürliche Reaktion akzeptieren, die mit dieser Charakterisierung übereinstimmt. Anders ausgedrückt: Obwohl die Juroren unvoreingenommen bewerten sollen, befinden sie sich in einer Umgebung, in der dies schwierig ist.
Natürlich sind Menschen mit psychischen Erkrankungen zum Denken fähig. Doch nur weil eine KI, die einem Menschen mit einer psychischen Erkrankung nachempfunden ist, den Turing-Test besteht, heißt das nicht, dass sie „menschenähnlicher“ denkt als ein Mensch. Um der von Alan Turing aufgeworfenen Frage – „Kann sich eine Maschine wie ein Mensch verhalten?“ – gerecht zu werden, muss der Test auf allgemeinen Situationen basieren, die die meisten Menschen akzeptieren können.
Drittens kann KI den Turing-Test bestehen, indem sie lediglich Symbole manipuliert, anstatt den Inhalt tatsächlich zu verstehen. Ein Paradebeispiel dafür ist „ELIZA“. Um über ein Thema nachzudenken, muss ein Mensch dieses Thema verstehen und auf Grundlage relevanter Erfahrungen Urteile fällen. Aus diesem Grund argumentierte der Philosoph John Searle auch, dass der Turing-Test allein nicht beweisen kann, ob eine Maschine tatsächlich denkt.
Da künstliche Intelligenz nach vorgegebenen Algorithmen arbeitet, kann sie in unerwarteten Situationen leicht Fehler aufdecken. Das folgende Beispiel veranschaulicht dies.
Gesprächspartner: Unterstützen Sie Bill Clinton noch immer?
Richter: Ich habe Clinton noch nie getroffen.
Gesprächspartner: Sie mögen Bill Clinton ganz offensichtlich nicht. Zumindest ist es offensichtlich. Meiner Meinung nach haben sich die meisten Leute bisher einfach nicht dafür interessiert oder sich nicht groß damit auseinandergesetzt.
Richter: Haben Sie „Der Marsianer“ gesehen?
Gesprächspartner: Ganz ruhig. Ich bin nicht hier, um dumme Fragen zu beantworten. Darum geht es nicht. Worüber haben wir gesprochen? Genau. Bedeutet das, was Sie gerade gesagt haben, dass die zugrundeliegenden Probleme – wie Whitewater und der Sonderermittler – ernst zu nehmen sind?
Dieses Gespräch findet zwischen einem Richter und „Catherine“ statt, einer KI, die einen Dialog auf Basis vorprogrammierter Informationen über Ereignisse fortführen sollte, die am Tag vor dem Turing-Test in den Nachrichten waren. Hätte der Richter das politische Gespräch über Bill Clinton fortgesetzt, wäre der Dialog vermutlich ganz natürlich verlaufen. Als der Richter jedoch plötzlich das Thema wechselte, konnte die KI mit dem nicht programmierten Thema nicht umgehen und verursachte den oben gezeigten Fehler.
Wir können daher nicht schlussfolgern, dass sich eine KI wie ein Mensch verhält, nur weil sie zu einem gewissen Kommunikationsniveau fähig ist. Auch wenn sie oberflächlich betrachtet menschenähnliche Gespräche führt, versteht sie den Inhalt nicht wirklich, sondern reagiert lediglich so, dass es menschlich wirkt. Daher erfüllt sie nicht den zuvor definierten Begriff der „Intelligenz“. Der aktuelle Turing-Test, der KI-Systeme bestehen lässt, die menschliches Verhalten lediglich imitieren, ohne die Bedeutung tatsächlich zu verstehen, hat deutliche Einschränkungen.
Da der Turing-Test KI durch den Vergleich mit Menschen bewertet, ist er ein aussagekräftiges Experiment, das die Grenze zwischen Mensch und KI auslotet. Angesichts der Tatsache, dass selbst Menschen das Wesen des Denkens oder des Geistes nicht eindeutig definieren können, ist dieser Versuch an sich schon von großer Bedeutung. Andererseits lässt sich KI, da sie auf relativ einfachen Strukturen und Prinzipien basiert, bis zu einem gewissen Grad messen und analysieren, wenn auch nicht perfekt.
Der Turing-Test eignet sich jedoch nicht zur präzisen Beurteilung von Intelligenz und seine Bewertungskriterien sind zudem zu subjektiv. Eine genauere Betrachtung des Testverfahrens zeigt, dass es kaum geeignet ist, die Intelligenz einer KI umfassend zu bewerten. Selbst wenn mehrere Gutachter beteiligt sind und eine Institution den Bewertungsprozess überwacht, ist die Anzahl der Bewerter begrenzt, und es ist schwierig, zu einem objektiven Ergebnis zu gelangen, das alle Variablen berücksichtigt. Daher gibt es grundlegende Einschränkungen, um ein perfektes, allgemein akzeptables Ergebnis zu erzielen.
Der Turing-Test ist von großer Bedeutung, da er gezeigt hat, dass KI kognitive Fähigkeiten, die einst als einzigartig für den Menschen galten, bis zu einem gewissen Grad nachbilden kann. Anstatt diesen Test daher gänzlich zu verwerfen, ist es notwendig, präzisere und für ein breiteres Publikum akzeptablere Bewertungskriterien und -verfahren zu entwickeln als die derzeit verwendeten.
In diesem Zusammenhang möchte ich den „umgekehrten Turing-Test“ als Alternative vorschlagen. Beim umgekehrten Turing-Test ist der Bewertende ein Computer und nicht ein Mensch. Anders ausgedrückt: Es handelt sich um eine Methode, bei der ein Computer einen Menschen oder einen anderen Computer während der Interaktion bewertet. Die Integration dieses Ansatzes in bestehende Tests würde das Problem der menschlichen Subjektivität verringern und Bewertungen in einem objektiveren Umfeld ermöglichen. Natürlich wirft die Tatsache, dass der Bewertende eine KI ist, auch neue Fragen auf.
Unabhängig vom Thema werden Tests zur Bewertung und Beurteilung kaum alle zufriedenstellen, und es ist schwierig, perfekte, allgemein akzeptable Kriterien zu entwickeln. Daher müssen wir kontinuierlich nach Verbesserungsmöglichkeiten suchen. Insbesondere der Turing-Test, eine entscheidende Bewertungsmethode, die die Zukunft der Industrie und die Entwicklung von KI-Technologien maßgeblich beeinflussen kann, muss effizienter und zuverlässiger gestaltet werden.
Künstliche Intelligenz (KI) entwickelt sich heute in einem Tempo, das in der Vergangenheit unerreicht war, und durchdringt bereits alle Bereiche unseres täglichen Lebens. Bei der Bewertung solcher KI sollten wir sie nicht allein danach beurteilen, ob sie Menschen täuschen kann, sondern vielmehr nach ihrer Fähigkeit, Bedeutung zu verstehen, Kontext zu erfassen und in verschiedenen Situationen natürlich zu kommunizieren. Da es sich hier nicht um ein Gebiet mit klar definierten „richtigen Antworten“ wie bei einer mathematischen Aufgabe handelt, ist die Festlegung objektiver Kriterien natürlich nicht einfach. Um KI zu bewerten, die in Zukunft mit Menschen koexistieren wird, muss der Turing-Test jedoch weiterentwickelt werden und ethische Faktoren sowie die Fähigkeit zur effektiven Kommunikation umfassend berücksichtigen.

 

Über die Autorin