Dans cet article de blog, nous examinerons si le test de Turing est une norme appropriée pour évaluer l'intelligence artificielle, et nous explorerons ses limites et ses pistes d'amélioration potentielles.
En 2014, l'annonce de la réussite au test de Turing d'« Eugene Goostman », un chatbot créé par des développeurs russes, a créé la surprise et semé la confusion. Cette nouvelle a clairement démontré que l'intelligence artificielle n'est plus un simple produit d'une société future imaginaire, digne des films de science-fiction. L'IA est déjà profondément ancrée dans nos vies et progresse à un rythme effréné, conformément à la « loi des rendements accélérés » de Ray Kurzweil. Cependant, nous ne pouvons rester les bras croisés face à l'essor fulgurant de l'IA et à son implantation durable dans la société. Il nous faut déterminer si l'IA est réellement capable de penser comme les humains et réfléchir à l'orientation que devrait prendre son développement futur.
Ces questions sont liées au test de Turing. Le test de Turing est une méthode d'évaluation qui trouve son origine dans la question : « Est-il possible de créer un ordinateur doté d'intelligence et de conscience ? » On sait qu'Alan Turing l'a proposé en 1950 pour répondre à la question : « Les machines peuvent-elles penser ? » Cependant, Turing a en réalité reformulé la question elle-même en : « Les machines peuvent-elles se comporter comme les humains ? » lors de la conception de l'expérience. Le test consiste à faire poser des questions à un humain et à une IA par un juge, puis à déterminer quelles réponses sont les plus humaines. Dans le test de Turing, diverses méthodes peuvent être utilisées pour tromper le juge ; il est notamment permis de ralentir les temps de réponse ou de poursuivre la conversation sous forme de chat. De plus, le test est considéré comme réussi si l'IA parvient à tromper environ 30 % des juges dans le cadre et sur le sujet limités de la discussion.
Je me suis demandé si le test de Turing, avec ces conditions et règles, constituait réellement une mesure appropriée pour évaluer l'intelligence artificielle. Autrement dit, je pense que le test de Turing n'est pas adapté à l'évaluation de l'IA. Pour étayer ce point de vue, je présenterai trois arguments et proposerai le « test de Turing inversé » comme solution. Auparavant, il est toutefois nécessaire d'examiner d'autres exemples notables d'IA ayant réussi le test de Turing, outre « Eugene Goostman ».
ELIZA, développé par Joseph Weizenbaum en 1966, est l'exemple le plus connu des premiers programmes de dialogue en langage naturel. Cette intelligence artificielle était conçue pour identifier les mots-clés dans les phrases saisies et fournir des réponses correspondantes ; si aucun mot-clé pertinent n'était trouvé, elle répétait les mots de l'utilisateur ou fournissait une réponse générique.
Il y a aussi « PARRY », développé par Kenneth Colby en 1972. Cette IA a été conçue sur le modèle du style conversationnel d'un patient paranoïaque, et des expériences ont même été menées au cours desquelles plusieurs psychiatres ont tenté de distinguer de vrais patients de PARRY.
À partir de maintenant, j'examinerai pourquoi le test de Turing n'est pas une norme appropriée pour évaluer l'IA.
Premièrement, le test de Turing n'évalue pas précisément l'intelligence elle-même. Autrement dit, au lieu d'évaluer la capacité de réflexion d'une IA, ce test détermine, par le biais de la conversation, si elle se comporte comme un humain. Cela pose deux problèmes.
Premièrement, tous les humains ne se comportent pas toujours intelligemment. Ici, « intelligent » désigne une activité intellectuelle impliquant la compréhension d'un phénomène ou d'un objet et son traitement rationnel. De plus, selon l'article d'Alan Turing, certaines capacités intellectuelles de l'IA peuvent se manifester différemment de celles des humains. Autrement dit, si une IA résout un problème insoluble pour les humains, l'évaluateur est plus susceptible de se rendre compte qu'il s'agit d'un ordinateur. En définitive, le test de Turing ne permet pas d'évaluer correctement les formes d'intelligence qui surpassent les capacités humaines.
Deuxièmement, les critères d'évaluation du test de Turing sont subjectifs et les conditions expérimentales sont excessivement restrictives. Autrement dit, les résultats du test peuvent être fortement influencés par l'attitude, l'expérience, les compétences et les connaissances de l'évaluateur plutôt que par le niveau d'intelligence réel de l'IA, ce qui rend difficile de garantir l'objectivité.
En définitive, l'entité qui détermine si une chose est une IA ou un humain est une personne ; il est donc difficile d'éliminer complètement la subjectivité de l'évaluateur. De plus, les questions posées dans le délai imparti d'environ cinq minutes sont très restrictives. Tant que l'évaluateur est humain, il existe toujours un risque d'influence de facteurs externes.
De plus, la plupart des IA participant au test de Turing sont modélisées d'après des humains confrontés à des situations ou des caractéristiques spécifiques. Par conséquent, même si une IA réussit le test, il est difficile de conclure qu'elle se comporte comme un humain en général. Par exemple, « Eugene Goostman », présenté précédemment, a été développé en partant du principe qu'il s'agissait d'un garçon de 13 ans vivant en Ukraine. Il s'agissait d'une tentative délibérée de créer une situation où même un anglais quelque peu maladroit serait perçu comme naturel. « PARRY » a été modélisé d'après un patient paranoïaque, et « ELIZA » a été conçu pour imiter une conseillère psychologique professionnelle.
Ainsi, lorsqu'une IA est programmée pour représenter un humain doté de caractéristiques spécifiques et qu'une conversation est engagée, les juges l'évaluent en tenant compte de ces caractéristiques. Par exemple, même si une réponse quelque peu étrange survient lors d'une conversation avec une IA programmée pour représenter une personne atteinte de maladie mentale, les juges sont susceptibles de l'accepter comme une réaction naturelle et cohérente avec cette caractérisation. Autrement dit, bien que les juges soient censés évaluer sans parti pris, ils sont en réalité placés dans un environnement où cela s'avère difficile.
Bien sûr, les personnes atteintes de troubles mentaux sont capables de penser. Cependant, le fait qu'une IA conçue d'après une personne atteinte de maladie mentale réussisse le test de Turing ne signifie pas qu'elle pense de manière plus « humaine » qu'un humain. Pour rester fidèle à la question posée par Alan Turing – « Une machine peut-elle se comporter comme un humain ? » – le test doit être conçu à partir de situations générales que la majorité des gens peuvent accepter.
Troisièmement, l'IA peut réussir le test de Turing simplement en manipulant des symboles, sans même comprendre le contenu. « ELIZA » en est un parfait exemple. Pour qu'une personne puisse réfléchir à un sujet, elle doit le comprendre et porter des jugements fondés sur son expérience. C'est pourquoi le philosophe John Searle a également soutenu que le test de Turing, à lui seul, ne peut prouver si une machine pense réellement.
De plus, comme l'intelligence artificielle fonctionne selon des algorithmes prédéterminés, elle peut facilement révéler des erreurs face à des situations inattendues. L'exemple suivant illustre ce phénomène.
Interlocuteur : Soutenez-vous toujours Bill Clinton ?
Juge : Je n'ai jamais rencontré Clinton.
Interlocuteur : Vous n’aimez vraiment pas Bill Clinton. Du moins, cela se voit. À mon avis, la plupart des gens semblent tout simplement désintéressés ou n’y ont pas vraiment réfléchi jusqu’à présent.
Juge : Avez-vous vu « Le Martien » ?
Interlocuteur : Du calme. Je ne suis pas là pour répondre à des questions idiotes. Ce n’est pas ça. De quoi parlions-nous déjà ? Bien. Ce que vous venez de dire signifie-t-il que les problèmes sous-jacents – comme l’affaire Whitewater et le procureur spécial – sont graves ?
Cette conversation a lieu entre un juge et « Catherine », une intelligence artificielle conçue pour poursuivre un dialogue basé sur des informations préprogrammées concernant des événements ayant fait l'actualité la veille du test de Turing. Si le juge avait continué la conversation politique relative à Bill Clinton, le dialogue serait resté tout à fait naturel. Cependant, lorsque le juge a soudainement abordé un autre sujet, l'IA n'a pas pu gérer correctement ce nouveau thème et a révélé l'erreur mentionnée ci-dessus.
Ainsi, on ne peut conclure qu'une IA se comporte comme un humain simplement parce qu'elle est capable d'un certain niveau de communication. Bien qu'elle puisse sembler tenir une conversation humaine en apparence, elle ne comprend pas réellement le contenu, mais se contente de répondre de manière à paraître humaine. Par conséquent, elle ne correspond pas au concept d'« intelligence » tel que défini précédemment. Le test de Turing actuel, qui valide les systèmes d'IA se contentant d'imiter le comportement humain sans en comprendre réellement le sens, présente des limites évidentes.
En évaluant l'IA par comparaison avec l'humain, le test de Turing constitue une expérience pertinente qui explore la frontière entre l'humain et l'IA. Considérant que l'être humain lui-même ne peut définir clairement l'essence de la pensée ou de l'esprit, cette tentative revêt une importance considérable. Par ailleurs, l'IA fonctionnant selon des structures et des principes relativement simples, il est possible de la mesurer et de l'analyser dans une certaine mesure, même si cette analyse n'est pas parfaite.
Cependant, le test de Turing ne permet pas d'évaluer l'intelligence avec précision, et ses critères d'évaluation sont par ailleurs trop subjectifs. Un examen plus approfondi du processus de test révèle qu'il est difficile de le considérer comme un environnement capable d'évaluer de manière exhaustive l'intelligence d'une IA. Même si plusieurs juges participent et qu'une institution supervise le processus d'évaluation, le nombre d'évaluateurs reste limité, et il est difficile de parvenir à une conclusion objective qui prenne en compte toutes les variables. Par conséquent, il existe des limites fondamentales à l'obtention d'un résultat parfait et universellement acceptable.
Le test de Turing revêt une importance considérable car il a démontré que l'IA peut, dans une certaine mesure, reproduire des capacités cognitives autrefois considérées comme propres à l'humain. Par conséquent, plutôt que de rejeter complètement ce test, il est nécessaire d'établir des critères et des procédures d'évaluation plus précis et plus acceptables pour un public plus large que ceux actuellement utilisés.
À cet égard, je propose le « test de Turing inversé » comme alternative. Dans ce test, l’évaluateur est un ordinateur et non un humain. Autrement dit, il s’agit d’une méthode où un ordinateur évalue un humain ou un autre ordinateur lors d’une interaction. Intégrer cette approche aux tests existants permettrait de réduire le problème de la subjectivité humaine et de mener les évaluations dans un environnement plus objectif. Bien entendu, le fait que l’évaluateur soit une IA soulève également de nouvelles questions.
Quel que soit le sujet, les tests d'évaluation et de jugement ont peu de chances de satisfaire tout le monde, et il est difficile d'établir des critères parfaits et universellement acceptables. Il est donc impératif de rechercher constamment des moyens de les améliorer. En particulier, le test de Turing étant une méthode d'évaluation cruciale susceptible d'influencer considérablement l'avenir de l'industrie et l'orientation du développement de l'intelligence artificielle, il doit évoluer vers une forme plus efficace et plus fiable.
Aujourd'hui, l'IA progresse à un rythme sans précédent et est déjà omniprésente dans notre quotidien. Pour évaluer une telle IA, il ne faut pas se limiter à sa capacité à tromper les humains, mais plutôt apprécier son aptitude à comprendre le sens, à saisir le contexte et à communiquer naturellement dans diverses situations. Bien entendu, comme il ne s'agit pas d'un domaine aux « réponses correctes » clairement définies, à l'instar d'un problème mathématique, établir des critères objectifs s'avère complexe. Néanmoins, pour évaluer une IA destinée à coexister avec les humains à l'avenir, le test de Turing doit évoluer afin de prendre pleinement en compte les facteurs éthiques et la capacité à communiquer efficacement.