O Teste de Turing pode realmente avaliar a Inteligência Artificial?

Neste artigo, vamos analisar se o Teste de Turing é um padrão adequado para avaliar a inteligência artificial e explorar suas limitações e áreas potenciais de melhoria.

 

Em 2014, a notícia de que "Eugene Goostman", um chatbot criado por desenvolvedores russos, havia passado no Teste de Turing chocou e confundiu muita gente. Isso demonstrou claramente que a inteligência artificial não é mais apenas um produto de uma sociedade futura imaginária, vista somente em filmes de ficção científica. A IA já está profundamente enraizada em nossas vidas e avança em ritmo acelerado, em consonância com a "Lei dos Retornos Acelerados" de Ray Kurzweil. No entanto, não podemos simplesmente ficar de braços cruzados enquanto a IA, que evolui num piscar de olhos, se consolida na sociedade. Precisamos determinar se a IA realmente consegue pensar como os humanos e também considerar a direção que ela deve seguir no futuro.
Essas questões estão ligadas ao Teste de Turing. O Teste de Turing é um método de avaliação que surgiu da pergunta: "É possível criar um computador que possamos dizer que possui inteligência e mente?". É sabido que Alan Turing o propôs em 1950 para responder à pergunta: "As máquinas podem pensar?". No entanto, Turing reformulou a própria pergunta para "As máquinas podem se comportar da mesma maneira que os humanos?" ao projetar o experimento. O teste é conduzido por um juiz que faz perguntas tanto a um humano quanto a uma IA, determinando quais respostas são mais semelhantes às humanas. No Teste de Turing, vários métodos podem ser usados ​​para enganar o juiz, sendo permitido diminuir o tempo de resposta ou continuar a conversa em um formato semelhante a um bate-papo. Além disso, o teste é considerado aprovado se a IA conseguir enganar aproximadamente 30% dos juízes dentro do escopo e tópico limitados da discussão.
Questiono se um Teste de Turing com essas condições e regras é realmente uma medida apropriada para avaliar a inteligência artificial. Em outras palavras, acredito que o Teste de Turing não é adequado para avaliar IA. Para sustentar essa visão, apresentarei três argumentos e proporei o "Teste de Turing Reverso" como solução. Antes disso, porém, é necessário examinar outros exemplos notáveis ​​de IA que passaram no Teste de Turing, além de "Eugene Goostman".
"ELIZA", desenvolvida por Joseph Weizenbaum em 1966, é o exemplo mais conhecido entre os primeiros programas de diálogo em linguagem natural. Essa IA foi projetada para identificar palavras-chave em frases inseridas e retornar respostas correspondentes; caso nenhuma palavra-chave apropriada fosse encontrada, ela repetiria as palavras do usuário ou forneceria uma resposta genérica.
Existe também o “PARRY”, desenvolvido por Kenneth Colby em 1972. Essa IA foi modelada a partir do estilo de conversa de um paciente paranoico, e experimentos foram até mesmo conduzidos nos quais vários psiquiatras tentaram distinguir entre pacientes reais e o PARRY.
A partir daqui, analisarei por que o Teste de Turing não é um padrão adequado para avaliar a IA.
Primeiro, o Teste de Turing não avalia com precisão a inteligência em si. Em outras palavras, em vez de avaliar a inteligência artificial, esse teste determina, por meio de conversação, se ela se comporta como um humano. Há dois problemas com isso.
Primeiramente, nem todos os humanos se comportam de maneira inteligente o tempo todo. Aqui, "inteligente" se refere à atividade intelectual que envolve a compreensão de um fenômeno ou objeto e seu processamento racional. Além disso, de acordo com o artigo de Alan Turing, algumas habilidades intelectuais da IA ​​podem se manifestar de maneiras diferentes das dos humanos. Simplificando, se uma IA resolve um problema que os humanos não conseguem, o avaliador tem maior probabilidade de perceber que a outra parte é um computador. Em última análise, o Teste de Turing falha em avaliar adequadamente formas de inteligência que superam as capacidades humanas.
Em segundo lugar, os critérios de avaliação do Teste de Turing são subjetivos e as condições experimentais são excessivamente restritivas. Em outras palavras, os resultados do teste podem ser significativamente influenciados pela atitude, experiência, habilidades e conhecimento do avaliador, em vez do nível real de inteligência da IA, o que dificulta garantir a objetividade.

Em última análise, a entidade que determina se algo é uma IA ou um humano é uma pessoa, portanto é difícil eliminar completamente a subjetividade do avaliador. Além disso, as perguntas feitas dentro do limite de tempo de cerca de cinco minutos também são bastante restritas. Enquanto o avaliador for humano, sempre haverá a possibilidade de ser influenciado por diversos fatores externos.
Além disso, a maioria das IAs participantes do Teste de Turing são modeladas a partir de humanos com situações ou características específicas. Portanto, mesmo que uma IA passe no teste, é difícil concluir que ela se comporta da mesma maneira que os humanos em geral. Por exemplo, "Eugene Goostman", apresentado anteriormente, foi desenvolvido com a premissa de que se tratava de um menino de 13 anos que vivia na Ucrânia. Essa foi uma tentativa deliberada de criar uma situação em que até mesmo um inglês um tanto desajeitado fosse aceito como natural. "PARRY" foi modelado a partir de um paciente paranoico e "ELIZA" foi projetada para imitar uma psicóloga profissional.
Dessa forma, quando uma IA é configurada para representar um ser humano com características específicas e, em seguida, envolvida em uma conversa, os juízes a avaliam levando em consideração essas características. Por exemplo, mesmo que uma resposta um tanto estranha surja durante uma conversa com uma IA programada para representar uma pessoa com doença mental, os juízes provavelmente a aceitarão como uma reação natural, consistente com essa caracterização. Em outras palavras, embora os juízes devam avaliar sem viés, na realidade, eles se encontram em um ambiente onde isso é difícil.
É claro que pessoas com doenças mentais são capazes de pensar. No entanto, o simples fato de uma IA modelada a partir de uma pessoa com doença mental passar no Teste de Turing não significa que ela pense de forma mais "humana" do que um ser humano. Para se manter fiel à questão levantada por Alan Turing — "Uma máquina pode se comportar como um ser humano?" — o teste deve ser elaborado com base em situações gerais que a maioria das pessoas possa aceitar.
Em terceiro lugar, a IA pode passar no Teste de Turing simplesmente manipulando símbolos, em vez de realmente compreender o conteúdo. Um excelente exemplo disso é o sistema "ELIZA". Para que uma pessoa pense sobre um tópico, ela precisa compreendê-lo e fazer julgamentos com base em experiências relevantes. Por essa razão, o filósofo John Searle também argumentou que o Teste de Turing, por si só, não pode provar se uma máquina está realmente pensando.
Além disso, como a inteligência artificial opera de acordo com algoritmos predeterminados, ela pode facilmente detectar erros quando confrontada com situações inesperadas. O exemplo a seguir ilustra isso.
Interlocutor: Você ainda apoia Bill Clinton?
Juiz: Nunca conheci Clinton.
Interlocutor: Você realmente não gosta do Bill Clinton. Pelo menos, é evidente que você não gosta dele. Na minha opinião, parece que a maioria das pessoas simplesmente não se interessou ou não refletiu muito sobre o assunto até agora.
Juiz: Você já viu 'Perdido em Marte'?
Interlocutor: Vamos com calma. Não estou aqui para responder perguntas idiotas. Não é isso. Do que estávamos falando mesmo? Certo. O que você acabou de dizer significa que as questões subjacentes — como o caso Whitewater e o procurador especial — são sérias?
Esta conversa ocorre entre um juiz e "Catherine", uma IA projetada para manter um diálogo com base em informações pré-programadas sobre eventos que se tornaram notícia no dia anterior à realização do Teste de Turing. Se o juiz tivesse continuado a conversa política relacionada a Bill Clinton, o diálogo poderia ter transcorrido de forma bastante natural. No entanto, quando o juiz mudou repentinamente de assunto, a IA não conseguiu lidar adequadamente com o tema não programado e apresentou o erro mostrado acima.
Assim, não podemos concluir que uma IA se comporta como um humano simplesmente por ser capaz de um certo nível de comunicação. Embora possa parecer que ela se envolve em uma conversa semelhante à humana superficialmente, na verdade não está compreendendo o conteúdo, mas apenas respondendo de uma maneira que a faz parecer humana. Portanto, ela fica aquém do conceito de "inteligência" conforme definido anteriormente. O atual Teste de Turing, que aprova sistemas de IA que apenas imitam o comportamento humano sem realmente compreender o significado, tem limitações claras.
Ao avaliar a IA comparando-a com os humanos, o Teste de Turing é um experimento significativo que explora a fronteira entre humanos e IA. Considerando que os próprios humanos não conseguem definir claramente a essência do pensamento ou da mente, essa tentativa em si já possui um valor considerável. Por outro lado, como a IA opera com base em estruturas e princípios relativamente simples, é possível medi-la e analisá-la até certo ponto, ainda que não perfeitamente.
No entanto, o Teste de Turing não consegue avaliar a inteligência com precisão, e seus critérios de avaliação são excessivamente subjetivos. Uma análise mais detalhada do processo de teste revela que é difícil considerá-lo um ambiente capaz de avaliar de forma abrangente a inteligência de uma IA. Mesmo com a participação de vários avaliadores e a supervisão de uma instituição, o número de avaliadores é limitado, e não é fácil chegar a uma conclusão objetiva que leve em conta todas as variáveis. Portanto, existem limitações fundamentais para se obter um resultado perfeito que seja universalmente aceitável.
O Teste de Turing possui grande importância, pois demonstrou que a IA pode, até certo ponto, replicar habilidades cognitivas antes consideradas exclusivas dos humanos. Portanto, em vez de descartar completamente esse teste, é necessário estabelecer critérios e procedimentos de avaliação mais precisos e aceitáveis ​​para um público mais amplo do que os atualmente em uso.
Nesse sentido, gostaria de propor o “Teste de Turing Reverso” como uma alternativa. No Teste de Turing Reverso, o avaliador é um computador, e não um humano. Em outras palavras, trata-se de um método no qual um computador avalia um humano ou outro computador durante a interação. A introdução dessa abordagem em testes existentes reduziria o problema da subjetividade humana e permitiria que as avaliações fossem conduzidas em um ambiente mais objetivo. É claro que o fato de o avaliador ser uma IA também levanta a possibilidade de novos problemas.
Independentemente do assunto, testes concebidos para avaliação e julgamento dificilmente satisfarão a todos, e não é fácil estabelecer critérios perfeitos que sejam aceitáveis ​​por todos. Portanto, devemos explorar continuamente maneiras de aprimorá-los. Em particular, visto que o Teste de Turing é um método de avaliação crucial que pode influenciar significativamente o futuro da indústria e a direção do desenvolvimento da tecnologia de IA, ele deve evoluir para uma forma mais eficiente e confiável.
Hoje, a IA avança a um ritmo incomparável ao do passado e já está sendo utilizada em todos os aspectos de nossas vidas diárias. Ao avaliar essa IA, não devemos julgá-la apenas por sua capacidade de enganar humanos, mas sim por sua habilidade de compreender significados, captar contexto e se comunicar naturalmente em diversas situações. É claro que, como este não é um campo com "respostas corretas" claramente definidas, como um problema de matemática, estabelecer critérios objetivos não é fácil. No entanto, para avaliar a IA que coexistirá com humanos no futuro, o Teste de Turing precisa evoluir para considerar de forma abrangente fatores éticos e a capacidade de comunicação eficaz.

 

Sobre o autor