In questo post del blog, esamineremo se il Test di Turing sia uno standard adeguato per valutare l'intelligenza dell'intelligenza artificiale ed esploreremo i suoi limiti e le potenziali aree di miglioramento.
Nel 2014, la notizia che "Eugene Goostman", un chatbot creato da sviluppatori russi, avesse superato il test di Turing ha destato stupore e confusione in molti. Si è trattato di una chiara dimostrazione del fatto che l'intelligenza artificiale non è più un prodotto di una società futura immaginaria, vista solo nei film di fantascienza. L'IA è già profondamente radicata nelle nostre vite e sta progredendo a un ritmo rapidissimo, in linea con la "Legge dei rendimenti accelerati" di Ray Kurzweil. Tuttavia, non possiamo semplicemente restare a guardare mentre l'IA, che si evolve alla velocità della luce, si afferma nella società. Dobbiamo stabilire se l'IA sia effettivamente in grado di pensare come gli esseri umani e dobbiamo anche considerare la direzione in cui dovrebbe svilupparsi in futuro.
Queste problematiche sono legate al Test di Turing. Il Test di Turing è un metodo di valutazione che ha origine dalla domanda: "È possibile creare un computer che possiamo definire dotato di intelligenza e di una mente?". È noto che Alan Turing lo propose nel 1950 per rispondere alla domanda: "Le macchine possono pensare?". Tuttavia, Turing riformulò la domanda stessa in "Le macchine possono comportarsi come gli esseri umani?" quando progettò l'esperimento. Il test viene condotto ponendo delle domande a un essere umano e a un'intelligenza artificiale, e determinando poi quali risposte siano più simili a quelle umane. Nel Test di Turing, è possibile utilizzare diversi metodi per ingannare il giudice, ed è consentito rallentare i tempi di risposta o continuare la conversazione in un formato simile a una chat. Inoltre, il test è considerato superato se l'intelligenza artificiale riesce a ingannare circa il 30% dei giudici, entro i limiti dell'argomento e della portata della discussione.
Ho messo in dubbio che un test di Turing con queste condizioni e regole sia davvero una misura appropriata per valutare l'intelligenza artificiale. In altre parole, credo che il test di Turing non sia adatto a valutare l'IA. A sostegno di questa tesi, presenterò tre argomenti e proporrò il "Test di Turing inverso" come soluzione. Prima di farlo, tuttavia, è necessario esaminare altri esempi notevoli di IA che hanno superato il test di Turing, oltre a "Eugene Goostman".
“ELIZA”, sviluppata da Joseph Weizenbaum nel 1966, è l'esempio più noto tra i primi programmi di dialogo in linguaggio naturale. Questa intelligenza artificiale era progettata per identificare le parole chiave nelle frasi di input e restituire risposte corrispondenti; se non venivano trovate parole chiave appropriate, ripeteva le parole dell'utente o forniva una risposta generica.
Esiste anche "PARRY", sviluppato da Kenneth Colby nel 1972. Questa intelligenza artificiale è stata modellata sullo stile di conversazione di un paziente paranoico, e sono stati persino condotti esperimenti in cui diversi psichiatri hanno tentato di distinguere tra pazienti reali e PARRY.
Da qui in avanti, esaminerò perché il test di Turing non è uno standard adatto per valutare l'intelligenza artificiale.
Innanzitutto, il test di Turing non valuta accuratamente l'intelligenza in sé. In altre parole, anziché valutare quanto intelligentemente un'IA pensi, questo test determina, attraverso la conversazione, se si comporta come un essere umano. Ciò presenta due problemi.
Innanzitutto, non tutti gli esseri umani si comportano sempre in modo intelligente. In questo contesto, "intelligente" si riferisce a un'attività intellettuale che implica la comprensione di un fenomeno o di un oggetto e la sua elaborazione razionale. Inoltre, secondo l'articolo di Alan Turing, alcune capacità intellettuali dell'IA possono manifestarsi in modi diversi da quelli umani. In parole semplici, se un'IA risolve un problema che gli esseri umani non riescono a risolvere, è più probabile che chi la valuta si renda conto che l'altra parte è un computer. In definitiva, il Test di Turing non riesce a valutare correttamente le forme di intelligenza che superano le capacità umane.
In secondo luogo, i criteri di valutazione del Test di Turing sono soggettivi e le condizioni sperimentali sono eccessivamente restrittive. In altre parole, i risultati del test possono essere influenzati in modo significativo dall'atteggiamento, dall'esperienza, dalle competenze e dalle conoscenze del valutatore, piuttosto che dal livello effettivo di intelligenza dell'IA, rendendo difficile garantire l'obiettività.
In definitiva, l'entità che determina se qualcosa è un'IA o un essere umano è una persona, quindi è difficile eliminare completamente la soggettività del valutatore. Inoltre, le domande poste nel lasso di tempo limitato di circa cinque minuti sono anch'esse molto circoscritte. Finché il valutatore è umano, esiste sempre la possibilità che venga influenzato da vari fattori esterni.
Inoltre, la maggior parte delle IA che partecipano al Test di Turing sono modellate su esseri umani con situazioni o caratteristiche specifiche. Pertanto, anche se un'IA supera il test, è difficile concludere che si comporti allo stesso modo degli esseri umani in generale. Ad esempio, "Eugene Goostman", presentato in precedenza, è stato sviluppato partendo dal presupposto che fosse un ragazzo di 13 anni che vive in Ucraina. Questo è stato un tentativo deliberato di creare una situazione in cui anche un inglese un po' goffo sarebbe stato accettato come naturale. "PARRY" è stato modellato su un paziente paranoico, e "ELIZA" è stato progettato per imitare uno psicologo professionista.
In questo modo, quando un'IA viene programmata per rappresentare un essere umano con caratteristiche specifiche e poi impegnata in una conversazione, i giudici la valutano tenendo conto di tali caratteristiche. Ad esempio, anche se durante una conversazione con un'IA programmata per rappresentare una persona con una malattia mentale emerge una risposta alquanto strana, è probabile che i giudici la accettino come una reazione naturale coerente con tale caratterizzazione. In altre parole, sebbene i giudici dovrebbero valutare senza pregiudizi, in realtà si trovano in un contesto in cui ciò risulta difficile.
Certo, le persone con disturbi mentali sono capaci di pensare. Tuttavia, il fatto che un'intelligenza artificiale modellata su una persona con un disturbo mentale superi il test di Turing non significa che pensi in modo più "umano" di un essere umano. Per rimanere fedeli alla domanda posta da Alan Turing – "Una macchina può comportarsi come un essere umano?" – il test deve essere progettato sulla base di situazioni generali che la maggior parte delle persone può accettare.
In terzo luogo, l'IA può superare il test di Turing semplicemente manipolando simboli, anziché comprenderne effettivamente il contenuto. Un esempio lampante è "ELIZA". Affinché una persona possa riflettere su un argomento, deve prima comprenderlo ed esprimere giudizi basandosi su esperienze pertinenti. Per questo motivo, il filosofo John Searle ha sostenuto che il test di Turing da solo non è sufficiente a dimostrare se una macchina stia effettivamente pensando.
Inoltre, poiché l'intelligenza artificiale opera secondo algoritmi predeterminati, può facilmente rivelare errori quando si trova di fronte a situazioni impreviste. Il seguente esempio illustra questo concetto.
Interlocutore: Sostieni ancora Bill Clinton?
Giudice: Non ho mai incontrato Clinton.
Interlocutore: Tu proprio non sopporti Bill Clinton. O almeno, è evidente che non ti piace. A mio parere, la maggior parte delle persone sembra semplicemente disinteressata o non ci ha riflettuto molto finora.
Giudice: Hai visto 'The Martian'?
Interlocutore: Andiamo con calma. Non sono qui per rispondere a domande stupide. Non è questo il punto. Di cosa stavamo parlando? Giusto. Quello che ha appena detto significa che le questioni di fondo, come Whitewater e il procuratore speciale, sono serie?
Questa conversazione si svolge tra un giudice e "Catherine", un'intelligenza artificiale progettata per proseguire un dialogo basato su informazioni pre-programmate riguardanti eventi di attualità del giorno precedente al test di Turing. Se il giudice avesse continuato la conversazione politica relativa a Bill Clinton, il dialogo sarebbe potuto rimanere del tutto naturale. Tuttavia, quando il giudice ha improvvisamente cambiato argomento, l'IA non è stata in grado di gestire correttamente il tema non programmato, rivelando l'errore mostrato sopra.
Pertanto, non possiamo concludere che un'IA si comporti come un essere umano semplicemente perché è in grado di comunicare a un certo livello. Sebbene in superficie possa sembrare impegnata in una conversazione simile a quella umana, in realtà non comprende il contenuto, ma si limita a rispondere in un modo che la fa apparire umana. Di conseguenza, non soddisfa il concetto di "intelligenza" come definito in precedenza. L'attuale Test di Turing, che approva i sistemi di IA che si limitano a imitare il comportamento umano senza comprenderne realmente il significato, presenta evidenti limiti.
Il test di Turing, valutando l'intelligenza artificiale attraverso un confronto con gli esseri umani, rappresenta un esperimento significativo che esplora il confine tra uomo e IA. Considerando che gli esseri umani stessi non sono in grado di definire con precisione l'essenza del pensiero o della mente, questo tentativo riveste di per sé un valore considerevole. D'altro canto, poiché l'IA opera sulla base di strutture e principi relativamente semplici, è possibile misurarla e analizzarla entro certi limiti, seppur non in modo perfetto.
Tuttavia, il Test di Turing non riesce a valutare l'intelligenza in modo accurato e i suoi criteri di valutazione sono eccessivamente soggettivi. Un'analisi più approfondita del processo di test rivela che è difficile considerarlo un ambiente in grado di valutare in modo esaustivo l'intelligenza di un'IA. Anche se partecipano più giudici e un'istituzione supervisiona il processo di valutazione, il numero di valutatori è limitato e non è facile giungere a una conclusione oggettiva che tenga conto di tutte le variabili. Pertanto, esistono limiti fondamentali all'ottenimento di un risultato perfetto e universalmente accettato.
Il test di Turing riveste una notevole importanza in quanto ha dimostrato che l'intelligenza artificiale può, entro certi limiti, replicare le capacità cognitive un tempo considerate esclusive degli esseri umani. Pertanto, anziché scartare completamente questo test, è necessario stabilire criteri e procedure di valutazione più accurati e accettabili per un pubblico più ampio rispetto a quelli attualmente in uso.
A questo proposito, vorrei proporre il "Test di Turing inverso" come alternativa. Nel Test di Turing inverso, il valutatore è un computer anziché un essere umano. In altre parole, è un metodo in cui un computer valuta un essere umano o un altro computer interagendo con esso. Introdurre questo approccio nei test esistenti ridurrebbe il problema della soggettività umana e consentirebbe di condurre valutazioni in un ambiente più obiettivo. Naturalmente, il fatto che il valutatore sia un'intelligenza artificiale solleva anche la possibilità di nuove problematiche.
Indipendentemente dall'argomento, è improbabile che i test progettati per la valutazione e il giudizio soddisfino tutti, ed è difficile stabilire criteri perfetti che siano universalmente accettabili. Pertanto, dobbiamo continuamente esplorare modi per migliorarli. In particolare, poiché il Test di Turing è un metodo di valutazione cruciale che potrebbe influenzare significativamente il futuro dell'industria e la direzione dello sviluppo della tecnologia dell'IA, deve evolversi in una forma più efficiente e affidabile.
Oggi, l'intelligenza artificiale (IA) sta progredendo a un ritmo incomparabile rispetto al passato ed è già utilizzata in ogni aspetto della nostra vita quotidiana. Nel valutare tale IA, non dovremmo giudicarla unicamente in base alla sua capacità di ingannare gli esseri umani, ma piuttosto valutarne la capacità di comprendere il significato, cogliere il contesto e comunicare in modo naturale in una varietà di situazioni. Naturalmente, poiché questo non è un campo con "risposte corrette" chiaramente definite come un problema di matematica, stabilire criteri oggettivi non è semplice. Tuttavia, per valutare l'IA che coesisterà con gli esseri umani in futuro, il Test di Turing deve evolversi per considerare in modo esaustivo i fattori etici e la capacità di comunicare efficacemente.