Apakah Uji Turing Benar-Benar Dapat Mengevaluasi Kecerdasan Buatan?

Dalam postingan blog ini, kita akan meneliti apakah Tes Turing merupakan standar yang tepat untuk mengevaluasi kecerdasan kecerdasan buatan, dan mengeksplorasi keterbatasannya serta potensi area untuk perbaikan.

 

Pada tahun 2014, berita bahwa “Eugene Goostman,” sebuah chatbot yang diciptakan oleh pengembang Rusia, telah lulus Uji Turing mengejutkan dan menimbulkan kebingungan bagi banyak orang. Ini merupakan demonstrasi yang jelas bahwa kecerdasan buatan bukan lagi sekadar produk dari masyarakat masa depan imajiner yang hanya terlihat dalam film fiksi ilmiah. AI telah tertanam dalam kehidupan kita dan berkembang dengan pesat, sejalan dengan “Hukum Pengembalian yang Dipercepat” Ray Kurzweil. Namun, kita tidak bisa hanya berdiam diri dan menyaksikan AI, yang berevolusi dalam sekejap mata, menjadi mapan dalam masyarakat. Kita perlu menentukan apakah AI memang dapat berpikir seperti manusia, dan kita juga harus mempertimbangkan arah perkembangannya di masa depan.
Isu-isu ini terkait dengan Tes Turing. Tes Turing adalah metode evaluasi yang berasal dari pertanyaan: “Apakah mungkin untuk menciptakan komputer yang dapat kita katakan memiliki kecerdasan dan pikiran?” Umumnya diketahui bahwa Alan Turing mengusulkannya pada tahun 1950 untuk menjawab pertanyaan, “Bisakah mesin berpikir?” Namun, Turing sebenarnya merumuskan kembali pertanyaan itu sendiri sebagai “Bisakah mesin berperilaku dengan cara yang sama seperti manusia?” ketika merancang eksperimen tersebut. Tes ini dilakukan dengan meminta seorang juri mengajukan pertanyaan kepada manusia dan AI, kemudian menentukan respons siapa yang lebih mirip manusia. Dalam Tes Turing, berbagai metode dapat digunakan untuk menipu juri, dan diperbolehkan untuk memperlambat waktu respons atau melanjutkan percakapan dalam format seperti obrolan. Lebih lanjut, tes dianggap lulus jika AI dapat menipu sekitar 30% juri dalam lingkup dan topik diskusi yang terbatas.
Saya mempertanyakan apakah Tes Turing dengan kondisi dan aturan ini benar-benar merupakan ukuran yang tepat untuk menilai kecerdasan AI. Dengan kata lain, saya percaya Tes Turing tidak cocok untuk mengevaluasi AI. Untuk mendukung pandangan ini, saya akan menyajikan tiga argumen dan mengusulkan "Tes Turing Terbalik" sebagai solusinya. Namun, sebelum melakukannya, perlu terlebih dahulu memeriksa contoh-contoh AI terkenal lainnya yang telah lulus Tes Turing selain "Eugene Goostman."
“ELIZA,” yang dikembangkan oleh Joseph Weizenbaum pada tahun 1966, adalah contoh yang paling dikenal di antara program dialog bahasa alami awal. AI ini dirancang untuk mengidentifikasi kata kunci utama dalam kalimat masukan dan memberikan respons yang sesuai; jika tidak ditemukan kata kunci yang sesuai, ia akan mengulangi kata-kata pengguna atau memberikan jawaban umum.
Ada juga "PARRY," yang dikembangkan oleh Kenneth Colby pada tahun 1972. AI ini dimodelkan berdasarkan gaya percakapan pasien paranoid, dan bahkan dilakukan eksperimen di mana beberapa psikiater mencoba membedakan antara pasien sebenarnya dan PARRY.
Selanjutnya, saya akan mengkaji mengapa Tes Turing bukanlah standar yang tepat untuk mengevaluasi AI.
Pertama, Tes Turing tidak secara akurat menilai kecerdasan itu sendiri. Dengan kata lain, alih-alih mengevaluasi seberapa cerdas AI berpikir, tes ini menentukan melalui percakapan apakah AI tersebut berperilaku seperti manusia. Ada dua masalah dengan hal ini.
Pertama, tidak semua manusia selalu berperilaku cerdas. Di sini, "cerdas" merujuk pada aktivitas intelektual yang melibatkan pemahaman suatu fenomena atau objek dan memprosesnya secara rasional. Lebih lanjut, menurut makalah Alan Turing, beberapa kemampuan intelektual AI mungkin terwujud dengan cara yang berbeda dari manusia. Sederhananya, jika AI memecahkan masalah yang tidak dapat dipecahkan manusia, penilai sebenarnya lebih mungkin menyadari bahwa pihak lain adalah komputer. Pada akhirnya, Tes Turing gagal mengevaluasi dengan tepat bentuk-bentuk kecerdasan yang melampaui kemampuan manusia.
Kedua, kriteria evaluasi Tes Turing bersifat subjektif, dan kondisi eksperimennya terlalu ketat. Dengan kata lain, hasil tes dapat dipengaruhi secara signifikan oleh sikap, pengalaman, keterampilan, dan pengetahuan evaluator, bukan oleh tingkat kecerdasan AI yang sebenarnya, sehingga sulit untuk memastikan objektivitas.

Pada akhirnya, entitas yang menentukan apakah sesuatu itu AI atau manusia adalah seseorang, sehingga sulit untuk sepenuhnya menghilangkan subjektivitas penilai. Selain itu, pertanyaan yang diajukan dalam jangka waktu terbatas sekitar lima menit juga sangat terbatas. Selama penilai adalah manusia, selalu ada kemungkinan dipengaruhi oleh berbagai faktor eksternal.
Selain itu, sebagian besar AI yang berpartisipasi dalam Tes Turing dimodelkan berdasarkan manusia dengan situasi atau karakteristik tertentu. Oleh karena itu, meskipun sebuah AI lulus tes, sulit untuk menyimpulkan bahwa ia berperilaku dengan cara yang sama seperti manusia pada umumnya. Misalnya, "Eugene Goostman," yang diperkenalkan sebelumnya, dikembangkan dengan premis bahwa ia adalah seorang anak laki-laki berusia 13 tahun yang tinggal di Ukraina. Ini adalah upaya yang disengaja untuk menciptakan situasi di mana bahkan bahasa Inggris yang agak canggung pun akan diterima sebagai hal yang wajar. "PARRY" dimodelkan berdasarkan pasien paranoid, dan "ELIZA" dirancang untuk meniru seorang konselor psikologis profesional.
Dengan cara ini, ketika AI diatur untuk mewakili manusia dengan karakteristik tertentu dan kemudian diajak berbicara, para juri mengevaluasinya dengan mempertimbangkan karakteristik tersebut. Misalnya, meskipun respons yang agak aneh muncul saat berbicara dengan AI yang diprogram untuk mewakili seseorang dengan penyakit mental, para juri cenderung menerimanya sebagai reaksi alami yang konsisten dengan karakterisasi tersebut. Dengan kata lain, meskipun para juri seharusnya mengevaluasi tanpa bias, mereka sebenarnya ditempatkan dalam lingkungan di mana melakukan hal itu sulit.
Tentu saja, orang dengan penyakit mental mampu berpikir. Namun, hanya karena AI yang dimodelkan berdasarkan seseorang dengan penyakit mental lulus Uji Turing bukan berarti ia berpikir lebih "mirip manusia" daripada manusia. Agar tetap setia pada pertanyaan yang diajukan oleh Alan Turing—"Bisakah mesin berperilaku seperti manusia?"—tes tersebut harus dirancang berdasarkan situasi umum yang dapat diterima oleh sebagian besar orang.
Ketiga, AI dapat lulus Uji Turing hanya dengan memanipulasi simbol daripada benar-benar memahami isinya. Contoh utamanya adalah "ELIZA." Agar seseorang dapat berpikir tentang suatu topik, mereka harus memahami topik tersebut dan membuat penilaian berdasarkan pengalaman yang relevan. Karena alasan ini, filsuf John Searle juga berpendapat bahwa Uji Turing saja tidak dapat membuktikan apakah sebuah mesin benar-benar berpikir.
Selain itu, karena kecerdasan buatan beroperasi sesuai dengan algoritma yang telah ditentukan, ia dapat dengan mudah mengungkap kesalahan ketika dihadapkan pada situasi yang tidak terduga. Berikut adalah contoh yang mengilustrasikan hal ini.
Pewawancara: Apakah Anda masih mendukung Bill Clinton?
Hakim: Saya belum pernah bertemu Clinton.
Penjawab: Anda benar-benar tidak menyukai Bill Clinton. Setidaknya, jelas bahwa Anda tidak menyukainya. Menurut saya, tampaknya sebagian besar orang sama sekali tidak tertarik atau belum memikirkannya secara mendalam sejauh ini.
Hakim: Apakah Anda sudah menonton 'The Martian'?
Penjawab Pertanyaan: Tenang saja. Saya di sini bukan untuk menjawab pertanyaan bodoh. Bukan itu masalahnya. Kita tadi membicarakan apa? Baik. Apakah yang baru saja Anda katakan berarti bahwa isu-isu mendasar—seperti Whitewater dan penasihat khusus—itu serius?
Percakapan ini terjadi antara seorang hakim dan "Catherine," sebuah AI yang dirancang untuk melanjutkan dialog berdasarkan informasi yang telah diprogram sebelumnya tentang peristiwa yang menjadi berita sehari sebelum Uji Turing diadakan. Jika hakim melanjutkan percakapan politik terkait Bill Clinton, dialog tersebut bisa tetap berjalan dengan cukup alami. Namun, ketika hakim tiba-tiba mengalihkan topik ke hal lain, AI tidak mampu menangani subjek yang tidak diprogram dengan benar dan mengungkapkan kesalahan yang ditunjukkan di atas.
Dengan demikian, kita tidak dapat menyimpulkan bahwa AI berperilaku seperti manusia hanya karena mampu berkomunikasi pada tingkat tertentu. Meskipun secara permukaan tampak terlibat dalam percakapan seperti manusia, sebenarnya AI tidak memahami isinya, melainkan hanya merespons dengan cara yang membuatnya tampak seperti manusia. Oleh karena itu, AI gagal memenuhi konsep "kecerdasan" seperti yang didefinisikan sebelumnya. Uji Turing saat ini, yang meloloskan sistem AI yang hanya meniru perilaku manusia tanpa benar-benar memahami maknanya, memiliki keterbatasan yang jelas.
Karena mengevaluasi AI dengan membandingkannya dengan manusia, Tes Turing merupakan eksperimen bermakna yang mengeksplorasi batasan antara manusia dan AI. Mengingat bahwa manusia sendiri tidak dapat mendefinisikan secara jelas esensi pemikiran atau pikiran, upaya ini sendiri memiliki nilai yang signifikan. Di sisi lain, karena AI beroperasi berdasarkan struktur dan prinsip yang relatif sederhana, dimungkinkan untuk mengukur dan menganalisisnya sampai batas tertentu, meskipun tidak sempurna.
Namun, Tes Turing gagal menilai kecerdasan secara akurat, dan kriteria evaluasinya juga terlalu subjektif. Pengamatan lebih dekat pada proses pengujian sebenarnya mengungkapkan bahwa sulit untuk menganggapnya sebagai lingkungan yang mampu mengevaluasi kecerdasan AI secara komprehensif. Bahkan jika banyak juri berpartisipasi dan sebuah lembaga mengawasi proses evaluasi, jumlah evaluator terbatas, dan tidak mudah untuk mencapai kesimpulan objektif yang mempertimbangkan semua variabel. Oleh karena itu, terdapat keterbatasan mendasar untuk mendapatkan hasil sempurna yang dapat diterima semua orang.
Uji Turing memiliki arti penting karena menunjukkan bahwa AI, sampai batas tertentu, dapat meniru kemampuan kognitif yang dulunya dianggap unik bagi manusia. Oleh karena itu, daripada sepenuhnya mengabaikan uji ini, perlu ditetapkan kriteria dan prosedur evaluasi yang lebih akurat dan dapat diterima oleh khalayak yang lebih luas daripada yang saat ini digunakan.
Dalam hal ini, saya ingin mengusulkan "Tes Turing Terbalik" sebagai alternatif. Dalam Tes Turing Terbalik, evaluatornya adalah komputer, bukan manusia. Dengan kata lain, ini adalah metode di mana komputer mengevaluasi manusia atau komputer lain sambil berinteraksi dengannya. Memperkenalkan pendekatan ini ke dalam tes yang ada akan mengurangi masalah subjektivitas manusia dan memungkinkan evaluasi dilakukan dalam lingkungan yang lebih objektif. Tentu saja, fakta bahwa evaluatornya adalah AI juga menimbulkan kemungkinan masalah baru.
Terlepas dari subjeknya, tes yang dirancang untuk evaluasi dan penilaian cenderung tidak memuaskan semua orang, dan tidak mudah untuk menetapkan kriteria sempurna yang dapat diterima semua orang. Oleh karena itu, kita harus terus mengeksplorasi cara untuk memperbaikinya. Secara khusus, karena Tes Turing adalah metode evaluasi penting yang dapat secara signifikan memengaruhi masa depan industri dan arah pengembangan teknologi AI, tes ini harus berevolusi menjadi bentuk yang lebih efisien dan andal.
Saat ini, AI berkembang dengan kecepatan yang tak tertandingi di masa lalu dan sudah digunakan dalam setiap aspek kehidupan kita sehari-hari. Ketika mengevaluasi AI tersebut, kita tidak boleh menilainya hanya berdasarkan kemampuannya untuk menipu manusia, tetapi lebih pada kemampuannya untuk memahami makna, memahami konteks, dan berkomunikasi secara alami dalam berbagai situasi. Tentu saja, karena ini bukan bidang dengan "jawaban benar" yang jelas seperti soal matematika, menetapkan kriteria objektif bukanlah hal yang mudah. ​​Namun demikian, untuk mengevaluasi AI yang akan hidup berdampingan dengan manusia di masa depan, Uji Turing harus berevolusi untuk mempertimbangkan secara komprehensif faktor etika dan kemampuan untuk berkomunikasi secara efektif.

 

Tentang Penulis