Dalam catatan blog ini, kami akan mengkaji sama ada Ujian Turing merupakan standard yang sesuai untuk menilai kecerdasan kecerdasan buatan dan meneroka batasan serta potensi penambahbaikannya.
Pada tahun 2014, berita bahawa “Eugene Goostman,” sebuah chatbot yang dicipta oleh pembangun Rusia, telah lulus Ujian Turing telah mengejutkan dan menyebabkan kekeliruan bagi ramai orang. Ini merupakan demonstrasi yang jelas bahawa kecerdasan buatan bukan lagi sekadar produk masyarakat masa depan khayalan yang hanya dilihat dalam filem fiksyen sains. AI telah pun tertanam dalam kehidupan kita dan sedang maju dengan pantas, selaras dengan “Hukum Mempercepatkan Pulangan” Ray Kurzweil. Walau bagaimanapun, kita tidak boleh hanya berdiam diri dan melihat AI, yang berkembang sekelip mata, menjadi kukuh dalam masyarakat. Kita perlu menentukan sama ada AI sememangnya boleh berfikir seperti manusia, dan kita juga mesti mempertimbangkan arah perkembangannya pada masa hadapan.
Isu-isu ini dikaitkan dengan Ujian Turing. Ujian Turing merupakan kaedah penilaian yang berasal daripada soalan: “Adakah mungkin untuk mencipta komputer yang boleh kita katakan mempunyai kecerdasan dan minda?” Umumnya diketahui bahawa Alan Turing mencadangkannya pada tahun 1950 untuk menjawab soalan, “Bolehkah mesin berfikir?” Walau bagaimanapun, Turing sebenarnya mengubah frasa soalan itu sendiri sebagai “Bolehkah mesin bertindak seperti manusia?” semasa mereka bentuk eksperimen. Ujian ini dijalankan dengan meminta seorang hakim mengemukakan soalan kepada manusia dan AI, kemudian menentukan respons siapa yang lebih menyerupai manusia. Dalam Ujian Turing, pelbagai kaedah boleh digunakan untuk menipu hakim, dan dibenarkan untuk memperlahankan masa tindak balas atau meneruskan perbualan dalam format seperti sembang. Tambahan pula, ujian dianggap lulus jika AI boleh menipu kira-kira 30% daripada hakim dalam skop dan topik perbincangan yang terhad.
Saya mempersoalkan sama ada Ujian Turing dengan syarat dan peraturan ini benar-benar merupakan ukuran yang sesuai untuk menilai kecerdasan AI. Dalam erti kata lain, saya percaya Ujian Turing tidak sesuai untuk menilai AI. Untuk menyokong pandangan ini, saya akan mengemukakan tiga hujah dan mencadangkan "Ujian Turing Songsang" sebagai penyelesaian. Walau bagaimanapun, sebelum berbuat demikian, adalah perlu untuk mengkaji terlebih dahulu contoh AI lain yang telah lulus Ujian Turing selain "Eugene Goostman."
“ELIZA,” yang dibangunkan oleh Joseph Weizenbaum pada tahun 1966, merupakan contoh paling dikenali ramai di kalangan program dialog bahasa semula jadi awal. AI ini direka bentuk untuk mengenal pasti kata kunci utama dalam ayat input dan mengembalikan respons yang sepadan; jika tiada kata kunci yang sesuai ditemui, ia akan mengulangi perkataan pengguna atau memberikan balasan generik.
Terdapat juga "PARRY," yang dibangunkan oleh Kenneth Colby pada tahun 1972. AI ini dimodelkan mengikut gaya perbualan pesakit paranoid, dan eksperimen juga dijalankan di mana beberapa pakar psikiatri cuba membezakan antara pesakit sebenar dan PARRY.
Mulai sekarang, saya akan mengkaji mengapa Ujian Turing bukanlah standard yang sesuai untuk menilai AI.
Pertama, Ujian Turing tidak menilai kecerdasan itu sendiri dengan tepat. Dalam erti kata lain, ujian ini menentukan melalui perbualan sama ada ia berkelakuan seperti manusia, bukannya menilai sejauh mana kecerdasan buatan (AI) berfikir. Terdapat dua masalah dengan ini.
Pertama, tidak semua manusia sentiasa berkelakuan bijak. Di sini, "pintar" merujuk kepada aktiviti intelektual yang melibatkan pemahaman tentang sesuatu fenomena atau objek dan memprosesnya secara rasional. Tambahan pula, menurut kertas kerja Alan Turing, beberapa kebolehan intelektual AI mungkin nyata dengan cara yang berbeza daripada manusia. Secara ringkasnya, jika AI menyelesaikan masalah yang tidak dapat diselesaikan oleh manusia, penilai sebenarnya lebih cenderung untuk menyedari bahawa pihak yang satu lagi adalah komputer. Akhirnya, Ujian Turing gagal menilai dengan betul bentuk kecerdasan yang mengatasi keupayaan manusia.
Kedua, kriteria penilaian Ujian Turing adalah subjektif, dan keadaan eksperimen terlalu ketat. Dalam erti kata lain, keputusan ujian boleh dipengaruhi dengan ketara oleh sikap, pengalaman, kemahiran dan pengetahuan penilai dan bukannya tahap kecerdasan sebenar AI, sehingga sukar untuk memastikan objektiviti.
Akhirnya, entiti yang menentukan sama ada sesuatu itu AI atau manusia adalah orang, jadi sukar untuk menghapuskan sepenuhnya subjektiviti penilai. Tambahan pula, soalan yang ditanya dalam tempoh masa terhad kira-kira lima minit juga sangat terhad. Selagi penilai itu manusia, sentiasa ada kemungkinan untuk dipengaruhi oleh pelbagai faktor luaran.
Selain itu, kebanyakan AI yang mengambil bahagian dalam Ujian Turing dimodelkan mengikut manusia dengan situasi atau ciri tertentu. Oleh itu, walaupun AI lulus ujian, sukar untuk membuat kesimpulan bahawa ia bertindak sama seperti manusia secara umum. Contohnya, "Eugene Goostman," yang diperkenalkan sebelum ini, dibangunkan dengan premis bahawa ia adalah seorang budak lelaki berusia 13 tahun yang tinggal di Ukraine. Ini adalah percubaan yang disengajakan untuk mewujudkan situasi di mana bahasa Inggeris yang agak kekok pun akan diterima sebagai sesuatu yang semula jadi. "PARRY" dimodelkan mengikut pesakit paranoid, dan "ELIZA" direka bentuk untuk meniru seorang kaunselor psikologi profesional.
Dengan cara ini, apabila AI diwujudkan untuk mewakili manusia dengan ciri-ciri tertentu dan kemudian terlibat dalam perbualan, para hakim menilainya dengan mengambil kira ciri-ciri tersebut. Contohnya, walaupun tindak balas yang agak pelik timbul semasa berbual dengan AI yang diprogramkan untuk mewakili seseorang yang menghidap penyakit mental, para hakim mungkin menerimanya sebagai reaksi semula jadi yang selaras dengan pencirian tersebut. Dalam erti kata lain, walaupun para hakim sepatutnya menilai tanpa berat sebelah, mereka sebenarnya diletakkan dalam persekitaran di mana berbuat demikian adalah sukar.
Sudah tentu, orang yang menghidap penyakit mental mampu berfikir. Walau bagaimanapun, hanya kerana AI yang dimodelkan mengikut seseorang yang menghidap penyakit mental lulus Ujian Turing tidak bermakna ia berfikir lebih "seperti manusia" daripada manusia. Untuk kekal setia kepada soalan yang diajukan oleh Alan Turing—"Bolehkah mesin bertindak seperti manusia?"—ujian tersebut mesti direka bentuk berdasarkan situasi umum yang boleh diterima oleh majoriti orang.
Ketiga, AI boleh lulus Ujian Turing hanya dengan memanipulasi simbol dan bukannya benar-benar memahami kandungannya. Contoh utama ialah "ELIZA." Agar seseorang dapat berfikir tentang sesuatu topik, mereka mesti memahami topik tersebut dan membuat penilaian berdasarkan pengalaman yang berkaitan. Atas sebab ini, ahli falsafah John Searle juga berhujah bahawa Ujian Turing sahaja tidak dapat membuktikan sama ada mesin benar-benar berfikir.
Tambahan pula, memandangkan kecerdasan buatan beroperasi mengikut algoritma yang telah ditentukan, ia boleh mendedahkan ralat dengan mudah apabila berhadapan dengan situasi yang tidak dijangka. Berikut adalah contoh yang menggambarkan perkara ini.
Pengantara: Adakah anda masih menyokong Bill Clinton?
Hakim: Saya tidak pernah bertemu Clinton.
Pengantara: Anda benar-benar tidak menyukai Bill Clinton. Sekurang-kurangnya, jelas bahawa anda tidak menyukainya. Pada pendapat saya, nampaknya kebanyakan orang tidak berminat atau tidak terlalu memikirkannya setakat ini.
Hakim: Pernahkah anda menonton 'The Martian'?
Pengantara: Kita bertenang. Saya di sini bukan untuk menjawab soalan bodoh. Bukan itu sahaja. Apa yang kita bincangkan? Betul. Adakah apa yang awak katakan tadi bermakna isu-isu asas—seperti Whitewater dan peguam khas—adalah serius?
Perbualan ini adalah antara seorang hakim dan “Catherine,” sebuah AI yang direka untuk meneruskan dialog berdasarkan maklumat yang telah diprogramkan terlebih dahulu tentang peristiwa yang telah menjadi berita sehari sebelum Ujian Turing diadakan. Jika hakim meneruskan perbualan politik yang berkaitan dengan Bill Clinton, dialog itu mungkin kekal agak semula jadi. Walau bagaimanapun, apabila hakim tiba-tiba mengalihkan topik kepada sesuatu yang lain, AI tidak dapat mengendalikan subjek yang tidak diprogramkan dengan betul dan mendedahkan ralat yang ditunjukkan di atas.
Oleh itu, kita tidak boleh membuat kesimpulan bahawa AI bertindak seperti manusia hanya kerana ia mampu berkomunikasi pada tahap tertentu. Walaupun ia mungkin kelihatan seperti manusia pada permukaannya, ia sebenarnya tidak memahami kandungannya tetapi hanya bertindak balas dengan cara yang menjadikannya kelihatan seperti manusia. Oleh itu, ia tidak memenuhi konsep "kecerdasan" seperti yang ditakrifkan sebelum ini. Ujian Turing semasa, yang lulus sistem AI yang hanya meniru tingkah laku manusia tanpa benar-benar memahami maksudnya, mempunyai batasan yang jelas.
Dalam menilai AI dengan membandingkannya dengan manusia, Ujian Turing merupakan eksperimen bermakna yang meneroka sempadan antara manusia dan AI. Memandangkan manusia sendiri tidak dapat mentakrifkan intipati pemikiran atau minda dengan jelas, percubaan ini sendiri mempunyai nilai yang signifikan. Sebaliknya, memandangkan AI beroperasi berdasarkan struktur dan prinsip yang agak mudah, adalah mungkin untuk mengukur dan menganalisisnya sehingga tahap tertentu, walaupun tidak sempurna.
Walau bagaimanapun, Ujian Turing gagal menilai kecerdasan dengan tepat, dan kriteria penilaiannya juga terlalu subjektif. Melihat lebih dekat proses ujian sebenar mendedahkan bahawa sukar untuk melihatnya sebagai persekitaran yang mampu menilai kecerdasan AI secara komprehensif. Walaupun ramai hakim mengambil bahagian dan sesebuah institusi menyelia proses penilaian, bilangan penilai adalah terhad, dan tidak mudah untuk mencapai kesimpulan objektif yang mengambil kira semua pembolehubah. Oleh itu, terdapat batasan asas untuk memperoleh keputusan yang sempurna yang boleh diterima oleh semua orang.
Ujian Turing mempunyai kepentingan yang ketara kerana ia menunjukkan bahawa AI boleh, sehingga tahap tertentu, meniru kebolehan kognitif yang pernah dianggap unik kepada manusia. Oleh itu, daripada menolak sepenuhnya ujian ini, terdapat keperluan untuk mewujudkan kriteria dan prosedur penilaian yang lebih tepat dan boleh diterima oleh khalayak yang lebih luas berbanding yang sedang digunakan.
Dalam hal ini, saya ingin mencadangkan "Ujian Turing Songsang" sebagai alternatif. Dalam Ujian Turing Songsang, penilai adalah komputer dan bukannya manusia. Dalam erti kata lain, ia adalah kaedah di mana komputer menilai manusia atau komputer lain semasa berinteraksi dengannya. Memperkenalkan pendekatan ini ke dalam ujian sedia ada akan mengurangkan masalah subjektiviti manusia dan membolehkan penilaian dijalankan dalam persekitaran yang lebih objektif. Sudah tentu, hakikat bahawa penilai adalah AI juga menimbulkan kemungkinan isu baharu.
Terlepas dari subjeknya, ujian yang direka untuk penilaian dan pertimbangan tidak mungkin memuaskan semua orang, dan bukanlah mudah untuk menetapkan kriteria sempurna yang boleh diterima oleh semua orang. Oleh itu, kita mesti terus meneroka cara untuk memperbaikinya. Khususnya, memandangkan Ujian Turing merupakan kaedah penilaian penting yang boleh mempengaruhi masa depan industri dan hala tuju pembangunan teknologi AI dengan ketara, ia mesti berkembang menjadi bentuk yang lebih cekap dan boleh dipercayai.
Hari ini, AI sedang maju pada kadar yang tidak dapat ditandingi dengan masa lalu dan telah pun digunakan dalam setiap aspek kehidupan seharian kita. Apabila menilai AI sedemikian, kita tidak seharusnya menilainya semata-mata berdasarkan sama ada ia boleh menipu manusia, tetapi sebaliknya menilai keupayaannya untuk memahami makna, memahami konteks dan berkomunikasi secara semula jadi merentasi pelbagai situasi. Sudah tentu, memandangkan ini bukanlah bidang dengan "jawapan betul" yang jelas seperti masalah matematik, menetapkan kriteria objektif bukanlah mudah. Walau bagaimanapun, untuk menilai AI yang akan wujud bersama manusia pada masa hadapan, Ujian Turing mesti berkembang untuk mempertimbangkan secara komprehensif faktor etika dan keupayaan untuk berkomunikasi dengan berkesan.