ट्युरिंग चाचणी खरोखरच कृत्रिम बुद्धिमत्तेचे मूल्यांकन करू शकते का?

या ब्लॉग पोस्टमध्ये, आपण ट्युरिंग चाचणी ही कृत्रिम बुद्धिमत्तेच्या मूल्यांकनासाठी एक योग्य मानक आहे की नाही हे तपासणार आहोत, तसेच तिच्या मर्यादा आणि सुधारणेच्या संभाव्य क्षेत्रांचा शोध घेणार आहोत.

 

२०१४ मध्ये, रशियन डेव्हलपर्सनी तयार केलेल्या 'युजीन गुस्टमन' नावाच्या चॅटबॉटने ट्युरिंग टेस्ट उत्तीर्ण केल्याची बातमी अनेकांसाठी धक्कादायक होती आणि त्यामुळे गोंधळ निर्माण झाला. यावरून हे स्पष्ट झाले की, कृत्रिम बुद्धिमत्ता (AI) आता केवळ विज्ञान-कथा चित्रपटांमध्ये दिसणाऱ्या एका काल्पनिक भविष्यकालीन समाजाचे उत्पादन राहिलेली नाही. रे कर्झविलच्या 'लॉ ऑफ ॲक्सिलरेटिंग रिटर्न्स'नुसार, AI आधीच आपल्या जीवनात खोलवर रुजली आहे आणि वेगाने प्रगती करत आहे. तथापि, डोळ्याची पापणी लवते न लवते तोच AI समाजात दृढपणे स्थापित होत असताना आपण केवळ बघत बसू शकत नाही. AI खरोखरच माणसांप्रमाणे विचार करू शकते का, हे आपल्याला ठरवावे लागेल आणि भविष्यात त्याचा विकास कोणत्या दिशेने व्हायला हवा याचाही विचार करावा लागेल.
हे मुद्दे ट्युरिंग चाचणीशी संबंधित आहेत. ट्युरिंग चाचणी ही एक मूल्यांकन पद्धत आहे, जिचा उगम "असा संगणक तयार करणे शक्य आहे का, ज्याच्याकडे बुद्धिमत्ता आणि मन आहे असे आपण म्हणू शकू?" या प्रश्नातून झाला. हे सर्वज्ञात आहे की, ॲलन ट्युरिंगने १९५० मध्ये "यंत्रे विचार करू शकतात का?" या प्रश्नाचे उत्तर देण्यासाठी ही चाचणी प्रस्तावित केली होती. तथापि, प्रयोगाची रचना करताना ट्युरिंगने प्रत्यक्षात मूळ प्रश्नच बदलून "यंत्रे माणसांप्रमाणे वागू शकतात का?" असा केला. या चाचणीत एक परीक्षक माणूस आणि एआय (AI) या दोघांनाही प्रश्न विचारतो आणि मग कोणाची उत्तरे अधिक मानवासारखी आहेत हे ठरवतो. ट्युरिंग चाचणीमध्ये परीक्षकाला फसवण्यासाठी विविध पद्धती वापरल्या जाऊ शकतात आणि प्रतिसादाचा वेळ कमी करणे किंवा चॅटसारख्या स्वरूपात संभाषण सुरू ठेवणे याला परवानगी आहे. शिवाय, जर एआय चर्चेच्या मर्यादित व्याप्ती आणि विषयामध्ये अंदाजे ३०% परीक्षकांना फसवू शकले, तर चाचणी उत्तीर्ण मानली जाते.
मी असा प्रश्न उपस्थित केला की, या अटी आणि नियमांसह असलेली ट्युरिंग चाचणी ही एआयच्या बुद्धिमत्तेचे मूल्यांकन करण्यासाठी खरोखरच एक योग्य मापदंड आहे का. दुसऱ्या शब्दांत सांगायचे झाल्यास, मला वाटते की ट्युरिंग चाचणी एआयचे मूल्यांकन करण्यासाठी योग्य नाही. या मताच्या समर्थनार्थ, मी तीन युक्तिवाद सादर करेन आणि त्यावर उपाय म्हणून “रिव्हर्स ट्युरिंग चाचणी” प्रस्तावित करेन. तथापि, असे करण्यापूर्वी, “युजीन गूस्टमन” व्यतिरिक्त ट्युरिंग चाचणी उत्तीर्ण झालेल्या एआयच्या इतर उल्लेखनीय उदाहरणांचे प्रथम परीक्षण करणे आवश्यक आहे.
जोसेफ वायझेनबॉम यांनी १९६६ मध्ये विकसित केलेला “एलिझा” हा सुरुवातीच्या नैसर्गिक भाषा संवाद कार्यक्रमांमधील सर्वात प्रसिद्ध उदाहरण आहे. हा एआय दिलेल्या वाक्यांमधील मुख्य शब्द ओळखण्यासाठी आणि त्यानुसार प्रतिसाद देण्यासाठी तयार करण्यात आला होता; जर कोणतेही योग्य शब्द सापडले नाहीत, तर तो वापरकर्त्याचे शब्द पुन्हा बोलवून सांगायचा किंवा एक सामान्य उत्तर द्यायचा.
तसेच, १९७२ मध्ये केनेथ कोल्बी यांनी विकसित केलेला “पॅरी” (PARRY) नावाचा एआय (AI) देखील आहे. हा एआय एका पॅरानॉईड रुग्णाच्या संभाषण शैलीच्या धर्तीवर तयार करण्यात आला होता, आणि असे प्रयोगही करण्यात आले होते ज्यात अनेक मानसोपचारतज्ज्ञांनी प्रत्यक्ष रुग्ण आणि पॅरी यांच्यातील फरक ओळखण्याचा प्रयत्न केला.
येथून पुढे, मी ट्युरिंग चाचणी ही एआयचे मूल्यांकन करण्यासाठी एक योग्य मानक का नाही, याचे परीक्षण करणार आहे.
पहिली गोष्ट म्हणजे, ट्युरिंग चाचणी बुद्धिमत्तेचे अचूक मूल्यांकन करत नाही. दुसऱ्या शब्दांत सांगायचे झाल्यास, एखादा एआय किती हुशारीने विचार करतो याचे मूल्यांकन करण्याऐवजी, ही चाचणी संभाषणाद्वारे तो माणसासारखा वागतो की नाही हे ठरवते. यामध्ये दोन समस्या आहेत.
सर्वप्रथम, सर्वच माणसे नेहमीच बुद्धिमत्तेने वागत नाहीत. येथे, “बुद्धिमान” याचा अर्थ अशी बौद्धिक क्रिया आहे, ज्यात एखादी घटना किंवा वस्तू समजून घेणे आणि त्यावर तर्कशुद्धपणे प्रक्रिया करणे समाविष्ट आहे. शिवाय, ॲलन ट्युरिंगच्या शोधनिबंधानुसार, एआयच्या काही बौद्धिक क्षमता मानवांपेक्षा वेगळ्या प्रकारे प्रकट होऊ शकतात. सोप्या भाषेत सांगायचे तर, जर एखाद्या एआयने अशी समस्या सोडवली जी मानव सोडवू शकत नाही, तर मूल्यमापन करणाऱ्याच्या लक्षात येण्याची अधिक शक्यता असते की समोरची व्यक्ती एक संगणक आहे. सरतेशेवटी, मानवी क्षमतांच्या पलीकडील बुद्धिमत्तेच्या प्रकारांचे योग्य मूल्यांकन करण्यात ट्युरिंग चाचणी अयशस्वी ठरते.
दुसरे म्हणजे, ट्युरिंग चाचणीचे मूल्यांकनाचे निकष व्यक्तिनिष्ठ आहेत आणि प्रायोगिक परिस्थिती अतिशय कडक आहे. दुसऱ्या शब्दांत सांगायचे झाल्यास, एआयच्या वास्तविक बुद्धिमत्तेच्या पातळीऐवजी, मूल्यांकनकर्त्याची वृत्ती, अनुभव, कौशल्ये आणि ज्ञान यांचा चाचणीच्या निकालांवर लक्षणीय प्रभाव पडू शकतो, ज्यामुळे वस्तुनिष्ठता सुनिश्चित करणे कठीण होते.

सरतेशेवटी, एखादी गोष्ट एआय आहे की माणूस, हे ठरवणारी संस्था एक व्यक्तीच असते, त्यामुळे मूल्यमापन करणाऱ्याची व्यक्तिनिष्ठता पूर्णपणे दूर करणे कठीण आहे. शिवाय, सुमारे पाच मिनिटांच्या मर्यादित वेळेत विचारले जाणारे प्रश्नही खूप मर्यादित असतात. जोपर्यंत मूल्यमापन करणारी व्यक्ती माणूस आहे, तोपर्यंत विविध बाह्य घटकांचा प्रभाव पडण्याची शक्यता नेहमीच असते.
याव्यतिरिक्त, ट्युरिंग चाचणीत सहभागी होणारे बहुतेक एआय हे विशिष्ट परिस्थिती किंवा वैशिष्ट्ये असलेल्या मानवांच्या धर्तीवर तयार केलेले असतात. त्यामुळे, जरी एखादा एआय चाचणीत उत्तीर्ण झाला, तरी तो सर्वसाधारणपणे मानवांप्रमाणेच वागतो असा निष्कर्ष काढणे कठीण आहे. उदाहरणार्थ, पूर्वी ओळख करून दिलेला “युजीन गूस्टमन” हा युक्रेनमध्ये राहणारा एक १३ वर्षांचा मुलगा आहे या गृहितकावर विकसित करण्यात आला होता. थोडीशी अस्ताव्यस्त इंग्रजीसुद्धा नैसर्गिक मानली जाईल अशी परिस्थिती निर्माण करण्याचा हा एक हेतुपुरस्सर केलेला प्रयत्न होता. “पॅरी” हा एका पॅरानॉईड रुग्णाच्या धर्तीवर तयार करण्यात आला होता, आणि “एलिझा” ही एका व्यावसायिक मानसशास्त्रीय समुपदेशकाची नक्कल करण्यासाठी तयार करण्यात आली होती.
अशा प्रकारे, जेव्हा एखाद्या विशिष्ट वैशिष्ट्यांसह मानवाचे प्रतिनिधित्व करण्यासाठी एआय (AI) तयार केले जाते आणि नंतर संभाषणात गुंतवले जाते, तेव्हा परीक्षक ती वैशिष्ट्ये लक्षात घेऊन त्याचे मूल्यांकन करतात. उदाहरणार्थ, मानसिक आजार असलेल्या व्यक्तीचे प्रतिनिधित्व करण्यासाठी प्रोग्राम केलेल्या एआयशी संवाद साधताना जरी एखादी थोडी विचित्र प्रतिक्रिया आली, तरी परीक्षक ती त्या वर्णनाशी सुसंगत असलेली एक नैसर्गिक प्रतिक्रिया म्हणून स्वीकारण्याची शक्यता असते. दुसऱ्या शब्दांत सांगायचे झाल्यास, परीक्षकांनी निःपक्षपातीपणे मूल्यांकन करणे अपेक्षित असले तरी, प्रत्यक्षात त्यांना अशा वातावरणात ठेवले जाते जिथे तसे करणे कठीण असते.
अर्थातच, मानसिक आजार असलेले लोक विचार करू शकतात. तथापि, एखाद्या मानसिक आजार असलेल्या व्यक्तीच्या धर्तीवर तयार केलेला एआय ट्युरिंग चाचणी उत्तीर्ण झाला, याचा अर्थ असा होत नाही की तो माणसापेक्षा अधिक 'मानवी' विचार करतो. ॲलन ट्युरिंगने विचारलेल्या प्रश्नाशी—"एखादे यंत्र माणसाप्रमाणे वागू शकते का?"—प्रामाणिक राहण्यासाठी, ही चाचणी अशा सामान्य परिस्थितींवर आधारित असली पाहिजे, ज्या बहुसंख्य लोकांना मान्य असतील.
तिसरे म्हणजे, एआय आशय खऱ्या अर्थाने समजून घेण्याऐवजी केवळ चिन्हांची हाताळणी करून ट्युरिंग चाचणी उत्तीर्ण करू शकते. याचे एक उत्तम उदाहरण म्हणजे “एलिझा”. एखाद्या व्यक्तीला एखाद्या विषयावर विचार करण्यासाठी, त्याला तो विषय समजणे आणि संबंधित अनुभवाच्या आधारावर निर्णय घेणे आवश्यक असते. याच कारणामुळे, तत्त्वज्ञ जॉन सियरल यांनी असा युक्तिवाद केला की, एखादे यंत्र खरोखर विचार करत आहे की नाही हे केवळ ट्युरिंग चाचणीद्वारे सिद्ध होऊ शकत नाही.
शिवाय, कृत्रिम बुद्धिमत्ता पूर्वनिश्चित अल्गोरिदमनुसार कार्य करत असल्यामुळे, अनपेक्षित परिस्थितींना सामोरे गेल्यावर ती चुका सहजपणे शोधू शकते. हे स्पष्ट करणारे एक उदाहरण खाली दिले आहे.
संवादक: तुम्ही अजूनही बिल क्लिंटन यांना पाठिंबा देता का?
न्यायाधीश: मी क्लिंटनला कधीही भेटलेलो नाही.
संवादक: तुम्हाला बिल क्लिंटन अजिबात आवडत नाहीत. किमान, हे स्पष्ट आहे की ते तुम्हाला आवडत नाहीत. माझ्या मते, आतापर्यंत बहुतेक लोकांनी यात रस दाखवला नाही किंवा यावर फारसा विचार केलेला नाही.
न्यायाधीश: तुम्ही 'द मार्टियन' पाहिला आहे का?
संवादक: जरा शांत व्हा. मी इथे मूर्ख प्रश्नांची उत्तरं द्यायला आलेलो नाही. तसं नाही. आपण कशाबद्दल बोलत होतो? बरोबर. तुम्ही आत्ता जे म्हणालात, त्याचा अर्थ असा आहे का की मूळ मुद्दे—जसे की व्हाईटवॉटर आणि विशेष वकील—गंभीर आहेत?
हा संवाद एका न्यायाधीश आणि 'कॅथरीन' नावाच्या एका एआय (AI) मध्ये आहे. ट्युरिंग चाचणीच्या आदल्या दिवशी चर्चेत आलेल्या घटनांबद्दलच्या पूर्वनियोजित माहितीच्या आधारे संवाद पुढे चालू ठेवण्यासाठी या एआयची रचना करण्यात आली होती. जर न्यायाधीशांनी बिल क्लिंटन यांच्याशी संबंधित राजकीय संवाद पुढे चालू ठेवला असता, तर तो संवाद अगदी स्वाभाविक राहिला असता. तथापि, जेव्हा न्यायाधीशांनी अचानक विषय बदलून दुसऱ्या कशावर तरी वळवला, तेव्हा एआयला तो अनियोजित विषय योग्यरित्या हाताळता आला नाही आणि वर दर्शवलेली त्रुटी दिसून आली.
म्हणून, केवळ एका विशिष्ट पातळीवर संवाद साधण्यास सक्षम आहे म्हणून आपण असा निष्कर्ष काढू शकत नाही की एआय मानवासारखे वागते. वरवर पाहता ते मानवासारखे संभाषण करत असल्याचे दिसत असले तरी, ते प्रत्यक्षात आशय समजत नाही, तर केवळ अशा प्रकारे प्रतिसाद देत असते ज्यामुळे ते मानवासारखे वाटते. त्यामुळे, पूर्वी परिभाषित केलेल्या “बुद्धिमत्ते”च्या संकल्पनेत ते कमी पडते. सध्याच्या ट्युरिंग चाचणीला स्पष्ट मर्यादा आहेत, जी मानवी वर्तनाचा अर्थ न समजता केवळ त्याचे अनुकरण करणाऱ्या एआय प्रणालींना उत्तीर्ण करते.
मानवांशी तुलना करून एआयचे मूल्यांकन करत असल्यामुळे, ट्युरिंग चाचणी हा मानव आणि एआय यांच्यातील सीमारेषेचा शोध घेणारा एक अर्थपूर्ण प्रयोग आहे. मानव स्वतः विचार किंवा मनाचे सार स्पष्टपणे परिभाषित करू शकत नाही हे लक्षात घेता, हा प्रयत्न स्वतःच महत्त्वपूर्ण ठरतो. दुसरीकडे, एआय तुलनेने सोप्या रचना आणि तत्त्वांवर कार्य करत असल्यामुळे, जरी ते परिपूर्ण नसले तरी, काही प्रमाणात त्याचे मोजमाप आणि विश्लेषण करणे शक्य आहे.
तथापि, ट्युरिंग चाचणी बुद्धिमत्तेचे अचूक मूल्यांकन करण्यात अयशस्वी ठरते आणि तिचे मूल्यांकनाचे निकषही अत्यंत व्यक्तिनिष्ठ आहेत. प्रत्यक्ष चाचणी प्रक्रियेचे बारकाईने निरीक्षण केल्यास असे दिसून येते की, एखाद्या एआयच्या बुद्धिमत्तेचे सर्वसमावेशक मूल्यांकन करण्यास सक्षम असलेले वातावरण म्हणून त्याकडे पाहणे कठीण आहे. जरी अनेक परीक्षक सहभागी झाले आणि एखादी संस्था मूल्यांकन प्रक्रियेवर देखरेख ठेवत असली तरी, मूल्यमापन करणाऱ्यांची संख्या मर्यादित असते आणि सर्व घटकांचा विचार करून वस्तुनिष्ठ निष्कर्षापर्यंत पोहोचणे सोपे नसते. त्यामुळे, सर्वांना मान्य होईल असा परिपूर्ण निकाल मिळवण्यात मूलभूत मर्यादा आहेत.
ट्युरिंग चाचणीला मोठे महत्त्व आहे कारण तिने हे दाखवून दिले की, एकेकाळी केवळ मानवांमध्येच आढळणाऱ्या संज्ञानात्मक क्षमतांची कृत्रिम बुद्धिमत्ता (AI) काही प्रमाणात नक्कल करू शकते. त्यामुळे, ही चाचणी पूर्णपणे नाकारण्याऐवजी, सध्या वापरात असलेल्या पद्धतींपेक्षा अधिक अचूक आणि व्यापक जनसमुदायाला स्वीकारार्ह असे मूल्यांकनाचे निकष आणि कार्यपद्धती स्थापित करण्याची गरज आहे.
या संदर्भात, मी एक पर्याय म्हणून “रिव्हर्स ट्युरिंग टेस्ट” प्रस्तावित करू इच्छितो. रिव्हर्स ट्युरिंग टेस्टमध्ये, मूल्यमापन करणारा माणूस नसून एक संगणक असतो. दुसऱ्या शब्दांत सांगायचे झाल्यास, ही एक अशी पद्धत आहे ज्यात एक संगणक, एखाद्या माणसाशी किंवा दुसऱ्या संगणकाशी संवाद साधत असताना त्याचे मूल्यमापन करतो. सध्याच्या चाचण्यांमध्ये हा दृष्टिकोन आणल्याने मानवी व्यक्तिनिष्ठतेची समस्या कमी होईल आणि अधिक वस्तुनिष्ठ वातावरणात मूल्यमापन करणे शक्य होईल. अर्थात, मूल्यमापन करणारा एक एआय (AI) असल्यामुळे नवीन समस्या निर्माण होण्याची शक्यताही निर्माण होते.
विषय कोणताही असो, मूल्यांकन आणि निर्णयासाठी तयार केलेल्या चाचण्या प्रत्येकाला समाधानकारक वाटतीलच असे नाही, आणि सर्वांना मान्य होतील असे परिपूर्ण निकष स्थापित करणे सोपे नाही. त्यामुळे, त्यांमध्ये सुधारणा करण्याचे मार्ग आपण सतत शोधले पाहिजेत. विशेषतः, ट्युरिंग चाचणी ही एक महत्त्वपूर्ण मूल्यांकन पद्धत असल्याने, जी उद्योगाचे भविष्य आणि एआय तंत्रज्ञान विकासाची दिशा यावर लक्षणीय प्रभाव टाकू शकते, ती अधिक कार्यक्षम आणि विश्वसनीय स्वरूपात विकसित झाली पाहिजे.
आज, एआय (AI) भूतकाळाच्या तुलनेत अतुलनीय वेगाने प्रगती करत आहे आणि आपल्या दैनंदिन जीवनाच्या प्रत्येक पैलूमध्ये त्याचा वापर आधीच केला जात आहे. अशा एआयचे मूल्यांकन करताना, ते मानवांना फसवू शकते की नाही यावरच आपण त्याचा न्याय करू नये, तर त्याऐवजी अर्थ समजून घेण्याची, संदर्भ जाणण्याची आणि विविध परिस्थितींमध्ये नैसर्गिकरित्या संवाद साधण्याची त्याची क्षमता तपासावी. अर्थातच, हे गणिताच्या प्रश्नाप्रमाणे स्पष्टपणे परिभाषित 'योग्य उत्तरे' असलेले क्षेत्र नसल्यामुळे, वस्तुनिष्ठ निकष स्थापित करणे सोपे नाही. तरीही, भविष्यात मानवांसोबत सहअस्तित्व राखणाऱ्या एआयचे मूल्यांकन करण्यासाठी, नैतिक घटक आणि प्रभावीपणे संवाद साधण्याच्या क्षमतेचा सर्वसमावेशकपणे विचार करण्याकरिता ट्युरिंग चाचणीमध्ये बदल होणे आवश्यक आहे.

 

लेखक बद्दल