इस ब्लॉग पोस्ट में, हम यह जांच करेंगे कि क्या ट्यूरिंग टेस्ट कृत्रिम बुद्धिमत्ता के मूल्यांकन के लिए एक उपयुक्त मानक है, और इसकी सीमाओं और सुधार के संभावित क्षेत्रों का पता लगाएंगे।
2014 में, रूसी डेवलपर्स द्वारा बनाए गए चैटबॉट "यूजीन गूस्टमैन" के ट्यूरिंग टेस्ट पास करने की खबर ने सबको चौंका दिया और कई लोगों को भ्रमित कर दिया। इससे यह स्पष्ट हो गया कि कृत्रिम बुद्धिमत्ता अब केवल विज्ञान कथाओं में दिखाई देने वाली काल्पनिक भविष्य की दुनिया की उपज नहीं रह गई है। एआई हमारे जीवन में गहराई से समाहित हो चुका है और रे कर्ट्जवेल के "त्वरित प्रतिफल के नियम" के अनुसार तेजी से प्रगति कर रहा है। हालांकि, हम केवल खड़े होकर यह नहीं देख सकते कि एआई, जो पलक झपकते ही विकसित हो रहा है, समाज में मजबूती से स्थापित हो जाए। हमें यह निर्धारित करने की आवश्यकता है कि क्या एआई वास्तव में मनुष्यों की तरह सोच सकता है, और हमें यह भी विचार करना होगा कि भविष्य में इसका विकास किस दिशा में होना चाहिए।
ये मुद्दे ट्यूरिंग टेस्ट से जुड़े हैं। ट्यूरिंग टेस्ट एक मूल्यांकन विधि है जिसकी उत्पत्ति इस प्रश्न से हुई: "क्या ऐसा कंप्यूटर बनाना संभव है जिसे हम बुद्धि और मन वाला कह सकें?" यह सर्वविदित है कि एलन ट्यूरिंग ने 1950 में "क्या मशीनें सोच सकती हैं?" प्रश्न का उत्तर देने के लिए इसे प्रस्तावित किया था। हालांकि, प्रयोग को डिज़ाइन करते समय ट्यूरिंग ने वास्तव में प्रश्न को ही इस प्रकार पुनः परिभाषित किया: "क्या मशीनें मनुष्यों की तरह व्यवहार कर सकती हैं?" इस परीक्षण में एक निर्णायक एक मनुष्य और एक कृत्रिम बुद्धिमत्ता (एआई) दोनों से प्रश्न पूछता है, और फिर यह निर्धारित करता है कि किसके उत्तर अधिक मानवीय हैं। ट्यूरिंग टेस्ट में, निर्णायक को धोखा देने के लिए विभिन्न विधियों का उपयोग किया जा सकता है, और उत्तर देने में लगने वाले समय को धीमा करना या बातचीत को चैट के प्रारूप में जारी रखना अनुमत है। इसके अलावा, यदि एआई चर्चा के सीमित दायरे और विषय के भीतर लगभग 30% निर्णायकों को धोखा देने में सक्षम है, तो परीक्षण उत्तीर्ण माना जाता है।
मैंने यह सवाल उठाया कि क्या इन शर्तों और नियमों के साथ ट्यूरिंग टेस्ट वास्तव में कृत्रिम बुद्धिमत्ता का आकलन करने का एक उपयुक्त तरीका है। दूसरे शब्दों में, मेरा मानना है कि ट्यूरिंग टेस्ट कृत्रिम बुद्धिमत्ता के मूल्यांकन के लिए उपयुक्त नहीं है। इस दृष्टिकोण का समर्थन करने के लिए, मैं तीन तर्क प्रस्तुत करूँगा और एक समाधान के रूप में "रिवर्स ट्यूरिंग टेस्ट" का प्रस्ताव रखूँगा। हालाँकि, ऐसा करने से पहले, "यूजीन गूस्टमैन" के अलावा, ट्यूरिंग टेस्ट में सफल रहे कृत्रिम बुद्धिमत्ता के अन्य उल्लेखनीय उदाहरणों की जाँच करना आवश्यक है।
जोसेफ वेइज़ेनबाम द्वारा 1966 में विकसित "एलिज़ा" प्रारंभिक प्राकृतिक भाषा संवाद कार्यक्रमों में सबसे व्यापक रूप से ज्ञात उदाहरण है। इस कृत्रिम बुद्धिमत्ता को इनपुट वाक्यों में प्रमुख कीवर्ड की पहचान करने और संबंधित प्रतिक्रियाएँ देने के लिए डिज़ाइन किया गया था; यदि कोई उपयुक्त कीवर्ड नहीं मिलते थे, तो यह उपयोगकर्ता के शब्दों को दोहराता था या एक सामान्य उत्तर प्रदान करता था।
इसके अलावा, 1972 में केनेथ कोल्बी द्वारा विकसित "पैरी" भी है। इस एआई को एक पैरानॉयड रोगी की बातचीत शैली के आधार पर तैयार किया गया था, और यहां तक कि ऐसे प्रयोग भी किए गए थे जिनमें कई मनोचिकित्सकों ने वास्तविक रोगियों और पैरी के बीच अंतर करने का प्रयास किया था।
अब मैं इस बात की पड़ताल करूंगा कि ट्यूरिंग टेस्ट कृत्रिम बुद्धिमत्ता के मूल्यांकन के लिए एक उपयुक्त मानक क्यों नहीं है।
पहली बात तो यह है कि ट्यूरिंग टेस्ट बुद्धिमत्ता का सटीक आकलन नहीं करता। दूसरे शब्दों में, यह परीक्षण किसी कृत्रिम बुद्धिमत्ता की सोच का मूल्यांकन करने के बजाय, बातचीत के माध्यम से यह निर्धारित करता है कि क्या वह मनुष्य की तरह व्यवहार करता है। इसमें दो समस्याएं हैं।
पहली बात तो यह है कि सभी मनुष्य हमेशा बुद्धिमानी से व्यवहार नहीं करते। यहाँ "बुद्धिमान" से तात्पर्य उस बौद्धिक गतिविधि से है जिसमें किसी घटना या वस्तु को समझना और उसका तर्कसंगत विश्लेषण करना शामिल है। इसके अलावा, एलन ट्यूरिंग के शोध पत्र के अनुसार, कृत्रिम बुद्धिमत्ता (AI) की कुछ बौद्धिक क्षमताएँ मनुष्यों से भिन्न तरीके से प्रकट हो सकती हैं। सरल शब्दों में कहें तो, यदि कोई AI किसी ऐसी समस्या को हल कर लेता है जिसे मनुष्य हल नहीं कर सकते, तो मूल्यांकनकर्ता को यह समझने की अधिक संभावना होती है कि दूसरा पक्ष एक कंप्यूटर है। अंततः, ट्यूरिंग परीक्षण उन बुद्धिमत्ताओं का सही मूल्यांकन करने में विफल रहता है जो मानवीय क्षमताओं से परे हैं।
दूसरा, ट्यूरिंग टेस्ट के मूल्यांकन मानदंड व्यक्तिपरक हैं, और प्रायोगिक परिस्थितियाँ अत्यधिक प्रतिबंधात्मक हैं। दूसरे शब्दों में, परीक्षण के परिणाम एआई की वास्तविक बुद्धिमत्ता के स्तर के बजाय मूल्यांकनकर्ता के दृष्टिकोण, अनुभव, कौशल और ज्ञान से काफी हद तक प्रभावित हो सकते हैं, जिससे वस्तुनिष्ठता सुनिश्चित करना मुश्किल हो जाता है।
अंततः, किसी चीज़ को कृत्रिम बुद्धिमत्ता (एआई) या मानव के रूप में निर्धारित करने वाली इकाई एक व्यक्ति ही होती है, इसलिए मूल्यांकनकर्ता की व्यक्तिपरकता को पूरी तरह से समाप्त करना कठिन है। इसके अलावा, लगभग पाँच मिनट की सीमित समयावधि में पूछे जाने वाले प्रश्न भी बहुत सीमित होते हैं। जब तक मूल्यांकनकर्ता मानव है, विभिन्न बाहरी कारकों से प्रभावित होने की संभावना हमेशा बनी रहती है।
इसके अलावा, ट्यूरिंग टेस्ट में भाग लेने वाले अधिकांश एआई को विशिष्ट परिस्थितियों या विशेषताओं वाले मनुष्यों के मॉडल पर बनाया गया है। इसलिए, भले ही कोई एआई टेस्ट पास कर ले, यह निष्कर्ष निकालना मुश्किल है कि वह सामान्य रूप से मनुष्यों की तरह ही व्यवहार करता है। उदाहरण के लिए, पहले बताए गए "यूजीन गूस्टमैन" को इस आधार पर विकसित किया गया था कि वह यूक्रेन में रहने वाला एक 13 वर्षीय लड़का है। यह जानबूझकर ऐसी स्थिति बनाने का प्रयास था जहाँ थोड़ी अटपटी अंग्रेजी को भी स्वाभाविक माना जाए। "पैरी" को एक पैरानॉयड रोगी के मॉडल पर बनाया गया था, और "एलिज़ा" को एक पेशेवर मनोवैज्ञानिक परामर्शदाता की तरह व्यवहार करने के लिए डिज़ाइन किया गया था।
इस तरह, जब किसी कृत्रिम बुद्धिमत्ता (एआई) को विशिष्ट विशेषताओं वाले मानव का प्रतिनिधित्व करने के लिए तैयार किया जाता है और फिर उससे बातचीत की जाती है, तो न्यायाधीश उन विशेषताओं को ध्यान में रखते हुए उसका मूल्यांकन करते हैं। उदाहरण के लिए, यदि किसी मानसिक बीमारी से ग्रसित व्यक्ति का प्रतिनिधित्व करने के लिए प्रोग्राम की गई एआई से बातचीत के दौरान कोई अटपटा जवाब भी आता है, तो न्यायाधीश उसे उस विशेषता के अनुरूप एक स्वाभाविक प्रतिक्रिया मानकर स्वीकार कर लेते हैं। दूसरे शब्दों में, हालांकि न्यायाधीशों से निष्पक्ष मूल्यांकन करने की अपेक्षा की जाती है, वास्तव में उन्हें ऐसे वातावरण में रखा जाता है जहां ऐसा करना कठिन होता है।
बेशक, मानसिक बीमारियों से ग्रस्त लोग सोचने-समझने में सक्षम होते हैं। हालांकि, किसी मानसिक बीमारी से ग्रस्त व्यक्ति पर आधारित कृत्रिम बुद्धिमत्ता (एआई) के ट्यूरिंग टेस्ट पास करने का यह मतलब नहीं है कि वह मनुष्य से अधिक "मानव-समान" सोच रखती है। एलन ट्यूरिंग द्वारा पूछे गए प्रश्न—"क्या कोई मशीन मनुष्य की तरह व्यवहार कर सकती है?"—के प्रति निष्ठा बनाए रखने के लिए, परीक्षण को ऐसी सामान्य परिस्थितियों पर आधारित किया जाना चाहिए जिन्हें अधिकांश लोग स्वीकार कर सकें।
तीसरा, कृत्रिम बुद्धिमत्ता (AI) ट्यूरिंग टेस्ट को केवल प्रतीकों का हेरफेर करके पास कर सकती है, न कि वास्तव में विषयवस्तु को समझकर। इसका एक प्रमुख उदाहरण "एलिज़ा" है। किसी व्यक्ति को किसी विषय पर सोचने के लिए, उसे उस विषय को समझना और प्रासंगिक अनुभव के आधार पर निर्णय लेना आवश्यक है। इसी कारण से, दार्शनिक जॉन सियरल ने भी तर्क दिया कि केवल ट्यूरिंग टेस्ट से यह सिद्ध नहीं किया जा सकता कि कोई मशीन वास्तव में सोच रही है या नहीं।
इसके अलावा, चूंकि कृत्रिम बुद्धिमत्ता पूर्वनिर्धारित एल्गोरिदम के अनुसार कार्य करती है, इसलिए अप्रत्याशित परिस्थितियों का सामना करने पर यह आसानी से त्रुटियों को उजागर कर सकती है। निम्नलिखित उदाहरण इसे स्पष्ट करता है।
वार्ताकार: क्या आप अब भी बिल क्लिंटन का समर्थन करते हैं?
जज: मैं क्लिंटन से कभी नहीं मिला।
वार्ताकार: आप बिल क्लिंटन को सचमुच नापसंद करते हैं। कम से कम, यह तो स्पष्ट है कि आप उन्हें नापसंद करते हैं। मेरी राय में, ऐसा लगता है कि अधिकांश लोग अब तक या तो उदासीन रहे हैं या उन्होंने इस बारे में ज्यादा सोचा ही नहीं है।
जज: क्या आपने 'द मार्टियन' देखी है?
वार्ताकार: चलिए, शांत हो जाइए। मैं यहाँ बेवकूफी भरे सवालों के जवाब देने नहीं आया हूँ। बात वो नहीं है। हम किस बारे में बात कर रहे थे? ठीक है। क्या आपने जो अभी कहा, उसका मतलब यह है कि व्हाइटवॉटर और विशेष वकील जैसे मूल मुद्दे गंभीर हैं?
यह बातचीत एक जज और "कैथरीन" नामक एक कृत्रिम बुद्धिमत्ता (एआई) के बीच है, जिसे ट्यूरिंग टेस्ट से एक दिन पहले की खबरों से संबंधित पूर्व-प्रोग्राम की गई जानकारी के आधार पर संवाद जारी रखने के लिए डिज़ाइन किया गया है। यदि जज बिल क्लिंटन से संबंधित राजनीतिक बातचीत जारी रखते, तो संवाद काफी स्वाभाविक बना रहता। हालांकि, जब जज ने अचानक विषय बदल दिया, तो एआई अप्रोग्राम किए गए विषय को ठीक से संभाल नहीं पाई और ऊपर दिखाई गई त्रुटि सामने आई।
इसलिए, हम यह निष्कर्ष नहीं निकाल सकते कि कोई कृत्रिम बुद्धिमत्ता (एआई) केवल इसलिए मनुष्य की तरह व्यवहार करती है क्योंकि वह एक निश्चित स्तर तक संवाद करने में सक्षम है। हालांकि सतही तौर पर यह मनुष्य जैसी बातचीत करती हुई प्रतीत हो सकती है, लेकिन वास्तव में यह विषयवस्तु को समझ नहीं रही होती, बल्कि केवल इस तरह से प्रतिक्रिया दे रही होती है जिससे यह मनुष्य जैसी लगे। अतः, यह पहले परिभाषित की गई "बुद्धिमत्ता" की अवधारणा पर खरी नहीं उतरती। वर्तमान ट्यूरिंग परीक्षण, जो उन एआई प्रणालियों को भी पास कर देता है जो केवल मानवीय व्यवहार की नकल करती हैं लेकिन वास्तव में अर्थ को नहीं समझतीं, स्पष्ट रूप से सीमित है।
ट्यूरिंग टेस्ट कृत्रिम बुद्धिमत्ता (एआई) का मूल्यांकन मनुष्यों से तुलना करके करता है, इसलिए यह एक सार्थक प्रयोग है जो मनुष्यों और एआई के बीच की सीमा का पता लगाता है। यह देखते हुए कि मनुष्य स्वयं विचार या मन के सार को स्पष्ट रूप से परिभाषित नहीं कर सकते, यह प्रयास अपने आप में महत्वपूर्ण है। दूसरी ओर, चूंकि एआई अपेक्षाकृत सरल संरचनाओं और सिद्धांतों पर काम करता है, इसलिए इसे कुछ हद तक, भले ही पूर्ण रूप से नहीं, मापा और विश्लेषण किया जा सकता है।
हालांकि, ट्यूरिंग टेस्ट बुद्धिमत्ता का सटीक आकलन करने में विफल रहता है, और इसके मूल्यांकन मानदंड भी अत्यधिक व्यक्तिपरक हैं। वास्तविक परीक्षण प्रक्रिया पर करीब से नज़र डालने पर पता चलता है कि इसे कृत्रिम बुद्धिमत्ता की व्यापक रूप से समीक्षा करने में सक्षम वातावरण के रूप में देखना कठिन है। भले ही कई निर्णायक भाग लें और कोई संस्था मूल्यांकन प्रक्रिया की देखरेख करे, मूल्यांकनकर्ताओं की संख्या सीमित होती है, और सभी कारकों को ध्यान में रखते हुए एक वस्तुनिष्ठ निष्कर्ष पर पहुँचना आसान नहीं है। इसलिए, एक ऐसा सटीक परिणाम प्राप्त करने में मूलभूत सीमाएँ हैं जिसे सभी स्वीकार कर सकें।
ट्यूरिंग परीक्षण का विशेष महत्व है क्योंकि इसने यह प्रदर्शित किया कि कृत्रिम बुद्धिमत्ता कुछ हद तक उन संज्ञानात्मक क्षमताओं की नकल कर सकती है जिन्हें कभी केवल मनुष्यों में ही पाया जाता था। इसलिए, इस परीक्षण को पूरी तरह से खारिज करने के बजाय, ऐसे मूल्यांकन मानदंड और प्रक्रियाएं स्थापित करने की आवश्यकता है जो वर्तमान में उपयोग में आने वाली प्रक्रियाओं की तुलना में अधिक सटीक और व्यापक स्तर पर स्वीकार्य हों।
इस संदर्भ में, मैं "रिवर्स ट्यूरिंग टेस्ट" को एक विकल्प के रूप में प्रस्तावित करना चाहूंगा। रिवर्स ट्यूरिंग टेस्ट में, मूल्यांकनकर्ता मनुष्य के बजाय एक कंप्यूटर होता है। दूसरे शब्दों में, यह एक ऐसी विधि है जिसमें एक कंप्यूटर किसी मनुष्य या दूसरे कंप्यूटर के साथ अंतःक्रिया करते हुए उसका मूल्यांकन करता है। इस दृष्टिकोण को मौजूदा परीक्षणों में शामिल करने से मानवीय व्यक्तिपरकता की समस्या कम हो जाएगी और मूल्यांकन अधिक वस्तुनिष्ठ वातावरण में किया जा सकेगा। बेशक, मूल्यांकनकर्ता के कृत्रिम बुद्धिमत्ता (एआई) होने से कुछ नई समस्याएं भी उत्पन्न हो सकती हैं।
विषय चाहे जो भी हो, मूल्यांकन और निर्णय के लिए डिज़ाइन किए गए परीक्षण हर किसी को संतुष्ट नहीं कर सकते, और ऐसे सटीक मानदंड स्थापित करना आसान नहीं है जिन्हें हर कोई स्वीकार कर सके। इसलिए, हमें इन्हें बेहतर बनाने के तरीकों की निरंतर खोज करनी चाहिए। विशेष रूप से, ट्यूरिंग टेस्ट एक महत्वपूर्ण मूल्यांकन विधि है जो उद्योग के भविष्य और एआई प्रौद्योगिकी विकास की दिशा को काफी हद तक प्रभावित कर सकती है, इसलिए इसे अधिक कुशल और विश्वसनीय रूप में विकसित होना आवश्यक है।
आज, कृत्रिम बुद्धिमत्ता (एआई) अभूतपूर्व गति से प्रगति कर रही है और हमारे दैनिक जीवन के हर पहलू में इसका उपयोग हो रहा है। ऐसी एआई का मूल्यांकन करते समय, हमें केवल इस आधार पर इसका आकलन नहीं करना चाहिए कि क्या यह मनुष्यों को धोखा दे सकती है, बल्कि विभिन्न परिस्थितियों में अर्थ समझने, संदर्भ को ग्रहण करने और स्वाभाविक रूप से संवाद करने की इसकी क्षमता का आकलन करना चाहिए। बेशक, चूंकि यह गणित की समस्या की तरह स्पष्ट रूप से परिभाषित "सही उत्तर" वाला क्षेत्र नहीं है, इसलिए वस्तुनिष्ठ मापदंड स्थापित करना आसान नहीं है। फिर भी, भविष्य में मनुष्यों के साथ सह-अस्तित्व में रहने वाली एआई का मूल्यांकन करने के लिए, ट्यूरिंग परीक्षण को नैतिक कारकों और प्रभावी ढंग से संवाद करने की क्षमता को व्यापक रूप से ध्यान में रखते हुए विकसित होना चाहिए।