এই ব্লগ পোস্টে আমরা খতিয়ে দেখব যে, কৃত্রিম বুদ্ধিমত্তার বুদ্ধিমত্তা মূল্যায়নের জন্য টিউরিং টেস্ট একটি উপযুক্ত মানদণ্ড কি না এবং এর সীমাবদ্ধতা ও উন্নতির সম্ভাব্য ক্ষেত্রগুলো অন্বেষণ করব।
২০১৪ সালে, রুশ ডেভেলপারদের তৈরি একটি চ্যাটবট ‘ইউজিন গুস্টম্যান’ টিউরিং টেস্টে উত্তীর্ণ হয়েছে—এই খবরটি অনেকের জন্য একটি বড় ধাক্কা ছিল এবং বিভ্রান্তির সৃষ্টি করেছিল। এটি ছিল একটি সুস্পষ্ট প্রমাণ যে, কৃত্রিম বুদ্ধিমত্তা এখন আর কেবল সায়েন্স ফিকশন সিনেমায় দেখা কোনো কাল্পনিক ভবিষ্যৎ সমাজের ফসল নয়। এআই ইতোমধ্যেই আমাদের জীবনে গভীরভাবে মিশে গেছে এবং রে কার্জওয়েলের ‘ত্বরান্বিত প্রতিদানের সূত্র’ অনুসারে দ্রুত গতিতে এগিয়ে চলেছে। তবে, চোখের পলকে বিবর্তিত হতে থাকা এআই যখন সমাজে দৃঢ়ভাবে প্রতিষ্ঠিত হয়ে যাচ্ছে, তখন আমরা কেবল হাত গুটিয়ে বসে তা দেখতে পারি না। এআই সত্যিই মানুষের মতো চিন্তা করতে পারে কি না, তা আমাদের নির্ধারণ করতে হবে এবং ভবিষ্যতে এর বিকাশের অভিমুখ কোন দিকে হওয়া উচিত, সে বিষয়েও আমাদের ভাবতে হবে।
এই বিষয়গুলো টিউরিং টেস্টের সাথে সম্পর্কিত। টিউরিং টেস্ট হলো একটি মূল্যায়ন পদ্ধতি, যার উৎপত্তি হয়েছে এই প্রশ্ন থেকে: “এমন একটি কম্পিউটার তৈরি করা কি সম্ভব, যাকে আমরা বুদ্ধি এবং মনসম্পন্ন বলতে পারি?” এটি সর্বজনবিদিত যে, অ্যালান টিউরিং ১৯৫০ সালে “যন্ত্র কি চিন্তা করতে পারে?”—এই প্রশ্নের উত্তর খোঁজার জন্য এটি প্রস্তাব করেছিলেন। তবে, পরীক্ষাটি ডিজাইন করার সময় টিউরিং আসলে প্রশ্নটিকে এভাবে পুনর্বিন্যাস করেছিলেন: “যন্ত্র কি মানুষের মতো আচরণ করতে পারে?” এই পরীক্ষাটি পরিচালিত হয় একজন বিচারকের মাধ্যমে, যিনি একজন মানুষ এবং একটি এআই (AI) উভয়কেই প্রশ্ন করেন এবং তারপর নির্ধারণ করেন কার উত্তরগুলো বেশি মানবিক। টিউরিং টেস্টে বিচারককে ধোঁকা দেওয়ার জন্য বিভিন্ন পদ্ধতি ব্যবহার করা যেতে পারে এবং উত্তরের সময় কমিয়ে আনা বা চ্যাটের মতো বিন্যাসে কথোপকথন চালিয়ে যাওয়া অনুমোদিত। এছাড়াও, আলোচনার সীমিত পরিসর এবং বিষয়ের মধ্যে যদি এআই প্রায় ৩০% বিচারককে ধোঁকা দিতে পারে, তবে পরীক্ষাটি উত্তীর্ণ বলে বিবেচিত হয়।
আমি প্রশ্ন তুলেছিলাম যে, এই শর্ত ও নিয়মাবলী সহ একটি টিউরিং টেস্ট কৃত্রিম বুদ্ধিমত্তার বুদ্ধিমত্তা মূল্যায়নের জন্য সত্যিই একটি উপযুক্ত পরিমাপক কি না। অন্য কথায়, আমি বিশ্বাস করি যে কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের জন্য টিউরিং টেস্ট উপযুক্ত নয়। এই মতকে সমর্থন করার জন্য, আমি তিনটি যুক্তি উপস্থাপন করব এবং সমাধান হিসেবে “রিভার্স টিউরিং টেস্ট” প্রস্তাব করব। তবে, তা করার আগে, “ইউজিন গুস্টম্যান” ছাড়াও কৃত্রিম বুদ্ধিমত্তার অন্যান্য উল্লেখযোগ্য উদাহরণগুলো পরীক্ষা করা প্রয়োজন, যেগুলো টিউরিং টেস্টে উত্তীর্ণ হয়েছে।
১৯৬৬ সালে জোসেফ ভাইজেনবাউম কর্তৃক উদ্ভাবিত “এলিজা” হলো প্রাথমিক যুগের স্বাভাবিক ভাষা সংলাপ প্রোগ্রামগুলোর মধ্যে সবচেয়ে বহুল পরিচিত উদাহরণ। এই এআই-টিকে ইনপুট করা বাক্য থেকে মূল শব্দগুলো শনাক্ত করে সেই অনুযায়ী প্রতিক্রিয়া জানানোর জন্য ডিজাইন করা হয়েছিল; যদি কোনো উপযুক্ত শব্দ খুঁজে না পাওয়া যেত, তবে এটি ব্যবহারকারীর কথাগুলো পুনরাবৃত্তি করত অথবা একটি সাধারণ উত্তর দিত।
এছাড়াও রয়েছে “প্যারি”, যা ১৯৭২ সালে কেনেথ কোলবি তৈরি করেন। এই এআই-টি একজন প্যারানয়েড রোগীর কথোপকথনের ধরন অনুকরণ করে তৈরি করা হয়েছিল, এবং এমনকি এমন পরীক্ষাও চালানো হয়েছিল যেখানে বেশ কয়েকজন মনোরোগ বিশেষজ্ঞ আসল রোগী এবং প্যারির মধ্যে পার্থক্য করার চেষ্টা করেছিলেন।
এরপর থেকে আমি আলোচনা করব কেন কৃত্রিম বুদ্ধিমত্তা মূল্যায়নের জন্য টিউরিং টেস্ট একটি উপযুক্ত মানদণ্ড নয়।
প্রথমত, টিউরিং টেস্ট সরাসরি বুদ্ধিমত্তাকে সঠিকভাবে মূল্যায়ন করে না। অন্য কথায়, একটি এআই কতটা বুদ্ধিমত্তার সাথে চিন্তা করে তা মূল্যায়ন করার পরিবর্তে, এই পরীক্ষাটি কথোপকথনের মাধ্যমে নির্ধারণ করে যে এটি মানুষের মতো আচরণ করে কি না। এতে দুটি সমস্যা রয়েছে।
প্রথমত, সব মানুষ সবসময় বুদ্ধিমত্তার সাথে আচরণ করে না। এখানে, “বুদ্ধিমান” বলতে সেই বুদ্ধিবৃত্তিক কার্যকলাপকে বোঝানো হয়েছে, যার মধ্যে কোনো ঘটনা বা বস্তুকে বোঝা এবং সেটিকে যৌক্তিকভাবে বিশ্লেষণ করা অন্তর্ভুক্ত। অধিকন্তু, অ্যালান টিউরিং-এর গবেষণাপত্র অনুসারে, কৃত্রিম বুদ্ধিমত্তার (AI) কিছু বুদ্ধিবৃত্তিক ক্ষমতা মানুষের থেকে ভিন্নভাবে প্রকাশ পেতে পারে। সহজ কথায়, যদি একটি AI এমন কোনো সমস্যার সমাধান করে যা মানুষ পারে না, তবে মূল্যায়নকারীর পক্ষে এটি উপলব্ধি করার সম্ভাবনা বেশি থাকে যে অপর পক্ষটি একটি কম্পিউটার। পরিশেষে, টিউরিং টেস্ট মানুষের সক্ষমতাকে ছাড়িয়ে যাওয়া বুদ্ধিমত্তার রূপগুলোকে সঠিকভাবে মূল্যায়ন করতে ব্যর্থ হয়।
দ্বিতীয়ত, টিউরিং টেস্টের মূল্যায়ন মানদণ্ড ব্যক্তিনিষ্ঠ এবং পরীক্ষামূলক শর্তগুলো অতিরিক্ত সীমাবদ্ধ। অন্য কথায়, এআই-এর প্রকৃত বুদ্ধিমত্তার স্তরের চেয়ে মূল্যায়নকারীর মনোভাব, অভিজ্ঞতা, দক্ষতা এবং জ্ঞান দ্বারা পরীক্ষার ফলাফল উল্লেখযোগ্যভাবে প্রভাবিত হতে পারে, যা বস্তুনিষ্ঠতা নিশ্চিত করা কঠিন করে তোলে।
শেষ পর্যন্ত, কোনো কিছু কৃত্রিম বুদ্ধিমত্তা (AI) নাকি মানুষ, তা নির্ধারণকারী সত্তাটি একজন ব্যক্তিই, তাই মূল্যায়নকারীর ব্যক্তিনিষ্ঠতাকে সম্পূর্ণরূপে দূর করা কঠিন। উপরন্তু, প্রায় পাঁচ মিনিটের সীমিত সময়সীমার মধ্যে জিজ্ঞাসা করা প্রশ্নগুলোও খুব সীমাবদ্ধ থাকে। যতক্ষণ মূল্যায়নকারী মানুষ, ততক্ষণ বিভিন্ন বাহ্যিক কারণ দ্বারা প্রভাবিত হওয়ার সম্ভাবনা সবসময়ই থাকে।
এছাড়াও, টিউরিং টেস্টে অংশগ্রহণকারী বেশিরভাগ এআই-কেই নির্দিষ্ট পরিস্থিতি বা বৈশিষ্ট্যসম্পন্ন মানুষের আদলে তৈরি করা হয়। তাই, কোনো এআই পরীক্ষায় উত্তীর্ণ হলেও, এটি সাধারণভাবে মানুষের মতোই আচরণ করে—এই সিদ্ধান্তে আসা কঠিন। উদাহরণস্বরূপ, পূর্বে উল্লিখিত “ইউজিন গুস্টম্যান”-কে এই ধারণার ওপর ভিত্তি করে তৈরি করা হয়েছিল যে সে ইউক্রেনে বসবাসকারী ১৩ বছর বয়সী এক বালক। এটি ছিল এমন একটি পরিস্থিতি তৈরির ইচ্ছাকৃত প্রচেষ্টা, যেখানে কিছুটা অগোছালো ইংরেজিও স্বাভাবিক বলে গৃহীত হবে। “প্যারি”-কে একজন প্যারানয়েড রোগীর আদলে তৈরি করা হয়েছিল, এবং “এলাইজা”-কে একজন পেশাদার মনস্তাত্ত্বিক পরামর্শদাতার অনুকরণে ডিজাইন করা হয়েছিল।
এইভাবে, যখন কোনো এআই-কে নির্দিষ্ট বৈশিষ্ট্যসম্পন্ন একজন মানুষের প্রতিনিধিত্ব করার জন্য প্রস্তুত করা হয় এবং তারপর কথোপকথনে নিযুক্ত করা হয়, তখন বিচারকরা সেই বৈশিষ্ট্যগুলো মাথায় রেখেই সেটির মূল্যায়ন করেন। উদাহরণস্বরূপ, মানসিক অসুস্থতাসম্পন্ন কোনো ব্যক্তির প্রতিনিধিত্ব করার জন্য প্রোগ্রাম করা একটি এআই-এর সাথে কথোপকথনের সময় যদি কিছুটা অদ্ভুত প্রতিক্রিয়াও আসে, বিচারকরা সম্ভবত সেটিকে সেই বৈশিষ্ট্যায়নের সাথে সামঞ্জস্যপূর্ণ একটি স্বাভাবিক প্রতিক্রিয়া হিসেবেই গ্রহণ করবেন। অন্য কথায়, যদিও বিচারকদের পক্ষপাতহীনভাবে মূল্যায়ন করার কথা, বাস্তবে তাঁদের এমন একটি পরিবেশে রাখা হয় যেখানে তা করা কঠিন।
অবশ্যই, মানসিক অসুস্থতায় আক্রান্ত ব্যক্তিরাও চিন্তা করতে সক্ষম। তবে, মানসিক অসুস্থতায় আক্রান্ত কোনো ব্যক্তির আদলে তৈরি একটি এআই টিউরিং টেস্টে উত্তীর্ণ হলেই যে সেটি মানুষের চেয়ে বেশি ‘মানুষের মতো’ চিন্তা করে, তা নয়। অ্যালান টিউরিং-এর উত্থাপিত প্রশ্ন—"একটি যন্ত্র কি মানুষের মতো আচরণ করতে পারে?"—এর প্রতি বিশ্বস্ত থাকতে হলে, পরীক্ষাটি এমন সাধারণ পরিস্থিতির ওপর ভিত্তি করে তৈরি করতে হবে যা অধিকাংশ মানুষ মেনে নিতে পারে।
তৃতীয়ত, কৃত্রিম বুদ্ধিমত্তা কোনো বিষয়বস্তু না বুঝেও শুধুমাত্র প্রতীক ব্যবহার করে টিউরিং টেস্টে উত্তীর্ণ হতে পারে। এর একটি প্রধান উদাহরণ হলো “এলাইজা”। কোনো ব্যক্তি যদি কোনো বিষয় নিয়ে চিন্তা করতে চায়, তবে তাকে সেই বিষয়টি বুঝতে হবে এবং প্রাসঙ্গিক অভিজ্ঞতার ভিত্তিতে সিদ্ধান্ত নিতে হবে। এই কারণে দার্শনিক জন সার্লও যুক্তি দিয়েছিলেন যে, শুধুমাত্র টিউরিং টেস্টের মাধ্যমে প্রমাণ করা যায় না যে একটি যন্ত্র আসলেই চিন্তা করছে কি না।
তাছাড়া, যেহেতু কৃত্রিম বুদ্ধিমত্তা পূর্বনির্ধারিত অ্যালগরিদম অনুযায়ী কাজ করে, তাই অপ্রত্যাশিত পরিস্থিতির সম্মুখীন হলে এটি সহজেই ভুলগুলো প্রকাশ করতে পারে। নিচে এর একটি উদাহরণ দেওয়া হলো।
প্রশ্নকর্তা: আপনি কি এখনও বিল ক্লিনটনকে সমর্থন করেন?
বিচারক: আমার ক্লিনটনের সাথে কখনো দেখা হয়নি।
কথোপকথনকারী: আপনি বিল ক্লিনটনকে সত্যিই অপছন্দ করেন। অন্তত, এটা স্পষ্ট যে আপনি তাকে অপছন্দ করেন। আমার মতে, এখন পর্যন্ত বেশিরভাগ মানুষ হয় এ বিষয়ে অনাগ্রহী ছিলেন অথবা বিষয়টি নিয়ে তেমন ভাবেননি।
বিচারক: আপনি কি 'দ্য মার্সিয়ান' দেখেছেন?
কথোপকথনকারী: শান্ত হোন। আমি এখানে বোকার মতো প্রশ্নের উত্তর দিতে আসিনি। ব্যাপারটা তা নয়। আমরা কী নিয়ে কথা বলছিলাম? ঠিক। আপনি এইমাত্র যা বললেন, তার মানে কি এই যে মূল বিষয়গুলো—যেমন হোয়াইটওয়াটার এবং বিশেষ পরামর্শক—গুরুতর?
এই কথোপকথনটি একজন বিচারক এবং “ক্যাথরিন” নামক একটি এআই-এর মধ্যে হচ্ছে, যাকে টিউরিং টেস্ট অনুষ্ঠিত হওয়ার আগের দিন সংবাদে পরিণত হওয়া ঘটনা সম্পর্কিত পূর্ব-প্রোগ্রাম করা তথ্যের ভিত্তিতে একটি সংলাপ চালিয়ে যাওয়ার জন্য ডিজাইন করা হয়েছে। যদি বিচারক বিল ক্লিনটন সম্পর্কিত রাজনৈতিক আলোচনাটি চালিয়ে যেতেন, তাহলে সংলাপটি বেশ স্বাভাবিক থাকতে পারত। কিন্তু, যখন বিচারক হঠাৎ করে আলোচনার বিষয় পরিবর্তন করে অন্য কিছু নিয়ে কথা বলতে শুরু করেন, তখন এআই-টি সেই অপ্রোগ্রাম করা বিষয়টি সঠিকভাবে সামলাতে পারেনি এবং উপরে দেখানো ত্রুটিটি প্রকাশ করে।
সুতরাং, শুধুমাত্র একটি নির্দিষ্ট স্তরের যোগাযোগে সক্ষম বলেই আমরা এই সিদ্ধান্তে আসতে পারি না যে একটি এআই মানুষের মতো আচরণ করে। যদিও বাহ্যিকভাবে এটিকে মানুষের মতো কথোপকথনে লিপ্ত হতে দেখা যেতে পারে, এটি আসলে বিষয়বস্তু বোঝে না, বরং এমনভাবে প্রতিক্রিয়া জানায় যা এটিকে মানবিক বলে মনে করায়। অতএব, এটি পূর্বে সংজ্ঞায়িত "বুদ্ধিমত্তা"র ধারণার মানদণ্ড পূরণ করতে ব্যর্থ হয়। বর্তমান টিউরিং টেস্টের সুস্পষ্ট সীমাবদ্ধতা রয়েছে, যা এমন এআই সিস্টেমগুলোকেও পাশ করিয়ে দেয় যেগুলো প্রকৃত অর্থ না বুঝেই কেবল মানুষের আচরণের অনুকরণ করে।
যেহেতু এটি মানুষের সাথে তুলনা করে কৃত্রিম বুদ্ধিমত্তাকে মূল্যায়ন করে, তাই টিউরিং টেস্ট একটি অর্থবহ পরীক্ষা যা মানুষ ও কৃত্রিম বুদ্ধিমত্তার মধ্যকার সীমারেখা অন্বেষণ করে। যেহেতু মানুষ নিজেরাই চিন্তা বা মনের সারমর্মকে স্পষ্টভাবে সংজ্ঞায়িত করতে পারে না, তাই এই প্রচেষ্টাটির নিজস্ব একটি তাৎপর্যপূর্ণ মূল্য রয়েছে। অন্যদিকে, যেহেতু কৃত্রিম বুদ্ধিমত্তা তুলনামূলকভাবে সরল কাঠামো এবং নীতির উপর ভিত্তি করে কাজ করে, তাই একে নিখুঁতভাবে না হলেও, একটি নির্দিষ্ট সীমা পর্যন্ত পরিমাপ ও বিশ্লেষণ করা সম্ভব।
তবে, টিউরিং টেস্ট বুদ্ধিমত্তা সঠিকভাবে মূল্যায়ন করতে ব্যর্থ হয় এবং এর মূল্যায়নের মানদণ্ডও অতিরিক্ত ব্যক্তিনিষ্ঠ। প্রকৃত পরীক্ষা প্রক্রিয়াটি নিবিড়ভাবে পর্যবেক্ষণ করলে দেখা যায় যে, এটিকে একটি কৃত্রিম বুদ্ধিমত্তার বুদ্ধিমত্তাকে সার্বিকভাবে মূল্যায়ন করতে সক্ষম একটি পরিবেশ হিসেবে বিবেচনা করা কঠিন। একাধিক বিচারক অংশগ্রহণ করলেও এবং কোনো প্রতিষ্ঠান মূল্যায়ন প্রক্রিয়াটি তত্ত্বাবধান করলেও, মূল্যায়নকারীর সংখ্যা সীমিত থাকে এবং সমস্ত চলক বিবেচনায় নিয়ে একটি বস্তুনিষ্ঠ সিদ্ধান্তে পৌঁছানো সহজ নয়। সুতরাং, এমন একটি নিখুঁত ফলাফল বের করার ক্ষেত্রে মৌলিক সীমাবদ্ধতা রয়েছে যা সবাই গ্রহণ করতে পারে।
টিউরিং টেস্টের একটি বিশেষ গুরুত্ব রয়েছে, কারণ এটি প্রমাণ করেছে যে কৃত্রিম বুদ্ধিমত্তা (AI) একটি নির্দিষ্ট সীমা পর্যন্ত সেইসব জ্ঞানীয় ক্ষমতা অনুকরণ করতে পারে, যা একসময় কেবল মানুষেরই অনন্য বৈশিষ্ট্য বলে মনে করা হতো। সুতরাং, এই পরীক্ষাটিকে পুরোপুরি বাতিল না করে, বর্তমানে ব্যবহৃত পদ্ধতির চেয়ে আরও নির্ভুল এবং বৃহত্তর জনগোষ্ঠীর কাছে গ্রহণযোগ্য মূল্যায়ন মানদণ্ড ও পদ্ধতি প্রতিষ্ঠা করার প্রয়োজন রয়েছে।
এই প্রসঙ্গে, আমি একটি বিকল্প হিসেবে “রিভার্স টিউরিং টেস্ট” প্রস্তাব করতে চাই। রিভার্স টিউরিং টেস্টে, মূল্যায়নকারী মানুষ না হয়ে একটি কম্পিউটার হয়। অন্য কথায়, এটি এমন একটি পদ্ধতি যেখানে একটি কম্পিউটার কোনো মানুষ বা অন্য কম্পিউটারের সাথে মিথস্ক্রিয়া করার সময় সেটিকে মূল্যায়ন করে। প্রচলিত পরীক্ষাগুলোতে এই পদ্ধতি চালু করলে মানুষের ব্যক্তিনিষ্ঠতার সমস্যা কমে আসবে এবং আরও বস্তুনিষ্ঠ পরিবেশে মূল্যায়ন পরিচালনা করা সম্ভব হবে। অবশ্যই, মূল্যায়নকারী একটি এআই হওয়ায় নতুন কিছু সমস্যার সম্ভাবনাও তৈরি হয়।
বিষয় নির্বিশেষে, মূল্যায়ন ও বিচারের জন্য তৈরি পরীক্ষাগুলো সম্ভবত সবাইকে সন্তুষ্ট করতে পারে না, এবং এমন নিখুঁত মানদণ্ড প্রতিষ্ঠা করাও সহজ নয় যা সবাই গ্রহণ করতে পারে। তাই, আমাদের অবশ্যই এগুলোকে উন্নত করার উপায় ক্রমাগত অন্বেষণ করতে হবে। বিশেষ করে, যেহেতু টিউরিং টেস্ট একটি অত্যন্ত গুরুত্বপূর্ণ মূল্যায়ন পদ্ধতি যা শিল্পের ভবিষ্যৎ এবং এআই প্রযুক্তির বিকাশের গতিপথকে উল্লেখযোগ্যভাবে প্রভাবিত করতে পারে, তাই এটিকে অবশ্যই আরও কার্যকর ও নির্ভরযোগ্য রূপে বিকশিত হতে হবে।
বর্তমানে, কৃত্রিম বুদ্ধিমত্তা (এআই) অতীতের তুলনায় অভূতপূর্ব গতিতে এগিয়ে চলেছে এবং ইতোমধ্যেই আমাদের দৈনন্দিন জীবনের প্রতিটি ক্ষেত্রে এর ব্যবহার শুরু হয়েছে। এই ধরনের এআই-কে মূল্যায়ন করার সময়, এটি মানুষকে ধোঁকা দিতে পারে কি না, শুধু তার উপর ভিত্তি করে এর বিচার করা উচিত নয়, বরং এর অর্থ বোঝার, প্রেক্ষাপট অনুধাবন করার এবং বিভিন্ন পরিস্থিতিতে স্বাভাবিকভাবে যোগাযোগ করার ক্ষমতা মূল্যায়ন করা উচিত। অবশ্যই, যেহেতু এটি গণিতের সমস্যার মতো সুস্পষ্টভাবে সংজ্ঞায়িত "সঠিক উত্তর" সহ কোনো ক্ষেত্র নয়, তাই বস্তুনিষ্ঠ মানদণ্ড স্থাপন করা সহজ নয়। তথাপি, ভবিষ্যতে মানুষের সাথে সহাবস্থান করবে এমন এআই-কে মূল্যায়ন করার জন্য, নৈতিক বিষয় এবং কার্যকরভাবে যোগাযোগ করার ক্ষমতাকে সামগ্রিকভাবে বিবেচনা করতে টিউরিং টেস্টের বিবর্তন ঘটা আবশ্যক।