في هذه المدونة، سنبحث فيما إذا كان اختبار تورينج معيارًا مناسبًا لتقييم ذكاء الذكاء الاصطناعي، وسنستكشف قيوده ومجالات التحسين المحتملة.
في عام ٢٠١٤، شكّل خبر اجتياز "يوجين جوستمان"، وهو روبوت محادثة من ابتكار مطورين روس، لاختبار تورينج صدمةً وحيرةً لدى الكثيرين. كان هذا دليلاً واضحاً على أن الذكاء الاصطناعي لم يعد مجرد نتاج لمجتمع مستقبلي خيالي لا نراه إلا في أفلام الخيال العلمي. فقد أصبح الذكاء الاصطناعي جزءاً لا يتجزأ من حياتنا، ويتطور بوتيرة متسارعة، بما يتماشى مع "قانون العوائد المتسارعة" لراي كرزويل. مع ذلك، لا يمكننا أن نقف مكتوفي الأيدي ونشاهد الذكاء الاصطناعي، الذي يتطور بسرعة فائقة، وهو يرسخ أقدامه في المجتمع. علينا أن نحدد ما إذا كان الذكاء الاصطناعي قادراً حقاً على التفكير كما يفكر البشر، وعلينا أيضاً أن ندرس الاتجاه الذي ينبغي أن يسلكه في تطوره المستقبلي.
ترتبط هذه المسائل باختبار تورينج. اختبار تورينج هو أسلوب تقييم نشأ من السؤال: "هل من الممكن ابتكار حاسوب يمكننا القول إنه يمتلك ذكاءً وعقلاً؟" من المعروف أن آلان تورينج اقترحه عام ١٩٥٠ للإجابة على السؤال: "هل تستطيع الآلات التفكير؟" إلا أن تورينج أعاد صياغة السؤال نفسه عند تصميم التجربة ليصبح: "هل تستطيع الآلات التصرف بالطريقة نفسها التي يتصرف بها البشر؟". يُجرى الاختبار بأن يطرح مُحكِّم أسئلة على كلٍّ من إنسان وذكاء اصطناعي، ثم يُحدِّد أيّ الإجابات أقرب إلى إجابات الإنسان. في اختبار تورينج، يمكن استخدام أساليب مختلفة لخداع المُحكِّم، ويُسمح بإبطاء أوقات الاستجابة أو مواصلة المحادثة بأسلوب شبيه بالدردشة. علاوة على ذلك، يُعتبر الاختبار ناجحًا إذا استطاع الذكاء الاصطناعي خداع ما يقارب ٣٠٪ من المُحكِّمين ضمن النطاق المحدود وموضوع النقاش.
تساءلتُ عما إذا كان اختبار تورينج، بهذه الشروط والقواعد، يُعدّ مقياسًا مناسبًا حقًا لتقييم ذكاء الذكاء الاصطناعي. بعبارة أخرى، أعتقد أن اختبار تورينج غير ملائم لتقييم الذكاء الاصطناعي. ولدعم هذا الرأي، سأقدم ثلاث حجج وأقترح "اختبار تورينج العكسي" كحل. ولكن قبل ذلك، من الضروري أولًا دراسة أمثلة أخرى بارزة للذكاء الاصطناعي اجتازت اختبار تورينج، إلى جانب "يوجين جوستمان".
يُعدّ برنامج "إليزا"، الذي طوّره جوزيف وايزنباوم عام 1966، المثال الأكثر شهرة بين برامج الحوار المبكر للغة الطبيعية. صُمّم هذا البرنامج الذكي لتحديد الكلمات المفتاحية في الجمل المدخلة وتقديم ردود مناسبة؛ وإذا لم يتم العثور على كلمات مفتاحية ملائمة، فإنه يُكرّر كلمات المستخدم أو يُقدّم ردًا عامًا.
وهناك أيضًا "باري"، الذي طوره كينيث كولبي في عام 1972. تم تصميم هذا الذكاء الاصطناعي على غرار أسلوب المحادثة لمريض مصاب بجنون العظمة، بل وأجريت تجارب حاول فيها العديد من الأطباء النفسيين التمييز بين المرضى الحقيقيين وباري.
من الآن فصاعدًا، سأبحث في سبب عدم كون اختبار تورينج معيارًا مناسبًا لتقييم الذكاء الاصطناعي.
أولًا، لا يُقيّم اختبار تورينج الذكاء بدقة. بعبارة أخرى، بدلًا من تقييم مدى ذكاء الذكاء الاصطناعي في التفكير، يُحدد هذا الاختبار، من خلال المحادثة، ما إذا كان يتصرف كإنسان. وهذا ينطوي على مشكلتين.
أولًا، لا يتصرف جميع البشر بذكاء دائمًا. هنا، يُقصد بـ"الذكاء" النشاط الفكري الذي ينطوي على فهم ظاهرة أو شيء ما ومعالجته بعقلانية. علاوة على ذلك، ووفقًا لورقة آلان تورينج البحثية، قد تظهر بعض القدرات الفكرية للذكاء الاصطناعي بطرق مختلفة عن تلك التي يمتلكها البشر. ببساطة، إذا حلّ الذكاء الاصطناعي مشكلةً يعجز البشر عن حلّها، فمن المرجح أن يُدرك المُقيِّم أن الطرف الآخر هو جهاز كمبيوتر. في نهاية المطاف، يفشل اختبار تورينج في تقييم أشكال الذكاء التي تتجاوز القدرات البشرية تقييمًا صحيحًا.
ثانيًا، معايير تقييم اختبار تورينج ذاتية، وظروف التجربة مقيدة للغاية. بعبارة أخرى، يمكن أن تتأثر نتائج الاختبار بشكل كبير بموقف المُقيِّم وخبرته ومهاراته ومعرفته أكثر من تأثرها بمستوى ذكاء الذكاء الاصطناعي الفعلي، مما يجعل ضمان الموضوعية أمرًا صعبًا.
في نهاية المطاف، فإن الجهة التي تحدد ما إذا كان شيء ما ذكاءً اصطناعياً أم إنساناً هي شخص، لذا يصعب التخلص تماماً من ذاتية المُقيِّم. علاوة على ذلك، فإن الأسئلة المطروحة خلال الإطار الزمني المحدود الذي يبلغ حوالي خمس دقائق محدودة للغاية. وطالما أن المُقيِّم إنسان، فهناك دائماً احتمال تأثره بعوامل خارجية مختلفة.
بالإضافة إلى ذلك، فإن معظم أنظمة الذكاء الاصطناعي المشاركة في اختبار تورينج مصممة على غرار البشر بخصائص أو مواقف محددة. لذا، حتى لو اجتاز نظام الذكاء الاصطناعي الاختبار، يصعب الجزم بأنه يتصرف بنفس طريقة البشر عمومًا. على سبيل المثال، تم تطوير "يوجين جوستمان"، الذي عُرض سابقًا، على أساس أنه صبي يبلغ من العمر 13 عامًا يعيش في أوكرانيا. كانت هذه محاولة مقصودة لخلق وضع يُقبل فيه حتى استخدام اللغة الإنجليزية الركيكة نوعًا ما على أنه طبيعي. أما "باري" فقد صُمم على غرار مريض مصاب بجنون العظمة، بينما صُممت "إليزا" لمحاكاة مستشارة نفسية محترفة.
بهذه الطريقة، عندما يُبرمج نظام ذكاء اصطناعي لتمثيل إنسان بخصائص محددة، ثم يُجرى معه حوار، يُقيّمه الحكام مع مراعاة تلك الخصائص. على سبيل المثال، حتى لو صدر رد فعل غريب نوعًا ما أثناء التحدث مع نظام ذكاء اصطناعي مُبرمج لتمثيل شخص يعاني من مرض عقلي، فمن المرجح أن يقبله الحكام كرد فعل طبيعي يتوافق مع هذا الوصف. بعبارة أخرى، بينما يُفترض أن يُقيّم الحكام دون تحيز، إلا أنهم في الواقع يُوضعون في بيئة يصعب فيها القيام بذلك.
بالطبع، الأشخاص المصابون بأمراض عقلية قادرون على التفكير. مع ذلك، لا يعني اجتياز نظام ذكاء اصطناعي مُصمّم على غرار شخص مصاب بمرض عقلي لاختبار تورينج أنه يفكر بطريقة "إنسانية" أكثر من الإنسان. وللحفاظ على جوهر السؤال الذي طرحه آلان تورينج - "هل يمكن للآلة أن تتصرف كما يتصرف الإنسان؟" - يجب تصميم الاختبار بناءً على مواقف عامة يتقبلها غالبية الناس.
ثالثًا، يمكن للذكاء الاصطناعي اجتياز اختبار تورينج بمجرد التلاعب بالرموز دون فهم المحتوى فعليًا. ومن الأمثلة البارزة على ذلك برنامج "إليزا". لكي يفكر الإنسان في موضوع ما، يجب أن يفهمه ويصدر أحكامًا بناءً على خبرته ذات الصلة. ولهذا السبب، جادل الفيلسوف جون سيرل أيضًا بأن اختبار تورينج وحده لا يكفي لإثبات ما إذا كانت الآلة تفكر بالفعل.
علاوة على ذلك، وبما أن الذكاء الاصطناعي يعمل وفقًا لخوارزميات محددة مسبقًا، فإنه يستطيع بسهولة اكتشاف الأخطاء عند مواجهة مواقف غير متوقعة. وفيما يلي مثال يوضح ذلك.
المحاور: هل ما زلت تدعم بيل كلينتون؟
القاضي: لم ألتقِ بكلينتون قط.
المحاور: أنت تكره بيل كلينتون بشدة. على الأقل، هذا واضح. في رأيي، يبدو أن معظم الناس لم يهتموا بالأمر أو لم يفكروا فيه ملياً حتى الآن.
القاضي: هل شاهدت فيلم "المريخي"؟
المحاور: لنأخذ الأمور ببساطة. لستُ هنا للإجابة على أسئلة سخيفة. ليس هذا هو المقصود. ما الذي كنا نتحدث عنه؟ صحيح. هل ما قلته للتو يعني أن القضايا الأساسية - مثل قضية وايت ووتر والمحقق الخاص - خطيرة؟
هذا الحوار يدور بين قاضٍ و"كاثرين"، وهي ذكاء اصطناعي مصمم لمواصلة حوار مبني على معلومات مُبرمجة مسبقًا حول أحداث تصدرت عناوين الأخبار في اليوم السابق لاختبار تورينج. لو استمر القاضي في الحديث السياسي المتعلق ببيل كلينتون، لكان الحوار طبيعيًا تمامًا. لكن عندما حوّل القاضي الموضوع فجأة إلى شيء آخر، عجز الذكاء الاصطناعي عن التعامل مع الموضوع غير المُبرمج، فظهر الخطأ الموضح أعلاه.
لذا، لا يمكننا استنتاج أن الذكاء الاصطناعي يتصرف كالإنسان لمجرد قدرته على مستوى معين من التواصل. فمع أنه قد يبدو ظاهريًا وكأنه يُجري محادثة شبيهة بمحادثات البشر، إلا أنه في الحقيقة لا يفهم المحتوى، بل يكتفي بالرد بطريقة تجعله يبدو بشريًا. وبالتالي، فهو لا يرقى إلى مستوى مفهوم "الذكاء" كما عُرِّف سابقًا. ويُعاني اختبار تورينج الحالي، الذي يُجيز أنظمة الذكاء الاصطناعي التي تُحاكي السلوك البشري دون فهم معناه، من قصور واضح.
يُعد اختبار تورينج، الذي يُقيّم الذكاء الاصطناعي بمقارنته بالبشر، تجربةً قيّمةً تستكشف الحدود الفاصلة بين البشر والذكاء الاصطناعي. ونظرًا لعجز البشر عن تحديد جوهر الفكر أو العقل بدقة، فإن هذه المحاولة بحد ذاتها ذات قيمة كبيرة. من جهة أخرى، ولأن الذكاء الاصطناعي يعمل وفق هياكل ومبادئ بسيطة نسبيًا، فإنه من الممكن قياسه وتحليله إلى حد ما، وإن لم يكن بشكل كامل.
مع ذلك، يعجز اختبار تورينج عن تقييم الذكاء بدقة، كما أن معايير تقييمه ذاتية للغاية. وبالتدقيق في عملية الاختبار الفعلية، يتضح صعوبة اعتبارها بيئة قادرة على تقييم ذكاء الذكاء الاصطناعي تقييمًا شاملًا. فحتى مع مشاركة عدة محكمين وإشراف مؤسسة ما على عملية التقييم، يظل عدد المقيمين محدودًا، ويصعب التوصل إلى نتيجة موضوعية تأخذ جميع المتغيرات في الحسبان. لذا، ثمة قيود جوهرية تحول دون التوصل إلى نتيجة مثالية مقبولة للجميع.
يُعدّ اختبار تورينج ذا أهمية بالغة، إذ أثبت أن الذكاء الاصطناعي قادر، إلى حدٍّ ما، على محاكاة القدرات المعرفية التي كانت تُعتبر حكرًا على البشر. لذا، وبدلًا من تجاهل هذا الاختبار تمامًا، ثمة حاجة إلى وضع معايير وإجراءات تقييم أكثر دقةً وقبولًا لدى شريحة أوسع من الجمهور مقارنةً بالمعايير والإجراءات المُستخدمة حاليًا.
في هذا الصدد، أودّ أن أقترح "اختبار تورينج العكسي" كبديل. في هذا الاختبار، يكون المُقيِّم حاسوبًا وليس إنسانًا. بعبارة أخرى، هي طريقة يُقيِّم فيها الحاسوب إنسانًا أو حاسوبًا آخر أثناء تفاعله معه. من شأن إدخال هذا النهج في الاختبارات الحالية أن يُقلِّل من مشكلة الذاتية البشرية، ويُتيح إجراء التقييمات في بيئة أكثر موضوعية. بالطبع، كون المُقيِّم ذكاءً اصطناعيًا يُثير أيضًا احتمالية ظهور مشكلات جديدة.
بغض النظر عن الموضوع، من غير المرجح أن تُرضي الاختبارات المصممة للتقييم والحكم جميع الأذواق، وليس من السهل وضع معايير مثالية مقبولة لدى الجميع. لذا، يجب علينا البحث باستمرار عن سبل لتحسينها. وبشكل خاص، بما أن اختبار تورينج يُعدّ أسلوب تقييم بالغ الأهمية، إذ يُمكن أن يؤثر بشكل كبير على مستقبل الصناعة وتوجهات تطوير تقنيات الذكاء الاصطناعي، فلا بد من تطويره ليصبح أكثر كفاءة وموثوقية.
يشهد الذكاء الاصطناعي اليوم تقدماً متسارعاً غير مسبوق، ويُستخدم بالفعل في شتى جوانب حياتنا اليومية. عند تقييم هذا النوع من الذكاء الاصطناعي، لا ينبغي أن نحكم عليه فقط بقدرته على خداع البشر، بل يجب أن نقيّم قدرته على فهم المعنى، واستيعاب السياق، والتواصل بسلاسة في مختلف المواقف. بالطبع، ولأن هذا المجال لا يخضع لمعايير محددة بوضوح كالمسائل الرياضية، فإن وضع معايير موضوعية ليس بالأمر الهين. مع ذلك، لتقييم الذكاء الاصطناعي الذي سيتعايش مع البشر في المستقبل، يجب أن يتطور اختبار تورينج ليشمل بشكل شامل العوامل الأخلاقية والقدرة على التواصل بفعالية.