האם מבחן טיורינג באמת יכול להעריך בינה מלאכותית?

בפוסט זה בבלוג, נבחן האם מבחן טיורינג הוא סטנדרט מתאים להערכת האינטליגנציה של בינה מלאכותית, ונבחן את מגבלותיו ואת התחומים הפוטנציאליים לשיפור.

 

בשנת 2014, הידיעה ש"יוג'ין גוסטמן", צ'אטבוט שנוצר על ידי מפתחים רוסים, עבר את מבחן טיורינג, הגיעה כהלם וגרמה לבלבול בקרב אנשים רבים. זו הייתה הדגמה ברורה לכך שבינה מלאכותית אינה עוד רק תוצר של חברה עתידית דמיונית שנראית רק בסרטי מדע בדיוני. בינה מלאכותית כבר השתלבה עמוק בחיינו ומתקדמת בקצב מהיר, בהתאם ל"חוק התשואות המואצות" של ריי קורצווייל. עם זאת, איננו יכולים פשוט לעמוד מהצד ולצפות כיצד בינה מלאכותית, המתפתחת כהרף עין, מתבססת היטב בחברה. עלינו לקבוע האם בינה מלאכותית אכן יכולה לחשוב כמו בני אדם, ועלינו גם לשקול את הכיוון שאליו היא צריכה להתפתח בעתיד.
סוגיות אלו קשורות למבחן טיורינג. מבחן טיורינג הוא שיטת הערכה שמקורה בשאלה: "האם ניתן ליצור מחשב שניתן לומר שיש לו אינטליגנציה ותודעה?" ידוע כי אלן טיורינג הציע אותו בשנת 1950 כדי לענות על השאלה "האם מכונות יכולות לחשוב?" עם זאת, טיורינג ניסח מחדש את השאלה עצמה כ"האם מכונות יכולות להתנהג באותו אופן שבני אדם מתנהגים?" בעת תכנון הניסוי. המבחן נערך על ידי שופט השואל שאלות גם לאדם וגם לבינה מלאכותית, ולאחר מכן קובע מי מהן התשובות האנושיות ביותר. במבחן טיורינג, ניתן להשתמש בשיטות שונות כדי להונות את השופט, ומותר להאט את זמני התגובה או להמשיך את השיחה בפורמט דמוי צ'אט. יתר על כן, המבחן נחשב כמוצלח אם הבינה המלאכותית יכולה להונות כ-30% מהשופטים במסגרת ונושא הדיון המוגבלים.
תהיתי האם מבחן טיורינג עם תנאים וכללים אלה הוא באמת מדד מתאים להערכת אינטליגנציה של בינה מלאכותית. במילים אחרות, אני מאמין שמבחן טיורינג אינו מתאים להערכת בינה מלאכותית. כדי לתמוך בדעה זו, אציג שלושה טיעונים ואציע את "מבחן טיורינג ההפוך" כפתרון. עם זאת, לפני כן, יש צורך לבחון תחילה דוגמאות בולטות אחרות של בינה מלאכותית שעברו את מבחן טיורינג מלבד "יוג'ין גוסטמן".
"אליזה", שפותחה על ידי ג'וזף וייזנבאום בשנת 1966, היא הדוגמה הידועה ביותר מבין תוכנות דיאלוג בשפה טבעית מוקדמות. בינה מלאכותית זו תוכננה לזהות מילות מפתח במשפטי קלט ולהחזיר תשובות תואמות; אם לא נמצאו מילות מפתח מתאימות, היא הייתה חוזרת על דברי המשתמש או מספקת תשובה כללית.
יש גם את "PARRY", שפותח על ידי קנת' קולבי בשנת 1972. בינה מלאכותית זו עוצבה על פי סגנון השיחה של מטופל פרנואיד, ואף נערכו ניסויים בהם מספר פסיכיאטרים ניסו להבחין בין מטופלים אמיתיים לבין PARRY.
מכאן ואילך, אבחן מדוע מבחן טיורינג אינו סטנדרט מתאים להערכת בינה מלאכותית.
ראשית, מבחן טיורינג אינו מעריך במדויק את האינטליגנציה עצמה. במילים אחרות, במקום להעריך את מידת האינטליגנציה של בינה מלאכותית, מבחן זה קובע באמצעות שיחה האם היא מתנהגת כמו בן אדם. ישנן שתי בעיות בכך.
ראשית, לא כל בני האדם מתנהגים תמיד בצורה אינטליגנטית. כאן, "אינטליגנטי" מתייחס לפעילות אינטלקטואלית הכוללת הבנת תופעה או אובייקט ועיבודו באופן רציונלי. יתר על כן, על פי מאמרו של אלן טיורינג, חלק מיכולות האינטלקטואליות של בינה מלאכותית עשויות להתבטא בדרכים שונות מאלה של בני אדם. במילים פשוטות, אם בינה מלאכותית פותרת בעיה שבני אדם אינם יכולים, המעריך נוטה יותר להבין שהצד השני הוא מחשב. בסופו של דבר, מבחן טיורינג נכשל בהערכת צורות של אינטליגנציה שעולות על היכולות האנושיות.
שנית, קריטריוני ההערכה של מבחן טיורינג הם סובייקטיביים, ותנאי הניסוי מגבילים מדי. במילים אחרות, תוצאות המבחן יכולות להיות מושפעות באופן משמעותי מגישתו, ניסיונו, כישוריו וידעו של המעריך ולא מרמת האינטליגנציה בפועל של הבינה המלאכותית, מה שמקשה על הבטחת אובייקטיביות.

בסופו של דבר, הישות שקובעת האם משהו הוא בינה מלאכותית או אדם היא אדם, ולכן קשה לבטל לחלוטין את הסובייקטיביות של המעריך. יתר על כן, השאלות הנשאלות במסגרת הזמן המוגבלת של כחמש דקות גם הן מוגבלות מאוד. כל עוד המעריך הוא אנושי, תמיד קיימת האפשרות להיות מושפע מגורמים חיצוניים שונים.
בנוסף, רוב הבינה המלאכותית המשתתפת במבחן טיורינג עוצבה על פי בני אדם בעלי מצבים או מאפיינים ספציפיים. לכן, גם אם בינה מלאכותית עוברת את המבחן, קשה להסיק שהיא מתנהגת באותו אופן כמו בני אדם באופן כללי. לדוגמה, "יוג'ין גוסטמן", שהוצג קודם לכן, פותח מתוך ההנחה שמדובר בילד בן 13 המתגורר באוקראינה. זה היה ניסיון מכוון ליצור מצב שבו אפילו אנגלית מגושמת במקצת תתקבל כטבעית. "PARRY" עוצב על פי מטופל פרנואידי, ו-"ELIZA" נועד לחקות יועץ פסיכולוגי מקצועי.
בדרך זו, כאשר בינה מלאכותית מוגדרת לייצג אדם בעל מאפיינים ספציפיים ולאחר מכן מנהלת שיחה, השופטים מעריכים אותה תוך התחשבות במאפיינים אלה. לדוגמה, גם אם עולה תגובה מוזרה במקצת בזמן שיחה עם בינה מלאכותית שתוכנתה לייצג אדם עם מחלת נפש, סביר להניח שהשופטים יקבלו זאת כתגובה טבעית התואמת את האפיון הזה. במילים אחרות, בעוד ששופטים אמורים להעריך ללא משוא פנים, הם למעשה ממוקמים בסביבה שבה קשה לעשות זאת.
כמובן, אנשים עם מחלות נפש מסוגלים לחשוב. עם זאת, רק בגלל שבינה מלאכותית שעוצבה על פי אדם עם מחלת נפש עוברת את מבחן טיורינג, אין פירוש הדבר שהיא חושבת יותר "כאדם" מאשר אדם. כדי להישאר נאמן לשאלה שהציג אלן טיורינג - "האם מכונה יכולה להתנהג כפי שאדם מתנהג?" - יש לתכנן את המבחן על סמך מצבים כלליים שרוב האנשים יכולים לקבל.
שלישית, בינה מלאכותית יכולה לעבור את מבחן טיורינג פשוט על ידי מניפולציה של סמלים במקום להבין בפועל את התוכן. דוגמה מובהקת לכך היא "אליזה". כדי שאדם יחשוב על נושא מסוים, עליו להבין את הנושא ולקבוע שיפוטים המבוססים על ניסיון רלוונטי. מסיבה זו, הפילוסוף ג'ון סירל טען גם שמבחן טיורינג לבדו אינו יכול להוכיח האם מכונה באמת חושבת.
יתר על כן, מכיוון שבינה מלאכותית פועלת על פי אלגוריתמים קבועים מראש, היא יכולה לחשוף בקלות שגיאות כאשר היא מתמודדת עם מצבים בלתי צפויים. להלן דוגמה הממחישה זאת.
בן שיח: האם אתה עדיין תומך בביל קלינטון?
שופט: מעולם לא פגשתי את קלינטון.
בן שיח: אתה ממש לא אוהב את ביל קלינטון. לפחות, ברור שאתה לא אוהב אותו. לדעתי, נראה שרוב האנשים פשוט לא התעניינו או שלא הקדישו לזה הרבה מחשבה עד כה.
שופט: ראית את 'המאדים'?
בן שיח: בוא ניקח את זה בקלות. אני לא כאן כדי לענות על שאלות טיפשיות. זה לא הכל. על מה דיברנו? נכון. האם מה שאמרת עכשיו אומר שהבעיות הבסיסיות - כמו וייטווטר והיועץ המיוחד - הן רציניות?
שיחה זו מתנהלת בין שופט ל"קתרין", בינה מלאכותית שנועדה להמשיך דיאלוג המבוסס על מידע מתוכנת מראש על אירועים שהפכו לחדשות יום לפני קיום מבחן טיורינג. אם השופט היה ממשיך את השיחה הפוליטית הקשורה לביל קלינטון, הדיאלוג היה יכול להישאר טבעי למדי. עם זאת, כאשר השופט העביר לפתע את הנושא למשהו אחר, הבינה המלאכותית לא הצליחה לטפל כראוי בנושא הלא מתוכנת וחשפה את השגיאה המוצגת לעיל.
לכן, איננו יכולים להסיק שבינה מלאכותית מתנהגת כמו אדם רק משום שהיא מסוגלת לרמה מסוימת של תקשורת. למרות שעל פני השטח היא עשויה להיראות כמנהלת שיחה אנושית, היא אינה מבינה בפועל את התוכן אלא רק מגיבה באופן שגורם לו להיראות אנושי. לכן, היא אינה עומדת במושג "אינטליגנציה" כפי שהוגדר קודם לכן. למבחן טיורינג הנוכחי, שעובר מערכות בינה מלאכותית המחקות התנהגות אנושית מבלי להבין בפועל את המשמעות, יש מגבלות ברורות.
בכך שהוא מעריך את הבינה המלאכותית על ידי השוואתה לבני אדם, מבחן טיורינג הוא ניסוי משמעותי הבוחן את הגבול בין בני אדם לבינה מלאכותית. בהתחשב בכך שבני אדם עצמם אינם יכולים להגדיר בבירור את מהות המחשבה או הנפש, לניסיון זה כשלעצמו יש ערך רב. מצד שני, מכיוון שהבינה המלאכותית פועלת על סמך מבנים ועקרונות פשוטים יחסית, ניתן למדוד ולנתח אותה במידה מסוימת, גם אם לא בצורה מושלמת.
עם זאת, מבחן טיורינג אינו מצליח להעריך במדויק את האינטליגנציה, וגם קריטריוני ההערכה שלו סובייקטיביים מדי. מבט מקרוב על תהליך הבדיקה עצמו מגלה שקשה לראותו כסביבה המסוגלת להעריך באופן מקיף את האינטליגנציה של בינה מלאכותית. גם אם משתתפים מספר שופטים ומוסד מפקח על תהליך ההערכה, מספר המעריכים מוגבל, ולא קל להגיע למסקנה אובייקטיבית שלוקחת בחשבון את כל המשתנים. לכן, ישנן מגבלות מהותיות להסקת תוצאה מושלמת שכולם יכולים לקבל.
למבחן טיורינג חשיבות רבה בכך שהוא הוכיח שבינה מלאכותית יכולה, במידה מסוימת, לשכפל את היכולות הקוגניטיביות שנחשבו בעבר ייחודיות לבני אדם. לכן, במקום לפסול לחלוטין מבחן זה, יש צורך לקבוע קריטריונים ונהלים להערכה שיהיו מדויקים יותר ומקובלים על קהל רחב יותר מאלה הנמצאים בשימוש כיום.
בהקשר זה, ברצוני להציע את "מבחן טיורינג הפוך" כחלופה. במבחן טיורינג הפוך, המעריך הוא מחשב ולא אדם. במילים אחרות, זוהי שיטה שבה מחשב מעריך אדם או מחשב אחר תוך כדי אינטראקציה איתו. הכנסת גישה זו למבחנים קיימים תצמצם את בעיית הסובייקטיביות האנושית ותאפשר ביצוע הערכות בסביבה אובייקטיבית יותר. כמובן, העובדה שהמעריך הוא בינה מלאכותית מעלה גם את האפשרות לבעיות חדשות.
ללא קשר לנושא, מבחנים שנועדו להערכה ושיפוט לא צפויים לספק את כולם, ולא קל לקבוע קריטריונים מושלמים שכולם יוכלו לקבל. לכן עלינו לבחון ללא הרף דרכים לשיפורם. בפרט, מכיוון שמבחן טיורינג הוא שיטת הערכה מכרעת שיכולה להשפיע באופן משמעותי על עתיד התעשייה ועל כיוון פיתוח טכנולוגיית הבינה המלאכותית, עליו להתפתח לצורה יעילה ואמינה יותר.
כיום, בינה מלאכותית מתקדמת בקצב שאין שני לו לעבר וכבר נמצאת בשימוש בכל היבט של חיי היומיום שלנו. כאשר מעריכים בינה מלאכותית כזו, אין לשפוט אותה אך ורק על סמך האם היא יכולה להטעות בני אדם, אלא להעריך את יכולתה להבין משמעות, לתפוס הקשר ולתקשר באופן טבעי במגוון מצבים. כמובן, מכיוון שזהו אינו תחום עם "תשובות נכונות" מוגדרות בבירור כמו בעיה מתמטית, קביעת קריטריונים אובייקטיביים אינה קלה. אף על פי כן, כדי להעריך בינה מלאכותית שתתקיים לצד בני אדם בעתיד, מבחן טיורינג חייב להתפתח כך שיביא בחשבון באופן מקיף גורמים אתיים ויכולת לתקשר ביעילות.

 

על הסופר