การทดสอบทัวริงสามารถประเมินปัญญาประดิษฐ์ได้อย่างแท้จริงหรือไม่?

ในบทความนี้ เราจะมาพิจารณาว่าการทดสอบทัวริงเป็นมาตรฐานที่เหมาะสมสำหรับการประเมินความฉลาดของปัญญาประดิษฐ์หรือไม่ รวมถึงข้อจำกัดและจุดที่สามารถปรับปรุงได้

 

ในปี 2014 ข่าวที่ว่า “ยูจีน กูสต์แมน” แชทบอทที่สร้างโดยนักพัฒนาชาวรัสเซีย ผ่านการทดสอบทัวริงได้นั้น สร้างความตกใจและสับสนให้กับผู้คนจำนวนมาก นี่เป็นการแสดงให้เห็นอย่างชัดเจนว่าปัญญาประดิษฐ์ไม่ได้เป็นเพียงผลผลิตของสังคมในอนาคตในจินตนาการที่เห็นได้เฉพาะในภาพยนตร์วิทยาศาสตร์อีกต่อไป ปัญญาประดิษฐ์ได้ฝังตัวอยู่ในชีวิตของเราอย่างลึกซึ้งแล้ว และกำลังก้าวหน้าอย่างรวดเร็ว สอดคล้องกับ “กฎแห่งผลตอบแทนที่เร่งตัวขึ้น” ของเรย์ เคิร์ซไวล์ อย่างไรก็ตาม เราไม่สามารถนิ่งเฉยและเฝ้าดูปัญญาประดิษฐ์ซึ่งกำลังพัฒนาอย่างรวดเร็วในพริบตาเดียว กลายมาเป็นส่วนหนึ่งของสังคมอย่างมั่นคงได้ เราจำเป็นต้องพิจารณาว่าปัญญาประดิษฐ์สามารถคิดได้เหมือนมนุษย์หรือไม่ และเราต้องพิจารณาถึงทิศทางการพัฒนาของมันในอนาคตด้วย
ประเด็นเหล่านี้เชื่อมโยงกับการทดสอบทัวริง การทดสอบทัวริงเป็นวิธีการประเมินที่มาจากคำถามที่ว่า “เป็นไปได้หรือไม่ที่จะสร้างคอมพิวเตอร์ที่เราสามารถกล่าวได้ว่ามีสติปัญญาและจิตใจ?” เป็นที่ทราบกันดีว่าอลัน ทัวริงเสนอการทดสอบนี้ในปี 1950 เพื่อตอบคำถามที่ว่า “เครื่องจักรสามารถคิดได้หรือไม่?” อย่างไรก็ตาม ทัวริงได้ปรับเปลี่ยนคำถามนั้นเป็น “เครื่องจักรสามารถประพฤติตัวในลักษณะเดียวกับมนุษย์ได้หรือไม่?” เมื่อออกแบบการทดลอง การทดสอบนี้ดำเนินการโดยให้กรรมการตั้งคำถามกับทั้งมนุษย์และปัญญาประดิษฐ์ จากนั้นจึงพิจารณาว่าคำตอบของใครมีความคล้ายคลึงกับมนุษย์มากกว่า ในการทดสอบทัวริง สามารถใช้วิธีการต่างๆ เพื่อหลอกลวงกรรมการได้ และอนุญาตให้ลดความเร็วในการตอบสนองหรือสนทนาต่อในรูปแบบแชทได้ นอกจากนี้ การทดสอบจะถือว่าผ่านหากปัญญาประดิษฐ์สามารถหลอกลวงกรรมการได้ประมาณ 30% ภายในขอบเขตและหัวข้อการสนทนาที่จำกัด
ผมตั้งคำถามว่า การทดสอบทัวริงภายใต้เงื่อนไขและกฎเกณฑ์เหล่านี้เป็นมาตรวัดที่เหมาะสมสำหรับการประเมินสติปัญญาของ AI จริงหรือไม่ กล่าวอีกนัยหนึ่ง ผมเชื่อว่าการทดสอบทัวริงไม่เหมาะสมสำหรับการประเมิน AI เพื่อสนับสนุนมุมมองนี้ ผมจะนำเสนอข้อโต้แย้งสามประการและเสนอ "การทดสอบทัวริงแบบย้อนกลับ" เป็นทางออก อย่างไรก็ตาม ก่อนที่จะทำเช่นนั้น จำเป็นต้องตรวจสอบตัวอย่าง AI ที่โดดเด่นอื่นๆ ที่ผ่านการทดสอบทัวริงนอกเหนือจาก "ยูจีน กูสต์แมน" ก่อน
“ELIZA” ซึ่งพัฒนาโดยโจเซฟ ไวเซนบอมในปี 1966 เป็นตัวอย่างที่รู้จักกันอย่างแพร่หลายที่สุดในบรรดาโปรแกรมสนทนาภาษาธรรมชาติยุคแรกๆ ปัญญาประดิษฐ์นี้ได้รับการออกแบบมาเพื่อระบุคำสำคัญในประโยคที่ป้อนเข้ามาและส่งคำตอบที่สอดคล้องกัน หากไม่พบคำสำคัญที่เหมาะสม มันจะพูดซ้ำคำพูดของผู้ใช้หรือให้คำตอบทั่วไป
นอกจากนี้ยังมี “PARRY” ซึ่งพัฒนาโดย Kenneth Colby ในปี 1972 ปัญญาประดิษฐ์นี้จำลองมาจากรูปแบบการสนทนาของผู้ป่วยที่มีอาการหวาดระแวง และมีการทดลองที่จิตแพทย์หลายคนพยายามแยกแยะระหว่างผู้ป่วยจริงกับ PARRY ด้วย
จากนี้ไป ผมจะพิจารณาว่าเหตุใดการทดสอบทัวริงจึงไม่ใช่มาตรฐานที่เหมาะสมสำหรับการประเมินปัญญาประดิษฐ์
ประการแรก การทดสอบทัวริงไม่ได้ประเมินสติปัญญาอย่างแม่นยำ กล่าวคือ แทนที่จะประเมินว่า AI คิดอย่างชาญฉลาดเพียงใด การทดสอบนี้จะตรวจสอบผ่านการสนทนาว่ามันมีพฤติกรรมเหมือนมนุษย์หรือไม่ ซึ่งมีปัญหาอยู่สองประการ
ประการแรก ไม่ใช่ว่ามนุษย์ทุกคนจะประพฤติตนอย่างชาญฉลาดเสมอไป ในที่นี้ “ชาญฉลาด” หมายถึงกิจกรรมทางปัญญาที่เกี่ยวข้องกับการทำความเข้าใจปรากฏการณ์หรือวัตถุ และประมวลผลอย่างมีเหตุผล ยิ่งไปกว่านั้น ตามบทความของอลัน ทัวริง ความสามารถทางปัญญาบางอย่างของ AI อาจแสดงออกมาในรูปแบบที่แตกต่างจากมนุษย์ กล่าวคือ หาก AI แก้ปัญหาที่มนุษย์แก้ไม่ได้ ผู้ประเมินก็มีแนวโน้มที่จะตระหนักว่าอีกฝ่ายเป็นคอมพิวเตอร์ ในที่สุด การทดสอบทัวริงจึงล้มเหลวในการประเมินรูปแบบของสติปัญญาที่เหนือกว่าความสามารถของมนุษย์อย่างถูกต้อง
ประการที่สอง เกณฑ์การประเมินของการทดสอบทัวริงนั้นเป็นอัตวิสัย และเงื่อนไขการทดลองก็เข้มงวดเกินไป กล่าวคือ ผลการทดสอบอาจได้รับอิทธิพลอย่างมากจากทัศนคติ ประสบการณ์ ทักษะ และความรู้ของผู้ประเมิน มากกว่าระดับสติปัญญาที่แท้จริงของ AI ทำให้ยากที่จะรับประกันความเป็นกลาง

ท้ายที่สุดแล้ว ผู้ที่ตัดสินว่าสิ่งใดเป็น AI หรือมนุษย์นั้นก็คือมนุษย์ ดังนั้นจึงเป็นเรื่องยากที่จะขจัดอคติส่วนตัวของผู้ประเมินออกไปได้อย่างสมบูรณ์ นอกจากนี้ คำถามที่ถามภายในกรอบเวลาที่จำกัดประมาณห้านาทีก็ค่อนข้างจำกัดเช่นกัน ตราบใดที่ผู้ประเมินเป็นมนุษย์ ก็ย่อมมีความเป็นไปได้ที่จะได้รับอิทธิพลจากปัจจัยภายนอกต่างๆ เสมอ
นอกจากนี้ AI ส่วนใหญ่ที่เข้าร่วมในการทดสอบทัวริงนั้นถูกจำลองมาจากมนุษย์ในสถานการณ์หรือลักษณะเฉพาะบางอย่าง ดังนั้น แม้ว่า AI จะผ่านการทดสอบ แต่ก็ยากที่จะสรุปได้ว่ามันมีพฤติกรรมเหมือนมนุษย์โดยทั่วไป ตัวอย่างเช่น “Eugene Goostman” ที่กล่าวถึงไปก่อนหน้านี้ ถูกพัฒนาขึ้นโดยมีสมมติฐานว่าเป็นเด็กชายอายุ 13 ปีที่อาศัยอยู่ในยูเครน นี่เป็นความพยายามโดยเจตนาที่จะสร้างสถานการณ์ที่แม้แต่ภาษาอังกฤษที่ดูไม่ค่อยคล่องแคล่วก็จะได้รับการยอมรับว่าเป็นธรรมชาติ “PARRY” ถูกจำลองมาจากผู้ป่วยที่มีอาการหวาดระแวง และ “ELIZA” ถูกออกแบบมาเพื่อเลียนแบบนักจิตวิทยาผู้เชี่ยวชาญ
ด้วยวิธีนี้ เมื่อ AI ถูกตั้งค่าให้เป็นตัวแทนของมนุษย์ที่มีลักษณะเฉพาะบางอย่าง แล้วจึงเริ่มสนทนากับ AI นั้น กรรมการจะประเมิน AI โดยคำนึงถึงลักษณะเฉพาะเหล่านั้น ตัวอย่างเช่น แม้ว่าจะมีปฏิกิริยาตอบสนองที่ค่อนข้างแปลกเกิดขึ้นขณะสนทนากับ AI ที่ถูกตั้งโปรแกรมให้เป็นตัวแทนของบุคคลที่มีอาการป่วยทางจิต กรรมการก็มีแนวโน้มที่จะยอมรับว่าเป็นปฏิกิริยาตามธรรมชาติที่สอดคล้องกับลักษณะเฉพาะนั้น กล่าวอีกนัยหนึ่ง แม้ว่ากรรมการควรประเมินโดยปราศจากอคติ แต่ในความเป็นจริงแล้ว พวกเขาอยู่ในสภาพแวดล้อมที่การทำเช่นนั้นเป็นเรื่องยาก
แน่นอนว่าผู้ป่วยทางจิตสามารถคิดได้ อย่างไรก็ตาม การที่ AI ที่จำลองมาจากผู้ป่วยทางจิตผ่านการทดสอบทัวริงไม่ได้หมายความว่ามันคิดได้ "เหมือนมนุษย์" มากกว่ามนุษย์ เพื่อให้สอดคล้องกับคำถามที่อลัน ทัวริงตั้งไว้ว่า "เครื่องจักรสามารถประพฤติตัวในแบบที่มนุษย์ทำได้หรือไม่" การทดสอบจึงต้องออกแบบโดยอิงจากสถานการณ์ทั่วไปที่คนส่วนใหญ่ยอมรับได้
ประการที่สาม ปัญญาประดิษฐ์สามารถผ่านการทดสอบทัวริงได้โดยการจัดการสัญลักษณ์มากกว่าการเข้าใจเนื้อหาอย่างแท้จริง ตัวอย่างที่ชัดเจนคือ “เอลิซ่า” สำหรับคนๆ หนึ่งที่จะคิดเกี่ยวกับหัวข้อใดหัวข้อหนึ่ง พวกเขาต้องเข้าใจหัวข้อนั้นและตัดสินใจโดยอาศัยประสบการณ์ที่เกี่ยวข้อง ด้วยเหตุนี้ นักปรัชญาจอห์น เซิร์ล จึงโต้แย้งว่าการทดสอบทัวริงเพียงอย่างเดียวไม่สามารถพิสูจน์ได้ว่าเครื่องจักรนั้นกำลังคิดอยู่จริงหรือไม่
นอกจากนี้ เนื่องจากปัญญาประดิษฐ์ทำงานตามอัลกอริทึมที่กำหนดไว้ล่วงหน้า จึงสามารถเปิดเผยข้อผิดพลาดได้ง่ายเมื่อเผชิญกับสถานการณ์ที่ไม่คาดคิด ตัวอย่างต่อไปนี้แสดงให้เห็นถึงเรื่องนี้
ผู้ถาม: คุณยังคงสนับสนุนบิล คลินตันอยู่หรือไม่?
ผู้พิพากษา: ผมไม่เคยพบกับคลินตันมาก่อน
ผู้สนทนา: คุณไม่ชอบบิล คลินตันเอามากๆ เลย อย่างน้อยก็เห็นได้ชัดว่าคุณไม่ชอบเขา ในความคิดของผม ดูเหมือนว่าคนส่วนใหญ่จะไม่สนใจหรือไม่ก็ไม่ได้คิดถึงเรื่องนี้มากนัก
ผู้พิพากษา: คุณเคยดูเรื่อง 'The Martian' ไหม?
ผู้ถาม: ใจเย็นๆ กันก่อน ผมไม่ได้มาที่นี่เพื่อตอบคำถามโง่ๆ ไม่ใช่แบบนั้น เรากำลังพูดถึงอะไรกันอยู่? ถูกต้อง สิ่งที่คุณเพิ่งพูดไปหมายความว่าประเด็นพื้นฐาน—เช่นเรื่องไวท์วอเตอร์และอัยการพิเศษ—เป็นเรื่องร้ายแรงใช่ไหม?
บทสนทนานี้เป็นการสนทนาระหว่างผู้พิพากษาและ “แคทเธอรีน” ปัญญาประดิษฐ์ (AI) ที่ออกแบบมาเพื่อสานต่อบทสนทนาโดยอิงจากข้อมูลที่ตั้งโปรแกรมไว้ล่วงหน้าเกี่ยวกับเหตุการณ์ที่กลายเป็นข่าวในวันก่อนการทดสอบทัวริง หากผู้พิพากษาสานต่อบทสนทนาทางการเมืองที่เกี่ยวข้องกับบิล คลินตัน บทสนทนาก็อาจจะยังคงเป็นไปอย่างเป็นธรรมชาติ อย่างไรก็ตาม เมื่อผู้พิพากษาเปลี่ยนหัวข้อสนทนาไปเป็นเรื่องอื่นอย่างกะทันหัน ปัญญาประดิษฐ์ไม่สามารถรับมือกับหัวข้อที่ไม่ได้ตั้งโปรแกรมไว้ได้อย่างถูกต้อง และแสดงข้อผิดพลาดดังที่แสดงไว้ข้างต้น
ดังนั้น เราจึงไม่สามารถสรุปได้ว่า AI มีพฤติกรรมเหมือนมนุษย์เพียงเพราะมันสามารถสื่อสารได้ในระดับหนึ่ง แม้ว่ามันอาจดูเหมือนสนทนาได้อย่างเหมือนมนุษย์ในเบื้องต้น แต่แท้จริงแล้วมันไม่ได้เข้าใจเนื้อหา แต่เพียงแค่ตอบสนองในลักษณะที่ทำให้ดูเหมือนมนุษย์เท่านั้น ดังนั้น มันจึงไม่เข้าข่ายแนวคิดของ "สติปัญญา" ตามที่ได้นิยามไว้ก่อนหน้านี้ การทดสอบทัวริงในปัจจุบัน ซึ่งผ่านระบบ AI ที่เลียนแบบพฤติกรรมของมนุษย์โดยไม่เข้าใจความหมายที่แท้จริงนั้น มีข้อจำกัดที่ชัดเจน
การทดสอบทัวริงเป็นการทดลองที่มีความหมายซึ่งสำรวจขอบเขตระหว่างมนุษย์และปัญญาประดิษฐ์ โดยประเมินปัญญาประดิษฐ์โดยการเปรียบเทียบกับมนุษย์ เนื่องจากมนุษย์เองก็ไม่สามารถนิยามแก่นแท้ของความคิดหรือจิตใจได้อย่างชัดเจน ความพยายามนี้จึงมีคุณค่าอย่างมาก ในทางกลับกัน เนื่องจากปัญญาประดิษฐ์ทำงานบนพื้นฐานของโครงสร้างและหลักการที่ค่อนข้างง่าย จึงสามารถวัดและวิเคราะห์ได้ในระดับหนึ่ง แม้จะไม่สมบูรณ์แบบก็ตาม
อย่างไรก็ตาม การทดสอบทัวริงล้มเหลวในการประเมินสติปัญญาอย่างแม่นยำ และเกณฑ์การประเมินก็มีความเป็นอัตวิสัยสูงเกินไป การพิจารณาอย่างละเอียดเกี่ยวกับกระบวนการทดสอบจริงเผยให้เห็นว่าเป็นการยากที่จะมองว่าเป็นสภาพแวดล้อมที่สามารถประเมินสติปัญญาของ AI ได้อย่างครอบคลุม แม้ว่าจะมีผู้ตัดสินหลายคนเข้าร่วมและมีสถาบันกำกับดูแลกระบวนการประเมิน แต่จำนวนผู้ประเมินก็มีจำกัด และไม่ใช่เรื่องง่ายที่จะได้ข้อสรุปที่เป็นกลางโดยคำนึงถึงตัวแปรทั้งหมด ดังนั้นจึงมีข้อจำกัดพื้นฐานในการได้ผลลัพธ์ที่สมบูรณ์แบบที่ทุกคนยอมรับได้
การทดสอบทัวริงมีความสำคัญอย่างยิ่ง เนื่องจากแสดงให้เห็นว่าปัญญาประดิษฐ์สามารถจำลองความสามารถทางปัญญาที่เคยถือว่าเป็นเอกลักษณ์เฉพาะของมนุษย์ได้ในระดับหนึ่ง ดังนั้น แทนที่จะปฏิเสธการทดสอบนี้โดยสิ้นเชิง จึงจำเป็นต้องกำหนดเกณฑ์และขั้นตอนการประเมินที่แม่นยำและเป็นที่ยอมรับในวงกว้างมากกว่าที่ใช้อยู่ในปัจจุบัน
ในเรื่องนี้ ผมขอเสนอ “การทดสอบทัวริงแบบย้อนกลับ” เป็นทางเลือก ในการทดสอบทัวริงแบบย้อนกลับ ผู้ประเมินคือคอมพิวเตอร์แทนที่จะเป็นมนุษย์ กล่าวอีกนัยหนึ่งคือ เป็นวิธีการที่คอมพิวเตอร์ประเมินมนุษย์หรือคอมพิวเตอร์เครื่องอื่นในขณะที่โต้ตอบกัน การนำแนวทางนี้มาใช้ในการทดสอบที่มีอยู่จะช่วยลดปัญหาความลำเอียงของมนุษย์และช่วยให้การประเมินดำเนินการในสภาพแวดล้อมที่เป็นกลางมากขึ้น แน่นอนว่า การที่ผู้ประเมินเป็นปัญญาประดิษฐ์ก็อาจทำให้เกิดปัญหาใหม่ๆ ขึ้นได้เช่นกัน
ไม่ว่าจะเป็นเรื่องอะไรก็ตาม การทดสอบที่ออกแบบมาเพื่อการประเมินและการตัดสินนั้นย่อมไม่สามารถสร้างความพึงพอใจให้กับทุกคนได้ และการกำหนดเกณฑ์ที่สมบูรณ์แบบซึ่งทุกคนยอมรับได้นั้นไม่ใช่เรื่องง่าย ดังนั้นเราจึงต้องค้นหาวิธีการปรับปรุงอย่างต่อเนื่อง โดยเฉพาะอย่างยิ่ง เนื่องจากแบบทดสอบทัวริงเป็นวิธีการประเมินที่สำคัญซึ่งอาจส่งผลกระทบอย่างมากต่ออนาคตของอุตสาหกรรมและทิศทางการพัฒนาเทคโนโลยี AI จึงจำเป็นต้องพัฒนาให้มีประสิทธิภาพและน่าเชื่อถือมากยิ่งขึ้น
ปัจจุบัน ปัญญาประดิษฐ์ (AI) กำลังก้าวหน้าอย่างรวดเร็วอย่างที่ไม่เคยมีมาก่อน และถูกนำมาใช้ในทุกแง่มุมของชีวิตประจำวันของเราแล้ว เมื่อประเมิน AI ดังกล่าว เราไม่ควรตัดสินเพียงแค่ว่ามันสามารถหลอกลวงมนุษย์ได้หรือไม่ แต่ควรประเมินความสามารถในการเข้าใจความหมาย เข้าใจบริบท และสื่อสารได้อย่างเป็นธรรมชาติในสถานการณ์ต่างๆ แน่นอนว่า เนื่องจากนี่ไม่ใช่สาขาที่มี "คำตอบที่ถูกต้อง" ที่ชัดเจนเหมือนกับโจทย์คณิตศาสตร์ การกำหนดเกณฑ์ที่เป็นกลางจึงไม่ใช่เรื่องง่าย อย่างไรก็ตาม เพื่อประเมิน AI ที่จะอยู่ร่วมกับมนุษย์ในอนาคต การทดสอบทัวริง (Turing Test) ต้องพัฒนาให้ครอบคลุมถึงปัจจัยด้านจริยธรรมและความสามารถในการสื่อสารอย่างมีประสิทธิภาพด้วย

 

เกี่ยวกับผู้เขียน