Liệu bài kiểm tra Turing có thực sự đánh giá được trí tuệ nhân tạo?

Trong bài đăng trên blog này, chúng ta sẽ xem xét liệu bài kiểm tra Turing có phải là tiêu chuẩn phù hợp để đánh giá trí thông minh của trí tuệ nhân tạo hay không, đồng thời khám phá những hạn chế và các lĩnh vực tiềm năng để cải thiện nó.

 

Năm 2014, tin tức về việc “Eugene Goostman”, một chatbot do các nhà phát triển người Nga tạo ra, đã vượt qua bài kiểm tra Turing đã gây sốc và hoang mang cho nhiều người. Điều này chứng minh rõ ràng rằng trí tuệ nhân tạo không còn chỉ là sản phẩm của một xã hội tương lai tưởng tượng chỉ thấy trong các bộ phim khoa học viễn tưởng. AI đã ăn sâu vào cuộc sống của chúng ta và đang phát triển với tốc độ nhanh chóng, phù hợp với “Định luật gia tốc lợi nhuận” của Ray Kurzweil. Tuy nhiên, chúng ta không thể chỉ đứng nhìn khi AI, thứ đang phát triển trong nháy mắt, trở nên vững chắc trong xã hội. Chúng ta cần xác định xem AI có thực sự có thể suy nghĩ như con người hay không, và chúng ta cũng phải xem xét hướng phát triển của nó trong tương lai.
Những vấn đề này có liên quan đến Bài kiểm tra Turing. Bài kiểm tra Turing là một phương pháp đánh giá bắt nguồn từ câu hỏi: “Liệu có thể tạo ra một máy tính mà chúng ta có thể nói là sở hữu trí thông minh và tâm trí?” Người ta thường biết rằng Alan Turing đã đề xuất bài kiểm tra này vào năm 1950 để trả lời câu hỏi, “Máy móc có thể suy nghĩ không?” Tuy nhiên, Turing thực chất đã diễn đạt lại câu hỏi đó thành “Máy móc có thể hành xử giống như con người không?” khi thiết kế thí nghiệm. Bài kiểm tra được tiến hành bằng cách để một người chấm điểm đặt câu hỏi cho cả người và trí tuệ nhân tạo (AI), sau đó xác định xem câu trả lời của ai giống con người hơn. Trong Bài kiểm tra Turing, có thể sử dụng nhiều phương pháp khác nhau để đánh lừa người chấm điểm, và được phép làm chậm thời gian phản hồi hoặc tiếp tục cuộc trò chuyện theo hình thức giống như trò chuyện trực tuyến. Hơn nữa, bài kiểm tra được coi là đạt nếu AI có thể đánh lừa khoảng 30% số người chấm điểm trong phạm vi và chủ đề thảo luận giới hạn.
Tôi đặt câu hỏi liệu bài kiểm tra Turing với những điều kiện và quy tắc này có thực sự là thước đo thích hợp để đánh giá trí thông minh của AI hay không. Nói cách khác, tôi tin rằng bài kiểm tra Turing không phù hợp để đánh giá AI. Để ủng hộ quan điểm này, tôi sẽ trình bày ba luận điểm và đề xuất "Bài kiểm tra Turing đảo ngược" như một giải pháp. Tuy nhiên, trước khi làm như vậy, cần phải xem xét trước những ví dụ đáng chú ý khác về AI đã vượt qua bài kiểm tra Turing ngoài "Eugene Goostman".
“ELIZA,” được Joseph Weizenbaum phát triển vào năm 1966, là ví dụ nổi tiếng nhất trong số các chương trình đối thoại ngôn ngữ tự nhiên thời kỳ đầu. Trí tuệ nhân tạo này được thiết kế để xác định các từ khóa chính trong câu nhập vào và trả về các phản hồi tương ứng; nếu không tìm thấy từ khóa phù hợp, nó sẽ lặp lại lời của người dùng hoặc đưa ra câu trả lời chung chung.
Ngoài ra còn có "PARRY", được Kenneth Colby phát triển vào năm 1972. Trí tuệ nhân tạo này được mô phỏng theo phong cách trò chuyện của một bệnh nhân mắc chứng hoang tưởng, và thậm chí đã có những thí nghiệm được tiến hành trong đó một số bác sĩ tâm thần cố gắng phân biệt giữa bệnh nhân thực sự và PARRY.
Từ đây trở đi, tôi sẽ phân tích lý do tại sao bài kiểm tra Turing không phải là tiêu chuẩn phù hợp để đánh giá trí tuệ nhân tạo.
Thứ nhất, bài kiểm tra Turing không đánh giá chính xác trí thông minh. Nói cách khác, thay vì đánh giá trí thông minh trong tư duy của AI, bài kiểm tra này xác định thông qua hội thoại xem nó có hành xử giống con người hay không. Có hai vấn đề với điều này.
Thứ nhất, không phải tất cả con người đều luôn hành xử thông minh. Ở đây, “thông minh” đề cập đến hoạt động trí tuệ liên quan đến việc hiểu một hiện tượng hoặc đối tượng và xử lý nó một cách hợp lý. Hơn nữa, theo bài báo của Alan Turing, một số khả năng trí tuệ của trí tuệ nhân tạo có thể biểu hiện theo những cách khác với con người. Nói một cách đơn giản, nếu một trí tuệ nhân tạo giải quyết được một vấn đề mà con người không thể, người đánh giá thực tế có nhiều khả năng nhận ra rằng bên kia là một máy tính. Cuối cùng, bài kiểm tra Turing không đánh giá đúng mức các hình thức trí tuệ vượt trội so với khả năng của con người.
Thứ hai, tiêu chí đánh giá của bài kiểm tra Turing mang tính chủ quan, và điều kiện thử nghiệm quá khắt khe. Nói cách khác, kết quả kiểm tra có thể bị ảnh hưởng đáng kể bởi thái độ, kinh nghiệm, kỹ năng và kiến ​​thức của người đánh giá hơn là mức độ thông minh thực tế của AI, khiến việc đảm bảo tính khách quan trở nên khó khăn.

Xét cho cùng, thực thể quyết định xem một thứ gì đó là trí tuệ nhân tạo hay con người vẫn là con người, vì vậy rất khó để loại bỏ hoàn toàn tính chủ quan của người đánh giá. Hơn nữa, các câu hỏi được đặt ra trong khung thời gian giới hạn khoảng năm phút cũng rất hạn chế. Chừng nào người đánh giá còn là con người, thì luôn có khả năng bị ảnh hưởng bởi nhiều yếu tố bên ngoài khác nhau.
Ngoài ra, hầu hết các AI tham gia vào bài kiểm tra Turing đều được mô phỏng theo con người với những tình huống hoặc đặc điểm cụ thể. Do đó, ngay cả khi một AI vượt qua bài kiểm tra, rất khó để kết luận rằng nó hành xử giống như con người nói chung. Ví dụ, “Eugene Goostman”, được giới thiệu trước đó, được phát triển dựa trên giả định rằng nó là một cậu bé 13 tuổi sống ở Ukraine. Đây là một nỗ lực có chủ đích nhằm tạo ra một tình huống mà ngay cả tiếng Anh có phần vụng về cũng được chấp nhận là tự nhiên. “PARRY” được mô phỏng theo một bệnh nhân mắc chứng hoang tưởng, và “ELIZA” được thiết kế để bắt chước một nhà tư vấn tâm lý chuyên nghiệp.
Theo cách này, khi một trí tuệ nhân tạo được thiết lập để đại diện cho con người với những đặc điểm cụ thể và sau đó tham gia vào cuộc hội thoại, các giám khảo sẽ đánh giá nó dựa trên những đặc điểm đó. Ví dụ, ngay cả khi một phản hồi có phần kỳ lạ xuất hiện trong khi trò chuyện với một trí tuệ nhân tạo được lập trình để đại diện cho một người mắc bệnh tâm thần, các giám khảo vẫn có khả năng chấp nhận nó như một phản ứng tự nhiên phù hợp với đặc điểm đó. Nói cách khác, mặc dù các giám khảo được cho là phải đánh giá một cách khách quan, nhưng trên thực tế họ lại đang ở trong một môi trường mà việc đó rất khó thực hiện.
Dĩ nhiên, người mắc bệnh tâm thần vẫn có khả năng suy nghĩ. Tuy nhiên, việc một trí tuệ nhân tạo được mô phỏng theo người mắc bệnh tâm thần vượt qua bài kiểm tra Turing không có nghĩa là nó suy nghĩ "giống người" hơn con người. Để trung thành với câu hỏi mà Alan Turing đặt ra — "Liệu máy móc có thể hành xử theo cách con người hành xử?" — bài kiểm tra phải được thiết kế dựa trên các tình huống tổng quát mà đa số mọi người có thể chấp nhận.
Thứ ba, trí tuệ nhân tạo có thể vượt qua bài kiểm tra Turing chỉ bằng cách thao tác các ký hiệu chứ không cần thực sự hiểu nội dung. Một ví dụ điển hình là “ELIZA”. Để một người suy nghĩ về một chủ đề, họ phải hiểu chủ đề đó và đưa ra phán đoán dựa trên kinh nghiệm liên quan. Vì lý do này, triết gia John Searle cũng lập luận rằng chỉ riêng bài kiểm tra Turing không thể chứng minh liệu một cỗ máy có thực sự suy nghĩ hay không.
Hơn nữa, vì trí tuệ nhân tạo hoạt động theo các thuật toán đã được lập trình sẵn, nó có thể dễ dàng phát hiện ra lỗi khi gặp phải các tình huống bất ngờ. Ví dụ sau đây minh họa điều này.
Người đối thoại: Ông/Bà vẫn ủng hộ Bill Clinton chứ?
Thẩm phán: Tôi chưa từng gặp Clinton.
Người đối thoại: Anh/chị thực sự không thích Bill Clinton. Ít nhất thì điều đó cũng rõ ràng. Theo tôi, dường như hầu hết mọi người đều không quan tâm hoặc chưa suy nghĩ nhiều về vấn đề này.
Thẩm phán: Anh/chị đã xem phim 'Người Sao Hỏa' chưa?
Người đối thoại: Bình tĩnh nào. Tôi không ở đây để trả lời những câu hỏi ngớ ngẩn. Không phải vậy. Chúng ta đang nói về cái gì nhỉ? Đúng rồi. Những gì anh vừa nói có nghĩa là những vấn đề cốt lõi—như vụ Whitewater và công tố viên đặc biệt—là nghiêm trọng sao?
Cuộc hội thoại này diễn ra giữa một thẩm phán và “Catherine”, một trí tuệ nhân tạo được thiết kế để tiếp tục cuộc đối thoại dựa trên thông tin được lập trình sẵn về các sự kiện đã trở thành tin tức một ngày trước khi bài kiểm tra Turing được tổ chức. Nếu thẩm phán tiếp tục cuộc trò chuyện chính trị liên quan đến Bill Clinton, cuộc đối thoại có thể vẫn diễn ra khá tự nhiên. Tuy nhiên, khi thẩm phán đột ngột chuyển chủ đề sang một vấn đề khác, trí tuệ nhân tạo đã không thể xử lý đúng chủ đề chưa được lập trình và đã bộc lộ lỗi như hình trên.
Do đó, chúng ta không thể kết luận rằng trí tuệ nhân tạo (AI) hành xử giống con người chỉ đơn giản vì nó có khả năng giao tiếp ở một mức độ nhất định. Mặc dù bề ngoài nó có vẻ tham gia vào các cuộc hội thoại giống con người, nhưng thực chất nó không hiểu nội dung mà chỉ phản hồi theo cách khiến nó trông giống con người. Vì vậy, nó không đáp ứng được khái niệm "trí thông minh" như đã định nghĩa trước đó. Bài kiểm tra Turing hiện tại, cho phép các hệ thống AI chỉ bắt chước hành vi của con người mà không thực sự hiểu ý nghĩa, rõ ràng có những hạn chế.
Xét về khía cạnh đánh giá trí tuệ nhân tạo bằng cách so sánh với con người, bài kiểm tra Turing là một thí nghiệm có ý nghĩa, khám phá ranh giới giữa con người và trí tuệ nhân tạo. Vì chính con người cũng không thể định nghĩa rõ ràng bản chất của tư duy hay tâm trí, nên nỗ lực này tự nó đã mang giá trị đáng kể. Mặt khác, vì trí tuệ nhân tạo hoạt động dựa trên các cấu trúc và nguyên tắc tương đối đơn giản, nên có thể đo lường và phân tích nó ở một mức độ nhất định, dù không hoàn hảo.
Tuy nhiên, bài kiểm tra Turing không đánh giá chính xác trí thông minh, và tiêu chí đánh giá của nó cũng quá chủ quan. Quan sát kỹ hơn quy trình kiểm tra thực tế cho thấy khó có thể coi nó là môi trường có khả năng đánh giá toàn diện trí thông minh của AI. Ngay cả khi có nhiều giám khảo tham gia và một tổ chức giám sát quá trình đánh giá, số lượng người đánh giá vẫn bị hạn chế, và không dễ để đạt được kết luận khách quan có tính đến tất cả các biến số. Do đó, có những hạn chế cơ bản trong việc đưa ra một kết quả hoàn hảo mà mọi người đều có thể chấp nhận.
Bài kiểm tra Turing có ý nghĩa quan trọng vì nó đã chứng minh rằng trí tuệ nhân tạo (AI) có thể, ở một mức độ nhất định, sao chép các khả năng nhận thức từng được coi là độc nhất vô nhị của con người. Do đó, thay vì hoàn toàn bác bỏ bài kiểm tra này, cần phải thiết lập các tiêu chí và quy trình đánh giá chính xác hơn và được nhiều người chấp nhận hơn so với những tiêu chí và quy trình hiện đang được sử dụng.
Về vấn đề này, tôi muốn đề xuất “Bài kiểm tra Turing ngược” như một phương án thay thế. Trong Bài kiểm tra Turing ngược, người đánh giá là máy tính chứ không phải con người. Nói cách khác, đó là một phương pháp trong đó máy tính đánh giá con người hoặc một máy tính khác trong khi tương tác với nó. Việc đưa phương pháp này vào các bài kiểm tra hiện có sẽ giảm thiểu vấn đề chủ quan của con người và cho phép tiến hành đánh giá trong một môi trường khách quan hơn. Tất nhiên, việc người đánh giá là trí tuệ nhân tạo cũng làm nảy sinh khả năng phát sinh các vấn đề mới.
Bất kể chủ đề là gì, các bài kiểm tra được thiết kế để đánh giá và phán đoán khó có thể làm hài lòng tất cả mọi người, và việc thiết lập các tiêu chí hoàn hảo mà mọi người đều chấp nhận là không dễ dàng. Do đó, chúng ta phải liên tục tìm cách cải thiện chúng. Đặc biệt, vì bài kiểm tra Turing là một phương pháp đánh giá quan trọng có thể ảnh hưởng đáng kể đến tương lai của ngành công nghiệp và hướng phát triển công nghệ AI, nên nó cần phải được phát triển thành một hình thức hiệu quả và đáng tin cậy hơn.
Ngày nay, trí tuệ nhân tạo (AI) đang phát triển với tốc độ chưa từng có và đã được ứng dụng trong mọi khía cạnh của cuộc sống hàng ngày. Khi đánh giá AI, chúng ta không nên chỉ dựa vào khả năng đánh lừa con người mà cần đánh giá khả năng hiểu ý nghĩa, nắm bắt ngữ cảnh và giao tiếp tự nhiên trong nhiều tình huống khác nhau. Tất nhiên, vì đây không phải là lĩnh vực có “câu trả lời đúng” rõ ràng như một bài toán, nên việc thiết lập các tiêu chí khách quan không hề dễ dàng. Tuy nhiên, để đánh giá AI có thể cùng tồn tại với con người trong tương lai, bài kiểm tra Turing cần phải phát triển để xem xét toàn diện các yếu tố đạo đức và khả năng giao tiếp hiệu quả.

 

Giới thiệu về tác giả