在这篇博文中,我们将探讨图灵测试是否是评估人工智能智能的合适标准,并探讨其局限性和潜在的改进领域。
2014年,俄罗斯开发者创建的聊天机器人“尤金·古斯特曼”(Eugene Goostman)通过图灵测试的消息震惊了世人,也让许多人感到困惑。这清楚地表明,人工智能不再仅仅是科幻电影中虚构的未来社会的产物。人工智能已经深深融入我们的生活,并正以惊人的速度发展,符合雷·库兹韦尔的“加速回报定律”。然而,我们不能袖手旁观,任由人工智能在瞬息万变的时代中稳固立足。我们需要确定人工智能是否真的能够像人类一样思考,并且必须思考它未来的发展方向。
这些问题与图灵测试密切相关。图灵测试是一种评估方法,其源于这样一个问题:“是否有可能创造出一台可以说拥有智能和思维的计算机?”众所周知,艾伦·图灵于1950年提出图灵测试,旨在回答“机器能否思考?”这个问题。然而,在设计实验时,图灵实际上将问题重新表述为“机器能否像人类一样行动?”。测试方法是让一位评委分别向人类和人工智能提出问题,然后判断哪一方的回答更像人类。在图灵测试中,可以使用各种方法来欺骗评委,例如放慢反应速度或以类似聊天的方式继续对话。此外,如果人工智能能够在限定的讨论范围和主题内欺骗大约30%的评委,则认为测试通过。
我质疑在这些条件和规则下进行的图灵测试是否真的适合用来评估人工智能的智能。换句话说,我认为图灵测试并不适合评估人工智能。为了支持这一观点,我将提出三个论点,并提出“反向图灵测试”作为解决方案。然而,在此之前,有必要先考察一下除了“尤金·古斯特曼”之外,其他通过图灵测试的著名人工智能案例。
由约瑟夫·魏岑鲍姆于1966年开发的“ELIZA”是早期自然语言对话程序中最广为人知的例子。这款人工智能程序旨在识别输入句子中的关键关键词并返回相应的回复;如果没有找到合适的关键词,它会重复用户的话语或提供通用回复。
还有 Kenneth Colby 于 1972 年开发的“PARRY”。这款人工智能模仿了妄想症患者的对话风格,甚至进行过实验,让几位精神科医生试图区分真正的患者和 PARRY。
接下来,我将探讨为什么图灵测试不适合作为评估人工智能的标准。
首先,图灵测试并不能准确评估智能本身。换句话说,它并非评估人工智能的思维智能程度,而是通过对话来判断其行为是否像人类。这存在两个问题。
首先,并非所有人类的行为都始终体现出智能。这里,“智能”指的是理解现象或物体并进行理性处理的智力活动。此外,根据艾伦·图灵的论文,人工智能的某些智能能力可能以不同于人类的方式展现出来。简而言之,如果人工智能解决了人类无法解决的问题,评估者更有可能意识到对方是一台计算机。最终,图灵测试无法正确评估超越人类能力的智能形式。
其次,图灵测试的评估标准具有主观性,且实验条件过于苛刻。换言之,测试结果很容易受到评估者的态度、经验、技能和知识的影响,而非人工智能的实际智能水平,因此难以保证客观性。
归根结底,判断某事物是人工智能还是人类的主体是人,因此很难完全消除评估者的主观性。此外,在五分钟左右的有限时间内提出的问题也受到诸多限制。只要评估者是人,就始终存在受到各种外部因素影响的可能性。
此外,大多数参与图灵测试的人工智能都是以特定情境或特征的人类为模型设计的。因此,即使人工智能通过了测试,也很难断定它的行为方式与人类完全相同。例如,前面提到的“尤金·古斯特曼”(Eugene Goostman)的开发前提是它是一位生活在乌克兰的13岁男孩。这是为了刻意创造一种情境,使即使略显笨拙的英语也能被接受为自然表达。“帕里”(PARRY)的模型是模仿一位妄想症患者,“伊丽莎”(ELIZA)的设计目的是为了模仿一位专业的心理咨询师。
这样一来,当人工智能被设定为代表具有特定特征的人类并进行对话时,评委们会根据这些特征对其进行评估。例如,即使人工智能在与被设定为代表精神疾病患者的对话中出现了一些奇怪的反应,评委们也可能将其视为符合该设定的自然反应。换句话说,尽管评委们理应做到客观公正,但他们实际所处的环境却使得做到这一点变得困难。
当然,患有精神疾病的人也具备思考能力。然而,仅仅因为一个以精神疾病患者为模型的AI通过了图灵测试,并不意味着它的思维比人类更“像人类”。为了忠实于艾伦·图灵提出的问题——“机器能否像人类一样行事?”——测试必须基于大多数人都能接受的普遍情境来设计。
第三,人工智能可以通过操纵符号而非真正理解其内容来通过图灵测试。“ELIZA”就是一个典型的例子。一个人要思考某个主题,就必须理解该主题并基于相关经验做出判断。因此,哲学家约翰·塞尔也认为,仅凭图灵测试无法证明机器是否真的在思考。
此外,由于人工智能是按照预先设定的算法运行的,因此在遇到意外情况时很容易发现错误。以下示例可以说明这一点。
对话者:你还支持比尔·克林顿吗?
法官:我从未见过克林顿。
对话者:你真的很讨厌比尔·克林顿。至少,很明显你不喜欢他。依我看,大多数人似乎只是对此不感兴趣,或者至今还没怎么考虑过这个问题。
法官:你看过《火星救援》吗?
对话者:别激动。我不是来回答愚蠢问题的。不是那个。我们刚才说到哪儿了?对了。你刚才说的意思是,像白水事件和特别检察官这样的根本问题很严重吗?
这段对话发生在一位法官和“凯瑟琳”之间。“凯瑟琳”是一款人工智能,其设计目的是根据预先设定的信息,即图灵测试前一天发生的新闻事件,来延续对话。如果法官继续讨论与比尔·克林顿相关的政治话题,对话可能会显得非常自然。然而,当法官突然将话题转向其他内容时,人工智能无法正确处理这个未预先设定的主题,并出现了上述错误。
因此,我们不能仅仅因为人工智能具备一定程度的沟通能力就断定它的行为像人类。虽然它表面上看起来能进行类似人类的对话,但实际上它并没有理解对话内容,而只是以一种看似人类的方式做出回应。因此,它不符合之前定义的“智能”概念。目前的图灵测试允许那些仅仅模仿人类行为而没有真正理解其含义的人工智能系统通过,这显然存在局限性。
图灵测试通过将人工智能与人类进行比较来评估其能力,因此它是一项意义重大的实验,探索了人类与人工智能之间的界限。考虑到人类自身都无法清晰定义思想或心智的本质,这项尝试本身就具有重要的价值。另一方面,由于人工智能基于相对简单的结构和原理运行,即使无法做到完美,我们仍然可以在一定程度上对其进行测量和分析。
然而,图灵测试无法准确评估人工智能的智能,其评估标准也过于主观。仔细审视实际的测试过程就会发现,它很难被视为一个能够全面评估人工智能智能的环境。即使有多位评委参与,并由机构监督评估过程,评估人员的数量仍然有限,很难得出考虑到所有变量的客观结论。因此,要得出人人都能接受的完美结果,存在着根本性的局限性。
图灵测试意义重大,因为它证明了人工智能在一定程度上可以复制曾经被认为是人类独有的认知能力。因此,我们不应完全否定这项测试,而应建立比现有标准和程序更准确、更易于被广泛接受的评估标准和程序。
鉴于此,我想提出“反向图灵测试”作为一种替代方案。在反向图灵测试中,评估者是计算机而非人类。换句话说,这是一种计算机在与人类或其他计算机交互的同时对其进行评估的方法。将这种方法引入现有测试中,可以减少人类主观性带来的问题,并使评估在更加客观的环境下进行。当然,评估者是人工智能这一事实也可能带来一些新的问题。
无论涉及哪个领域,旨在进行评估和判断的测试都不可能让所有人满意,也很难建立人人都能接受的完美标准。因此,我们必须不断探索改进测试的方法。尤其图灵测试作为一种至关重要的评估方法,可能对产业的未来和人工智能技术的发展方向产生重大影响,因此必须发展成为一种更高效、更可靠的形式。
如今,人工智能的发展速度前所未有,并已渗透到我们日常生活的方方面面。在评估人工智能时,我们不应仅仅以它能否欺骗人类为标准,而应考察其理解含义、把握语境以及在各种情境下进行自然沟通的能力。当然,人工智能不像数学题那样有明确的“正确答案”,因此建立客观标准并非易事。然而,为了评估未来将与人类共存的人工智能,图灵测试必须与时俱进,全面考量其伦理因素和有效沟通能力。