Действительно ли тест Тьюринга может оценить искусственный интеллект?

В этой статье мы рассмотрим, является ли тест Тьюринга подходящим стандартом для оценки интеллекта искусственного интеллекта, а также изучим его ограничения и потенциальные области для улучшения.

 

В 2014 году новость о том, что чат-бот «Юджин Густман», созданный российскими разработчиками, прошёл тест Тьюринга, стала шоком и вызвала замешательство у многих. Это стало наглядным доказательством того, что искусственный интеллект — это уже не просто продукт воображаемого будущего общества, которое можно увидеть только в научно-фантастических фильмах. ИИ уже глубоко вошел в нашу жизнь и развивается быстрыми темпами, в соответствии с «законом ускоряющейся отдачи» Рэя Курцвейла. Однако мы не можем просто стоять в стороне и наблюдать, как ИИ, развивающийся в мгновение ока, прочно закрепляется в обществе. Нам необходимо определить, действительно ли ИИ способен мыслить как человек, и мы также должны рассмотреть направление его дальнейшего развития.
Эти вопросы связаны с тестом Тьюринга. Тест Тьюринга — это метод оценки, возникший из вопроса: «Возможно ли создать компьютер, который, как мы можем сказать, обладает интеллектом и разумом?» Общеизвестно, что Алан Тьюринг предложил его в 1950 году, чтобы ответить на вопрос: «Могут ли машины мыслить?». Однако, разрабатывая эксперимент, Тьюринг фактически переформулировал сам вопрос как «Могут ли машины вести себя так же, как люди?». Тест проводится следующим образом: судья задает вопросы человеку и искусственному интеллекту, а затем определяет, чьи ответы более человекоподобны. В тесте Тьюринга могут использоваться различные методы для обмана судьи, и допускается замедление времени ответа или продолжение разговора в формате чата. Кроме того, тест считается пройденным, если ИИ может обмануть примерно 30% судей в рамках ограниченной темы обсуждения.
Я поставил под сомнение, действительно ли тест Тьюринга с такими условиями и правилами является подходящим методом оценки интеллекта ИИ. Другими словами, я считаю, что тест Тьюринга не подходит для оценки ИИ. В поддержку этой точки зрения я приведу три аргумента и предложу в качестве решения «обратный тест Тьюринга». Однако прежде чем это сделать, необходимо рассмотреть другие известные примеры ИИ, прошедшие тест Тьюринга, помимо «Юджина Густмана».
«ELIZA», разработанная Джозефом Вайзенбаумом в 1966 году, является наиболее известным примером среди ранних программ для диалога на естественном языке. Этот ИИ был разработан для распознавания ключевых слов во входных предложениях и выдачи соответствующих ответов; если подходящие ключевые слова не были найдены, он повторял слова пользователя или предоставлял общий ответ.
Существует также «PARRY», разработанный Кеннетом Колби в 1972 году. Этот ИИ был создан по образцу разговорного стиля параноика, и даже проводились эксперименты, в которых несколько психиатров пытались отличить реальных пациентов от PARRY.
Далее я рассмотрю, почему тест Тьюринга не является подходящим стандартом для оценки искусственного интеллекта.
Во-первых, тест Тьюринга неточно оценивает сам интеллект. Другими словами, вместо того чтобы оценивать, насколько разумно мыслит ИИ, этот тест определяет посредством разговора, ведёт ли он себя как человек. С этим связаны две проблемы.
Во-первых, не все люди всегда ведут себя разумно. Здесь под «разумным» понимается интеллектуальная деятельность, включающая понимание явления или объекта и его рациональную обработку. Кроме того, согласно статье Алана Тьюринга, некоторые интеллектуальные способности ИИ могут проявляться иначе, чем у людей. Проще говоря, если ИИ решает задачу, с которой человек не может справиться, оценщик с большей вероятностью поймет, что другой человек — компьютер. В конечном итоге, тест Тьюринга не позволяет должным образом оценить формы интеллекта, превосходящие человеческие возможности.
Во-вторых, критерии оценки теста Тьюринга субъективны, а экспериментальные условия чрезмерно ограничительны. Другими словами, на результаты теста могут существенно влиять отношение, опыт, навыки и знания оценивающего, а не фактический уровень интеллекта ИИ, что затрудняет обеспечение объективности.

В конечном счете, определяющим, является ли что-то искусственным интеллектом или человеком, является человек, поэтому полностью исключить субъективность оценщика сложно. Кроме того, вопросы, задаваемые в рамках ограниченного времени, составляющего около пяти минут, также весьма ограничены. Поскольку оценщик — человек, всегда существует вероятность влияния различных внешних факторов.
Кроме того, большинство ИИ, участвующих в тесте Тьюринга, созданы по образу людей с учетом конкретных ситуаций или характеристик. Поэтому, даже если ИИ проходит тест, трудно сделать вывод, что он ведет себя так же, как люди в целом. Например, представленный ранее «Юджин Густман» был разработан исходя из предположения, что это 13-летний мальчик, живущий в Украине. Это была преднамеренная попытка создать ситуацию, в которой даже несколько неуклюжий английский язык воспринимался бы как естественный. «Парри» был создан по образу параноика, а «Элиза» была разработана для имитации профессионального психолога.
Таким образом, когда ИИ, запрограммированный на представление человека с определенными характеристиками, вступает с ним в диалог, судьи оценивают его, учитывая эти характеристики. Например, даже если в разговоре с ИИ, запрограммированным на представление человека с психическим заболеванием, возникает несколько странная реакция, судьи, скорее всего, воспримут ее как естественную реакцию, соответствующую этой характеристике. Другими словами, хотя судьи должны оценивать беспристрастно, на самом деле они находятся в среде, где это сделать сложно.
Конечно, люди с психическими заболеваниями способны мыслить. Однако тот факт, что искусственный интеллект, созданный по образу человека с психическим заболеванием, проходит тест Тьюринга, не означает, что он мыслит более «человекоподобно», чем человек. Чтобы оставаться верным вопросу, поставленному Аланом Тьюрингом: «Может ли машина вести себя так, как человек?», тест должен быть разработан на основе общих ситуаций, которые приемлемы для большинства людей.
В-третьих, ИИ может пройти тест Тьюринга, просто манипулируя символами, а не понимая их содержание. Яркий пример — «Элиза». Чтобы человек мог размышлять над какой-либо темой, он должен понимать её и делать выводы, основываясь на соответствующем опыте. По этой причине философ Джон Сёрл также утверждал, что тест Тьюринга сам по себе не может доказать, действительно ли машина мыслит.
Кроме того, поскольку искусственный интеллект работает в соответствии с заранее заданными алгоритмами, он может легко выявлять ошибки в непредвиденных ситуациях. Ниже приведён пример, иллюстрирующий это.
Собеседник: Вы по-прежнему поддерживаете Билла Клинтона?
Судья: Я никогда не встречал Клинтона.
Собеседник: Вам действительно не нравится Билл Клинтон. По крайней мере, это очевидно. На мой взгляд, большинство людей просто не проявляли к нему интереса или до сих пор не задумывались об этом.
Судья: Вы смотрели фильм «Марсианин»?
Собеседник: Давайте не будем заострять внимание. Я здесь не для того, чтобы отвечать на глупые вопросы. Дело не в этом. О чем мы говорили? Хорошо. То, что вы только что сказали, означает, что основные проблемы — такие как дело «Уайтуотер» и специальный прокурор — серьезны?
Этот разговор происходит между судьёй и «Кэтрин», искусственным интеллектом, разработанным для продолжения диалога на основе предварительно запрограммированной информации о событиях, ставших новостями за день до проведения теста Тьюринга. Если бы судья продолжил политическую дискуссию о Билле Клинтоне, диалог мог бы остаться вполне естественным. Однако, когда судья внезапно переключился на другую тему, ИИ не смог должным образом обработать незапрограммированную тему и выявил ошибку, показанную выше.
Таким образом, мы не можем заключить, что ИИ ведёт себя как человек просто потому, что он способен на определённый уровень общения. Хотя на первый взгляд может показаться, что он ведёт человекоподобный разговор, на самом деле он не понимает содержания, а лишь отвечает так, чтобы это выглядело по-человечески. Следовательно, он не соответствует понятию «интеллект», как оно было определено ранее. Современный тест Тьюринга, который проходит системы ИИ, просто имитирующие человеческое поведение, не понимая его смысла, имеет явные ограничения.
Поскольку тест Тьюринга оценивает ИИ, сравнивая его с людьми, это значимый эксперимент, исследующий границу между человеком и ИИ. Учитывая, что сами люди не могут четко определить сущность мышления или разума, эта попытка сама по себе имеет большое значение. С другой стороны, поскольку ИИ работает на основе относительно простых структур и принципов, его можно измерить и проанализировать в определенной степени, пусть и не идеально.
Однако тест Тьюринга не позволяет точно оценить интеллект, а его критерии оценки чрезмерно субъективны. Более внимательное изучение самого процесса тестирования показывает, что его сложно рассматривать как среду, способную всесторонне оценить интеллект ИИ. Даже если в тестировании участвует несколько экспертов и надзор за процессом осуществляет организация, количество экспертов ограничено, и непросто прийти к объективному выводу, учитывающему все переменные. Следовательно, существуют фундаментальные ограничения для получения идеального результата, приемлемого для всех.
Тест Тьюринга имеет огромное значение, поскольку он продемонстрировал, что ИИ в определенной степени может воспроизводить когнитивные способности, ранее считавшиеся уникальными для человека. Поэтому, вместо того чтобы полностью отвергать этот тест, необходимо установить критерии и процедуры оценки, которые были бы более точными и приемлемыми для более широкой аудитории, чем те, которые используются в настоящее время.
В этой связи я хотел бы предложить в качестве альтернативы «обратный тест Тьюринга». В обратном тесте Тьюринга оценщиком является компьютер, а не человек. Другими словами, это метод, при котором компьютер оценивает человека или другой компьютер, взаимодействуя с ним. Внедрение этого подхода в существующие тесты уменьшило бы проблему человеческой субъективности и позволило бы проводить оценки в более объективной среде. Конечно, тот факт, что оценщиком является искусственный интеллект, также порождает новые проблемы.
Вне зависимости от предмета, тесты, предназначенные для оценки и вынесения суждений, вряд ли удовлетворят всех, и установить идеальные критерии, приемлемые для всех, непросто. Поэтому мы должны постоянно искать способы их улучшения. В частности, поскольку тест Тьюринга является важнейшим методом оценки, который может существенно повлиять на будущее промышленности и направление развития технологий искусственного интеллекта, он должен эволюционировать в более эффективную и надежную форму.
Сегодня искусственный интеллект развивается с невиданной ранее скоростью и уже используется во всех аспектах нашей повседневной жизни. При оценке такого ИИ следует судить не только по его способности обманывать людей, но и по его способности понимать смысл, улавливать контекст и естественно общаться в различных ситуациях. Конечно, поскольку это не область с четко определенными «правильными ответами», как, например, математическая задача, установить объективные критерии непросто. Тем не менее, для оценки ИИ, который будет сосуществовать с людьми в будущем, тест Тьюринга должен развиваться, чтобы всесторонне учитывать этические факторы и способность эффективно общаться.

 

Об авторе