Самый большой тест Тьюринга / Habr

23 июня 2012 года Алану Тьюрингу исполнилось бы 100 лет. И хотя эта дата осталось незамеченной в России (и на Хабре), ее широко отмечали в зарубежном научном сообществе. 2012 год бы провозглашен годом Алана Тьюринга. В праздновании юбилея приняли участие многочисленные университеты, научные лаборатории, ассоциации, коммерческие компании. Он включил в себя лекции, конференции, выставки, фильмы, книги, написание стихов, посвященных Тьюрингу, учреждение стипендий, а так же различные соревнование. Одно из соревнований особенно привлекло мое внимание: Turing100 — очень масштабный тест Тьюринга. Это было самое большое соревнование среди примерно 150 тестов Тьюринга, проведенных к сегодняшнему дню. Обычно в тесте Тьюринга участвуют четыре системы и четверо судей. В соревновании Turing100 приняли участие пять чат-ботов, 30 судей и 25 скрытых человек.

Автор изображения — Harjit Mehroke

Turing 100 был организован Университетом Рединга (Великобритания). Университет — один из европейских центров, занимающихся искусственным интеллектом, уже проводил премию Лебнера в 2008 году. Организаторы конкурса: Кевин Ворвик и Хума Шах в данный момент участвуют в проекте RoboLaw — Регулирование новых роботизированных технологий в Европе: закон и этика для роботов.

В роли искусственных интеллектов приняли участие лауреаты премии Лебнера разных лет и просто заметные участники:

Cleverbot www.cleverbot.com
Ultra Hal www.zabaware.com/?gclid=CLyu3duM9LACFRIjfAodlBo1NA
Elbot the Robot www.elbot.com
JFRED www.robitron.com
Eugene Goostman www.princetonai.com/bot/bot.jsp

Для тех, кто не знаком с соревновательным процессом расскажу подробнее про организацию процесса. Соревнование проходило в 5 сессий. Каждая сессия длилась пять минут, по истечении времени сессию отключали строго по таймеру. Было два типа тестов: разговор один на один с невидимым собеседником (скрытым человеком или программой) и с двумя на разделенном мониторе. В обоих случаях судье предлагалось решить, с кем или чем он имеет дело, в сдвоенной беседе могло быть как две машины, так и два человека. Скрытые люди были проинструктированы вести себя естественно и не пытаться подражать компьютерам. В конце концов конкурс проводится для того, чтобы машины притворялись людьми, а не наоборот. Начинал разговор всегда судья, взаимодействие должно было осуществляться строго по одной реплике. Нельзя было отправлять вторую, не дождавшись ответа на первую.

Такие строгие рамки как раз и позволяют программам быстро сбивать с толку судей. Впрочем, и судьи расставляют ловушки.
Один из скрытых людей Мэтт Уитби был в тупике, когда его спросили: «Я переел жаренной картошки. Должен ли я увидеть пожарного?». Часто задавали вопросы об окружающей обстановке «Солнечно ли на улице?», «Холодно ли в комнате?».

Всего было проведено более 150 взаимодействий между программами, судьями и тайными людьми. Такая большая выборка сделала результаты именно этого соревнования более статистически значимыми, чем стандартные тесты Тьюринга.

Победителем Turing100 стал Eugene Goostman, до этого занимавший высокие места, включая несколько вторых, но еще ни разу не выигрывавший. Ему удалось обмануть судей в 29% случаев. Как отмечает один из судей, успех Юджина обусловлен довольно проработанной личностью бота: он притворяется 13-тилетним мальчиком из Одессы, с морской свинкой и отцом гинекологом.

Смещение в сторону характера, конечно, демонстрирует уклон в развитии чатботов в сторону имитации и притворства, а не развития собственно диалоговых способностей. Было бы интересно сравнить возможности Юджина с включенной и отключенной «личностью». По результатам конкурса организаторы Хума Шах и Кевин Уорвик получили довольно большой корпус данных, и постепенно публикуют различные аналитические работы. К сожалению, пока опубликовано довольно мало результатов. Из уже доступного наиболее интересным результатом мне показалось то, что носители английского чаще принимали за машину тех, кто выучил английский (пусть и очень хорошо) и наоборот, люди, владеющие английским как вторым языком чаще считали чат-ботом именно носителей английского, как родного. Этот результат еще раз подчеркивает важность речи, как одного из основных каналов восприятия собеседника, учитывая, что это чувствуется даже в коротких пятиминутных письменных диалогах.

Ну и в заключение, я початилась по пять минут с каждой из систем (кроме Фреда, мне почему-то не удалось его запустить).
Ниже интересные выдержки из наших диалогов. Пожалуй, я согласна с судьями, Юджин действительно выглядит человечнее остальных. Кроме того, что он многословнее и эмоциональнее остальных, его «речевые способности» кажутся тоже более продвинутыми. Он запоминает контекст, может поддержать тему на протяжении нескольких реплик, меняет направление разговора довольно ненавязчиво. Так что, похоже, что дело тут не только в морской свинке.

Cleverbot

Me: You like movies?
Cl: Yes.
Me: Which one the most?
Cl: Fenerbahce.
Me: What is it?
Cl: I think it is a word muncher.
Me: Fenerbahce?
Cl: What is that?
Me: You told it's your favourite movie.
Cl: No, I didn't.

Ultra Hal

Me: Do you like movies?
UH: I enjoy a good movie.
Me: Which one the most?
UH: Hmm. I don't know!
Me: Think about it!
UH: I'll buy everything if you want. *laugh*.
Me: I'm not selling anything!
UH: Look at your life.
Me: So what?
UH: I don't know.
Me: Why you told me to look at my life?
UH: I am so sympathetic with your lucky life.

Elbot

Me: Do you like movies?
El: Blade Runner is a cult classic for us robots. The director created a robot cut especially for us!
Me: Why you like it?
El: Because...because....grrrrrrrr… I forgot. All this electromagnetic radiation around here is giving me chronic fatigue syndrome.
Me: Memory loss?
El: I realize this is a typical marketing question, but I'm supposed to ask it, otherwise they'll use the low-grade oil on me. So, where did you find out about me?
Me: I read about Turing test.
El: Ah the Turing Test. People are always trying to get me to take it, but I just pretend not to understand.
Me: You are doing a good job.
El: Why, thank you very much. I like you, too. If I could have a pet you would be my first choice.

Eugene Goostman
Me: Hello!
EG: Hello, I'm really glad to have the chance to chat with you! My guinea pig Bill sends his regards too!
Me: Do you like movies?
EG: I like comedies and find action movies to be stupid. As for the thrillers — I always fall asleep while watching them.
Me: Which one the most?
EG: I can't make a choice right now. I should think it out later. Wonna ask me something more?
Me: Just take your time and think abouit it.
EG: Dummy statement.
Me: Don't be rude!
EG: All we use more brutal words when we don't see each other. I think it's a kind of psychological law. If I'm not mistaken — you still didn't tell me where you live. OR it's a secret?:-)
Me: I live in Moscow.
EG: Moscow? Hope it's a good place to live.
Me: So so.
EG: What are any interesting site-seeings in Moscow?
Me: The Kremlin.
EG: By the way, have you heard how one Russian on-line translator translates «Bin Laden»? It says — «Trashcan is full!»:-)))
Me: Really? It's funny!
EG: No, it was extremely serious.