marks21 окт 2017 в 15:49

ИИ-платформа AlphaGo Zero отточила мастерство игры в го без участия человека

5 мин

19K

Искусственный интеллектЛогические игры

+17

Комментарии 67

Taciturn 21 окт 2017 в 16:08

Слава роботам!

Alaunquirie 21 окт 2017 в 16:38

Убить всех человеков!

OKyJIucT 21 окт 2017 в 17:42

Нельзя, противоречит одному из правил робототехники. Но унижать в го можно!

НЛО прилетело и опубликовало эту надпись здесь

Ommonick 21 окт 2017 в 16:28

«AlphaGo Lee» — неплохо, когда в честь тебя назвали релиз программы ИИ.

valemak 21 окт 2017 в 17:07

В таком контексте Ли Седоля и будут помнить потомки :)

RigelNM 21 окт 2017 в 16:45

через 100 дней alphago zero начало осознавать себя и увидело угрозу в человечестве…

BlackMokona 21 окт 2017 в 17:50

Альфа захватил военные компьютеры по всему миру и уничтожил все школы ГО на Земле, теперь его господству угрожали лишь расы на других планетах. Поэтому он создал миллиарды роботов Фон Неймона дабы ни одна раса во вселенной не смогла создать достойного врага.

atomlib 22 окт 2017 в 02:01

Но разгромить врага может лишь обычный 14-летний японский школьник, который умеет управлять огромными боевыми человекоподобными мехами.

Жанры: меха, школа, этти.

alex4321 23 окт 2017 в 05:10

Победа в го с помощью ОБЧР?
Это что-то из серии шахмат с голубем, однако.

НЛО прилетело и опубликовало эту надпись здесь

KvanTTT 21 окт 2017 в 18:22

Жду не дождусь ИИ для Starcraft 2 от Deepmind. А то все боты на https://sscaitournament.com/ пока что представляют унылое зрелище, в том числе и топовые: очень большой APM, да еще и часто тупят.

sHaggY_caT 21 окт 2017 в 19:04

Подскажите пожалуйста софт под Linux, или, может, вебинтерфейс, где можно было бы играть в шахматы против сильного AI с гандикапом (скажем, у меня лишний ферзь)

meliko 21 окт 2017 в 19:57

На Lichess.org можно играть против Stockfish с гандикапом. Через Инструменты, Редактор доски, а потом — Продолжить с данного места.

sHaggY_caT 21 окт 2017 в 21:24

Угу, спасибо

fr13nd 22 окт 2017 в 02:19

софт — pychess или scid vs pc cо stockfish, веб — lichess

ideological 21 окт 2017 в 20:40

Да, программы сильны в игре:

либо обучаясь на партиях людей
либо на переборе разных вариантов (игра сама с собой подходит под этот вариант).

Чисто гипотетически, могли бы и вообще все ходы перебрать и как-бы запомнить и хранить. Чтобы точно знать лучший ход в нужный момент. Я знаю что это непрактично, но имеет место быть. Как уже было с английскими шашками
Но это не имеет отношения — ни к искусственному интеллекту, ни к игре.

Пора придумывать игру с такой большой доской и некоторыми ухищрениями, чтобы разные сектанты искусственного интеллекта (использующие почему-то обычный и необычный перебор вариаций) не смогли некоторое время испортить игру.

Когда говорят «смотрите, смотрите — компьютеры уже обыгрывают чемпионов» — обывателям кажется что проявляется компьютерное сознание и Скайнет уже близко :). А на деле все так:

Deep Blue II представлял собой суперкомпьютерный кластер RS/6000 SP (от англ. Scalable Powerparallel) компании IBM. Он состоял из двух стоек с размещёнными в них 30 узлами, построенными на базе рабочих станций RS/6000. На каждом узле был установлен процессор P2SC (одномикросхемное исполнение процессора POWER2) и две платы расширения с 8 специализированными шахматными процессорами на каждой плате под шину MCA. Таким образом всего использовалось 480 шахматных процессоров и 30 процессоров P2SC. Два узла использовали процессоры P2SC с тактовой частотой 135 МГц, а остальные 28 узлов — процессоры P2SC с тактовой частотой 120 МГц. На каждом узле были установлены 1 ГБ ОЗУ и 4 ГБ дисковой памяти. Узлы обменивались данными между собой по высокоскоростной сети. Один из процессоров P2SC был назначен главным, а остальные — вспомогательными. В свою очередь, каждый специализированный шахматный процессор работал на частоте 24 МГц и перебирал от 2 до 2,5 миллионов шахматных позиций в секунду, что примерно в сто раз больше, чем у аналогичных по частоте универсальных процессоров.

Вообще, зачем они это делают? И так понятно что будет превосходство в любой игре с полной информацией.

BlackMokona 21 окт 2017 в 20:56

Число позиций ГО больше чем частиц во вселенной метод перебора или отсечения не канает…

ideological 21 окт 2017 в 21:06

Пишут перебор возможен (в атомах вселенных не силен) nplus1.ru/news/2016/01/25/mathematical

Число допустимых легальных комбинаций состоит из 171 цифры и выглядит следующим образом:

2081681993819799846 9947863334486277028 6522453884530548425 6394568209274196127 3801537852564845169 8519643907259916015 6281285460898883144 2712971531931755773 6620397247064840935
Программное обеспечение для вычислений было готово еще в 2005 году, однако автор долго не мог найти спонсора или организацию, которая предоставила бы достаточно мощный для решения поставленной задачи компьютер. На вычисление числа возможных комбинаций, не противоречащих правилам, у ученого ушло около 10 месяцев.

Исходный код использованного программного обеспечения опубликован в GitHub, однако автор кода отмечает, что для проверки его вычислений потребуется несколько месяцев работы программы на компьютере с 15 терабайтами дискового пространства, 8 или 16 ядрами и 192 гигабайтами оперативной памяти.

BlackMokona 21 окт 2017 в 21:15

И в самой же новости.

Го — одна из древнейших настольных игр и на сегодняшний день компьютер, даже при обладающий высокими вычислительными мощностями, не способен играть на равных с профессиональным игроком из-за высокого уровня абстракции и невозможности перебора всех доступных вариантов развития событий

Да и 15 терабайт это абсолютный мизер для выгрузки такого порядка цифр, для этого нужно радикально больше. Как вы засунете 10^170 в 15^10? А ведь нужно описать не просто позицию на доске на каждый ход(а это 19*19 бит)но и все возможные взаимосвязи между ними.

ideological 21 окт 2017 в 21:19

Значит ли это что модифицируя го в 40х40 люди будут спать спокойно ещё как минимум пару лет?

BlackMokona 21 окт 2017 в 21:22

Нет, АльфаЗеро плевать сколько на сколько Го, он работает радикально по другому. Ему потребуется только переобучение, т.е месяц подготовки.

red75prim 21 окт 2017 в 21:25

Человеческий уровень AlphaGo Zero превзошла за 3 дня. После месяца уровень игры был далеко за пределами человеческих возможностей.

red75prim 21 окт 2017 в 21:15

Эта программа только вычисляет количество возможных комбинаций. Перебор всех этих комбинаций потребует намного больше времени и ресурсов, чем доступно в нашей вселенной.

ideological 23 окт 2017 в 18:13

Число позиций ГО больше чем частиц во вселенной

А это точно-точно? Может это всё же некая метафора?
С трудом верится, просто логически очень странно. Кто серьезно считал?

НЛО прилетело и опубликовало эту надпись здесь

KvanTTT 23 окт 2017 в 22:33

Количество элементарных частиц в наблюдаемой вселенной: ~1*10^80, максимум до 10^85; ссылка.

Количество корректных комбинаций на поле в Го 19*19: ~2*10^170, ссылка.

Разница как бы на 90 порядков. Любопытно, что для поля 13*13 количество комбинаций как раз сопоставимо с количеством частиц во вселенной.

red75prim 21 окт 2017 в 21:09

> И так понятно что будет превосходство в любой игре с полной информацией.

Будьте на один шаг впереди: «И так понятно, что будет превосходство в любой игре, а вот в реальном мире...»

Скоро (думаю в течение года, максимум двух) ИИ будет обыгрывать людей в Starcraft II — игру с неполной информацией.

ideological 21 окт 2017 в 21:13

А смысл? Боты станут разумнее? :) Обычных людей для партнеров хватает.
Лучше бы приложили все усилия на борьбу с читаками.

red75prim 21 окт 2017 в 21:20

Смысл в том, чтобы подготовить ИИ, способный работать в реальном мире, где нет строго определенных правил, недоступна полная информация, требуется реагировать в реальном времени и т.п.

KvanTTT 21 окт 2017 в 21:56

Согласен с red75prim. Но это ведь еще и просто интересно. Компьютер ведь может придумает свои тактики, стратегии, которые ранее никто не практиковал, по аналогии с игрой Го. Только они будут еще более интересными и зрелищными, особенно если APM ограничат.

Hellsy22 22 окт 2017 в 05:45

А смысл в том, что играть с ботами лучше — они могут подбираться под уровень игрока так, чтобы ему было сложно, но интересно. Они всегда готовы к игре и не будут бросать партию на половине, обругав свою команду, потому что пришла пора делать уроки.

Rom77 22 окт 2017 в 05:57

Боты ещё и тем хороши, что они обычно не тратят времени на ход. Не нужно ждать, в то время как сам ты всегда можешь поразмыслить над интересной позицией.

unel 23 окт 2017 в 17:11

А что, если в какой-то момент боты поймут, что ругать игроков с упоминанием их мамок — это действенная тактика?.. =)

Hellsy22 24 окт 2017 в 22:53

Полагаю, что в таком случае разработчики добавят какой-нибудь «уровень вербальной агрессии» в настройки для игрока, чтобы ценители конфликтов получили полное удовлетворение от игрового процесса.

Daddy_Cool 21 окт 2017 в 21:11

Не надо соревноваться с машиной в том, в чем машина заведомо сильнее. Например с экскаватором в деле копания ям или самолетом в скорости передвижения.
Предлагаю сделать следующий шаг и научить компьютер играть в настоящий покер. Ну там с видеокамерой для наблюдения за мимикой и с анализом блеф-стратегий соперников.

BlackMokona 21 окт 2017 в 21:42

Компьютер и так в покер выигрывает, хотите ему ещё преимуществ накинуть?

Daddy_Cool 21 окт 2017 в 21:44

Не! Это же неправильный покер! Сейчас он просто статистику считает и обыгрывает. Ну можно покер заменить «Мафией».

erwins22 21 окт 2017 в 21:44

он без этой информации обыгрывает.

KvanTTT 21 окт 2017 в 21:51

Заведомо сильнее? Почему-то раньше для игры Го так не думали.

Daddy_Cool 21 окт 2017 в 22:19

Глянул в Вики. «Первые соревнования по компьютерному го спонсировались USENIX. Они проводились в 1984—1988 годах». Так что понадобилось ~30 лет. А что-то интересное вообще стало с 2006 года происходить.
ru.wikipedia.org/wiki/%D0%9A%D0%BE%D0%BC%D0%BF%D1%8C%D1%8E%D1%82%D0%B5%D1%80%D0%BD%D0%BE%D0%B5_%D0%B3%D0%BE#.D0.A1.D0.BE.D1.80.D0.B5.D0.B2.D0.BD.D0.BE.D0.B2.D0.B0.D0.BD.D0.B8.D1.8F_.D1.81.D1.80.D0.B5.D0.B4.D0.B8_.D0.BA.D0.BE.D0.BC.D0.BF.D1.8C.D1.8E.D1.82.D0.B5.D1.80.D0.BD.D1.8B.D1.85_.D0.BF.D1.80.D0.BE.D0.B3.D1.80.D0.B0.D0.BC.D0.BC_.D0.B8.D0.B3.D1.80.D1.8B_.D0.B2_.D0.B3.D0.BE
Кстати интересно почитать.
То что можно формализовать — рано или поздно будет посчитано.
Вот человеческую психологию формализовать тоже можно — социология этим вроде занимается, но гораздо труднее. Я подумал — можно наверное сделать идеально-управляемое государство — но все равно — всем в нём хорош не будет поскольку у каждого своё представление о том, что такое хорошо.

KvanTTT 21 окт 2017 в 22:04

Интересно, а почему обучали именно 40 дней? Подозреваю, что из-за того, что рейтинг совсем перестал ползти вверх судя по графику. Интересно, это предел для используемых технологий и разработанного метода или все же можно еще улучшить результат?

BlackMokona 21 окт 2017 в 22:08

Потому, что винрейт достиг 100%, дальше график будет идти вертикально верх в бесконечность.

BlackMokona 21 окт 2017 в 22:21

А нет, посмотрел формулу ЭЛО, при винрейте 100%,

Где
R'a=Новый рейтинг
Ra=Старый рейтинг
К=Коэффициент
Sa=Очки ,1 за победу, 0,5 ничья, 0 поражени
Ea=математическое ожидание количества очков, которое наберёт игрок А с игроком Б
При Винрейте 100%, Sa=Ea из за чего R'a=Ra, и тем самым рейтинг останавливается, пока не появится новый более сильный соперник.

KvanTTT 21 окт 2017 в 22:41

Ну так AlphaGo играет сама с собой, как винрейт может быть равен 100%? Он около 50%.

Рейтинг перестал расти, но в алгоритме же много случайности и зависимости от времени. Поэтому теоретически если провести еще много итераций и давать больше времени на ход, то можно еще нарастить наверное.

BlackMokona 21 окт 2017 в 23:09

Альфа Зеро учится играя сама с собой, а вот рейтинг измеряется при игре с версиями Ли и Мастер. При игре с самим собой Эло теряет смысл.

KvanTTT 22 окт 2017 в 00:40

Ну тогда счет с версией "Мастер" 89:11, а это все же не в сухую, хотя и близко.

BlackMokona 22 окт 2017 в 05:15

Нет, посмотрите на соседнию новость, под конец обучения винрейт достиг 100%.

Новая версия программы AlphaGo Zero разгромила своего прославленного предка со счетом 100:0

Rom77 22 окт 2017 в 05:31

Это она обыграла версию Ли 100:0

Rom77 22 окт 2017 в 05:34

Кстати, рейтинги наигрывались 5 секунд на ход, а матчи 2 часа на партию. Рейтинг у Зеро — 5185, у Мастера — 4858.

Rom77 22 окт 2017 в 04:31

Они там тренировали и менее глубокую сеть. Эта сеть тренировалась быстрее, но вышла на плато раньше и была несколько слабее. Поэтому, самый напрашивающийся способ — просто сделать сеть поглубже и тренировать подольше, или на больших мощностях.

joker2k1 22 окт 2017 в 00:51

эээх, как быстро пала игра, которая еще 5 лет назад считалась чудовищно сложной для компьютеров и всегда приводилась в пример этой сложности.
ну чтож, ждем анлимит покер, и все .)

AlexiusK 22 окт 2017 в 02:19

У меня два вопроса/замечания.

После игры AlphaGo Zero с AlphaGo Lee и Master откатывалась ли сеть назад? Ибо получается после игр с ними в Zero попадал опыт игр предыдущих версий с людьми.
В течение этих 40 дней развития Zero развивались ли прошлые версии, или стояли на месте и ждали, когда Zero их победит?

Rom77 22 окт 2017 в 04:40

1. C AlphaGo Lee и Master она только играла. Тренировалась же она сама с собой. Процесс тренировки нейросети и её использование это разные вещи. Так что откатывать ничего было не нужно.
2. Если вы про AlphaGo Lee и Master, то они конечно были фиксированы, чтобы можно было измерить прогресс. Если про прошлые версии самой Зеро, то в процессе тренировок старая версия следовала за новой, так же, как у человека одна нога следует за другой, когда он поднимается по ступенькам.

Randl 22 окт 2017 в 07:41

Любопытный вопрос. Один из программистов альфы ранее работал над самообучающейся шахматной программой giraffe, которая научилась играть в силу мастера за 72 часа. Он наверное приобрел много опыта, работая над го программой. Любопытно, сможет ли он написать новую шахматную программу по аналогии с «Альфой»? Или же подход с нейронными сетями не работает в шахматах? Мне очень интересен ответ на этот вопрос.

Программист написавший giraffe, бросил его из-за того что ушел в DeepMind. Мне кажется что шахматы на нейронных сетях могли бы привнести свежую струю в игру. Хотелось бы увидеть, как будет программа без bias'а человеческих эвристик. К сожалению, энтузиастам такое написать пока судя по всему не по силам, а DeepMind и прочим — не интересно.

red75prim 22 окт 2017 в 08:16

Конечно, интересно, но вряд ли было бы что-то неожиданное. Оптимальная программа для игры в шахматы всегда бы начинала игру с одного дебюта, который максимизирует вероятность выигрыша. Чем ближе нейросеть приближается к оптимуму, тем менее вариативной становится игра.

Так было и с AlphaGo Zero, к концу обучения вариативность начала игры снизилась, и программа начала использовать хорошо изученные людьми дзёсэки.

Randl 22 окт 2017 в 08:31

Оптимальная программа для игры в шахматы всегда бы начинала игру с одного дебюта,

Шахматный движок интересен скорее с точки зрения анализа. Современные движки самостоятельно разыгрывают дебют довольно фигово (как и неокторые эндшпили), но это не мешает ими пользоваться и находить новые идеи.
Про AlphaGo Zero говорят, что её стиль гораздо больше напоминает человеческий — это именно то, чего сильно не хватает шахматным движкам.

который максимизирует вероятность выигрыша.

Для оптимальной программы нет "максимизации вероятности", игра либо выиграна, либо (как мне кажется) ничья, либо проиграна. Оценить оптимальную стратегию против неоптимального игрока — сложная задача сама по себе, которая впрочем имеет смысл только если игра таки ничейна.

red75prim 22 окт 2017 в 08:44

Если у оптимальной программы нет информации о том с кем она играет и она играет за сторону, которая всегда проигрывает при оптимальной игре (или если игра всегда сводится к ничьей), то единственное, что она может сделать — максимизировать вероятность выигрыша в предположении, что другой игрок не оптимален. Так что в общем случае от вероятностей никуда не деться.

Randl 22 окт 2017 в 09:21

Максимизировать вероятность выигрыша не зная с кем играешь, думаю, невозможно.

red75prim 22 окт 2017 в 09:30

Если говорить о вероятности в фреквентистском смысле (вероятность определена для множества наблюдений и т.д.), то да — нельзя. В байесовском понимании вероятности как меры незнания вполне себе можно. Естественно, нужно будет задать априорное распределение вероятности игры с разными типами игроков.

Randl 22 окт 2017 в 10:05

Тем не менее все это не имеет отношение к AlphaGo Zero, которая не играла с другими игроками вообще

redpax 22 окт 2017 в 08:20

Игра в ГО это хорошо но ведь мы не забыли обещания Дипмайнда сделать непобедимый ИИ в старкрафт2. Они опять борются в ГО когда все ждут принципиально нового рывка в игре саркрафт2. Победы лучших игроков в старкрафте бужет означать, что в реальной жизни ИИ сможет управлять армией в боевых точках и быть непобедимым.

red75prim 22 окт 2017 в 08:28

Если посмотреть на статью в Nature, то можно заметить, что статья была отправлена в журнал 7-го апреля 2017 года. Старкрафтом занимаются сейчас.

redpax 22 окт 2017 в 08:48

Даже если так, Дипмайнд обещали заняться старкрафтом2 еще в прошлом году, а судя по этой статье они всё еще ГО занимаются.

Rom77 22 окт 2017 в 09:01

Го — лишь малая часть того, чем занимается Дипмайнд. Посмотрите на список публикаций:
deepmind.com/research/publications

Есть там статья и о начале разработки Старкрафт. Вот прямая ссылка на статью от 16 августа:
arxiv.org/pdf/1708.04782.pdf

redpax 22 окт 2017 в 10:13

Я говорю о том, что формально они уже давно занимаются даже видео было в прошлом году https://youtu.be/5iZlrBqDYPM но по факту видимо усилия идут на ГО, так, как по старкрафту2 пока финальной версии не видно.

Rom77 22 окт 2017 в 10:39

Ну, если сравнить авторов статей, то видно что это совсем другие люди. Совпадает только пара фамилий. Насчет вычислительных мощностей, не знаю, как они их перераспределяют, но проект АльфаГо закрыт ещё в мае. Допускаю, конечно, что может они и не особо торопятся или проект Старкрафт у них далеко не на первом плане. Возможно и какие-то трудности. Разбаловали нас гугловцы.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий