История AlphaGo: как ИИ покорил самую сложную настольную игру

Futuristic illustration of AlphaGo with robot hand playing go
Futuristic illustration of AlphaGo with robot hand playing go

Кажется, всех игр ждет одна судьба: компьютеры совершенствуются и обходят нас — от победы Chinook над Мэрионом Тинсли в шашках (1994) до Deep Blue над Гарри Каспаровым в шахматах (1997).

Го выглядело неуязвимым: коэффициент ветвления здесь такой, что полный перебор бессилен, и годами программы для Го были куда слабее сильных игроков.

Меньше чем через двадцать лет после Deep Blue, в 2015 году, DeepMind представила AlphaGo — и за год он перевернул все эти представления, заставив заново обдумать, что такое «интуиция» и «творчество» в Го.

Это был порог, за которым последний рубеж Го превратился в полигон для искусственного интеллекта.

Статья подготовлена по мотивам видео на канале Go Magic.

Почему Го — особая игра

Прежде чем на сцену выйдет ИИ, стоит коротко описать саму игру. Правила Го объясняются за минуту, а позиции при этом быстро уходят в непредсказуемость и неопределенность — именно это сочетание надолго оставило компьютеры далеко позади сильных игроков.

Простые правила, безграничная сложность

Игроки ставят черные и белые камни на свободные пункты: первыми ходят черные, отвечают белые, дальше ходы чередуются. Задача — разделить доску на области надежной территории, а захваты здесь — средство, а не цель. Дамэ камня — это соседние с ним пункты; когда не остается ни одного, камень снимают с доски. В простейшем примере у одинокого белого камня четыре соседних пункта: как только черные займут все четыре, камень захвачен. Из этого крошечного свода правил вырастает дерево вариантов, которое очень быстро перестает поддаваться прямому расчету. Более подробное пошаговое введение в правила — в нашем интерактивном руководстве.

×

Ранние программы для Го сильно отставали от людей: даже нескольких месяцев занятий человеку хватало, чтобы обойти сильнейшие движки того времени. Причина структурная — в Го слишком много вариантов, чтобы решить его полным перебором. На практике игра держится на смеси локального счета вариантов и чутья. Позиции настолько непредсказуемы, что просчитать все точно обычно невозможно, и ходы часто выбираются интуитивно. Сократить разрыв машинам удалось только с появлением новых алгоритмов.

Фора позволяет более слабой стороне выставить камни до первого хода — два, три, пять и больше, — чтобы партия оставалась осмысленной при разнице в силе. Те же расстановки стали стресс-тестом для ранних движков. Даже при огромной форе, когда вся доска была заполнена черными камнями, люди обыгрывали программы без особого труда. 

Черные камни, выложенные в абстрактную фигуру на деревянной доске
Даже при такой чудовищной форе ранние программы для Го проигрывали сильным игрокам.

Прорыв

Годами кривая росла плавно: новые алгоритмы, программы получше, устойчивый, но не впечатляющий прогресс. А потом наступил 2015 год, и история резко свернула.

Команда DeepMind вышла на Фань Хуэя — профессионала 2 дана родом из Китая, к тому времени жившего во Франции и, что важно, трехкратного чемпиона Европы. Это была естественная первая проверка. В октябре 2015 года стороны сыграли матч из пяти партий. Фань Хуэй, как и большинство профессионалов той поры, был настроен скептически: опыт подсказывал, что никакая программа не обыграет сильного человека. Это ожидание рухнуло почти сразу. После первой партии стало ясно, что баланс сместился, и матч закончился сухим счетом: пять поражений в пяти партиях. Результат многих поразил, но мир Го в целом не почувствовал, что все перевернулось — многие подозревали, что это все еще не «настоящее» столкновение человека с машиной.

Более серьезное испытание было неизбежно. Соперником на следующий год стала легенда — Ли Седоль из Южной Кореи. К 2015 году за ним закрепилось сравнение «Майкл Джордан в мире Го»: восемнадцать международных титулов, репутация агрессивного, интуитивного игрока. Перед матчем Ли просмотрел пять партий с Фань Хуэем и, как и Фань Хуэй до него, остался при своем: увиденный уровень показался ему ниже собственного, и он рассчитывал на уверенную победу. Чего он не учел, так это дополнительного обучения AlphaGo перед их встречей — подготовки, которая изменила расстановку сил к марту 2016 года.

Ли Седоль против AlphaGo

Ожидание нарастало в начале 2016 года, пока вопрос не стал скорее культурным, чем спортивным: что будет, когда живая легенда встретится с машиной, которая от матча к матчу становится сильнее? Ставки склонялись в пользу человека: большинство поставило на Ли Седоля. Событие вышло далеко за пределы игрового зала — прямые комментарии на нескольких языках, огромные уличные экраны в Сеуле, превратившие улицы в просмотровые залы. Когда на доску лег первый камень, это уже походило на всемирный стресс-тест человеческой интуиции.

Партия 1: ранний бой и неожиданный стиль машины

Здравый смысл подсказывал, что программе против топового профессионала стоит избегать раннего хаоса. AlphaGo сделал ровно наоборот: завязал острый бой прямо с начала партии — именно тот сценарий, который считался выгодным человеку, — и выиграл с обескураживающей легкостью. Ли был озадачен, а настоящая борьба, казалось, только начиналась.

Партия 2: «невозможный» 37-й ход

Вторая партия подарила момент, от которого зал замер. На 37-м ходу машина выбрала линию, которую люди «не играют». Это шло вразрез с азбукой хорошего тона за доской, с тем, что вбивают в голову как основы, — и все же ход стоял на доске, спокойный и невозмутимый. Зрители остолбенели: ход «удивил всех, кто смотрел». По человеческой доктрине так «просто нельзя играть». И все-таки система сыграла его, а потом заставила работать. В это мгновение матч перестал быть спором о подражании базам данных. Он стал доказательством того, что программа способна выйти за пределы исходных данных, шагнуть за границы человеческих партий, на которых училась, и найти что-то по-настоящему творческое. Остаток дня подтвердил шок: AlphaGo выиграл партию и повел 2–0, загнав Ли Седоля туда, где матч можно было спасти только выдающимися идеями.

Партия 3: попытка переломить ход событий

Матч уплывал, и Ли пошел единственным оставшимся путем: осложнения и большой бой с самого начала партии. Не сработало. AlphaGo стабилизировался, выиграл снова, и при счете 3–0 матч был фактически окончен.

Партия 4: шедевр человека, 78-й ход

К середине четвертой партии казалось, что все решено: AlphaGo вел примерно десять очков, а на таком уровне это обычно означает спокойное скольжение к финишу. И тут в позиции, закрытой для чудес, Ли Седоль нашел единственную ошеломляющую идею, которой не увидел никто в зале. Ход попал в слепое пятно системы. Оценка AlphaGo дала сбой, он не смог разобраться в позиции, и инициатива перешла к человеку. У этой искры есть имя в летописи Го — 78-й ход. Более поздние разборы, с ИИ куда более сильным, чем версия 2016 года, показали, что в принципе прием не должен работать, — но против той сборки, в тот день, он сработал. Ли реализовал перевес и выиграл. Помимо счета, эта сцена важна тем, что доказала кое-что о духе всего матча. Первые три партии показали машину, способную и на тихую силу, и на поразительные находки, а четвертая показала, что человеческое творчество еще может пробить брешь в этой броне. Это единственная победа человека над той машиной — исключение, ставшее легендой.

Партия 5: точка в матче

Пятая партия началась сразу после этого перелома, с натянутыми нервами с обеих сторон. Ли снова давил, искал осложнения и способы вновь раскрыть доску. AlphaGo встретил напор спокойно, эффективно разменялся в середине партии и превратил небольшой перевес в устойчивый. Когда исход подсчета стал очевиден, Ли сдался. Зрители увидели и человеческий шедевр накануне, и способность системы пережить его и ответить уже в следующей партии.

Итоговый счет и его наследие

Матч закончился 4–1. За счетом стояло нечто новое: ИИ, который умеет быстро учиться между встречами, выходить за рамки человеческих привычек и при этом выдерживать самый яркий свет софитов. Это была неделя, когда человек окончательно проиграл машине в Го, — и неделя, когда творческий поиск ИИ перестал быть гипотезой и стал виден прямо на доске.

Подробнее о наследии матча и о том, что он значит для сегодняшних игроков, — в нашей статье «Ли Седоль и AlphaGo: наследие исторической битвы!» 

От AlphaGo к AlphaGo Zero

После Сеула появлялись все более сильные сборки, но настоящий поворот случился годом позже, когда на сцену вышла совсем другая система — с новым именем и новой идеей.

Новую систему назвали AlphaGo Zero: «Zero» — потому что Го он учил с нуля. Никакого архива человеческих партий, никаких унаследованных дзёсэки и профессиональных привычек. Только базовые правила и бесконечная игра с самим собой.

Comparison of AlphaGo match scores versus Fan Hui, Lee Sedol, pro players and AlphaGo Master

Поначалу партии по человеческим меркам были ужасны: тысячи спотыканий, ходы, похожие на случайные. Но обучающему циклу не было дела до красоты — ему важен был результат. Миллионы и миллионы партий с самим собой, и сила системы неуклонно росла.

Итог оказался однозначным: тот, кто учился с нуля, превзошел все прежние версии, обученные на человеческих данных. Иначе говоря, убрать человеческую точку отсчета, исключить «человеческий фактор» оказалось для машины выгоднее.

Важна была не только скорость или сила, но и направление. Система, не привязанная к человеческим примерам, могла исследовать линии, которым ее никто не учил, уверенно отвечать на давние вопросы и делать нормой идеи, еще недавно казавшиеся ересью. Спустя годы сверхчеловеческий ИИ для Го есть в арсенале у каждого — и это одновременно благо и проклятие для того, как игроки учатся и как развивается игра.

Чтобы поставить современные движки анализа Го на свой компьютер, воспользуйтесь нашей пошаговой инструкцией «Установка и настройка программ для анализа партий Го».

За пределами человеческого Го: начало, а не конец

История заканчивается не на мрачной ноте. Та победа девять лет назад значила больше, чем «мы научили машину играть в Го» — или в крестики-нолики, или в StarCraft. Она открыла метод: AlphaGo показал, как правильно обучать ИИ сложным задачам.

К 2025 году этот метод ушел далеко за пределы доски 19×19: системы, которые понимают человеческую речь, генерируют изображения и видео, сочиняют музыку и делают многое другое, стали обыденностью. При этом исследовательский фронт остается открытым: работа не закончена, и предел того, что она может значить для нашего вида, пока неизвестен.

Вокруг самого Го разговор тоже становится шире. Учеба — уже не только «как играть в эту игру», но и все, что вращается вокруг доски: технологии, творчество, последствия для игроков и болельщиков. В конце стоит не точка, а многоточие: от одной доски к большому миру — следующий ход еще не сделан.

Связанные статьи

Комментарии

👍
Войдите, чтобы задать вопрос