История AlphaGo: как ИИ покорил самую сложную настольную игру


Кажется, всех игр ждет одна судьба: компьютеры совершенствуются и обходят нас — от победы Chinook над Мэрионом Тинсли в шашках (1994) до Deep Blue над Гарри Каспаровым в шахматах (1997).
Го выглядело неуязвимым: коэффициент ветвления здесь такой, что полный перебор бессилен, и годами программы для Го были куда слабее сильных игроков.
Меньше чем через двадцать лет после Deep Blue, в 2015 году, DeepMind представила AlphaGo — и за год он перевернул все эти представления, заставив заново обдумать, что такое «интуиция» и «творчество» в Го.
Это был порог, за которым последний рубеж Го превратился в полигон для искусственного интеллекта.
Статья подготовлена по мотивам видео на канале Go Magic.
Почему Го — особая игра
Прежде чем на сцену выйдет ИИ, стоит коротко описать саму игру. Правила Го объясняются за минуту, а позиции при этом быстро уходят в непредсказуемость и неопределенность — именно это сочетание надолго оставило компьютеры далеко позади сильных игроков.
Простые правила, безграничная сложность
Игроки ставят черные и белые камни на свободные пункты: первыми ходят черные, отвечают белые, дальше ходы чередуются. Задача — разделить доску на области надежной территории, а захваты здесь — средство, а не цель. Дамэ камня — это соседние с ним пункты; когда не остается ни одного, камень снимают с доски. В простейшем примере у одинокого белого камня четыре соседних пункта: как только черные займут все четыре, камень захвачен. Из этого крошечного свода правил вырастает дерево вариантов, которое очень быстро перестает поддаваться прямому расчету. Более подробное пошаговое введение в правила — в нашем интерактивном руководстве.
Ранние программы для Го сильно отставали от людей: даже нескольких месяцев занятий человеку хватало, чтобы обойти сильнейшие движки того времени. Причина структурная — в Го слишком много вариантов, чтобы решить его полным перебором. На практике игра держится на смеси локального счета вариантов и чутья. Позиции настолько непредсказуемы, что просчитать все точно обычно невозможно, и ходы часто выбираются интуитивно. Сократить разрыв машинам удалось только с появлением новых алгоритмов.
Фора позволяет более слабой стороне выставить камни до первого хода — два, три, пять и больше, — чтобы партия оставалась осмысленной при разнице в силе. Те же расстановки стали стресс-тестом для ранних движков. Даже при огромной форе, когда вся доска была заполнена черными камнями, люди обыгрывали программы без особого труда.

Прорыв
Годами кривая росла плавно: новые алгоритмы, программы получше, устойчивый, но не впечатляющий прогресс. А потом наступил 2015 год, и история резко свернула.
Команда DeepMind вышла на Фань Хуэя — профессионала 2 дана родом из Китая, к тому времени жившего во Франции и, что важно, трехкратного чемпиона Европы. Это была естественная первая проверка. В октябре 2015 года стороны сыграли матч из пяти партий. Фань Хуэй, как и большинство профессионалов той поры, был настроен скептически: опыт подсказывал, что никакая программа не обыграет сильного человека. Это ожидание рухнуло почти сразу. После первой партии стало ясно, что баланс сместился, и матч закончился сухим счетом: пять поражений в пяти партиях. Результат многих поразил, но мир Го в целом не почувствовал, что все перевернулось — многие подозревали, что это все еще не «настоящее» столкновение человека с машиной.

Более серьезное испытание было неизбежно. Соперником на следующий год стала легенда — Ли Седоль из Южной Кореи. К 2015 году за ним закрепилось сравнение «Майкл Джордан в мире Го»: восемнадцать международных титулов, репутация агрессивного, интуитивного игрока. Перед матчем Ли просмотрел пять партий с Фань Хуэем и, как и Фань Хуэй до него, остался при своем: увиденный уровень показался ему ниже собственного, и он рассчитывал на уверенную победу. Чего он не учел, так это дополнительного обучения AlphaGo перед их встречей — подготовки, которая изменила расстановку сил к марту 2016 года.
Ли Седоль против AlphaGo
Ожидание нарастало в начале 2016 года, пока вопрос не стал скорее культурным, чем спортивным: что будет, когда живая легенда встретится с машиной, которая от матча к матчу становится сильнее? Ставки склонялись в пользу человека: большинство поставило на Ли Седоля. Событие вышло далеко за пределы игрового зала — прямые комментарии на нескольких языках, огромные уличные экраны в Сеуле, превратившие улицы в просмотровые залы. Когда на доску лег первый камень, это уже походило на всемирный стресс-тест человеческой интуиции.

Партия 1: ранний бой и неожиданный стиль машины
Здравый смысл подсказывал, что программе против топового профессионала стоит избегать раннего хаоса. AlphaGo сделал ровно наоборот: завязал острый бой прямо с начала партии — именно тот сценарий, который считался выгодным человеку, — и выиграл с обескураживающей легкостью. Ли был озадачен, а настоящая борьба, казалось, только начиналась.
Партия 2: «невозможный» 37-й ход
Вторая партия подарила момент, от которого зал замер. На 37-м ходу машина выбрала линию, которую люди «не играют». Это шло вразрез с азбукой хорошего тона за доской, с тем, что вбивают в голову как основы, — и все же ход стоял на доске, спокойный и невозмутимый. Зрители остолбенели: ход «удивил всех, кто смотрел». По человеческой доктрине так «просто нельзя играть». И все-таки система сыграла его, а потом заставила работать. В это мгновение матч перестал быть спором о подражании базам данных. Он стал доказательством того, что программа способна выйти за пределы исходных данных, шагнуть за границы человеческих партий, на которых училась, и найти что-то по-настоящему творческое. Остаток дня подтвердил шок: AlphaGo выиграл партию и повел 2–0, загнав Ли Седоля туда, где матч можно было спасти только выдающимися идеями.

Партия 3: попытка переломить ход событий
Матч уплывал, и Ли пошел единственным оставшимся путем: осложнения и большой бой с самого начала партии. Не сработало. AlphaGo стабилизировался, выиграл снова, и при счете 3–0 матч был фактически окончен.
Партия 4: шедевр человека, 78-й ход
К середине четвертой партии казалось, что все решено: AlphaGo вел примерно десять очков, а на таком уровне это обычно означает спокойное скольжение к финишу. И тут в позиции, закрытой для чудес, Ли Седоль нашел единственную ошеломляющую идею, которой не увидел никто в зале. Ход попал в слепое пятно системы. Оценка AlphaGo дала сбой, он не смог разобраться в позиции, и инициатива перешла к человеку. У этой искры есть имя в летописи Го — 78-й ход. Более поздние разборы, с ИИ куда более сильным, чем версия 2016 года, показали, что в принципе прием не должен работать, — но против той сборки, в тот день, он сработал. Ли реализовал перевес и выиграл. Помимо счета, эта сцена важна тем, что доказала кое-что о духе всего матча. Первые три партии показали машину, способную и на тихую силу, и на поразительные находки, а четвертая показала, что человеческое творчество еще может пробить брешь в этой броне. Это единственная победа человека над той машиной — исключение, ставшее легендой.

Партия 5: точка в матче
Пятая партия началась сразу после этого перелома, с натянутыми нервами с обеих сторон. Ли снова давил, искал осложнения и способы вновь раскрыть доску. AlphaGo встретил напор спокойно, эффективно разменялся в середине партии и превратил небольшой перевес в устойчивый. Когда исход подсчета стал очевиден, Ли сдался. Зрители увидели и человеческий шедевр накануне, и способность системы пережить его и ответить уже в следующей партии.
Итоговый счет и его наследие
Матч закончился 4–1. За счетом стояло нечто новое: ИИ, который умеет быстро учиться между встречами, выходить за рамки человеческих привычек и при этом выдерживать самый яркий свет софитов. Это была неделя, когда человек окончательно проиграл машине в Го, — и неделя, когда творческий поиск ИИ перестал быть гипотезой и стал виден прямо на доске.
Подробнее о наследии матча и о том, что он значит для сегодняшних игроков, — в нашей статье «Ли Седоль и AlphaGo: наследие исторической битвы!»
От AlphaGo к AlphaGo Zero
После Сеула появлялись все более сильные сборки, но настоящий поворот случился годом позже, когда на сцену вышла совсем другая система — с новым именем и новой идеей.
Новую систему назвали AlphaGo Zero: «Zero» — потому что Го он учил с нуля. Никакого архива человеческих партий, никаких унаследованных дзёсэки и профессиональных привычек. Только базовые правила и бесконечная игра с самим собой.

Поначалу партии по человеческим меркам были ужасны: тысячи спотыканий, ходы, похожие на случайные. Но обучающему циклу не было дела до красоты — ему важен был результат. Миллионы и миллионы партий с самим собой, и сила системы неуклонно росла.
Итог оказался однозначным: тот, кто учился с нуля, превзошел все прежние версии, обученные на человеческих данных. Иначе говоря, убрать человеческую точку отсчета, исключить «человеческий фактор» оказалось для машины выгоднее.
Важна была не только скорость или сила, но и направление. Система, не привязанная к человеческим примерам, могла исследовать линии, которым ее никто не учил, уверенно отвечать на давние вопросы и делать нормой идеи, еще недавно казавшиеся ересью. Спустя годы сверхчеловеческий ИИ для Го есть в арсенале у каждого — и это одновременно благо и проклятие для того, как игроки учатся и как развивается игра.
Чтобы поставить современные движки анализа Го на свой компьютер, воспользуйтесь нашей пошаговой инструкцией «Установка и настройка программ для анализа партий Го».
За пределами человеческого Го: начало, а не конец
История заканчивается не на мрачной ноте. Та победа девять лет назад значила больше, чем «мы научили машину играть в Го» — или в крестики-нолики, или в StarCraft. Она открыла метод: AlphaGo показал, как правильно обучать ИИ сложным задачам.
К 2025 году этот метод ушел далеко за пределы доски 19×19: системы, которые понимают человеческую речь, генерируют изображения и видео, сочиняют музыку и делают многое другое, стали обыденностью. При этом исследовательский фронт остается открытым: работа не закончена, и предел того, что она может значить для нашего вида, пока неизвестен.
Вокруг самого Го разговор тоже становится шире. Учеба — уже не только «как играть в эту игру», но и все, что вращается вокруг доски: технологии, творчество, последствия для игроков и болельщиков. В конце стоит не точка, а многоточие: от одной доски к большому миру — следующий ход еще не сделан.
Комментарии