Back to School Sale: take 40% OFF all memberships and courses with code STUDY40 — through September 6 only ×

Câu chuyện AlphaGo: AI chinh phục môn cờ khó nhất ra sao

Futuristic illustration of AlphaGo with robot hand playing go
Futuristic illustration of AlphaGo with robot hand playing go

Every game seems to meet the same fate: as computers improve, they overtake us, from Chinook, which inherited Marion Tinsley’s checkers title in 1994 when illness forced him to withdraw from their rematch, to Deep Blue over Garry Kasparov in chess (1997).

Riêng cờ vây thì như miễn nhiễm: số biến quá lớn khiến lối tính vét cạn sụp đổ, nên suốt nhiều năm, chương trình cờ vây vẫn yếu hơn hẳn kỳ thủ mạnh.

Chưa đầy hai mươi năm sau Deep Blue, DeepMind trình làng AlphaGo vào năm 2015. Chỉ trong một năm, nó lật ngược toàn bộ giả định ấy, buộc cả làng cờ nghĩ lại xem “trực giác” và “sáng tạo” trong cờ vây thật ra là gì.

Đó chính là ngưỡng cửa: thành trì cuối cùng của cờ vây trở thành sân thử sức của AI.

Bài viết này dựa trên video của kênh Go Magic.

Vì sao cờ vây khác biệt

Trước khi AI bước vào câu chuyện, hãy nhìn lại chính môn cờ này một chút. Cờ vây có bộ luật đơn giản đến mức một phút là giải thích xong, nhưng thế cờ thì cứ mở ra mãi, đầy bất ngờ và bất định. Chính sự kết hợp đó khiến máy tính tụt lại rất xa sau kỳ thủ mạnh suốt một thời gian dài.

Luật đơn giản, biến hóa vô tận

Players place black and white stones on empty intersections; Black plays first, White replies, and turns alternate. The aim is to divide the board into areas of secure territory, with captures as a means rather than the goal. A stone’s liberties are the empty intersections adjacent to it; fill them all and the stone is taken off the board. In a basic example, a lone white stone has four adjacent intersections; once Black occupies all four, the stone is captured. From that tiny ruleset, the game’s decision tree quickly outgrows straightforward calculation. For a deeper, step by step introduction to the rules, see our interactive guide.

×

Chương trình cờ vây đời đầu thua con người rất xa: chỉ cần vài tháng học nghiêm túc là người chơi vượt qua được phần mềm mạnh nhất thời đó. Lý do rất đơn giản và nằm ngay trong cấu trúc của môn cờ: cờ vây có quá nhiều biến, tính vét cạn không giải nổi. Trong thực chiến, người chơi vừa đọc cờ cục bộ vừa dựa vào cảm giác. Thế cờ khó lường tới mức thường không thể tính hết cho chính xác, nên phải chọn nước đi bằng trực giác. Chỉ khi có những thuật toán mới, máy mới bắt đầu rút ngắn khoảng cách.

Cờ chấp cho bên yếu hơn đặt sẵn quân trước nước đi đầu tiên – hai, ba, năm quân hoặc hơn nữa – để ván đấu vẫn có ý nghĩa dù trình độ chênh nhau. Chính những thế chấp ấy trở thành bài kiểm tra độ bền cho phần mềm đời đầu. Ngay cả khi thế cờ trông áp đảo, bàn cờ phủ kín quân đen, con người vẫn hạ chương trình khá nhẹ nhàng. 

Quân đen xếp thành hình trừu tượng trên bàn cờ gỗ
Chấp tới mức ấy mà chương trình cờ vây đời đầu vẫn thua các kỳ thủ mạnh.

Bước đột phá

Suốt nhiều năm, đường đi lên rất thoai thoải: thuật toán mới, chương trình khá hơn, tiến bộ đều đặn nhưng chẳng có gì gây choáng. Rồi năm 2015 tới, câu chuyện rẽ ngoặt.

Đội ngũ DeepMind tìm đến Fan Hui, kỳ thủ chuyên nghiệp 2 dan gốc Trung Quốc, khi ấy sống ở Pháp, và quan trọng hơn cả, từng ba lần vô địch châu Âu. Đó là phép thử đầu tiên rất hợp lý. Tháng 10/2015, hai bên chơi loạt năm ván. Như phần lớn kỳ thủ chuyên nghiệp thời đó, Fan Hui hoài nghi: kinh nghiệm cho thấy chưa chương trình nào thắng nổi người chơi mạnh. Niềm tin ấy sụp đổ gần như ngay lập tức. Xong ván đầu, ai cũng thấy cán cân đã lệch; loạt trận kết thúc bằng cú quét sạch: thua cả năm ván. Kết quả làm nhiều người sững sờ, nhưng làng cờ vây nói chung chưa thấy mọi thứ lật hẳn; không ít kỳ thủ vẫn ngờ rằng đây chưa phải màn phân định “thật sự” giữa người và máy.

Thử thách lớn hơn là điều tất yếu. Đối thủ của năm sau là một huyền thoại người Hàn Quốc: Lee Sedol. Theo cách nói năm 2015, ví von đọng lại nhiều nhất là “Michael Jordan của cờ vây”: 18 danh hiệu quốc tế, nổi tiếng với lối chơi hiếu chiến và giàu trực giác. Trước loạt trận, Lee Sedol xem lại năm ván của Fan Hui và, giống Fan Hui trước đó, vẫn không tin: trình độ hiện ra trên kỳ phổ thấp hơn mình, nên anh tính sẽ thắng thong thả. Điều anh không lường được là AlphaGo còn học thêm rất nhiều trước cuộc chạm trán; chính phần chuẩn bị đó sẽ làm nghiêng sân khấu tháng 3/2016.

Lee Sedol vs AlphaGo

Bước sang đầu năm 2016, sự chờ đợi cứ lớn dần, tới mức câu hỏi đặt ra không chỉ là chuyện thắng thua mà còn là chuyện văn hóa: điều gì xảy ra khi một huyền thoại sống ngồi trước cỗ máy cứ mạnh lên sau mỗi lần xuất hiện? Dư luận nghiêng về con người, phần lớn tiền cược đặt vào Lee Sedol. Sự kiện tràn ra khỏi phòng đấu: bình luận trực tiếp bằng nhiều thứ tiếng, màn hình khổng lồ dựng ngoài trời khắp Seoul biến đường phố thành nơi xem chung. Nên khi nước đầu tiên chạm bàn cờ, đó giống như một cuộc thử sức trực giác con người ở quy mô toàn cầu.

Ván 1: giao tranh sớm và lối chơi lạ của máy

Theo lẽ thường, gặp kỳ thủ chuyên nghiệp hàng đầu thì chương trình nên tránh loạn đả từ sớm. AlphaGo làm ngược lại: ngay từ khai cuộc đã lao vào cuộc chiến gắt, đúng kiểu thế trận mà ai cũng tin là có lợi cho con người, rồi thắng nhẹ tênh. Lee Sedol chưng hửng; ai cũng nghĩ trận chiến thật sự chỉ mới bắt đầu.

Ván 2: nước 37 “không tưởng”

Ván hai sinh ra một khoảnh khắc khiến cả phòng đấu lặng đi. Ở nước 37, cỗ máy chọn đúng cái biến mà người ta “không đi”. Nước đó đi ngược hẳn những phép tắc vỡ lòng trên bàn cờ, thứ ai học cờ cũng phải thuộc nằm lòng, vậy mà quân cờ vẫn nằm đó, thản nhiên, chẳng chút ngập ngừng. Người xem sững sờ; nước đi ấy “làm tất cả những ai đang theo dõi phải ngỡ ngàng”. Theo sách vở của con người, lựa chọn đó “không thể đi được”. Vậy mà hệ thống vẫn đi. Và nước ấy thành công. Ngay khoảnh khắc đó, loạt trận không còn là câu hỏi liệu máy có chỉ biết bắt chước kỳ phổ hay không. Nó trở thành bằng chứng rằng chương trình vượt qua được chính bộ dữ liệu ban đầu, bước ra ngoài những ván cờ của con người mà nó học theo và tìm ra điều gì đó thật sự sáng tạo. Phần còn lại của ngày hôm ấy xác nhận cú sốc. AlphaGo thắng luôn ván này, dẫn 2–0, đẩy Lee Sedol vào thế chỉ còn những ý tưởng phi thường mới giữ nổi loạt trận.

Ván 3: cố xoay chuyển tình thế

Loạt trận đang trôi khỏi tầm tay, Lee Sedol chỉ còn một đường: làm thế cờ rối lên và mở trận đánh lớn ngay từ khai cuộc. AlphaGo không mắc câu. Máy ổn định thế trận rồi lại thắng; ở tỉ số 3–0, loạt trận coi như đã ngã ngũ.

Ván 4: kiệt tác của con người, nước 78

Đến giữa ván bốn, mọi thứ tưởng như an bài. AlphaGo dẫn khoảng mười mục; ở đẳng cấp này, chừng ấy thường đã đủ để thong thả về đích. Rồi trong thế cờ tưởng chừng không còn chỗ cho phép màu, Lee Sedol tìm ra một ý tưởng duy nhất, đẹp tới mức sững người, mà không ai ở hiện trường nhìn ra. Nước đó đánh trúng điểm mù của hệ thống. Phần đánh giá thế cờ của AlphaGo chao đảo, máy không xử lý nổi cục diện và thế trận đảo chiều. Tia sáng ấy có hẳn một cái tên trong lịch sử cờ vây: nước 78. Về sau, khi phân tích lại bằng những AI mạnh hơn hẳn phiên bản 2016, người ta thấy về lý thì đòn đó không nên thành công; vậy mà trước phiên bản ấy, trong ngày hôm ấy, nó thành công thật. Lee Sedol giữ vững ưu thế và thắng. Ngoài tỉ số, cảnh tượng đó còn quan trọng vì nó nói lên tinh thần của cả loạt trận. Ba ván đầu cho thấy một cỗ máy mạnh mà lặng lẽ, lại biết tung ra phát kiến gây choáng; ván bốn cho thấy sức sáng tạo của con người vẫn có thể chọc thủng lớp giáp ấy. Đó vẫn là chiến thắng duy nhất của con người trước cỗ máy đó, một ngoại lệ đã thành huyền thoại.

Ván 5: khép lại loạt trận

The fifth game arrived with momentum freshly shifted and nerves taut on both sides. Lee pressed again, looking for complications and ways to reopen the board. AlphaGo met the pressure with calm, traded efficiently in the middlegame, and turned a small edge into a stable lead. When the territorial count became clear, Lee resigned. The audience saw both the human masterpiece of the day before and the system’s ability to come back and win the very next game.

Tỉ số cuối cùng và ý nghĩa còn lại

The match ended 4–1. Beyond the scoreline was a new pattern: an AI that could step outside human habits and still deliver under the brightest lights. That was the week humans finally lost to machines at Go, and the week creative search by AI stopped being speculative and became visible on the board.

For a deeper look at the match’s legacy and what it means for players today, see our article “Lee Sedol and AlphaGo: The Legacy of a Historic Fight!”: 

Từ AlphaGo đến AlphaGo Zero

Sau Seoul, những phiên bản mạnh hơn vẫn nối nhau ra đời, nhưng khúc ngoặt thật sự chỉ đến một năm sau, khi một hệ thống hoàn toàn khác bước lên sân khấu với cái tên mới và tiền đề mới.

Hệ thống mới ấy tên là AlphaGo Zero, chữ “Zero” đến từ chuyện nó học cờ vây từ con số không. Không kho kỳ phổ của con người, không định thức kế thừa, không thói quen nhà nghề; chỉ có luật cơ bản, rồi tự đấu với chính mình không ngơi nghỉ.

Comparison of AlphaGo match scores versus Fan Hui, Lee Sedol, pro players and AlphaGo Master

Thời gian đầu, những ván cờ đó tệ theo chuẩn con người: hàng nghìn cú vấp, nhiều nước đi gần như ngẫu nhiên. Nhưng vòng lặp học máy không quan tâm tới cái đẹp, chỉ quan tâm tới kết quả. Qua hàng triệu rồi hàng chục triệu ván tự đấu, trình độ của hệ thống cứ thế đi lên đều đặn.

Kết quả nhận về rất rõ ràng: cỗ máy học từ con số không vượt qua mọi phiên bản trước đó vốn luyện trên dữ liệu con người. Nói cách khác, bỏ đi điểm xuất phát của con người, loại luôn “yếu tố con người”, hóa ra lại tốt hơn cho máy.

Điều quan trọng không chỉ nằm ở tốc độ hay sức mạnh, mà ở hướng đi. Một hệ thống không neo vào khuôn mẫu của con người có thể tự dò những biến chưa ai dạy nó, trả lời dứt khoát các câu hỏi treo lơ lửng bao năm và biến những ý tưởng từng bị coi là dị thường thành chuyện bình thường. Nhiều năm sau, AI cờ vây mạnh hơn con người nằm sẵn trong hộp công cụ của mọi người: vừa là món quà, vừa là gánh nặng cho cách kỳ thủ học cờ và cho cách môn cờ này tiến hóa.

Muốn tự cài công cụ phân tích cờ vây hiện đại lên máy của mình, hãy làm theo hướng dẫn từng bước “Cách cài phần mềm phân tích ván cờ vây bằng AI”

Cờ vây vượt tầm con người: khởi đầu chứ không phải kết thúc

Câu chuyện không khép lại bằng một nốt trầm. Chiến thắng chín năm trước mang ý nghĩa lớn hơn nhiều so với việc dạy máy chơi cờ vây, hay Tic Tac Toe, hay StarCraft. Nó hé lộ một phương pháp: AlphaGo cho thấy cách huấn luyện AI sao cho đúng với những nhiệm vụ phức tạp.

Đến năm 2025, phương pháp ấy vươn xa khỏi bàn cờ 19×19: những hệ thống hiểu tiếng nói con người, tạo ảnh và video, soạn nhạc và nhiều thứ khác nữa giờ đều là chuyện thường ngày. Dù vậy, biên giới nghiên cứu vẫn để ngỏ: công việc còn dang dở, chẳng ai biết chắc giới hạn ở đâu, cũng như ý nghĩa của tất cả với loài người.

Quanh chính môn cờ vây, câu chuyện cũng rộng dần ra. Người ta không chỉ học “chơi môn này thế nào” nữa, mà còn học cả những gì xoay quanh bàn cờ: công nghệ, sức sáng tạo và ý nghĩa của tất cả với kỳ thủ lẫn người hâm mộ. Câu cuối không đóng lại bằng dấu chấm, mà bằng dấu ba chấm: từ một bàn cờ ra tới thế giới rộng lớn, nước đi tiếp theo vẫn chưa được viết ra.

Bài viết liên quan

Bình luận

👍
Đăng nhập để đặt câu hỏi