Câu chuyện AlphaGo: AI chinh phục môn cờ khó nhất ra sao


Trò chơi nào rồi cũng đi tới cùng một kết cục: máy tính mạnh dần lên rồi vượt qua con người. Cờ đam có Chinook, chương trình thừa hưởng ngôi vô địch của Marion Tinsley năm 1994 khi bệnh tật buộc ông bỏ dở trận tái đấu; cờ vua có Deep Blue thắng Garry Kasparov năm 1997.
Riêng cờ vây thì như miễn nhiễm: số biến quá lớn khiến lối tính vét cạn sụp đổ, nên suốt nhiều năm, chương trình cờ vây vẫn yếu hơn hẳn kỳ thủ mạnh.
Chưa đầy hai mươi năm sau Deep Blue, DeepMind trình làng AlphaGo vào năm 2015. Chỉ trong một năm, nó lật ngược toàn bộ giả định ấy, buộc cả làng cờ nghĩ lại xem “trực giác” và “sáng tạo” trong cờ vây thật ra là gì.
Đó chính là ngưỡng cửa: thành trì cuối cùng của cờ vây trở thành sân thử sức của AI.
Bài viết này dựa trên video của kênh Go Magic.
Vì sao cờ vây khác biệt
Trước khi AI bước vào câu chuyện, hãy nhìn lại chính môn cờ này một chút. Cờ vây có bộ luật đơn giản đến mức một phút là giải thích xong, nhưng thế cờ thì cứ mở ra mãi, đầy bất ngờ và bất định. Chính sự kết hợp đó khiến máy tính tụt lại rất xa sau kỳ thủ mạnh suốt một thời gian dài.
Luật đơn giản, biến hóa vô tận
Hai bên lần lượt đặt quân đen và quân trắng lên giao điểm còn trống: Đen đi trước, Trắng đáp lại, rồi cứ thế luân phiên. Mục tiêu là chia bàn cờ thành những vùng đất chắc chắn, còn ăn quân chỉ là phương tiện chứ không phải đích đến. Khí của quân cờ là những giao điểm trống nằm sát nó; bịt hết khí thì quân đó bị nhấc khỏi bàn cờ. Lấy ví dụ đơn giản nhất: một quân trắng đứng lẻ có bốn giao điểm kề bên, Đen chiếm đủ cả bốn là ăn được quân ấy. Chỉ từng ấy luật thôi, mà cây biến của ván cờ lớn nhanh tới mức không tài nào tính xuể. Muốn học luật kỹ hơn theo từng bước, mời bạn xem hướng dẫn tương tác.
Chương trình cờ vây đời đầu thua con người rất xa: chỉ cần vài tháng học nghiêm túc là người chơi vượt qua được phần mềm mạnh nhất thời đó. Lý do rất đơn giản và nằm ngay trong cấu trúc của môn cờ: cờ vây có quá nhiều biến, tính vét cạn không giải nổi. Trong thực chiến, người chơi vừa đọc cờ cục bộ vừa dựa vào cảm giác. Thế cờ khó lường tới mức thường không thể tính hết cho chính xác, nên phải chọn nước đi bằng trực giác. Chỉ khi có những thuật toán mới, máy mới bắt đầu rút ngắn khoảng cách.
Cờ chấp cho bên yếu hơn đặt sẵn quân trước nước đi đầu tiên – hai, ba, năm quân hoặc hơn nữa – để ván đấu vẫn có ý nghĩa dù trình độ chênh nhau. Chính những thế chấp ấy trở thành bài kiểm tra độ bền cho phần mềm đời đầu. Ngay cả khi thế cờ trông áp đảo, bàn cờ phủ kín quân đen, con người vẫn hạ chương trình khá nhẹ nhàng.

Bước đột phá
Suốt nhiều năm, đường đi lên rất thoai thoải: thuật toán mới, chương trình khá hơn, tiến bộ đều đặn nhưng chẳng có gì gây choáng. Rồi năm 2015 tới, câu chuyện rẽ ngoặt.
Đội ngũ DeepMind tìm đến Fan Hui, kỳ thủ chuyên nghiệp 2 dan gốc Trung Quốc, khi ấy sống ở Pháp, và quan trọng hơn cả, từng ba lần vô địch châu Âu. Đó là phép thử đầu tiên rất hợp lý. Tháng 10/2015, hai bên chơi loạt năm ván. Như phần lớn kỳ thủ chuyên nghiệp thời đó, Fan Hui hoài nghi: kinh nghiệm cho thấy chưa chương trình nào thắng nổi người chơi mạnh. Niềm tin ấy sụp đổ gần như ngay lập tức. Xong ván đầu, ai cũng thấy cán cân đã lệch; loạt trận kết thúc bằng cú quét sạch: thua cả năm ván. Kết quả làm nhiều người sững sờ, nhưng làng cờ vây nói chung chưa thấy mọi thứ lật hẳn; không ít kỳ thủ vẫn ngờ rằng đây chưa phải màn phân định “thật sự” giữa người và máy.

Thử thách lớn hơn là điều tất yếu. Đối thủ của năm sau là một huyền thoại người Hàn Quốc: Lee Sedol. Theo cách nói năm 2015, ví von đọng lại nhiều nhất là “Michael Jordan của cờ vây”: 18 danh hiệu quốc tế, nổi tiếng với lối chơi hiếu chiến và giàu trực giác. Trước loạt trận, Lee Sedol xem lại năm ván của Fan Hui và, giống Fan Hui trước đó, vẫn không tin: trình độ hiện ra trên kỳ phổ thấp hơn mình, nên anh tính sẽ thắng thong thả. Điều anh không lường được là AlphaGo còn học thêm rất nhiều trước cuộc chạm trán; chính phần chuẩn bị đó sẽ làm nghiêng sân khấu tháng 3/2016.
Lee Sedol vs AlphaGo
Bước sang đầu năm 2016, sự chờ đợi cứ lớn dần, tới mức câu hỏi đặt ra không chỉ là chuyện thắng thua mà còn là chuyện văn hóa: điều gì xảy ra khi một huyền thoại sống ngồi trước cỗ máy cứ mạnh lên sau mỗi lần xuất hiện? Dư luận nghiêng về con người, phần lớn tiền cược đặt vào Lee Sedol. Sự kiện tràn ra khỏi phòng đấu: bình luận trực tiếp bằng nhiều thứ tiếng, màn hình khổng lồ dựng ngoài trời khắp Seoul biến đường phố thành nơi xem chung. Nên khi nước đầu tiên chạm bàn cờ, đó giống như một cuộc thử sức trực giác con người ở quy mô toàn cầu.

Ván 1: giao tranh sớm và lối chơi lạ của máy
Theo lẽ thường, gặp kỳ thủ chuyên nghiệp hàng đầu thì chương trình nên tránh loạn đả từ sớm. AlphaGo làm ngược lại: ngay từ khai cuộc đã lao vào cuộc chiến gắt, đúng kiểu thế trận mà ai cũng tin là có lợi cho con người, rồi thắng nhẹ tênh. Lee Sedol chưng hửng; ai cũng nghĩ trận chiến thật sự chỉ mới bắt đầu.
Ván 2: nước 37 “không tưởng”
Ván hai sinh ra một khoảnh khắc khiến cả phòng đấu lặng đi. Ở nước 37, cỗ máy chọn đúng cái biến mà người ta “không đi”. Nước đó đi ngược hẳn những phép tắc vỡ lòng trên bàn cờ, thứ ai học cờ cũng phải thuộc nằm lòng, vậy mà quân cờ vẫn nằm đó, thản nhiên, chẳng chút ngập ngừng. Người xem sững sờ; nước đi ấy “làm tất cả những ai đang theo dõi phải ngỡ ngàng”. Theo sách vở của con người, lựa chọn đó “không thể đi được”. Vậy mà hệ thống vẫn đi. Và nước ấy thành công. Ngay khoảnh khắc đó, loạt trận không còn là câu hỏi liệu máy có chỉ biết bắt chước kỳ phổ hay không. Nó trở thành bằng chứng rằng chương trình vượt qua được chính bộ dữ liệu ban đầu, bước ra ngoài những ván cờ của con người mà nó học theo và tìm ra điều gì đó thật sự sáng tạo. Phần còn lại của ngày hôm ấy xác nhận cú sốc. AlphaGo thắng luôn ván này, dẫn 2–0, đẩy Lee Sedol vào thế chỉ còn những ý tưởng phi thường mới giữ nổi loạt trận.

Ván 3: cố xoay chuyển tình thế
Loạt trận đang trôi khỏi tầm tay, Lee Sedol chỉ còn một đường: làm thế cờ rối lên và mở trận đánh lớn ngay từ khai cuộc. AlphaGo không mắc câu. Máy ổn định thế trận rồi lại thắng; ở tỉ số 3–0, loạt trận coi như đã ngã ngũ.
Ván 4: kiệt tác của con người, nước 78
Đến giữa ván bốn, mọi thứ tưởng như an bài. AlphaGo dẫn khoảng mười mục; ở đẳng cấp này, chừng ấy thường đã đủ để thong thả về đích. Rồi trong thế cờ tưởng chừng không còn chỗ cho phép màu, Lee Sedol tìm ra một ý tưởng duy nhất, đẹp tới mức sững người, mà không ai ở hiện trường nhìn ra. Nước đó đánh trúng điểm mù của hệ thống. Phần đánh giá thế cờ của AlphaGo chao đảo, máy không xử lý nổi cục diện và thế trận đảo chiều. Tia sáng ấy có hẳn một cái tên trong lịch sử cờ vây: nước 78. Về sau, khi phân tích lại bằng những AI mạnh hơn hẳn phiên bản 2016, người ta thấy về lý thì đòn đó không nên thành công; vậy mà trước phiên bản ấy, trong ngày hôm ấy, nó thành công thật. Lee Sedol giữ vững ưu thế và thắng. Ngoài tỉ số, cảnh tượng đó còn quan trọng vì nó nói lên tinh thần của cả loạt trận. Ba ván đầu cho thấy một cỗ máy mạnh mà lặng lẽ, lại biết tung ra phát kiến gây choáng; ván bốn cho thấy sức sáng tạo của con người vẫn có thể chọc thủng lớp giáp ấy. Đó vẫn là chiến thắng duy nhất của con người trước cỗ máy đó, một ngoại lệ đã thành huyền thoại.

Ván 5: khép lại loạt trận
Ván năm bắt đầu khi thế trận vừa đổi chiều và thần kinh hai bên đều căng. Lee Sedol lại ép, tìm cách làm rối cục diện để mở lại bàn cờ. AlphaGo đón sức ép rất bình thản, đổi đất hiệu quả trong trung cuộc, rồi biến ưu thế mỏng thành khoảng cách vững chắc. Khi tương quan đất đã rõ, Lee Sedol xin thua. Khán giả thấy cả hai điều: kiệt tác của con người hôm trước và khả năng hệ thống trở lại giành chiến thắng ngay trong ván kế tiếp.
Tỉ số cuối cùng và ý nghĩa còn lại
Loạt trận khép lại với tỉ số 4–1. Đằng sau con số ấy là một kiểu đối thủ chưa từng có: một AI biết bước ra ngoài thói quen của con người mà vẫn làm được việc dưới ánh đèn sáng nhất. Đó là tuần con người chính thức thua máy ở môn cờ vây, cũng là tuần mà lối tìm kiếm sáng tạo của AI không còn là chuyện giả định nữa mà hiện ra ngay trên bàn cờ.
Muốn hiểu sâu hơn di sản của loạt trận và ý nghĩa với người chơi hôm nay, mời bạn đọc bài “Lee Sedol và AlphaGo: di sản của một trận đấu lịch sử!”.
Từ AlphaGo đến AlphaGo Zero
Sau Seoul, những phiên bản mạnh hơn vẫn nối nhau ra đời, nhưng khúc ngoặt thật sự chỉ đến một năm sau, khi một hệ thống hoàn toàn khác bước lên sân khấu với cái tên mới và tiền đề mới.
Hệ thống mới ấy tên là AlphaGo Zero, chữ “Zero” đến từ chuyện nó học cờ vây từ con số không. Không kho kỳ phổ của con người, không định thức kế thừa, không thói quen nhà nghề; chỉ có luật cơ bản, rồi tự đấu với chính mình không ngơi nghỉ.

Thời gian đầu, những ván cờ đó tệ theo chuẩn con người: hàng nghìn cú vấp, nhiều nước đi gần như ngẫu nhiên. Nhưng vòng lặp học máy không quan tâm tới cái đẹp, chỉ quan tâm tới kết quả. Qua hàng triệu rồi hàng chục triệu ván tự đấu, trình độ của hệ thống cứ thế đi lên đều đặn.
Kết quả nhận về rất rõ ràng: cỗ máy học từ con số không vượt qua mọi phiên bản trước đó vốn luyện trên dữ liệu con người. Nói cách khác, bỏ đi điểm xuất phát của con người, loại luôn “yếu tố con người”, hóa ra lại tốt hơn cho máy.
Điều quan trọng không chỉ nằm ở tốc độ hay sức mạnh, mà ở hướng đi. Một hệ thống không neo vào khuôn mẫu của con người có thể tự dò những biến chưa ai dạy nó, trả lời dứt khoát các câu hỏi treo lơ lửng bao năm và biến những ý tưởng từng bị coi là dị thường thành chuyện bình thường. Nhiều năm sau, AI cờ vây mạnh hơn con người nằm sẵn trong hộp công cụ của mọi người: vừa là món quà, vừa là gánh nặng cho cách kỳ thủ học cờ và cho cách môn cờ này tiến hóa.
Muốn tự cài công cụ phân tích cờ vây hiện đại lên máy của mình, hãy làm theo hướng dẫn từng bước “Cách cài phần mềm phân tích ván cờ vây bằng AI”
Cờ vây vượt tầm con người: khởi đầu chứ không phải kết thúc
Câu chuyện không khép lại bằng một nốt trầm. Chiến thắng chín năm trước mang ý nghĩa lớn hơn nhiều so với việc dạy máy chơi cờ vây, hay Tic Tac Toe, hay StarCraft. Nó hé lộ một phương pháp: AlphaGo cho thấy cách huấn luyện AI sao cho đúng với những nhiệm vụ phức tạp.
Đến năm 2025, phương pháp ấy vươn xa khỏi bàn cờ 19×19: những hệ thống hiểu tiếng nói con người, tạo ảnh và video, soạn nhạc và nhiều thứ khác nữa giờ đều là chuyện thường ngày. Dù vậy, biên giới nghiên cứu vẫn để ngỏ: công việc còn dang dở, chẳng ai biết chắc giới hạn ở đâu, cũng như ý nghĩa của tất cả với loài người.
Quanh chính môn cờ vây, câu chuyện cũng rộng dần ra. Người ta không chỉ học “chơi môn này thế nào” nữa, mà còn học cả những gì xoay quanh bàn cờ: công nghệ, sức sáng tạo và ý nghĩa của tất cả với kỳ thủ lẫn người hâm mộ. Câu cuối không đóng lại bằng dấu chấm, mà bằng dấu ba chấm: từ một bàn cờ ra tới thế giới rộng lớn, nước đi tiếp theo vẫn chưa được viết ra.
Bình luận