LabHub

블로그

초인간 게임 AI 2026 — Stockfish 17 / Leela Chess Zero / KataGo / AlphaZero / MuZero / Cicero / Pluribus / AlphaStar / 将棋 dlshogi 심층 가이드

한국어English日本語

프롤로그 — 인간이 이기지 못하는 시대

2016년 3월, 이세돌은 알파고에게 1승 4패로 졌다. 그해 많은 사람이 "이제 바둑도 끝났다"라고 말했고, 실제로 끝났다. 2017년 알파고 제로는 인간 기보 없이 자기 자신과만 두면서 알파고를 능가했고, 같은 해 알파제로(AlphaZero)는 같은 알고리즘 하나로 체스·쇼기·바둑을 모두 정복했다. 2019년에는 머지(MuZero)가 "게임 규칙을 모른 채로" 같은 일을 해냈다.

체스 쪽도 사정은 비슷하다. Stockfish 17은 인간 세계 챔피언을 어떤 시간 컨트롤에서도 거의 100% 이긴다. Stockfish vs Leela Chess Zero (Lc0)의 TCEC 결승은 사실상 인간이 관전자다. 모바일에서 돌아가는 Stockfish도 인간 그랜드마스터를 이긴다.

하지만 게임 AI는 체스·바둑만이 아니다. Pluribus(Meta 2019)는 6인 무제한 텍사스 홀덤에서 인간 프로를 이겼고, Cicero(Meta 2022)는 자연어로 동맹·배신을 협상하는 Diplomacy에서 상위 10% 성적을 냈다. AlphaStar는 스타크래프트 2에서, OpenAI Five는 도타 2에서, Suphx는 마작에서, 그리고 2024년 AlphaProof + AlphaGeometry는 IMO(국제 수학 올림피아드)에서 은메달 점수를 받았다.

이 글은 2026년 시점에서 "어떤 게임 AI가 어디까지 와 있고, 무엇을 어떻게 하는가"를 한 자리에 정리한다. 단순 연대기가 아니라, 알고리즘(MCTS / NNUE / 자기 대국 / CFR / 모델 기반 RL) 관점에서 같은 가족끼리 묶었다.


1장 · 2026년 게임 AI 지도 — 네 가지 분류

게임 AI를 깔끔하게 나누는 한 가지 축은 정보의 완전성플레이어 수다.

분류정보플레이어대표 게임대표 AI
완전정보 · 2인공개2체스, 바둑, 쇼기Stockfish, Lc0, KataGo, AlphaZero, dlshogi
완전정보 · 1인(퍼즐)공개1수학 증명AlphaProof, AlphaGeometry
불완전정보 · 2인비공개2헤즈업 포커Libratus, DeepStack
불완전정보 · 다인비공개3+6인 포커, 마작Pluribus, Suphx
불완전정보 + 언어비공개+NL7DiplomacyCicero
실시간 · 부분관측일부 공개2~10StarCraft 2, Dota 2AlphaStar, OpenAI Five

이 축이 중요한 이유는 알고리즘이 달라지기 때문이다.

이 분류를 머리에 두고 다음 장부터 한 종씩 본다.


2장 · Stockfish 17 — 체스의 최강

Stockfish는 2008년부터 시작된 오픈소스 체스 엔진이다. C++로 작성되었고, GPL v3 라이선스, github.com/official-stockfish/Stockfish에서 개발된다. 2026년 현재 최신 안정 버전이 Stockfish 17이며, CCRL과 TCEC 양쪽에서 1위를 굳혔다.

무엇이 달라졌나 — 알파-베타 + NNUE

전통 Stockfish는 알파-베타 가지치기 + 수많은 휴리스틱(예: null-move pruning, late move reductions, futility pruning)을 썼다. 평가 함수는 손으로 짠 게임 지식 — 폰 구조, 킹 안전, 모빌리티 등이었다.

Stockfish 12(2020)부터 NNUE(Efficiently Updatable Neural Network)가 도입됐다. 일본 쇼기 커뮤니티(やねうら王 그룹)의 那須悠 등이 만든 구조로, 작은 신경망을 CPU에서 매우 빠르게 평가하는 게 핵심이다. GPU가 없어도 되고, 한 수 둘 때마다 전체 네트워크를 재계산하지 않고 변한 부분만 업데이트한다 → "Efficiently Updatable".

Stockfish 17의 핵심 특징:

어떻게 실행하나

# Linux/macOS — 패키지 매니저로 설치
brew install stockfish              # macOS
sudo apt install stockfish          # Debian/Ubuntu

# 또는 직접 다운로드: https://stockfishchess.org/download/
# UCI 모드로 실행
stockfish
# UCI 세션 예
uci
id name Stockfish 17
id author the Stockfish developers
...
uciok
position startpos moves e2e4 e7e5
go depth 20
info depth 20 seldepth 28 multipv 1 score cp 31 nodes 1234567 ...
bestmove g1f3 ponder b8c6

Stockfish는 체스를 풀었나

"풀었다"라는 말은 강한 의미로는 아직 아니다 — 체스의 게임 트리는 1012010^{120} 정도라 완전 풀이는 불가능. 하지만 약한 의미로는 사실상 "풀렸다"고 볼 수 있다 — 인간이 Stockfish를 어떤 시간 컨트롤에서도 이기지 못한다. 인간 세계 챔피언(2024년 기준 Ding Liren, 2025년부터 Gukesh Dommaraju)도 마찬가지.


3장 · Leela Chess Zero (Lc0) — 신경망 기반 체스 엔진

Leela Chess Zero(약칭 Lc0)는 알파제로 논문(2017)을 보고 "그럼 우리도 만들어 보자"고 시작된 오픈소스 프로젝트다. lczero.org, github.com/LeelaChessZero/lc0.

Stockfish와 어떻게 다른가

항목Stockfish 17Leela Chess Zero (Lc0)
검색알파-베타 + 휴리스틱MCTS (PUCT)
평가NNUE (작은 신경망, CPU)큰 신경망 (CNN/Transformer, GPU)
하드웨어CPU 위주, 멀티코어GPU 위주, NVIDIA RTX 5090이 인기
학습학습 안 함(평가망만 학습)자기 대국으로 처음부터 학습
노드/초수백만~수천만수만~수십만
스타일전술적, 계산력위치적, 직관적

Lc0는 노드 효율(쳤을 때 얼마나 잘 보는가)이 압도적으로 높다. Stockfish가 1초에 1천만 노드를 본다면 Lc0는 10만 노드를 본다 — 그런데 비슷한 강도가 나온다. 이유는 신경망이 "어느 수가 유망한지"를 사전에 알려주기 때문(정책망 + 가치망).

학습 — 자기 대국 분산

Lc0는 수만 명의 자원봉사자가 GPU를 빌려주는 분산 자기 대국 프로젝트다. 각 클라이언트가 매치를 하나 두고 결과를 서버에 올리면 그게 학습 데이터가 된다. RTX 5090 기준 한 시간에 수십 게임을 둘 수 있고, 누적 학습 게임 수는 수십억 판을 넘었다.

# Lc0 + 네트워크 가중치
git clone https://github.com/LeelaChessZero/lc0
cd lc0
./build.sh
# 가중치는 https://lczero.org/play/networks/bestnets/ 에서
# 보통 BT5나 BT4 시리즈가 강함

누가 Lc0를 쓰나


4장 · Komodo Dragon 3 — 상용 체스 엔진의 마지막 강자

Komodo Dragon은 Don Dailey와 Larry Kaufman이 만든 체스 엔진. 2018년 chess.com이 인수했고, 2026년 현재 Komodo Dragon 3 버전. 상용 엔진(연간 구독)이지만 chess.com 분석 도구의 기본 엔진이라 사실상 매일 수억 번 호출된다.

특징

Stockfish가 무료/오픈소스인데 왜 상용을 쓰나


5장 · AlphaZero → MuZero — DeepMind 라인업

AlphaZero(2017) — 게임 하나의 알고리즘

Silver et al., 2017, "Mastering Chess and Shogi by Self-Play..."

AlphaZero가 바꾼 것

이전까지 체스 엔진은 체스 지식을 사람이 코딩했다. 폰 구조, 킹 안전, 더블 룩, 비숍 페어 — 전부 GM 출신 개발자의 휴리스틱. 알파제로는 그걸 다 버리고 자기 대국만으로 같은 수준에 도달했다. 이게 충격이었다.

MuZero(2019) — 규칙을 모를 때

Schrittwieser et al., 2019, "Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model"

코드

DeepMind의 공식 오픈소스는 아니지만 잘 알려진 구현체:


6장 · Maia — 인간 같은 체스 (MS Research + Toronto)

대부분 엔진은 "최강의 수"를 둔다. Maia는 정반대: 인간이 둘 법한 수를 둔다.

어떻게 만드나

왜 중요한가


7장 · KataGo — 바둑 분산 학습의 정점

체스에 Lc0가 있다면 바둑에는 KataGo가 있다.

알파고 / 알파고 제로보다 강한가

개선점

  1. 자체-검증된 보상 모델링(score-based) — "몇 집 차이"를 직접 학습. → 끝내기에서 인간이 보기 좋은 수.
  2. 다양한 보드 크기를 한 네트워크가 처리(9x9, 13x13, 19x19).
  3. 핸디캡 게임과 비공식 룰(중국식/일본식 카운팅).

누가 KataGo를 쓰나

그리고 Leela Zero (Go)

Leela Zero는 KataGo 이전의 분산 바둑 프로젝트로, Lc0의 Go 버전이다. 2017~2019년 알파고 제로 논문을 보고 오픈소스로 재현했다. 이후 KataGo가 더 효율적이라 자원봉사자가 그쪽으로 넘어가서 사실상 종료. 하지만 알파고 제로의 수준을 처음으로 외부에서 재현했다는 역사적 의미가 있다.


8장 · AlphaGo — 2016년 그 시리즈

2026년 시점에서 AlphaGo는 "역사"지만, 게임 AI 연대기의 분기점이다.

알파고 라인업

버전연도특징결과
AlphaGo Fan2015CNN + MCTS, 인간 기보로 사전 학습판후이(유럽 챔피언) 5:0
AlphaGo Lee2016더 큰 정책망, 분산 추론이세돌 4:1
AlphaGo Master2017.1단일 신경망, 일부 자기 대국온라인에서 60연승, 커제 3:0
AlphaGo Zero2017.10인간 기보 0, 자기 대국만Master 89:11
AlphaZero2017.12같은 알고리즘으로 체스·쇼기·바둑 일반화Stockfish 8 / Elmo / AlphaGo Zero 격파

이세돌의 4국, 78수

2016년 3월 13일 4국. 이세돌은 78수에 "끼는 수"(神의 한 수, divine move)를 두었다. 알파고의 평가 함수가 이 수를 거의 0%의 확률로 예측했고, 이후 형세를 잘못 판단하면서 이세돌이 이겼다. 인간이 강한 바둑 AI를 이긴 마지막 공식 대국으로 기록된다(2025년 현재까지).

이세돌은 2019년 은퇴하면서 "AI를 이길 수 없는 게임을 계속 할 이유가 없다"는 취지의 발언을 했다. 한국 사회에서 AlphaGo는 단순한 AI 사건이 아니라 "이세돌의 4국"으로 기억된다.


9장 · Pluribus — 6인 포커의 정복(Meta 2019)

체스·바둑은 완전정보 게임이라 미니맥스가 통한다. 포커는 다르다 — 상대 카드를 모르고, 운이 섞이고, 블러프(허세)가 게임의 일부.

무엇이 충격이었나

인간이 본 충격적 행동


10장 · Cicero — Diplomacy(2022 Meta)

Pluribus가 "수학적으로 어려운" 게임이라면, Cicero가 푼 게임 Diplomacy는 언어와 인간 협상이 어려운 게임이다.

Diplomacy가 어려운 이유

Cicero의 구조

  1. 언어 모델 (LLM) — Diplomacy 채팅 데이터로 미세 조정한 27억 파라미터 BART.
  2. 전략 모델 — 자기 대국으로 학습한 정책 네트워크. RL 기반.
  3. 의도 추론 → 메시지 생성 → 행동 결정 — 자신의 의도와 상대 의도를 동시에 모델링.

결과

이건 단순한 게임 AI를 넘어서 자연어 + 전략 + 다인 협상이라는 인간 사회의 핵심을 AI가 다룰 수 있음을 보여준 분기점이다.


11장 · AlphaStar — StarCraft 2 (DeepMind 2019)

StarCraft 2가 어려운 이유

알고리즘

결과


12장 · OpenAI Five — Dota 2

도타 2가 더 어려운 점

결과

이건 사실상 분산 강화학습의 산업 규모 데모였다. OpenAI Five가 보여준 게 OpenAI를 OpenAI로 만든 셀프플레이 + 대규모 컴퓨트 패러다임의 출발이다(이후 GPT 라인).


13장 · Suphx — 마작 (Microsoft 2019)

Li et al., 2019, "Suphx: Mastering Mahjong with Deep Reinforcement Learning".

마작이 어려운 이유

Suphx의 접근

결과


14장 · AlphaProof + AlphaGeometry — IMO 은메달 (2024)

게임은 아니지만 수학 증명도 본질적으로 거대한 탐색 문제다. DeepMind는 이걸 게임 AI 기법으로 푼다.

AlphaGeometry (2024.1, Nature)

Trinh et al., 2024, "Solving olympiad geometry without human demonstrations".

AlphaProof (2024.7)

DeepMind 블로그: deepmind.google/discover/blog/ai-solves-imo-problems-at-silver-medal-level.

2024 IMO 결과


15장 · 체스 UI — lichess / chess.com / ChessBase / Arena / Banksia / NIBBLER

엔진이 아무리 강해도 인간이 쓰려면 UI가 필요하다. 2026년의 체스 UI는 다음과 같이 정리된다.

lichess.org — FOSS의 끝판왕

chess.com — 상용 1위

ChessBase

Arena, Banksia, NIBBLER — 엔진 테스트용


16장 · UCI와 XBoard 프로토콜

엔진과 GUI가 통신하는 표준이 두 가지 있다.

UCI (Universal Chess Interface)

Stefan Meyer-Kahlen이 1990년대 후반에 만든 표준. 거의 모든 현대 엔진이 UCI를 쓴다.

# GUI → 엔진
uci                                    # 엔진에게 "UCI 모드"로 진입하라
setoption name Threads value 8
isready
position startpos moves e2e4 e7e5
go wtime 60000 btime 60000

# 엔진 → GUI
id name Stockfish 17
uciok
readyok
info depth 20 score cp 31 ...
bestmove g1f3 ponder b8c6

XBoard / CECP

훨씬 오래된 프로토콜(1990년대 초). 일부 클래식 엔진(Crafty, GNU Chess)이 여전히 사용. lichess는 XBoard 형식의 봇도 지원.

둘의 차이

항목UCIXBoard/CECP
등장1990년대 후반1990년대 초
시간 관리GUI가 보내준다엔진이 직접 클럭 측정
옵션setoption 통일엔진별로 다름
점유율압도적 1위레거시 위주

요즘은 새 엔진을 만들면 그냥 UCI로 만든다.


17장 · 한국 — NCsoft 한돌, 그리고 이세돌

한돌 (NCsoft, Hancho)

NCsoft AI 센터가 만든 한국형 바둑 AI. 2017년에 처음 공개, 2019년 12월 이세돌과의 은퇴 직전 대국에서 1국 승리, 2~3국 패배로 시리즈를 1:2로 졌다.

이후 한돌은 NCsoft 내부 연구로 남았고, 일반 대중에게는 공개 분석 도구로 적극 출시되진 않았다. 대신 NCsoft는 게임 AI 일반(예: 리니지 NPC, 강화학습 기반 콘텐츠) 쪽으로 방향을 옮겼다.

LG 가이드 / 카카오 — 바둑 AI

한국에서 바둑 AI의 의미

이세돌 vs AlphaGo는 AI라는 단어가 한국 대중에게 처음 일상화된 사건이다. 2016년 3월 이전과 이후로 "AI"라는 단어의 빈도가 다르다. 정부 차원의 AI 산업 정책(예: 2019년 인공지능 국가전략)도 직접적으로 이 사건의 영향이다.


18장 · 일본 — 将棋 AI 발전사, dlshogi, やねうら王

쇼기(将棋, Shogi)는 일본 장기. 잡은 말을 다시 둘 수 있어서 체스보다 게임 트리가 훨씬 크다. 일본 컴퓨터 쇼기 커뮤니티는 1990년대부터 매우 활발했다.

주요 엔진 (시간 순)

엔진연도핵심
激指 (Gekisashi)1990년대일본 첫 강한 쇼기 엔진
ボナンザ (Bonanza)2005기계학습 평가함수의 시조 — 보든 와타루(保木邦仁)
GPS将棋2009도쿄대 GPS 그룹
Ponanza2013~17명인전(名人戦) 첫 인간 승리(2013)
Apery2014오픈소스
やねうら王 (Yaneura-ou)2015~현재 일본 표준 엔진 — NNUE 발상지
dlshogi2018~알파제로 스타일 NN. RTX 시리즈로 학습

Bonanza의 충격 — Bonanza Method

보든의 2006년 논문 — 평가함수의 가중치를 프로 기보로부터 최적화 학습으로 얻는 방법. 이게 체스의 NNUE보다도 10년 빠른 기계학습 평가함수의 시작이다. 이후 Stockfish의 NNUE 발상에도 영향.

やねうら王 — NNUE의 발상지

야네우라(やねうら, Motohiro Isozaki)가 만든 오픈소스 쇼기 엔진. NNUE를 처음 실용화한 곳. 나중에 Stockfish가 이걸 체스로 가져갔다. 일본 컴퓨터 쇼기 선수권에서 우승하는 게 대부분 やねうら王 변종이다.

dlshogi — 알파제로의 쇼기 버전

깃허브: github.com/TadaoYamaoka/DeepLearningShogi.

인간 vs 쇼기 AI — 명인전과 NHK 杯


19장 · 누가 게임 AI를 배워야 하나

1) RL 연구자

2) 보드게임 엔진 개발자

3) 멀티 에이전트 / 협상 AI

4) 게임 회사

5) 교육 / 코칭


20장 · 마무리 — "초인간"이 의미하는 것

2026년의 게임 AI는 거의 모든 표준 게임에서 인간보다 강하다. 체스, 바둑, 쇼기, 헤즈업/멀티웨이 포커, StarCraft 2, Dota 2, 마작, Diplomacy까지. 그리고 IMO 수학 올림피아드도 은메달 수준.

하지만 이게 끝이 아니다. 새 게임 — 예를 들어 MMO PvE 던전 클리어, MOBA의 새로운 영웅 메타 발견, 카드게임의 새 카드세트 출시 직후의 메타 탐색 — 같은 영역은 여전히 활발히 연구 중이다.

그리고 더 흥미로운 방향은 "인간과 같은 AI"다 — Maia처럼, Cicero처럼. 단순히 더 강한 AI가 아니라, 인간과 함께 두고, 인간이 이해할 수 있게 두고, 인간을 가르치는 AI.

게임 AI는 끝나지 않았다. 다만 "이긴다"가 더 이상 목표가 아닌 시대로 들어섰을 뿐이다.


참고 / References

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다