알파고의 ML과 생성형 AI는 무엇이 다른가 — 기술적 본질부터 실전 실험까지
# 알파고의 ML과 생성형 AI는 무엇이 다른가 — 기술적 본질부터 실전 실험까지
DevSnack AI Lab | 2026-07-14
1. 서론: 같은 'AI'라는 이름, 다른 우주
2016년 3월, 서울의 한 호텔에서 인류는 처음으로 기계에게 바둑으로 정면 패배했다. 알파고(AlphaGo)는 이세돌 9단을 4:1로 꺾고, 전 세계에 'AI의 시대'를 선언했다. 그 순간을 기억하는가? 당신의 스마트폰에는 아직 ChatGPT도, 생성형 AI라는 개념조차 없었다.
10년이 흘렀다. 2026년, 우리는 매일 ChatGPT와 대화하고, Claude에게 코드를 짜 달라고 하고, Midjourney로 이미지를 만든다. 생성형 AI는 일상이 되었다. 하지만 문득 이런 질문이 든다.
"알파고처럼 바둑 세계 챔피언을 이긴 AI가 있었는데, 왜 오늘날의 생성형 AI는 오목조차 어려워할까?"
혹은 더 직접적으로:
"ChatGPT에게 오목을 시키면, 알파고처럼 강할까?"
우리는 이 질문에 답하기 위해 직접 실험을 했다. AI 오목 플레이어를 만들고, 로컬 LLM(Qwen3.5-35B)과 RuleBot을 대결시켰다. 총 7판의 실험을 진행했다. 초기 결과는 예상보다 훨씬 좋지 않았다. 기본 LLM 플레이어는 단순한 룰 기반 봇조차 이기지 못했다.
이 글에서는 알파고의 머신러닝과 오늘날 생성형 AI(LLM)가 기술적으로 무엇이 다른지, 왜 그 차이가 실전 성능의 차이로 이어지는지, 그리고 그 두 접근법이 언젠가 만날 수 있을지를 이야기한다.
2. 알파고: 승리만을 위해 설계된 기계
알파고를 이해하는 가장 빠른 길은 하나의 문장이다.
알파고는 '승리'라는 하나의 목표에 모든 것이 최적화된 AI다.
이 단순함이 알파고의 모든 설계를 관통한다.
2.1 두 개의 신경망 + 하나의 탐색 알고리즘
알파고의 아키텍처는 세 가지 구성요소로 이루어져 있다.
① Policy Network (정책 네트워크)
현재 바둑판을 보고, 다음 수를 어디에 둘지 '확률'로 예측한다. 수천 가지 가능한 수 중에서 유망한 수만 추려내는 역할이다. 이 네트워크는 처음에는 인간 프로 기사의 기보 3,000만 수를 지도학습(supervised learning)으로 흉내 내다가, 이후 자신과의 대국(self-play)을 통해 강화학습(reinforcement learning)으로 진화한다.
② Value Network (가치 네트워크)
현재 바둑판 상태를 보고, '이局面에서 누가 이길까?'를 -1(패)에서 +1(승) 사이의 숫자로 예측한다. 이 값은 MCTS가 탐색 트리를 깊이 들어가지 않고도 평가할 수 있게 해준다.
③ MCTS (Monte Carlo Tree Search)
알파고의 진짜 핵심이다. Policy Network가 추천한 유망한 수들을 중심으로, 수천~수만 가지의 가상 게임을 시뮬레이션한다. 각 시뮬레이션의 결과는 Value Network로 평가되고, 그 정보가 다음 탐색을 더 효율적으로 만든다.
이것이 알파고를 '그냥 딥러닝'과 다르게 만드는 결정적 차이다. 알파고는 두뇌(신경망) + 계산(트리 탐색) 의 결합체다. 신경망이 직관(intuition)을 제공하고, MCTS가 그 직관을 체계적으로 검증한다.
2.2 알파고의 학습: 무한한 자기 대국
알파고의 두 번째 혁신은 학습 데이터에 있다. 초기 알파고는 인간 기보로 시작했지만(AlphaGo Lee), 단 1년 만에 등장한 AlphaGo Zero는 인간 데이터 없이 오로지 자기 대국(self-play)만으로 모든 것을 학습했다.
- 3일 만에 AlphaGo Lee(이세돌 이긴 버전)를 100:0으로 압살
- 21일 만에 AlphaGo Master(60연승 버전) 수준 도달
- 40일 만에 모든 이전 버전을 초월
이는 인간이 만든 정적인 데이터셋에 크게 의존하는 LLM의 학습 방식과 대조적이다. LLM은 인터넷 텍스트라는 고정된 말뭉치에서 학습하며, 환경과의 상호작용을 통해 스스로 데이터를 생성할 수 없다. 자연어는 인공적으로 생성해도 진짜 인간의 언어와 같지 않다.
2.3 AlphaZero: 일반화의 시작
AlphaGo Zero를 더 일반화한 AlphaZero는 바둑뿐 아니라 체스와 쇼기까지 24시간 만에 세계 최고 수준에 도달했다. 단순한 규칙 + 자기 대국 + 신경망 + 트리 탐색이라는 공식이 다양한 게임에서 통한다는 것을 증명했다.
하지만 여기서 중요한 점: AlphaZero도 게임만 할 수 있었다. 규칙이 명확히 정의되고, 승패라는 명확한 피드백이 있는 '완전 정보 게임(perfect information game)'에서만 통하는 접근법이다.
3. 생성형 AI: 언어를 '흉내'내는 기계
ChatGPT, Claude, Gemini, Qwen — 이 모든 모델의 공통점은 단 하나다.
생성형 AI는 '다음 토큰(next token)'을 예측하도록 학습된 거대한 확률 모델이다.
3.1 Transformer와 Autoregressive Generation
GPT 계열 모델의 핵심 구조는 2017년 Google의 논문 "Attention Is All You Need"에서 제안된 Transformer 아키텍처다.
- Attention 매커니즘: 입력 텍스트의 모든 위치 사이의 관계를 계산한다. "나는 ___에 가고 싶다"라는 문장에서 빈칸이 "학교"일 확률을 앞뒤 문맥으로 추정한다.
- Autoregressive(자기회귀) 생성: 한 번에 한 토큰씩 생성한다. "나는" → "학교" → "에" → "가고" → "싶다". 이전에 생성한 모든 토큰이 다음 토큰의 입력이 된다.
- Context Window: 한 번에 처리할 수 있는 토큰 수(GPT-4는 128K, Claude는 200K, Gemini 1.5는 1M).
3.2 학습: 인터넷 전체를 통째로
LLM의 학습 데이터는 사실상 인터넷 전체다. 수조 개의 토큰 — 웹페이지, 책, 논문, 코드 저장소, 위키피디아...
- Pre-training: 가지고 있는 데이터로 다음 토큰 예측 학습. 대부분의 지식과 패턴이 여기서 습득된다.
- SFT (Supervised Fine-tuning): 인간이 작성한 고품질 질문-답변 쌍으로 미세 조정. 말을 예쁘게 하도록.
- RLHF (Reinforcement Learning from Human Feedback): 인간이 선호하는 답변 스타일을 보상 모델로 학습시키고, PPO 알고리즘으로 LLM을 최적화. 진정한 의미의 '강화학습'이지만, 알파고와는 본질적으로 다르다.
3.3 LLM의 특징적 한계들
LLM의 추론은 인간이나 검색 기반 AI의 추론과는 다른 방식으로 동작한다. 많은 경우 학습된 패턴과 내부 표현을 활용해 추론과 유사한 결과를 만들어낸다. 이 과정에서 몇 가지 특징적인 한계가 드러난다.
① 탐색 능력의 부재
가장 치명적인 한계다. 일반적인 생성 과정에서는 하나의 응답 경로를 순차적으로 생성한다. 알파고가 MCTS로 수천 개의 가상 게임을 시뮬레이션하는 동안, LLM은 단 하나의 응답만 생성한다. 사고의 사슬(Chain-of-Thought)이나 Self-Consistency 같은 기법이 이 문제를 완화하지만, 트리 탐색이 제공하는 체계적인 경로 탐색과는 근본적으로 다르다.
② 명확한 보상 신호의 부재
알파고는 '이겼다/졌다'는 명확한 피드백을 받는다. 반면 LLM의 RLHF는 '인간이 이 응답을 더 선호한다'는 주관적 신호다. 바둑의 승패처럼 객관적이고 측정 가능한 목표가 없다.
③ 상태 유지의 취약성
긴 대화의 맥락을 유지하는 데 한계가 있다. 방금 한 말을 잊어버리고, 일관성 없는 답변을 한다. 알파고는 완벽한 게임 상태를 유지한다.
④ 데이터의 유한성
자연어 데이터는 유한하다. 인간은 무한한 텍스트를 생성할 수 없고, AI가 생성한 텍스트로 학습하면 모델 붕괴(Model Collapse)가 발생한다. 반면 알파고는 자기 대국으로 무한한 훈련 데이터를 생성할 수 있다.
4. 결정적 비교: 8가지 차원
| 차원 | 알파고 | 생성형 AI (LLM) |
|---|---|---|
| 목적 | 승리 확률 최대화 | 다음 토큰 확률 예측 |
| 탐색 | ✅ MCTS (수천~수만 가지 가상 게임) | ❌ 없음 (단일 경로) |
| 학습 데이터 | 자기 대국 (∞) | 인터넷 텍스트 (유한) |
| 보상 신호 | 승/패 (명확, 객관적) | 인간 선호도 (모호, 주관적) |
| 상태 | 완전 상태 유지 | 컨텍스트 윈도우에 의존 |
| 일반화 | 한 게임 특화 | 범용 언어 처리 |
| 실패 모드 | 예측 가능한 범위 내 | 환각 (hallucination) |
| 연산 방식 | 트리 탐색 + 신경망 | 순전파 (forward pass) 1회 |
5. 실전 검증: LLM에게 오목을 시켰다
알파고와 LLM의 차이는 이론만으로 이해하기 어렵다. 그래서 직접 실험했다.
실험 설계
- LLM 플레이어: Qwen3.5-35B (로컬, DGX Spark)
- 상대: Rule-based 봇 (즉시승리 > 4목방어 > 4목생성 > 중앙선호 우선순위)
- 룰: 15×15 표준 오목
- 프롬프트: 오목 규칙, 좌표 시스템, 위협 패턴 설명 포함
결과
5전 전패. 평균 10~12턴 만에 패배.
가장 충격적인 장면들:
- 상대의 열린 4목(4연속)을 인식하지 못함
- 이미 돌이 있는 위치에 재착수 시도
- 방금 설명한 전략과 정반대의 수 선택
- A1, B1 같은 엉뚱한 코너에 착수
개선 실험
ThreatAnalyzer라는 보드 분석 도구를 LLM의 프롬프트에 연결했다. 즉시 효과가 나타났다.
핵심 발견: LLM 혼자서는 위협을 인식하지 못했지만, ThreatAnalyzer라는 보드 분석 도구가 연결되자 확연히 나아진 플레이를 보여주었다. 구조는 다르지만 역할은 비슷하다. 알파고에서 MCTS가 탐색 부담을 덜어주듯, ThreatAnalyzer는 LLM이 처리하기 어려운 보드 분석을 대신 수행했다. LLM은 언어 능력을 제공하고, 도구가 분석과 탐색을 제공하는 것이다.
LLM은 22턴까지 버티며 6번의 위협을 정확히 차단했지만, 단 한 번의 위치 오판(H6 대신 E6)으로 패배했다. 긴 방어에도 단 1회의 실수가 패배로 직결되었다. 이것이 생성형 AI의 본질이다. 언어 이해 능력 ≠ 게임 플레이 능력.
"LLM은 오목을 '이해한' 것이 아니라, 오목 문제를 '독해한' 것이다."
6. 알파고 방식의 일반화 한계
알파고의 접근법은 왜 모든 문제에 적용되지 않을까?
6.1 완전 정보 vs 불완전 정보
바둑은 완전 정보 게임이다. 모든 정보가 보드 위에 공개되어 있다. 하지만 현실 세계는 그렇지 않다. 주식 시장을 예측하거나, 협상을 하거나, 의사를 진단할 때는 알 수 없는 변수(variable)가 무수히 많다.
실제로 DeepMind는 AlphaGo의 기술을 단백질 접힘 예측(AlphaFold)에 성공적으로 적용했지만, 이는 생물학적 구조가 '일종의 게임'으로 모델링될 수 있었기 때문이다. 하지만 현실 세계는 게임보다 훨씬 복잡하며, 불완전한 정보와 모호한 목표를 포함한다.
6.2 보상 함수 설계의 어려움
알파고의 성공은 '승리'라는 명확한 보상 신호에 크게 의존한다. 현실 문제에서 좋은 보상 함수를 설계하는 것은 어렵다. 예를 들어, AI 비서의 '좋은 응답'을 정의하는 것은 이겼는지 졌는지만큼 명확하지 않다. 이것이 RLHF가 필요한 이유이지만, RLHF의 보상 신호는 알파고의 승패 신호보다 훨씬 약하다.
7. 융합의 미래: 두 접근법의 만남
가장 흥미로운 질문은 이것이다: 알파고의 탐색 능력과 생성형 AI의 언어 능력이 결합된다면?
7.1 Tree-of-Thoughts (ToT)
2023년 제안된 ToT는 LLM의 사고 과정을 트리 구조로 확장한다. 하나의 응답만 생성하는 대신, 여러 가능한 추론 경로를 동시에 탐색하고, MCTS나 BFS로 최적 경로를 선택한다. 초기 실험에서 수학 문제, 창의적 글쓰기 등에서 성능 향상이 확인되었다.
7.2 LLM + MCTS 하이브리드
이미 여러 연구에서 LLM을 MCTS의 휴리스틱(heuristic)으로 사용하는 접근법이 시도되고 있다. LLM이 '이 상황에서 어떤 선택이 유망한가'를 제안하고, MCTS가 그 선택들을 체계적으로 탐색한다. 이는 알파고의 Policy Network + MCTS 관계와 구조적으로 동일하다.
7.3 AlphaDev, AlphaFold: 게임을 넘어서
DeepMind는 알파고의 기술을 활용해 AlphaDev(더 빠른 알고리즘 발견), AlphaFold(단백질 구조 예측), AlphaTensor(행렬 곱셈 최적화) 등을 만들어냈다. 이는 검색 기반 강화학습이 게임을 넘어 과학과 공학에 적용될 수 있음을 보여준다.
7.4 MuZero: 규칙조차 모르는 AI
MuZero는 게임의 규칙조차 배우지 않고 MCTS를 수행한다. 환경 모델을 내부적으로 학습하여, 시뮬레이션이 가능하게 만든다. 이는 현실 세계의 불완전 정보 문제에 더 근접한 접근법이다.
8. 결론: 그리고 남은 질문
알파고와 생성형 AI는 같은 '딥러닝'이라는 기술을 공유하지만, 설계 철학이 완전히 다르다.
알파고는 최적화(Optimization) 의 AI다. 명확한 목표, 완벽한 정보, 무한한 연습 데이터 — 이 조건이 충족될 때 경이로운 성능을 발휘한다.
생성형 AI는 확률적 생성(Probabilistic Generation) 의 AI다. 불완전한 데이터, 모호한 목표, 제한된 연산 — 이런 제약 속에서도 실용적인 결과를 만들어낸다.
두 접근법 모두 각자의 강점과 약점이 있다. 알파고는 바둑을 둘 수 있지만 시를 쓸 수 없다. LLM은 시를 쓸 수 있지만 바둑을 둘 수 없다.
하지만 이 둘이 만나는 지점이 있다. 바로 Tool-Augmented LLM이다. 우리의 실험에서 ThreatAnalyzer라는 '검색 도구'를 LLM에 연결했을 때, LLM의 게임 성능이 비약적으로 향상되었다. 이것이 미래의 방향이다.
생성형 AI는 스스로 플레이어가 될 수 없지만, 플레이어를 만드는 조력자가 될 수 있다.
우리는 아직 '진정한 일반 인공지능(AGI)'에 도달하지 못했다. 하지만 알파고와 GPT의 차이를 이해하는 것은 그 길을 가는 중요한 이정표다. 다음에 AI가 무언가를 '잘한다'는 말을 들으면, 그것이 알파고 타입(최적화)인지, GPT 타입(모방)인지 생각해보자. 그 차이를 이해하는 것이 현대 AI를 이해하는 가장 빠른 길이다.
이 글은 DevSnack AI Lab의 AI 오목 실험 시리즈의 일부입니다. Phase 1 실험 결과는 [별도 게시글](https://devsnack.blogspot.com/2026/07/ai-chatgpt.html)에서 확인할 수 있습니다.
참고문헌
- Silver et al. (2016) "Mastering the game of Go with deep neural networks and tree search", Nature
- Silver et al. (2017) "Mastering the game of Go without human knowledge", Nature
- Silver et al. (2017) "Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm", arXiv
- Vaswani et al. (2017) "Attention Is All You Need", NeurIPS
- Brown et al. (2020) "Language Models are Few-Shot Learners", NeurIPS
- Yao et al. (2023) "Tree of Thoughts: Deliberate Problem Solving with Large Language Models", arXiv