2026년 8월 29일
4단계: TrueSkill 베이지안 레이팅 (체스의 Elo나 Glicko-2 대신 왜 TrueSkill일까?)
글을 쓰며이 글의 주제와 흐름은 작성자의 생각이며, 본문 작성에 AI의 도움을 받았습니다.
초 단위 기록이 빠른 선수가 진짜 더 잘 타는 선수일까요?
수영이나 육상 100m와 달리, 쇼트트랙은 초 단위 기록이 선수의 진짜 실력을 온전히 대변하지 못합니다.
쇼트트랙 기록의 3가지 한계
- 빙질과 링크장의 차이: 목동 링크장은 빙질이 무뎌서 1등이 44초인데, 태릉 링크장은 빙질이 미끄러워 1등이 42초일 수 있습니다. (목동 1등이 태릉 1등보다 못하다고 볼 수 없음)
- 결승전 눈치작전: 결승전은 기록 측정이 아니라 순위 싸움입니다. 초반에 서로 견제하며 천천히 돌면 결승전 1등 기록이 예선 4등 기록(46초)보다 훨씬 느리게 나오기도 합니다.
- 몸싸움과 코너링: 쇼트트랙은 자리싸움과 인코스/아웃코스 추월 능력이 핵심입니다.
💡 결론
초 단위 시간 대신 '누가 누구를 제치고 이겼는가(상대적 승패)'를 점수화해야 합니다.
왜 Glicko-2 대신 마이크로소프트의 TrueSkill인가?
체스, 바둑, 테니스는 항상 1:1로만 승부하는 종목입니다.
반면 쇼트트랙은 4명~6명이 한 링크장에서 동시에 달리는 다자간 순위 경쟁(Free-for-all)입니다.
다이어그램 렌더링 중...
- Glicko-2의 한계: 다자간 레이스를 1:1 대결 묶음(Pairwise)으로 분해하다 보니, "4명이 한 조에서 함께 경쟁했다"는 경기 전체의 상관관계가 희석됩니다.
- TrueSkill의 강점: 마이크로소프트 연구소가 Xbox 게임의 다자간 매치메이킹을 위해 개발한 모델입니다. 다자간 순위 관계()를 가우시안 분포()로 한 번에 모델링합니다.
TrueSkill의 핵심: 실력 과 불확실성
TrueSkill은 선수의 실력을 단 하나의 고정된 점수가 아니라 정규분포 곡선(종 모양)으로 바라봅니다.
선수 A (신인: μ=25, σ=8.33) 선수 B (베테랑: μ=32, σ=1.5)
불확실성이 큼 실력이 매우 확실함
╭───────╮ ╭─╮
╭─╯ ╰─╮ ╭─╯ ╰─╮
╭─╯ ╰─╮ ╭─╯ ╰─╮
───────────┴───────────────┴─────────────────────────────┴─────────┴────────
10 20 25 30 40 29 32 35- 실력 점수 (, 뮤): 기본값 25점. 경기에서 상위 순위를 기록할수록 올라갑니다.
- 불확실성 (, 시그마): 기본값 8.33점.
- 경기를 많이 치를수록: 선수의 기량이 드러나므로 가 점점 줄어듭니다(점수가 뾰족하고 확실해짐).
- 오랫동안 쉬면: 실력이 어떻게 변했는지 알 수 없으므로 가 다시 넓어집니다.
- 노출 점수 (Conservative Rating: ):
- 랭킹을 산정할 때는 에서 불확실성을 뺀 보수적인 점수를 사용하여, 신인이 한두 번 반짝 1등 했다고 랭킹 1위가 되는 현상을 방지합니다.
백테스트 검증: Glicko-2 vs TrueSkill 맞대결 결과
이론에만 그치지 않고, 18,425건의 실제 경기(2025~2026 홀드아웃 시즌)를 대상으로 12가지 설정을 정면 비교했습니다.
[실제 백테스트 리포트 결과]
순위 | 정책(Policy) | 주기(Period) | 레이팅 엔진 | 예측 정확도 | 로그 손실(Log-Loss) | 베이스라인 대비 개선
---------------------------------------------------------------------------------------------
🥇 1위 | conservative | 대회(meet) | TrueSkill | 71.33% | 0.55523 | +11.01% (1위)
🥈 2위 | conservative | 월(month) | TrueSkill | 70.84% | 0.55924 | +10.37%
🥉 3위 | aggressive | 대회(meet) | TrueSkill | 70.50% | 0.56118 | +10.05%
...
5위 | conservative | 대회(meet) | Glicko-2 | 69.12% | 0.57896 | +7.20%
6위 | aggressive | 대회(meet) | Glicko-2 | 68.92% | 0.58005 | +7.03%📊 데이터가 증명한 결론
- 예측 정확도: TrueSkill(71.33%)이 Glicko-2(69.12%)보다 실제 경기 승자를 더 잘 맞췄습니다.
- 로그 손실(Log-Loss): TrueSkill(0.555)이 Glicko-2(0.578)보다 더 정밀한 승리 확률을 산출했습니다.
- 개선율: 베이스라인 대비 TrueSkill은 +11.01% 개선되어, 모델 채택 기준(개선율 )을 안정적으로 통과했습니다.
최종 채택된 설정: conservative / meet / trueskill
conservative(정책): 실격(DQ)이나 부전승(ADV) 같은 심판 판정 노이즈를 배제하고, 순수 완주자들의 순위만을 학습 데이터로 사용.meet(주기): 경기마다 점수를 갱신하면 경기 순서에 따른 왜곡이 생기므로, 대회 1개가 끝날 때마다 일괄 배치(Batch)로 실력을 업데이트.TrueSkill(엔진): 다자간 레이스 순위를 가우시안 팩터 그래프로 온전히 반영.
전체 1~4단계 종합 로드맵
프로젝트의 데이터 파이프라인은 다음과 같이 유기적으로 연결됩니다.
다이어그램 렌더링 중...
- 1단계: 연령별·거리별 공정한 백분위 기준선을 세우고 개인정보를 보호합니다.
- 2단계: 초등 5~6 성적 밴드를 바탕으로 성인 무대까지의 생존율을 추적합니다.
- 3단계: 선수의 은퇴 시점을 공백 복귀율 데이터(Stop Rule, )로 정확히 판정합니다.
- 4단계: 환경에 따라 요동치는 시간 대신, 승패 기반 TrueSkill 레이팅으로 선수의 기량을 측정합니다.
부록: Glicko-2 모델의 구조와 한계
Glicko-2는 체스나 온라인 게임(1:1)에서 널리 쓰이는 표준 레이팅 시스템입니다.
1. 다자간 경기를 1:1로 쪼갤 때의 정보 손실
쇼트트랙 4인 경기를 Glicko-2에 넣으려면 6개의 개별 1:1 경기로 분해해야 합니다.
[4인 경기 결과: 1위 A / 2위 B / 3위 C / 4위 D]
👉 총 6개의 1:1 승패 데이터로 변환:
- A vs B -> A 승
- A vs C -> A 승
- A vs D -> A 승
- B vs C -> B 승
- B vs D -> B 승
- C vs D -> C 승2. Glicko-2의 3가지 차원
Glicko-2는 선수의 실력을 3가지 요소로 모델링합니다.
- 평점 (, 뮤): 선수의 실력 점수 (기본 1500점)
- 불확실성 (, RD): 최근 출전이 없으면 시간이 지날수록 오차범위가 넓어짐
- 변동성 (, 시그마): 경기력의 기복 정도 (기본 0.06)