AI·플레이 데이터 기반 경쟁 게임의
공정성·재현성 검증

2026 SCHU AI·SW Festival · AI·SW 프로젝트 경진대회 · 지도교수 안호연 · 이학주(20253762), 김보민(20253758) · 메타버스&게임학과

▶ 검증 실험실: 브라우저에서 직접 돌려 보기 (에이전트 대회, 프레임레이트 실험, 직접 플레이, 아무 사이트 QA 점검)

핵심 질문

경쟁 게임에서 “점수 규칙이 공정한가, 다시 해도 같은 결과가 나오는가”를, 실력이 다른 AI 에이전트의 플레이 데이터로 가설 → 실험 → 분석 → 개선하며 검증할 수 있는가?

모든 수치는 사람이 아니라 합성 AI 에이전트(반응 지연·실수·전략을 규칙으로 정한 플레이어)의 결과입니다. 사람 데이터 수집은 후속 과제입니다.

검증 대상

「2분 전의 나」 게임 화면: 4층, 분신 4명, 점수와 남은 시간 표시

Q1 난이도: 실력이 높아도 점수가 단조롭게 오르지 않는다

층별 도달률과 에이전트 실력 대비 점수 그래프

실력 0.75~0.9 구간의 에이전트는 분신 협동 같은 고위험 전략이 실패하면 0.5~0.7 구간보다 점수가 낮았습니다(3회 평균 약 5,000점 대 약 9,000점). 전략 구간이 계단 모양 점수를 만든 부분은 에이전트 설계의 영향도 있습니다.

Q2 점수 규칙: 3회 최고점은 운 요소가 큰 게임에서만 순위 정확도를 높인다

게임별 첫 시도와 3회 최고점의 순위 상관, 동점 비율
게임첫 시도 ρ3회 최고점 ρ
2분 전의 나 (고정 맵)0.580.55
Flappy Bird0.670.75
Dino Run0.480.55
20480.430.61

ρ는 에이전트의 잠재 실력과 점수 순위 사이의 Spearman 상관입니다(120명 × 3회). 「2분 전의 나」는 맵이 고정이라 3회 기회가 순위를 더 정확하게 만들지 못했고, 동점자 비율(약 67~70%)이 높아 동점 규칙 보강이 필요합니다.

Q3·Q5 프레임레이트와 분신 재생

프레임레이트별 상대 점수와 분신 재생 방식별 재현율

Q6 실제 서비스 QA

사이트별 실패 요청, 깨진 이미지, 콘솔 오류와 판정 재현율, 주입 결함 탐지율

한계와 후속 과제