연구 및 글쓰기
소프트웨어 공학, AI, 컴퓨팅, 디지털 문화에 관한 글쓰기 및 연구.
본 연구는 숨겨진 정보, 다수의 플레이어, 시간 제약이 있는 멀티플레이어 보드게임 시타델에 적용된 하이브리드 MCTS-RL 프레임워크의 훈련에 상대방 모델링이 어떻게 영향을 미치는지 조사한다. 제안된 방법은 시뮬레이션에서 오프라인으로 구축된 지속적 의사결정 구조를 통해 계획과 실행을 분리하여 MCTS의 온라인 계산 비용을 줄인다. 전문가 에이전트와 랜덤 에이전트가 포함된 시뮬레이션 환경에서 다양한 훈련 세션(다양한 환경 포함)을 승률로 비교한다. 결과는 훈련에서의 전략 다양성이 개별적으로 강한 상대방에 대한 훈련보다 더 강건하고 범용적인 에이전트를 생성하는 경향이 있음을 보여준다.
부분 관측 가능한 멀티플레이어 게임에서의 의사결정은 숨겨진 정보와 높은 분기 요소로 인해 상당한 어려움을 야기한다. 본 연구는 전략 보드게임 시타델(Citadels)을 사례 연구로 활용하여, 이러한 환경에서 효율적으로 운영되도록 설계된 지속적 몬테카를로 트리 탐색(MCTS) 프레임워크를 소개한다. 핵심 기여는 트리 구축 단계와 적용 단계의 분리에 있다: 의사결정 트리는 환경 시뮬레이션을 통해 오프라인으로 생성되며, 관련 통계는 표 형식으로 저장되어 추가 시뮬레이션 없이 실행 중 빠른 쿼리가 가능하다. 실험적 평가를 통해, 훈련 중 다양한 상대방에 노출되면 광범위한 게임 시나리오에서 강력한 성능을 발휘할 수 있는 견고하고 일반화 가능한 전략을 가진 모델이 생성됨이 입증되었다. 특히, 상대방이 확률적으로 샘플링되는 환경에서 훈련된 모델은 단일 상대방 유형에 대해 훈련된 모델을 지속적으로 능가했으며, 훈련 실행 간에 안정적인 성능을 보였다. 이러한 결과는 MCTS와 지속적 지식 저장소를 결합하여 복잡한 도메인에서 빠르고 신뢰할 수 있으며 적응력 있는 에이전트를 생성하는 효과를 뒷받침한다.