Onderzoek & Schrijven
Schrijven en onderzoek naar software-engineering, AI, computing en digitale cultuur.
Dit werk onderzoekt hoe tegenstandermodellering de training van een hybride MCTS-RL-framework beïnvloedt dat wordt toegepast op het multiplayer-bordspel Citadels, met verborgen informatie, meerdere spelers en tijdsdruk. Het voorstel ontkoppelt planning en uitvoering via een persistente beslissingsstructuur die offline uit simulaties is opgebouwd, waardoor de online rekenkosten van MCTS worden verlaagd. In een simulatieomgeving met expertagents en een willekeurige agent worden verschillende trainingsessies (inclusief een gevarieerde omgeving) vergeleken op winpercentage. De resultaten geven aan dat de diversiteit aan strategieën in de training de neiging heeft een robuustere en meer generalistische agent te produceren dan training tegen individueel sterke tegenstanders.
Besluitvorming in multiplayer-spellen met gedeeltelijke observeerbaarheid stelt aanzienlijke uitdagingen vanwege verborgen informatie en grote vertakkingsfactoren. In dit onderzoek wordt een persistent Monte Carlo Tree Search (MCTS)-framework geïntroduceerd dat is ontworpen om efficiënt te opereren in dergelijke omgevingen, waarbij het strategische bordspel Citadels als casestudy wordt gebruikt. De kernbijdrage is de ontkoppeling van de boomconstructiefase en de toepassingsfase: beslissingsbomen worden offline gegenereerd via omgevingssimulaties, en relevante statistieken worden in tabelvorm opgeslagen, waardoor snelle opvragingen tijdens uitvoering mogelijk zijn zonder extra simulaties. Experimentele evaluatie toont aan dat blootstelling aan diverse tegenstanders tijdens de training modellen oplevert met robuuste en generaliseerbare strategieën, die in staat zijn tot sterke prestaties in een breed scala aan spelscenario's. Met name modellen die zijn getraind in een omgeving waar tegenstanders stochastisch werden gesampleed, presteerden consistent beter dan die getraind tegen één type tegenstander en vertoonden stabiele prestaties over trainingsruns. Deze bevindingen onderstrepen de effectiviteit van het combineren van MCTS met persistente kennisopslag voor het produceren van snelle, betrouwbare en aanpasbare agents in complexe domeinen.