Ricerca e Scrittura
Scrittura e ricerca su ingegneria del software, IA, informatica e cultura digitale.
Questo lavoro studia come la modellazione degli avversari influenzi l'addestramento di un framework ibrido MCTS-RL applicato al gioco da tavolo multiplayer Citadels, caratterizzato da informazioni nascoste, più giocatori e vincoli temporali. La proposta disaccoppia pianificazione ed esecuzione attraverso una struttura decisionale persistente costruita offline da simulazioni, riducendo il costo computazionale online di MCTS. In un ambiente di simulazione con agenti esperti e un agente casuale, vengono confrontate diverse sessioni di addestramento (incluso un ambiente variato) per tasso di vittoria. I risultati indicano che la diversità delle strategie nell'addestramento tende a produrre un agente più robusto e generalista rispetto all'addestramento contro avversari individualmente forti.
Il processo decisionale in giochi multiplayer con osservabilità parziale pone sfide significative a causa delle informazioni nascoste e degli elevati fattori di ramificazione. Questo studio introduce un framework di Ricerca ad Albero Monte Carlo (MCTS) persistente, progettato per operare in modo efficiente in tali ambienti, utilizzando il gioco da tavolo strategico Citadels come caso di studio. Il contributo principale è il disaccoppiamento tra la fase di costruzione dell'albero e la fase di applicazione: gli alberi di decisione vengono generati offline attraverso simulazioni dell'ambiente, e le statistiche rilevanti vengono memorizzate in forma tabellare, consentendo query rapide durante l'esecuzione senza necessità di simulazioni aggiuntive. La valutazione sperimentale dimostra che l'esposizione ad avversari diversi durante l'addestramento produce modelli con strategie robuste e generalizzabili, capaci di ottenere buone prestazioni in un'ampia gamma di scenari di gioco. In particolare, i modelli addestrati in un ambiente in cui gli avversari venivano campionati stocasticamente hanno costantemente superato quelli addestrati contro un singolo tipo di avversario e hanno mostrato prestazioni stabili tra le diverse sessioni di addestramento. Questi risultati sottolineano l'efficacia di combinare MCTS con la memorizzazione persistente della conoscenza per produrre agenti veloci, affidabili e adattabili in domini complessi.