# Auto-jeu automatisé pour équilibrer les jeux de cartes IA

> Moonfall joue des matchs complets contre lui-même et note chaque match terminé, pour repérer les cartes floues avant que les joueurs ne les rencontrent.

- Canonical: https://moonfall.io/blog/fr/automated-self-play
- Published: 2026-07-09
- Updated: 2026-08-17
- Language: fr
- Part of: Moonfall guides — https://moonfall.io/blog/fr/
- Play: https://moonfall.io/play

![Une invocatrice ailée tenant sa lame au-dessus d'une mer de nuages, pesant ce qui passe et ce qui ne passe pas.](https://moonfall.io/assets/marketing/art/valkyrie-1920.webp)

*Chaque match terminé est pesé de la même façon avant que quoi que ce soit change dans le jeu.*

Les cartes de Moonfall n'ont ni attaque ni points de vie. [Jouer une carte est un prompt](https://moonfall.io/blog/fr/what-is-an-ai-card-game), et un [maître du jeu IA](https://moonfall.io/blog/fr/ai-game-master) décide sur le moment de ce qu'elle fait. D'où une catégorie de bug qu'aucun test unitaire n'attrape : la carte disait une chose, l'histoire en suggérait une autre, et le plateau a atterri ailleurs. Les trois ne s'emmêlent qu'une fois le match terminé — et l'histoire n'est pas jetable, puisqu'un match fini peut devenir un [storybook manga](https://moonfall.io/blog/fr/share-your-story) que quelqu'un partage.

## Laisser le jeu jouer tout seul

L'auto-jeu automatisé fait tourner des matchs Moonfall complets où personne n'est assis. Deux clients socket prennent la place des joueurs sur le vrai serveur, un joueur simulé choisit parmi les coups légaux, et le storyteller résout chacun exactement comme dans une partie en direct. Rien n'est simulé en dur, donc rien ne passe ici pour échouer en production.

Les matchs tournent en parallèle, par lots. Un match étrange ne dit rien ; la même étrangeté dans six matchs sur vingt-cinq est un défaut qu'on peut aller chercher.

Chaque match laisse une trace : l'état initial, chaque action, les appels du storyteller, les patches émis, et l'endroit où le plateau a réellement atterri. Les comparer, c'est ce qui transforme *ça sonnait faux* en *le patch du tour sept a retiré une carte dont l'histoire n'a jamais parlé*.

![Schéma de matchs Moonfall parallèles traversant le serveur et le storyteller vers la capture des traces, un juge LLM, une file de changements et une application encadrée.](https://moonfall.io/assets/marketing/selfplay/selfplay-harness-overview.svg)

*Rien n'est simulé ici — le harness emprunte le même chemin serveur qu'un match réel.*

## Juger ce qui en sort

Les matchs terminés montent une courte échelle. D'abord les vérifications déterministes, car ce qu'un programme peut trancher n'a pas à être débattu. Le reste va à un juge LLM qui répond à des questions binaires plutôt que de noter sur dix, et cite le tour ayant décidé chaque réponse. Les deux suivent des recommandations publiées sur l'[évaluation par LLM](https://hamel.dev/blog/posts/llm-judge/) et sur le fait de [raisonner avant de noter](https://arxiv.org/abs/2303.16634).

Le plus important est la moitié qu'on laisse d'ordinaire au ressenti : un moment a-t-il vraiment surpris, la prose a-t-elle mérité son effroi au lieu de l'annoncer, la résolution a-t-elle respecté ce que promettait le nom de la carte. Les constats répétés deviennent de petites propositions ; des changements limités s'appliquent automatiquement sous garde-fous, avec une piste d'audit pour le suivi et une intervention facultative.

![Tableau de l'échelle de jugement Moonfall, indiquant ce qui s'exécute à chaque niveau, la question à laquelle il répond et la forme de son verdict.](https://moonfall.io/assets/marketing/selfplay/selfplay-judging-ladder.svg)

*Les vérifications déterministes d'abord, pour qu'une violation prouvable n'atteigne jamais un modèle qui pourrait la discuter.*

## Ce que dix lots ont montré

![Graphique linéaire de la précision estimée du storyteller, des moments surprenants et de l'émotion méritée sur dix lots d'auto-jeu Moonfall.](https://moonfall.io/assets/marketing/selfplay/quality-signals-real-data.svg)

*La courbe de la surprise s'envole ; celle de la précision, déjà haute après les campagnes précédentes, monte plus lentement.*

Chaque point correspond à un lot de vingt-cinq matchs. Seuls les matchs menés jusqu'au bout sont notés.

Les histoires sont devenues bien plus surprenantes. Dans le premier lot, un juge a trouvé un moment vraiment surprenant et juste dans 44 % des matchs ; dans les deux derniers, 95 % puis 100 %. La précision progresse désormais plus lentement : elle s'est maintenue entre 92,6 % et 97,1 % sur les dix lots, après que des campagnes précédentes l'avaient déjà nettement améliorée.

Deux réserves. La précision dont il est question est une estimation : la part des appels au storyteller jamais reliés à une défaillance enregistrée, utile pour comparer des lots plutôt que pour juger un match donné. Et dix lots, c'est un pilote : des centaines de matchs, pas des centaines de milliers.

## Des decks IA pourraient-ils un jour s'affronter dans le jeu ?

Le harness est déjà une sorte d'**auto-battler** : des decks pilotés par IA se mettent mutuellement sous pression pendant qu'un storyteller raconte le résultat. Une version de cela pourrait être intéressante dans Moonfall même — les humains se concentrant davantage sur les cartes et les choix de deck que sur le clic tour après tour. Ce n'est pas une annonce de fonctionnalité, juste une raison pour laquelle ce travail est intéressant au-delà du test.

Pour l'instant, son rôle est plus étroit. Moonfall est censé vous surprendre, et la boucle existe pour que la surprise vienne du match et non d'une carte dont la formulation était floue.
