# Autojogo automatizado para equilibrar jogos de cartas com IA

> Moonfall joga partidas completas contra si mesmo e pontua cada partida concluída, para pegar cartas confusas antes que os jogadores as encontrem.

- Canonical: https://moonfall.io/blog/pt/automated-self-play
- Published: 2026-07-09
- Updated: 2026-08-17
- Language: pt
- Part of: Moonfall guides — https://moonfall.io/blog/pt/
- Play: https://moonfall.io/play

![Uma invocadora alada erguendo a lâmina sobre um mar de nuvens, pesando o que passa e o que não passa.](https://moonfall.io/assets/marketing/art/valkyrie-1920.webp)

*Toda partida concluída é pesada do mesmo jeito antes que algo no jogo mude.*

As cartas de Moonfall não têm números de ataque ou vida. [Cada jogada é um prompt](https://moonfall.io/blog/pt/what-is-an-ai-card-game), e um [mestre de jogo com IA](https://moonfall.io/blog/pt/ai-game-master) decide na hora o que ela faz. Isso cria uma classe de falha que nenhum teste unitário pega: a carta dizia uma coisa, a história sugeria outra e a mesa terminou num terceiro lugar. As três só se embaralham depois que a partida foi até o fim — e a história não é descartável, já que uma partida concluída pode virar um [storybook em mangá](https://moonfall.io/blog/pt/share-your-story) que alguém compartilha.

## Deixar o jogo jogar sozinho

O autojogo automatizado roda partidas completas de Moonfall sem ninguém sentado nelas. Dois clientes socket ocupam o lugar dos jogadores no servidor real, um jogador simulado escolhe entre as jogadas legais e o storyteller resolve cada uma igual a uma partida ao vivo. Nada é substituído por mock, então nada passa aqui e falha em produção.

As partidas rodam em paralelo, em lotes. Uma partida estranha não diz nada; a mesma estranheza em seis de vinte e cinco é um defeito que dá para ir atrás.

Cada partida deixa um rastro: o estado inicial, cada ação, as chamadas do storyteller, os patches emitidos e onde a mesa realmente parou. Comparar isso é o que transforma *aquilo pareceu errado* em *o patch do turno sete removeu uma carta que a história nunca mencionou*.

![Diagrama de partidas paralelas de Moonfall passando pelo servidor e pelo storyteller até a captura de rastros, um juiz LLM, uma fila de mudanças e aplicação com guardrails.](https://moonfall.io/assets/marketing/selfplay/selfplay-harness-overview.svg)

*Aqui nada é mockado — o harness percorre o mesmo caminho de servidor de uma partida real.*

## Julgar o que sai

Partidas concluídas sobem uma escada curta. Primeiro as verificações determinísticas, porque aquilo que um programa resolve não deveria ser discutido. O resto vai para um juiz LLM que responde perguntas binárias em vez de dar nota de zero a dez, e cita o turno que decidiu cada resposta. As duas coisas seguem recomendações publicadas sobre [avaliação com LLM](https://hamel.dev/blog/posts/llm-judge/) e sobre [raciocinar antes de pontuar](https://arxiv.org/abs/2303.16634).

O que mais importa é a metade normalmente deixada ao gosto: se houve um momento genuinamente surpreendente, se a prosa conquistou seu pavor em vez de anunciá-lo, se a resolução respeitou o que o nome da carta prometia. Achados repetidos viram propostas pequenas; mudanças limitadas são aplicadas automaticamente sob guardrails, com uma trilha de auditoria para monitoramento e intervenção opcional.

![Tabela da escada de julgamento de Moonfall, com o que roda em cada nível, a pergunta que ele responde e o formato do veredito.](https://moonfall.io/assets/marketing/selfplay/selfplay-judging-ladder.svg)

*Verificações determinísticas primeiro, para que uma violação demonstrável nunca chegue a um modelo capaz de discuti-la.*

## O que dez lotes mostraram

![Gráfico de linhas da precisão estimada do storyteller, momentos surpreendentes e emoção conquistada ao longo de dez lotes de autojogo de Moonfall.](https://moonfall.io/assets/marketing/selfplay/quality-signals-real-data.svg)

*A linha da surpresa dispara; a da precisão, já alta após execuções anteriores, sobe mais devagar.*

Cada ponto é um lote de vinte e cinco partidas. Só partidas que foram até o fim são pontuadas.

As histórias ficaram bem mais surpreendentes. No primeiro lote, um juiz encontrou um momento genuinamente surpreendente e justo em 44% das partidas; nos dois últimos, 95% e depois 100%. A precisão agora cresce mais devagar: ficou entre 92,6% e 97,1% nos dez lotes, depois de execuções anteriores já a terem melhorado bastante.

Duas ressalvas. A precisão aqui é uma estimativa: a parcela de chamadas ao storyteller nunca vinculadas a uma falha registrada, útil para comparar lotes mais do que para julgar uma partida específica. E dez lotes são um piloto: centenas de partidas, não centenas de milhares.

## Decks de IA poderiam um dia se enfrentar dentro do jogo?

O harness já é uma espécie de **auto-battler**: decks controlados por IA pressionam uns aos outros enquanto um storyteller narra o resultado. Alguma versão disso poderia ser interessante dentro do próprio Moonfall — com humanos focando mais nas cartas e nas escolhas de deck do que em clicar turno a turno. Não é um anúncio de recurso, apenas um motivo pelo qual o trabalho é interessante além do teste.

Por ora ele faz algo mais estreito. Moonfall deve surpreender você, e o ciclo existe para que a surpresa venha da partida e não de uma carta com redação confusa.
