# Automatisches Self-Play für Balance in KI-Kartenspielen

> Moonfall spielt vollständige Partien gegen sich selbst und bewertet jede beendete, damit unklare Karten auffallen, bevor Spielerinnen und Spieler ihnen begegnen.

- Canonical: https://moonfall.io/blog/de/automated-self-play
- Published: 2026-07-09
- Updated: 2026-08-17
- Language: de
- Part of: Moonfall guides — https://moonfall.io/blog/de/
- Play: https://moonfall.io/play

![Eine geflügelte Beschwörerin hält über einem Wolkenmeer ihr Schwert und wägt ab, was besteht und was nicht.](https://moonfall.io/assets/marketing/art/valkyrie-1920.webp)

*Jede beendete Partie wird gleich gewogen, bevor sich im Spiel etwas ändert.*

Moonfall-Karten haben keine Angriffs- oder Lebenswerte. [Jedes Ausspielen einer Karte ist ein Prompt](https://moonfall.io/blog/de/what-is-an-ai-card-game), und ein [KI-Spielleiter](https://moonfall.io/blog/de/ai-game-master) entscheidet im Moment, was sie tut. Damit entsteht eine Fehlerklasse, die kein Unit-Test fassen kann: Die Karte sagte das eine, die Geschichte deutete etwas anderes an, und das Spielfeld landete an einem dritten Ort. Verheddert hat sich das erst, wenn eine Partie ganz durchgelaufen ist — und die Geschichte ist nicht wegwerfbar, denn aus einer beendeten Partie kann ein [Manga-Storybook](https://moonfall.io/blog/de/share-your-story) werden, das jemand teilt.

## Das Spiel sich selbst spielen lassen

Automatisches Self-Play spielt vollständige Moonfall-Partien, in denen niemand sitzt. Zwei Socket-Clients nehmen auf dem echten Server die Plätze der Spieler ein, ein simulierter Spieler wählt aus den legalen Zügen, und der Storyteller löst jeden davon exakt so auf wie in einer laufenden Partie. Nichts ist gemockt, also besteht nichts hier und scheitert in der Produktion.

Partien laufen parallel, in Batches. Eine seltsame Partie sagt nichts; dieselbe Seltsamkeit in sechs von fünfundzwanzig Partien ist ein Defekt, den man suchen gehen kann.

Jede Partie hinterlässt einen Trace: Ausgangszustand, jede Aktion, die Aufrufe des Storytellers, die ausgegebenen Patches und die Stelle, an der das Spielfeld tatsächlich landete. Diese zu vergleichen macht aus *das fühlte sich falsch an* ein *der Patch in Zug sieben entfernte eine Karte, die in der Geschichte nie vorkam*.

![Diagramm, in dem parallele Moonfall-Partien über Server und Storyteller in Tracerfassung, LLM-Judge, Änderungsqueue und abgesicherte Anwendung fließen.](https://moonfall.io/assets/marketing/selfplay/selfplay-harness-overview.svg)

*Hier ist nichts gemockt — das Harness nimmt denselben Serverpfad wie eine echte Partie.*

## Bewerten, was herauskommt

Beendete Partien steigen eine kurze Leiter hinauf. Zuerst deterministische Prüfungen, denn worüber ein Programm entscheiden kann, sollte nicht diskutiert werden. Der Rest geht an einen LLM-Judge, der binäre Fragen beantwortet statt auf einer Zehnerskala zu benoten, und den Zug zitiert, der die jeweilige Antwort entschieden hat. Beides folgt veröffentlichten Hinweisen zur [LLM-Bewertung](https://hamel.dev/blog/posts/llm-judge/) und dazu, [vor dem Bewerten zu begründen](https://arxiv.org/abs/2303.16634).

Am meisten zählt die Hälfte, die sonst dem Geschmack überlassen bleibt: ob ein Moment wirklich überrascht hat, ob die Prosa ihre Furcht verdient statt sie behauptet hat, ob eine Auflösung respektierte, was der Kartenname versprach. Wiederholte Befunde werden zu kleinen Vorschlägen; begrenzte Änderungen werden unter Guardrails automatisch angewendet, mit einem Audit-Trail für Monitoring und optionales Eingreifen.

![Tabelle der Moonfall-Bewertungsleiter mit dem, was auf jeder Stufe läuft, der Frage, die sie beantwortet, und der Form ihres Urteils.](https://moonfall.io/assets/marketing/selfplay/selfplay-judging-ladder.svg)

*Deterministische Prüfungen zuerst, damit ein beweisbarer Verstoß nie ein Modell erreicht, das darüber streiten könnte.*

## Was zehn Batches gezeigt haben

![Liniendiagramm der geschätzten Storyteller-Genauigkeit, überraschender Momente und verdienter Emotion über zehn Moonfall-Self-Play-Batches.](https://moonfall.io/assets/marketing/selfplay/quality-signals-real-data.svg)

*Die Überraschungslinie schnellt hoch; die Genauigkeitslinie, nach früheren Läufen bereits hoch, steigt langsamer.*

Jeder Punkt ist ein Batch aus fünfundzwanzig Partien. Bewertet werden nur Partien, die vollständig durchliefen.

Die Geschichten wurden deutlich überraschender. Im ersten Batch fand ein Judge in 44 % der Partien einen wirklich überraschenden, fairen Moment; in den letzten beiden waren es 95 % und dann 100 %. Die Genauigkeit wächst inzwischen langsamer: Sie lag über die zehn Batches zwischen 92,6 % und 97,1 %, nachdem frühere Läufe sie bereits deutlich angehoben hatten.

Zwei Einschränkungen. Die Genauigkeit hier ist eine Schätzung: der Anteil der Storyteller-Aufrufe, die nie mit einem erfassten Korrektheitsfehler verknüpft wurden — brauchbar, um Batches zu vergleichen, nicht um eine einzelne Partie zu beurteilen. Und zehn Batches sind ein Pilot: Hunderte Partien, nicht Hunderttausende.

## Könnten KI-Decks irgendwann im Spiel selbst gegeneinander antreten?

Das Harness ist bereits eine Art **Auto-Battler**: KI-gesteuerte Decks setzen einander unter Druck, während ein Storyteller das Ergebnis erzählt. Irgendeine Form davon könnte auch in Moonfall interessant sein — Menschen konzentrieren sich stärker auf Karten und Deckentscheidungen, statt sich durch jeden Zug zu klicken. Das ist keine Feature-Ankündigung, nur ein Grund, warum die Arbeit über das Testen hinaus interessant ist.

Heute tut sie etwas Engeres. Moonfall soll dich überraschen, und die Schleife existiert, damit die Überraschung aus der Partie kommt und nicht aus einer Karte, deren Wortlaut unklar war.
