Zum Inhalt springen

Stimmung

Version v2.0 · 24. Juli 2026

Ordnet jede Nachricht einer von vier Stimmungen zu: positiv, negativ, neutral oder gemischt. Gemischte Stimmungen, also Lob und Beschwerde im selben Text, sind eine eigene Klasse und kein Zwischenwert. Version 2 wurde gezielt gegen eine Gruppe von Fehlklassifikationen nachtrainiert, die auf kuratierten deutschen Realdaten gefunden wurde: Wut in Grossbuchstaben, Polemik, höflich formulierte Kündigungen.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft immer von 0 bis 100 Prozent und wird nie beschnitten: Eine breite Spanne bedeutet eine kleine Stichprobe, und genau so soll sie aussehen.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Genauigkeit

    97,8 %

    Referenzsatz:
    Eingefrorener handannotierter Testsplit
    Umfang:
    n = 139 · Stand 24. Juli 2026
    95-%-Konfidenzintervall:
    93,8 % bis 99,2 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 139)
  • F1 der Klasse gemischt

    97,1 %

    Referenzsatz:
    Eingefrorener handannotierter Testsplit
    Umfang:
    n = 139 · Stand 24. Juli 2026
    Kein Konfidenzintervall:
    Ein F1-Wert ist das harmonische Mittel aus Genauigkeit und Trefferquote und damit kein Anteil. Sein Stichprobenverhalten ist nicht binomial, ein Wilson-Intervall wäre hier unzulässig.
  • Produktions-Testfälle bestanden

    39 von 40

    Referenzsatz:
    Kuratierte Produktions-Testfälle
    Umfang:
    n = 40 · Stand 24. Juli 2026
    95-%-Konfidenzintervall:
    87,1 % bis 99,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 40)

Pipeline-Referenzlauf

End-to-end durch die vollständige Pipeline gemessen, gegen die Referenzwerte eines synthetischen deutschen Testkorpus. Grosse Fallzahlen, aber maschinell abgeleitete Referenzwerte.

  • Genauigkeit

    96,6 %

    Referenzsatz:
    Referenzlauf 2026-08-04, Teilmenge mit Stimmungs-Referenz
    Umfang:
    n = 8.574 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    96,2 % bis 97,0 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 8.574)
  • Trefferquote auf gemischten Stimmungen

    71,4 %

    Referenzsatz:
    Referenzlauf 2026-08-04, Teilmenge konstruiert gemischter Fälle
    Umfang:
    n = 1.158 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    68,7 % bis 73,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.158)

Werte je Klasse

Alle vier Klassen stammen aus demselben Referenzlauf, mit derselben Kennzahl gemessen, und jede Klasse hat ihre eigene Stützmenge als Nenner. Deshalb dürfen sie hier als eine Reihe stehen. Die Spanne je Klasse ist das Konfidenzintervall auf dieser Stützmenge.

Eine Reihe, weil Quelle, Kennzahl und Referenzlauf für alle Klassen dieselben sind. Die Nenner sind es nicht: Jede Klasse wird auf den Fällen gemessen, die zu ihr gehören, und der Umfang steht bei jeder Zeile.

Pipeline-Referenzlauf

  • negativ — Trefferquote

    95,7 %

    Referenzsatz:
    Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung negativ
    Umfang:
    n = 5.324 · Stand 29. Juli 2026
    95-%-Konfidenzintervall:
    95,1 % bis 96,2 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.324)
  • neutral — Trefferquote

    90 %

    Referenzsatz:
    Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung neutral
    Umfang:
    n = 2.021 · Stand 29. Juli 2026
    95-%-Konfidenzintervall:
    88,6 % bis 91,2 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 2.021)
  • positiv — Trefferquote

    97,4 %

    Referenzsatz:
    Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung positiv
    Umfang:
    n = 1.283 · Stand 29. Juli 2026
    95-%-Konfidenzintervall:
    96,4 % bis 98,1 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.283)
  • gemischt — Trefferquote

    72,8 %

    Referenzsatz:
    Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung gemischt
    Umfang:
    n = 1.078 · Stand 29. Juli 2026
    95-%-Konfidenzintervall:
    70,1 % bis 75,4 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.078)

Konfusionsmatrix

Wie sich die Stimmungs-Zuordnung im Referenzlauf verteilt. Jede Zeile ist die richtige Stimmung, jede Spalte die vom Modell vergebene. Die Zahlen sind Fälle und keine Anteile, damit die Zeilensummen nachrechenbar bleiben. Die Diagonale ist die richtige Zuordnung; sie steht dort, wo Zeilen- und Spaltenkopf dasselbe sagen.
Soll ↓ / Ist →negativneutralpositivSumme
negativ5.09452395.185
neutral1531.892272.072
positiv1741.2961.317

Konstruiert gemischte Texte

Keine Diagonale

Diese Zeile steht abgesetzt, weil es für sie keine richtige Antwort gibt. „Gemischt“ ist keines der drei Label, die das Modell vergeben kann, sondern ein eigenes Kennzeichen daneben; eine vierte Spalte kann es deshalb nicht geben. Die Spalten zeigen, auf welches der drei Label das Modell ausweicht, nicht ob es richtig lag. Der größte Wert dieser Zeile ist damit kein Fehler der Matrix, sondern das sinnvollste Ausweichlabel für einen gemischten Text, in dem eine Beschwerde steht.

Gewähltes LabelnegativneutralpositivSumme
konstruiert gemischt81813391.158

Es sind dieselben Fälle, auf denen oben die Trefferquote für gemischte Stimmungen gemessen ist. Dort steht mit Referenzsatz und Intervall, wie oft das Kennzeichen selbst gesetzt wurde.

Kalibrierung

Temperatur-Skalierung. Die ausgegebenen Konfidenzwerte sind als Wahrscheinlichkeiten interpretierbar.

Für dieses Modell ist kein Kalibrierungsfehler als Zahl veröffentlicht.

Versionshistorie

Die Kernmetrik einer Version ist Versionskontext, keine eigenständig belegte Messung: Sie nennt weder Referenzsatz noch Umfang. Die belegten Messungen stehen oben.

Die Messungen oben stammen aus dem Referenzlauf vom 4. August 2026, und der läuft auf Korpus-Generation 1.2.0: Der Generator kennt seit dieser Generation eine eigene Klasse für Verbandspolitik, die Anteile sind entsprechend neu normiert. Die Werte der älteren Versionen darunter wurden auf den Läufen vom 6. und vom 29. Juli gemessen. Jede einzelne Zahl bleibt für ihren eigenen Lauf gültig; eingeschränkt ist der Vergleich untereinander, nicht die Messung.

  1. v1.0

    5. Juli 2026

  2. v2.0

    24. Juli 2026

    aktuell

Die Abfolge zeigt Reihenfolge und Stand, keine Werte. Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell sogar die Richtung. Eine gemeinsame Achse gibt es dafür nicht, die Werte stehen deshalb einzeln darunter.

  • v2.0

    24. Juli 2026

    Trefferquote gemischte Stimmungen (Pipeline-Kurzlauf, 400 Fälle): 90,7 %

    Was sich geändert hat

    • Die auf Realdaten gefundene Fehlklassen-Gruppe ist vollständig behoben: fünf von fünf Prüffällen korrekt, vorher null von fünf.
    • Die Erkennung gemischter Stimmungen stieg von 39,5 auf 90,7 Prozent.
    • Dokumentierte Kosten: zwei Fälle auf dem eingefrorenen Testsplit und eine leichte Neutral-Erosion. Ironie bleibt eine offene Klasse.
  • v1.0

    5. Juli 2026

    Genauigkeit (eingefrorener Testsplit): 99,3 %

    Was sich geändert hat

    • Erstes eigenes Vier-Klassen-Modell, trainiert auf 933 handannotierten Goldens.
    • Alle 40 Produktions-Testfälle bestanden.

Wie es dazu kam

Diese Seite zeigt, wo das Modell heute steht. Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.