Zum Inhalt springen

Stimmung

Version v2.0 · 24. Juli 2026

Ordnet jede Nachricht einer von vier Stimmungen zu: positiv, negativ, neutral oder gemischt. Gemischte Stimmungen, also Lob und Beschwerde im selben Text, sind eine eigene Klasse und kein Zwischenwert. Version 2 wurde gezielt gegen eine Gruppe von Fehlklassifikationen nachtrainiert, die auf kuratierten deutschen Realdaten gefunden wurde: Wut in Grossbuchstaben, Polemik, höflich formulierte Kündigungen.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Genauigkeit

    97,8 %

    Referenzsatz:
    Eingefrorener handannotierter Testsplit
    Umfang:
    n = 139 · Stand 24. Juli 2026
    95-%-Konfidenzintervall:
    93,8 % bis 99,2 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 139)
  • F1 der Klasse gemischt

    97,1 %

    Referenzsatz:
    Eingefrorener handannotierter Testsplit
    Umfang:
    n = 139 · Stand 24. Juli 2026
    Kein Konfidenzintervall:
    Kein Intervall: F1 ist ein harmonisches Mittel und kein Anteil, ein Wilson-Intervall wäre hier unzulässig.
  • Produktions-Testfälle bestanden

    39 von 40

    Referenzsatz:
    Kuratierte Produktions-Testfälle
    Umfang:
    n = 40 · Stand 24. Juli 2026
    95-%-Konfidenzintervall:
    87,1 % bis 99,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 40)

Volllauf auf echten Texten

End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

  • Übereinstimmung mit der Sternebewertung (ein bis zwei Sterne negativ, drei neutral, vier bis fünf positiv)

    93,3 %

    Referenzsatz:
    Volllauf auf öffentlichen Bewertungen, 10.09.2026
    Umfang:
    n = 6.971 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    92,7 % bis 93,9 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 6.971)

Konfusionsmatrix

Jede Zeile ist die erwartete Stimmung, jede Spalte die vom Modell vergebene; auf der Diagonalen stimmen beide überein. Die Zahlen sind Fälle, nicht Anteile.
Soll ↓ / Ist →negativneutralpositivSumme
negativ5.0321721155.319
neutral80126107
positiv46281.4711.545

Selbsteinschätzung

Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.

Median:
0,94
im obersten Zehntel:
63,5 %
unter 0,5:
3,5 %
Referenzsatz:
Volllauf auf öffentlichen Bewertungen, 10.09.2026
Umfang:
n = 6.859 · Stand 10. September 2026

Kalibrierung

Temperatur-Skalierung. Die ausgegebenen Konfidenzwerte sind als Wahrscheinlichkeiten interpretierbar.

Für dieses Modell liegt kein Kalibrierungsfehler als Zahl vor.

Versionshistorie

Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.

Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.

  1. v1.0

    5. Juli 2026

  2. v2.0

    24. Juli 2026

    aktuell

Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.

  • v2.0

    24. Juli 2026

    Trefferquote gemischte Stimmungen (Pipeline-Kurzlauf, 400 Fälle)

    Wert zurückgezogenGemessen auf einem synthetischen Referenzkorpus, den es nicht mehr gibt. Die Kennzahl sagt weiter, woran diese Version gemessen wurde; der Wert ist nicht mehr nachprüfbar.

    Was sich geändert hat

    • Die auf Realdaten gefundene Fehlklassen-Gruppe ist vollständig behoben: fünf von fünf Prüffällen korrekt, vorher null von fünf.
    • Die Erkennung gemischter Stimmungen stieg von 39,5 auf 90,7 Prozent.
    • Dokumentierte Kosten: zwei Fälle auf dem eingefrorenen Testsplit und eine leichte Neutral-Erosion. Ironie bleibt eine offene Klasse.
  • v1.0

    5. Juli 2026

    Genauigkeit (eingefrorener Testsplit): 99,3 %

    Was sich geändert hat

    • Erstes eigenes Vier-Klassen-Modell, trainiert auf 933 handannotierten Goldens.
    • Alle 40 Produktions-Testfälle bestanden.

Wie es dazu kam

Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.