Stimmung
Version v2.0 · 24. Juli 2026
Ordnet jede Nachricht einer von vier Stimmungen zu: positiv, negativ, neutral oder gemischt. Gemischte Stimmungen, also Lob und Beschwerde im selben Text, sind eine eigene Klasse und kein Zwischenwert. Version 2 wurde gezielt gegen eine Gruppe von Fehlklassifikationen nachtrainiert, die auf kuratierten deutschen Realdaten gefunden wurde: Wut in Grossbuchstaben, Polemik, höflich formulierte Kündigungen.
Messungen
Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft immer von 0 bis 100 Prozent und wird nie beschnitten: Eine breite Spanne bedeutet eine kleine Stichprobe, und genau so soll sie aussehen.
Modell-Ebene
Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
Genauigkeit
97,8 %
- Referenzsatz:
- Eingefrorener handannotierter Testsplit
- Umfang:
- n = 139 · Stand 24. Juli 2026
- 95-%-Konfidenzintervall:
- 93,8 % bis 99,2 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 139)
F1 der Klasse gemischt
97,1 %
- Referenzsatz:
- Eingefrorener handannotierter Testsplit
- Umfang:
- n = 139 · Stand 24. Juli 2026
- Kein Konfidenzintervall:
- Ein F1-Wert ist das harmonische Mittel aus Genauigkeit und Trefferquote und damit kein Anteil. Sein Stichprobenverhalten ist nicht binomial, ein Wilson-Intervall wäre hier unzulässig.
Produktions-Testfälle bestanden
39 von 40
- Referenzsatz:
- Kuratierte Produktions-Testfälle
- Umfang:
- n = 40 · Stand 24. Juli 2026
- 95-%-Konfidenzintervall:
- 87,1 % bis 99,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 40)
Pipeline-Referenzlauf
End-to-end durch die vollständige Pipeline gemessen, gegen die Referenzwerte eines synthetischen deutschen Testkorpus. Grosse Fallzahlen, aber maschinell abgeleitete Referenzwerte.
Genauigkeit
96,6 %
- Referenzsatz:
- Referenzlauf 2026-08-04, Teilmenge mit Stimmungs-Referenz
- Umfang:
- n = 8.574 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 96,2 % bis 97,0 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 8.574)
Trefferquote auf gemischten Stimmungen
71,4 %
- Referenzsatz:
- Referenzlauf 2026-08-04, Teilmenge konstruiert gemischter Fälle
- Umfang:
- n = 1.158 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 68,7 % bis 73,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.158)
Werte je Klasse
Alle vier Klassen stammen aus demselben Referenzlauf, mit derselben Kennzahl gemessen, und jede Klasse hat ihre eigene Stützmenge als Nenner. Deshalb dürfen sie hier als eine Reihe stehen. Die Spanne je Klasse ist das Konfidenzintervall auf dieser Stützmenge.
Eine Reihe, weil Quelle, Kennzahl und Referenzlauf für alle Klassen dieselben sind. Die Nenner sind es nicht: Jede Klasse wird auf den Fällen gemessen, die zu ihr gehören, und der Umfang steht bei jeder Zeile.
Pipeline-Referenzlauf
negativ — Trefferquote
95,7 %
- Referenzsatz:
- Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung negativ
- Umfang:
- n = 5.324 · Stand 29. Juli 2026
- 95-%-Konfidenzintervall:
- 95,1 % bis 96,2 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.324)
neutral — Trefferquote
90 %
- Referenzsatz:
- Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung neutral
- Umfang:
- n = 2.021 · Stand 29. Juli 2026
- 95-%-Konfidenzintervall:
- 88,6 % bis 91,2 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 2.021)
positiv — Trefferquote
97,4 %
- Referenzsatz:
- Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung positiv
- Umfang:
- n = 1.283 · Stand 29. Juli 2026
- 95-%-Konfidenzintervall:
- 96,4 % bis 98,1 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.283)
gemischt — Trefferquote
72,8 %
- Referenzsatz:
- Referenzlauf 2026-07-29, Teilmenge mit erwarteter Stimmung gemischt
- Umfang:
- n = 1.078 · Stand 29. Juli 2026
- 95-%-Konfidenzintervall:
- 70,1 % bis 75,4 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.078)
Konfusionsmatrix
| Soll ↓ / Ist → | negativ | neutral | positiv | Summe |
|---|---|---|---|---|
| negativ | 5.094 | 52 | 39 | 5.185 |
| neutral | 153 | 1.892 | 27 | 2.072 |
| positiv | 17 | 4 | 1.296 | 1.317 |
Konstruiert gemischte Texte
Keine DiagonaleDiese Zeile steht abgesetzt, weil es für sie keine richtige Antwort gibt. „Gemischt“ ist keines der drei Label, die das Modell vergeben kann, sondern ein eigenes Kennzeichen daneben; eine vierte Spalte kann es deshalb nicht geben. Die Spalten zeigen, auf welches der drei Label das Modell ausweicht, nicht ob es richtig lag. Der größte Wert dieser Zeile ist damit kein Fehler der Matrix, sondern das sinnvollste Ausweichlabel für einen gemischten Text, in dem eine Beschwerde steht.
| Gewähltes Label | negativ | neutral | positiv | Summe |
|---|---|---|---|---|
| konstruiert gemischt | 818 | 1 | 339 | 1.158 |
Es sind dieselben Fälle, auf denen oben die Trefferquote für gemischte Stimmungen gemessen ist. Dort steht mit Referenzsatz und Intervall, wie oft das Kennzeichen selbst gesetzt wurde.
Kalibrierung
Temperatur-Skalierung. Die ausgegebenen Konfidenzwerte sind als Wahrscheinlichkeiten interpretierbar.
Für dieses Modell ist kein Kalibrierungsfehler als Zahl veröffentlicht.
Versionshistorie
Die Kernmetrik einer Version ist Versionskontext, keine eigenständig belegte Messung: Sie nennt weder Referenzsatz noch Umfang. Die belegten Messungen stehen oben.
Die Messungen oben stammen aus dem Referenzlauf vom 4. August 2026, und der läuft auf Korpus-Generation 1.2.0: Der Generator kennt seit dieser Generation eine eigene Klasse für Verbandspolitik, die Anteile sind entsprechend neu normiert. Die Werte der älteren Versionen darunter wurden auf den Läufen vom 6. und vom 29. Juli gemessen. Jede einzelne Zahl bleibt für ihren eigenen Lauf gültig; eingeschränkt ist der Vergleich untereinander, nicht die Messung.
v1.0
5. Juli 2026
v2.0
24. Juli 2026
aktuell
Die Abfolge zeigt Reihenfolge und Stand, keine Werte. Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell sogar die Richtung. Eine gemeinsame Achse gibt es dafür nicht, die Werte stehen deshalb einzeln darunter.
v2.0
24. Juli 2026Trefferquote gemischte Stimmungen (Pipeline-Kurzlauf, 400 Fälle): 90,7 %
Was sich geändert hat
- Die auf Realdaten gefundene Fehlklassen-Gruppe ist vollständig behoben: fünf von fünf Prüffällen korrekt, vorher null von fünf.
- Die Erkennung gemischter Stimmungen stieg von 39,5 auf 90,7 Prozent.
- Dokumentierte Kosten: zwei Fälle auf dem eingefrorenen Testsplit und eine leichte Neutral-Erosion. Ironie bleibt eine offene Klasse.
v1.0
5. Juli 2026Genauigkeit (eingefrorener Testsplit): 99,3 %
Was sich geändert hat
- Erstes eigenes Vier-Klassen-Modell, trainiert auf 933 handannotierten Goldens.
- Alle 40 Produktions-Testfälle bestanden.
Wie es dazu kam
Diese Seite zeigt, wo das Modell heute steht. Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.