Stimmung
Version v2.0 · 24. Juli 2026
Ordnet jede Nachricht einer von vier Stimmungen zu: positiv, negativ, neutral oder gemischt. Gemischte Stimmungen, also Lob und Beschwerde im selben Text, sind eine eigene Klasse und kein Zwischenwert. Version 2 wurde gezielt gegen eine Gruppe von Fehlklassifikationen nachtrainiert, die auf kuratierten deutschen Realdaten gefunden wurde: Wut in Grossbuchstaben, Polemik, höflich formulierte Kündigungen.
Messungen
Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.
Modell-Ebene
Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
Genauigkeit
97,8 %
- Referenzsatz:
- Eingefrorener handannotierter Testsplit
- Umfang:
- n = 139 · Stand 24. Juli 2026
- 95-%-Konfidenzintervall:
- 93,8 % bis 99,2 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 139)
F1 der Klasse gemischt
97,1 %
- Referenzsatz:
- Eingefrorener handannotierter Testsplit
- Umfang:
- n = 139 · Stand 24. Juli 2026
- Kein Konfidenzintervall:
- Kein Intervall: F1 ist ein harmonisches Mittel und kein Anteil, ein Wilson-Intervall wäre hier unzulässig.
Produktions-Testfälle bestanden
39 von 40
- Referenzsatz:
- Kuratierte Produktions-Testfälle
- Umfang:
- n = 40 · Stand 24. Juli 2026
- 95-%-Konfidenzintervall:
- 87,1 % bis 99,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 40)
Volllauf auf echten Texten
End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.
Übereinstimmung mit der Sternebewertung (ein bis zwei Sterne negativ, drei neutral, vier bis fünf positiv)
93,3 %
- Referenzsatz:
- Volllauf auf öffentlichen Bewertungen, 10.09.2026
- Umfang:
- n = 6.971 · Stand 10. September 2026
- 95-%-Konfidenzintervall:
- 92,7 % bis 93,9 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 6.971)
Konfusionsmatrix
| Soll ↓ / Ist → | negativ | neutral | positiv | Summe |
|---|---|---|---|---|
| negativ | 5.032 | 172 | 115 | 5.319 |
| neutral | 80 | 1 | 26 | 107 |
| positiv | 46 | 28 | 1.471 | 1.545 |
Selbsteinschätzung
Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.
- Median:
- 0,94
- im obersten Zehntel:
- 63,5 %
- unter 0,5:
- 3,5 %
- Referenzsatz:
- Volllauf auf öffentlichen Bewertungen, 10.09.2026
- Umfang:
- n = 6.859 · Stand 10. September 2026
Kalibrierung
Temperatur-Skalierung. Die ausgegebenen Konfidenzwerte sind als Wahrscheinlichkeiten interpretierbar.
Für dieses Modell liegt kein Kalibrierungsfehler als Zahl vor.
Versionshistorie
Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.
Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.
v1.0
5. Juli 2026
v2.0
24. Juli 2026
aktuell
Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.
v2.0
24. Juli 2026Trefferquote gemischte Stimmungen (Pipeline-Kurzlauf, 400 Fälle)
Wert zurückgezogenGemessen auf einem synthetischen Referenzkorpus, den es nicht mehr gibt. Die Kennzahl sagt weiter, woran diese Version gemessen wurde; der Wert ist nicht mehr nachprüfbar.
Was sich geändert hat
- Die auf Realdaten gefundene Fehlklassen-Gruppe ist vollständig behoben: fünf von fünf Prüffällen korrekt, vorher null von fünf.
- Die Erkennung gemischter Stimmungen stieg von 39,5 auf 90,7 Prozent.
- Dokumentierte Kosten: zwei Fälle auf dem eingefrorenen Testsplit und eine leichte Neutral-Erosion. Ironie bleibt eine offene Klasse.
v1.0
5. Juli 2026Genauigkeit (eingefrorener Testsplit): 99,3 %
Was sich geändert hat
- Erstes eigenes Vier-Klassen-Modell, trainiert auf 933 handannotierten Goldens.
- Alle 40 Produktions-Testfälle bestanden.
Wie es dazu kam
Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.