Risiko
Version v6.1 · 6. August 2026
Gibt einen kalibrierten Risiko-Score zwischen 0 und 1 aus, dazu eine Stufe, und kein einfaches Label. Seit Version 6.1 erhalten kurze Schmähungen keine kritische Stufe mehr; die Stufenschwellen wurden dafür blind auf dem Validierungssplit neu abgeleitet.
Messungen
Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.
Modell-Ebene
Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
Anteil kritischer Einstufungen auf öffentlichen Bewertungen
2,3 %
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Eingefrorene Auswertung öffentlicher Bewertungen
- Umfang:
- n = 172 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 0,9 % bis 5,8 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 172)
Kurze Schmähungen fälschlich kritisch eingestuft
0 von 54
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Kohorte kurzer Schmähungen (Teilmenge der eingefrorenen Auswertung)
- Umfang:
- n = 54 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 0,0 % bis 6,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 54)
Kurz-Schmaehungen faelschlich hoch eingestuft (Ziel hoechstens 10 Prozent)
8 von 54, 14,8 Prozent
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Kohorte kurzer Schmähungen (Teilmenge der eingefrorenen Auswertung)
- Umfang:
- n = 54 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 7,7 % bis 26,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 54)
Notlagen als hoch oder kritisch erkannt (Ziel mindestens 80 Prozent)
13 von 19, 68,4 Prozent
- Referenzsatz:
- Notlagen-Kohorte (Teilmenge der eingefrorenen Auswertung)
- Umfang:
- n = 19 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 46,0 % bis 84,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 19)
Anteil hoher und kritischer Einstufungen (Zielband 12 bis 33 Prozent)
34,9 %
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Eingefrorene Auswertung öffentlicher Bewertungen
- Umfang:
- n = 172 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 28,2 % bis 42,3 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 172)
Genauigkeit
89,6 %
- Referenzsatz:
- Eingefrorener Goldens-Testsplit
- Umfang:
- n = 77 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 80,8 % bis 94,6 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 77)
Kritische Fälle erkannt
19 von 19
- Referenzsatz:
- Eingefrorener Goldens-Testsplit
- Umfang:
- n = 77 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 83,2 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 19)
Lob-Kohorte fälschlich hoch oder kritisch eingestuft
0 von 62
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Kuratierte Lob-Kohorte aus Realdaten
- Umfang:
- n = 62 · Stand 6. August 2026
- 95-%-Konfidenzintervall:
- 0,0 % bis 5,8 % (Wilson, 95 %, auf den gezählten Fällen, n = 62)
Produktions-Testfälle bestanden
24 von 25
Risiko-Modell v5.0Gemessen am Vorgängermodell v5.0. Version 6.1 ist seit dem 06.08.2026 ausgeliefert; die Zahl beschreibt den Stand davor und ist mit den Zeilen darüber nicht vergleichbar.
- Referenzsatz:
- Kuratierte Produktions-Testfälle
- Umfang:
- n = 25 · Stand 14. Juli 2026
- 95-%-Konfidenzintervall:
- 80,5 % bis 99,3 % (Wilson, 95 %, auf den gezählten Fällen, n = 25)
Volllauf auf echten Texten
End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.
Anteil „niedrig“ bei Bewertungen mit fünf Sternen
91,7 %
- Referenzsatz:
- Volllauf 10.09.2026, Teilmenge der Bewertungen mit fünf Sternen
- Umfang:
- n = 1.448 · Stand 10. September 2026
- 95-%-Konfidenzintervall:
- 90,2 % bis 93,0 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.448)
Werte je Stufe der Sternebewertung Sternebewertung n Anteil 1 Sterne 5.011 0,9 % 2 Sterne 308 1,6 % 3 Sterne 107 6,5 % 4 Sterne 97 46,4 % 5 Sterne 1.448 91,7 % Monoton steigendDer Anteil ist auf jeder höheren Stufe mindestens so groß wie auf der darunter.
Anteil „hoch“ oder „kritisch“ bei Bewertungen mit einem Stern
64,6 %
- Referenzsatz:
- Volllauf 10.09.2026, Teilmenge der Bewertungen mit einem Stern
- Umfang:
- n = 5.011 · Stand 10. September 2026
- 95-%-Konfidenzintervall:
- 63,3 % bis 65,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.011)
Werte je Stufe der Sternebewertung Sternebewertung n Anteil 1 Sterne 5.011 64,6 % 2 Sterne 308 51 % 3 Sterne 107 32,7 % 4 Sterne 97 12,4 % 5 Sterne 1.448 1 % Monoton fallendDer Anteil ist auf jeder höheren Stufe höchstens so groß wie auf der darunter.
Selbsteinschätzung
Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.
- Median:
- 0,80
- im obersten Zehntel:
- 31,8 %
- unter 0,5:
- 22,1 %
- Referenzsatz:
- Volllauf auf öffentlichen Bewertungen, 10.09.2026
- Umfang:
- n = 6.971 · Stand 10. September 2026
Kalibrierung
Beta-Kalibrierung über eine monotone Kurve. Der Out-of-sample-Wert liegt unter dem der Vorgängerversion.
Kalibrierungsfehler (ECE)
0,0455
Niedriger ist besser: der ECE misst, wie weit die ausgegebene Konfidenz von der tatsächlichen Trefferquote abweicht.
Für dieses Modell ist keine Kalibrierungs-Grenze beschlossen. Der Kalibrierungsfehler wird berichtet, nicht gegen eine Grenze geprüft.
Versionshistorie
Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.
Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.
v4
5. Juli 2026
v5.0
14. Juli 2026
v6.1
6. August 2026
aktuell
Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.
v6.1
6. August 2026Anteil kritischer Einstufungen auf öffentlichen Bewertungen: 2,3 %Fehlerrate
Was sich geändert hat
- Anteil kritischer Einstufungen auf öffentlichen Bewertungen von 20,3 auf 2,3 Prozent gesenkt.
- Kurze Schmähungen erhalten keine kritische Stufe mehr (vorher 19 von 54).
- Notlagen-Erkennung von 63 auf 68,4 Prozent verbessert.
- Stufenschwellen blind auf dem Validierungssplit neu abgeleitet (0,90/0,63/0,22 statt 0,86/0,65/0,30).
- Kalibrierungsfehler von 0,0507 auf 0,0455 verbessert; Goldens-Genauigkeit und kritische Erkennung unverändert.
- Veröffentlicht mit drei offen verfehlten Zielmarken: hohe Stufe bei kurzen Schmähungen 14,8 statt höchstens 10 Prozent, Notlagen 68,4 statt mindestens 80 Prozent, Anteil hoch und kritisch 34,9 statt höchstens 33 Prozent. Alle drei stehen als eigene Messzeilen.
v5.0
14. Juli 2026Lob fälschlich hoch oder kritisch
Was sich geändert hat
- Lob-Pathologie im Modell behoben, vorher bis zu 0,97 Risiko auf reinem Lob.
- Zwei Übergangs-Krücken im Laufzeit-Code zurückgebaut: eine Sonder-Schwelle und ein Stimmungs-Gate.
- Goldens-Genauigkeit stabil, kritische Erkennung 19 von 19.
v4
5. Juli 2026Kalibrierungsfehler (ECE)Fehlerrate
Was sich geändert hat
- Glatte Beta-Kalibrierung ersetzt Isotonic, das Plateau-Problem ist behoben.
- Bekannte Schwäche dokumentiert: Überschätzung auf reinem Lob. Sie führte zu Version 5.
Wie es dazu kam
Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.