Zum Inhalt springen

Risiko

Version v6.1 · 6. August 2026

Gibt einen kalibrierten Risiko-Score zwischen 0 und 1 aus, dazu eine Stufe, und kein einfaches Label. Seit Version 6.1 erhalten kurze Schmähungen keine kritische Stufe mehr; die Stufenschwellen wurden dafür blind auf dem Validierungssplit neu abgeleitet.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Anteil kritischer Einstufungen auf öffentlichen Bewertungen

    2,3 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Eingefrorene Auswertung öffentlicher Bewertungen
    Umfang:
    n = 172 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    0,9 % bis 5,8 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 172)
  • Kurze Schmähungen fälschlich kritisch eingestuft

    0 von 54

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Kohorte kurzer Schmähungen (Teilmenge der eingefrorenen Auswertung)
    Umfang:
    n = 54 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    0,0 % bis 6,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 54)
  • Kurz-Schmaehungen faelschlich hoch eingestuft (Ziel hoechstens 10 Prozent)

    8 von 54, 14,8 Prozent

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Kohorte kurzer Schmähungen (Teilmenge der eingefrorenen Auswertung)
    Umfang:
    n = 54 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    7,7 % bis 26,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 54)
  • Notlagen als hoch oder kritisch erkannt (Ziel mindestens 80 Prozent)

    13 von 19, 68,4 Prozent

    Referenzsatz:
    Notlagen-Kohorte (Teilmenge der eingefrorenen Auswertung)
    Umfang:
    n = 19 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    46,0 % bis 84,6 % (Wilson, 95 %, auf den gezählten Fällen, n = 19)
  • Anteil hoher und kritischer Einstufungen (Zielband 12 bis 33 Prozent)

    34,9 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Eingefrorene Auswertung öffentlicher Bewertungen
    Umfang:
    n = 172 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    28,2 % bis 42,3 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 172)
  • Genauigkeit

    89,6 %

    Referenzsatz:
    Eingefrorener Goldens-Testsplit
    Umfang:
    n = 77 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    80,8 % bis 94,6 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 77)
  • Kritische Fälle erkannt

    19 von 19

    Referenzsatz:
    Eingefrorener Goldens-Testsplit
    Umfang:
    n = 77 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    83,2 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 19)
  • Lob-Kohorte fälschlich hoch oder kritisch eingestuft

    0 von 62

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Kuratierte Lob-Kohorte aus Realdaten
    Umfang:
    n = 62 · Stand 6. August 2026
    95-%-Konfidenzintervall:
    0,0 % bis 5,8 % (Wilson, 95 %, auf den gezählten Fällen, n = 62)
  • Produktions-Testfälle bestanden

    24 von 25

    Risiko-Modell v5.0Gemessen am Vorgängermodell v5.0. Version 6.1 ist seit dem 06.08.2026 ausgeliefert; die Zahl beschreibt den Stand davor und ist mit den Zeilen darüber nicht vergleichbar.

    Referenzsatz:
    Kuratierte Produktions-Testfälle
    Umfang:
    n = 25 · Stand 14. Juli 2026
    95-%-Konfidenzintervall:
    80,5 % bis 99,3 % (Wilson, 95 %, auf den gezählten Fällen, n = 25)

Volllauf auf echten Texten

End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

  • Anteil „niedrig“ bei Bewertungen mit fünf Sternen

    91,7 %

    Referenzsatz:
    Volllauf 10.09.2026, Teilmenge der Bewertungen mit fünf Sternen
    Umfang:
    n = 1.448 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    90,2 % bis 93,0 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.448)
    Werte je Stufe der Sternebewertung
    SternebewertungnAnteil
    1 Sterne5.0110,9 %
    2 Sterne3081,6 %
    3 Sterne1076,5 %
    4 Sterne9746,4 %
    5 Sterne1.44891,7 %

    Monoton steigendDer Anteil ist auf jeder höheren Stufe mindestens so groß wie auf der darunter.

  • Anteil „hoch“ oder „kritisch“ bei Bewertungen mit einem Stern

    64,6 %

    Referenzsatz:
    Volllauf 10.09.2026, Teilmenge der Bewertungen mit einem Stern
    Umfang:
    n = 5.011 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    63,3 % bis 65,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.011)
    Werte je Stufe der Sternebewertung
    SternebewertungnAnteil
    1 Sterne5.01164,6 %
    2 Sterne30851 %
    3 Sterne10732,7 %
    4 Sterne9712,4 %
    5 Sterne1.4481 %

    Monoton fallendDer Anteil ist auf jeder höheren Stufe höchstens so groß wie auf der darunter.

Selbsteinschätzung

Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.

Median:
0,80
im obersten Zehntel:
31,8 %
unter 0,5:
22,1 %
Referenzsatz:
Volllauf auf öffentlichen Bewertungen, 10.09.2026
Umfang:
n = 6.971 · Stand 10. September 2026

Kalibrierung

Beta-Kalibrierung über eine monotone Kurve. Der Out-of-sample-Wert liegt unter dem der Vorgängerversion.

Kalibrierungsfehler (ECE)

0,0455

Niedriger ist besser: der ECE misst, wie weit die ausgegebene Konfidenz von der tatsächlichen Trefferquote abweicht.

Für dieses Modell ist keine Kalibrierungs-Grenze beschlossen. Der Kalibrierungsfehler wird berichtet, nicht gegen eine Grenze geprüft.

Versionshistorie

Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.

Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.

  1. v4

    5. Juli 2026

  2. v5.0

    14. Juli 2026

  3. v6.1

    6. August 2026

    aktuell

Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.

  • v6.1

    6. August 2026

    Anteil kritischer Einstufungen auf öffentlichen Bewertungen: 2,3 %Fehlerrate

    Was sich geändert hat

    • Anteil kritischer Einstufungen auf öffentlichen Bewertungen von 20,3 auf 2,3 Prozent gesenkt.
    • Kurze Schmähungen erhalten keine kritische Stufe mehr (vorher 19 von 54).
    • Notlagen-Erkennung von 63 auf 68,4 Prozent verbessert.
    • Stufenschwellen blind auf dem Validierungssplit neu abgeleitet (0,90/0,63/0,22 statt 0,86/0,65/0,30).
    • Kalibrierungsfehler von 0,0507 auf 0,0455 verbessert; Goldens-Genauigkeit und kritische Erkennung unverändert.
    • Veröffentlicht mit drei offen verfehlten Zielmarken: hohe Stufe bei kurzen Schmähungen 14,8 statt höchstens 10 Prozent, Notlagen 68,4 statt mindestens 80 Prozent, Anteil hoch und kritisch 34,9 statt höchstens 33 Prozent. Alle drei stehen als eigene Messzeilen.
  • v5.0

    14. Juli 2026

    Lob fälschlich hoch oder kritisch

    Was sich geändert hat

    • Lob-Pathologie im Modell behoben, vorher bis zu 0,97 Risiko auf reinem Lob.
    • Zwei Übergangs-Krücken im Laufzeit-Code zurückgebaut: eine Sonder-Schwelle und ein Stimmungs-Gate.
    • Goldens-Genauigkeit stabil, kritische Erkennung 19 von 19.
  • v4

    5. Juli 2026

    Kalibrierungsfehler (ECE)Fehlerrate

    Was sich geändert hat

    • Glatte Beta-Kalibrierung ersetzt Isotonic, das Plateau-Problem ist behoben.
    • Bekannte Schwäche dokumentiert: Überschätzung auf reinem Lob. Sie führte zu Version 5.

Wie es dazu kam

Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.