Schweregrad
Version v2.4 · 4. August 2026
Stuft eine Nachricht in vier Schweregrade ein, von niedrig bis kritisch, und gibt zusätzlich einen kalibrierten Score aus. Seit Version 2.4 misst das Modell den Handlungsbedarf aus dem Anliegen statt der Dramatik des Ereignisses; Lob und Dank erreichen die oberen Stufen nicht mehr. Kritische Sicherheits- und Rechtsfälle bilden eine eigene Pflicht-Testklasse.
Messungen
Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.
Modell-Ebene
Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
Lob und Dank fälschlich hoch oder kritisch eingestuft
0 von 28
FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.
- Referenzsatz:
- Lob- und Dank-Kohorte der eingefrorenen Auswertung
- Umfang:
- n = 28 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 0,0 % bis 12,1 % (Wilson, 95 %, auf den gezählten Fällen, n = 28)
Einstufung auf öffentlichen Bewertungen
64,3 %
- Referenzsatz:
- Eingefrorene Auswertung öffentlicher Bewertungen
- Umfang:
- n = 171 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 56,9 % bis 71,1 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 171)
Sichtbare Langtext-Signale erkannt
24 von 24
- Referenzsatz:
- Langtext-Evalset, kuratiert und held-out
- Umfang:
- n = 50 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 86,2 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 24)
Fehlalarm-Kontrollen bestanden, signalfreie Langtexte
6 von 6, keine kritisch-Fehlalarme
- Referenzsatz:
- Langtext-Evalset, kuratiert und held-out
- Umfang:
- n = 50 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 61 % bis 100 % (Wilson, 95 %, auf den gezählten Fällen, n = 6)
Genauigkeit auf dem eingefrorenen Testsplit
95,2 %
- Referenzsatz:
- Eingefrorener Testsplit
- Umfang:
- n = 312 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 92,2 % bis 97,1 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 312)
Kritische Pflichtfälle erkannt
7 von 7
- Referenzsatz:
- Kuratierte Produktions-Testfälle
- Umfang:
- n = 30 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 64,6 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 7)
Produktions-Testfälle des Altbestands bestanden (Latte 18 von 20 verfehlt)
17 von 20
- Referenzsatz:
- Produktions-Testfälle des Altbestands
- Umfang:
- n = 20 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 64,0 % bis 94,8 % (Wilson, 95 %, auf den gezählten Fällen, n = 20)
Lob mit dramatischer Vorgeschichte höchstens mittel eingestuft (Zielmarke verfehlt)
2 von 3
- Referenzsatz:
- Kuratierte Fälle „Lob mit Drama“
- Umfang:
- n = 3 · Stand 4. August 2026
- 95-%-Konfidenzintervall:
- 20,8 % bis 93,9 % (Wilson, 95 %, auf den gezählten Fällen, n = 3)
Volllauf auf echten Texten
End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.
Anteil „niedrig“ bei Bewertungen mit fünf Sternen
90,5 %
- Referenzsatz:
- Volllauf 10.09.2026, Teilmenge der Bewertungen mit fünf Sternen
- Umfang:
- n = 1.448 · Stand 10. September 2026
- 95-%-Konfidenzintervall:
- 88,9 % bis 91,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.448)
Werte je Stufe der Sternebewertung Sternebewertung n Anteil 1 Sterne 5.011 2,9 % 2 Sterne 308 2,9 % 3 Sterne 107 12,1 % 4 Sterne 97 60,8 % 5 Sterne 1.448 90,5 % Monoton steigendDer Anteil ist auf jeder höheren Stufe mindestens so groß wie auf der darunter.
Anteil „hoch“ oder „kritisch“ bei Bewertungen mit einem Stern
36,6 %
- Referenzsatz:
- Volllauf 10.09.2026, Teilmenge der Bewertungen mit einem Stern
- Umfang:
- n = 5.011 · Stand 10. September 2026
- 95-%-Konfidenzintervall:
- 35,3 % bis 37,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.011)
Werte je Stufe der Sternebewertung Sternebewertung n Anteil 1 Sterne 5.011 36,6 % 2 Sterne 308 16,6 % 3 Sterne 107 4,7 % 4 Sterne 97 2,1 % 5 Sterne 1.448 1,2 % Monoton fallendDer Anteil ist auf jeder höheren Stufe höchstens so groß wie auf der darunter.
Die Degradationsrate ist eine untere Schranke.
Der Schweregrad meldet einen Ausfall im Ergebnis nicht, weder als Marke noch über eine fehlende Modellversion. Jede Degradationszahl ist deshalb eine untere Schranke.
Selbsteinschätzung
Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.
- Median:
- 0,88
- im obersten Zehntel:
- 44,8 %
- unter 0,5:
- 14,6 %
- Referenzsatz:
- Volllauf auf öffentlichen Bewertungen, 10.09.2026
- Umfang:
- n = 6.971 · Stand 10. September 2026
Kalibrierung
Beta-Kalibrierung über eine monotone Kurve. Der Out-of-sample-Wert liegt unter dem gesetzten Gate.
Kalibrierungsfehler (ECE)
0,0184
Niedriger ist besser: der ECE misst, wie weit die ausgegebene Konfidenz von der tatsächlichen Trefferquote abweicht.
Gate: höchstens 0,05Der gemessene Kalibrierungsfehler liegt unter der gesetzten Grenze.
Versionshistorie
Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.
v2.1
vor 2026-07
v2.2
6. Juli 2026
v2.3
13. Juli 2026
v2.4
4. August 2026
aktuell
Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.
v2.4
4. August 2026Lob und Dank fälschlich hoch oder kritisch
Was sich geändert hat
- Zielgröße umgestellt: gemessen wird der Handlungsbedarf aus dem Anliegen, nicht die Dramatik des Ereignisses.
- Lob und Dank erreichen die oberen Stufen nicht mehr (vorher zweimal kritisch, einmal hoch von 28).
- Falsch-kritische Einstufungen niedriger Fälle von 6 auf 0, falsch-hohe von 10 auf 1 (eingefrorene Auswertung, 171 Bewertungen).
- Einstufungs-Genauigkeit auf öffentlichen Bewertungen von 33,9 auf 64,3 Prozent.
- Veröffentlicht mit zwei offenen Abweichungen: ein neutraler Sachbericht bleibt eine Stufe zu hoch, Altbestands-Testfälle 17 von 20 statt 18.
v2.3
13. Juli 2026Sichtbare Langtext-Signale
Was sich geändert hat
- Langtext-Blindstelle geschlossen: Jedes im Analysefenster sichtbare Signal wird erkannt, vorher 18 von 36.
- Fehlalarme auf signalfreien Langtexten von 2 auf 0.
- Die Kurztext-Genauigkeit stieg gleichzeitig von 91,4 auf 95,0 Prozent.
v2.2
6. Juli 2026Sichtbare Langtext-Signale (Box-Referenzmessung)
Was sich geändert hat
- Analysefenster von 192 auf 512 Token vergrössert, erste Langtext-Trainingsrunde.
- Langtexte blieben teilweise blind. Die Messreihe dazu führte zu Version 2.3.
v2.1
Zeitraum vor 2026-07Genauigkeit (Pipeline-Referenzlauf 2026-07-06)
Wert zurückgezogenGemessen auf einem synthetischen Referenzkorpus, den es nicht mehr gibt. Die Kennzahl sagt weiter, woran diese Version gemessen wurde; der Wert ist nicht mehr nachprüfbar.
Was sich geändert hat
- Basisversion der aktuellen Reihe. Die Langtext-Schwäche ist dokumentiert: sehr lange Nachrichten 51 Prozent.
Wie es dazu kam
Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.
- Schweregrad: der blinde Fleck in langen Nachrichten
13. Juli 2026