Zum Inhalt springen

Schweregrad

Version v2.4 · 4. August 2026

Stuft eine Nachricht in vier Schweregrade ein, von niedrig bis kritisch, und gibt zusätzlich einen kalibrierten Score aus. Seit Version 2.4 misst das Modell den Handlungsbedarf aus dem Anliegen statt der Dramatik des Ereignisses; Lob und Dank erreichen die oberen Stufen nicht mehr. Kritische Sicherheits- und Rechtsfälle bilden eine eigene Pflicht-Testklasse.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Lob und Dank fälschlich hoch oder kritisch eingestuft

    0 von 28

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Lob- und Dank-Kohorte der eingefrorenen Auswertung
    Umfang:
    n = 28 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    0,0 % bis 12,1 % (Wilson, 95 %, auf den gezählten Fällen, n = 28)
  • Einstufung auf öffentlichen Bewertungen

    64,3 %

    Referenzsatz:
    Eingefrorene Auswertung öffentlicher Bewertungen
    Umfang:
    n = 171 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    56,9 % bis 71,1 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 171)
  • Sichtbare Langtext-Signale erkannt

    24 von 24

    Referenzsatz:
    Langtext-Evalset, kuratiert und held-out
    Umfang:
    n = 50 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    86,2 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 24)
  • Fehlalarm-Kontrollen bestanden, signalfreie Langtexte

    6 von 6, keine kritisch-Fehlalarme

    Referenzsatz:
    Langtext-Evalset, kuratiert und held-out
    Umfang:
    n = 50 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    61 % bis 100 % (Wilson, 95 %, auf den gezählten Fällen, n = 6)
  • Genauigkeit auf dem eingefrorenen Testsplit

    95,2 %

    Referenzsatz:
    Eingefrorener Testsplit
    Umfang:
    n = 312 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    92,2 % bis 97,1 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 312)
  • Kritische Pflichtfälle erkannt

    7 von 7

    Referenzsatz:
    Kuratierte Produktions-Testfälle
    Umfang:
    n = 30 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    64,6 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 7)
  • Produktions-Testfälle des Altbestands bestanden (Latte 18 von 20 verfehlt)

    17 von 20

    Referenzsatz:
    Produktions-Testfälle des Altbestands
    Umfang:
    n = 20 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    64,0 % bis 94,8 % (Wilson, 95 %, auf den gezählten Fällen, n = 20)
  • Lob mit dramatischer Vorgeschichte höchstens mittel eingestuft (Zielmarke verfehlt)

    2 von 3

    Referenzsatz:
    Kuratierte Fälle „Lob mit Drama“
    Umfang:
    n = 3 · Stand 4. August 2026
    95-%-Konfidenzintervall:
    20,8 % bis 93,9 % (Wilson, 95 %, auf den gezählten Fällen, n = 3)

Volllauf auf echten Texten

End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

  • Anteil „niedrig“ bei Bewertungen mit fünf Sternen

    90,5 %

    Referenzsatz:
    Volllauf 10.09.2026, Teilmenge der Bewertungen mit fünf Sternen
    Umfang:
    n = 1.448 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    88,9 % bis 91,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 1.448)
    Werte je Stufe der Sternebewertung
    SternebewertungnAnteil
    1 Sterne5.0112,9 %
    2 Sterne3082,9 %
    3 Sterne10712,1 %
    4 Sterne9760,8 %
    5 Sterne1.44890,5 %

    Monoton steigendDer Anteil ist auf jeder höheren Stufe mindestens so groß wie auf der darunter.

  • Anteil „hoch“ oder „kritisch“ bei Bewertungen mit einem Stern

    36,6 %

    Referenzsatz:
    Volllauf 10.09.2026, Teilmenge der Bewertungen mit einem Stern
    Umfang:
    n = 5.011 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    35,3 % bis 37,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 5.011)
    Werte je Stufe der Sternebewertung
    SternebewertungnAnteil
    1 Sterne5.01136,6 %
    2 Sterne30816,6 %
    3 Sterne1074,7 %
    4 Sterne972,1 %
    5 Sterne1.4481,2 %

    Monoton fallendDer Anteil ist auf jeder höheren Stufe höchstens so groß wie auf der darunter.

Die Degradationsrate ist eine untere Schranke.

Der Schweregrad meldet einen Ausfall im Ergebnis nicht, weder als Marke noch über eine fehlende Modellversion. Jede Degradationszahl ist deshalb eine untere Schranke.

Selbsteinschätzung

Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.

Median:
0,88
im obersten Zehntel:
44,8 %
unter 0,5:
14,6 %
Referenzsatz:
Volllauf auf öffentlichen Bewertungen, 10.09.2026
Umfang:
n = 6.971 · Stand 10. September 2026

Kalibrierung

Beta-Kalibrierung über eine monotone Kurve. Der Out-of-sample-Wert liegt unter dem gesetzten Gate.

Kalibrierungsfehler (ECE)

0,0184

Niedriger ist besser: der ECE misst, wie weit die ausgegebene Konfidenz von der tatsächlichen Trefferquote abweicht.

Gate: höchstens 0,05Der gemessene Kalibrierungsfehler liegt unter der gesetzten Grenze.

Versionshistorie

Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.

  1. v2.1

    vor 2026-07

  2. v2.2

    6. Juli 2026

  3. v2.3

    13. Juli 2026

  4. v2.4

    4. August 2026

    aktuell

Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.

  • v2.4

    4. August 2026

    Lob und Dank fälschlich hoch oder kritisch

    Was sich geändert hat

    • Zielgröße umgestellt: gemessen wird der Handlungsbedarf aus dem Anliegen, nicht die Dramatik des Ereignisses.
    • Lob und Dank erreichen die oberen Stufen nicht mehr (vorher zweimal kritisch, einmal hoch von 28).
    • Falsch-kritische Einstufungen niedriger Fälle von 6 auf 0, falsch-hohe von 10 auf 1 (eingefrorene Auswertung, 171 Bewertungen).
    • Einstufungs-Genauigkeit auf öffentlichen Bewertungen von 33,9 auf 64,3 Prozent.
    • Veröffentlicht mit zwei offenen Abweichungen: ein neutraler Sachbericht bleibt eine Stufe zu hoch, Altbestands-Testfälle 17 von 20 statt 18.
  • v2.3

    13. Juli 2026

    Sichtbare Langtext-Signale

    Was sich geändert hat

    • Langtext-Blindstelle geschlossen: Jedes im Analysefenster sichtbare Signal wird erkannt, vorher 18 von 36.
    • Fehlalarme auf signalfreien Langtexten von 2 auf 0.
    • Die Kurztext-Genauigkeit stieg gleichzeitig von 91,4 auf 95,0 Prozent.
  • v2.2

    6. Juli 2026

    Sichtbare Langtext-Signale (Box-Referenzmessung)

    Was sich geändert hat

    • Analysefenster von 192 auf 512 Token vergrössert, erste Langtext-Trainingsrunde.
    • Langtexte blieben teilweise blind. Die Messreihe dazu führte zu Version 2.3.
  • v2.1

    Zeitraum vor 2026-07

    Genauigkeit (Pipeline-Referenzlauf 2026-07-06)

    Wert zurückgezogenGemessen auf einem synthetischen Referenzkorpus, den es nicht mehr gibt. Die Kennzahl sagt weiter, woran diese Version gemessen wurde; der Wert ist nicht mehr nachprüfbar.

    Was sich geändert hat

    • Basisversion der aktuellen Reihe. Die Langtext-Schwäche ist dokumentiert: sehr lange Nachrichten 51 Prozent.

Wie es dazu kam

Was eine Version geändert hat, warum sie nötig war und was sie gekostet hat, steht ausführlich in den Neuigkeiten.