Zum Inhalt springen

Ursache

Version v2.0 · 1. August 2026

Ordnet eine Nachricht einem zweistufigen deutschen Ursachen-Katalog zu: Hauptkategorie und Detailursache, seit Version 2 mit 9 Haupt- und 27 Detailkategorien. Beide Ebenen werden gemeinsam entschieden, eine unmögliche Kombination aus beiden kann deshalb nicht entstehen. Nachrichten ohne Anliegen, also reines Lob, haben seit Version 2 eine eigene Kategorie, damit Beschwerden nicht darin verschwinden.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Beschwerden fälschlich als „kein Anliegen“ eingeordnet

    6,3 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Eingefrorenes Gegenprüfset, Teilmenge öffentlicher Bewertungen
    Umfang:
    n = 160 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    3,4 % bis 11,1 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 160)
  • Beschwerden fälschlich als „kein Anliegen“ eingeordnet, Teilmenge gewöhnlicher Beschwerden

    3,5 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Eingefrorenes Gegenprüfset, Teilmenge gewöhnlicher Beschwerden
    Umfang:
    n = 143 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    1,5 % bis 7,9 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 143)
  • Lob korrekt als „kein Anliegen“ erkannt

    82,3 %

    Referenzsatz:
    Eingefrorenes Lob-Prüfset
    Umfang:
    n = 147 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    75,3 % bis 87,6 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 147)
  • Detailursache unverändert gegenüber der Vorversion

    94,4 %

    Referenzsatz:
    Nicht-Regressions-Satz der Vorversion
    Umfang:
    n = 107 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    88,3 % bis 97,4 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 107)
  • Produktions-Testfälle bestanden

    40 von 40

    Referenzsatz:
    Kuratierte Produktions-Testfälle
    Umfang:
    n = 40 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    91,2 % bis 100,0 % (Wilson, 95 %, auf den gezählten Fällen, n = 40)
  • Unmögliche Kombinationen aus Haupt- und Detailkategorie

    0 von 502

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Alle Vorhersagen der Abnahmemessung, alle Prüfsets zusammen
    Umfang:
    n = 502 · Stand 1. August 2026
    95-%-Konfidenzintervall:
    0,0 % bis 0,8 % (Wilson, 95 %, auf den gezählten Fällen, n = 502)
  • Beschwerden fälschlich als „kein Anliegen“ eingeordnet, Teilmenge Lob mit Mangel

    29,4 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Gegenprüfset, Teilmenge von Texten mit Lob und Mangel zugleich
    Umfang:
    n = 17 · Stand 2. August 2026
    95-%-Konfidenzintervall:
    13,3 % bis 53,1 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 17)

Volllauf auf echten Texten

End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

  • Anteil ohne spezifische Ursache

    3,6 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Volllauf 10.09.2026, Teilmenge mit Ursachen-Urteil
    Umfang:
    n = 6.859 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    3,2 % bis 4,1 % (Wilson, 95 %, auf einer Teilmenge des Referenzsatzes, n = 6.859)
  • Belegte Ursachen des Katalogs

    27 von 28

    Referenzsatz:
    Ursachenkatalog
    Umfang:
    n = 28 · Stand 10. September 2026
    Kein Konfidenzintervall:
    Kein Intervall: der Referenzsatz ist ein Katalog, keine Stichprobe.

Selbsteinschätzung

Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.

Median:
0,61
im obersten Zehntel:
23,0 %
unter 0,5:
39,5 %
Referenzsatz:
Volllauf auf öffentlichen Bewertungen, 10.09.2026
Umfang:
n = 6.859 · Stand 10. September 2026

Kalibrierung

Je Katalogebene eine eigene Temperatur. Beide Ebenen sind einzeln kalibriert, und jede Ebene hat ihren eigenen Kalibrierungsfehler.

Kalibrierungsfehler Hauptkategorie (ECE)
0,0143
Kalibrierungsfehler Detailursache (ECE)
0,0348

Niedriger ist besser: der ECE misst, wie weit die ausgegebene Konfidenz von der tatsächlichen Trefferquote abweicht.

Für dieses Modell ist keine Kalibrierungs-Grenze beschlossen. Die beiden Kalibrierungsfehler werden berichtet, nicht gegen eine Grenze geprüft.

Versionshistorie

Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.

Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.

  1. v1.1

    22. März 2026

  2. v2.0

    1. August 2026

    aktuell

Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.

  • v2.0

    1. August 2026

    Beschwerden fälschlich als „kein Anliegen“ eingeordnet: 6,3 %Fehlerrate

    Was sich geändert hat

    • Der Katalog ist um zwei Kategorien gewachsen: Nachrichten ohne Anliegen, also reines Lob, und Verbandspolitik.
    • Beschwerden, die fälschlich als reines Lob eingeordnet wurden, sanken von 13,8 auf 6,3 Prozent; bei gewöhnlichen Beschwerden von 9,1 auf 3,5 Prozent.
    • Haupt- und Detailkategorie werden gemeinsam entschieden statt getrennt und nachträglich abgeglichen. Unmögliche Kombinationen sind damit ausgeschlossen.
    • Der veröffentlichte Trainingsstand wurde nach einer vorab festgelegten Regel ausgewählt, auf einem eigenen Satz, der von allen Prüfsets getrennt ist.
  • v1.1

    22. März 2026

    Produktions-Testfälle

    Was sich geändert hat

    • Nachschärfung der Erstversion. Seither unverändert im Einsatz.