Zum Inhalt springen

Thema

Version v2.0 · 3. August 2026

Ordnet Nachrichten Themenfeldern zu, etwa Pannenhilfe, Mitgliedschaft oder Versicherung, samt Detailthemen. Nachrichten mit mehreren Themen erhalten ein Haupt- und ein Nebenthema.

Messungen

Der waagerechte Balken ist die Konfidenzspanne, der senkrechte Strich der Messwert. Die Skala läuft von 0 bis 100 Prozent; eine breite Spanne kommt von einer kleinen Stichprobe.

Modell-Ebene

Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.

  • Themenzuordnung auf öffentlichen Bewertungen

    75,8 %

    Referenzsatz:
    Eingefrorene Auswertung öffentlicher Bewertungen
    Umfang:
    n = 182 · Stand 3. August 2026
    95-%-Konfidenzintervall:
    69,1 % bis 81,4 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 182)
  • Kuratierte Testfälle bestanden

    91,8 %

    Gemessen am Themenmodell v1.1Gemessen am Vorgängermodell auf einem leichteren, kuratierten Referenzsatz. Das Nachfolgemodell v2.0 ist auf öffentlichen Bewertungen geprüft, das ist die Zeile darüber; die beiden Zahlen sind nicht vergleichbar.

    Referenzsatz:
    Kuratierte Testfälle
    Umfang:
    n = 122 · Stand 11. März 2026
    95-%-Konfidenzintervall:
    85,6 % bis 95,5 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 122)

Volllauf auf echten Texten

End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

  • Anteil ohne zuordenbares Thema

    1,2 %

    FehlerrateNiedriger ist besser, null ist das beste Ergebnis. Die Obergrenze des Intervalls ist die vorsichtige Lesart.

    Referenzsatz:
    Volllauf auf öffentlichen Bewertungen, 10.09.2026
    Umfang:
    n = 6.971 · Stand 10. September 2026
    95-%-Konfidenzintervall:
    0,9 % bis 1,4 % (Wilson, 95 %, auf dem vollen Referenzsatz, n = 6.971)
  • Belegte Klassen des Themenkatalogs

    12 von 12

    Referenzsatz:
    Themenkatalog
    Umfang:
    n = 12 · Stand 10. September 2026
    Kein Konfidenzintervall:
    Kein Intervall: der Referenzsatz ist ein Katalog, keine Stichprobe.

Selbsteinschätzung

Zu jedem Urteil gibt das Modell an, wie sicher es sich ist. Die Verteilung zeigt, wie oft es welche Sicherheit angibt — nicht, wie oft es recht hat.

Median:
0,90
im obersten Zehntel:
52,1 %
unter 0,5:
4,4 %
Referenzsatz:
Volllauf auf öffentlichen Bewertungen, 10.09.2026
Umfang:
n = 6.971 · Stand 10. September 2026

Kalibrierung

Temperatur-Skalierung.

Für dieses Modell liegt kein Kalibrierungsfehler als Zahl vor.

Versionshistorie

Die Kernmetrik einer Version nennt weder Referenzsatz noch Umfang; sie sagt, woran diese Version gemessen wurde.

Die Zahlen dieses Laufs stehen auf öffentlichen Bewertungen zum Verband, keine Kundennachrichten, und ihre Referenz sind die Metadaten der Bewertungsplattform. Die Zeilen darunter stammen aus kuratierten Prüfsätzen der Modellentwicklung — ein anderer Satz Texte, also ein anderer Maßstab. Jede Zahl gilt für ihren eigenen Satz und ist mit den anderen nur eingeschränkt vergleichbar.

  1. v1.0

    11. März 2026

  2. v1.1

    11. März 2026

  3. v2.0

    3. August 2026

    aktuell

Die Kernmetrik wechselt zwischen den Versionen: mal eine Zählung, mal ein Anteil, beim Risiko-Modell die Richtung. Eine gemeinsame Achse haben sie nicht.

  • v2.0

    3. August 2026

    Themenzuordnung auf öffentlichen Bewertungen: 75,8 %

    Was sich geändert hat

    • Zwölftes Themenfeld für verbandspolitische Rückmeldungen ergänzt.
    • Erstmals mit öffentlichen Bewertungen trainiert und auf einer eingefrorenen Realdaten-Auswertung geprüft; die Fehlzuordnung von Geldbeträgen zum Themenfeld Finanzen ist von 11,1 auf 1,2 Prozent gefallen.
    • Größeres Textfenster, 512 statt 192 Token, damit lange Nachrichten vollständig gelesen werden.
  • v1.1

    11. März 2026

    Kuratierte Testfälle: 91,8 %

    Was sich geändert hat

    • Vierte Feinabstimmungsphase: 112 von 122 kuratierten Testfällen bestanden.
  • v1.0

    11. März 2026

    Erstversion

    Was sich geändert hat

    • Erstes eigenes Themenmodell, trainiert und kalibriert.