Zum Inhalt springen

Benchmarks

Die Howzer-Pipeline besteht aus zwölf Analyseschritten: sieben trainierte Modelle und fünf regelbasierte Engines. Sie laufen nicht einzeln, sondern in einem Durchlauf über denselben Text.

Die Zahlen stehen auf zweierlei Belegen. Die Modell-Ebene misst gegen kuratierte Referenzfälle der Modellentwicklung: wenige hundert Fälle je Modell, jeder von Menschen geprüft. Der Volllauf misst end-to-end durch die ganze Pipeline, auf öffentlichen Bewertungen, gegen das Sprachfeld und die Sternebewertung der Bewertungsplattform — Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.

Die eindrucksvollere Zahl steht oft auf der kleineren Stichprobe.

Stand 10. September 2026

Woher die Zahlen kommen

Modell-Ebene31 Zahlen · n = 3…502
Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
Pipeline-Referenzlaufkeine Zahl
End-to-end durch die vollständige Pipeline gemessen, gegen die Referenzwerte eines synthetischen deutschen Testkorpus. Den Korpus gibt es nicht mehr, und die Läufe darauf sind zurückgezogen.
Benchmark-Datensatzkeine Zahl
Reserviert für geplante Einzelmodell-Tests gegen benannte externe Datensätze.
Volllauf auf echten Texten19 Zahlen · n = 12…69.710
End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.