Benchmarks
Die Howzer-Pipeline besteht aus zwölf Analyseschritten: sieben trainierte Modelle und fünf regelbasierte Engines. Sie laufen nicht einzeln, sondern in einem Durchlauf über denselben Text.
Die Zahlen stehen auf zweierlei Belegen. Die Modell-Ebene misst gegen kuratierte Referenzfälle der Modellentwicklung: wenige hundert Fälle je Modell, jeder von Menschen geprüft. Der Volllauf misst end-to-end durch die ganze Pipeline, auf öffentlichen Bewertungen, gegen das Sprachfeld und die Sternebewertung der Bewertungsplattform — Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.
Die eindrucksvollere Zahl steht oft auf der kleineren Stichprobe.
Stand 10. September 2026
Woher die Zahlen kommen
- Modell-Ebene31 Zahlen · n = 3…502
- Handannotierte beziehungsweise kuratierte Referenzfälle der Modellentwicklung: eingefrorene Testsplits, Produktions-Testfälle, gezielt zusammengestellte Kohorten. Wenige hundert Fälle je Modell, von Menschen geprüft.
- Pipeline-Referenzlaufkeine Zahl
- End-to-end durch die vollständige Pipeline gemessen, gegen die Referenzwerte eines synthetischen deutschen Testkorpus. Den Korpus gibt es nicht mehr, und die Läufe darauf sind zurückgezogen.
- Benchmark-Datensatzkeine Zahl
- Reserviert für geplante Einzelmodell-Tests gegen benannte externe Datensätze.
- Volllauf auf echten Texten19 Zahlen · n = 12…69.710
- End-to-end durch die vollständige Pipeline, auf öffentlichen Bewertungen. Referenz sind die Metadaten der Bewertungsplattform — ihr Sprachfeld und die Sternebewertung —, also Angaben, die vor der Analyse existierten und nicht für sie erzeugt wurden.