Prüfstände

Zahlen statt Adjektive. Zu jedem Produkt ein Benchmark.

Zu jedem Produkt gehört ein Prüfstand oder ein Benchmark. Aufgaben, Musterlösungen und Auswertungen sind dokumentiert; Lizenznehmer können sämtliche Läufe eigenständig nachvollziehen.

/ 01 — StatikBench

Der deutschsprachige Benchmark für Baunormen und Tragwerksbemessung.

statikbench.de ↗

StatikBench misst, wie Sprachmodelle normbasierte Tragwerksbemessung nach DIN, Eurocode-Anhängen, ÖNORM und SIA beherrschen: 5.888 Aufgaben in vier Bereichen und elf Subtracks, 43.480 Lösungsfelder, vollständig synthetisch und seed-reproduzierbar. Normen werden referenziert, nie im Wortlaut wiedergegeben.

Jede Musterlösung wird deterministisch berechnet, gegen analytische Anker geprüft und feldweise mit SOFiSTiK in zwei Programmfassungen (2024 und 2026) gegengerechnet; die Balkenstatik zusätzlich mit zwei unabhängigen Open-Source-Rechenkernen. 2.821 Lösungsfelder sind durch SOFiSTiK bestätigt.

138 Negativ-Items, in denen eine zur Lösung nötige Angabe fehlt, ergeben die Halluzinationsrate: Ein Modell, das dort Zahlen liefert, erfindet Lastannahmen. Version 0.4 ist kostenpflichtig lizenziert; Zugang und Lizenzklassen auf statikbench.de.

Aufgaben5.888 in 4 Bereichen, 11 Subtracks
Lösungsfelder43.480
GeltungDE, AT, CH (DIN, Eurocode-NA, ÖNORM, SIA)
BereicheLastannahmen, Balkenstatik, statisch unbestimmte Durchlaufträger, Bemessung (EC2, EC3, EC5)
VerifikationAnalytische Anker, PyNite und anaStruct, SOFiSTiK 2024 und 2026 (2.821 Felder bestätigt, Median-Abweichung 0,0002 %)
MetrikenFeldgenauigkeit, Halluzinationsrate, Verify-Catch, Antwortzeit, Formatstabilität
Version0.4, kostenpflichtig lizenziert; Datensatz auf Hugging Face per Zugangsanfrage
5.888Aufgaben nach Baunormen aus DE, AT und CH
43.480Lösungsfelder mit Musterlösung
2.821Felder durch SOFiSTiK bestätigt, zwei Programmfassungen
138Negativ-Items für die Halluzinationsmessung

SOFiSTiK ist eine Marke der SOFiSTiK AG; PyNite und anaStruct sind Projekte ihrer jeweiligen Inhaber. Die Nennung beschreibt die zur unabhängigen Gegenrechnung eingesetzte Software; eine geschäftliche Verbindung besteht nicht. StatikBench ist ein Messinstrument für Sprachmodelle, keine Grundlage für Tragwerksplanung an realen Bauwerken.

/ 02 — BelegBench

Der offene Benchmark für Belege aus CH, DE und AT.

Hugging Face ↗

BelegBench ist der Benchmark hinter Belegant und German-OCR: 10.002 synthetische Belege aus der Schweiz (QR-Rechnungen in Deutsch, Französisch und Italienisch), Deutschland (Rechnungen nach § 14 UStG, GiroCode) und Österreich (Rechnungen nach § 11 UStG). Jeder Beleg hat eine vollständige, arithmetisch konsistente Ground Truth, prüfsummenkorrekte Kennungen und echte, scannbare QR-Codes.

Rund ein Viertel der Belege ist mit Scan-Degradation versehen. Bewertet wird feldweise; leere Felder müssen leer bleiben. Der Datensatz ist unter Apache 2.0 veröffentlicht.

Belege10.002 in Version 2 (August 2026); je 3.334 für CH, DE und AT
SprachenDeutsch, Französisch, Italienisch
BelegartenRechnung, Gutschrift, Kleinbetragsrechnung
QR-Codes72 % (CH), 38 % (DE), 43 % (AT), scannbar
LizenzApache 2.0, Hugging Face keyvan-ai/belegbench

/ 03 — E-Rechnungs-Prüfstand

XRechnung und ZUGFeRD prüfen, kostenlos.

german-ocr.de ↗

Der Prüfstand nimmt eingehende E-Rechnungen entgegen und prüft sie auf Formatkonformität. Bei ZUGFeRD gleicht er zusätzlich das sichtbare PDF mit dem eingebetteten XML ab: Beträge, Positionen und Steuersätze müssen übereinstimmen.

Der Prüfstand ist kostenlos und wird unter German-OCR betrieben. Er dient zugleich als Referenz für German-OCR: Was aus dem PDF gelesen wird, muss zum XML passen.

FormateXRechnung, ZUGFeRD
PrüfungFormatkonformität, Abgleich PDF gegen eingebettetes XML
Kosten0 €
BetriebUnter German-OCR, Server in Deutschland

/ 04 — Einblick

Der E-Rechnungs-Prüfstand im Betrieb.

demo.german-ocr.de
Zugang auf Anfrage

XRechnung mit Summenfehler: Befund mit Regelverweis, jede gelesene Angabe im Dokument markiert
XRechnung mit Summenfehler: Befund mit Regelverweis, jede gelesene Angabe im Dokument markiert

/ 05 — Methodik

Wie gemessen wird.

01

Musterlösung aus dem Rechenkern

Die Referenz kommt nicht aus einem Sprachmodell, sondern aus deterministischer Berechnung oder aus dem Beleg selbst. Wo möglich, wird mit unabhängiger Software gegengerechnet.

02

Feld statt Fließtext

Bewertet wird der Wert im Lösungsfeld, nicht die Formulierung. Fehlende Angaben müssen als fehlend erkannt werden; erfundene Werte zählen als Halluzination.

03

Gleiche Testmenge, gleiche Metrik

Vor und nach jeder Modellanpassung wird auf derselben Menge gemessen. In Kundenprojekten ist die Abnahme eine dokumentierte Kennzahl.

StatikBench — Fachwerk, Zug und Druck Ziehen zum Drehen ↻
DruckZug
Anfrage mit Dokumentart, Menge im Monat und Zielsystem. Sie erhalten eine fachliche Einschätzung.
Kontaktformular Demo-Umgebung German-OCR StatikBench einsehen