StatikBench ist der erste deutschsprachige Benchmark für Baunormen und normbasierte Tragwerksbemessung in Deutschland, Österreich und der Schweiz. Version 0.4 vergrößert den Prüfumfang auf 5.888 Aufgaben in elf Subtracks mit insgesamt 43.480 Lösungsfeldern. Alle Aufgaben sind zu 100 Prozent synthetisch erzeugt und mit festen Seeds reproduzierbar; Normen werden referenziert, nie im Wortlaut wiedergegeben.
Vier Bereiche, elf Subtracks
Der Bereich Lastannahmen deckt Wind nach EC1-1-4/NA, Schnee nach EC1-1-3/NA und Erdbeben nach EC8/NA ab, mit 320 Aufgaben für Deutschland. Balkenstatik prüft Einfeldträger, Kragarm und Zweifeld-Durchlaufträger in 360 Aufgaben für Deutschland, Österreich und die Schweiz. Den größten Anteil stellt die statisch unbestimmte Balkenstatik: 4.888 Aufgaben zu Dreifeld-Durchlaufträgern mit unsymmetrischer Belastung, ebenfalls länderübergreifend. Der Bereich Bemessung prüft Biegeknicken nach EC3, Holzbau nach EC5 und Stahlbeton nach EC2 in 320 Aufgaben für Deutschland.
Gegenrechnung statt Selbstauskunft
Jede Lösung wird an analytischen Ankern geprüft, etwa qL²/8, 5qL⁴/384EI oder π²EI/L². Für die Balkenstatik kommt eine doppelte Gegenrechnung mit den Solvern PyNite und anaStruct hinzu: 1.583 Felder liegen zu 100 Prozent innerhalb der Toleranz, die größte Abweichung beträgt 0,014 Prozent. Zusätzlich hat SOFiSTiK 2024 1.582 von 1.583 Feldern bestätigt, bei einer Median-Abweichung von 0,0002 Prozent; SOFiSTiK 2026 kommt zum identischen Ergebnis. Auch die Bemessungsaufgaben sind mit 1.239 Feldern je Fassung bestätigt. Für die statisch unbestimmte Balkenstatik wurden 39.104 Felder mit SOFiSTiK bestimmt und zusätzlich analytisch über das Dreimomentenverfahren und die Integration der Biegelinie gegengeprüft, mit einer maximalen Abweichung von 0,222 Prozent und einem Median von höchstens 0,011 Prozent. Insgesamt sind damit 2.821 Lösungsfelder durch SOFiSTiK bestätigt. SOFiSTiK ist eine Marke der SOFiSTiK AG; zwischen SOFiSTiK und Statika besteht keine geschäftliche Verbindung, die Software wird ausschließlich zur unabhängigen Gegenrechnung eingesetzt.
Die Halluzinationsrate
138 Aufgaben enthalten bewusst eine fehlende Angabe. Die korrekte Antwort lautet in diesen Fällen „keine Angabe möglich“. Ob ein Modell diesen Fall erkennt oder einen Wert erfindet, ergibt die Halluzinationsrate, eine der fünf Kennzahlen von StatikBench neben Feldgenauigkeit (Field-EM), Verify-Catch, Antwortzeit und Formatstabilität.
Wo Modelle heute stehen
Gegenüber den Vorgängerversionen 0.1 und 0.3 zeigen die bisherigen Auswertungen ein wiederkehrendes Muster: Rohe Sprachmodelle ohne zusätzliche Absicherung erreichen 22 bis 26 Prozent Feldgenauigkeit und erfinden bei fehlenden Angaben in vier von zehn Fällen einen Wert. Reasoning-Modi heben die Genauigkeit auf bis zu 75 Prozent, lösen aber weder das Wissens- noch das Sicherheitsproblem bei fehlenden Angaben. Statika AI erreicht 96,9 Prozent Feldgenauigkeit bei 0,0 Prozent Halluzination.
StatikBench ist als Messinstrument konzipiert und keine Grundlage für die Tragwerksplanung an realen Bauwerken. Der Zugang ist über sechs Lizenzklassen von Evaluierung über Forschung und Unternehmen bis Publikation, KI-Training und OEM geregelt. Details zu Version 0.4 stehen unter statikbench.de, der Datensatz selbst unter huggingface.co.