Benchmark-Methodik
Stand: Juni 2026
1. Datenquellen
Wir aggregieren Daten aus mehreren unabhaengigen Quellen:
- LMSYS Chatbot Arena — 6M+ anonyme menschliche Vergleiche
- Artificial Analysis — Intelligence Index, Latenz, Throughput
- SWE-bench Pro — 1,865 Real-World Coding Tasks
- GPQA Diamond — PhD-Level Science Questions
- Humanity's Last Exam — Haertester Reasoning-Benchmark
2. KapitalAI Composite Score
Gewichtung
Arena Elo (25%) + SWE-bench Pro (20%) + GPQA Diamond (15%) + MATH-500 (15%) + HLE (15%) + Preis-Effizienz (10%)
3. Benchmark-Details
- Arena Elo: LMSYS Chatbot Arena. Gaps unter 30 Punkten sind statistisch nicht signifikant.
- SWE-bench Pro: 1,865 Tasks aus 41 Repos (Python, Go, TypeScript, JavaScript). Ersetzt SWE-bench Verified wegen Datenlecks.
- GPQA Diamond: PhD-Level Science Questions (Physik, Chemie, Biologie)
- HLE: Humanity's Last Exam — haertester allgemeiner Reasoning-Benchmark
- MATH-500: Olympiade-Level Mathematik-Probleme
- ARC-AGI-2: Abstract Reasoning Corpus — misst echtes Generalisieren
4. Aktualisierung
Rankings werden woechentlich aktualisiert. Neue Modelle werden innerhalb von 7 Tagen nach Release getestet.
5. Statistischer Hinweis
Modelle innerhalb von 2-3% Unterschied auf einem Benchmark sind funktional gleichwertig. Arena Elo Gaps unter 30 Punkten wechseln in 60% der Faelle innerhalb eines Quartals.