Nur technisch notwendige Cookies. Mehr

OK
KapitalAI
Ranking Methodik FAQ Kontakt Report

Benchmark-Methodik

Stand: Juni 2026

1. Datenquellen

Wir aggregieren Daten aus mehreren unabhaengigen Quellen:

  • LMSYS Chatbot Arena — 6M+ anonyme menschliche Vergleiche
  • Artificial Analysis — Intelligence Index, Latenz, Throughput
  • SWE-bench Pro — 1,865 Real-World Coding Tasks
  • GPQA Diamond — PhD-Level Science Questions
  • Humanity's Last Exam — Haertester Reasoning-Benchmark

2. KapitalAI Composite Score

Gewichtung

Arena Elo (25%) + SWE-bench Pro (20%) + GPQA Diamond (15%) + MATH-500 (15%) + HLE (15%) + Preis-Effizienz (10%)

3. Benchmark-Details

  • Arena Elo: LMSYS Chatbot Arena. Gaps unter 30 Punkten sind statistisch nicht signifikant.
  • SWE-bench Pro: 1,865 Tasks aus 41 Repos (Python, Go, TypeScript, JavaScript). Ersetzt SWE-bench Verified wegen Datenlecks.
  • GPQA Diamond: PhD-Level Science Questions (Physik, Chemie, Biologie)
  • HLE: Humanity's Last Exam — haertester allgemeiner Reasoning-Benchmark
  • MATH-500: Olympiade-Level Mathematik-Probleme
  • ARC-AGI-2: Abstract Reasoning Corpus — misst echtes Generalisieren

4. Aktualisierung

Rankings werden woechentlich aktualisiert. Neue Modelle werden innerhalb von 7 Tagen nach Release getestet.

5. Statistischer Hinweis

Modelle innerhalb von 2-3% Unterschied auf einem Benchmark sind funktional gleichwertig. Arena Elo Gaps unter 30 Punkten wechseln in 60% der Faelle innerhalb eines Quartals.

KapitalAI

Unabhaengige KI-Benchmarks. Wissenschaftlich fundiert.

Benchmark

RankingMethodikFAQ

Rechtliches

ImpressumDatenschutz

© 2024-2026 KapitalAI Research