Nur technisch notwendige Cookies. Mehr

OK
KapitalAI
Ranking Methodik FAQ Kontakt Report

Haeufige Fragen

Antworten zu unserem Benchmark

Welches Modell ist das beste?

Es haengt vom Use-Case ab: Coding: Claude Opus 4.8 (#1 SWE-bench Pro, Coding Arena). Math: DeepSeek R1 (#1 MATH-500, 97.3%). Reasoning: GPT-5.5 (#1 ARC-AGI, 100% AIME). Science: Gemini 3.1 Pro (#1 GPQA Diamond). Budget: Gemini 3.5 Flash (1/30 des Preises).

Was bedeutet Arena Elo?

Arena Elo basiert auf 6M+ anonymen menschlichen Vergleichen in der LMSYS Chatbot Arena. Werte ueber 1450 gelten als Frontier-Level. Gaps unter 30 Punkten sind statistisch nicht signifikant — solche Modelle wechseln haeufig Plaetze.

Warum SWE-bench Pro statt Verified?

OpenAI entdeckte, dass SWE-bench Verified Tasks in Trainingsdaten geleckt waren — Modelle konnten Gold-Patches reproduzieren. SWE-bench Pro ist schwieriger (1,865 Tasks, 41 Repos) und weniger kontaminiert.

Welches Open-Source Modell ist am besten?

DeepSeek R1 (MIT Lizenz) fuehrt bei MATH-500 (97.3%). Qwen 3 235B (Apache 2.0) ist staerkstes All-Around Open-Weight Modell mit 119 Sprachen. Llama 4 Maverick hat 1M Context bei nur 17B aktiven Parametern.

Welches Modell fuer taegliches Coding?

Claude Sonnet 4.6 — Default fuer Claude Code. 79.6% SWE-bench Verified, 112 TPS, beste Balance zwischen Qualitaet, Geschwindigkeit und Preis. Fuer kritische PRs: Claude Opus 4.8.

KapitalAI

Unabhaengige KI-Benchmarks. Wissenschaftlich fundiert.

Benchmark

RankingMethodikFAQ

Rechtliches

ImpressumDatenschutz

© 2024-2026 KapitalAI Research