Antworten zu unserem Benchmark
Es haengt vom Use-Case ab: Coding: Claude Opus 4.8 (#1 SWE-bench Pro, Coding Arena). Math: DeepSeek R1 (#1 MATH-500, 97.3%). Reasoning: GPT-5.5 (#1 ARC-AGI, 100% AIME). Science: Gemini 3.1 Pro (#1 GPQA Diamond). Budget: Gemini 3.5 Flash (1/30 des Preises).
Arena Elo basiert auf 6M+ anonymen menschlichen Vergleichen in der LMSYS Chatbot Arena. Werte ueber 1450 gelten als Frontier-Level. Gaps unter 30 Punkten sind statistisch nicht signifikant — solche Modelle wechseln haeufig Plaetze.
OpenAI entdeckte, dass SWE-bench Verified Tasks in Trainingsdaten geleckt waren — Modelle konnten Gold-Patches reproduzieren. SWE-bench Pro ist schwieriger (1,865 Tasks, 41 Repos) und weniger kontaminiert.
DeepSeek R1 (MIT Lizenz) fuehrt bei MATH-500 (97.3%). Qwen 3 235B (Apache 2.0) ist staerkstes All-Around Open-Weight Modell mit 119 Sprachen. Llama 4 Maverick hat 1M Context bei nur 17B aktiven Parametern.
Claude Sonnet 4.6 — Default fuer Claude Code. 79.6% SWE-bench Verified, 112 TPS, beste Balance zwischen Qualitaet, Geschwindigkeit und Preis. Fuer kritische PRs: Claude Opus 4.8.