#SWE-Bench
5mos
515
GPT-5.5 vs DeepSeek V4 vs Claude Opus 4.7 vs Qwen 3.6 vs Kimi K2.6: The 2026 LLM Showdown
5mos
537
GLM 5.1 Tops SWE-Bench Pro at 58.4% — First Chinese Model to Beat Claude and GPT on Real-World Coding
7mos
1,392
GPT-5.3 Codex Debuts: The First AI That Helped Build Itself — 400K Context, 25% Faster, and Now on GitHub Copilot
7mos
2,233
Qwen3-Coder-Next Launched: Alibaba's 80B Open-Source AI That Beats Claude Opus 4.5 in Security Coding — Free to Use, Runs Locally, and Supports 370 Languages