Ranking-Guide

Programmierung — KI, die Produktionscode schreibt

Das sind Coding-Agenten, keine Autocomplete-Spielzeuge. GPT-6 Astra führt, weil es Terminal-Arbeit mit den wenigsten Token erledigt, während Claude Opus 5.5 in unabhängigen Tests gleichauf liegt und bei großen, unübersichtlichen Codebasen am stärksten ist. Claude Sonnet 5.5 ist die schnelle Option zum halben Tokenpreis für klar umrissene Bugs und Features. GPT-6.1 Sol und Grok 4.7 bringen Programmierleistung nahe der Spitze zu einem Bruchteil des Preises, und GLM-5.3, GLM-5.3-Flash und Qwen3.8-Max runden die Auswahl mit starken Preis-Leistungs-Optionen ab.

Die Entscheidung zuerst

Unser Ranking

Beginne mit dem Sieger und vergleiche dann die Abwägungen, die deine Wahl ändern könnten.

#1 Programmierung

GPT-6 Astra

OpenAI

GPT-6 Astra übernimmt die Coding-Krone auf die gleiche ehrliche Art, wie GPT-5.6 sie hielt: indem es agentenförmige Arbeit fertigstellt — Terminal-Sitzungen, scheiternde Pipelines, Incident-Forensik, ganze Desktop-Setups — nun untermauert durch den neuen 1. Platz auf Arena.ais Code Arena (WebDev mit 1.797 Pkt.) und bei rund einem Drittel von Sols Tokens.

Warum es gewinnt

Neuer 1. Platz auf Arena.ais Code Arena: WebDev mit 1.797 Punkten (+35 Punkte Vorsprung vor Claude Fable 5.1 Max bei 1.762, +109 vor Opus 5 Max bei 1.688 und +180 vor Sol auf Rang 13), führend in Data & Analytics, Consumer Product und Content Creation Tools. Gepaart mit Terminal-Bench 4.0 bei 57,7–57,9% (Fable 5.1: 55,8%), tabellenbesten 74,1% auf DeepSWE v1.1, 64,6% auf Terminal-Bench Science, SRE-Bench bei 88% pass@1 / 99,2% pass@4 und 100% auf ExploitBench. Auch wenn Artificial Analysis' eigener Agenten-Harness Fable 5.1 noch knapp vorn sieht (70 gegen 67), definiert Astra die Pareto-Grenze bei gemischten $40/Mtoken neu und verbraucht rund ein Drittel von Sols Tokens.

Der Haken

Selbst mit dem 1. Platz in der Code Arena für WebDev und Produktwerkzeuge hält Fable 5(.1) weiterhin den SWE-Bench-Pro-Rekord und führt im Agenten-Index von Artificial Analysis (70 gegen 67). Der API-Sticker liegt beim 2,5-Fachen von Sol bei $10/$50, Cache-Lesezugriffe kosten das Vierfache von Fable 5.1s $0,25, knappe Antworten überspringen Report-Politur-Schritte, und stärkere Cyber-Schutzvorkehrungen erschweren exploit-nahe Arbeit. Die Launch-Tabellen wanderten nach Veröffentlichung — behandeln Sie jede einzelne Zahl als ±1–2 Punkte.

9.9 Redaktionswertung
Test lesen
Am besten für

GPT-6 Astra übernimmt die Coding-Krone auf die gleiche ehrliche Art, wie GPT-5.6 sie hielt: indem es agentenförmige Arbeit fertigstellt — Terminal-Sitzungen, scheiternde Pipelines, Incident-Forensik, ganze Desktop-Setups — nun untermauert durch den neuen 1. Platz auf Arena.ais Code Arena (WebDev mit 1.797 Pkt.) und bei rund einem Drittel von Sols Tokens.

Warum es gewinnt

Neuer 1. Platz auf Arena.ais Code Arena: WebDev mit 1.797 Punkten (+35 Punkte Vorsprung vor Claude Fable 5.1 Max bei 1.762, +109 vor Opus 5 Max bei 1.688 und +180 vor Sol auf Rang 13), führend in Data & Analytics, Consumer Product und Content Creation Tools. Gepaart mit Terminal-Bench 4.0 bei 57,7–57,9% (Fable 5.1: 55,8%), tabellenbesten 74,1% auf DeepSWE v1.1, 64,6% auf Terminal-Bench Science, SRE-Bench bei 88% pass@1 / 99,2% pass@4 und 100% auf ExploitBench. Auch wenn Artificial Analysis' eigener Agenten-Harness Fable 5.1 noch knapp vorn sieht (70 gegen 67), definiert Astra die Pareto-Grenze bei gemischten $40/Mtoken neu und verbraucht rund ein Drittel von Sols Tokens.

Zu beachten

Selbst mit dem 1. Platz in der Code Arena für WebDev und Produktwerkzeuge hält Fable 5(.1) weiterhin den SWE-Bench-Pro-Rekord und führt im Agenten-Index von Artificial Analysis (70 gegen 67). Der API-Sticker liegt beim 2,5-Fachen von Sol bei $10/$50, Cache-Lesezugriffe kosten das Vierfache von Fable 5.1s $0,25, knappe Antworten überspringen Report-Politur-Schritte, und stärkere Cyber-Schutzvorkehrungen erschweren exploit-nahe Arbeit. Die Launch-Tabellen wanderten nach Veröffentlichung — behandeln Sie jede einzelne Zahl als ±1–2 Punkte.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 ist das Programmiermodell für die großen, verworrenen Aufgaben: eine Migration über Hunderttausende Zeilen, ein Fehler, der sich durch fünf Dienste zieht, ein Altsystem, das niemand mehr ganz versteht. In Anthropics eigenen Benchmarks liegt es vor GPT-6 Astra; in unabhängigen Tests liegen beide gleichauf. Platz 2 statt Platz 1 hat es nur, weil Astra dieselbe Terminal-Arbeit mit deutlich weniger Token erledigt.

9.9 Redaktionswertung
Test lesen
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 ist das Programmiermodell, das man den ganzen Tag laufen lassen kann: schnell, zum halben Tokenpreis von Opus 5.5 und gut genug, dass die meisten Bugfixes, Features und Refactorings das Spitzenmodell nie brauchen. Nur den Aufwandsregler sollte man nicht ganz aufdrehen – auf der höchsten Stufe schreibt es mehr als jedes Modell, das Artificial Analysis je gemessen hat, und manche Ergebnisse werden sogar schlechter.

9.8 Redaktionswertung
Test lesen
#4

GPT-6.1 Sol

OpenAI

GPT-6.1 Sol ist der Coding-Agent, den Sie den ganzen Tag laufen lassen können, ohne auf die Rechnung schauen zu müssen. In unabhängigen Tests liegt er nur ein oder zwei Punkte hinter GPT-6 Astra, dem Flaggschiff von OpenAI, dennoch kostet eine typische Aufgabe weniger als ein Viertel. Der Token-Preis hat sich gegenüber GPT-6 Sol nicht geändert (2 $ Eingabe, 10 $ Ausgabe pro Million), aber das erneute Lesen von im Cache gespeichertem Code kostet jetzt nur noch 0,10 $ pro Million Token, und genau bei großen Repositories macht sich diese Ersparnis bemerkbar.

9.8 Redaktionswertung
Test lesen
#5

Claude Fable 5.1

Anthropic

Die für agenten-basiertes Codieren verfeinerte Reasoning-Engine der Mythos-Klasse. Gleiche Gewichte wie das eingeschränkte Mythos 5.1, aber optimiert durch einen 75%igen Cache-Rabatt, der die Wirtschaftlichkeit von Langzeit-Engineering revolutioniert. Am besten in Claude Code eingesetzt, wo der AA Coding Agent-Score von 70 das Feld anführt.

9.8 Redaktionswertung
Test lesen
#6

Grok 4.7

xAI

Grok 4.7 ist das günstigste ernstzunehmende Programmiermodell in der Nähe der Ranglistenspitze. Für $2 Eingabe und $6 Ausgabe pro Million Token erreicht es 71,0 % bei DeepSWE und 46,3 % bei CursorBench 4.0, und es läuft direkt in Cursor und Grok Build. Ein starker Programmierpartner für den Alltag – aber noch nicht der Agent, den man stundenlang allein im Terminal arbeiten lässt.

9.7 Redaktionswertung
Test lesen
#7

GLM-5.3

Z.ai (Zhipu AI)

Ein schwergewichtiges Open-Weight-Modell für genau den Teil der Softwareentwicklung, der nach der ersten Antwort beginnt: planen, editieren, testen, Rückschläge auffangen und sich auch bei langen Aufträgen in einem Repository nicht verirren.

9.2 Redaktionswertung
Test lesen
#8

Qwen3.8-Max

Alibaba / Qwen Team

Ein äußerst wertvoller Herausforderer für visuelles und kontextreiches Programmieren, der nach unabhängigen Tests, bei denen das Flaggschiff GLM-5.3 die Nase vorn hatte, nun auf Platz 6 rangiert. Sein herunterladbares Max-Tier-Checkpoint-Modell bleibt bemerkenswert, doch 2,4 Billionen Parameter machen das Self-Hosting zu einem echten Rechenzentrumsprojekt.

9.2 Redaktionswertung
Test lesen
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

Coding- und Agentenarbeit knapp unterhalb der Leistungsspitze zu ungewöhnlich niedrigen Preisen, mit nativer Bildverarbeitung und 1M Kontext. „Flash“ bedeutet hier effizient und günstig – nicht klein und auch nicht besonders schnell.

9.2 Redaktionswertung
Test lesen
Fragen und Antworten

Häufig gestellte Fragen