Rang #8 Programmierung — KI, die Produktionscode schreibt
Alibaba / Qwen Team

Qwen3.8-Max

Ein äußerst wertvoller Herausforderer für visuelles und kontextreiches Programmieren, der nach unabhängigen Tests, bei denen das Flaggschiff GLM-5.3 die Nase vorn hatte, nun auf Platz 6 rangiert. Sein herunterladbares Max-Tier-Checkpoint-Modell bleibt bemerkenswert, doch 2,4 Billionen Parameter machen das Self-Hosting zu einem echten Rechenzentrumsprojekt.

Aktualisiert 30. August 2026 Agentic CodingVision + Video1M Context

Ranglisten-Update Die Rangliste „Programmierung“ wurde seit der letzten Aktualisierung dieses Tests (30. August 2026) überarbeitet. Der oben angezeigte Rang ist immer aktuell. Aktuelle Nummer 1: GPT-6 Astra

Am besten für

Ein äußerst wertvoller Herausforderer für visuelles und kontextreiches Programmieren, der nach unabhängigen Tests, bei denen das Flaggschiff GLM-5.3 die Nase vorn hatte, nun auf Platz 6 rangiert. Sein herunterladbares Max-Tier-Checkpoint-Modell bleibt bemerkenswert, doch 2,4 Billionen Parameter machen das Self-Hosting zu einem echten Rechenzentrumsprojekt.

Warum es gewinnt

Artificial Analysis verzeichnet 71,8 Punkte beim Programmieren und 58,4 bei agentenbasierten Aufgaben; Alibaba meldet 86,6 beim Terminal Bench 2.1 und 93,0 beim PaperBench. Das gehostete Max-Modell bietet zusätzlich Vision-Fähigkeiten, Werkzeuge, ein standardmäßiges Kontextfenster von 1 Million Token und API-Zugang für 2 $/6 $, während die offenen Modellgewichte eine private Bereitstellung nur für Text ermöglichen.

Zu beachten

GLM-5.3 übertrifft Qwen nun bei den unabhängigen Indizes für Intelligenz, Programmierung und Agentenarbeit sowie in den direkten Terminal-Bench- und DeepSWE-Vergleichen von Z.ai. Die stärksten detaillierten Ergebnisse von Qwen stammen nach wie vor vom Anbieter selbst, und Tests zur Fehlerbehebung in der Praxis liefern gemischte Resultate.

01

Was es wirklich ist

Das Interessante an Qwen3.8-Max ist nicht, dass es in jeder Statistikreihe die höchsten Zahlen liefert. Das ist nämlich nicht der Fall. Das wirklich Spannende ist die Kombination: ein Modell mit einem extrem großen Kontextfenster, visuellen Eingabemöglichkeiten, ernsthaften Ambitionen als autonomer Agent und einem Preis, der wiederholte Anläufe erschwinglich macht. Programmieren ist im Grunde ein ständiger Prozess des Ausprobierens, Überprüfens und erneuten Ausprobierens; eine geringere Token-Rechnung macht diesen Prozess weniger zur grauen Theorie, sondern zur greifbaren Praxis.

Alibaba listet das Modell zu einem Preis von 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens. Zum Vergleich: Die bisherige Rate von Kimi K3 in diesem Leitfaden lag bei 3 $/15 $. Diese Ersparnis ist besonders dann nützlich, wenn ein Programmier-Agent den Kontext eines Repositories erneut lesen muss oder wenn Sie ein zweites Modell bitten wollen, einen Code-Patch zu überprüfen. Günstig ist zwar nicht gleichbedeutend mit gut, aber es sorgt dafür, dass gute Ingenieursgewohnheiten – wie ausführliche Tests, erneute Durchläufe und unabhängige Überprüfungen – in der Praxis schlichtweg weniger kosten.

Die frühen Frontend-Ergebnisse verdienen Beachtung. In einer frühen Momentaufnahme der Frontend Code Arena belegt Qwen3.8-Max mit 1668 Elo den Platz 4. Solche Rankings basieren darauf, dass Menschen eine fertiggestellte Benutzeroberfläche einer anderen vorziehen, ohne zu wissen, welches Modell sie erstellt hat. Das rückt diesen Test sehr nahe an die wahre Frage hinter jedem Produkt-Prototypen heran: Sieht die Seite stimmig aus und funktioniert sie so, wie der Nutzer es erwartet? Auch wenn sich die Punktzahl noch verschieben kann und eine hübsche Benutzeroberfläche fehleranfälligen Code verbergen mag, ist dies dennoch ein bedeutsames erstes Signal.

Die Eingabemöglichkeiten des gehosteten Max-Modells eignen sich hervorragend für die visuelle Entwicklung: Ein Screenshot, eine Designvorlage, eine Browseraufzeichnung, ein Aufgaben-Briefing und der Text aus dem Repository können sich alle einen einzigen Chatverlauf teilen. Das offene Checkpoint-Modell unterscheidet sich davon: Es verarbeitet nur Text und bietet ein natives Kontextfenster von 262.000 Tokens, das auf etwa 1,01 Millionen Tokens erweitert werden kann. Teams sollten sich je nach der tatsächlich benötigten Datenmodalität und ihrer vorhandenen Infrastruktur entweder für die gehostete oder die offene Variante entscheiden.

Die Veröffentlichung des offenen Modells verändert vor allem die Bereitstellung, anstatt auf magische Weise die Gewissheit bei Benchmarks zu erhöhen. Teams können ihren Code in ihrer eigenen Umgebung behalten und das Modell über unterstützte Software-Stacks betreiben. Dennoch bleiben 2,4 Billionen Parameter eine Größenordnung, die auf Rechenzentren ausgelegt ist, und die spezielle Lizenz fügt Bedingungen wie die Nennung des Namens sowie Anforderungen für separate Lizenzen bei hohen Nutzerzahlen oder Umsatzgrenzen hinzu. Offene Modellgewichte verlagern das Schloss quasi von der Tür des Anbieters in Ihren eigenen Serverraum – aber sie machen diesen Serverraum dadurch nicht kleiner.

Alibaba verzeichnet 86,6 Punkte beim Terminal Bench 2.1, ein starkes Ergebnis für einen Agenten, der Aufgaben in der Kommandozeile abarbeitet. Z.ai meldet in der gleichen Einführungstabelle 88,2 für GLM-5.3 sowie 66,9 Punkte bei DeepSWE im Vergleich zu 56,6 von Qwen. Artificial Analysis platziert GLM unabhängig davon weiter vorn: mit 74,8 gegenüber 71,8 beim Programmieren und 59,1 gegenüber 58,4 bei agentenbasierten Aufgaben. GLM belegt zudem mit 41,8 % den dritten Platz auf dem neuesten öffentlichen Terminal-Bench 4.0 Leaderboard, auf dem Qwen nicht vertreten ist. Auch wenn unterschiedliche Testumgebungen (“Harnesses”) weiterhin eine Rolle spielen, weisen die Belege nun konsistent genug darauf hin, um die Rangfolge zu ändern.

Die größte Vorsicht ist bei der Reparatur von Repositories geboten. Die von Alibaba angegebenen 67,7 Punkte beim SWE-bench Pro sind zwar ansehnlich, liegen aber unter den besten Resultaten am Markt, und erste unabhängige Berichte über die Fehlerbehebung (Bug-Fixing) fielen recht durchwachsen aus. Dies ist ein bekannter Unterschied in der KI-Entwicklung: Das Erschaffen einer überzeugenden neuen Benutzeroberfläche und die Reparatur einer fremden, alten Codebasis nutzen zwar dieselben Werkzeuge, erfordern aber nicht zwangsläufig die gleiche Art von Disziplin. Nutzen Sie Qwen für beides, wenn es sich in Ihren eigenen Tests bewährt; leiten Sie jedoch den Erfolg bei der zweiten Aufgabe nicht blind aus einem Sieg bei der ersten ab.

Bis auf Weiteres steht Qwen3.8-Max mit einer Punktzahl von 9,2 auf Platz 6. Es bleibt eine faszinierende Option für die Frontend-Arbeit durch die gehostete multimodale Max-Version sowie für das private, kontextreiche Programmieren durch das offene Text-Checkpoint-Modell. Doch das Flaggschiff GLM-5.3 rangiert nun auf der Programmier-Liste darüber. Halten Sie die Zugriffsrechte streng eingegrenzt und messen Sie das Gesamtergebnis: bestandene Tests, überprüfte Code-Diffs, sinnvolles Verhalten, Infrastrukturkosten und die Einhaltung der Lizenzbedingungen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Der Preis verändert das, was man guten Gewissens ausprobieren kann: Mit 2 $ für Eingabe- und 6 $ für Ausgabetokens pro Million kostet Qwen3.8-Max weitaus weniger als die teuersten Programmier-Agenten und unterbietet auch die bisherigen Raten von Kimi K3 (3 $/15 $). Das macht iteratives Debugging, lange Kontexte und eine zweite, unabhängige Code-Prüfung finanziell realistisch.
  • Es beginnt mit einem ermutigenden Frontend-Ergebnis: Die Frontend Code Arena listet Qwen3.8-Max in einer frühen Momentaufnahme mit 1668 Elo auf Platz 4, was starke Platzierungen bei Endverbraucherprodukten einschließt. Wenn Nutzer blindlings die von einer KI erstellte Benutzeroberfläche bevorzugen, ist das ein starkes Signal für die UI-Entwicklung – auch wenn es noch keine umfassenden Software-Engineering-Fähigkeiten für riesige Code-Repositories beweist.
  • Lange, visuelle Aufgaben passen perfekt zu seiner Eingabestruktur: Das Modell verarbeitet Text, Screenshots, Diagramme und Videos mit einem Kontextfenster von 1 Million Token. Das ist enorm nützlich, um ein Design in Code zu übersetzen, einen aufgezeichneten UI-Fehler zu diagnostizieren oder ein großes Repository samt seinen Produktanforderungen in einer einzigen Arbeitssitzung präsent zu halten.
  • Das Terminal-Agent-Ergebnis des Anbieters ist stark: Alibaba meldet einen Wert von 86,6 beim Terminal Bench 2.1, was ganz oben in ihrem Vergleich liegt. Dies ist ein Beleg dafür, dass das Qwen-System Aufgaben in der Befehlszeile bewältigen, Dateien schreiben und auf das Feedback von Werkzeugen reagieren kann.
  • Es bietet gezielte Kontrollmöglichkeiten für das logische Denken: Die Einstellung reasoning_effort (Denkaufwand) unterstützt die Stufen hoch, mittel und niedrig, während preserve_thinking (Denkprozesse bewahren) standardmäßig aktiviert ist. So können Entwickler bei einem komplexen Design mehr Zeit investieren oder die Latenz bei einer kleinen, präzise definierten Bearbeitung reduzieren.
  • Teams können die Max-Stufe selbst hosten: Der offene Checkpoint ist auf Hugging Face und ModelScope verfügbar, und die Modellkarte nennt die Kompatibilität mit vLLM, SGLang und TokenSpeed. Dies ermöglicht private Evaluierungen und Fine-Tuning – vorausgesetzt, das Team verfügt über Hardware auf Rechenzentrumsniveau.

Ehrliche Einschränkungen

  • Unabhängige Nachweise setzen nun eine niedrigere Obergrenze: Artificial Analysis bewertet Qwen3.8-Max mit 71,8 Punkten beim Programmieren und 58,4 bei agentenbasierten Aufgaben, und damit hinter GLM-5.3 (74,8 und 59,1). Alibabas detaillierte Ergebnisse für den Terminal Bench und den PaperBench bleiben zwar nützlich, sind jedoch stark vom Versuchsaufbau abhängig.
  • Die Reparatur von Code-Repositories bleibt die deutlichste Schwachstelle: Alibaba meldet 67,7 Punkte beim SWE-bench Pro und liegt damit hinter den besten KI-Modellen an der Leistungsspitze. Erste unabhängige Berichte zu Fehlerbehebungs-Tests sind ebenfalls durchwachsen; man sollte also eine gute Frontend-Demo nicht mit der zuverlässigen Wartung einer großen, im produktiven Einsatz befindlichen Codebasis verwechseln.
  • Ein riesiger Kontext kann dazu führen, dass ein schlechter Plan länger bestehen bleibt: Eine Million Token lassen das Modell zwar eine Menge sehen, aber es kann dennoch eine architektonische Annahme falsch verstehen oder eine Tatsache in der Mitte des Textes übersehen. Nutzen Sie lieber kleine Code-Commits, Tests und Checkpoints, anstatt dem Modell eine unbegrenzte Aufgabe in einer einzigen, langen Sitzung zu übergeben.
  • Die Qualität des logischen Denkens, Geschwindigkeit und Kosten bilden ein Spannungsfeld: Ein hoher Denkaufwand kann bei einem komplexen Problem helfen, aber Denk-Token werden als Ausgabetoken abgerechnet, und erste Nutzer berichten von einem hohen Kontingent- bzw. Token-Verbrauch. Verwenden Sie für Routinearbeiten mittlere oder niedrige Aufwandsstufen und messen Sie die Kosten pro erfolgreich integrierter und getesteter Änderung.
  • Dienstzugang und Integrationen können je nach Standort variieren: Die APIs sind zwar gut zugänglich, aber Verfügbarkeit, Zahlungsmodalitäten, Kontingente und Latenzzeiten können sich je nach Region unterscheiden. Stellen Sie sicher, dass das Modell dort, wo Ihr Team arbeitet und die Anwendung läuft, zuverlässig verfügbar ist, bevor Sie es zu Ihrem Standardwerkzeug machen.
  • Lizenz und Hardware setzen weiterhin Grenzen: Das Bereitstellen von 2,4 Billionen Parametern ist ein handfestes Rechenzentrumsprojekt. Zudem erfordert die benutzerdefinierte Lizenz die Nennung des Modellnamens bei sehr großen Produkten sowie eine separate Erlaubnis für große Modell-Dienstleister oder Programmier-/Büroassistenz-Unternehmen, die eine bestimmte Umsatzschwelle überschreiten.
03

Benchmark-Übersicht

Frontend Code Arena — 1668 Elo (Platz 4, früh)

Ein frühes Ergebnis aus menschlichen Präferenzen für fertige Frontend-Arbeiten. Es ist ein starker Beleg für die Erstellung von Benutzeroberflächen, aber kein umfassendes Ranking für Software-Engineering-Fähigkeiten.

Terminal Bench 2.1 — 86,6 (von Alibaba gemeldet)

Ein hohes, vom Anbieter gemeldetes Ergebnis für Terminal-Agenten, das jedoch hinter dem genannten GPT-5.6 Sol-Wert von 88,8 liegt. Unterschiedliche Testumgebungen für Agenten machen direkte Modellvergleiche unvollkommen.

SWE-bench Pro — 67,7 (von Alibaba gemeldet)

Eine respektable Punktzahl für das Reparieren von Code-Repositories, die in der Tabelle des Anbieters dennoch den stärksten Ergebnissen der Claude-Familie hinterherhinkt.

PaperBench — 93,0 (von Alibaba gemeldet)

Ein starkes Signal für Forschungsarbeiten, das einen nützlichen Kontext für die Planung und weitreichende Denkprozesse liefert, aber kein direkter Benchmark für das Programmieren ist.

Artificial Analysis Programmierung / Agenten — 71,8 / 58,4

Unabhängige, zusammengesetzte Nachweise bleiben hinter GLM-5.3 (74,8 / 59,1) zurück und stützen die Einordnung, das GLM-Flaggschiff über Qwen zu platzieren. Qwen bleibt auf diesen reinen Indizes noch leicht vor GLM-5.3-Flash.

04

Das Fazit

Qwen3.8-Max rückt beim Programmieren mit einer formelkorrigierten Punktzahl von 9,2 auf Platz 6 vor. Es bleibt ein exzellenter visueller, kostensensibler Herausforderer für lange Kontexte, aber die jüngsten unabhängigen Nachweise stützen nicht mehr die Einstufung über dem Flaggschiff GLM-5.3. Grok 4.6 belegt Platz 4, GLM-5.3 Platz 5, Qwen Platz 6 und GLM-5.3-Flash Platz 7. Setzen Sie Qwen dort ein, wo sein multimodales gehostetes Produkt und der Preis für die Aufgabe passen. Überlassen Sie dann der Continuous Integration (CI) und dem Code-Review die Entscheidung, ob es diese Modelle in Ihrem Repository wirklich übertrifft.

05

Häufig gestellte Fragen