Rang #8 Alltags-Ökosystem — Die führenden KI-Assistenten
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8 gibt es jetzt in zwei wichtigen Varianten: als gehostetes Qwen3.8-Max-Produkt mit Bilderkennung, integrierten Werkzeugen und einem standardmäßigen Kontext von 1 Million Token sowie als Qwens erstes herunterladbares Modell der Max-Klasse. Das offene Modell ist ein Textmodell mit insgesamt 2,4 Billionen Parametern (95 Milliarden aktiv) und einem nativen Kontext von 262K, der auf rund eine Million Token erweitert werden kann.

Aktualisiert 30. August 2026 Multimodal1M ContextDeep Research

Ranglisten-Update Die Rangliste „Alltags-Ökosystem“ wurde seit der letzten Aktualisierung dieses Tests (30. August 2026) überarbeitet. Der oben angezeigte Rang ist immer aktuell. Aktuelle Nummer 1: Claude Opus 5.5

Am besten für

Qwen3.8 gibt es jetzt in zwei wichtigen Varianten: als gehostetes Qwen3.8-Max-Produkt mit Bilderkennung, integrierten Werkzeugen und einem standardmäßigen Kontext von 1 Million Token sowie als Qwens erstes herunterladbares Modell der Max-Klasse. Das offene Modell ist ein Textmodell mit insgesamt 2,4 Billionen Parametern (95 Milliarden aktiv) und einem nativen Kontext von 262K, der auf rund eine Million Token erweitert werden kann.

Warum es gewinnt

Qwen3.8-2.4T-A95B ist auf Hugging Face und ModelScope verfügbar, mit offizieller Kompatibilität für vLLM, SGLang und TokenSpeed. Alibaba meldet 93,0 bei PaperBench und 86,6 bei Terminal Bench 2.1. Die gehostete Max-Version bietet zusätzlich Bild- und Videoeingabe, einen Modus ohne Denkpause (Non-Thinking Mode), integrierte Werkzeuge, standardmäßig 1M Kontext und API-Preise von 2 $/6 $.

Zu beachten

Dies ist eine sehr neue Veröffentlichung. Die beeindruckende, breit gefächerte Benchmark-Tabelle stammt von Alibaba, nicht von einem unabhängigen Labor; frühe unabhängige Berichte zur Programmierleistung fallen gemischt aus, und Zugang, Kontingente sowie Abrechnung können etwas unpraktisch sein. Qwen wird zu einem zunehmend vollständigen Ökosystem, aber die Integration in die Dienste, die viele Leser bereits nutzen, ist noch nicht so nahtlos wie bei Google, Microsoft oder OpenAI – besonders außerhalb Asiens.

01

Was es wirklich ist

Qwen3.8-Max lässt sich am einfachsten als mächtiger neuer Motor verstehen, der in einer vielbeschäftigten Werkstatt parkt. Der Motor ist Alibabas Flaggschiff-Modell: ein “Sparse Mixture-of-Experts”-Design mit insgesamt 2,4 Billionen Parametern und 95 Milliarden aktiven Parametern pro Anfrage. Die Werkstatt ist Qwen Studio, wo dieser Motor direkt neben Chat, tiefgehender Recherche (Deep Research), Bildgenerierung, Videogenerierung und Werkzeugen zum Erstellen von Web-Artefakten steht. Für einen ganz normalen Nutzer kann diese Werkstatt genauso wichtig sein wie der Motor selbst.

Der unmittelbarste praktische Reiz liegt im Preis-Leistungs-Verhältnis. Der offiziell gelistete Tarif bei QwenCloud beträgt 2 $ pro Million Input-Token und 6 $ pro Million Output-Token, wobei zwischengespeicherter Input mit 0,25 $ berechnet wird. Das macht zwar nicht jede Aufgabe spottbillig – denn ausgiebige Argumentationsketten werden als Output abgerechnet –, aber es macht Analysen mit großen Kontexten und wiederholtes Experimentieren deutlich leichter zu rechtfertigen als die Premium-Preise der absoluten Spitzenmodelle. Wenn Kimi K3 der fähige Allrounder war, für den man das Budget sorgfältig im Auge behalten musste, dann ist Qwen3.8-Max die ähnlich ehrgeizige Alternative, die im Budget einfach mehr Luft für einen zweiten Versuch und eine gründliche Überprüfung lässt.

Das Modell wurde außerdem dafür konzipiert, sich das Problem wirklich anzusehen, nicht nur darüber zu lesen. Es akzeptiert Text, Bilder und Videos mit einem Kontext von bis zu einer Million Token. Stellen Sie sich vor, Sie untersuchen eine Produkteinführung und haben das Strategiedokument, eine Tabellenkalkulation, einen Mock-up, den Screenshot eines Dashboards und die Videoaufzeichnung eines fehlerhaften Workflows gleichzeitig auf demselben Schreibtisch liegen. Das verleiht dem Modell zwar nicht auf magische Weise ein perfektes Gedächtnis oder unfehlbares Urteilsvermögen, aber es beseitigt viele jener umständlichen Übersetzungsschritte, die normalerweise Recherche von visueller Arbeit trennen.

Die Geschichte rund um diese Produktfamilie ist für die tägliche Arbeit ungewöhnlich nützlich. Qwen Studio bietet Chat, Deep Research, Bildgenerierung, Videogenerierung und Entwicklungs-Artefakte an. Das herunterladbare Modell (Checkpoint) ist allerdings nicht identisch mit diesem gehosteten Produkt: Es verarbeitet nur Text, nutzt nativ 262.000 Kontext-Token und kann auf etwa 1,01 Millionen erweitert werden; das gehostete Max-Modell hingegen bietet zusätzlich Bilderkennung, einen Modus ohne Denkpause, integrierte Werkzeuge und standardmäßig 1 Million Token Kontext. Diese Unterscheidung verhindert, dass eine in der Modellkarte beworbene Funktion bei der eigentlichen Bereitstellung zu einer bösen Überraschung führt.

Die versprochene Open-Source-Veröffentlichung ist nun Realität. Qwen3.8-2.4T-A95B kann von Hugging Face und ModelScope heruntergeladen werden, ausgestattet mit 512 “Experten”, von denen pro Token 10 zugewiesene plus ein geteilter Experte aktiv sind. Es ist natürlich immer noch kein Modell für den heimischen Laptop: Das Speichern und Ausführen von 2,4 Billionen Parametern ist ein Projekt im Rechenzentrums-Maßstab. Die maßgeschneiderte Lizenz ist für den normalen Gebrauch weit gefasst, aber sehr große Produkte müssen den Modellnamen anzeigen. Zudem benötigen große Unternehmen, die Modell-Dienste oder Code-/Büroassistenten anbieten, möglicherweise eine separate kommerzielle Lizenz.

Das Bild der Leistungsfähigkeit ist vielversprechend, aber noch nicht vollständig. Alibaba meldet exzellente Ergebnisse bei PaperBench, IFBench, OSWorld-Verified, Terminal Bench 2.1 sowie in einer umfangreichen multimodalen Tabelle. In der ersten Momentaufnahme der Frontend Code Arena belegt Qwen3.8-Max mit 1668 Elo Platz 4. Noch interessanter ist, dass Alibaba mehrere ungewöhnlich konkrete Demonstrationen von autonomer Arbeit beschreibt: Ein unbeaufsichtigter Lauf über 10 bis 16 Tage, startend mit einem leeren Ordner, baute eine sich selbst entwickelnde Testumgebung auf, erstellte 265 Commits, öffnete 127 Pull-Requests und protokollierte 151 Issues; hinzu kommt ein multimodaler Wettbewerb für Dialog-Absichten, bei dem die Genauigkeit über 45 Einreichungen hinweg von 0,60 auf 0,853 kletterte, sowie ausführliche Simulationen in den Bereichen Chip-Design und E-Commerce. Zwar handelt es sich hierbei um Alibabas eigene Berichte und nicht um unabhängige Validierungen, dennoch vermitteln sie ein nützliches Bild von der professionellen, mehrstufigen Arbeit, auf die das Team abzielt. Unabhängige Gutachter müssen nun noch die langsame, teils ermüdende Arbeit erledigen, die ein Leaderboard letztlich vertrauenswürdig macht.

Diese Vorsicht ist beim Programmieren am wichtigsten. Das von Qwen gemeldete Ergebnis bei Terminal Bench ist stark, dennoch reicht der gemeldete Wert von 67,7 bei SWE-bench Pro nicht aus, um es bei der Lösung von Problemen in echten Repositories in die absolute Spitzengruppe einzureihen. Einige frühe praktische Tests zur Fehlerbehebung liefern ebenfalls ein gemischtes Bild. Ein Benchmark kann zwar zeigen, dass ein Modell über einen mächtigen Werkzeugkasten verfügt; aber nur ein reproduzierbarer Durchlauf auf Ihrem eigenen Repository zeigt wirklich, ob es sich an das Ziel erinnert, die richtigen Befehle nutzt und den Fehler tatsächlich behebt, anstatt einen wunderbar erklärten neuen Fehler einzubauen.

Auch das Produkt selbst hat seine Grenzen. Verfügbarkeit, Kontingente, Abrechnung und Durchsatz variieren je nach Region, während das eigenständige Hosten (Self-Hosting) eine ernsthafte Infrastruktur und eine Überprüfung der Lizenzen erfordert. Vorerst erreicht Qwen3.8-Max mit einer 9,0 den 6. Platz, direkt hinter Grok 4.6. Nutzen Sie es für eine klar umrissene Aufgabe, überprüfen Sie seine Fakten und den generierten Code, und lassen Sie am Ende unabhängige Ergebnisse – und nicht die Begeisterung der Launch-Woche – darüber entscheiden, ob es zu Ihrem neuen Standard wird.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Jede Menge Flaggschiff-Leistung fürs API-Geld: QwenCloud ruft 2 $ pro Million Input-Token und 6 $ pro Million Output-Token auf, wobei zwischengespeicherter Input bei 0,25 $ liegt. Das ist in etwa die Hälfte des Output-Preises von Kimi K3 aus unserem vorherigen Ranking und liegt weit unter den teuersten Claude-Tarifen. Ernsthaftes Experimentieren tut dem Geldbeutel hier also viel weniger weh.
  • Es kann mehr als nur Text analysieren: Qwen3.8-Max verarbeitet von Haus aus Text, Bilder und Videos und verfügt über ein Kontextfenster von 1 Million Token. Ein langer Bericht, ein UI-Screenshot, ein Diagramm und eine kurze Bildschirmaufzeichnung können so Teil ein und derselben Untersuchung sein – ganz ohne separate, verlustbehaftete Übergaben.
  • Die Qwen-Familie bietet normalen Nutzern mehr als nur einen Chatbot: Qwen Studio kombiniert Chat mit tiefgehender Recherche (Deep Research), Webentwicklungs-Artefakten sowie Bild- und Videogenerierung und ist im Web sowie auf den wichtigsten Desktop- und Mobilplattformen verfügbar. Diese generativen Medienwerkzeuge sind Teil der Produktfamilie; das bedeutet aber nicht, dass das Max-Modell allein all diese Outputs erzeugt.
  • Die Demonstrationen für autonomes Arbeiten sind ungewöhnlich konkret: Laut Alibaba lief Qwen3.8-Max unbeaufsichtigt 10 bis 16 Tage lang, beginnend mit einem leeren Ordner. Es baute eine sich selbst entwickelnde Testumgebung auf und erstellte dabei 265 Commits, 127 Pull-Requests und 151 Issues. Es wird auch von einem multimodalen Intent-Wettbewerb mit 45 Einreichungen berichtet, bei dem sich die Genauigkeit von 0,60 auf 0,853 verbesserte. Dies sind Hersteller-Demonstrationen, aber sie zeigen die Art von kontinuierlichen, professionellen Arbeitsabläufen, auf die Alibaba abzielt.
  • Das erste öffentliche Signal im Frontend-Bereich ist wirklich konkurrenzfähig: Die Frontend Code Arena platziert das Modell in einer frühen Momentaufnahme auf Platz 4 mit 1668 Elo, mit besonders starken Ergebnissen bei Konsumentenprodukten. Das ist zwar noch kein abschließendes Urteil über die Programmierfähigkeiten, aber es ist ein nützlicher Beleg dafür, dass Qwen Benutzeroberflächen erstellen kann, die den Leuten gefallen.
  • Die Max-Klasse ist endlich zum Download verfügbar: Qwen3.8-2.4T-A95B steht auf Hugging Face und ModelScope bereit, mit insgesamt 2,4 Billionen / 95 Milliarden aktiven Parametern, einem nativen Kontext von 262.144 Token und einer Erweiterung auf etwa 1,01 Millionen. vLLM, SGLang und TokenSpeed werden als kompatible Laufzeitumgebungen (Runtimes) genannt.

Ehrliche Einschränkungen

  • Betrachten Sie die großen Benchmark-Tabellen als Herstellernachweis, nicht als in Stein gemeißelte Fakten: Alibabas Zahlen sind nützlich, aber viele Vergleiche nutzen Agenten-Frameworks und Konfigurationen, die das Ergebnis verändern können. Unabhängige Testreihen sind noch nicht ganz auf demselben Stand, daher sollten die Angaben zu PaperBench und Terminal Bench eher als Orientierung für einen eigenen Test dienen und diesen nicht ersetzen.
  • Das Lösen von Problemen in echten Code-Repositories ist noch kein eindeutiger Gewinn: Alibaba meldet 67,7 bei SWE-bench Pro, was hinter den stärksten Claude-Ergebnissen liegt, und frühe Berichte aus Bug-Benchmarks fielen deutlich schwächer aus als die Zahlen zum Start. Bevor Sie es zur Standardlösung für Produktions-Patches machen, sollten Sie das gleiche Problem sowohl durch Qwen als auch durch Ihren aktuellen Spitzenreiter laufen lassen.
  • Das Ökosystem ist breit gefächert, aber nicht überall tief integriert: Qwen Studio bietet eine überzeugende Werkzeugfamilie, taucht aber nicht automatisch in Google Mail, Office-Dateien, Browsern, Kalendern oder Unternehmensberechtigungen der meisten Nutzer auf. Zudem können Reichweite und Serviceverfügbarkeit von Alibaba in Asien deutlich bequemer sein als anderswo.
  • Ein 1M-Kontextfenster bedeutet Kapazität, kein perfektes Erinnerungsvermögen: Es kann eine enorme Menge an Material fassen, aber irrelevante Seiten, vage Ziele und Fakten, die in der Mitte vergraben sind, können das Modell dennoch in die Irre führen. Teilen Sie große Projekte in Zwischenschritte auf und halten Sie die Quelldokumente zur Überprüfung bereit.
  • Der frühe Zugang kann noch etwas holprig sein: Tester berichten von Reibungsverlusten bei Kontingenten, Abrechnung und Durchsatz, während das Modell bei der höchsten Argumentationsstufe (Reasoning) eine beträchtliche Menge an Output-Token verbrauchen kann. Beginnen Sie mit einer klar umrissenen Aufgabe und behalten Sie die Kosten für ein fertiges, geprüftes Ergebnis im Auge – nicht nur die beworbene Token-Rate.
  • Offen bedeutet weder mühelos noch völlig frei von Einschränkungen: Ein 2,4-Billionen-Parameter-Modell hat Rechenzentrum-Dimensionen, selbst wenn pro Token nur 95 Milliarden aktiv sind. Die maßgeschneiderte Lizenz verlangt die Nennung des Modells ab 100 Millionen monatlichen Nutzern oder 20 Millionen Dollar Monatsumsatz, und eine separate Lizenz für große Modell-Service- oder KI-Arbeitsassistenz-Unternehmen ab 50 Millionen Dollar Jahresumsatz.
03

Benchmark-Übersicht

Frontend Code Arena — 1668 Elo (Platz 4, früh)

Ein frühes Signal für menschliche Präferenzen bei fertigen Frontend-Arbeiten. Es ist ermutigend, aber der Rang und der Elo-Wert werden sich noch verschieben, wenn mehr Vergleiche eintreffen.

PaperBench — 93,0 (von Alibaba gemeldet)

Ein vom Hersteller gemeldetes Ergebnis für komplexe, forschungsähnliche Aufgaben. Es untermauert die Ambitionen des Modells, ist aber keine unabhängige Garantie.

IFBench — 82,8 (von Alibaba gemeldet)

Ein starker, vom Hersteller gemeldeter Wert für das Befolgen von Anweisungen, was relevant ist, wenn eine Aufgabe viele Einschränkungen und Schritte hat.

Terminal Bench 2.1 — 86,6 (von Alibaba gemeldet)

Ein hohes Ergebnis für Terminal-Agenten, unterhalb des zitierten GPT-5.6 Sol-Wertes und oberhalb mehrerer Konkurrenten in Alibabas Tabelle; Unterschiede in der Agenten-Umgebung spielen hier eine große Rolle.

SWE-bench Pro — 67,7 (von Alibaba gemeldet)

Eine respektable Leistung im Software-Engineering, aber kein branchenführender Wert bei der Reparatur von Code-Repositories.

04

Das Fazit

Qwen3.8-Max belegt Platz 6 mit einer formelkorrigierten 9,0 in der Kategorie „Alltags-Ökosystem“. Grok 4.6 schiebt sich davor, weil seine 9,5 stärkere unabhängige Beweise mit einer breiteren Verteilung einsatzbereiter Agenten kombiniert. Qwen bleibt jedoch äußerst attraktiv für alle, die zu niedrigeren Betriebskosten zwischen Dokumenten, visuellen Eingaben, Forschung, Bild-, Video- und Programmieraufgaben wechseln. Probieren Sie es bei einer klar umrissenen Aufgabe aus und beziehen Sie weiterhin Quellenangaben, Tests und eine menschliche Überprüfung mit ein.

05

Häufig gestellte Fragen