Rang #1 Lokale / Private KI — Ihr Gehirn, Ihre Maschine, Ihre Regeln
Alibaba (Qwen Team)

Qwen3.8-27B

Qwen3.8-27B ist eines der seltenen lokalen Modelle, dessen Kompromisse zu Hardware passen, die Menschen tatsächlich besitzen: ein dichtes 27B-Checkpoint für Text, Bilder, Video, Coding und Werkzeug-Agenten. Eine 4-Bit-Version passt auf eine GPU der 24-GB-Klasse; die Apache-2.0-Lizenz hält die Arbeit privat und kommerziell nutzbar.

Aktualisiert 26. August 2026 Open WeightsApache 2.027B Dense
Am besten für

Qwen3.8-27B ist eines der seltenen lokalen Modelle, dessen Kompromisse zu Hardware passen, die Menschen tatsächlich besitzen: ein dichtes 27B-Checkpoint für Text, Bilder, Video, Coding und Werkzeug-Agenten. Eine 4-Bit-Version passt auf eine GPU der 24-GB-Klasse; die Apache-2.0-Lizenz hält die Arbeit privat und kommerziell nutzbar.

Warum es gewinnt

Unabhängige Tests stützen inzwischen die Geschichte zum Start: Qwen3.8-27B erreicht 52 im Artificial Analysis Intelligence Index und 51 im Agentic Index; Arenas Image-to-WebDev-Rangliste setzt es auf Platz 7 unter erheblich größeren Frontier-Systemen. Qwens eigene Coding- und Computer-Use-Werte bleiben stark, und das Modell vereint 262K Kontext, regelbaren Denkaufwand, native Bild- und Videoverarbeitung sowie eine Apache-2.0-Lizenz.

Zu beachten

Unabhängige Gesamtwertungen stützen die breiten und agentischen Fähigkeiten, doch die meisten konkreten Coding- und Computer-Use-Werte stammen weiterhin aus Qwens eigenen Harnesses. Die voreingestellte Denkstufe xhigh kann auf lokaler Hardware quälend langsam und weitschweifig sein; beginnen Sie für gewöhnliche interaktive Arbeit mit low oder medium oder schalten Sie das Denken ab. Q4-Quantisierung und KV-Cache-Grenzen trennen einen Download von 18 GB weiterhin von einer praktisch nutzbaren Kontextlänge von 262K.

01

Was es wirklich ist

Stellen Sie sich vor, Sie wählen eine Werkstatt statt nur eines Hammers. Ein lokales KI-Modell muss durch die Tür passen, Platz auf der Werkbank lassen, das Material vor sich verstehen und Werkzeuge nutzen, ohne vertrauliche Arbeit nach außen zu tragen. Bei Qwen3.8-27B treffen diese Anforderungen in einem Checkpoint zusammen. Es ist ein dichtes Vision-Language-Modell mit 27 Milliarden Parametern auf der Hybridbasis von Qwen3.5: Im wiederholten Muster folgen auf drei Gated-DeltaNet-Schichten jeweils eine Vollaufmerksamkeitsschicht. Lineare Aufmerksamkeit hilft der Effizienz, periodische Vollaufmerksamkeit verbindet weiterhin weit entfernte Details.

„Multimodal“ ist hier keine Verzierung. Qwen trainiert und verteilt das Modell für Text, Bilder und Video. Ein lokaler Coding-Agent kann einen Screenshot untersuchen, eine Fehlermeldung lesen, sie mit Quelldateien abgleichen und Werkzeuge bedienen, ohne das Bild zuerst an einen separaten Cloud-Dienst zu senden. Die Modellkarte beschreibt außerdem Dokumente, Diagramme, Browser, Mobilgeräte und stundenlange Videos. Qwen3.8-27B wirkt dadurch eher wie eine private Universalwerkbank als wie eine spezialisierte Autovervollständigung.

Die Startwerte erklären die Aufmerksamkeit: 61,7 bei SWE-bench Pro, 73,0 bei Terminal Bench 2.1, 42,2 bei DeepSWE 1.1 und 90,3 bei LiveCodeBench v6. Für multimodale Agenten nennt Qwen 84,3 bei OSWorld-Verified, 64,8 bei WebArena-Verified und 70,7 bei CoWorkBench. Gegenüber Qwen3.6-27B tauchen Verbesserungen bei Repository-Reparatur, Terminalarbeit, Büroaufgaben und Computerbedienung auf, nicht nur in einer bequem gewählten Prüfung. Diese Breite ist interessanter als eine einzelne Rekordzahl.

Die ersten externen Messungen weisen nun in dieselbe allgemeine Richtung. Artificial Analysis vergibt für die xhigh-Konfiguration 52 im Intelligence Index und 51 im Agentic Index; letzteres übertrifft im zitierten Snapshot knapp das historische Ergebnis von Opus 4.8 bei maximalem Aufwand. Auf Arenas Image-to-WebDev-Rangliste stand Qwen3.8-27B am 25. August mit einem Wert von 1574 und 1.686 Stimmen auf Platz 7, bei einer konfidenzbasierten Rangspanne von fünf bis zehn. Dass sich ein herunterladbares 27B-Modell bei der Umsetzung von Screenshots in Oberflächen statistisch unter Frontier-Cloudsysteme mischt, ist bemerkenswert. Diese Tests reproduzieren Qwens genaue lokale Konfiguration nicht, sind aber unabhängige Belege dafür, dass die Starttabelle keine Fata Morgana beschrieben hat.

Ein Benchmark ist jedoch ein Laboraufbau, kein Naturgesetz. SWE-bench Pro und DeepSWE laufen bei Qwen im Claude-Code-Harness mit langem Kontext und festgelegten Samplingwerten. Problematische SWE-bench-Pro-Aufgaben wurden korrigiert und Baselines neu gemessen. CoWorkBench und QwenSWEBench stammen von Qwen selbst. Bei MathVision gelten ein bestimmter Prompt und korrigierte Annotationen; einige visuelle Agententests verwenden besondere Grader oder Scaffolds. Das entwertet die Zahlen nicht. Es beschreibt, was gemessen wurde: Qwen3.8 in einem sorgfältig gewählten System. Ollama, LM Studio, llama.cpp oder ein eigener Agent können anders abschneiden.

Auch die Hardwaregeschichte braucht Präzision. Die offiziellen BF16-Shards summieren sich vor Laufzeitkosten auf etwa 55,6 GB. Unsloths Q4_K_M-Datei belegt rund 17,1 GB, der Vision-Projektor weitere 0,93 GB. Ein Download von ungefähr 18 GB passt auf eine 24-GB-GPU. Die verbleibenden sechs Gigabyte sind aber kein leerer Luxus: Puffer und der mit jedem Token wachsende KV-Cache benötigen sie. Eine 24-GB-Karte ist ein glaubwürdiger Start für nützliche lokale Arbeit, kein Versprechen für 262.144 Token mit höchster Geschwindigkeit und voller Cache-Präzision.

Für Betreiber bietet Qwen ungewöhnlich viele sinnvolle Regler. Das native Fenster umfasst 262.144 Token; für vLLM, SGLang und TokenSpeed dokumentiert die Modellkarte YaRN bis zu einer Million. Denken ist standardmäßig an, kann aber mit low, medium oder xhigh gesteuert werden, während preserve_thinking den Denkkontext über eine Agentenkonversation hinweg bewahren kann. Ein Multi-Token-Prediction-Kopf kann in kompatiblen Laufzeiten die Decodierung beschleunigen.

Die Werkseinstellung ist für viele gewöhnliche Aufgaben die falsche Einstellung. Qwen verwendet standardmäßig xhigh, und Artificial Analysis verzeichnete über seinen Index hinweg 160 Millionen Output-Token, verglichen mit einem Median von 43 Millionen bei ähnlichen offenen Modellen. In Simon Willisons lokalem Test verbrauchte ein einfaches Pelikan-SVG 22.276 Reasoning-Token und 21 Minuten; ohne Denken sank die Laufzeit auf 137 Sekunden. Das ist keine Verschlechterung der Qualität, sondern eine Lektion für den Betrieb: Beginnen Sie mit low oder medium—oder bei einfachen Umformungen ganz ohne Denken—und stufen Sie eine Aufgabe nur dann auf xhigh hoch, wenn die zusätzliche Suche das Warten wert ist. Statisches YaRN, Sampling und die Bewahrung des Denkzustands verlangen dieselbe bewusste Behandlung.

Der beste erste Test ist absichtlich alltäglich. Laden Sie eine Quantisierung, die dauerhaft in den Speicher passt, wählen Sie ein Kontextfenster mit Reserve und geben Sie Qwen eine reale Aufgabe mit sichtbarem Ziel: einen fehlschlagenden Test reparieren, Zahlen aus einem privaten Bericht extrahieren oder eine Oberfläche aus einem Screenshot nachbauen. Notieren Sie Abschluss, Wiederholungen, Tempo und menschliche Korrektur. Lassen Sie danach Qwen3.6 oder Ihr aktuelles Modell unter denselben Bedingungen antreten. So messen Sie Ihre Werkstatt statt eines fremden Labors.

Heute ist Qwen3.8-27B der beste Standard am Schnittpunkt von Privatsphäre, Fähigkeit, Multimodalität und erreichbarer Hardware. Größere offene Modelle sind in einzelnen schweren Bereichen klüger, kleinere schneller. Qwen besetzt die nützliche Mitte: stark genug für ernsthafte Arbeit, klein genug für einen Schreibtisch und offen genug, dass dieser Schreibtisch vollständig Ihnen gehören kann.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Ein wirklich praktischer multimodaler Lokal-Agent: Derselbe Checkpoint liest Text, Screenshots, Diagramme, Dokumente und Videos, kann darüber nachdenken und Werkzeuge aufrufen. Für einen UI-Fehler oder eine Tabelle vor einer Codeänderung muss kein privater Ablauf auf getrennte Vision- und Coding-Modelle verteilt werden.
  • Die Zugewinne zum Start haben jetzt unabhängige Unterstützung: Qwen3.8-27B steigt in Qwens Tests von 53,5 bei Qwen3.6-27B auf 61,7 bei SWE-bench Pro, von 63,4 auf 73,0 bei Terminal Bench 2.1 und von 13,3 auf 42,2 bei DeepSWE 1.1. Artificial Analysis vergibt unabhängig davon 52 im Intelligence Index und 51 im Agentic Index—ungewöhnlich starke Ergebnisse für ein offenes 27B-Modell.
  • 27B sind hier nützlich klein, nicht nur eine hübsche Zahl: Unsloths Q4_K_M-Gewichte sind etwa 17,1 GB groß, der Vision-Projektor rund 0,93 GB. Damit sind eine 24-GB-GPU oder ein passend ausgestatteter Apple-Silicon-Rechner realistische Zielsysteme; der Spielraum hängt von Runtime, Cache-Präzision und Kontextlänge ab.
  • Langkontext und Denkkontrolle sind ungewöhnlich vollständig: Nativ stehen 262.144 Token bereit; Qwen dokumentiert für vLLM, SGLang und TokenSpeed YaRN bis 1M. Denken lässt sich abschalten oder auf low, medium beziehungsweise xhigh setzen und für lange Agentenschleifen zwischen Runden bewahren. Diese Regler sind wichtig, weil xhigh die Voreinstellung ist und nicht für jede Aufgabe der vernünftige Ausgangspunkt.
  • Offene Lizenz und schnelles Deployment-Ökosystem: Das offizielle Checkpoint steht unter Apache 2.0. Qwen dokumentiert vLLM, SGLang und TokenSpeed; Ollama listet bereits qwen3.8:27b mit 18 GB, Unsloth GGUF-Quantisierungen von ungefähr 9 bis 31,5 GB.

Ehrliche Einschränkungen

  • Die unabhängige Bestätigung ist breit, aber keine Reproduktion jeder Behauptung: Artificial Analysis und Arena stützen inzwischen die Geschichte zu allgemeiner Intelligenz, Agentenfähigkeit und visuellem Coding. Qwen führte die meisten konkreten Aufgabenvergleiche weiterhin selbst durch und mischte öffentliche Tests mit den internen QwenSWEBench, CoWorkBench und RecreationBench. SWE-bench Pro und DeepSWE nutzen einen Claude Code Harness; sie messen daher ein Modell-plus-Scaffold-System und nicht nackte Gewichte in jeder lokalen App.
  • 24 GB bedeuten nicht den vollen 262K-Kontext: Die Gewichte sind nur der erste Koffer. Vision-Projektor, Laufzeitpuffer und wachsender KV-Cache brauchen ebenfalls Speicher. Eine 24-GB-Karte kann eine 4-Bit-Version ausführen; sehr lange Prompts verlangen aber kleineren oder quantisierten Cache, teilweise CPU-Auslagerung oder mehr Speicher.
  • Quantisierung verändert das gemessene Modell: Qwens Tabelle beweist nicht, dass jedes 4-Bit-GGUF dieselbe Denk-, Vision- und Werkzeugqualität behält. Der Unterschied kann klein oder auf einzelne Aufgaben begrenzt sein; produktiv sollte genau die geplante Quantisierung mit der geplanten Kontextgröße geprüft werden.
  • Die Voreinstellung kann eine schnelle Aufgabe in eine lange Meditation verwandeln: Qwen verwendet standardmäßig xhigh. Simon Willisons einfacher SVG-Test brauchte 21 Minuten und 22.276 Reasoning-Token, gegenüber 137 Sekunden bei abgeschaltetem Denken. Beginnen Sie für interaktive Arbeit mit low oder medium, reservieren Sie xhigh für wirklich schwierige Aufgaben und bedenken Sie, dass Sampling-Einstellungen, Werkzeugschemata, Chat-Templates und statisches YaRN das Ergebnis ebenfalls beeinflussen.
03

Benchmark-Übersicht

Repository-Reparatur — SWE-bench Pro: 61,7

Qwen meldet 61,7 gegenüber 53,5 für Qwen3.6-27B. Getestet wurde im Claude Code Harness mit Temperatur 1,0, top-p 0,95, 256K Kontext und einem verfeinerten Satz, in dem problematische Aufgaben korrigiert wurden.

Terminal-Agent — Terminal Bench 2.1: 73,0

In Qwens Tabelle sind das 9,6 Punkte mehr als bei Qwen3.6-27B. Es ist ein starkes Signal für mehrstufige Kommandozeilenarbeit, wobei lokales Tempo und Erfolg weiter vom Agenten-Scaffold und den verfügbaren Werkzeugen abhängen.

Computerbedienung — OSWorld-Verified: 84,3

Die größte praktische Überraschung: Das kompakte offene Checkpoint liegt in Qwens Tabelle vor allen Vergleichssystemen, auch Opus 4.6 Max mit 72,7. Unabhängige Reproduktion ist besonders wichtig, weil Computer-Use-Ergebnisse empfindlich auf den umgebenden Harness reagieren.

Lokaler Platzbedarf — Q4_K_M plus Vision-Projektor: etwa 18 GB

Die Repository-Metadaten nennen 17,1 GB für das Q4_K_M-GGUF und rund 0,93 GB für den BF16-Vision-Projektor. Die Dateien passen damit auf 24-GB-Hardware; der Rest bestimmt Kontextlänge und Parallelität.

Unabhängiger Gesamtwert — Artificial Analysis Intelligence Index: 52

Die xhigh-Konfiguration erreicht 52, liegt damit im zitierten Snapshot gleichauf mit GPT-5.6 Luna bei maximalem Aufwand und auf Platz eins in Artificial Analysis' Vergleichsklasse offener Modelle von 4B bis 40B. Über den Index hinweg erzeugte sie 160 Millionen Output-Token gegenüber einem Median von 43 Millionen—das Ergebnis dokumentiert also auch außergewöhnliche Weitschweifigkeit.

Visuelles Coding — Arena Image-to-WebDev: Platz 7, Wert 1574

Am 25. August lag das 27B-Modell unter 44 Systemen auf Platz sieben, mit 1.686 Stimmen und einer Rangspanne von 5 bis 10; statistisch mischte es sich damit unter erheblich größere und teurere Modelle. Arena liefert Präferenzdaten statt eines kontrollierten lokalen Quantisierungsbenchmarks, stützt aber unabhängig die praktische Stärke des Modells bei Vision plus Coding.

04

Das Fazit

Qwen3.8-27B bleibt unsere Empfehlung Nummer 1 (#1) in der Kategorie „Lokale / Private KI“, weil es Einzelpersonen das nützlichste Gesamtpaket bietet: ernsthafte Coding- und Agentenleistung, natives Bild und Video, ein langes Kontextfenster, Apache-2.0-Freiheit und einen quantisierten Platzbedarf, der auf eine High-End-Consumer-GPU passt. Artificial Analysis und Arena machen diese Platzierung nun weniger abhängig von Qwens Starttabellen. Es schlägt nicht jedes größere Modell, und unabhängige API-Tests beweisen nicht, dass sich jede lokale Q4-Version identisch verhält. Betrachten Sie die 9,2 als starke, aber konfigurationsabhängige Empfehlung: Beginnen Sie unterhalb von xhigh, testen Sie genau die Quantisierung, Werkzeuge und Kontextgröße Ihres geplanten Betriebs und behalten Sie bei folgenreichen Aktionen eine menschliche Prüfung bei.

05

Häufig gestellte Fragen