Ranking-Guide

Lokale / Private KI — Ihr Gehirn, Ihre Maschine, Ihre Regeln

Hier eine radikale Idee: Was wäre, wenn Sie eine wirklich intelligente KI auf Ihrer eigenen Hardware betreiben könnten, und nichts, was Sie ihr sagen, jemals Ihre Maschine verlässt? Keine Cloud-Server. Keine Datensammlung. Keine Abogebühren. Nur Sie, Ihr Laptop und eine Intelligenz, die Ihre Privatsphäre von vornherein respektiert. Willkommen zur Open-Weight-Revolution.

Die Entscheidung zuerst

Unser Ranking

Beginne mit dem Sieger und vergleiche dann die Abwägungen, die deine Wahl ändern könnten.

#1 Lokale / Private KI

Qwen3.8 — 27B

Alibaba (Qwen Team)

Qwen3.8-27B ist eines der seltenen lokalen Modelle, dessen Kompromisse zu tatsächlich verbreiteter Hardware passen: ein dichtes 27B-Checkpoint für Text, Bilder, Video, Coding und Werkzeug-Agenten. Eine 4-Bit-Version passt auf eine GPU der 24-GB-Klasse; die Apache-2.0-Lizenz hält die Arbeit privat und kommerziell nutzbar.

Warum es gewinnt

Qwen meldet 61,7 auf SWE-bench Pro, 73,0 auf Terminal Bench 2.1, 42,2 auf DeepSWE 1.1, 84,3 auf OSWorld-Verified und 70,7 auf CoWorkBench. Hinzu kommen 262.144 Token nativer Kontext, optionale YaRN-Skalierung auf fast 1M, einstellbarer Denkaufwand, erhaltenes Denken über mehrere Runden sowie natives Bild- und Videoverständnis.

Der Haken

Das sind Belege vom ersten Veröffentlichungstag, noch kein gefestigtes Urteil. Die meisten Spitzenwerte stammen aus Qwens eigener Tabelle; teils wurden Claude-Code-Harness, korrigierte Aufgaben, spezielle Prompts oder Qwen-interne Tests verwendet. Das übliche Q4_K_M-Paket belegt mit Vision-Projektor etwa 18 GB, doch Laufzeit-Overhead und KV-Cache begrenzen auf einer 24-GB-Karte weiterhin den nutzbaren Kontext.

9.2 Redaktionswertung
Test lesen
Am besten für

Qwen3.8-27B ist eines der seltenen lokalen Modelle, dessen Kompromisse zu tatsächlich verbreiteter Hardware passen: ein dichtes 27B-Checkpoint für Text, Bilder, Video, Coding und Werkzeug-Agenten. Eine 4-Bit-Version passt auf eine GPU der 24-GB-Klasse; die Apache-2.0-Lizenz hält die Arbeit privat und kommerziell nutzbar.

Warum es gewinnt

Qwen meldet 61,7 auf SWE-bench Pro, 73,0 auf Terminal Bench 2.1, 42,2 auf DeepSWE 1.1, 84,3 auf OSWorld-Verified und 70,7 auf CoWorkBench. Hinzu kommen 262.144 Token nativer Kontext, optionale YaRN-Skalierung auf fast 1M, einstellbarer Denkaufwand, erhaltenes Denken über mehrere Runden sowie natives Bild- und Videoverständnis.

Zu beachten

Das sind Belege vom ersten Veröffentlichungstag, noch kein gefestigtes Urteil. Die meisten Spitzenwerte stammen aus Qwens eigener Tabelle; teils wurden Claude-Code-Harness, korrigierte Aufgaben, spezielle Prompts oder Qwen-interne Tests verwendet. Das übliche Q4_K_M-Paket belegt mit Vision-Projektor etwa 18 GB, doch Laufzeit-Overhead und KV-Cache begrenzen auf einer 24-GB-Karte weiterhin den nutzbaren Kontext.

#2

Ein phänomenal effizientes 284B/13B-MoE-Modell, das agentische und Coding-Workflows dominiert und dabei bequem auf Hardware der Mittelklasse passt.

9.1 Redaktionswertung
Test lesen
#3

GLM-5.3

Z.ai (Zhipu AI)

Das spannendste lokale Modell, das man noch nicht herunterladen kann. GLM-5.3 behält die 744B-MoE-Basis von GLM-5.2 und gewinnt allein durch Post-Training deutlich bei Coding und Agentenarbeit. Z.ai verspricht Gewichte etwa zwei Wochen nach dem Start; bis dahin bleibt es ein gehostetes Modell mit glaubwürdiger Self-Hosting-Perspektive.

9.2 Redaktionswertung
Test lesen
#4

Kimi K3

Moonshot AI

Das erste Open-Weight-Modell, das aussieht wie ein geschlossenes Frontier-Gehirn. 2,8 Billionen Parameter als Mixture-of-Experts, native Bildverarbeitung, ein voller Million-Token-Kontext und eine Lizenz, die kommerzielle Nutzung erlaubt — alles als Download für eine Maschine unter Ihrer Kontrolle. Der Haken ist die Maschine: Sie braucht ein Rechenzentrum, keinen Schreibtisch.

8.5 Redaktionswertung
Test lesen
#5

Gemma 4

Google DeepMind

Nicht ein Modell — fünf. Google DeepMinds Gemma 4 ist eine Familie, die alles abdeckt: von einem 2-Milliarden-Parameter-Winzling, der auf deinem Handy läuft, bis hin zu einem 31-Milliarden-Parameter-Kraftpaket für Server. Jedes Familienmitglied hat eine andere Architektur, andere Stärken und andere Hardware-Anforderungen. Das E2B passt in 1 GB RAM. Das 12B Unified betreibt eine vollständige multimodale KI auf einer Laptop-GPU. Das 26B MoE aktiviert nur 3,8B Parameter pro Token. Alle Apache 2.0, alle mit offenen Gewichten. Dieser Guide geht jedes einzelne durch, damit du genau weißt, welches Gemma zu deiner Hardware und deinem Workflow passt.

8.2 Redaktionswertung
Test lesen
Fragen und Antworten

Häufig gestellte Fragen