Lokale LLMs · Foto: derekGavey, CC BY 2.0
Qwen 3
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
Aktuelle Qwen-Generation mit umschaltbarem „Thinking“-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: 0.6B–32B dense; MoE: 30B-A3B, 235B-A22B
- Empfohlene Hardware (Q4): 8B: 8–12 GB · 14B: 16 GB · 30B-A3B: 24–32 GB (läuft dank MoE flott)
Benutzungsanleitung
Alibabas aktuelle Familie — von winzig bis riesig, stark bei Logik und Mehrsprachigkeit.
Installation:
ollama run qwen3
Varianten für jede Hardware: qwen3:4b (ab 4 GB RAM), qwen3:8b (8 GB), qwen3:32b (32 GB+).
Wofür gut: Logik, Mathe, Mehrsprachigkeit (auch gutes Deutsch), Werkzeug-Nutzung in Agenten. Die kleinen Varianten sind erstaunlich fähig — ideal für ältere Rechner.
Erster Test: eine Rechenaufgabe mit Zwischenschritten stellen — Qwen 3 zeigt seine Stärke beim strukturierten Denken.
Im Detail
Qwen 3 ist die aktuelle Generation von Alibabas Sprachmodellen und bringt einen umschaltbaren „Thinking“-Modus mit, bei dem das Modell vor der eigentlichen Antwort sichtbar überlegt – nützlich für Aufgaben mit mehrschrittigem Schlussfolgern. Besonders bemerkenswert ist die MoE-Variante 30B-A3B: Sie liefert Qualität auf 30B-Niveau, ist wegen der Mixture-of-Experts-Architektur beim Antworten aber so schnell wie ein deutlich kleineres Modell. Die dense-Varianten reichen von 0.6B bis 32B und decken damit vom Edge-Gerät bis zur leistungsstarken GPU alles ab. Für alle, die ein aktuelles, flexibles Allround-Modell mit optionalem Reasoning suchen, ist Qwen 3 aktuell eine der besten freien Optionen.
Praxis-Tipp
Für schnelle Chat-Antworten den Thinking-Modus ausschalten, für Logik- oder Rechenaufgaben aktivieren – in vielen Frontends per einfachem Toggle oder Prompt-Flag steuerbar.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
