machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Apache-2.0

Qwen 3

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Apache-2.0

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

Keine besonderen — direkt loslegen.

Aktuelle Qwen-Generation mit umschaltbarem „Thinking“-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: 0.6B–32B dense; MoE: 30B-A3B, 235B-A22B
  • Empfohlene Hardware (Q4): 8B: 8–12 GB · 14B: 16 GB · 30B-A3B: 24–32 GB (läuft dank MoE flott)

Benutzungsanleitung

Alibabas aktuelle Familie — von winzig bis riesig, stark bei Logik und Mehrsprachigkeit.

Installation:

ollama run qwen3

Varianten für jede Hardware: qwen3:4b (ab 4 GB RAM), qwen3:8b (8 GB), qwen3:32b (32 GB+).

Wofür gut: Logik, Mathe, Mehrsprachigkeit (auch gutes Deutsch), Werkzeug-Nutzung in Agenten. Die kleinen Varianten sind erstaunlich fähig — ideal für ältere Rechner.

Erster Test: eine Rechenaufgabe mit Zwischenschritten stellen — Qwen 3 zeigt seine Stärke beim strukturierten Denken.

Im Detail

Qwen 3 ist die aktuelle Generation von Alibabas Sprachmodellen und bringt einen umschaltbaren „Thinking“-Modus mit, bei dem das Modell vor der eigentlichen Antwort sichtbar überlegt – nützlich für Aufgaben mit mehrschrittigem Schlussfolgern. Besonders bemerkenswert ist die MoE-Variante 30B-A3B: Sie liefert Qualität auf 30B-Niveau, ist wegen der Mixture-of-Experts-Architektur beim Antworten aber so schnell wie ein deutlich kleineres Modell. Die dense-Varianten reichen von 0.6B bis 32B und decken damit vom Edge-Gerät bis zur leistungsstarken GPU alles ab. Für alle, die ein aktuelles, flexibles Allround-Modell mit optionalem Reasoning suchen, ist Qwen 3 aktuell eine der besten freien Optionen.

Praxis-Tipp

Für schnelle Chat-Antworten den Thinking-Modus ausschalten, für Logik- oder Rechenaufgaben aktivieren – in vielen Frontends per einfachem Toggle oder Prompt-Flag steuerbar.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –