machichdigital
ModellLokale LLM-ModelleLizenz: Apache-2.0

Qwen 3

Aktuelle Qwen-Generation mit umschaltbarem „Thinking"-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.

× kopiert× heruntergeladenBewertung:

Aktuelle Qwen-Generation mit umschaltbarem „Thinking“-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: 0.6B–32B dense; MoE: 30B-A3B, 235B-A22B
  • Empfohlene Hardware (Q4): 8B: 8–12 GB · 14B: 16 GB · 30B-A3B: 24–32 GB (läuft dank MoE flott)

Benutzungsanleitung

Alibabas aktuelle Familie — von winzig bis riesig, stark bei Logik und Mehrsprachigkeit.

Installation:

ollama run qwen3

Varianten für jede Hardware: qwen3:4b (ab 4 GB RAM), qwen3:8b (8 GB), qwen3:32b (32 GB+).

Wofür gut: Logik, Mathe, Mehrsprachigkeit (auch gutes Deutsch), Werkzeug-Nutzung in Agenten. Die kleinen Varianten sind erstaunlich fähig — ideal für ältere Rechner.

Erster Test: eine Rechenaufgabe mit Zwischenschritten stellen — Qwen 3 zeigt seine Stärke beim strukturierten Denken.

Im Detail

Qwen 3 löst Qwen 2.5 ab und bringt einen entscheidenden Vorteil: Pro Anfrage lässt sich wählen, ob das Modell erst „nachdenkt“ (Thinking-Modus, besser bei komplexen Aufgaben, aber langsamer) oder direkt antwortet. Besonders interessant ist die MoE-Variante 30B-A3B: 30 Milliarden Parameter, davon aber nur rund 3 Milliarden pro Token aktiv – das Ergebnis ist Antwortgeschwindigkeit nahe einem kleinen Modell bei deutlich höherer Qualität. Für 24–32 GB RAM/VRAM ist das oft die beste Kombination aus Tempo und Können. Wer nur ein Modell für Chat, Reasoning und Coding-Hilfe will, ist mit Qwen 3 aktuell besser bedient als mit Qwen 2.5.

Praxis-Tipp

Für schnelle Alltagsfragen den Thinking-Modus in der Chat-Vorlage deaktivieren, bei Matheaufgaben oder Logikrätseln bewusst einschalten.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)