machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Apache-2.0

gpt-oss (OpenAI)

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Apache-2.0

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

  • Rechner mit mindestens 16 GB RAM für die 20B-Variante
  • Für die 120B-Variante: Workstation oder Server mit 64–80 GB Speicher
  • Grundkenntnisse im Betrieb lokaler KI-Modelle

Einordnung

AufwandEinrichtung & Einarbeitung2/5 · eher geringNutzenErtrag im Alltag4/5 · eher hochVoraussetzungenWas vorher da sein muss2/5 · eher gering1 = gering5 = hoch

Die 20B-Variante läuft dank MoE und 4-Bit-Quantisierung schon auf bescheidener Hardware bei hoher Alltagstauglichkeit.

OpenAIs offene Modelle (2025): starke Reasoning-Fähigkeiten mit einstellbarem Denk-Aufwand, natives Tool-Calling. Das 20B läuft dank MoE + 4-Bit erstaunlich gut auf 16-GB-Geräten.

Größen & Hardware

  • Verfügbare Größen: 20B MoE / 120B MoE
  • Empfohlene Hardware (Q4): 20B: ~16 GB · 120B: ~64–80 GB

Im Detail

gpt-oss ist die erste offene Modellfamilie von OpenAI seit GPT-2, veröffentlicht 2025 in zwei Größen: 20B für Consumer-Hardware, 120B für Workstations mit viel Speicher. Dank Mixture-of-Experts-Architektur und nativer 4-Bit-Quantisierung läuft die 20B-Variante bereits mit rund 16 GB RAM — ungewöhnlich sparsam für ein Modell mit dieser Reasoning-Stärke. Eingebautes Tool-Calling macht es zu einer soliden Basis für Assistenten, die externe Funktionen aufrufen sollen, etwa Websuche oder Rechner-Tools. Für alltägliche Chat- und Assistenzaufgaben auf lokaler Hardware ist es eines der stärksten offenen Allround-Modelle; die 120B-Variante braucht dagegen 64–80 GB Speicher und eignet sich eher für Server.

Schritt für Schritt

  1. Je nach verfügbarer Hardware zwischen der 20B- und der 120B-Variante entscheiden
  2. Den Denk-Aufwand (Reasoning-Level) passend zur Aufgabe einstellen
  3. Tool-Calling aktivieren, wenn das Modell externe Funktionen wie Websuche oder einen Rechner ansteuern soll
  4. Im Alltag als Chat- und Assistenzmodell testen und die Antwortqualität mit bisherigen Modellen vergleichen
  5. Bei Bedarf für Server-Einsätze auf die 120B-Variante wechseln

Beispiel aus der Praxis

Auf einem Laptop mit 16 GB RAM läuft die 20B-Variante als lokaler Assistent, der bei einer Rechercheaufgabe selbstständig eine Websuche anstößt und die Ergebnisse einordnet, ohne dass eine Cloud-Anfrage nötig ist.

Praxis-Tipp

Nutzen Sie das native Tool-Calling-Format, um gpt-oss direkt an eigene Funktionen (z. B. Websuche) anzubinden, statt einen Umweg über Prompt-Hacks zu gehen.

Stolperfallen

Wer die 120B-Variante ohne ausreichenden Speicher (64–80 GB) startet, bekommt Abstürze oder unbrauchbare Geschwindigkeit — vorher die Hardware prüfen. Das eingebaute Tool-Calling funktioniert nur, wenn die anbindende Anwendung es auch tatsächlich nutzt.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: Ollama
  • Quelle: HF

Häufige Fragen.

Ist gpt-oss kostenlos nutzbar?

Laut Beschreibung handelt es sich um eine offene Modellfamilie von OpenAI; konkrete Lizenzdetails gehen aus dem Material nicht hervor, prüfen Sie das vor dem produktiven Einsatz.

Reicht die 20B-Variante für ernsthafte Aufgaben?

Für alltägliche Chat- und Assistenzaufgaben gilt sie als eines der stärksten offenen Allround-Modelle, das bereits auf Consumer-Hardware mit rund 16 GB läuft.

Wann brauche ich die 120B-Variante?

Wenn Sie deutlich mehr Rechenleistung und 64–80 GB Speicher zur Verfügung haben, etwa auf einem Server statt einem Consumer-Rechner.

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –