Lokale LLMs · Foto: derekGavey, CC BY 2.0
gpt-oss (OpenAI)
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
- Rechner mit mindestens 16 GB RAM für die 20B-Variante
- Für die 120B-Variante: Workstation oder Server mit 64–80 GB Speicher
- Grundkenntnisse im Betrieb lokaler KI-Modelle
Einordnung
Die 20B-Variante läuft dank MoE und 4-Bit-Quantisierung schon auf bescheidener Hardware bei hoher Alltagstauglichkeit.
OpenAIs offene Modelle (2025): starke Reasoning-Fähigkeiten mit einstellbarem Denk-Aufwand, natives Tool-Calling. Das 20B läuft dank MoE + 4-Bit erstaunlich gut auf 16-GB-Geräten.
Größen & Hardware
- Verfügbare Größen: 20B MoE / 120B MoE
- Empfohlene Hardware (Q4): 20B: ~16 GB · 120B: ~64–80 GB
Im Detail
gpt-oss ist die erste offene Modellfamilie von OpenAI seit GPT-2, veröffentlicht 2025 in zwei Größen: 20B für Consumer-Hardware, 120B für Workstations mit viel Speicher. Dank Mixture-of-Experts-Architektur und nativer 4-Bit-Quantisierung läuft die 20B-Variante bereits mit rund 16 GB RAM — ungewöhnlich sparsam für ein Modell mit dieser Reasoning-Stärke. Eingebautes Tool-Calling macht es zu einer soliden Basis für Assistenten, die externe Funktionen aufrufen sollen, etwa Websuche oder Rechner-Tools. Für alltägliche Chat- und Assistenzaufgaben auf lokaler Hardware ist es eines der stärksten offenen Allround-Modelle; die 120B-Variante braucht dagegen 64–80 GB Speicher und eignet sich eher für Server.
Schritt für Schritt
- Je nach verfügbarer Hardware zwischen der 20B- und der 120B-Variante entscheiden
- Den Denk-Aufwand (Reasoning-Level) passend zur Aufgabe einstellen
- Tool-Calling aktivieren, wenn das Modell externe Funktionen wie Websuche oder einen Rechner ansteuern soll
- Im Alltag als Chat- und Assistenzmodell testen und die Antwortqualität mit bisherigen Modellen vergleichen
- Bei Bedarf für Server-Einsätze auf die 120B-Variante wechseln
Beispiel aus der Praxis
Auf einem Laptop mit 16 GB RAM läuft die 20B-Variante als lokaler Assistent, der bei einer Rechercheaufgabe selbstständig eine Websuche anstößt und die Ergebnisse einordnet, ohne dass eine Cloud-Anfrage nötig ist.
Praxis-Tipp
Nutzen Sie das native Tool-Calling-Format, um gpt-oss direkt an eigene Funktionen (z. B. Websuche) anzubinden, statt einen Umweg über Prompt-Hacks zu gehen.
Stolperfallen
Wer die 120B-Variante ohne ausreichenden Speicher (64–80 GB) startet, bekommt Abstürze oder unbrauchbare Geschwindigkeit — vorher die Hardware prüfen. Das eingebaute Tool-Calling funktioniert nur, wenn die anbindende Anwendung es auch tatsächlich nutzt.
Siehe auch
Lizenz & Quelle
Häufige Fragen.
Ist gpt-oss kostenlos nutzbar?
Laut Beschreibung handelt es sich um eine offene Modellfamilie von OpenAI; konkrete Lizenzdetails gehen aus dem Material nicht hervor, prüfen Sie das vor dem produktiven Einsatz.
Reicht die 20B-Variante für ernsthafte Aufgaben?
Für alltägliche Chat- und Assistenzaufgaben gilt sie als eines der stärksten offenen Allround-Modelle, das bereits auf Consumer-Hardware mit rund 16 GB läuft.
Wann brauche ich die 120B-Variante?
Wenn Sie deutlich mehr Rechenleistung und 64–80 GB Speicher zur Verfügung haben, etwa auf einem Server statt einem Consumer-Rechner.
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
