Lokale LLMs · Foto: derekGavey, CC BY 2.0
gpt-oss
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
- Rund 16 GB Speicher für die 20B-Variante, deutlich mehr für 120B
Einordnung
Die 20B-Variante läuft schon mit moderater Hardware, deckt dank einstellbarem Reasoning-Aufwand aber ein breites Aufgabenspektrum ab.
Auch hier gelistet: Reasoning-Aufwand ist einstellbar (low/medium/high) — ein Modell für schnelle UND gründliche Antworten.
Größen & Hardware
- Verfügbare Größen: 20B / 120B MoE
- Empfohlene Hardware (Q4): 20B: ~16 GB
Im Detail
gpt-oss ist OpenAIs erstes offen verfügbares Modell seit GPT-2 und bringt echte Reasoning-Fähigkeiten mit: Über den Parameter reasoning_effort stellen Sie ein, wie viel Rechenzeit das Modell in seine Antwort investiert — low für schnelle Fakten, high für mehrstufige Denkschritte bei komplexen Aufgaben. Als Mixture-of-Experts-Modell aktiviert es pro Anfrage nur einen Teil der Parameter, wodurch die 20B-Variante trotz MoE-Architektur mit rund 16 GB RAM auf normaler Consumer-Hardware läuft. Für alle, die ein einziges Modell für sowohl schnelle Chat-Antworten als auch gründliches Problemlösen suchen, ist das eine praktische Kombination — die 120B-Variante braucht dafür deutlich mehr Speicher.
Schritt für Schritt
- 20B- oder 120B-Variante nach verfügbarem Speicher wählen
- Modell lokal laden und einbinden
- reasoning_effort je nach Aufgabe auf low, medium oder high stellen
- Bei einfachen Fakten low wählen, bei mehrstufigen Denkaufgaben high
- Bei begrenztem Speicher bei der 20B-Variante bleiben, da die MoE-Architektur nur einen Teil der Parameter aktiviert
Beispiel aus der Praxis
Bei einer einfachen Terminfrage wird reasoning_effort auf low gestellt für eine schnelle Antwort, bei einer mehrstufigen Rechenaufgabe dagegen auf high, damit das Modell die Zwischenschritte gründlicher durchgeht.
Praxis-Tipp
Setzen Sie reasoning_effort auf „high“, wenn Sie ein mehrschrittiges Rechen- oder Codierproblem lösen lassen — für einfache Fragen reicht „low“ und spart Zeit.
Stolperfallen
reasoning_effort dauerhaft auf high zu lassen kostet bei einfachen Anfragen unnötig Zeit. Der Parameter sollte je nach Aufgabe angepasst werden, statt einen festen Wert zu verwenden.
Siehe auch
Lizenz & Quelle
Häufige Fragen.
Was macht der Parameter reasoning_effort?
Er steuert, wie viel Rechenzeit das Modell in seine Antwort investiert, von schnellen Fakten bei low bis mehrstufigen Denkschritten bei high.
Wie viel Speicher braucht gpt-oss?
Dank der Mixture-of-Experts-Architektur läuft die 20B-Variante mit rund 16 GB RAM auf normaler Consumer-Hardware, die 120B-Variante braucht deutlich mehr.
Ist gpt-oss das erste offene Modell von OpenAI?
Ja, es ist OpenAIs erstes offen verfügbares Modell seit GPT-2.
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
