machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Apache-2.0

gpt-oss

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Apache-2.0

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

  • Rund 16 GB Speicher für die 20B-Variante, deutlich mehr für 120B

Einordnung

AufwandEinrichtung & Einarbeitung2/5 · eher geringNutzenErtrag im Alltag4/5 · eher hochVoraussetzungenWas vorher da sein muss3/5 · mittel1 = gering5 = hoch

Die 20B-Variante läuft schon mit moderater Hardware, deckt dank einstellbarem Reasoning-Aufwand aber ein breites Aufgabenspektrum ab.

Auch hier gelistet: Reasoning-Aufwand ist einstellbar (low/medium/high) — ein Modell für schnelle UND gründliche Antworten.

Größen & Hardware

  • Verfügbare Größen: 20B / 120B MoE
  • Empfohlene Hardware (Q4): 20B: ~16 GB

Im Detail

gpt-oss ist OpenAIs erstes offen verfügbares Modell seit GPT-2 und bringt echte Reasoning-Fähigkeiten mit: Über den Parameter reasoning_effort stellen Sie ein, wie viel Rechenzeit das Modell in seine Antwort investiert — low für schnelle Fakten, high für mehrstufige Denkschritte bei komplexen Aufgaben. Als Mixture-of-Experts-Modell aktiviert es pro Anfrage nur einen Teil der Parameter, wodurch die 20B-Variante trotz MoE-Architektur mit rund 16 GB RAM auf normaler Consumer-Hardware läuft. Für alle, die ein einziges Modell für sowohl schnelle Chat-Antworten als auch gründliches Problemlösen suchen, ist das eine praktische Kombination — die 120B-Variante braucht dafür deutlich mehr Speicher.

Schritt für Schritt

  1. 20B- oder 120B-Variante nach verfügbarem Speicher wählen
  2. Modell lokal laden und einbinden
  3. reasoning_effort je nach Aufgabe auf low, medium oder high stellen
  4. Bei einfachen Fakten low wählen, bei mehrstufigen Denkaufgaben high
  5. Bei begrenztem Speicher bei der 20B-Variante bleiben, da die MoE-Architektur nur einen Teil der Parameter aktiviert

Beispiel aus der Praxis

Bei einer einfachen Terminfrage wird reasoning_effort auf low gestellt für eine schnelle Antwort, bei einer mehrstufigen Rechenaufgabe dagegen auf high, damit das Modell die Zwischenschritte gründlicher durchgeht.

Praxis-Tipp

Setzen Sie reasoning_effort auf „high“, wenn Sie ein mehrschrittiges Rechen- oder Codierproblem lösen lassen — für einfache Fragen reicht „low“ und spart Zeit.

Stolperfallen

reasoning_effort dauerhaft auf high zu lassen kostet bei einfachen Anfragen unnötig Zeit. Der Parameter sollte je nach Aufgabe angepasst werden, statt einen festen Wert zu verwenden.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: Ollama
  • Quelle: HF

Häufige Fragen.

Was macht der Parameter reasoning_effort?

Er steuert, wie viel Rechenzeit das Modell in seine Antwort investiert, von schnellen Fakten bei low bis mehrstufigen Denkschritten bei high.

Wie viel Speicher braucht gpt-oss?

Dank der Mixture-of-Experts-Architektur läuft die 20B-Variante mit rund 16 GB RAM auf normaler Consumer-Hardware, die 120B-Variante braucht deutlich mehr.

Ist gpt-oss das erste offene Modell von OpenAI?

Ja, es ist OpenAIs erstes offen verfügbares Modell seit GPT-2.

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –