machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Llama 3.1 Community License

Llama 3.1

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Llama 3.1 Community License

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

Keine besonderen — direkt loslegen.

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: 8B / 70B / 405B
  • Empfohlene Hardware (Q4): 8B: 8 GB · 70B: 48–64 GB

Benutzungsanleitung

Metas Allrounder — der sichere Einstieg in lokale KI.

Installation (mit Ollama):

ollama run llama3.1

Lädt die 8B-Variante (~4,7 GB), braucht rund 8 GB RAM. Größere Varianten: llama3.1:70b (ab 48 GB RAM/VRAM).

Wofür gut: Alltag, Zusammenfassungen, E-Mails, solides Deutsch, brauchbarer Code. Sehr ausgewogen — wer nur ein Modell will, nimmt dieses.

Erster Test: „Fasse den folgenden Text in drei Stichpunkten zusammen: …“ — die Antwortqualität zeigt sofort, ob die Größe zur Hardware passt (stockt es stark, kleinere Variante wählen).

Im Detail

Llama 3.1 war lange der Referenzpunkt unter den offenen Sprachmodellen und ist mit Kontextfenstern von 128K Tokens auch für längere Dokumente oder Chatverläufe geeignet. Die kleine 8B-Variante läuft bereits mit rund 8 GB Speicher und eignet sich damit gut für Laptops oder ältere GPUs, während 70B und 405B deutlich mehr Rechenleistung (48–64 GB bzw. Server-Hardware) verlangen, dafür aber näher an große Cloud-Modelle heranreichen. Für Deutsch liefert Llama 3.1 ordentliche, aber nicht herausragende Ergebnisse – neuere Modelle wie Llama 3.3, Qwen 2.5/3 oder Mistral Small 3.x sind bei gleicher oder kleinerer Größe oft sprachlich präziser. Wer als Allround-Chat-Modell auf schwacher Hardware startet und stabile, gut dokumentierte Community-Unterstützung will, ist mit Llama 3.1 8B trotzdem gut bedient.

Praxis-Tipp

Auf Hardware mit 8 GB RAM/VRAM mit der 8B-Variante starten; reicht die Qualität nicht, direkt Llama 3.3 oder Qwen 2.5 im gleichen Größenbereich vergleichen.

Siehe auch

Lizenz & Quelle

  • Lizenz: Llama 3.1 Community License
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –

Qwen 2.5

Alibabas Arbeitspferd: stark in vielen Sprachen (auch Deutsch), Mathe und strukturierten Ausgaben (JSON). Die Apache-Größen sind auch kommerziell völlig frei.

Apache-2.0 (7B/14B/32B); 3B + 72B: eigene Qwen-Lizenz♥ –⧉ –