Lokale LLMs · Foto: derekGavey, CC BY 2.0
CodeGemma
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Gemma Terms of Use
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
- Rechner mit mindestens 4 GB freiem Speicher (2B) bzw. 8 GB (7B)
- Lokale Inference-Umgebung, die das Modell laden kann
- Editor mit Anbindung für Inline-Code-Vervollständigung
Einordnung
Kleine Modellgröße macht die Einrichtung einfach, der Nutzen bleibt aber auf einfache Autocomplete-Aufgaben begrenzt.
Googles Code-Ableger von Gemma; das 2B ist als schnelle Completion-Engine für schwache Hardware gedacht.
Größen & Hardware
- Verfügbare Größen: 2B / 7B
- Empfohlene Hardware (Q4): 2B: 4 GB · 7B: 8 GB
Im Detail
CodeGemma ist Googles Code-Variante der Gemma-Modellfamilie und richtet sich vor allem an schnelle Code-Vervollständigung direkt im Editor. Die 2B-Version ist bewusst klein gehalten, damit sie auch auf schwächerer Hardware ab rund 4 GB noch flüssig als Autocomplete-Engine läuft, während die 7B-Variante mehr Kontext und Qualität bei höherem Ressourcenbedarf bietet. Für komplexe Coding-Aufgaben, Refactoring oder Chat-artige Programmierhilfe ist es aktuell nicht erste Wahl — dort sind spezialisierte Modelle wie Qwen2.5-Coder oder Codestral leistungsfähiger. CodeGemma eignet sich am ehesten für Nutzer mit begrenzter GPU- oder CPU-Leistung, die trotzdem eine lokale, schnelle Inline-Vervollständigung wollen, statt auf Cloud-Tools zurückzugreifen.
Schritt für Schritt
- 2B- oder 7B-Variante je nach verfügbarer Hardware wählen
- Modell in die lokale Inference-Umgebung laden
- Als Autocomplete-Engine im Editor einbinden
- Im Alltag auf einfache Vervollständigung statt komplexe Aufgaben beschränken
- Bei Refactoring oder Chat-artiger Hilfe zu einem spezialisierten Modell wie Qwen2.5-Coder oder Codestral wechseln
Beispiel aus der Praxis
Auf einem älteren Laptop mit knappem Arbeitsspeicher läuft CodeGemma 2B als Autocomplete beim Schreiben von Python-Code und liefert schnelle Inline-Vorschläge, scheitert aber an einer größeren Refactoring-Aufgabe im selben Projekt.
Praxis-Tipp
Nutzen Sie die 2B-Version für Inline-Autocomplete in Editoren mit Ollama-Anbindung, etwa Continue.dev, auf Laptops ohne dedizierte GPU.
Stolperfallen
Wer CodeGemma wie einen vollwertigen Coding-Chat-Assistenten für Refactoring oder komplexe Aufgaben einsetzt, wird enttäuscht, da es dafür nicht ausgelegt ist. Die Wahl zwischen 2B und 7B sollte sich an der tatsächlich verfügbaren Hardware orientieren, nicht am gewünschten Funktionsumfang.
Lizenz & Quelle
Häufige Fragen.
Ist CodeGemma für Chat-artige Programmierhilfe geeignet?
Nicht als erste Wahl - dafür sind spezialisierte Modelle wie Qwen2.5-Coder oder Codestral leistungsfähiger.
Was unterscheidet die 2B- von der 7B-Variante?
Die 2B-Version ist auf Geschwindigkeit auf schwacher Hardware ausgelegt, die 7B-Version bietet mehr Kontext und Qualität bei höherem Ressourcenbedarf.
Für wen lohnt sich CodeGemma?
Für alle mit begrenzter GPU- oder CPU-Leistung, die trotzdem eine lokale, schnelle Inline-Vervollständigung statt Cloud-Tools wollen.
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
