GTE / gte-Qwen2
Alibabas Embedding-Reihe; die Qwen2-Varianten gehören zu den stärksten offenen Embeddings, brauchen aber mehr Rechenleistung.
Alibabas Embedding-Reihe; die Qwen2-Varianten gehören zu den stärksten offenen Embeddings, brauchen aber mehr Rechenleistung.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Im Detail
GTE (General Text Embeddings) ist Alibabas Embedding-Modellreihe, die neueste Generation gte-Qwen2 baut auf dem Qwen2-Sprachmodell auf und zählt in Benchmarks wie MTEB zu den stärksten frei verfügbaren Embeddings – auch für Deutsch brauchbar. Der Preis dafür: Die großen Varianten (1.5B, 7B Parameter) brauchen deutlich mehr VRAM und Rechenzeit als kompakte Alternativen wie BGE oder E5-small. Lohnt sich, wenn beim eigenen RAG-System die Trefferqualität wichtiger ist als Geschwindigkeit und eine ordentliche GPU vorhanden ist. Ohne starke Hardware lieber zu einer kleineren GTE- oder Jina-Variante greifen.
Praxis-Tipp
Als Embedding-Modell in Open WebUI oder LlamaIndex hinterlegen, z. B. gte-Qwen2-7B-instruct bei ausreichend VRAM – sonst die kleinere GTE-Basisvariante nehmen.
Siehe auch
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: HF
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
