LocalAI
Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI" erwarten. Läuft auch ohne GPU.
Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI“ erwarten. Läuft auch ohne GPU.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: Docker, Linux, macOS, Windows
Im Detail
LocalAI ist ein selbstgehosteter Server, der die OpenAI-API nachbildet – nicht nur für Chat, sondern auch für Embeddings, Spracherkennung (Whisper), Sprachausgabe und Bildgenerierung. Der Vorteil gegenüber Ollama oder llama.cpp: Man bekommt den kompletten Multimodal-Stack hinter einer einzigen, vertrauten API, sodass bestehende OpenAI-SDK-Anwendungen ohne Codeänderung umgestellt werden können. Läuft auch reinem CPU-Betrieb, wenn auch spürbar langsamer. Der Preis dafür ist mehr Konfigurationsaufwand als bei schlankeren Tools. Lohnt sich für Entwickler, die eine echte On-Premise-Alternative zu OpenAI mit Audio- und Bildfunktionen brauchen, nicht nur einen Chat-Ersatz.
Praxis-Tipp
In bestehenden OpenAI-SDK-Code einfach die Base-URL auf http://localhost:8080/v1 umbiegen – kein Code-Umschreiben nötig, inklusive Whisper-Transkription über denselben Endpunkt.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: localai.io
- Quelle: GitHub
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
