machichdigital
ToolRunner-ToolsLizenz: MIT

LocalAI

Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI" erwarten. Läuft auch ohne GPU.

× kopiert× heruntergeladenBewertung:

Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI“ erwarten. Läuft auch ohne GPU.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: Docker, Linux, macOS, Windows

Im Detail

LocalAI ist ein selbstgehosteter Server, der die OpenAI-API nachbildet – nicht nur für Chat, sondern auch für Embeddings, Spracherkennung (Whisper), Sprachausgabe und Bildgenerierung. Der Vorteil gegenüber Ollama oder llama.cpp: Man bekommt den kompletten Multimodal-Stack hinter einer einzigen, vertrauten API, sodass bestehende OpenAI-SDK-Anwendungen ohne Codeänderung umgestellt werden können. Läuft auch reinem CPU-Betrieb, wenn auch spürbar langsamer. Der Preis dafür ist mehr Konfigurationsaufwand als bei schlankeren Tools. Lohnt sich für Entwickler, die eine echte On-Premise-Alternative zu OpenAI mit Audio- und Bildfunktionen brauchen, nicht nur einen Chat-Ersatz.

Praxis-Tipp

In bestehenden OpenAI-SDK-Code einfach die Base-URL auf http://localhost:8080/v1 umbiegen – kein Code-Umschreiben nötig, inklusive Whisper-Transkription über denselben Endpunkt.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT