Lokales LLM (lokale KI)
Ein Sprachmodell, das auf eigener Hardware läuft statt in der Cloud eines Anbieters.
Erklärung
Ein lokales LLM ist ein großes Sprachmodell, das auf eigener Hardware betrieben wird, etwa auf einem Laptop, einer Workstation oder einem Server im eigenen Rechenzentrum. Eingaben und Daten verlassen dabei nicht die eigene Infrastruktur.
So funktioniert's
Man lädt ein Open-Weight-Modell herunter und betreibt es mit einer Laufzeitumgebung wie Ollama, LM Studio, llama.cpp oder vLLM. Durch Quantisierung, also eine komprimierte Speicherung der Modellgewichte, laufen auch größere Modelle mit weniger Speicher. Anwendungen greifen über eine lokale Schnittstelle darauf zu.
Praxisbeispiel
Ein Maschinenbauer nutzt ein lokal betriebenes Modell, um Konstruktionsunterlagen und Servicehandbücher zu durchsuchen, ohne dass vertrauliche Entwicklungsdaten an externe Anbieter übertragen werden.
Warum es wichtig ist
Lokale Modelle geben volle Kontrolle über Daten, Kosten und Verfügbarkeit. Bei sensiblen Informationen und strengen Compliance-Anforderungen sind sie oft die Voraussetzung dafür, KI überhaupt einsetzen zu dürfen.
Lokale KI: Welche Modelle gibt es?
Lokal betreiben lassen sich sogenannte Open-Weight-Modelle, deren Gewichte veröffentlicht sind. Bekannte Modellfamilien sind Llama von Meta, Mistral, Qwen von Alibaba, Gemma von Google, DeepSeek und gpt-oss von OpenAI. Es gibt sie in verschiedenen Größen, gemessen in Milliarden Parametern.
Als grobe Orientierung: Modelle mit etwa 7 bis 20 Milliarden Parametern laufen quantisiert auf einem aktuellen Laptop oder einer einzelnen Grafikkarte und eignen sich für Zusammenfassungen, Klassifikation und einfache Assistenzaufgaben. Modelle mit 70 Milliarden Parametern und mehr brauchen deutlich mehr Grafikspeicher, meist in Form von Server-GPUs, kommen dafür bei vielen Aufgaben nah an Cloud-Modelle heran. Welche Größe reicht, zeigt nur ein Test mit echten Aufgaben.
Lokales LLM vs. Cloud-KI: Vor- und Nachteile
Vorteile: Daten bleiben im Haus, es gibt keine Abhängigkeit von Preisänderungen oder Nutzungsbedingungen eines Anbieters, und bei hoher, gleichmäßiger Auslastung sind die Kosten pro Anfrage oft niedriger. Lokale Modelle funktionieren auch ohne Internetverbindung.
Nachteile: Hardware und Betrieb kosten Geld und Know-how. Die stärksten Modelle für komplexes Denken, lange Kontexte und Agenten sind meist nur in der Cloud verfügbar. Updates, Sicherheit und Skalierung liegen in der eigenen Verantwortung. Viele Unternehmen kombinieren deshalb beides: lokale Modelle für sensible Daten und Routineaufgaben, Cloud-Modelle mit EU-Verträgen für anspruchsvolle Aufgaben mit unkritischen Daten. Mehr dazu unter On-Premise Hosting.
Häufige Fragen
Was ist ein lokales LLM?
Ein lokales LLM ist ein Sprachmodell, das auf eigener Hardware läuft, statt über die Cloud eines Anbieters genutzt zu werden. Anfragen und Daten bleiben dadurch in der eigenen Infrastruktur.
Welche Hardware brauche ich für ein lokales LLM?
Für kleinere Modelle reicht ein aktueller Rechner mit 16 bis 32 GB Arbeitsspeicher oder eine Grafikkarte mit ausreichend Speicher. Große Modelle für den Einsatz im Team brauchen einen Server mit einer oder mehreren leistungsstarken GPUs.
Ist lokale KI DSGVO-konform?
Lokaler Betrieb erleichtert die DSGVO-Konformität erheblich, weil keine Daten an Dritte übertragen werden. Rechtsgrundlage, Zugriffsrechte und Löschkonzepte sind trotzdem nötig.
Was ist Ollama?
Ollama ist ein kostenloses Open-Source-Werkzeug, mit dem sich Open-Weight-Modelle mit wenigen Befehlen herunterladen und lokal ausführen lassen. Es stellt eine Schnittstelle bereit, über die andere Anwendungen das Modell nutzen können.