Sie wollen eine KI, mit der Sie sprechen können, ohne dass Ihre Eingaben Ihr Gerät verlassen, und sie soll mit Ihren eigenen Notizen arbeiten, nicht mit einer Cloud, die Sie nicht kontrollieren. Ein Local LLM Setup bringt Sie an einem Nachmittag fast ans Ziel. Der Teil, den fast jeder Leitfaden auslässt, ist der Teil, auf den es ankommt: Sobald das Modell läuft, weiß es immer noch nichts über Sie, Ihre Projekte oder die Dateien auf Ihrer Festplatte. Dieser Text führt Sie durch die gesamte Einrichtung, von der Modellwahl bis zur Dimensionierung Ihrer Hardware, und dann durch den Schritt, der aus einem generischen lokalen Modell eines macht, das aus Ihrem echten Kontext antwortet.
Die wichtigsten Erkenntnisse
- Ein Local LLM Setup bedeutet, das Modell auf Ihrer eigenen Hardware laufen zu lassen, sodass nichts, was Sie eingeben, an eine Cloud-API gesendet wird. Es ist 2026 für die meisten Laptops wirklich praktikabel.
- Der schnellste Weg ist eine Laufzeitumgebung plus ein Modell: Ollama oder LM Studio installieren, ein 4B- bis 8B-Modell laden, und Sie haben in Minuten einen privaten Assistenten.
- Die wichtigste Kennzahl ist der Speicher. Rechnen Sie mit etwa 0,6 bis 0,7 GB VRAM oder Unified Memory pro Milliarde Parameter bei der üblichen Q4-Quantisierung.
- Lokal zu betreiben ist pro Abfrage kostenlos und offline-fähig, aber ein Basismodell hat keine Ahnung, wer Sie sind. Es kennt nur seine Trainingsdaten.
- Damit ein lokales Modell Ihre Arbeit wirklich kennt, ergänzen Sie Retrieval über Ihre eigenen Notizen mit einem lokalen Embedding-Modell. Das, und nicht ein größeres Modell, nimmt den generischen Eindruck.
Was ist ein Local LLM Setup (und ist es überhaupt möglich)
Ja, Sie können ein leistungsfähiges Sprachmodell vollständig auf Ihrem eigenen Rechner betreiben, ohne API-Schlüssel und nach dem Download ohne Internet. Ein Local LLM Setup ist genau das: Die Modellgewichte liegen auf Ihrer Festplatte, die Inferenz läuft auf Ihrer CPU oder GPU, und Ihre Eingaben verlassen das Gerät nie.
Vor zwei Jahren bedeutete das, C++ zu kompilieren und Treiber-Konflikte zu debuggen. Heute ist es eine einzige Installation und ein Befehl. Die Modelle sind zugleich kleiner und schlauer geworden, sodass ein 4B- bis 8B-Modell heute Alltagsaufgaben bewältigt, für die früher etwas viermal so Großes nötig war. Für viele Arbeitsabläufe ist lokal eher der sinnvolle Standard als ein Kompromiss.
Die drei Gründe, aus denen Menschen lokal arbeiten, sind konstant:
- Datenschutz. Ihre Eingaben und Dokumente bleiben auf Ihrer Hardware, von keinem Anbieter protokolliert. Das zählt umso mehr, je persönlicher Ihre Notizen sind.
- Kosten. Nach dem einmaligen Download gibt es keine Abrechnung pro Token. Sie können es den ganzen Tag laufen lassen.
- Offline und Kontrolle. Es funktioniert im Flugzeug, und Sie wählen genau, welches Modell und welche Version Sie ausführen.
Wählen Sie Ihre Laufzeitumgebung: Ollama oder LM Studio
Sie bauen kein Local LLM von Grund auf. Sie installieren eine Laufzeitumgebung, die das Modell für Sie verwaltet. Zwei decken fast jeden ab.
Ollama ist der Standard für die Kommandozeile. Ein Installationsbefehl, dann erledigen ollama pull und ollama run das Herunterladen, das GPU-Offloading und das Serving. Es stellt eine OpenAI-kompatible API unter localhost:11434 bereit, was bedeutet, dass jedes Tool, das bereits das OpenAI-Format spricht, mit einer einzigen Zeilenänderung darauf zeigen kann. Am besten für Skripting, Automatisierung und Headless-Setups.
LM Studio ist die grafische Wahl. Es bietet einen Modell-Browser, Downloads mit einem Klick, ein integriertes Chat-Fenster zum Testen und einen lokalen Server auf Port 1234, der ebenfalls OpenAI-kompatibel ist. Am besten, wenn Sie herumklicken, Modelle vergleichen und Einstellungen anpassen wollen, ohne ein Terminal anzufassen.
Sie müssen sich nicht für immer entscheiden. Ein verbreitetes Muster ist LM Studio zum Erkunden und Auswählen eines Modells, Ollama, um es im Hintergrund laufen zu lassen. Beide setzen auf derselben zugrunde liegenden Engine (llama.cpp) auf, sodass die Modellqualität in beiden Fällen dieselbe ist.
| Laufzeitumgebung | Oberfläche | Am besten für | Standard-lokale API |
|---|---|---|---|
| Ollama | Kommandozeile | Skripting, Automatisierung, Hintergrund-Serving | localhost:11434 |
| LM Studio | Grafische App | Modelle erkunden, testen, ohne Terminal | localhost:1234 |
| llama.cpp | Low-Level-Engine | Maximale Kontrolle und Tuning | Sie konfigurieren es |
So erstellen Sie Ihr Local LLM: eine Schritt-für-Schritt-Einrichtung
Sie trainieren kein Modell, Sie konfigurieren eines. Hier ist der praktische Ablauf.
- Installieren Sie eine Laufzeitumgebung. Ollama über seinen einzigen Installationsbefehl oder LM Studio über seinen normalen App-Installer.
- Laden Sie ein auf Ihr Gerät abgestimmtes Modell. Zum Beispiel
ollama pull qwen3:8b, oder nutzen Sie den Browser von LM Studio, um eines herunterzuladen. Fangen Sie klein an, Sie können immer größer werden. - Führen Sie es einmal aus, um zu prüfen, ob es funktioniert.
ollama run qwen3:8bbringt Sie in einen Chat im Terminal. Geben Sie eine Eingabe ein, drücken Sie Enter. Geben Sie/byeein, um zu beenden. Das Modell bleibt für schnelle Neustarts zwischengespeichert. - Prüfen Sie, ob die lokale API läuft. Bei Ollama sollte
curl http://localhost:11434/v1/modelsIhr Modell auflisten. Bei LM Studio starten Sie den Server und rufenlocalhost:1234/v1/modelsauf. - Richten Sie Ihre Tools auf den lokalen Endpunkt. Die meisten Apps, die eine benutzerdefinierte Basis-URL unterstützen, akzeptieren die lokale Adresse. Die OpenAI-Python-Bibliothek arbeitet mit einem lokalen Server, indem sie
base_urlüberschreibt, sodass bestehender Code mit einer Zeile migriert. - Speichern Sie ein Preset. Legen Sie einen projektspezifischen System-Prompt und ein sinnvolles Kontextfenster fest, damit Sie sich nicht in jeder Sitzung wiederholen.
Das ist ein funktionierender privater Assistent. Die Lücke ist jetzt, dass es nur weiß, worauf es trainiert wurde. Es kennt nicht Ihre Preise, Ihre letzten drei Entscheidungen oder das Dokument, das Sie gestern geschrieben haben.
Welche Local-LLM-Modelle Sie 2026 betreiben sollten
Passen Sie das Modell an Ihren Speicher an, nicht an ein Leaderboard. Ein Modell, das zu groß für Ihr Gerät ist, läuft teilweise auf die CPU über und kriecht.
- Einstieg, 3B bis 4B. Qwen3 4B oder Gemma 3 4B. Rund 3 GB. Läuft auf einem bescheidenen Laptop im Gesprächstempo, gut für schnelle Fragen und Entwürfe.
- Alltag, 7B bis 8B. Qwen3 8B oder eine Llama-Variante. Der Sweet Spot für die meisten mit 16 GB, mit deutlich besserem Reasoning und besserer Anweisungsbefolgung. DeepSeek R1 7B ist die Wahl, wenn Sie schrittweises Reasoning wollen.
- Embeddings, klein und separat.
nomic-embed-text, um Ihre Notizen in durchsuchbare Vektoren zu verwandeln. Nutzen Sie dafür nicht Ihr Chat-Modell. Ein dediziertes Embedding-Modell ist kleiner, schneller und genauer darin, das richtige Dokument zu finden.
Bleiben Sie bei der Q4_K_M-Quantisierung, sofern Sie keinen konkreten Grund dagegen haben. Sie bietet 4-Bit-Präzision mit kaum spürbarem Qualitätsverlust und das beste Verhältnis aus Geschwindigkeit und Größe für die meisten Geräte.

Welcher Laptop kann ein Local LLM betreiben, und ist es teuer
Die ehrliche Antwort zur Hardware: Speicher ist fast die ganze Geschichte, und die laufenden Kosten sind nahezu null.
Als grobe Schätzung bei Q4-Quantisierung rechnen Sie mit etwa 0,6 bis 0,7 GB VRAM (oder Unified Memory auf Apple Silicon) pro Milliarde Parameter. Das ergibt eine grobe Landkarte:
- 8 GB Speicher: ein 3B-Modell läuft komfortabel für den Chat.
- 16 GB: 7B- und 8B-Modelle laufen gut. Das ist die praktische Alltagsklasse.
- Nur CPU: in Ordnung für 1B- bis 3B-Modelle und geduldige Batch-Arbeit. Für die interaktive Nutzung von 7B und mehr macht eine GPU oder Apple Silicon einen echten Unterschied.
Apple-Silicon-Macs sind hier wirklich stark, weil der Speicher geteilt wird, sodass ein MacBook mit 16 GB oder 32 GB über seiner Gewichtsklasse spielt. NVIDIA mit CUDA bleibt der am besten unterstützte GPU-Weg. AMD über ROCm funktioniert unter Linux, aber die Einrichtung ist aufwendiger.
Sind Local LLMs teuer im Betrieb? Nicht im laufenden Sinne. Es gibt keine Gebühr pro Abfrage und kein Abo für das Modell selbst. Die einzigen Kosten sind die Hardware, die Sie ohnehin besitzen, plus der Strom für den Betrieb. Die größere Steuer ist die Zeit, die Sie mit der Wahl eines passenden Modells verbringen und damit, den klassischen Fehler unten zu vermeiden.
Ein größeres Modell behebt kein Local LLM, das generisch klingt. Der richtige Kontext tut es.
Der Schritt, den jeder Leitfaden auslässt: Machen Sie es mit Ihrem Kontext vertraut
Hier ist die Wand, gegen die Menschen laufen. Das Local LLM Setup funktioniert, das Modell ist schnell, und jede Antwort fühlt sich immer noch an, als käme sie von einem Fremden. Das ist erwartbar. Ein Basismodell kennt nur seine Trainingsdaten. Es hat nie Ihre Notizen gesehen, Ihre Projekte oder die Entscheidung, die Sie letzten Monat geändert haben.
Die Lösung, auf die sich alle geeinigt haben, ist weder Fine-Tuning noch das Training eines eigenen Modells. Für das Ziel "kenne meine Sachen" ist Fine-Tuning meist eine kostspielige Ablenkung. Die Antwort ist Retrieval: Lassen Sie das Modell zuerst Ihre eigenen Dokumente durchsuchen und dann mit dem antworten, was es gefunden hat. Sie belassen das Modell, wie es ist, und geben ihm die richtige Information zum Abfragezeitpunkt.
Mechanisch brauchen Sie zwei Teile, die zusammenarbeiten: ein Chat-Modell, das die Antwort schreibt, und ein separates Embedding-Modell (wie nomic-embed-text), das die relevanten Notizen findet. Ihre Dateien werden in Stücke geteilt, in Vektoren umgewandelt und lokal gespeichert. Wenn Sie eine Frage stellen, werden die nächstgelegenen Stücke als Kontext hereingezogen. Tools wie LM Studio und AnythingLLM bringen diesen Retrieval-Ablauf eingebaut mit, sodass Sie eines auf einen Notizordner richten und noch am selben Tag Fragen stellen können.
Setzen Sie die Erwartungen ehrlich. Ein lokales Modell, das über Ihre Markdown-Dateien antwortet, wird nicht immer Wort für Wort an ein Top-Cloud-Modell heranreichen. Aber es ist mehr als gut genug, um Ihr Gedächtnis anzustoßen, das richtige Dokument zutage zu fördern und in Ihrem Kontext zu entwerfen, alles, ohne dass etwas Ihr Gerät verlässt.
Hinter der Einrichtung steckt jedoch ein schwierigeres Problem: den Berg an Notizen so zu halten, dass er es wert ist, daraus abzurufen.
Warum ein Notizordner nicht die Ziellinie ist
Retrieval ist nur so gut wie das, was es abruft. Zwei Dinge brechen die meisten persönlichen lokalen KI-Setups leise:
- Das Wissen ist verstreut. Ihr echter Kontext liegt nicht in einem ordentlichen Ordner. Er lebt in Markdown-Dateien, PDFs, diktierten Sprachnotizen, Notion-Seiten und Ihrem öffentlichen Profil. Ein RAG-Setup, das nur einen Ordner liest, ist blind für das meiste, was Sie ausmacht.
- Das Wissen veraltet. Sie betten Ihre Notizen einmal ein, dann ändern sich Ihre Preise, Sie beheben einen Fehler, Ihre Meinung entwickelt sich weiter. Die Vektoren zeigen weiter auf die alten Fakten. Das erneute Einbetten von Hand ist eine Aufgabe, die niemand durchhält, sodass das Setup verrottet und die Antworten wieder ins Generische abdriften.
Hier braucht ein Local LLM Setup eine Schicht, die es nicht mitbringt: etwas, das Ihren Kontext von überall her sammelt, wo er lebt, ihn für Retrieval strukturiert und ihn von selbst aktuell hält, während er auf Ihrem Gerät bleibt.
Diese Schicht soll Locul sein. Es läuft local-first auf Ihrem Mac oder Windows-Gerät, sodass standardmäßig nichts Ihren Rechner verlässt. Es nutzt lokale Embeddings (Ollama mit nomic-embed-text, genau der Stack, den dieser Leitfaden empfiehlt), sodass Ihre Notizen privat indexiert werden. Und statt Sie zu bitten, alles in einen Ordner zu ziehen, liest es, was Sie ohnehin produzieren: lokale Markdown-Dateien, PDFs, Ihren Notion-Cache, Diktate, die Sie über Tools wie Contextli erfassen, und Ihr LinkedIn-Profil. Es destilliert das zu Memories, markiert alte Fakten als überholt, wenn sie sich ändern, und stellt das Ergebnis Ihrem Local LLM über MCP bereit. Sie können Ihr Gehirn weiterhin direkt ansehen und bearbeiten, so wie in einer Notizen-App. Der Punkt ist, dass Sie aufhören, der Wartungsarbeiter zu sein: Das Gehirn baut sich selbst auf und bleibt aktuell, sodass Ihr privates Modell immer aus Ihrem echten, aktuellen Kontext antwortet. Sie können kostenlos mit 500 Memories und ausschließlich lokaler KI starten, ohne Kreditkarte.
Wenn Ihr Ziel ein privates Setup ist, das Ihre bestehenden Tools liest, statt eine Migration zu erzwingen, lohnt es sich zu sehen, wie ein handfreies Gehirn im Vergleich dazu abschneidet, KI in einen einzelnen Vault zu verdrahten, was der Kompromiss hinter Obsidian als Second Brain und der Frage Obsidian vs Notion ist.
Lokale vs. Cloud-KI: ein ehrlicher Vergleich
Keines ist strikt besser; es hängt davon ab, was Ihnen wichtig ist.
| Local LLM Setup | Cloud-API (ChatGPT, Claude) | |
|---|---|---|
| Datenschutz | Alles bleibt auf Ihrem Gerät | Eingaben an einen Anbieter gesendet |
| Kosten | Pro Abfrage kostenlos nach dem Download | Pro Token oder Abo |
| Spitzenqualität | Sehr gut, unter den Top-Frontier-Modellen | Das Beste verfügbar |
| Offline | Funktioniert vollständig offline | Braucht eine Verbindung |
| Kennt Ihren Kontext | Nur, wenn Sie Retrieval ergänzen | Nur, wenn Sie Memory oder Dateien ergänzen |
| Einrichtungsaufwand | Eine Installation, dann Tuning | Null |
Beachten Sie die letzte Zeile. Sowohl ein lokales Modell als auch ein Cloud-Chatbot wissen zu Beginn nichts über Sie. Cloud-Tools versuchen es mit eingebauten Memory-Boxen zu lösen, die gedeckelt und pro Plattform getrennt sind. Für die tiefere Version dieser Geschichte siehe ChatGPT Memory vs Claude Memory und wie Sie Ihrer KI ein Gedächtnis geben, das wirklich bleibt. Der rote Faden ist überall derselbe: Das Modell ist selten der Engpass, Ihr Kontext ist es.
Häufig gestellte Fragen
Ist es möglich, ein LLM lokal auf einem normalen Laptop zu betreiben?
Ja. Mit 16 GB Speicher können Sie 7B- und 8B-Modelle bequem über Ollama oder LM Studio betreiben, und mit 8 GB ein 3B-Modell für den Chat. Apple-Silicon-Macs schneiden besonders gut ab, weil der Speicher geteilt wird. Die Installation ist ein Schritt und der erste Modell-Download sind ein paar Gigabyte.
Wie erstelle ich mein eigenes Local-LLM-Modell?
Für fast jeden gilt: Sie trainieren keines, Sie konfigurieren ein bestehendes. Installieren Sie eine Laufzeitumgebung, laden Sie ein Modell, das in Ihren Speicher passt, und richten Sie es optional mit Retrieval auf Ihre eigenen Notizen, damit es aus Ihrem Kontext antwortet. Ein Modell von Grund auf zu trainieren oder feinzutunen ist teuer und selten das richtige Werkzeug für "lass es meine Dokumente kennen".
Sind Local LLMs teuer im Betrieb?
Nicht in den laufenden Kosten. Es gibt keine Gebühr pro Abfrage und kein Abo für das Modell selbst. Sie zahlen einmal für Hardware, die Sie wahrscheinlich schon besitzen, plus Strom. Die Hauptinvestition ist die Zeit für die Wahl eines Modells, das in Ihren Speicher passt, damit es schnell läuft.
Was ist das beste Local LLM Setup, um meine eigenen Notizen zu nutzen?
Ein Chat-Modell im Bereich 7B bis 8B plus ein dediziertes Embedding-Modell wie nomic-embed-text, mit einer Retrieval-Schicht, die Ihre Dateien liest. Die Modellwahl zählt weniger, als das zugrunde liegende Wissen vollständig und aktuell zu halten, da Retrieval nur zutage fördern kann, was Sie tatsächlich einspeisen und pflegen.
Warum klingt mein Local LLM nach der Einrichtung immer noch generisch?
Ein Basismodell kennt nur seine Trainingsdaten. Bis Sie Retrieval über Ihre eigenen Dokumente ergänzen und diese Notizen frisch halten, hat es keinen Zugriff auf Ihre Projekte, Entscheidungen oder Ihr Schreiben. Das, und nicht ein größeres Modell, nimmt den generischen Eindruck. Chat-Modell, Embedding-Modell und Speicher alle lokal zu betreiben, hält das Ganze durchgehend privat.
---
Ein Local LLM Setup verschafft Ihnen an einem Nachmittag Datenschutz, null Kosten pro Abfrage und Offline-Kontrolle. Das Modell ist der einfache Teil. Was ein privates Spielzeug von einem wirklich nützlichen Assistenten unterscheidet, ist, ob es aus Ihrem echten Kontext antwortet und diesen Kontext aktuell hält, ohne dass Sie einen Ordner hüten. Bringen Sie zuerst die Laufzeitumgebung zum Laufen, und geben Sie ihr dann ein Gehirn, aus dem es sich lohnt, abzurufen.