Mit Ollama kannst du ein Sprachmodell auf deinem eigenen Rechner ausführen. Für den Einstieg brauchst du die Anwendung, ein passendes Modell und eine kleine Aufgabe, deren Ergebnis du selbst überprüfen kannst. Dieser Guide führt dich vom Download bis zum ersten Vergleich und erklärt, wo lokaler Betrieb endet, sobald du Cloud-Modelle oder zusätzliche Dienste einbindest.
Was ist Ollama genau?
Ollama ist eine Laufzeitumgebung für Sprachmodelle mit Terminal-Befehlen und einer API. Es stellt nicht selbst die Antwortqualität her: Die hängt vom gewählten Modell, deinen Eingaben und der Aufgabe ab. Neben lokalen Modellen unterstützt Ollama auch Cloud-Funktionen. Für einen lokalen Einstieg wählst du deshalb bewusst ein lokal herunterladbares Modell. Mit der API kannst du später eigene Tools oder selbst gebaute KI-Agenten anbinden.
Welche lokalen KI-Modelle lohnen sich 2026?
Ein Modellname ist noch keine Empfehlung für jede Aufgabe. Llama, Qwen, Mistral, Gemma und DeepSeek bezeichnen Familien mit unterschiedlichen Varianten und Nutzungsbedingungen. Prüfe den konkreten Tag in der offiziellen Modellbibliothek, statt aus der Familie auf Speicherbedarf, Lizenz oder Fähigkeiten zu schließen. Unsere Einordnung der Llama-4-Modelle liefert zusätzlichen Kontext, ersetzt aber nicht die Angaben der tatsächlich ausgewählten Variante.
Als überschaubares Beispiel verwendet diese Anleitung gemma3:1b. Der Tag bezeichnet eine Textvariante mit einer Milliarde Parametern. Er dient hier zum Kennenlernen der Befehle, nicht als Sieger eines Deutsch- oder Qualitätsbenchmarks. Lies die Modellkarte und die verlinkten Lizenzbedingungen vor dem Einsatz.
Welche Hardware brauchst du wirklich?
Die Downloadgröße ist nicht der gesamte Arbeitsspeicherbedarf. Modellvariante, Quantisierung, Kontextlänge, parallele Anfragen und andere Programme beeinflussen die Auslastung. Die Ollama-Dokumentation zur Kontextlänge beschreibt den zusätzlichen Speicherbedarf längerer Kontexte. Eine feste Aussage wie „16 GB reichen für jedes 14B-Modell“ wäre deshalb unzuverlässig.
| Dein Ziel | Erster Schritt | Was du prüfst |
|---|---|---|
| Kurze Notizen zusammenfassen | Kleine lokale Textvariante mit kurzem Eingabetext | Bleiben Namen, Zahlen und Einschränkungen erhalten? |
| Längere Dokumente bearbeiten | Zunächst einen repräsentativen Ausschnitt verwenden | Passt der Kontext, und steigt der Speicherbedarf vertretbar? |
| Code unterstützen lassen | Eine klar abgegrenzte Funktion und vorhandene Tests wählen | Bestehen die relevanten Tests, ohne unerwünschte Änderungen? |
| Vertrauliche Unterlagen verarbeiten | Lokales Modell und die gesamte angebundene Tool-Kette prüfen | Welche Komponente kann Daten lesen, speichern oder weitergeben? |
Starte mit einer kleinen Variante und vergleiche erst dann eine größere, wenn eine konkrete Aufgabe unzureichend gelöst wird. Die Anzeige ollama ps zeigt geladene Modelle und die CPU-/GPU-Zuordnung. Sie ersetzt keine vollständige Speicher- oder Leistungsmessung des Rechners. Für die Abwägung gegenüber API-Nutzung hilft unser Token-Kosten-Guide.
Ollama installieren: zum ersten lokalen Modell
- Öffne den offiziellen Download und folge der Anleitung für Windows, macOS oder Linux. Prüfe dort auch die aktuellen Systemanforderungen.
- Starte Ollama und öffne ein Terminal. Prüfe mit
ollama --version, ob der Befehl gefunden wird. Falls nicht, starte ein neues Terminal und kontrolliere die Installation. - Starte das Beispiel mit
ollama run gemma3:1b. Ist es noch nicht vorhanden, wird das Modell zunächst heruntergeladen; dafür brauchst du eine Internetverbindung. - Gib einen kurzen eigenen, nicht vertraulichen Text ein. Mit
/byeverlässt du die interaktive Sitzung. - Nutze in einem zweiten Terminal
ollama ps, um geladene Modelle zu sehen. Mitollama listsiehst du die lokal gespeicherten Modelle.
Die Befehle orientieren sich an der offiziellen CLI-Referenz. Installation und Download können unterschiedlich lange dauern; eine feste Zehn-Minuten-Zusage wäre nicht sinnvoll.
Welches Modell für welchen Zweck? Ein überprüfbarer Vergleich
Benutze für zwei Modellvarianten denselben kleinen Prüftext. Das folgende Beispiel enthält bewusst wenige Fakten. Es zeigt, wie du Antworten kontrollierst; es ist kein veröffentlichter Modelltest.
Notiz: Lea bestellt drei blaue Ordner. Die Lieferung ist für Dienstag
angekündigt, aber noch nicht bestätigt. Max bestellt zwei rote Ordner.
Fasse die Notiz in zwei Stichpunkten zusammen. Erhalte Namen, Mengen,
Farben und die Unsicherheit des Liefertermins. Ergänze keine Fakten.
| Prüfpunkt | Erwartung aus der Notiz |
|---|---|
| Zuordnung | Lea: drei blaue Ordner; Max: zwei rote Ordner. |
| Unsicherheit | Dienstag ist angekündigt, nicht bestätigt. |
| Keine Erfindungen | Keine Preise, Händler oder zusätzliche Liefertermine. |
| Format | Zwei verständliche Stichpunkte. |
Notiere Modell-Tag, Aufgabe, Fehler, wahrgenommene Wartezeit und deine Rechnerkonfiguration. Ein bestandenes Beispiel sagt nur etwas über diesen Durchlauf aus. Ergänze eigene typische Aufgaben, bevor du eine Variante für deinen Alltag auswählst. Für bessere Aufgabenstellungen findest du weitere Beispiele im Prompt-Engineering-Guide.
Wann lokale KI die richtige Wahl ist — und wann nicht
Lokale Inferenz kann passen, wenn du ausgewählte Aufgaben ohne externe Modell-API bearbeiten und Betrieb, Updates und Speicher selbst verantworten möchtest. Sie erspart nicht die Prüfung der Ergebnisse oder die Freigabe für vertrauliche Daten. Wenn du nur gelegentlich einen Text bearbeitest, brauchst du möglicherweise weder einen neuen Rechner noch ein kostenpflichtiges Abo. Vergleiche zunächst die vorhandenen Möglichkeiten; unser Überblick zu ChatGPT-Alternativen ordnet andere Wege ein.
Lokales Modell, Cloud und zusätzliche Oberflächen unterscheiden
Laut Ollama-FAQ bleiben Prompts beim lokalen Modellbetrieb bei dir. Cloud-Modelle und Websuche sind andere Funktionen. Soll Ollama nur lokal arbeiten, dokumentiert der Anbieter den Schlüssel "disable_ollama_cloud": true in ~/.ollama/server.json oder die Umgebungsvariable OLLAMA_NO_CLOUD=1. Ergänze bestehende Einstellungen, statt eine vorhandene Konfiguration zu überschreiben, und starte Ollama danach neu.
Das schaltet Ollamas Cloud-Funktionen ab, ist aber keine allgemeine Netzwerksperre. Downloads, Updates oder zusätzliche Programme haben eigene Datenwege. Open WebUI ist beispielsweise eine separat konfigurierte Oberfläche. Prüfe deren Modellendpunkte, Erweiterungen und Zugriffe eigenständig.
Ollama bindet die API standardmäßig an 127.0.0.1:11434. Behalte für den Einstieg den lokalen Zugriff bei. Wenn du später n8n-Workflows oder andere Geräte anschließt, kläre Netzwerkzugriff und Berechtigungen vor einer Freigabe.
Die wichtigsten Ollama-Befehle
ollama run gemma3:1b: Beispielmodell laden und starten.ollama pull gemma3:1b: Modell herunterladen.ollama list: lokal gespeicherte Modelle anzeigen.ollama ps: derzeit geladene Modelle anzeigen.ollama stop gemma3:1b: Modell aus dem Arbeitsspeicher entladen.ollama rm gemma3:1b: die lokale Modelldatei entfernen, wenn du sie nicht mehr brauchst.
Drei Anfängerfehler, die du dir sparen kannst
- Bei jeder langsamen Antwort die Hardware aufrüsten: Prüfe zuerst geladene Modelle, Eingabelänge und andere laufende Programme. Vergleiche eine kleinere Variante.
- Bei Verbindungsproblemen die API ins Internet öffnen: Prüfe zunächst, ob Ollama läuft und ob deine Anwendung den richtigen lokalen Endpunkt anspricht. Container oder Proxys können eine andere Konfiguration benötigen.
- Eine plausibel klingende Antwort übernehmen: Kontrolliere die Fakten am Ausgangsmaterial. Nutze für Diagnosen oder rechtliche Entscheidungen keine ungeprüfte Modellausgabe.
Bei konkreten Fehlermeldungen beschreibt die offizielle Fehlerbehebung, wo du Logs und plattformspezifische Hinweise findest.
Häufige Fragen zu Ollama und lokaler KI
Ist Ollama gratis?
Die lokale Software ist kostenlos erhältlich. Modelle haben eigene Lizenzbedingungen; Hardware, Strom und Administration können Kosten verursachen. Bezahlte Cloud-Angebote sind davon getrennt zu betrachten.
Ollama oder LM Studio — was ist besser?
Entscheide anhand der gewünschten Oberfläche, der Modellunterstützung und deiner Integrationen. Diese Anleitung behandelt Ollama. Sie behauptet weder eine Funktionsgleichheit noch einen pauschalen Testsieg gegenüber LM Studio.
Wie kann ich Ollama installieren?
Folge der offiziellen Anleitung für dein Betriebssystem, starte Ollama und führe beispielsweise ollama run gemma3:1b aus. Der erste Modell-Download benötigt eine Internetverbindung.
Läuft lokale KI auch auf Deutsch?
Ob die Ausgabe für deinen Zweck ausreichend ist, hängt von der konkreten Modellvariante und Aufgabe ab. Prüfe deutsche Texte mit eigenen Beispielen auf korrekte Fakten, Grammatik und erhaltene Einschränkungen. Modellgröße allein beantwortet diese Frage nicht.
Quellen und weiterführende Links
- Ollama-Download und verwendeter Modell-Tag
- CLI-Referenz, FAQ, Kontextlänge und Fehlerbehebung
- Ollama-Quellcode und Lizenz
Methode und Stand: Dokumentationsprüfung am 6. September 2026 mit KI-Unterstützung bei Recherche und Redaktion. Auswahlhilfe und Prüftext sind eigene redaktionelle Beispiele. Es wurde kein Hardware- oder Modellbenchmark durchgeführt; Antwortqualität und Laufzeit für deinen Rechner bleiben zu prüfen.

Florian Schröder ist Gründer von AI Rockstars, KI-Stratege und Prompt Engineer. Er berät Unternehmen bei der praktischen Implementierung von generativer KI und Automation.









