Ratgeber/Ollama braucht zu viel Speicher
Ollama braucht auf dem Mac zu viel Speicher? So siehst du, was geladen ist, und entlädst es
Kurze Antwort
Ollama behält ein Modell nach seiner letzten Antwort fünf Minuten im Speicher, damit die nächste Frage schnell beantwortet wird. Deshalb belegt es noch mehrere Gigabyte, wenn du es nicht mehr nutzt. Führe ollama ps aus, um zu sehen, welche Modelle geladen sind und wann jedes entladen wird, und ollama stop, gefolgt vom Namen eines Modells, um es sofort zu entladen. Wie viel Speicher ein Modell braucht, hängt von seiner Größe ab und von der Kontextlänge, mit der du es ausführst. Vitals, ein Systemmonitor für den Mac, zeigt Ollamas Speicher, die Auslastung des Grafikchips und den Speicherdruck des Mac in der Menüleiste.
So siehst du Ollamas Speicher und gibst ihn frei
- 01 Führe im Terminal
ollama psaus. Jede Zeile ist ein Modell im Speicher, mit seiner Größe, ob es auf dem Grafikchip läuft und wie lange es noch dauert, bis es entladen wird. - 02 Entlade eines sofort mit
ollama stop, gefolgt von seinem Namen, zum Beispielollama stop llama3.2. Der Speicher ist in ein, zwei Sekunden wieder frei. - 03 Öffne die Aktivitätsanzeige, klicke auf „Speicher“ und sieh dir unten „Speicherdruck“ an. Grün heißt, das Modell passt. Gelb oder Rot, während ein Modell geladen ist, heißt, es ist zu groß für das, was sonst noch offen ist.
- 04 Damit Modelle früher entladen werden, stell ein, wie lange sie bleiben. Führe im Terminal
launchctl setenv OLLAMA_KEEP_ALIVE 1maus, beende dann Ollama über sein Symbol in der Menüleiste und öffne es wieder. - 05 Fehlt dem Mac Speicher, sobald ein Modell geladen ist, nimm ein kleineres Modell oder eine kleinere Version desselben.
ollama listzeigt die, die du hast, und ihre Größen.
Ein Keep-alive von 0 entlädt ein Modell, sobald es geantwortet hat; -1 hält es geladen, bis du es stoppst. Apps, die mit Ollama sprechen, können mit jeder Anfrage einen eigenen Wert setzen. Deshalb bleibt ein Modell manchmal länger, als du eingestellt hast.
Ein Modell auf dem eigenen Mac auszuführen heißt, es ganz im Speicher zu halten. Ein Mac mit Apple Chip teilt einen einzigen Speicher zwischen Prozessor und Grafikchip. Ein Modell, das anderswo eine eigene Grafikkarte bräuchte, passt hier also, aber es geht von demselben Speicher ab, den deine Apps nutzen. Ein Modell mit 8 GB auf einem Mac mit 16 GB lässt 8 GB für alles andere. Dass Ollama so viel belegt, ist kein Speicherleck; es hält das Modell. Die Tabelle zeigt, was den Wert bestimmt.
Was Ollamas Speicher bestimmt
| Was du siehst | Warum | Was du tun kannst |
|---|---|---|
| Mehrere GB belegt, nachdem du aufgehört hast zu chatten | Das Modell bleibt fünf Minuten geladen | ollama stop oder ein kürzeres Keep-alive |
| Mehr Speicher als die Dateigröße des Modells | Auch der Kontext, mit dem du es ausführst, braucht Speicher | Eine kleinere Kontextlänge nutzen |
| Zwei Modelle gleichzeitig im Speicher | Ein zweites Modell wurde angefragt, bevor das erste entladen war | ollama ps, dann das stoppen, das du nicht nutzt |
| Speicherdruck gelb oder rot, der Mac langsam | Das Modell ist zu groß für den freien Speicher | Ein kleineres Modell, oder andere Apps schließen |
| Langsame Antworten und eine beschäftigte CPU | Ein Teil des Modells hat nicht auf den Grafikchip gepasst | ollama ps zeigt die Aufteilung; ein kleineres Modell nutzen |
Warum Ollama Modelle geladen lässt
Ein Modell zu laden heißt, Gigabyte von der Festplatte in den Speicher zu lesen, und das dauert Sekunden bis zu einer Minute. Das bei jeder Frage zu tun würde jede Antwort langsam machen. Deshalb behält Ollama das Modell fünf Minuten nach der letzten Nutzung und entlädt es danach. Jede neue Frage stellt die Uhr zurück. Fragt eine App auf deinem Mac das Modell alle paar Minuten etwas, zum Beispiel die Autovervollständigung eines Editors, wird das Modell nie entladen.
Die Einstellung heißt Keep-alive. OLLAMA_KEEP_ALIVE ändert den Standard für alles; der Wert 0 gibt den Speicher sofort zurück, dafür ist die erste Antwort jedes Mal langsam.
Wie viel Speicher ein Modell braucht
In der Regel ist der Speicher so groß wie die Datei des Modells plus Platz für die Unterhaltung. Ein Modell mit 8 Milliarden Parametern in der üblichen Komprimierung hat etwa 5 GB; eines mit 30 Milliarden etwa 20 GB. Die Größe auf der Festplatte, die ollama list zeigt, ist eine gute erste Schätzung.
Die Kontextlänge ist der Teil, den viele übersehen. Sie bestimmt, wie viel Text das Modell auf einmal im Blick behalten kann, und der Speicher dafür wird reserviert, wenn das Modell lädt, ob du ihn füllst oder nicht. Ein langer Kontext bei einem kleinen Modell kann mehr brauchen als das Modell selbst. Zeigt ollama ps eine Größe weit über der der Datei, liegt es am Kontext.
Passt das Modell auf deinen Mac?
Der ehrliche Test ist der Speicherdruck, wenn das Modell geladen ist und deine üblichen Apps offen sind. Grün: Es passt. Gelb: macOS komprimiert Speicher, um Platz zu schaffen, und alles wird etwas langsamer. Rot: Es lagert auf die Festplatte aus, und das Modell und der Mac werden beide langsam. Ein Modell, das teilweise auf dem Prozessor läuft, weil es nicht auf den Grafikchip gepasst hat, ist ebenfalls viel langsamer; ollama ps sagt, wie es aufgeteilt wurde.
Eine kleinere Version desselben Modells kostet meist wenig Qualität und viel weniger Speicher. Auf einem Mac mit 16 GB lassen Modelle bis etwa 8 GB Platz zum Arbeiten. Wie der Mac ihn teilt, steht unter Gemeinsamer Arbeitsspeicher.
LM Studio und andere Apps
Dasselbe gilt für jede App, die Modelle lokal ausführt. LM Studio behält ein Modell geladen, bis du es auswirfst oder seine Leerlaufzeit abläuft, und zeigt die geladenen Modelle oben in seinem Fenster. Editoren und Chat-Apps, die ein Modell für dich ausführen, machen dasselbe im Hintergrund. Der Speicher ist das Modell, egal welche App es hält.
Was Vitals ergänzt
Vitals zeigt, was ein geladenes Modell den Mac kostet, dort, wo du es bei der Arbeit siehst.
- Ollamas Speicher als eine Zeile, seine Hilfsprozesse eingerechnet
- Speicherdruck und freier Speicher in der Menüleiste. So siehst du sofort, ob ein Modell passt
- Die Auslastung des Grafikchips in der Menüleiste und in einem eigenen Tab, mit den Apps, die ihn nutzen
- Eine Mitteilung, wenn der Speicher einer App immer weiter wächst
- Welche App am meisten Energie verbraucht hat, Stunde für Stunde: Ein Modell auszuführen gehört zum Schwersten, was ein Mac im Batteriebetrieb tut
Gut zu wissen
- Vitals zeigt den Speicher, den Ollama belegt, nicht, welches Modell geladen ist. Das zeigt
ollama ps. - Vitals entlädt keine Modelle. Das macht
ollama stop.
Häufige Fragen
Warum braucht Ollama so viel Speicher?
Es hält ein Modell im Speicher. Modelle bleiben nach ihrer letzten Antwort fünf Minuten geladen. Führe ollama ps aus, um zu sehen, was geladen ist, und ollama stop mit dem Namen des Modells, um es zu entladen.
Wie entlade ich ein Modell in Ollama?
Führe ollama stop aus, gefolgt vom Namen des Modells. Damit Modelle früher von selbst entladen werden, stelle OLLAMA_KEEP_ALIVE auf eine kürzere Zeit.
Wie ändere ich, wie lange Ollama ein Modell auf dem Mac geladen lässt?
Führe im Terminal launchctl setenv OLLAMA_KEEP_ALIVE 1m mit der gewünschten Zeit aus, beende dann Ollama und öffne es wieder. Nimm 0, um sofort zu entladen, oder -1, um Modelle geladen zu lassen.
Wie viel Speicher brauche ich, um ein Modell mit Ollama auszuführen?
Etwa die Größe der Modelldatei plus Platz für den Kontext. Auf einem Mac mit 16 GB lassen Modelle bis etwa 8 GB Platz für deine anderen Apps.
Warum braucht Ollama mehr Speicher, als das Modell groß ist?
Der Speicher für die Kontextlänge wird reserviert, wenn das Modell lädt. Ein langer Kontext kann mehrere Gigabyte hinzufügen. Führe das Modell mit einem kleineren Kontext aus, wenn du ihn nicht brauchst.
Belegt Ollama Speicher, wenn ich es nicht nutze?
Nur fünf Minuten nach der letzten Antwort, außer eine App fragt es immer wieder etwas oder die Keep-alive-Zeit wurde verlängert. Danach wird das Modell entladen, und Ollama braucht sehr wenig.
Gibt es eine App, die zeigt, ob ein lokales Modell in den Speicher meines Mac passt?
Vitals zeigt Speicherdruck, freien Speicher und die Auslastung des Grafikchips in der Menüleiste. So siehst du bei der Arbeit, was ein geladenes Modell kostet.
Im Glossar
Weitere Ratgeber
- Warum ist mein Mac so langsam?
- Was die Batterie meines Mac leert
- Welche App meine CPU oder meinen Speicher nutzt
- Warum mein Mac nicht in den Ruhezustand geht
- Chrome braucht zu viel Speicher
- Warum die Lüfter meines Mac so laut sind
- Lüfterdrehzahl auf dem Mac steuern
- Arbeitsspeicher auf dem Mac freigeben
- Docker braucht zu viel Speicher
- Docker-Container stoppen
- Lautstärkemixer für den Mac
- Cursor braucht viel CPU
- Claude Code braucht zu viel Speicher
- Die Claude-App braucht viel CPU
- Codex braucht viel CPU
- Alternativen zur Aktivitätsanzeige
- Alternativen zu iStat Menus
- Alternativen zu Stats
- Task-Manager für den Mac
- Die besten Systemmonitore für den Mac
- Die besten Systemmonitore für die Menüleiste
- Die besten Lautstärkemixer für den Mac