Gidsen/Ollama gebruikt te veel geheugen
Gebruikt Ollama te veel geheugen op een Mac? Zo zie je wat er geladen is, en haal je het uit het geheugen
Kort antwoord
Ollama houdt een model vijf minuten na zijn laatste antwoord in het geheugen, zodat de volgende vraag snel wordt beantwoord. Daarom houdt het nog een paar gigabyte vast als je ermee bent gestopt. Voer ollama ps uit om te zien welke modellen geladen zijn en wanneer elk uit het geheugen gaat, en ollama stop gevolgd door de naam van een model om het nu uit het geheugen te halen. Hoeveel geheugen een model inneemt, hangt af van zijn grootte en van de contextlengte waarmee je het draait. Vitals, een systeemmonitor voor de Mac, toont het geheugen van Ollama, de belasting van de grafische chip en de geheugendruk van de Mac in de menubalk.
Zo zie je het geheugen van Ollama en maak je het vrij
- 01 Voer in Terminal
ollama psuit. Elke regel is een model in het geheugen, met zijn grootte, of het op de grafische chip draait, en hoelang het duurt tot het uit het geheugen gaat. - 02 Haal er nu een uit het geheugen met
ollama stopgevolgd door zijn naam, bijvoorbeeldollama stop llama3.2. Het geheugen komt binnen een seconde of twee terug. - 03 Open Activiteitenweergave, klik op Geheugen en kijk onderin naar Geheugendruk. Groen betekent dat het model past. Geel of rood terwijl een model geladen is, betekent dat het te groot is voor wat er verder open is.
- 04 Om modellen eerder uit het geheugen te laten gaan, stel je in hoelang ze blijven staan. Voer in Terminal
launchctl setenv OLLAMA_KEEP_ALIVE 1muit, stop Ollama dan via zijn symbool in de menubalk en open het opnieuw. - 05 Heeft de Mac te weinig geheugen zodra een model geladen is, gebruik dan een kleiner model of een kleinere versie van hetzelfde model.
ollama listtoont de modellen die je hebt en hun grootte.
Een keep-alive van 0 haalt een model uit het geheugen zodra het heeft geantwoord; -1 houdt het geladen tot je het stopt. Apps die met Ollama praten, kunnen bij elk verzoek een eigen waarde meegeven, en daarom blijft een model soms langer staan dan je instelling.
Een model op je eigen Mac draaien betekent het in zijn geheel tegelijk in het geheugen houden. Een Mac met Apple silicon deelt één geheugenpool tussen de processor en de grafische chip, dus een model dat elders een aparte grafische kaart nodig zou hebben, past hier, maar het gaat af van hetzelfde geheugen dat je apps gebruiken. Een model van 8 GB op een Mac met 16 GB laat 8 GB over voor al het andere. Ollama lekt niet als het zoveel vasthoudt; het houdt het model vast. De tabel laat zien wat het getal bepaalt.
Wat het geheugen van Ollama bepaalt
| Wat je ziet | Waarom | Wat je doet |
|---|---|---|
| Een paar GB vastgehouden nadat je bent gestopt met chatten | Het model blijft vijf minuten geladen | ollama stop, of een kortere keep-alive |
| Meer geheugen dan de bestandsgrootte van het model | De context waarmee je het draait, heeft ook geheugen nodig | Gebruik een kleinere contextlengte |
| Twee modellen tegelijk in het geheugen | Er is een tweede model gevraagd voordat het eerste uit het geheugen was | ollama ps, en stop dan het model dat je niet gebruikt |
| Geheugendruk geel of rood, de Mac traag | Het model is te groot voor het geheugen dat vrij is | Een kleiner model, of sluit andere apps |
| Trage antwoorden en een drukke CPU | Een deel van het model paste niet op de grafische chip | ollama ps toont de verdeling; gebruik een kleiner model |
Waarom Ollama modellen geladen houdt
Een model laden betekent gigabytes van de schijf naar het geheugen lezen, en dat duurt seconden tot een minuut. Dat bij elke vraag doen zou elk antwoord traag maken, dus Ollama houdt het model vijf minuten na het laatste gebruik vast en haalt het daarna uit het geheugen. Elke nieuwe vraag zet de klok terug. Vraagt een app op je Mac het model om de paar minuten iets, bijvoorbeeld de autocomplete van een editor, dan gaat het model nooit uit het geheugen.
De instelling heet keep-alive. OLLAMA_KEEP_ALIVE verandert de standaardwaarde voor alles; een waarde van 0 geeft het geheugen meteen terug, met als prijs elke keer een traag eerste antwoord.
Hoeveel geheugen een model nodig heeft
Als vuistregel is het geheugen de grootte van het modelbestand plus ruimte voor het gesprek. Een model met 8 miljard parameters bij de gebruikelijke compressie is ongeveer 5 GB; een met 30 miljard is ongeveer 20 GB. De grootte op de schijf die ollama list toont, is een goede eerste schatting.
De contextlengte is het deel dat mensen over het hoofd zien. Het is hoeveel tekst het model tegelijk kan onthouden, en het geheugen ervoor wordt gereserveerd als het model laadt, of je het nu vult of niet. Een lange context bij een klein model kan meer gebruiken dan het model zelf. Toont ollama ps een grootte ruim boven die van het bestand, dan komt dat door de context.
Past het model op je Mac?
De eerlijke test is geheugendruk met het model geladen en je gebruikelijke apps open. Groen: het past. Geel: macOS comprimeert geheugen om ruimte te maken, en alles wordt iets trager. Rood: het swapt naar de schijf, en zowel het model als de Mac worden traag. Een model dat deels op de processor draait omdat het niet op de grafische chip paste, is ook veel trager; ollama ps zegt hoe het is verdeeld.
Een kleinere versie van hetzelfde model kost meestal weinig kwaliteit en veel minder geheugen. Op een Mac met 16 GB laten modellen tot ongeveer 8 GB ruimte over om te werken. Zie centraal geheugen voor hoe de Mac het deelt.
LM Studio en andere apps
Hetzelfde geldt voor elke app die modellen lokaal draait. LM Studio houdt een model geladen tot je het uitwerpt of tot zijn inactieve tijd om is, en toont de geladen modellen boven in zijn venster. Editors en chat-apps die een model voor je draaien, doen achter de schermen hetzelfde. Het geheugen is het model, welke app het ook vasthoudt.
Wat Vitals toevoegt
Vitals laat zien wat een geladen model de Mac kost, op een plek waar je het ziet terwijl je werkt.
- Het geheugen van Ollama als één regel, met de helperprocessen meegeteld
- Geheugendruk en vrij geheugen in de menubalk, zodat je meteen ziet of een model past
- De belasting van de grafische chip in de menubalk en op een eigen tabblad, met de apps die hem gebruiken
- Een melding als een app steeds meer geheugen gebruikt
- Welke app de meeste energie gebruikte, per uur: een model draaien hoort bij het zwaarste dat een Mac op de batterij doet
Goed om te weten
- Vitals toont het geheugen dat Ollama vasthoudt, niet welk model geladen is. Dat toont
ollama ps. - Vitals haalt geen modellen uit het geheugen. Dat doet
ollama stop.
Vragen die mensen stellen
Waarom gebruikt Ollama zoveel geheugen?
Het houdt een model in het geheugen. Modellen blijven vijf minuten na hun laatste antwoord geladen. Voer ollama ps uit om te zien wat er geladen is, en ollama stop met de naam van het model om het uit het geheugen te halen.
Hoe haal ik een model uit het geheugen in Ollama?
Voer ollama stop uit, gevolgd door de naam van het model. Om modellen vanzelf eerder uit het geheugen te laten gaan, zet je OLLAMA_KEEP_ALIVE op een kortere tijd.
Hoe verander ik hoelang Ollama een model geladen houdt op een Mac?
Voer launchctl setenv OLLAMA_KEEP_ALIVE 1m uit in Terminal, met de tijd die je wilt, stop Ollama dan en open het opnieuw. Gebruik 0 om meteen uit het geheugen te halen, of -1 om modellen geladen te houden.
Hoeveel geheugen heb ik nodig om een model te draaien met Ollama?
Ongeveer de grootte van het modelbestand plus ruimte voor de context. Op een Mac met 16 GB laten modellen tot ongeveer 8 GB ruimte over voor je andere apps.
Waarom gebruikt Ollama meer geheugen dan de grootte van het model?
Het geheugen voor de contextlengte wordt gereserveerd als het model laadt. Een lange context kan er een paar gigabyte bij doen. Draai het model met een kleinere context als je die niet nodig hebt.
Gebruikt Ollama geheugen als ik het niet gebruik?
Alleen vijf minuten na het laatste antwoord, tenzij een app het iets blijft vragen of de keep-alive-tijd langer is gemaakt. Daarna gaat het model uit het geheugen en gebruikt Ollama heel weinig.
Is er een app die laat zien of een lokaal model in het geheugen van mijn Mac past?
Vitals toont geheugendruk, vrij geheugen en de belasting van de grafische chip in de menubalk, zodat je ziet wat een geladen model kost terwijl je werkt.
In de woordenlijst
Meer gidsen
- Waarom is mijn Mac zo traag
- Wat trekt de batterij van mijn Mac leeg
- Welke app gebruikt mijn CPU of geheugen
- Waarom gaat mijn Mac niet in sluimerstand
- Chrome gebruikt te veel geheugen
- Waarom maken de ventilatoren van mijn Mac zoveel lawaai
- Zo regel je de ventilatorsnelheid op een Mac
- Zo maak je RAM vrij op een Mac
- Docker gebruikt te veel geheugen
- Zo stop je Docker-containers
- Volumemixer voor Mac
- Cursor gebruikt veel CPU
- Claude Code gebruikt te veel geheugen
- Claude-app gebruikt veel CPU
- Codex gebruikt veel CPU
- Alternatieven voor Activiteitenweergave
- Alternatieven voor iStat Menus
- Alternatieven voor Stats
- Taakbeheer voor Mac
- Beste systeemmonitors voor Mac
- Beste menubalkmonitors voor Mac
- Beste volumemixers voor Mac