Guides/Ollama utilise trop de mémoire
Ollama utilise trop de mémoire sur un Mac ? Comment voir ce qui est chargé, et le décharger
En bref
Ollama garde un modèle en mémoire pendant cinq minutes après sa dernière réponse, pour répondre vite à la question suivante. C’est pourquoi il occupe encore plusieurs gigaoctets quand vous avez cessé de vous en servir. Lancez ollama ps pour voir quels modèles sont chargés et quand chacun sera déchargé, et ollama stop suivi du nom d’un modèle pour le décharger tout de suite. La mémoire que prend un modèle dépend de sa taille et de la longueur de contexte avec laquelle vous le faites tourner. Vitals, un moniteur système pour Mac, affiche la mémoire d’Ollama, la charge de la puce graphique et la pression sur la mémoire du Mac dans la barre des menus.
Comment voir et libérer la mémoire d’Ollama
- 01 Dans le Terminal, lancez
ollama ps. Chaque ligne est un modèle en mémoire, avec sa taille, s’il tourne sur la puce graphique, et le temps restant avant son déchargement. - 02 Déchargez-en un tout de suite avec
ollama stopsuivi de son nom, par exempleollama stop llama3.2. La mémoire revient en une ou deux secondes. - 03 Ouvrez le Moniteur d’activité, cliquez sur Mémoire et regardez la pression sur la mémoire en bas. Vert signifie que le modèle tient. Jaune ou rouge pendant qu’un modèle est chargé signifie qu’il est trop gros compte tenu de ce qui est ouvert par ailleurs.
- 04 Pour que les modèles se déchargent plus tôt, réglez la durée pendant laquelle ils sont gardés. Dans le Terminal, lancez
launchctl setenv OLLAMA_KEEP_ALIVE 1m, puis quittez Ollama depuis son icône dans la barre des menus et rouvrez-le. - 05 Si le Mac manque de mémoire dès qu’un modèle est chargé, utilisez un modèle plus petit ou une version plus petite du même.
ollama listmontre ceux que vous avez et leur taille.
Un keep-alive de 0 décharge un modèle dès qu’il a répondu ; -1 le garde chargé jusqu’à ce que vous l’arrêtiez. Les apps qui parlent à Ollama peuvent fixer leur propre valeur à chaque requête, ce qui explique qu’un modèle reste parfois plus longtemps que votre réglage.
Faire tourner un modèle sur votre propre Mac, c’est le garder tout entier en mémoire d’un coup. Un Mac avec Apple silicon partage une seule réserve de mémoire entre le processeur et la puce graphique : un modèle qui demanderait ailleurs une carte graphique dédiée tient donc ici, mais il est pris sur la même mémoire que vos apps. Un modèle de 8 Go sur un Mac de 16 Go laisse 8 Go pour tout le reste. Ollama n’a pas de fuite quand il occupe autant ; il garde le modèle. Le tableau montre ce qui détermine le chiffre.
Ce qui détermine la mémoire d’Ollama
| Ce que vous voyez | Pourquoi | Que faire |
|---|---|---|
| Plusieurs Go occupés après la fin de la discussion | Le modèle reste chargé cinq minutes | ollama stop, ou un keep-alive plus court |
| Plus de mémoire que la taille du fichier du modèle | Le contexte avec lequel vous le faites tourner demande aussi de la mémoire | Utilisez une longueur de contexte plus petite |
| Deux modèles en mémoire à la fois | Un second modèle a été demandé avant que le premier ne soit déchargé | ollama ps, puis arrêtez celui dont vous ne vous servez pas |
| Pression sur la mémoire jaune ou rouge, Mac lent | Le modèle est trop gros pour la mémoire disponible | Un modèle plus petit, ou fermez d’autres apps |
| Réponses lentes et processeur occupé | Une partie du modèle n’a pas tenu sur la puce graphique | ollama ps montre la répartition ; utilisez un modèle plus petit |
Pourquoi Ollama garde les modèles chargés
Charger un modèle, c’est lire des gigaoctets du disque vers la mémoire, ce qui prend de quelques secondes à une minute. Le faire à chaque question rendrait chaque réponse lente : Ollama garde donc le modèle cinq minutes après sa dernière utilisation, puis le décharge. Chaque nouvelle question remet le compteur à zéro. Si une app de votre Mac interroge le modèle toutes les quelques minutes, la saisie automatique d’un éditeur par exemple, le modèle ne se décharge jamais.
Le réglage s’appelle keep-alive. OLLAMA_KEEP_ALIVE change la valeur par défaut pour tout ; une valeur de 0 rend la mémoire aussitôt, au prix d’une première réponse lente à chaque fois.
De combien de mémoire un modèle a besoin
En règle générale, la mémoire correspond à la taille du fichier du modèle, plus de la place pour la conversation. Un modèle de 8 milliards de paramètres avec la compression habituelle fait environ 5 Go ; un modèle de 30 milliards, environ 20 Go. La taille sur le disque qu’indique ollama list est une bonne première estimation.
La longueur de contexte est la part qu’on oublie. C’est la quantité de texte que le modèle peut garder à l’esprit en une fois, et la mémoire correspondante est réservée au chargement du modèle, que vous la remplissiez ou non. Un long contexte sur un petit modèle peut utiliser plus que le modèle lui-même. Si ollama ps affiche une taille bien supérieure à celle du fichier, c’est à cause du contexte.
Le modèle tient-il dans votre Mac ?
Le vrai test, c’est la pression sur la mémoire avec le modèle chargé et vos apps habituelles ouvertes. Vert : il tient. Jaune : macOS compresse la mémoire pour faire de la place, et tout ralentit un peu. Rouge : il utilise le fichier d’échange sur le disque, et le modèle comme le Mac deviennent lents. Un modèle qui tourne en partie sur le processeur parce qu’il n’a pas tenu sur la puce graphique est lui aussi bien plus lent ; ollama ps indique comment il a été réparti.
Une version plus petite du même modèle coûte en général peu en qualité et bien moins en mémoire. Sur un Mac de 16 Go, les modèles jusqu’à environ 8 Go laissent de la place pour travailler. Voir mémoire unifiée pour la façon dont le Mac la partage.
LM Studio et les autres apps
Il en va de même pour toute app qui fait tourner des modèles en local. LM Studio garde un modèle chargé jusqu’à ce que vous l’éjectiez ou que son délai d’inactivité expire, et affiche les modèles chargés en haut de sa fenêtre. Les éditeurs et les apps de chat qui font tourner un modèle pour vous font de même en coulisses. La mémoire, c’est le modèle, quelle que soit l’app qui le garde.
Ce que Vitals apporte
Vitals montre ce qu’un modèle chargé coûte au Mac, là où vous pouvez le voir pendant que vous travaillez.
- La mémoire d’Ollama sur une seule ligne, processus utilitaires compris
- La pression sur la mémoire et la mémoire libre dans la barre des menus : vous voyez tout de suite si un modèle tient
- La charge de la puce graphique dans la barre des menus et dans son propre onglet, avec les apps qui l’utilisent
- Une notification quand la mémoire d’une app grossit sans cesse
- Quelle app a consommé le plus d’énergie, heure par heure : faire tourner un modèle compte parmi ce qu’un Mac fait de plus lourd sur batterie
Bon à savoir
- Vitals montre la mémoire qu’occupe Ollama, pas quel modèle est chargé.
ollama psle montre. - Vitals ne décharge pas les modèles.
ollama stople fait.
Questions fréquentes
Pourquoi Ollama utilise-t-il autant de mémoire ?
Il garde un modèle en mémoire. Les modèles restent chargés cinq minutes après leur dernière réponse. Lancez ollama ps pour voir ce qui est chargé, et ollama stop avec le nom du modèle pour le décharger.
Comment décharger un modèle dans Ollama ?
Lancez ollama stop suivi du nom du modèle. Pour que les modèles se déchargent d’eux-mêmes plus tôt, réglez OLLAMA_KEEP_ALIVE sur une durée plus courte.
Comment changer la durée pendant laquelle Ollama garde un modèle chargé sur un Mac ?
Lancez launchctl setenv OLLAMA_KEEP_ALIVE 1m dans le Terminal, avec la durée voulue, puis quittez et rouvrez Ollama. Utilisez 0 pour décharger aussitôt, ou -1 pour garder les modèles chargés.
De combien de mémoire ai-je besoin pour faire tourner un modèle avec Ollama ?
Environ la taille du fichier du modèle, plus de la place pour le contexte. Sur un Mac de 16 Go, les modèles jusqu’à environ 8 Go laissent de la place pour vos autres apps.
Pourquoi Ollama utilise-t-il plus de mémoire que la taille du modèle ?
La mémoire pour la longueur de contexte est réservée au chargement du modèle. Un long contexte peut ajouter plusieurs gigaoctets. Faites tourner le modèle avec un contexte plus petit si vous n’en avez pas besoin.
Ollama utilise-t-il de la mémoire quand je ne m’en sers pas ?
Seulement pendant cinq minutes après la dernière réponse, sauf si une app continue de l’interroger ou si la durée du keep-alive a été allongée. Ensuite, le modèle est déchargé et Ollama utilise très peu de mémoire.
Existe-t-il une app qui montre si un modèle local tient dans la mémoire de mon Mac ?
Vitals affiche la pression sur la mémoire, la mémoire libre et la charge de la puce graphique dans la barre des menus : vous voyez ce que coûte un modèle chargé pendant que vous travaillez.
Dans le lexique
Autres guides
- Pourquoi mon Mac est si lent
- Ce qui vide la batterie de mon Mac
- Quelle app utilise mon processeur ou ma mémoire
- Pourquoi mon Mac ne se met pas en veille
- Chrome utilise trop de mémoire
- Pourquoi les ventilateurs de mon Mac font autant de bruit
- Comment régler la vitesse des ventilateurs sur un Mac
- Comment libérer de la RAM sur un Mac
- Docker utilise trop de mémoire
- Comment arrêter des conteneurs Docker
- Mélangeur de volume pour Mac
- Cursor sollicite beaucoup le processeur
- Claude Code utilise trop de mémoire
- L’app Claude sollicite beaucoup le processeur
- Codex sollicite beaucoup le processeur
- Alternatives au Moniteur d’activité
- Alternatives à iStat Menus
- Alternatives à Stats
- Gestionnaire des tâches pour Mac
- Meilleurs moniteurs système pour Mac
- Meilleurs moniteurs de barre des menus pour Mac
- Meilleurs mélangeurs de volume pour Mac