Guias/Ollama usando memória demais
Ollama usando memória demais no Mac? Como ver o que está carregado e descarregar
Resposta rápida
O Ollama mantém um modelo na memória por cinco minutos depois da última resposta, para que a próxima pergunta seja respondida rápido. É por isso que ele continua segurando vários gigabytes depois que você parou de usá-lo. Execute ollama ps para ver quais modelos estão carregados e quando cada um será descarregado, e ollama stop seguido do nome de um modelo para descarregá-lo agora. Quanta memória um modelo ocupa depende do tamanho dele e do tamanho do contexto com que você o roda. O Vitals, um monitor de sistema para Mac, mostra a memória do Ollama, a carga do chip gráfico e a pressão da memória do Mac na barra de menus.
Como ver e liberar a memória do Ollama
- 01 No Terminal, execute
ollama ps. Cada linha é um modelo na memória, com o tamanho dele, se ele roda no chip gráfico e quanto tempo falta para ser descarregado. - 02 Descarregue um agora com
ollama stopseguido do nome dele, por exemploollama stop llama3.2. A memória volta em um ou dois segundos. - 03 Abra o Monitor de Atividade, clique em Memória e veja a Pressão da Memória na parte de baixo. Verde significa que o modelo cabe. Amarelo ou vermelho com um modelo carregado significa que ele é grande demais para o que mais está aberto.
- 04 Para que os modelos sejam descarregados mais cedo, defina por quanto tempo eles ficam. No Terminal, execute
launchctl setenv OLLAMA_KEEP_ALIVE 1m, depois encerre o Ollama pelo ícone dele na barra de menus e abra-o de novo. - 05 Se falta memória ao Mac sempre que um modelo está carregado, use um modelo menor ou uma versão menor do mesmo modelo.
ollama listmostra os que você tem e os tamanhos deles.
Um keep-alive de 0 descarrega um modelo assim que ele responde; -1 o mantém carregado até você pará-lo. Os apps que conversam com o Ollama podem definir um valor próprio a cada requisição, e é por isso que um modelo às vezes fica mais tempo do que o seu ajuste.
Rodar um modelo no seu próprio Mac significa manter ele inteiro na memória de uma vez. Um Mac com Apple silicon compartilha um único conjunto de memória entre o processador e o chip gráfico, então um modelo que em outro computador precisaria de uma placa de vídeo dedicada cabe aqui, mas sai da mesma memória que os seus apps usam. Um modelo de 8 GB em um Mac com 16 GB deixa 8 GB para todo o resto. O Ollama não está vazando memória quando segura tudo isso; ele está segurando o modelo. A tabela mostra o que decide o número.
O que decide a memória do Ollama
| O que você vê | Por quê | O que fazer |
|---|---|---|
| Vários GB ocupados depois que você para de conversar | O modelo fica carregado por cinco minutos | ollama stop, ou um keep-alive mais curto |
| Mais memória do que o tamanho do arquivo do modelo | O contexto com que você o roda também precisa de memória | Use um tamanho de contexto menor |
| Dois modelos na memória ao mesmo tempo | Um segundo modelo foi pedido antes de o primeiro ser descarregado | ollama ps, e depois pare o que você não está usando |
| Pressão da memória amarela ou vermelha, o Mac lento | O modelo é grande demais para a memória livre | Um modelo menor, ou feche outros apps |
| Respostas lentas e CPU ocupada | Parte do modelo não coube no chip gráfico | ollama ps mostra a divisão; use um modelo menor |
Por que o Ollama mantém os modelos carregados
Carregar um modelo significa ler gigabytes do disco para a memória, o que leva de segundos a um minuto. Fazer isso a cada pergunta deixaria todas as respostas lentas, então o Ollama mantém o modelo por cinco minutos depois do último uso e o descarrega depois disso. Cada pergunta nova zera o relógio. Se um app no seu Mac pergunta algo ao modelo a cada poucos minutos, como o preenchimento automático de um editor, o modelo nunca é descarregado.
O ajuste se chama keep-alive. OLLAMA_KEEP_ALIVE muda o padrão para tudo; o valor 0 devolve a memória na hora, ao custo de uma primeira resposta lenta toda vez.
De quanta memória um modelo precisa
Em geral, a memória é o tamanho do arquivo do modelo mais um espaço para a conversa. Um modelo com 8 bilhões de parâmetros na compressão usual tem cerca de 5 GB; um com 30 bilhões tem cerca de 20 GB. O tamanho em disco que ollama list mostra é uma boa primeira estimativa.
O tamanho do contexto é a parte que as pessoas esquecem. Ele é a quantidade de texto que o modelo consegue ter em mente de uma vez, e a memória para ele é reservada quando o modelo carrega, quer você o preencha ou não. Um contexto longo em um modelo pequeno pode usar mais do que o próprio modelo. Se ollama ps mostra um tamanho bem acima do tamanho do arquivo, o motivo é o contexto.
O modelo cabe no seu Mac?
O teste honesto é a pressão da memória com o modelo carregado e os seus apps de sempre abertos. Verde: cabe. Amarelo: o macOS está comprimindo memória para abrir espaço, e tudo fica um pouco mais lento. Vermelho: ele está usando troca no disco, e tanto o modelo quanto o Mac ficam lentos. Um modelo que roda em parte no processador porque não coube no chip gráfico também é muito mais lento; ollama ps mostra como ele foi dividido.
Uma versão menor do mesmo modelo geralmente custa pouco em qualidade e muito menos em memória. Em um Mac com 16 GB, modelos de até cerca de 8 GB deixam espaço para trabalhar. Veja memória unificada para entender como o Mac a compartilha.
LM Studio e outros apps
O mesmo vale para qualquer app que roda modelos localmente. O LM Studio mantém um modelo carregado até você ejetá-lo ou até o tempo de inatividade dele acabar, e mostra os modelos carregados no alto da janela. Editores e apps de chat que rodam um modelo por você fazem o mesmo nos bastidores. A memória é o modelo, seja qual for o app que o segura.
O que o Vitals acrescenta
O Vitals mostra quanto um modelo carregado custa ao Mac, onde você pode ver enquanto trabalha.
- A memória do Ollama em uma única linha, com os processos auxiliares incluídos
- A pressão da memória e a memória livre na barra de menus, para você ver na hora se um modelo cabe
- A carga do chip gráfico na barra de menus e em uma aba própria, com os apps que o usam
- Uma notificação quando um app não para de crescer na memória
- Qual app usou mais energia, hora a hora: rodar um modelo está entre as coisas mais pesadas que um Mac faz na bateria
Bom saber
- O Vitals mostra a memória que o Ollama segura, não qual modelo está carregado. Isso quem mostra é
ollama ps. - O Vitals não descarrega modelos. Quem faz isso é
ollama stop.
Perguntas frequentes
Por que o Ollama está usando tanta memória?
Ele está mantendo um modelo na memória. Os modelos ficam carregados por cinco minutos depois da última resposta. Execute ollama ps para ver o que está carregado, e ollama stop com o nome do modelo para descarregá-lo.
Como descarrego um modelo no Ollama?
Execute ollama stop seguido do nome do modelo. Para que os modelos sejam descarregados sozinhos mais cedo, defina OLLAMA_KEEP_ALIVE com um tempo menor.
Como mudo por quanto tempo o Ollama mantém um modelo carregado no Mac?
Execute launchctl setenv OLLAMA_KEEP_ALIVE 1m no Terminal, com o tempo que você quer, depois encerre e abra o Ollama de novo. Use 0 para descarregar na hora, ou -1 para manter os modelos carregados.
De quanta memória preciso para rodar um modelo com o Ollama?
Cerca do tamanho do arquivo do modelo mais um espaço para o contexto. Em um Mac com 16 GB, modelos de até cerca de 8 GB deixam espaço para os seus outros apps.
Por que o Ollama usa mais memória do que o tamanho do modelo?
A memória para o tamanho do contexto é reservada quando o modelo carrega. Um contexto longo pode acrescentar vários gigabytes. Rode o modelo com um contexto menor se não precisar dele.
O Ollama usa memória quando não o estou usando?
Só por cinco minutos depois da última resposta, a menos que um app continue perguntando algo a ele ou que o tempo de keep-alive tenha sido aumentado. Depois disso o modelo é descarregado e o Ollama usa muito pouco.
Existe um app que mostra se um modelo local cabe na memória do meu Mac?
O Vitals mostra a pressão da memória, a memória livre e a carga do chip gráfico na barra de menus, para você ver quanto um modelo carregado custa enquanto trabalha.
No glossário
Mais guias
- Por que meu Mac está tão lento
- O que está gastando a bateria do meu Mac
- Qual app está usando minha CPU ou memória
- Por que meu Mac não entra em repouso
- Chrome usando memória demais
- Por que as ventoinhas do meu Mac fazem tanto barulho
- Como controlar a velocidade da ventoinha no Mac
- Como liberar memória RAM no Mac
- Docker usando memória demais
- Como parar contêineres do Docker
- Mixer de volume para Mac
- Cursor com CPU alta
- Claude Code usando memória demais
- App do Claude com CPU alta
- Codex com CPU alta
- Alternativas ao Monitor de Atividade
- Alternativas ao iStat Menus
- Alternativas ao Stats
- Gerenciador de Tarefas para Mac
- Melhores monitores de sistema para Mac
- Melhores monitores para a barra de menus do Mac
- Melhores mixers de volume para Mac