Principal / Guias / LLM Local

Execute um LLM em seu VPS com Ollama

Você não precisa de uma fazenda GPU para executar um modelo de linguagem útil. Modelos pequenos respondem rápido na CPU e mantêm seus dados em seu próprio servidor — este guia define expectativas com números reais.

1. O que se encaixa na sua RAM

ModeloRAM necessáriaVelocidade em Ryzen 9 (CPU)Bom para
qwen2.5:0.5b~ 1 GBmuito rápidoClassificação, encaminhamento, testes
lhama3.2:3b~ 4 GB~10–20 unidades/sChat, resumos, rascunhos
qwen2.5:7b~ 8 GB~4–8 unidades/sMelhor qualidade, ainda utilizável

Seja honesto consigo mesmo: um modelo 7B na CPU escreve mais devagar do que você lê. Para bots de bate-papo e processamento em lote que é bom; para assistentes de codificação interativa não é. Mantenha o modelo em um plano de 8 GB e funciona sem drama.

2. Instale Ollama

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

Os modelos são armazenados em /usr/share/ollama/.ollama/models — alguns gigabytes cada, por isso verifique disco livre com df -h antes de puxar várias.

3. API compatível com OpenAI

Ollama fala o formato OpenAI API na porta 11434. Qualquer cliente que suporte uma URL base personalizada funciona:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4. Mantenha-o privado

Não exponha o porto 11434 ao mundo. Ou mantém o API no localhost, ou coloca-o atrás do Caddy com um símbolo:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

Então aponte o seu cliente para https://llm.example.com/v1 Com esse símbolo.

5. Use-o em seus aplicativos

Resumir os tickets de suporte em Telegram. Classificar mensagens recebidas. Gerar rascunhos para um bot. Executar incorporações para um pequeno índice de pesquisa. Tudo isso fica no seu servidor: sem chaves API, sem contas per-token, sem dados deixando a máquina.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

Respostas rápidas

A inferência somente da CPU é utilizável?

Para modelos pequenos, sim. Um modelo 3B responde simples prompts em poucos segundos em um conjunto de núcleo Ryzen 9, e trabalhos em lote não se importam com a velocidade em tudo. Os grandes modelos 30B+ precisam de uma GPU — alugue um quando precisar.

O Ollama precisa de uma GPU dedicada VPS?

Não. Ollama é executado em CPU com modelos quantizados por padrão. GPUs aceleram grandes modelos, mas tudo na tabela acima corre confortavelmente em um plano Buran normal.

Que plano devo escolher?

8 GB de RAM (Buran-3, €26/mês) para modelos 7B, 4 GB (Buran-2, €13/mês) para modelos 3B, 2 GB para os minúsculos 0,5B usados em testes e roteamento.

Executar modelos até 7B em Buran-3 com 8 GB DDR5.

Relacionado