Você não precisa de uma fazenda GPU para executar um modelo de linguagem útil. Modelos pequenos respondem rápido na CPU e mantêm seus dados em seu próprio servidor — este guia define expectativas com números reais.
| Modelo | RAM necessária | Velocidade em Ryzen 9 (CPU) | Bom para |
|---|---|---|---|
| qwen2.5:0.5b | ~ 1 GB | muito rápido | Classificação, encaminhamento, testes |
| lhama3.2:3b | ~ 4 GB | ~10–20 unidades/s | Chat, resumos, rascunhos |
| qwen2.5:7b | ~ 8 GB | ~4–8 unidades/s | Melhor qualidade, ainda utilizável |
Seja honesto consigo mesmo: um modelo 7B na CPU escreve mais devagar do que você lê. Para bots de bate-papo e processamento em lote que é bom; para assistentes de codificação interativa não é. Mantenha o modelo em um plano de 8 GB e funciona sem drama.
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."
Os modelos são armazenados em /usr/share/ollama/.ollama/models — alguns gigabytes cada, por isso verifique disco livre com df -h antes de puxar várias.
Ollama fala o formato OpenAI API na porta 11434. Qualquer cliente que suporte uma URL base personalizada funciona:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'
Não exponha o porto 11434 ao mundo. Ou mantém o API no localhost, ou coloca-o atrás do Caddy com um símbolo:
apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
@auth header Authorization "Bearer long-random-token"
handle @auth {
reverse_proxy 127.0.0.1:11434
}
respond 401
}
EOF
systemctl reload caddy
Então aponte o seu cliente para https://llm.example.com/v1 Com esse símbolo.
Resumir os tickets de suporte em Telegram. Classificar mensagens recebidas. Gerar rascunhos para um bot. Executar incorporações para um pequeno índice de pesquisa. Tudo isso fica no seu servidor: sem chaves API, sem contas per-token, sem dados deixando a máquina.
ollama ps # what is loaded right now
ollama list # downloaded models
journalctl -u ollama -f
Para modelos pequenos, sim. Um modelo 3B responde simples prompts em poucos segundos em um conjunto de núcleo Ryzen 9, e trabalhos em lote não se importam com a velocidade em tudo. Os grandes modelos 30B+ precisam de uma GPU — alugue um quando precisar.
Não. Ollama é executado em CPU com modelos quantizados por padrão. GPUs aceleram grandes modelos, mas tudo na tabela acima corre confortavelmente em um plano Buran normal.
8 GB de RAM (Buran-3, €26/mês) para modelos 7B, 4 GB (Buran-2, €13/mês) para modelos 3B, 2 GB para os minúsculos 0,5B usados em testes e roteamento.
Executar modelos até 7B em Buran-3 com 8 GB DDR5.