Home / Guías / LLM local

Corre un LLM en tu VPS con Ollama

Usted no necesita una granja GPU para ejecutar un modelo de lenguaje útil. Los modelos pequeños responden rápidamente en CPU y mantienen sus datos en su propio servidor: esta guía establece expectativas con números reales.

1. Lo que cabe en su RAM

ModeloRAM necesariaVelocidad en Ryzen 9 (CPU)Bien por
qwen2.5:0.5b~1 GBmuy rápidoClasificación, enrutamiento, pruebas
llama3.2:3b~4 GB~10–20 fichas/sChat, resúmenes, borradores
qwen2.5:7b~8 GB~4–8 fichas/sMejor calidad, aún usable

Sé honesto contigo mismo: un modelo 7B en CPU escribe más lento de lo que lees. Para chat bots y procesamiento por lotes que está bien; para asistentes de codificación interactivos no lo es. Mantenga el modelo en un plan de 8 GB y funciona sin drama.

2. Instalar Ollama

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

Los modelos se almacenan en /usr/share/ollama/.ollama/models — algunos gigabytes cada uno, así que compruebe el disco libre con df -h antes de tirar varios.

3. OpenAI-compatible API

Ollama habla el formato OpenAI API en el puerto 11434. Cualquier cliente que apoye una URL de base personalizada funciona:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4. Mantenerlo privado

No exponga el puerto 11434 al mundo. O mantener la API en localhost, o ponerla detrás de Caddy con un token:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

Entonces apunta a tu cliente https://llm.example.com/v1 con ese token.

5. Úsalo en tus aplicaciones

Summarize tickets de apoyo a Telegram. Clasifique los mensajes entrantes. Generar borradores para un bot. Ejecutar incrustaciones para un pequeño índice de búsqueda. Todo se mantiene en su servidor: no hay claves API, no facturas per-token, no hay datos que salgan de la máquina.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

Respuestas rápidas

¿Es utilizable la inferencia sólo CPU?

Para modelos pequeños, sí. Un modelo 3B responde simples indicaciones en unos segundos en un conjunto de núcleo Ryzen 9 y los trabajos de lote no se preocupan por la velocidad. Los grandes modelos 30B+ necesitan un GPU — alquila uno cuando lo necesite.

¿Ollama necesita una GPU VPS dedicada?

No. Ollama se ejecuta en CPU con modelos cuantificados por defecto. GPUs aceleran grandes modelos, pero todo en la tabla anterior funciona cómodamente en un plan Buran normal.

¿Qué plan debería elegir?

8 GB RAM (Buran-3, €26/mes) para modelos 7B, 4 GB (Buran-2, 13€/mo) para modelos 3B, 2 GB para los pequeños 0,5B utilizados en pruebas y enrutamiento.

Ejecutar modelos hasta 7B en Buran-3 con 8 GB DDR5.

Relacionados