Usted no necesita una granja GPU para ejecutar un modelo de lenguaje útil. Los modelos pequeños responden rápidamente en CPU y mantienen sus datos en su propio servidor: esta guía establece expectativas con números reales.
| Modelo | RAM necesaria | Velocidad en Ryzen 9 (CPU) | Bien por |
|---|---|---|---|
| qwen2.5:0.5b | ~1 GB | muy rápido | Clasificación, enrutamiento, pruebas |
| llama3.2:3b | ~4 GB | ~10–20 fichas/s | Chat, resúmenes, borradores |
| qwen2.5:7b | ~8 GB | ~4–8 fichas/s | Mejor calidad, aún usable |
Sé honesto contigo mismo: un modelo 7B en CPU escribe más lento de lo que lees. Para chat bots y procesamiento por lotes que está bien; para asistentes de codificación interactivos no lo es. Mantenga el modelo en un plan de 8 GB y funciona sin drama.
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."
Los modelos se almacenan en /usr/share/ollama/.ollama/models — algunos gigabytes cada uno, así que compruebe el disco libre con df -h antes de tirar varios.
Ollama habla el formato OpenAI API en el puerto 11434. Cualquier cliente que apoye una URL de base personalizada funciona:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'
No exponga el puerto 11434 al mundo. O mantener la API en localhost, o ponerla detrás de Caddy con un token:
apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
@auth header Authorization "Bearer long-random-token"
handle @auth {
reverse_proxy 127.0.0.1:11434
}
respond 401
}
EOF
systemctl reload caddy
Entonces apunta a tu cliente https://llm.example.com/v1 con ese token.
Summarize tickets de apoyo a Telegram. Clasifique los mensajes entrantes. Generar borradores para un bot. Ejecutar incrustaciones para un pequeño índice de búsqueda. Todo se mantiene en su servidor: no hay claves API, no facturas per-token, no hay datos que salgan de la máquina.
ollama ps # what is loaded right now
ollama list # downloaded models
journalctl -u ollama -f
Para modelos pequeños, sí. Un modelo 3B responde simples indicaciones en unos segundos en un conjunto de núcleo Ryzen 9 y los trabajos de lote no se preocupan por la velocidad. Los grandes modelos 30B+ necesitan un GPU — alquila uno cuando lo necesite.
No. Ollama se ejecuta en CPU con modelos cuantificados por defecto. GPUs aceleran grandes modelos, pero todo en la tabla anterior funciona cómodamente en un plan Buran normal.
8 GB RAM (Buran-3, €26/mes) para modelos 7B, 4 GB (Buran-2, 13€/mo) para modelos 3B, 2 GB para los pequeños 0,5B utilizados en pruebas y enrutamiento.
Ejecutar modelos hasta 7B en Buran-3 con 8 GB DDR5.