Sommaire Guides / LLM local

Exécutez un LLM sur votre VPS avec Ollama

Vous n'avez pas besoin d'une ferme GPU pour exécuter un modèle de langue utile. Les petits modèles répondent rapidement sur CPU et conservent vos données sur votre propre serveur — ce guide définit les attentes avec des nombres réels.

1. Ce qui convient à votre RAM

ModèleRAM nécessaireVitesse sur Ryzen 9 (CPU)Bon pour
qwen2,5:0,5b~1 Gotrès rapideClassement, routage, essais
Lama3.2:3b~4 Go~10–20 jetons/sChat, résumés, ébauches
qwen2.5:7b~8 Go~4–8 jetons/sMeilleure qualité, encore utilisable

Soyez honnête avec vous-même: un modèle 7B sur CPU écrit plus lentement que vous ne l'avez lu. Pour les robots de chat et le traitement par lots qui est très bien; pour les assistants de codage interactif ce n'est pas. Gardez le modèle sur un plan de 8 Go et il fonctionne sans drame.

2. Installer Ollama

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

Les modèles sont stockés dans /usr/share/ollama/.ollama/models — quelques gigaoctets chacun, alors vérifiez le disque libre avec df -h avant de tirer plusieurs.

3. API compatible OpenAI

Ollama parle du format OpenAI API sur le port 11434. Tout client qui prend en charge une URL de base personnalisée fonctionne :

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4. Garder le secret

Ne pas exposer le port 11434 au monde. Soit garder le API sur localhost, soit le placer derrière Caddy avec un jeton:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

Alors pointe ton client à https://llm.example.com/v1 avec ce jeton.

5. Utilisez-le dans vos applications

Résumez les tickets de support dans Telegram. Classer les messages entrants. Générer des ébauches pour un robot. Exécuter des embarquations pour un petit index de recherche. Tout reste sur votre serveur : aucune clé API, aucune facture par jeton, aucune donnée ne quitte la machine.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

Réponses rapides

Est-ce que seule la CPU est utilisable ?

Pour les petits modèles, oui. Un modèle 3B répond à des appels simples en quelques secondes sur un ensemble de cœurs Ryzen 9, et les tâches par lots ne se soucient pas du tout de la vitesse. Les grands modèles 30B+ ont besoin d'un GPU — louez-en un lorsque vous en avez besoin.

Ollama a-t-il besoin d'un GPU VPS dédié ?

C'est pas vrai. Ollama fonctionne sur CPU avec des modèles quantifiés par défaut. Les GPU accélèrent les gros modèles, mais tout dans le tableau ci-dessus fonctionne confortablement sur un plan Buran normal.

Quel plan choisir ?

8 Go RAM (Buran-3, €26/mois) pour les modèles 7B, 4 Go (Buran-2, 13/mois) pour les modèles 3B, 2 Go pour les petits 0,5B utilisés dans les tests et le routage.

Exécuter des modèles jusqu'à 7B sur Buran-3 avec 8 Go DDR5.

Autres