Zuhause / Guides / Lokales LLM

Führen Sie ein LLM auf Ihrem VPS aus mit Ollama

Sie benötigen keine GPU-Farm, um ein nützliches Sprachmodell auszuführen. Kleine Modelle antworten schnell auf der CPU und behalten Ihre Daten auf Ihrem eigenen Server - dieses Handbuch setzt Erwartungen mit echten Zahlen.

1. Was passt in Ihren RAM

ModellRAM benötigtGeschwindigkeit auf Ryzen 9 (CPU)Gut für
qwen2.5:0,5b~1 GBsehr schnellKlassifizierung, Routing, Tests
llama3.2:3b~4 GB~10–20 Token/sChat, Zusammenfassungen, Entwürfe
qwen2.5:7b~8 GB~4–8 Token/sBessere Qualität, noch nutzbar

Seien Sie ehrlich zu sich selbst: Ein 7B-Modell auf CPU schreibt langsamer als Sie lesen. Für chat-bots und batch-verarbeitung ist das in ordnung; für interaktive codierassistenten ist es nicht. Halten Sie das Modell auf einem 8 GB Plan und es funktioniert ohne Drama.

2. Ollama installieren

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

Modelle werden gespeichert in /usr/share/ollama/.ollama/models — jeweils ein paar Gigabyte, also überprüfen Sie die freie Festplatte mit df -h bevor man mehrere zieht.

3. OpenAI-kompatibel API

Ollama spricht das OpenAI API-Format auf Port 11434. Jeder Client, der eine benutzerdefinierte Basis-URL unterstützt, funktioniert:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4. Halten Sie es privat

Setzen Sie Port 11434 nicht der Welt aus. Behalten Sie entweder das API auf localhost oder legen Sie es mit einem Token hinter Caddy:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

Dann weisen Sie Ihren Kunden auf https://llm.example.com/v1 Mit diesem Token.

5. Verwenden Sie es in Ihren Apps

Fassen Sie Support-Tickets in Telegram zusammen. Klassifizieren Sie eingehende Nachrichten. Generieren Sie Entwürfe für einen Bot. Führen Sie Einbettungen für einen kleinen Suchindex aus. Alles bleibt auf Ihrem Server: keine API-Schlüssel, keine Pro-Token-Rechnungen, keine Daten, die den Computer verlassen.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

Schnelle Antworten

Ist CPU-only Inference verwendbar?

Für kleine Models ja. Ein 3B-Modell beantwortet einfache Aufforderungen in wenigen Sekunden auf einem Ryzen 9-Core-Set, und Batch-Jobs interessieren sich überhaupt nicht für Geschwindigkeit. Große 30B + Modelle benötigen eine GPU - mieten Sie eine, wenn Sie sie brauchen.

Benötigt Ollama eine dedizierte GPU VPS?

Nein. Ollama läuft standardmäßig auf CPU mit quantisierten Modellen. GPUs beschleunigen große Modelle, aber alles in der obigen Tabelle läuft bequem auf einem normalen Buran-Plan.

Welchen Plan sollte ich wählen?

8 GB RAM (Buran-3, €26/Monat) für 7B-Modelle, 4 GB (Buran-2, 13 €/mo) für 3B-Modelle, 2 GB für die winzigen 0,5 B, die bei Tests und Routing verwendet werden.

Führen Sie Modelle bis 7B auf Buran-3 mit 8 GB DDR5.

Related