Sie benötigen keine GPU-Farm, um ein nützliches Sprachmodell auszuführen. Kleine Modelle antworten schnell auf der CPU und behalten Ihre Daten auf Ihrem eigenen Server - dieses Handbuch setzt Erwartungen mit echten Zahlen.
| Modell | RAM benötigt | Geschwindigkeit auf Ryzen 9 (CPU) | Gut für |
|---|---|---|---|
| qwen2.5:0,5b | ~1 GB | sehr schnell | Klassifizierung, Routing, Tests |
| llama3.2:3b | ~4 GB | ~10–20 Token/s | Chat, Zusammenfassungen, Entwürfe |
| qwen2.5:7b | ~8 GB | ~4–8 Token/s | Bessere Qualität, noch nutzbar |
Seien Sie ehrlich zu sich selbst: Ein 7B-Modell auf CPU schreibt langsamer als Sie lesen. Für chat-bots und batch-verarbeitung ist das in ordnung; für interaktive codierassistenten ist es nicht. Halten Sie das Modell auf einem 8 GB Plan und es funktioniert ohne Drama.
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."
Modelle werden gespeichert in /usr/share/ollama/.ollama/models — jeweils ein paar Gigabyte, also überprüfen Sie die freie Festplatte mit df -h bevor man mehrere zieht.
Ollama spricht das OpenAI API-Format auf Port 11434. Jeder Client, der eine benutzerdefinierte Basis-URL unterstützt, funktioniert:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'
Setzen Sie Port 11434 nicht der Welt aus. Behalten Sie entweder das API auf localhost oder legen Sie es mit einem Token hinter Caddy:
apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
@auth header Authorization "Bearer long-random-token"
handle @auth {
reverse_proxy 127.0.0.1:11434
}
respond 401
}
EOF
systemctl reload caddy
Dann weisen Sie Ihren Kunden auf https://llm.example.com/v1 Mit diesem Token.
Fassen Sie Support-Tickets in Telegram zusammen. Klassifizieren Sie eingehende Nachrichten. Generieren Sie Entwürfe für einen Bot. Führen Sie Einbettungen für einen kleinen Suchindex aus. Alles bleibt auf Ihrem Server: keine API-Schlüssel, keine Pro-Token-Rechnungen, keine Daten, die den Computer verlassen.
ollama ps # what is loaded right now
ollama list # downloaded models
journalctl -u ollama -f
Für kleine Models ja. Ein 3B-Modell beantwortet einfache Aufforderungen in wenigen Sekunden auf einem Ryzen 9-Core-Set, und Batch-Jobs interessieren sich überhaupt nicht für Geschwindigkeit. Große 30B + Modelle benötigen eine GPU - mieten Sie eine, wenn Sie sie brauchen.
Nein. Ollama läuft standardmäßig auf CPU mit quantisierten Modellen. GPUs beschleunigen große Modelle, aber alles in der obigen Tabelle läuft bequem auf einem normalen Buran-Plan.
8 GB RAM (Buran-3, €26/Monat) für 7B-Modelle, 4 GB (Buran-2, 13 €/mo) für 3B-Modelle, 2 GB für die winzigen 0,5 B, die bei Tests und Routing verwendet werden.
Führen Sie Modelle bis 7B auf Buran-3 mit 8 GB DDR5.