Домой / Руководство / Локальный LLM

Запустите LLM на VPS с Ollama

Вам не нужна ферма GPU для запуска полезной языковой модели. Маленькие модели быстро отвечают на CPU и хранят ваши данные на вашем собственном сервере — это руководство устанавливает ожидания с реальными цифрами.

1.Что вписывается в вашу ОЗУ

МодельRAM необходимСкорость на Ryzen 9 (CPU)Хорошо для
qwen2.5:0.5b~1 ГБочень быстроКлассификация, маршрутизация, испытания
llama3.2:3b~4 ГБ~10-20 токенов/sЧат, резюме, черновики
qwen2.5:7b~8 ГБ~4-8 токенов/sЛучшее качество, по-прежнему пригодное для использования

Будьте честны с собой: модель 7B на процессоре пишет медленнее, чем вы читаете. Для чат-ботов и пакетной обработки это нормально; для интерактивных помощников кодирования это не так. Держите модель на 8 ГБ, и она работает без драмы.

2 Установите Оллама

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

Модели хранятся в /usr/share/ollama/.ollama/models — несколько гигабайт каждый, поэтому проверьте свободный диск df -h Перед тем, как вытащить несколько.

3. OpenAI-совместимый API

Ollama говорит в формате OpenAI API на порту 11434. Любой клиент, который поддерживает пользовательский базовый URL, работает:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4 Держите это в секрете

Не открывайте миру порт 11434. Либо сохраните API на локальном хосте, либо поместите его за Caddy с токеном:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

Затем направьте своего клиента на https://llm.example.com/v1 с этим токеном.

5. используйте его в своих приложениях

Обобщите билеты поддержки в Telegram. Классифицировать входящие сообщения. Создавайте чертежи для бота. Запустите встраивание для небольшого поискового индекса. Все это остается на вашем сервере: нет ключей API, нет счетов за токены, нет данных, покидающих машину.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

Быстрые ответы

Можно ли использовать только вывод CPU?

Для маленьких моделей – да. 3B-модель отвечает на простые подсказки за несколько секунд на ядре Ryzen 9, а пакетные задания вообще не заботятся о скорости. Большие модели 30B + нуждаются в графическом процессоре — арендуйте его, когда вам это нужно.

Нужен ли Ollama GPU VPS?

Нет. Ollama работает на процессоре с квантованными моделями по умолчанию. GPU ускоряют большие модели, но все в таблице выше удобно работает по обычному плану Buran.

Какой план мне выбрать?

8 ГБ ОЗУ (Buran-3, €26/мес) для моделей 7B, 4 ГБ (Buran-2, 13 евро / МО) для моделей 3B, 2 ГБ для крошечных 0,5B, используемых в тестах и маршрутизации.

Запуск моделей до 7B Buran-3 с 8 ГБ DDR5.

связанный