Вам не нужна ферма GPU для запуска полезной языковой модели. Маленькие модели быстро отвечают на CPU и хранят ваши данные на вашем собственном сервере — это руководство устанавливает ожидания с реальными цифрами.
| Модель | RAM необходим | Скорость на Ryzen 9 (CPU) | Хорошо для |
|---|---|---|---|
| qwen2.5:0.5b | ~1 ГБ | очень быстро | Классификация, маршрутизация, испытания |
| llama3.2:3b | ~4 ГБ | ~10-20 токенов/s | Чат, резюме, черновики |
| qwen2.5:7b | ~8 ГБ | ~4-8 токенов/s | Лучшее качество, по-прежнему пригодное для использования |
Будьте честны с собой: модель 7B на процессоре пишет медленнее, чем вы читаете. Для чат-ботов и пакетной обработки это нормально; для интерактивных помощников кодирования это не так. Держите модель на 8 ГБ, и она работает без драмы.
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."
Модели хранятся в /usr/share/ollama/.ollama/models — несколько гигабайт каждый, поэтому проверьте свободный диск df -h Перед тем, как вытащить несколько.
Ollama говорит в формате OpenAI API на порту 11434. Любой клиент, который поддерживает пользовательский базовый URL, работает:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'
Не открывайте миру порт 11434. Либо сохраните API на локальном хосте, либо поместите его за Caddy с токеном:
apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
@auth header Authorization "Bearer long-random-token"
handle @auth {
reverse_proxy 127.0.0.1:11434
}
respond 401
}
EOF
systemctl reload caddy
Затем направьте своего клиента на https://llm.example.com/v1 с этим токеном.
Обобщите билеты поддержки в Telegram. Классифицировать входящие сообщения. Создавайте чертежи для бота. Запустите встраивание для небольшого поискового индекса. Все это остается на вашем сервере: нет ключей API, нет счетов за токены, нет данных, покидающих машину.
ollama ps # what is loaded right now
ollama list # downloaded models
journalctl -u ollama -f
Для маленьких моделей – да. 3B-модель отвечает на простые подсказки за несколько секунд на ядре Ryzen 9, а пакетные задания вообще не заботятся о скорости. Большие модели 30B + нуждаются в графическом процессоре — арендуйте его, когда вам это нужно.
Нет. Ollama работает на процессоре с квантованными моделями по умолчанию. GPU ускоряют большие модели, но все в таблице выше удобно работает по обычному плану Buran.
8 ГБ ОЗУ (Buran-3, €26/мес) для моделей 7B, 4 ГБ (Buran-2, 13 евро / МО) для моделей 3B, 2 ГБ для крошечных 0,5B, используемых в тестах и маршрутизации.
Запуск моделей до 7B Buran-3 с 8 ГБ DDR5.