内容 /指南/当地LLM

在您的 VPS 上运行 LLM 与奥拉马

您不需要 GPU 农场来运行有用的语言模型 。 小模型在CPU上迅速回答,并将您的数据保存在自己的服务器上——这个指南以真实的数字设定了预期.

1. 内存中符合哪些内容

型号所需内存Ryzen 9号机速(CPU)不错
qwen2.5:0.5b (中文(简体) ).~1 GB 键非常快的,我们很快分类、路线、测试
拉马3.2:3b~4 GB 键~10–20个令牌/s聊天、摘要、草稿
qwen2.5:7b (中文(简体) ).~8 GB 键~4-8个令牌/s质量更好,仍可使用

老实说:CPU上的一个7B模型写作比阅读慢. 对于聊天bots和批次处理,是好的;对于交互式编码助理,是不好的. 保持模式上的8GB计划,并且没有戏剧效果.

2. 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."

模型存储于 /usr/share/ollama/.ollama/models ——每个几千兆字节,所以检查免费磁盘与 df -h 在拉几个之前。

3. 兼容OpenAI的API

Ollama在端口11434上会说OpenAI API格式. 支持自定义基础 URL 工作的任何客户端 :

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'

4. 保密

不要把11434号港口暴露给世界 要么把API留在本地主机上, 要么在Caddy后面贴上一个符号:

apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
    @auth header Authorization "Bearer long-random-token"
    handle @auth {
        reverse_proxy 127.0.0.1:11434
    }
    respond 401
}
EOF
systemctl reload caddy

那就点你的客户 https://llm.example.com/v1 和那个标志。

5,用在您的应用程序中

将支持票汇总为Telegram. 分类收到的消息 。 生成 bot 的草稿 。 运行一个小搜索索引的嵌入。 所有数据都留在你的服务器上:没有API键,没有每笔账单,没有数据离开机器.

ollama ps     # what is loaded right now
ollama list   # downloaded models
journalctl -u ollama -f

快速回答

CPU唯一的推论可用吗?

对于小模型,是的。 一个3B模型在几秒钟后在Ryzen 9核心集上解答了简单的提示,批量工作根本不关心速度. 大型30B+型号需要GPU——需要时租一款.

奥拉玛需要专用的GPU VPS吗?

没有 Ollama在CPU上运行,默认使用被量化的模型. GPU加速了大模型,但上表中的一切都在正常的Buran计划中舒适地运行.

我该选哪个计划?

8 GB RAM (Buran-3,€26/月)用于7B型机车,4 GB (Buran-2,欧元13/月)用于3B型机车,2 GB用于测试和路由中使用的微小0.5B型机车.

运行最多7B的模型 Buran-3 有8GB DDR5.

相关