您不需要 GPU 农场来运行有用的语言模型 。 小模型在CPU上迅速回答,并将您的数据保存在自己的服务器上——这个指南以真实的数字设定了预期.
| 型号 | 所需内存 | Ryzen 9号机速(CPU) | 不错 |
|---|---|---|---|
| qwen2.5:0.5b (中文(简体) ). | ~1 GB 键 | 非常快的,我们很快 | 分类、路线、测试 |
| 拉马3.2:3b | ~4 GB 键 | ~10–20个令牌/s | 聊天、摘要、草稿 |
| qwen2.5:7b (中文(简体) ). | ~8 GB 键 | ~4-8个令牌/s | 质量更好,仍可使用 |
老实说:CPU上的一个7B模型写作比阅读慢. 对于聊天bots和批次处理,是好的;对于交互式编码助理,是不好的. 保持模式上的8GB计划,并且没有戏剧效果.
curl -fsSL https://ollama.com/install.sh | sh
systemctl enable --now ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b "Say hello in one short sentence."
模型存储于 /usr/share/ollama/.ollama/models ——每个几千兆字节,所以检查免费磁盘与 df -h 在拉几个之前。
Ollama在端口11434上会说OpenAI API格式. 支持自定义基础 URL 工作的任何客户端 :
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.2:3b","messages":[{"role":"user","content":"Hello"}]}'
不要把11434号港口暴露给世界 要么把API留在本地主机上, 要么在Caddy后面贴上一个符号:
apt install -y caddy
cat > /etc/caddy/Caddyfile <<'EOF'
llm.example.com {
@auth header Authorization "Bearer long-random-token"
handle @auth {
reverse_proxy 127.0.0.1:11434
}
respond 401
}
EOF
systemctl reload caddy
那就点你的客户 https://llm.example.com/v1 和那个标志。
将支持票汇总为Telegram. 分类收到的消息 。 生成 bot 的草稿 。 运行一个小搜索索引的嵌入。 所有数据都留在你的服务器上:没有API键,没有每笔账单,没有数据离开机器.
ollama ps # what is loaded right now
ollama list # downloaded models
journalctl -u ollama -f
对于小模型,是的。 一个3B模型在几秒钟后在Ryzen 9核心集上解答了简单的提示,批量工作根本不关心速度. 大型30B+型号需要GPU——需要时租一款.
没有 Ollama在CPU上运行,默认使用被量化的模型. GPU加速了大模型,但上表中的一切都在正常的Buran计划中舒适地运行.
8 GB RAM (Buran-3,€26/月)用于7B型机车,4 GB (Buran-2,欧元13/月)用于3B型机车,2 GB用于测试和路由中使用的微小0.5B型机车.
运行最多7B的模型 Buran-3 有8GB DDR5.