ollama部署
·
1.下载 Ollama
访问 Download Ollama on macOS,下载对应系统 Ollama 客户端。
对于linux系统,
curl -fsSL https://ollama.com/install.sh | sh
2.卸载
2.1卸载本地服务
sudo systemctl stop ollama
sudo systemctl disable ollama
sudo rm /etc/systemd/system/ollama.service
2.2删除本地文件
which ollama
/usr/local/bin/ollama
删除对应的ollama文件
sudo rm $(which ollama)
删除下载的模型和用户等
sudo rm -r /usr/share/ollama
sudo userdel ollama
sudo groupdel ollama
3.镜像容器安装
如果不想在本地环境安装,可以基于镜像启动容器部署。
参考网址:https://hub.docker.com/r/ollama/ollama
docker run --privileged -d --gpus=all -v /data/1xiu/projects/ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
其中: --gpus=all 指定gpu执行;
--privileged开启权限
-v 定义映射路径,方便进行模型管理
访问:http://127.0.0.1:11434/,返回 Ollama is running,说明安装成功
4.加载模型
可以进入到容器内部执行相关命令
Usage:
ollama [flags]
ollama [command]
Available Commands:
serve Start ollama
create Create a model from a Modelfile
show Show information for a model
run Run a model
pull Pull a model from a registry
push Push a model to a registry
list List models
ps List running models
cp Copy a model
rm Remove a model
help Help about any command
Flags:
-h, --help help for ollama
-v, --version Show version information
Use "ollama [command] --help" for more information about a command.
例如:加载qwen2.5 32b量化版模型:
ollama run qwen2.5-coder:32b-instruct-q3_K_S
也可以不进入到容器中,执行下面的命令:
docker exec -it ollama ollama run qwen2.5-coder:32b-instruct-q3_K_S
5.保持模型在内存中
curl http://localhost:11434/api/generate -d '{"model": "llama3", "keep_alive": -1}'
keep_alive参数可以设置为:
- 一个持续时间字符串(例如"10m"或"24h")
- 一个以秒为单位的数字(例如3600)
- 任何负数,将会无限期保持模型在内存中(例如-1或"-1m")
- '0',将在生成响应后立即卸载模型
要卸载模型并释放内存,请使用:
curl http://localhost:11434/api/generate -d '{"model": "llama3", "keep_alive": 0}'
6.部署前端open-webui
GitHub - open-webui/open-webui: User-friendly AI Interface (Supports Ollama, OpenAI API, ...)
docker run --privileged -d -p 3000:8080 --gpus all --add-host=host.docker.internal:host-gateway -v /data/1xiu/projects/ollama:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:cuda
容器构建之后,打开浏览器,http://localhost:3000
可以选择不同的模型,进行对话。

所有评论(0)