1.下载 Ollama

访问 Download Ollama on macOS,下载对应系统 Ollama 客户端。

对于linux系统,

curl -fsSL https://ollama.com/install.sh | sh

2.卸载

2.1卸载本地服务

sudo systemctl stop ollama
sudo systemctl disable ollama
sudo rm /etc/systemd/system/ollama.service

2.2删除本地文件

which ollama
/usr/local/bin/ollama

删除对应的ollama文件

sudo rm $(which ollama)

删除下载的模型和用户等

sudo rm -r /usr/share/ollama
sudo userdel ollama
sudo groupdel ollama

3.镜像容器安装

如果不想在本地环境安装,可以基于镜像启动容器部署。

参考网址:https://hub.docker.com/r/ollama/ollama

docker run  --privileged  -d --gpus=all -v /data/1xiu/projects/ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

其中: --gpus=all 指定gpu执行;

           --privileged开启权限

           -v 定义映射路径,方便进行模型管理

访问:http://127.0.0.1:11434/,返回 Ollama is running,说明安装成功

4.加载模型

可以进入到容器内部执行相关命令

Usage:
  ollama [flags]
  ollama [command]

Available Commands:
  serve       Start ollama
  create      Create a model from a Modelfile
  show        Show information for a model
  run         Run a model
  pull        Pull a model from a registry
  push        Push a model to a registry
  list        List models
  ps          List running models
  cp          Copy a model
  rm          Remove a model
  help        Help about any command

Flags:
  -h, --help      help for ollama
  -v, --version   Show version information

Use "ollama [command] --help" for more information about a command.

例如:加载qwen2.5 32b量化版模型:

 ollama run qwen2.5-coder:32b-instruct-q3_K_S

也可以不进入到容器中,执行下面的命令:

docker exec -it ollama  ollama run qwen2.5-coder:32b-instruct-q3_K_S

5.保持模型在内存中

curl http://localhost:11434/api/generate -d '{"model": "llama3", "keep_alive": -1}'

keep_alive参数可以设置为:

  • 一个持续时间字符串(例如"10m"或"24h")
  • 一个以秒为单位的数字(例如3600)
  • 任何负数,将会无限期保持模型在内存中(例如-1或"-1m")
  • '0',将在生成响应后立即卸载模型

要卸载模型并释放内存,请使用:

curl http://localhost:11434/api/generate -d '{"model": "llama3", "keep_alive": 0}'

6.部署前端open-webui

GitHub - open-webui/open-webui: User-friendly AI Interface (Supports Ollama, OpenAI API, ...)

docker run --privileged  -d -p 3000:8080 --gpus all --add-host=host.docker.internal:host-gateway -v /data/1xiu/projects/ollama:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:cuda

容器构建之后,打开浏览器,http://localhost:3000

可以选择不同的模型,进行对话。

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。