Ollama 是一个轻量级、易上手的本地大模型运行框架
Ollama 详细部署教程
Ollama 是一个轻量级、易上手的本地大模型运行框架,它让你能像运行普通软件一样,在 Windows、macOS 或 Linux 上轻松运行和管理各种开源大语言模型(如 Qwen、DeepSeek、Llama 等),所有数据都保留在本地,保障隐私安全。本教程将提供最全面的部署指南,从零开始带你完成安装、模型部署与调用。
1. 准备工作
1.1 硬件与系统要求
在开始前,请检查你的设备是否满足基本要求:
| 配置项 | 基础要求 (运行 7B 模型) | 进阶要求 (运行更大模型) |
|---|---|---|
| 操作系统 | Windows 10/11, macOS, Linux | 同左 |
| CPU | 4 核或以上 | 8 核或以上 |
| 内存 | 8 GB | 16 GB 或更高 |
| 磁盘空间 | 至少 20 GB (用于存储模型) | 更大容量 (模型文件可达数GB至数十GB) |
| GPU (可选) | 无 (CPU模式可运行) | NVIDIA GPU (需配置CUDA) 以获得更好性能 |
1.2 必要环境
- 对于 Docker 部署:需要安装并配置好 Docker 环境。
- 对于 GPU 加速:若想使用 NVIDIA GPU,需提前安装好 NVIDIA 驱动和 NVIDIA Container Toolkit。
2. 安装 Ollama
Ollama 提供了多种安装方式,你可以根据自己的习惯和环境选择。
方式一:直接安装 (推荐新手)
这是最简单、最通用的方式,适合在个人电脑上快速开始。
macOS / Linux:
打开终端,执行以下命令:1
curl -fsSL https://ollama.com/install.sh | sh
该脚本会自动完成安装。
Windows:
- 访问 Ollama官网,点击下载 Windows 安装包。
- 双击运行安装程序,按向导完成安装。
验证安装:
安装完成后,打开终端(或命令提示符)并运行:1
ollama --version
如果正确显示版本号,则说明安装成功。
方式二:使用 Docker 部署
Docker 方式能提供更好的环境隔离和可复现性,适合生产环境或服务器部署。
拉取并运行容器 (CPU 模式):
1
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
-d:后台运行容器-v ollama:/root/.ollama:挂载数据卷,持久化存储模型文件,防止容器删除后数据丢失-p 11434:11434:将容器的 11434 端口映射到主机,供 API 访问--name ollama:给容器命名
启动 GPU 加速容器 (需 NVIDIA GPU):
如果满足条件,可使用此命令获得更好的推理性能:1
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
--gpus=all:将宿主机所有 GPU 资源分配给容器。
3. 下载与运行模型
安装完成后,就可以下载并运行你感兴趣的开源模型了。
3.1 基础命令
- 下载/拉取模型:
ollama pull <模型名称:标签>- 例如,下载阿里的通义千问 2.5 模型:
ollama pull qwen2.5。 - 下载 DeepSeek-R1 小型模型:
ollama pull deepseek-r1:1.5b。
- 例如,下载阿里的通义千问 2.5 模型:
- 运行并对话:
ollama run <模型名称:标签>- 如果本地没有该模型,此命令会先自动下载,然后直接进入对话界面。
- 例如:
ollama run qwen2.5。
- 查看本地已有模型:
ollama list。 - 删除模型:
ollama rm <模型名称>。
3.2 国内下载加速(重要)
由于网络原因,直接从官网下载模型可能较慢。你可以使用国内镜像站来加速下载。
使用 ModelScope (魔搭) 镜像:
在拉取命令前加上镜像站前缀,例如:1
ollama pull modelscope.cn/Qwen/Qwen2.5-7B-GGUF
注意:模型名称和标签 (Tag) 可能因镜像站命名规则而异,建议先去 ModelScope 官网搜索你需要的 GGUF 格式模型,再复制其 ID 进行拉取。
3.3 首次对话测试
以运行 Qwen2.5 模型为例:
1 | ollama run qwen2.5 |
等待模型加载完成后,你会看到 >>> 提示符,输入你的问题即可开始对话。输入 /bye 可退出对话。
4. 配置与高级使用
4.1 常用环境变量
你可以通过设置环境变量来定制 Ollama 的行为。
| 环境变量 | 作用 | 示例 |
|---|---|---|
OLLAMA_HOST |
指定 Ollama 服务监听的地址和端口 | 0.0.0.0:11434 (允许外部访问) |
OLLAMA_MODELS |
更改模型文件的存储目录 | /path/to/your/models |
OLLAMA_NUM_PARALLEL |
设置同时处理的并发请求数 | 4 |
OLLAMA_MAX_LOADED_MODELS |
设置最多同时加载到内存的模型数量 | 2 |
在 Docker 中使用:通过
-e参数传递,例如:1
docker run -d -e OLLAMA_HOST=0.0.0.0:11434 ... ollama/ollama
在 Linux 服务中使用:可修改
/etc/systemd/system/ollama.service文件,在[Service]段落下添加Environment="OLLAMA_HOST=0.0.0.0:11434",然后重启服务。
4.2 API 调用
Ollama 提供了简洁的 REST API,默认监听 http://localhost:11434,方便其他应用集成。
示例:使用 curl 调用文本生成
1 | curl http://localhost:11434/api/generate -d '{ |
使用 Python 调用
首先安装官方库:pip install ollama,然后:
1 | import ollama |
完整的 API 文档可参考 Ollama API 文档。
5. 图形界面:接入 Open WebUI
对于不习惯命令行的用户,可以部署一个美观的图形界面——Open WebUI。它支持多模型切换、历史记录、文件上传等丰富功能。
使用 Docker Compose 一键部署:
创建一个
docker-compose.yml文件,内容如下:1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24services:
ollama:
image: ollama/ollama:latest
container_name: ollama
restart: unless-stopped
ports:
- "11434:11434"
volumes:
- ollama_data:/root/.ollama
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: open-webui
restart: unless-stopped
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
volumes:
- open-webui_data:/app/backend/data
volumes:
ollama_data:
open-webui_data:在文件所在目录下运行:
1
docker-compose up -d
启动后,在浏览器访问
http://localhost:3000,注册账号即可开始使用。
6. 故障排除
| 问题 | 可能原因与解决方案 |
|---|---|
| 下载模型速度极慢或失败 | 网络问题。尝试使用国内 ModelScope 镜像站进行拉取。 |
| API 无法访问 (连接被拒绝) | 1. 检查 Ollama 服务是否运行。2. 检查 OLLAMA_HOST 环境变量是否设置正确。3. 检查防火墙是否放行 11434 端口。 |
| Docker 容器无法使用 GPU | 1. 确认 NVIDIA 驱动及 NVIDIA Container Toolkit 已正确安装。2. 运行 docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi 测试 GPU 是否对 Docker 可见。 |
| 运行大模型时系统卡顿或内存不足 | 模型参数规模 (B) 越大,所需内存越多。可尝试下载更小尺寸的模型(如 1.5B, 3B 或 7B 版本),或设置 OLLAMA_NUM_PARALLEL 和 OLLAMA_MAX_LOADED_MODELS 限制资源消耗。 |
7. 总结
Ollama 极大地降低了本地运行大模型的门槛。无论你是想私有化部署一个 AI 助手、测试不同模型的能力,还是为自己的应用集成本地 AI 能力,Ollama 都是一个绝佳的起点。
相关资源:
- 项目主页:GitHub - ollama/ollama
- 模型库:Ollama Library
- API 文档:Ollama API











