Linux 下载、安装 Ollama,本地部署大模型(附安装包ollama-linux-amd64.tar.zst)
文章目录

1. Ollama 简介
Ollama 是当前全球最流行的本地大语言模型(LLM)运行工具,GitHub 上已积累约 17.6 万颗星标,月下载量超过 5200 万次,被视为"LLM 界的 Docker"——一条命令拉取模型,一条命令运行模型。它由 Jeff Morgan 与 Michael Chiang 于 2023 年创建并主导开发,两人曾深度参与 Docker Desktop 的打造;项目底层基于 Georgi Gerganov 发起的 llama.cpp 推理引擎,采用 MIT 开源许可证。2026 年 7 月,Ollama 完成 6500 万美元 B 轮融资,每月活跃开发者接近 890 万。
Ollama 让开发者无需云服务与 API 密钥,即可在本地 Linux、macOS、Windows 上轻松运行 Llama、Gemma、Qwen、DeepSeek 等数百种开源模型,模型下载后可完全离线运行,数据不离开本地。它提供默认端口 11434 的 REST API、OpenAI 兼容接口,并支持 NVIDIA CUDA、AMD ROCm、Apple Metal/MLX 等多种硬件加速。
Ollama 的核心优势:
- 一键运行模型:
ollama run gemma4即可自动拉取并运行模型,无需手动下载或配置 - 交互式智能体:直接运行
ollama命令即可进入智能体工作流,支持聊天、写代码、搜索网页、委派真实工作 - 编程助手集成:通过
ollama launch一键接入 Claude Code、Codex、Copilot CLI、Droid、OpenCode 等编程助手 - REST API 原生支持:提供完整的 HTTP API(默认
localhost:11434),与 OpenAI API 兼容 - 丰富的模型库:在 https://ollama.com/library 上可浏览数百个预配置模型,涵盖对话、代码、嵌入等各类场景
- 跨平台与多硬件加速:同时支持 Linux、macOS、Windows,覆盖 NVIDIA CUDA、AMD ROCm、Apple Metal/MLX
- 庞大的集成生态:官方提供 Python/JavaScript SDK,社区贡献了数十种语言的开发库及超过 200 个集成项目,涵盖聊天界面、RAG 知识库、IDE 插件等
2. v0.32.5 版本亮点
该版本汇集了 1 位贡献者 的 2 条 贡献。
v0.32.5 是 v0.32 版本线的维护性补丁版本,紧承 v0.32.0 对使用方式的全面重构(统一入口、交互式智能体、ChatGPT 集成更名),聚焦于推理质量的一处关键修复:
2.1 推理质量修复
- 修复 MLX Metal 推理缺陷:修复了一个 MLX Metal 缺陷,该问题可能导致 NVFP4 量化模型的输出质量下降,尤其影响 Laguna 模型。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2256(内含 ollama-linux-amd64.tar.zst、README 中英对照、发布说明中英对照和 LICENSE)。
适用于 Linux x86_64(amd64)。
Ollama 其他版本:https://hanshuixin.org/resource/software_integrated_package/Linux/Ollama
Linux安装ollama-v0.32.5(ollama-linux-amd64).zip
├── ollama-linux-amd64.tar.zst ← 解压后部署使用
├── Linux安装ollama-v0.32.5(ollama-linux-amd64).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE4. 安装
ollama-linux-amd64.tar.zst 是 Ollama 官方的 Linux amd64/x86_64 二进制发行包,使用 Zstandard 压缩,内置 llama.cpp 推理引擎,不绑定特定发行版,适用于绝大多数 Linux 环境。
# 解压发行包
tar --zstd -xf ollama-linux-amd64.tar.zst
# 将可执行文件部署到系统路径(推荐 /usr/local/bin)
sudo mv ollama-linux-amd64/ollama /usr/local/bin/
# 验证安装
ollama --version直接运行即可启动服务(默认监听 11434 端口):
ollama serve生产环境建议注册为 systemd 服务,实现开机自启与崩溃自动重启。创建 /etc/systemd/system/ollama.service,写入:
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="PATH=/usr/local/bin:/usr/bin:/bin"
[Install]
WantedBy=default.target# 创建专用运行用户、重新加载并启动服务
sudo useradd -r -s /bin/false ollama
sudo systemctl daemon-reload
sudo systemctl enable ollama # 开机自启
sudo systemctl start ollama # 启动服务
systemctl status ollama # 查看状态
journalctl -u ollama.service -f # 实时查看日志4.1 关键环境变量配置
Ollama 默认仅监听本机 127.0.0.1,模型存放在 $HOME/.ollama/models。服务器部署时通常需要调整,可通过 systemd override 配置(创建 /etc/systemd/system/ollama.service.d/override.conf):
[Service]
# 监听地址:改为 0.0.0.0 后允许局域网或外部设备访问
Environment="OLLAMA_HOST=0.0.0.0:11434"
# 模型存储目录(模型文件较大,建议放到空间充足的分区)
Environment="OLLAMA_MODELS=/var/ai/ollama/models"
# 模型在内存中保持加载的时长,6h 内重复调用无需重新加载
Environment="OLLAMA_KEEP_ALIVE=6h"
# 默认上下文长度(默认 4K,改为 8K:记忆更多,但推理略慢)
Environment="OLLAMA_CONTEXT_LENGTH=8192"
# 最大并行请求数
Environment="OLLAMA_NUM_PARALLEL=4"
# 允许的跨域来源(Open WebUI 等网页端接入时使用)
Environment="OLLAMA_ORIGINS=*"
# 启用 Flash Attention 优化
Environment="OLLAMA_FLASH_ATTENTION=true"# 重新加载并重启服务使配置生效
sudo systemctl daemon-reload
sudo systemctl restart ollama5. 使用
5.1 挑选模型并下载
模型可从 Ollama 模型库挑选:https://ollama.com/library
以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:
# 下载并启动模型(首次自动下载,约 6.1GB),随后直接输入问题对话
ollama run qwen3.5:9b运行 Gemma 4 等其他模型同理:ollama run gemma4。
5.2 查看 GPU 与模型运行状态
# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi
# 查看当前加载在内存/显存中的模型
ollama psnvidia-smi实时显示 GPU 功耗、显存占用,可确认模型是否用上 GPU 加速ollama ps列出当前驻留的模型、上下文大小、占用大小
5.3 调用 REST API
Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:
curl http://localhost:11434/api/chat -d '{
"model": "qwen3.5:9b",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"stream": false
}'5.4 常用命令
# 查看帮助
ollama
# 列出已下载的模型
ollama list
# 查看模型信息
ollama show qwen3.5:9b
# 启动 Claude Code 集成
ollama launch claude
# 删除模型
ollama rm qwen3.5:9bOllama 内置 llama.cpp 推理引擎(由 Georgi Gerganov 创立),运行时自动利用 NVIDIA CUDA 等硬件加速,无需额外配置。