Linux 下载、安装 Ollama,本地部署大模型(附安装包ollama-linux-amd64.tar.zst)

发布于 2026/8/6 · 1 阅读
Ollama大语言模型本地AILLM模型推理llama.cppAI工具开源LinuxGemma
Ollama 是全球最流行的本地大语言模型运行工具,可在 Linux/macOS/Windows 上一条命令运行 Llama、Gemma、DeepSeek 等数百种开源模型,提供 REST API、编程助手集成与庞大社区生态。

封面.png

1. Ollama 简介

Ollama 是当前全球最流行的本地大语言模型(LLM)运行工具,GitHub 上已积累约 17.6 万颗星标,月下载量超过 5200 万次,被视为"LLM 界的 Docker"——一条命令拉取模型,一条命令运行模型。它由 Jeff Morgan 与 Michael Chiang 于 2023 年创建并主导开发,两人曾深度参与 Docker Desktop 的打造;项目底层基于 Georgi Gerganov 发起的 llama.cpp 推理引擎,采用 MIT 开源许可证。2026 年 7 月,Ollama 完成 6500 万美元 B 轮融资,每月活跃开发者接近 890 万。

Ollama 让开发者无需云服务与 API 密钥,即可在本地 Linux、macOS、Windows 上轻松运行 Llama、Gemma、Qwen、DeepSeek 等数百种开源模型,模型下载后可完全离线运行,数据不离开本地。它提供默认端口 11434 的 REST API、OpenAI 兼容接口,并支持 NVIDIA CUDA、AMD ROCm、Apple Metal/MLX 等多种硬件加速。

Ollama 的核心优势:

  • 一键运行模型ollama run gemma4 即可自动拉取并运行模型,无需手动下载或配置
  • 交互式智能体:直接运行 ollama 命令即可进入智能体工作流,支持聊天、写代码、搜索网页、委派真实工作
  • 编程助手集成:通过 ollama launch 一键接入 Claude Code、Codex、Copilot CLI、Droid、OpenCode 等编程助手
  • REST API 原生支持:提供完整的 HTTP API(默认 localhost:11434),与 OpenAI API 兼容
  • 丰富的模型库:在 https://ollama.com/library 上可浏览数百个预配置模型,涵盖对话、代码、嵌入等各类场景
  • 跨平台与多硬件加速:同时支持 Linux、macOS、Windows,覆盖 NVIDIA CUDA、AMD ROCm、Apple Metal/MLX
  • 庞大的集成生态:官方提供 Python/JavaScript SDK,社区贡献了数十种语言的开发库及超过 200 个集成项目,涵盖聊天界面、RAG 知识库、IDE 插件等

2. v0.32.5 版本亮点

该版本汇集了 1 位贡献者2 条 贡献。

v0.32.5 是 v0.32 版本线的维护性补丁版本,紧承 v0.32.0 对使用方式的全面重构(统一入口、交互式智能体、ChatGPT 集成更名),聚焦于推理质量的一处关键修复:

2.1 推理质量修复

  • 修复 MLX Metal 推理缺陷:修复了一个 MLX Metal 缺陷,该问题可能导致 NVFP4 量化模型的输出质量下降,尤其影响 Laguna 模型。

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2256(内含 ollama-linux-amd64.tar.zst、README 中英对照、发布说明中英对照和 LICENSE)。

适用于 Linux x86_64(amd64)。

Ollama 其他版本https://hanshuixin.org/resource/software_integrated_package/Linux/Ollama

Linux安装ollama-v0.32.5(ollama-linux-amd64).zip
├── ollama-linux-amd64.tar.zst   ← 解压后部署使用
├── Linux安装ollama-v0.32.5(ollama-linux-amd64).pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

4. 安装

ollama-linux-amd64.tar.zst 是 Ollama 官方的 Linux amd64/x86_64 二进制发行包,使用 Zstandard 压缩,内置 llama.cpp 推理引擎,不绑定特定发行版,适用于绝大多数 Linux 环境。

# 解压发行包
tar --zstd -xf ollama-linux-amd64.tar.zst

# 将可执行文件部署到系统路径(推荐 /usr/local/bin)
sudo mv ollama-linux-amd64/ollama /usr/local/bin/

# 验证安装
ollama --version

直接运行即可启动服务(默认监听 11434 端口):

ollama serve

生产环境建议注册为 systemd 服务,实现开机自启与崩溃自动重启。创建 /etc/systemd/system/ollama.service,写入:

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/local/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="PATH=/usr/local/bin:/usr/bin:/bin"

[Install]
WantedBy=default.target
# 创建专用运行用户、重新加载并启动服务
sudo useradd -r -s /bin/false ollama
sudo systemctl daemon-reload
sudo systemctl enable ollama    # 开机自启
sudo systemctl start ollama     # 启动服务
systemctl status ollama         # 查看状态
journalctl -u ollama.service -f # 实时查看日志

4.1 关键环境变量配置

Ollama 默认仅监听本机 127.0.0.1,模型存放在 $HOME/.ollama/models。服务器部署时通常需要调整,可通过 systemd override 配置(创建 /etc/systemd/system/ollama.service.d/override.conf):

[Service]
# 监听地址:改为 0.0.0.0 后允许局域网或外部设备访问
Environment="OLLAMA_HOST=0.0.0.0:11434"
# 模型存储目录(模型文件较大,建议放到空间充足的分区)
Environment="OLLAMA_MODELS=/var/ai/ollama/models"
# 模型在内存中保持加载的时长,6h 内重复调用无需重新加载
Environment="OLLAMA_KEEP_ALIVE=6h"
# 默认上下文长度(默认 4K,改为 8K:记忆更多,但推理略慢)
Environment="OLLAMA_CONTEXT_LENGTH=8192"
# 最大并行请求数
Environment="OLLAMA_NUM_PARALLEL=4"
# 允许的跨域来源(Open WebUI 等网页端接入时使用)
Environment="OLLAMA_ORIGINS=*"
# 启用 Flash Attention 优化
Environment="OLLAMA_FLASH_ATTENTION=true"
# 重新加载并重启服务使配置生效
sudo systemctl daemon-reload
sudo systemctl restart ollama

5. 使用

5.1 挑选模型并下载

模型可从 Ollama 模型库挑选:https://ollama.com/library

以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:

# 下载并启动模型(首次自动下载,约 6.1GB),随后直接输入问题对话
ollama run qwen3.5:9b

运行 Gemma 4 等其他模型同理:ollama run gemma4

5.2 查看 GPU 与模型运行状态

# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi

# 查看当前加载在内存/显存中的模型
ollama ps
  • nvidia-smi 实时显示 GPU 功耗、显存占用,可确认模型是否用上 GPU 加速
  • ollama ps 列出当前驻留的模型、上下文大小、占用大小

5.3 调用 REST API

Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.5:9b",
  "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
  "stream": false
}'

5.4 常用命令

# 查看帮助
ollama

# 列出已下载的模型
ollama list

# 查看模型信息
ollama show qwen3.5:9b

# 启动 Claude Code 集成
ollama launch claude

# 删除模型
ollama rm qwen3.5:9b

Ollama 内置 llama.cpp 推理引擎(由 Georgi Gerganov 创立),运行时自动利用 NVIDIA CUDA 等硬件加速,无需额外配置。