Windows 下载、安装 Ollama,本地部署大模型(附安装包OllamaSetup.exe)

发布于 2026/8/6 · 2 阅读
Ollama大语言模型LLM本地部署AI工具开源Windows模型运行GemmaLlama
Ollama 是 GitHub 上最受欢迎的本地大模型运行工具,支持一键运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型。v0.32.5 修复了 MLX Metal 推理质量 bug,提升 NVFP4 模型的输出质量。

封面.png

1. Ollama 简介

Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 175,000 颗星标(Stars),是全球最受关注的 AI 开源项目之一。它于 2023 年推出,核心理念是让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型。凭借超过 5,000 万次的月下载量,Ollama 已成为本地 AI 推理的事实标准,被开发者称为"AI 推理领域的 Docker"。

Ollama 的核心优势:

  • 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
  • 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
  • REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都能直接接入
  • 智能体集成ollama launch 命令可一键启动 Claude Code、OpenClaw、Codex、Copilot 等编程智能体集成
  • 丰富的集成生态:与 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目深度集成
  • 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
  • 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器

2. v0.32.5 版本亮点

此版本为补丁更新,聚焦于 Apple Silicon(MLX)平台的推理质量修复。

2.1 Bug 修复

  • MLX Metal 推理质量修复:修复了一个 MLX Metal 上的 bug,该问题可能降低 NVFP4 量化模型的输出质量,尤其是 Laguna 模型。

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2258(内含 OllamaSetup.exe、README 中英对照、发布说明中英对照和 LICENSE)。

Ollama 其他版本https://hanshuixin.org/resource/software_integrated_package/Windows/Ollama

Windows安装ollama-v0.32.5(OllamaSetup).zip
├── OllamaSetup.exe   ← 双击运行即可安装
├── Windows安装ollama-v0.32.5(OllamaSetup).pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

4. 安装

双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。安装完成后,Ollama 会作为 Windows 服务在后台运行,系统托盘出现 Ollama 图标。

安装后,会自动弹出桌面应用首页。

4.1 关键环境变量配置

来到配置页面

进入配置.png

做以下三项配置修改:

  • 【Expose Ollama to the network】,改为启用,这样就允许其他设备或服务访问 Ollama。
  • 【Model location】,修改到C盘以外的其他位置,比如 D:\ollama\models ,这是模型文件(权重文件)存放的位置,模型文件较大,放在C盘容易导致空间不够。
  • 【Context length】,从 4K 改为 8K,这是上下文长度(上下窗口文大小),决定了本地大语言模型能够记住并用于生成回复的对话内容多少。

注意:上下文长度长度越长,会话内记忆越长,但是推理速度越慢。

配置.png

5. 使用

5.1 挑选模型并下载

模型可从 Ollama 模型库挑选:https://ollama.com/library

以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:

桌面应用首页对话框右下角点击,输入要找到模型 qwen3.5:9b ,找到后点击选中

搜索模型并下载.png

在对话框输入一句你好,发送,就会开始下载当前模型,大约 6.1 GB

开始下载.png

完成之后,就可以继续对话了

使用.png

5.2 查看 GPU 与模型运行状态

# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi

# 查看当前加载在内存/显存中的模型
ollama ps
  • nvidia-smi 实时显示GPU风扇转速、GPU 功耗、显存占用,可确认模型是否用上 GPU 加速
  • ollama ps 列出当前驻留的模型、上下窗口文大小、占用大小。

5.3 调用 REST API

Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.5:9b",
  "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
  "stream": false
}'