Windows 下载、安装 Ollama,本地部署大模型(附安装包OllamaSetup.exe)
文章目录

1. Ollama 简介
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 175,000 颗星标(Stars),是全球最受关注的 AI 开源项目之一。它于 2023 年推出,核心理念是让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型。凭借超过 5,000 万次的月下载量,Ollama 已成为本地 AI 推理的事实标准,被开发者称为"AI 推理领域的 Docker"。
Ollama 的核心优势:
- 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
- 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
- REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认
localhost:11434),任何支持 OpenAI 的客户端都能直接接入 - 智能体集成:
ollama launch命令可一键启动 Claude Code、OpenClaw、Codex、Copilot 等编程智能体集成 - 丰富的集成生态:与 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目深度集成
- 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
- 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器
2. v0.32.5 版本亮点
此版本为补丁更新,聚焦于 Apple Silicon(MLX)平台的推理质量修复。
2.1 Bug 修复
- MLX Metal 推理质量修复:修复了一个 MLX Metal 上的 bug,该问题可能降低 NVFP4 量化模型的输出质量,尤其是 Laguna 模型。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2258(内含 OllamaSetup.exe、README 中英对照、发布说明中英对照和 LICENSE)。
Ollama 其他版本:https://hanshuixin.org/resource/software_integrated_package/Windows/Ollama
Windows安装ollama-v0.32.5(OllamaSetup).zip
├── OllamaSetup.exe ← 双击运行即可安装
├── Windows安装ollama-v0.32.5(OllamaSetup).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE4. 安装
双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。安装完成后,Ollama 会作为 Windows 服务在后台运行,系统托盘出现 Ollama 图标。
安装后,会自动弹出桌面应用首页。
4.1 关键环境变量配置
来到配置页面

做以下三项配置修改:
- 【Expose Ollama to the network】,改为启用,这样就允许其他设备或服务访问 Ollama。
- 【Model location】,修改到C盘以外的其他位置,比如
D:\ollama\models,这是模型文件(权重文件)存放的位置,模型文件较大,放在C盘容易导致空间不够。 - 【Context length】,从 4K 改为 8K,这是上下文长度(上下窗口文大小),决定了本地大语言模型能够记住并用于生成回复的对话内容多少。
注意:上下文长度长度越长,会话内记忆越长,但是推理速度越慢。

5. 使用
5.1 挑选模型并下载
模型可从 Ollama 模型库挑选:https://ollama.com/library
以国产模型 qwen3.5:9b(通义千问 3.5,90 亿参数,中文能力强,适合本地部署)为例:
桌面应用首页对话框右下角点击,输入要找到模型 qwen3.5:9b ,找到后点击选中

在对话框输入一句你好,发送,就会开始下载当前模型,大约 6.1 GB

完成之后,就可以继续对话了

5.2 查看 GPU 与模型运行状态
# 查看 NVIDIA GPU 占用(显存、利用率、功耗)
nvidia-smi
# 查看当前加载在内存/显存中的模型
ollama psnvidia-smi实时显示GPU风扇转速、GPU 功耗、显存占用,可确认模型是否用上 GPU 加速ollama ps列出当前驻留的模型、上下窗口文大小、占用大小。
5.3 调用 REST API
Ollama 自带兼容 OpenAI 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都可直接接入:
curl http://localhost:11434/api/chat -d '{
"model": "qwen3.5:9b",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"stream": false
}'