Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)

1. Ollama 简介
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
Ollama 于 2023 年 7 月首次发布,由一支专注于让 AI 技术变得简单易用的团队创建。它的核心理念是:让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型。
Ollama 的核心优势:
- 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
- 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
- REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认
localhost:11434),任何支持 OpenAI 的客户端都能直接接入 - 丰富的集成生态:与 Claude Code、Continue、Cline 等主流 AI 编程工具有深度集成;支持 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目
- 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
- 轻量高效:资源占用低,支持多模型并发,内置 GPU 层数自动优化和并发请求队列管理
- 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器
2. v0.32.1 版本亮点
此版本为增量更新,聚焦于工具调用增强、内存管理修复和开发体验优化。
模型推理增强
- Gemma 4 工具调用改进:增强了 Gemma 4 模型的工具调用(tool calling)和多轮推理(multi-turn reasoning)能力,包括更可靠的 tool-response 续写机制
Bug 修复
- MLX 缓存泄漏修复:修复了一个反复出现的 MLX 模型缓存泄漏问题,该问题可能导致跨请求内存占用持续增长;同时改进了缓存快照性能
- MLX 超时配置:MLX 文本模型加载现在正确遵循
OLLAMA_LOAD_TIMEOUT环境变量 - 模型选择器修复:修复了
ollama launch命令中,当通过--model参数传入已弃用模型时选择"Pick another model"无法打开模型选择器的问题
开发体验优化
- 智能体 Web 工具:当需要认证时,智能体的 web search 和 fetch 功能现在会提示用户运行
ollama signin - 智能体工作目录:交互式智能体现在能接收当前工作目录,为项目上下文提供更好的感知能力
- VS Code 文档更新:更新了面向官方 Ollama 扩展的 VS Code 安装配置文档
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2235(内含 OllamaSetup.exe、README 中英对照、发布说明中英对照和 LICENSE)。
Windows安装ollama-v0.32.1(OllamaSetup).zip
├── OllamaSetup.exe
├── 说明文档.pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE附录:快速开始
双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。
安装完成后,打开终端(PowerShell 或命令提示符)即可使用:
运行模型
# 运行 Gemma 4 模型
ollama run gemma4
# 运行 Llama 模型
ollama run llama3.2启动编程集成
# 启动 Claude Code 集成
ollama launch claude调用 REST API
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"stream": false
}'