Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)

发布于 2026/7/22 · 1 阅读
Ollama大语言模型LLM本地部署AI工具开源Windows模型运行GemmaLlama
Ollama 是 GitHub 上最受欢迎的本地大模型运行工具,支持一键运行 Llama、Gemma、Mistral 等数百个开源模型。v0.32.1 版本增强了 Gemma 4 工具调用能力,修复了 MLX 缓存泄漏问题,并优化了智能体开发体验。

封面.png

1. Ollama 简介

Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。

Ollama 于 2023 年 7 月首次发布,由一支专注于让 AI 技术变得简单易用的团队创建。它的核心理念是:让任何人都能在一分钟内,在自己的电脑上运行最先进的开源 AI 模型

Ollama 的核心优势:

  • 一键运行大模型:无需配置 Python 环境、CUDA 驱动,一条命令即可下载并运行 Llama、Gemma、Mistral、Qwen 等数百个开源模型
  • 跨平台支持:同时支持 Windows、macOS(含 Apple Silicon 原生加速)和 Linux,在 NVIDIA GPU 和 Apple Metal 上自动硬件加速
  • REST API 内置:自带兼容 OpenAI API 格式的 HTTP 接口(默认 localhost:11434),任何支持 OpenAI 的客户端都能直接接入
  • 丰富的集成生态:与 Claude Code、Continue、Cline 等主流 AI 编程工具有深度集成;支持 Open WebUI、Dify、LangChain、LlamaIndex 等数百个社区项目
  • 模型管理便捷:支持模型的下载、运行、自定义 Modelfile、量化、导入 GGUF 格式模型等全生命周期管理
  • 轻量高效:资源占用低,支持多模型并发,内置 GPU 层数自动优化和并发请求队列管理
  • 隐私优先:所有模型和数据完全运行在本地,不会上传到任何云端服务器

2. v0.32.1 版本亮点

此版本为增量更新,聚焦于工具调用增强、内存管理修复和开发体验优化。

模型推理增强

  • Gemma 4 工具调用改进:增强了 Gemma 4 模型的工具调用(tool calling)和多轮推理(multi-turn reasoning)能力,包括更可靠的 tool-response 续写机制

Bug 修复

  • MLX 缓存泄漏修复:修复了一个反复出现的 MLX 模型缓存泄漏问题,该问题可能导致跨请求内存占用持续增长;同时改进了缓存快照性能
  • MLX 超时配置:MLX 文本模型加载现在正确遵循 OLLAMA_LOAD_TIMEOUT 环境变量
  • 模型选择器修复:修复了 ollama launch 命令中,当通过 --model 参数传入已弃用模型时选择"Pick another model"无法打开模型选择器的问题

开发体验优化

  • 智能体 Web 工具:当需要认证时,智能体的 web search 和 fetch 功能现在会提示用户运行 ollama signin
  • 智能体工作目录:交互式智能体现在能接收当前工作目录,为项目上下文提供更好的感知能力
  • VS Code 文档更新:更新了面向官方 Ollama 扩展的 VS Code 安装配置文档

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2235(内含 OllamaSetup.exe、README 中英对照、发布说明中英对照和 LICENSE)。

Windows安装ollama-v0.32.1(OllamaSetup).zip
├── OllamaSetup.exe
├── 说明文档.pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

附录:快速开始

双击整合包根目录中的 OllamaSetup.exe,按向导完成安装。

安装完成后,打开终端(PowerShell 或命令提示符)即可使用:

运行模型

# 运行 Gemma 4 模型
ollama run gemma4

# 运行 Llama 模型
ollama run llama3.2

启动编程集成

# 启动 Claude Code 集成
ollama launch claude

调用 REST API

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
  "stream": false
}'