macOS下载、安装ollama-v0.32.1(附安装包Ollama.dmg)

1. Ollama 简介
Ollama 是目前全球最流行的本地大语言模型(LLM)运行工具,GitHub 上已获得 超过 130,000 颗星标(Stars),拥有庞大的社区生态。它将复杂的模型管理简化为一条命令,让开发者能在 macOS、Windows 和 Linux 上轻松运行 Llama、Gemma、Qwen、DeepSeek 等数百种开源模型。
Ollama 由 Jeffrey Morgan(jmorganca)创建并主导开发,底层基于 Georgi Gerganov 发起的 llama.cpp 项目,采用 MIT 开源许可证。项目自 2023 年推出以来迅速崛起,已成为本地 AI 推理的事实标准,被 Claude Code、OpenClaw、Continue、Cline 等主流 AI 工具原生集成。
Ollama 的核心优势:
- 一键运行模型:
ollama run gemma4即可自动拉取并运行模型,无需手动下载或配置 - REST API 原生支持:提供完整的 HTTP API(默认
localhost:11434),与 OpenAI API 兼容的聊天和嵌入接口 - 丰富的模型库:在 ollama.com/library 上可浏览数百个预配置模型,涵盖对话、代码、嵌入等各类场景
- 跨平台:同时支持 macOS(Apple Silicon + Intel)、Windows 和 Linux,并提供 Docker 镜像
- 编程助手集成:通过
ollama launch一键集成 Claude Code、Codex、Copilot CLI、Droid、OpenCode 等编程助手 - Agent 生态:内置 Agent 能力,支持网络搜索(web search)、工具调用(tool calling)、多轮推理,并可与 OpenClaw 等 AI 助理框架无缝协作
- 多语言 SDK:官方提供 Python 和 JavaScript SDK,社区贡献了 Go、Rust、Java、.NET、Swift、C++、PHP、R 等数十种语言的开发库
- 庞大的集成生态:超过 200 个社区集成项目,涵盖聊天界面、RAG 知识库、IDE 插件、终端工具、消息机器人等
2. v0.32.1 版本亮点
该版本汇集了 5 位贡献者 的 14 条 贡献。
推理与模型优化
- 改进 Gemma 4 工具调用与多轮推理:增强了 Google Gemma 4 模型在工具调用场景下的表现,工具响应续接(tool-response continuation)更加可靠,多轮对话推理更稳定。
- 修复 MLX 模型缓存泄漏:修复了 Apple Silicon 平台 MLX 后端中一个反复出现的内存缓存泄漏问题,该问题会导致多次请求后内存持续增长。同时优化了缓存快照(cache snapshot)的性能。
- MLX 加载超时支持:MLX 文本模型加载现尊重
OLLAMA_LOAD_TIMEOUT环境变量设置,避免模型加载过程无限等待。
Agent 能力增强
- 网络搜索认证提示:Agent 的 web search 和 fetch 功能在需要认证时,会直接提示用户运行
ollama signin,体验更加友好。 - 工作目录上下文:交互式 Agent 现可获取当前工作目录(CWD),为编程相关任务提供更准确的项目上下文。
- 模型选择器修复:修复
ollama launch中,通过--model传入已弃用模型后选择"选择其他模型(Pick another model)"时无法正常打开模型选择器的问题。
文档与集成
- VS Code 扩展文档更新:更新了 VS Code 官方 Ollama 扩展的安装与配置说明文档。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2236(内含 Ollama.dmg、README 中英对照、发布说明中英对照和 LICENSE)。
macOS-通用安装ollama-v0.32.1(Ollama).zip
├── Ollama.dmg
├── 说明文档.pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE附录:快速开始
Ollama.dmg 是适用于 macOS 的通用安装包,同时兼容 Intel 和 Apple Silicon(M1/M2/M3/M4)芯片。双击 .dmg 文件,将 Ollama.app 拖入 Applications 文件夹即可完成安装。安装后 Ollama 会在菜单栏运行,提供快速访问和模型管理。
推荐依赖:Ollama 启动后内置 llama.cpp 推理引擎,无需额外安装依赖。如需 GPU 加速,macOS 会自动使用 Metal(Apple Silicon GPU)进行推理。
常用命令
Ollama 安装后,在终端(Terminal)中直接使用:
# 查看帮助
ollama
# 运行 Gemma 4 模型(首次自动下载)
ollama run gemma4
# 列出已下载的模型
ollama list
# 查看模型信息
ollama show gemma4
# 启动 Claude Code 集成
ollama launch claude
# 启动 OpenClaw AI 助理
ollama launch openclaw
# 通过 REST API 调用(非流式)
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "你好"}],
"stream": false
}'
# 删除模型
ollama rm gemma4
# 查看运行状态
ollama ps
# 停止模型运行
ollama stop gemma4