macOS 下载、安装 Ollama,本地部署大模型(附安装包Ollama.dmg)

1. Ollama 简介
Ollama 是目前全球最流行的本地大语言模型(LLM)运行工具,GitHub 上已获得 超过 170,000 颗星标(Stars),并多次被 GitHub 评为年度最热门开源项目。它由 Jeffrey Morgan(jmorganca)创建并主导开发,底层基于 Georgi Gerganov 发起的 llama.cpp 项目,采用 MIT 开源许可证。项目于 2023 年推出后迅速崛起,已成为本地 AI 推理的事实标准,被 Claude Code、OpenClaw、Cline、Continue 等主流 AI 工具原生集成。
2026 年 7 月,Ollama 宣布完成 6500 万美元 B 轮融资(由 Theory Ventures 领投),累计融资达 8800 万美元,月活跃开发者接近 890 万,覆盖 85% 的财富 500 强公司。Ollama 同时是"AI 领域的 Docker"——一条命令即可拉取并运行开源模型,一个 API 即可对接各类应用。
Ollama 的核心优势:
- 一键运行模型:
ollama run gemma4即可自动拉取并运行模型,无需手动下载或配置 - REST API 原生支持:提供完整的 HTTP API(默认
localhost:11434),与 OpenAI API 兼容的聊天和嵌入接口 - 丰富的模型库:在 ollama.com/library 上可浏览数百个预配置模型,涵盖 Llama、Gemma、Qwen、DeepSeek、GLM、MiniMax、Kimi 等主流系列
- 跨平台:同时支持 macOS(Apple Silicon + Intel)、Windows 和 Linux,并提供 Docker 镜像
- 编程助手集成:通过
ollama launch一键集成 Claude Code、Codex、Copilot CLI、Droid、OpenCode 等编程助手 - Agent 生态:内置 Agent 能力,支持网络搜索(web search)、工具调用(tool calling)、多轮推理,并可与 OpenClaw 等 AI 助理框架无缝协作
- 多语言 SDK:官方提供 Python 和 JavaScript SDK,社区贡献了 Go、Rust、Java、.NET、Swift、C++、PHP、R 等数十种语言的开发库
- 庞大的集成生态:社区集成项目数以万计,涵盖聊天界面、RAG 知识库、IDE 插件、终端工具、消息机器人、可观测性等各类场景
2. v0.32.5 版本亮点
该版本汇集了 1 位贡献者 的 2 条 贡献。
- MLX Metal 推理质量修复:修复了一个 MLX Metal 的 bug,该问题可能降低 NVFP4 量化模型的输出质量,尤其是 Laguna 模型。修复后,Apple Silicon 用户在运行 NVFP4 量化模型时将获得正常的推理输出质量。
- 发布流程优化:优化了发布构建流程,避免单个构建任务失败导致整体发布中断。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/2257(内含 Ollama.dmg、README 中英对照、发布说明中英对照和 LICENSE)。
Ollama 其他版本:https://hanshuixin.org/resource/software_integrated_package/macOS/Ollama
macOS安装ollama-v0.32.5(Ollama).zip
├── Ollama.dmg ← 双击打开,将 Ollama.app 拖入 Applications 即可
├── macOS安装ollama-v0.32.5(Ollama).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE4. 快速开始
双击整合包根目录中的 Ollama.dmg,在打开的窗口中将 Ollama.app 拖入 Applications 文件夹即可完成安装。Ollama.dmg 是适用于 macOS 的通用安装包,同时兼容 Intel 和 Apple Silicon(M1/M2/M3/M4)芯片。安装后 Ollama 会在菜单栏运行,提供快速访问和模型管理。
推荐依赖:Ollama 启动后内置 llama.cpp 推理引擎,无需额外安装依赖。macOS 会自动使用 Metal(Apple Silicon GPU)进行推理加速。
常用命令
Ollama 安装后,在终端(Terminal)中直接使用:
# 查看帮助
ollama
# 运行 Gemma 4 模型(首次自动下载)
ollama run gemma4
# 列出已下载的模型
ollama list
# 查看模型信息
ollama show gemma4
# 启动 Claude Code 集成
ollama launch claude
# 启动 OpenClaw AI 助理
ollama launch openclaw
# 通过 REST API 调用(非流式)
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "你好"}],
"stream": false
}'
# 删除模型
ollama rm gemma4
# 查看运行状态
ollama ps
# 停止模型运行
ollama stop gemma4Python 与 JavaScript 中调用:
from ollama import chat
response = chat(model='gemma4', messages=[
{'role': 'user', 'content': '为什么天空是蓝色的?'},
])
print(response.message.content)import ollama from "ollama";
const response = await ollama.chat({
model: "gemma4",
messages: [{ role: "user", content: "为什么天空是蓝色的?" }],
});
console.log(response.message.content);