macOS下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-macos-arm64.tar.gz)

发布于 2026/7/24 · 1 阅读
llama.cpp大语言模型LLM推理GGUF本地AIApple SiliconMetal优化开源模型量化机器学习
llama.cpp 是纯 C/C++ 实现的大语言模型推理引擎,零依赖、高性能,支持 Apple Silicon 深度优化和多 GPU 后端,可在本地和云端运行数百种主流 AI 模型。

封面.png

1. llama.cpp 简介

llama.cpp 是 Georgi Gerganov 创建的开源项目,用纯 C/C++ 实现大语言模型(LLM)推理引擎,以最小配置和最优性能在本地及云端运行 AI 模型。Gerganov 同时也是 whisper.cpp(语音识别)、stable-diffusion.cpp 以及底层 ggml 张量计算库的作者,这一系列项目构成了当前最活跃的本地 AI 推理开源生态之一。

llama.cpp 的核心理念是"零依赖"——无需 Python 环境、无需复杂的深度学习框架,一个可执行文件即可运行主流大语言模型。这使得它在资源受限的设备上也能高效运行,极大降低了使用大语言模型的门槛。项目自发布以来获得广泛关注,已成为 GitHub 上最受欢迎的 AI 推理项目之一,吸引了大量社区贡献者参与开发,并催生了 ollama、LM Studio、gpt4all 等众多知名下游项目。

核心特点:

  • 纯 C/C++ 实现,零外部依赖,编译后即可运行
  • Apple Silicon 为第一优先级,通过 ARM NEON、Accelerate 和 Metal 框架深度优化
  • 支持 1.5 位到 8 位整数量化,大幅降低内存占用,提升推理速度
  • 多 GPU 后端支持:CUDA(NVIDIA)、HIP(AMD)、Vulkan、SYCL(Intel)
  • CPU+GPU 混合推理,可运行超出 VRAM 容量的超大模型
  • 兼容 OpenAI API 的 HTTP 服务器(llama-server),可替代云端推理服务
  • 支持数百种模型架构,包括 LLaMA、Mistral、Qwen、Deepseek、Phi、Gemma 等

2. b10068 版本亮点

该版本为 llama.cpp 的最新构建版本(build b10068)。

本版本主要包含以下更新:

  • DFlash K/V 缓存旋转优化(#25823):在使用 K/V 量化时,对注入的 K/V 缓存进行旋转处理,提升了 DFlash 注意力机制的推理质量。由 Georgi Gerganov 联合提交。

此外,该版本提供了覆盖 macOS(arm64/x64)、Linux(x64/arm64/s390x,含 CPU/Vulkan/ROCm/OpenVINO/SYCL 等多种后端)、Windows(CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP)、Android(arm64)以及 iOS(XCFramework)的全平台预编译二进制包。

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223S(内含 llama-b10068-bin-macos-arm64.tar.gz、README 中英对照、发布说明中英对照和 LICENSE)。

macOS安装llama.cpp-b10068(llama-b10068-bin-macos-arm64).zip
├── llama-b10068-bin-macos-arm64.tar.gz
├── macOS安装llama.cpp-b10068(llama-b10068-bin-macos-arm64).pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

适用硬件:搭载 Apple Silicon 芯片(M1/M2/M3/M4 等系列)的 Mac,运行 macOS。llama.cpp 对 Apple Silicon 进行了深度优化,利用 ARM NEON 指令集、Accelerate 框架和 Metal GPU 后端实现高性能本地推理。

4. 快速开始

解压 llama-b10068-bin-macos-arm64.tar.gz 后,在终端中进入解压目录,即可使用以下命令行工具。

llama.cpp 需要 GGUF 格式的模型文件。可从 Hugging Face 下载兼容模型,或使用 -hf 参数直接下载。

常用命令

# 使用本地模型文件进行对话
llama-cli -m model.gguf

# 直接从 Hugging Face 下载并运行模型
llama-cli -hf ggml-org/gemma-3-1b-it-GGUF

# 启动兼容 OpenAI API 的本地服务器(默认端口 8080)
llama-server -m model.gguf --port 8080

# 启动服务器并支持多用户并行(最多 4 并发)
llama-server -m model.gguf -c 16384 -np 4

# 启用推测性解码加速推理
llama-server -m model.gguf -md draft.gguf

# 运行推理性能基准测试
llama-bench -m model.gguf

# 测量模型在文本上的困惑度
llama-perplexity -m model.gguf -f file.txt