Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)

1. llama.cpp 简介
llama.cpp 是由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建的开源 LLM(Large Language Model,大语言模型)推理引擎。最初是 Gerganov 在一个周末为了让 Meta 的 LLaMA 模型在 MacBook 上运行而发起的项目,如今已发展成为本地 AI 推理领域的事实标准。截至 2026 年中,该项目在 GitHub 上已获得约 12 万颗星(Stars)、超过 1600 位贡献者,增长速度超过 PyTorch 和 TensorFlow。2026 年 2 月,Gerganov 及 ggml.ai 团队正式加入 Hugging Face,项目仓库从 ggerganov/llama.cpp 迁移至 ggml-org/llama.cpp,团队保留完全技术自主权,项目保持 100% 开源(MIT License)。
llama.cpp 的核心目标是实现 LLM 推理,以最少的配置和最先进的性能在广泛的硬件上运行——无论是本地还是云端。它采用纯 C/C++ 实现,编译为无任何运行时依赖的单一二进制文件,支持超过 100 种 LLM 架构(包括 LLaMA、Mistral、Phi、Gemma、DeepSeek、Qwen 等),覆盖从手机到服务器的各类设备。知名的 Ollama、LM Studio、GPT4All 等工具均构建在 llama.cpp 之上。
核心特色:
- 零依赖:纯 C/C++ 实现,无需 Python、PyTorch 或任何运行时库
- 极致量化:支持 1.5-bit 至 8-bit 整数量化,大幅降低内存占用和推理延迟
- 多后端加速:CUDA(NVIDIA)、Vulkan(跨平台)、Metal(Apple)、SYCL(Intel)、HIP(AMD)、ROCm(AMD)、OpenVINO(Intel)
- CPU+GPU 混合推理:可部分加速超过总 VRAM 容量的模型
- GGUF 模型格式:已成为本地 AI 推理的标准模型格式,被 Hugging Face 推理端点原生支持
- Apple Silicon 优先:通过 ARM NEON、Accelerate 和 Metal 框架深度优化
- 丰富的绑定生态:Python、Go、Node.js、Rust、C#、Java、Swift 等数十种语言绑定
- 多模态支持:LLaVA、Qwen2-VL、MobileVLM 等视觉语言模型
2. b10068 版本亮点
该版本汇集了 2 位贡献者 的 1 条 贡献。
b10068 是 llama.cpp 的 CI 自动构建版本(发布于 2026-07-18),主要包含以下改进:
- DFlash 模型 K/V 缓存旋转支持(#25823):在使用 K/V 量化时,DFlash 模型现在能够正确旋转注入的 K/V 缓存(Key/Value Cache),提升了 DFlash 模型的推理准确性和兼容性。此改动由社区贡献者与项目创始人 Georgi Gerganov 协作完成。
此版本提供多平台、多后端预编译二进制文件,覆盖 Linux(CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)、macOS(ARM/x64)和 Android(ARM)等全平台。
3. 获取安装包
如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223R(内含 llama-b10068-bin-ubuntu-vulkan-x64.tar.gz、README 中英对照、发布说明中英对照和 LICENSE)。
适用于 Linux x86_64(amd64),Vulkan 后端。Vulkan 为跨平台 GPU API,支持 NVIDIA、AMD、Intel 三大品牌显卡。
Linux安装llama.cpp-b10068(llama-b10068-bin-ubuntu-vulkan-x64).zip
├── llama-b10068-bin-ubuntu-vulkan-x64.tar.gz
├── Linux安装llama.cpp-b10068(llama-b10068-bin-ubuntu-vulkan-x64).pdf
├── README/
│ ├── README.md
│ └── README-中文版.md
├── 发布说明/
│ ├── RELEASE-NOTES.md
│ └── RELEASE-NOTES-中文版.md
└── LICENSE4. 快速开始
解压 llama-b10068-bin-ubuntu-vulkan-x64.tar.gz 到目标目录:
tar -xzf llama-b10068-bin-ubuntu-vulkan-x64.tar.gz解压后目录中包含以下主要可执行文件:
| 命令 | 功能 |
|---|---|
llama-cli |
命令行推理工具 |
llama-server |
OpenAI 兼容 API 服务器 |
llama-perplexity |
困惑度评估工具 |
llama-embedding |
文本嵌入生成工具 |
使用本地 GGUF 模型文件进行推理:
# 命令行对话
./llama-cli -m my_model.gguf -p "你好,请介绍一下自己"
# 或直接从 Hugging Face 下载并运行
./llama-cli -hf ggml-org/gemma-3-1b-it-GGUF -p "你好"
# 启动 OpenAI 兼容 API 服务(默认 http://localhost:8080)
./llama-server -m my_model.gguf系统要求:Linux x86_64 系统,Vulkan 驱动已安装。可通过
vulkaninfo命令检查 Vulkan 支持状态。在终端中使用--list-devices参数可查看 llama.cpp 识别到的 GPU 设备。