Windows下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-win-cuda-12.4-x64.zip)

发布于 2026/7/24 · 1 阅读
llama.cppLLM推理本地大模型GGUFC/C++GPU加速CUDA命令行工具开源MIT许可证
llama.cpp 是使用纯 C/C++ 实现的大语言模型(LLM)推理引擎,由保加利亚工程师 Georgi Gerganov 于 2023 年 3 月创建,可在从手机到数据中心的各种硬件上运行,无需 Python 等外部依赖。截至 2026 年中,GitHub Stars 突破 11.7 万,是 Ollama、LM Studio 等知名本地 AI 工具的核心推理引擎。

封面.png

1. llama.cpp 简介

llama.cpp 是使用纯 C/C++ 实现的大语言模型(LLM)推理引擎,由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建。最初是作为一个周末项目,目标是在 MacBook 上运行 Meta 的 LLaMA 模型,无需 Python、PyTorch 或 CUDA 依赖。如今,它已成为全球最受欢迎的本地 LLM 推理框架之一,截至 2026 年中,GitHub Stars 突破 11.7 万,拥有超过 700 位贡献者和近 2 万个 fork。

2026 年 2 月,Gerganov 与核心团队成员(Xuan-Son Nguyen、Aleksander Grygier)加入 Hugging Face 成为全职员工,llama.cpp 仓库也从 ggerganov/llama.cpp 迁移至 ggml-org/llama.cpp,但项目始终保持 100% 开源(MIT 许可证)和完全的技术自主权。llama.cpp 是 Ollama、LM Studio、GPT4All、LocalAI 等数十个知名本地 AI 工具的底层推理引擎,生态影响力极其广泛。

llama.cpp 的核心目标是以最低的设置成本在各种硬件上实现最先进的 LLM 推理性能——无论是在本地还是在云端。其核心特色包括:

  • 零依赖:纯 C/C++ 实现,无需 Python、PyTorch 等环境,下载即可运行
  • 广泛硬件支持:Apple Silicon(ARM NEON、Accelerate、Metal)、NVIDIA GPU(CUDA)、AMD GPU(HIP)、Intel GPU(SYCL、OpenVINO)、Vulkan、WebGPU 等
  • 灵活量化:支持 1.5 位至 8 位整数量化,显著降低内存占用和提升推理速度
  • CPU+GPU 混合推理:支持超出显存容量的大模型部分加速
  • OpenAI API 兼容服务:通过 llama-server 一键启动与 OpenAI API 兼容的 HTTP 服务
  • 庞大模型生态:支持 LLaMA、Mistral、Qwen、Deepseek、Gemma、Phi 等近百种模型架构的 GGUF 格式

2. b10068 版本亮点

llama.cpp 采用持续构建(build number)版本号体系,b10068 发布于 2026-07-18,主要包含以下更新:

  • DFlash 注入 K/V 缓存旋转:修复了在使用 K/V 量化时,DFlash 注意力机制中注入的 K/V 缓存需要旋转的问题,提升了量化场景下的推理正确性。

本整合包选用 llama-b10068-bin-win-cuda-12.4-x64.zip,适用于 Windows x64 系统,使用 NVIDIA CUDA 12.4 后端进行 GPU 加速推理。

环境要求:需安装 NVIDIA CUDA Toolkit 12.4 或更新版本,并配备支持 CUDA 的 NVIDIA 显卡(计算能力 ≥ 5.0,推荐 GTX 10 系列及以上)。若未安装 CUDA 或使用非 NVIDIA 显卡,请改用 CPU 版本或 Vulkan 版本。

3. 获取安装包

如果访问 GitHub 不便,安装包及中文文档:https://hanshuixin.org/go/223T(内含 llama-b10068-bin-win-cuda-12.4-x64.zip、README 中英对照、发布说明中英对照和 LICENSE)。

Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).zip
├── llama-b10068-bin-win-cuda-12.4-x64.zip   ← 官方预编译包(解压后为各工具 .exe)
├── Windows安装llama.cpp-b10068(llama-b10068-bin-win-cuda-12.4-x64).pdf
├── README/
│   ├── README.md
│   └── README-中文版.md
├── 发布说明/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-中文版.md
└── LICENSE

适用显卡:本整合包内为 CUDA 版本,仅适用于 NVIDIA 显卡(GTX 10 系列及以上,计算能力 ≥ 5.0)。若您使用 AMD 显卡,请选用 HIP(Radeon)版本;若使用 Intel 显卡,请选用 SYCL 或 OpenVINO 版本;若无独立显卡或使用其他品牌,请选用 CPU 或 Vulkan 版本。

4. 快速开始

将整合包根目录中的 llama-b10068-bin-win-cuda-12.4-x64.zip 解压到任意目录,即可得到以下命令行工具:

工具 用途
llama-cli.exe 命令行对话推理
llama-server.exe OpenAI API 兼容 HTTP 服务
llama-perplexity.exe 模型困惑度评测
llama-bench.exe 推理性能基准测试
llama-simple.exe 最小推理示例

解压后,打开命令提示符(cmd)或 PowerShell,进入解压目录,执行以下常用命令:

# 使用本地 GGUF 模型文件进行对话
llama-cli -m my_model.gguf

# 直接从 Hugging Face 下载并运行模型
llama-cli -hf ggml-org/gemma-3-1b-it-GGUF

# 启动 OpenAI 兼容 API 服务(默认端口 8080)
llama-server -m my_model.gguf --port 8080

# 启动服务并支持多用户并行请求
llama-server -m my_model.gguf -c 16384 -np 4

# 使用推测解码加速推理
llama-server -m model.gguf -md draft.gguf

# 运行性能基准测试
llama-bench -m my_model.gguf

# 使用自定义语法约束 JSON 输出
llama-cli -m my_model.gguf -n 256 --grammar-file grammars/json.gbnf

提示:模型文件(.gguf 格式)可从 Hugging Face GGUF 模型库 获取。也可通过 -hf 参数直接从 Hugging Face 下载。