官方介绍
GGUF(GPT-Generated Unified Format)是 ggml / llama.cpp 生态用于存放大模型推理文件的标准二进制格式:模型通常用 PyTorch 等框架训练,再转换成 GGUF 交给 GGML 系运行时推理。2023 年 8 月推出,作为 GGML、GGMF、GGJT 三个旧格式的后继,是目前本地部署圈分发模型的事实标准。
核心功能
| 设计目标 | 说明 |
|---|---|
| 单文件分发 | 权重张量、分词器、元数据全在一个文件里,不需要外部配置文件 |
| 无歧义完整 | 加载模型所需的全部信息都包含在文件内,用户无需额外提供 |
| 可扩展 | 元数据用键值对结构(区别于 GGJT 的无类型列表),新增字段不破坏旧模型兼容 |
| mmap 兼容 | 支持内存映射加载,启动快、省内存 |
| 量化类型丰富 | 内置 Q2_K~Q8_0、IQ 系列、TQ(三值)等大量量化编码,按体积 / 质量取档 |
| 命名约定与分片 | 文件名含模型名 / 参数量 / 版本 / 量化 / 分片信息;支持多分片与 mmproj(多模态投影)、mtp(投机解码草稿)等 sidecar 文件 |
使用说明
本地跑模型(llama.cpp、Ollama 等)时下载 .gguf 文件即可;从文件名即可读出关键信息,如 Grok-100B-v1.0-Q4_0-00003-of-00009.gguf 表示 100B 参数、v1.0、Q4_0 量化、共 9 片中的第 3 片。注意:特殊量化编码可能需要配套运行时支持——例如 Ternary Bonsai 2 的 PTQ1_0 / PQ2_0 三值格式在原版 llama.cpp 上无法加载,需用官方 fork。