官方介绍

GGUF(GPT-Generated Unified Format)是 ggml / llama.cpp 生态用于存放大模型推理文件的标准二进制格式:模型通常用 PyTorch 等框架训练,再转换成 GGUF 交给 GGML 系运行时推理。2023 年 8 月推出,作为 GGML、GGMF、GGJT 三个旧格式的后继,是目前本地部署圈分发模型的事实标准。

核心功能

设计目标说明
单文件分发权重张量、分词器、元数据全在一个文件里,不需要外部配置文件
无歧义完整加载模型所需的全部信息都包含在文件内,用户无需额外提供
可扩展元数据用键值对结构(区别于 GGJT 的无类型列表),新增字段不破坏旧模型兼容
mmap 兼容支持内存映射加载,启动快、省内存
量化类型丰富内置 Q2_K~Q8_0、IQ 系列、TQ(三值)等大量量化编码,按体积 / 质量取档
命名约定与分片文件名含模型名 / 参数量 / 版本 / 量化 / 分片信息;支持多分片与 mmproj(多模态投影)、mtp(投机解码草稿)等 sidecar 文件

使用说明

本地跑模型(llama.cpp、Ollama 等)时下载 .gguf 文件即可;从文件名即可读出关键信息,如 Grok-100B-v1.0-Q4_0-00003-of-00009.gguf 表示 100B 参数、v1.0、Q4_0 量化、共 9 片中的第 3 片。注意:特殊量化编码可能需要配套运行时支持——例如 Ternary Bonsai 2 的 PTQ1_0 / PQ2_0 三值格式在原版 llama.cpp 上无法加载,需用官方 fork。

官方链接