FreeToken(MoE 本地推理引擎)
官方介绍
FreeToken 是 UC Berkeley 与 MIT 联合团队开源的边缘原生(Edge-Native)MoE 大模型推理引擎(论文 arXiv 2608.16157,2026-07 开源,Apache-2.0 可商用)。它把个人电脑建模为 CPU + GPU 统一的弹性推理平台:全部专家权重驻留内存,剩余显存作为可伸缩的「专家缓存」,通过带宽自适应的 CPU-GPU 协同执行跑大型稀疏 MoE 模型(支持到 753B 级)。署名含 Databricks 联合创始人 Ion Stoica、Matei Zaharia 及 Song Han、Kurt Keutzer 等。
核心功能
- 带宽自适应执行(Bandwidth-Adaptive Execution):按内存 / PCIe 带宽动态调度专家计算位置
- 两级专家内存层级:CPU 驻留专家池为唯一真源,GPU 显存作为跨层共享的弹性专家缓存
- 面向 Agent 类动态负载的本地服务,无需整个模型装进显存
- 桌面 App 与本地服务两种形态;支持 Windows / Linux + NVIDIA RTX 30/40/50 系列
使用说明
- 硬件要求:Windows 或 Linux(x86-64)+ NVIDIA RTX 30/40/50 系列显卡;系统内存与 PCIe 带宽同样重要
- Apple Silicon 无官方路径(无 macOS 包),AMD ROCm 路线官方标注 WIP
- PyPI 包
freetoken(0.1.3 起);官方 Wiki 提供硬件要求与安装指引 - 论文中的速度数字为作者自报,第三方尚未完全复现,选型前先固定版本实测
官方链接
- GitHub 仓库:github.com/FlashML-org/FreeToken
- 论文(arXiv):arxiv.org/abs/2608.16157
- 官方 Wiki:freetoken.wiki