FreeToken 是面向消费级硬件的开源 MoE 大模型推理引擎,通过 CPU–GPU 协同、双缓冲预填充、专家缓存和状态复用,让显存有限的笔记本与桌面电脑运行更大规模的混合专家模型。
它适合希望在本地部署 Qwen、DeepSeek、GLM 等 MoE 模型的开发者、AI Agent 用户和隐私敏感团队。项目提供 Windows / Linux 桌面端,同时支持 Python 命令行安装。
FreeToken 能做什么?
- 消费级 GPU 运行大模型:把 GPU、CPU、主机内存与 PCIe 带宽统一调度,降低单纯依赖显存的门槛。
- 带宽自适应协同:根据硬件与模型负载动态安排 CPU–GPU 计算和权重传输。
- 双缓冲 Prefill:让下一层权重传输与当前层计算重叠,缩短长提示词首字等待。
- Agent 状态复用:复用语义锚点、KV Cache 与循环状态,改善重复上下文任务的响应速度。
- 弹性显存管理:使用全局 LRU 专家缓存,并按负载动态分配显存。
支持模型与平台
官方项目覆盖 20 余种 MoE 模型,并重点展示了 Qwen3.6-35B-A3B、DeepSeek-V4-Flash 与 GLM-5.2 等模型。桌面客户端支持 Windows 和 Linux;命令行用户可使用 uv pip install "freetoken[accel]" 安装。
使用前要知道
“本地运行完整模型”不等于全部权重都驻留显存。超大模型仍可能需要大量系统内存、较快的 PCIe 通道、足够的磁盘空间以及稳定散热。性能会随 GPU、CPU、内存带宽、量化格式、上下文长度与系统配置而变化。








