### [FreeToken – 消费级 GPU 本地运行 MoE 大模型](https://www.zuoshipin.com/) **Published:** 2026-08-23T03:14:41 **Author:** 天才交易员 **Excerpt:** FreeToken 是开源的边缘原生 MoE 推理引擎,通过 CPU-GPU 协同、双缓冲预填充、专家缓存和 … **FreeToken** 是面向消费级硬件的开源 MoE 大模型推理引擎,通过 CPU–GPU 协同、双缓冲预填充、专家缓存和状态复用,让显存有限的笔记本与桌面电脑运行更大规模的混合专家模型。 它适合希望在本地部署 Qwen、DeepSeek、GLM 等 MoE 模型的开发者、AI Agent 用户和隐私敏感团队。项目提供 Windows / Linux 桌面端,同时支持 Python 命令行安装。 ## FreeToken 能做什么? - **消费级 GPU 运行大模型:**把 GPU、CPU、主机内存与 PCIe 带宽统一调度,降低单纯依赖显存的门槛。 - **带宽自适应协同:**根据硬件与模型负载动态安排 CPU–GPU 计算和权重传输。 - **双缓冲 Prefill:**让下一层权重传输与当前层计算重叠,缩短长提示词首字等待。 - **Agent 状态复用:**复用语义锚点、KV Cache 与循环状态,改善重复上下文任务的响应速度。 - **弹性显存管理:**使用全局 LRU 专家缓存,并按负载动态分配显存。 ## 支持模型与平台 官方项目覆盖 20 余种 MoE 模型,并重点展示了 Qwen3.6-35B-A3B、DeepSeek-V4-Flash 与 GLM-5.2 等模型。桌面客户端支持 Windows 和 Linux;命令行用户可使用 `uv pip install "freetoken[accel]"` 安装。 ## 使用前要知道 “本地运行完整模型”不等于全部权重都驻留显存。超大模型仍可能需要大量系统内存、较快的 PCIe 通道、足够的磁盘空间以及稳定散热。性能会随 GPU、CPU、内存带宽、量化格式、上下文长度与系统配置而变化。 [查看开源代码](https://github.com/FlashML-org/FreeToken) | [阅读技术论文](https://arxiv.org/abs/2608.16157) ---