做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

FreeToken - 消费级 GPU 本地运行 MoE 大模型

597
让消费级显卡也能高效运行前沿 MoE 大模型
评分
工具类型:本地大模型推理引擎开源协议:Apache-2.0支持平台:Windows、Linux适用模型:DeepSeek、Qwen、GLM 等 MoE 模型安装方式:桌面客户端 / Python CLI
FreeToken 是开源的边缘原生 MoE 推理引擎,通过 CPU-GPU 协同、双缓冲预填充、专家缓存和 …
Github神器

FreeToken 是面向消费级硬件的开源 MoE 大模型推理引擎,通过 CPU–GPU 协同、双缓冲预填充、专家缓存和状态复用,让显存有限的笔记本与桌面电脑运行更大规模的混合专家模型。

它适合希望在本地部署 Qwen、DeepSeek、GLM 等 MoE 模型的开发者、AI Agent 用户和隐私敏感团队。项目提供 Windows / Linux 桌面端,同时支持 Python 命令行安装。

FreeToken 能做什么?

  • 消费级 GPU 运行大模型:把 GPU、CPU、主机内存与 PCIe 带宽统一调度,降低单纯依赖显存的门槛。
  • 带宽自适应协同:根据硬件与模型负载动态安排 CPU–GPU 计算和权重传输。
  • 双缓冲 Prefill:让下一层权重传输与当前层计算重叠,缩短长提示词首字等待。
  • Agent 状态复用:复用语义锚点、KV Cache 与循环状态,改善重复上下文任务的响应速度。
  • 弹性显存管理:使用全局 LRU 专家缓存,并按负载动态分配显存。

支持模型与平台

官方项目覆盖 20 余种 MoE 模型,并重点展示了 Qwen3.6-35B-A3B、DeepSeek-V4-Flash 与 GLM-5.2 等模型。桌面客户端支持 Windows 和 Linux;命令行用户可使用 uv pip install "freetoken[accel]" 安装。

使用前要知道

“本地运行完整模型”不等于全部权重都驻留显存。超大模型仍可能需要大量系统内存、较快的 PCIe 通道、足够的磁盘空间以及稳定散热。性能会随 GPU、CPU、内存带宽、量化格式、上下文长度与系统配置而变化。

查看开源代码 | 阅读技术论文

常见问题(FAQ)

FreeToken 是什么?
FreeToken 是 FlashML 开源的边缘原生 MoE 大模型推理引擎,用于在消费级 GPU 与主机内存协同环境中运行更大规模模型。
FreeToken 支持哪些系统?
官方提供 Windows 与 Linux 桌面端,同时支持通过 Python 命令行安装。
FreeToken 可以让 284B 模型全部放进显存吗?
不能这样理解。完整模型权重可以参与推理,但通常会分布在显存与主机内存中,性能还取决于 CPU、内存带宽、PCIe 与量化格式。
0 / 600
细中粗
0 讨论
热门最新
总结
暂无总结

相关网站

热门最新
暂无链接数据;请在后台添加链接或调整分类筛选。
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1