做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
搜索
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

FreeToken - 消费级 GPU 本地运行 MoE 大模型

19
让消费级显卡也能高效运行前沿 MoE 大模型
评分
工具类型:本地大模型推理引擎开源协议:Apache-2.0支持平台:Windows、Linux适用模型:DeepSeek、Qwen、GLM 等 MoE 模型安装方式:桌面客户端 / Python CLI
FreeToken 是开源的边缘原生 MoE 推理引擎,通过 CPU-GPU 协同、双缓冲预填充、专家缓存和 …
Github神器

FreeToken 是面向消费级硬件的开源 MoE 大模型推理引擎,通过 CPU–GPU 协同、双缓冲预填充、专家缓存和状态复用,让显存有限的笔记本与桌面电脑运行更大规模的混合专家模型。

它适合希望在本地部署 Qwen、DeepSeek、GLM 等 MoE 模型的开发者、AI Agent 用户和隐私敏感团队。项目提供 Windows / Linux 桌面端,同时支持 Python 命令行安装。

FreeToken 能做什么?

  • 消费级 GPU 运行大模型:把 GPU、CPU、主机内存与 PCIe 带宽统一调度,降低单纯依赖显存的门槛。
  • 带宽自适应协同:根据硬件与模型负载动态安排 CPU–GPU 计算和权重传输。
  • 双缓冲 Prefill:让下一层权重传输与当前层计算重叠,缩短长提示词首字等待。
  • Agent 状态复用:复用语义锚点、KV Cache 与循环状态,改善重复上下文任务的响应速度。
  • 弹性显存管理:使用全局 LRU 专家缓存,并按负载动态分配显存。

支持模型与平台

官方项目覆盖 20 余种 MoE 模型,并重点展示了 Qwen3.6-35B-A3B、DeepSeek-V4-Flash 与 GLM-5.2 等模型。桌面客户端支持 Windows 和 Linux;命令行用户可使用 uv pip install "freetoken[accel]" 安装。

使用前要知道

“本地运行完整模型”不等于全部权重都驻留显存。超大模型仍可能需要大量系统内存、较快的 PCIe 通道、足够的磁盘空间以及稳定散热。性能会随 GPU、CPU、内存带宽、量化格式、上下文长度与系统配置而变化。

查看开源代码 | 阅读技术论文

常见问题(FAQ)

FreeToken 是什么?
FreeToken 是 FlashML 开源的边缘原生 MoE 大模型推理引擎,用于在消费级 GPU 与主机内存协同环境中运行更大规模模型。
FreeToken 支持哪些系统?
官方提供 Windows 与 Linux 桌面端,同时支持通过 Python 命令行安装。
FreeToken 可以让 284B 模型全部放进显存吗?
不能这样理解。完整模型权重可以参与推理,但通常会分布在显存与主机内存中,性能还取决于 CPU、内存带宽、PCIe 与量化格式。
0 讨论
热门最新
总结
暂无总结
0 / 600
细中粗

相关网站

热门最新

Ollama – 把开放大模型装进自己电脑,也能随时切换云端算力

推荐!从本地离线推理到云端大模型,用一套命令和API接通应用、编辑器与Agent

推荐!一条命令下载并运行开放大模型,用本地REST API接入应用和Agent;电脑算力不够时,还能无缝调用O…

0

腾讯云大模型 Token Plan – 高频用 AI 编程和 Agent 时,模型调用成本更好控

面向 AI 编程和 Agent 工作负载的大模型 Token 套餐方案,覆盖 Hy3 与多种主流模型

腾讯云大模型 Token Plan 面向 AI 编程、Agent 工作负载和多步工具调用,提供 Hy3 与多种…

0

Boogu – 开源图像生成与编辑基础模型

开源统一图像生成与编辑基础模型,适合关注多模态生成能力的开发者。

面向图像生成与编辑场景的开源基础模型,适合关注多模态生成能力的开发者和研究者。

0

硅基流动 – 给开发者和企业省成本的大模型 API 平台

推荐给想快速把大模型能力接进产品的人:硅基流动把模型 API、推理加速、独占算力和私有化部署放在一起,开发和落地都更顺。

硅基流动(SiliconFlow)面向开发者和企业提供大模型 API、推理加速、独占算力与私有化部署方案,覆盖…

1

Qwen3.8-27B – 24GB显存可尝试的开源多模态Agent模型

推荐!把前沿Coding与Agent能力压缩到27B尺寸,本地部署和强能力第一次真正靠近

Qwen3.8-27B是27B Dense开源多模态模型,强化Coding、工具调用与长程Agent,4bit…

0

元空AI Work – 本地离线运行的端侧办公Agent

把模型、Agent Runtime 与办公工作流装进本地设备

元空AI Work 是面向数据、文件、文档和办公工作流的端侧AI生产力平台,支持本地模型、Agent Runt…

0

MoWorld – 高帧率实时交互世界模型

面向 NPU 的高帧率实时交互世界模型,适合关注世界模型和视频生成的用户。

面向 NPU 的实时交互世界模型,强调高帧率、低成本和连续控制的视频世界生成能力。

0

OpenRouter – 一个 API 接入多家主流与开源大模型

推荐!一个入口比较并调用多家大模型,搭建 Agent 时切换模型更方便

OpenRouter 提供统一 API、模型比较、供应商路由和 Playground,可快速接入多家主流与开源…

0

MiMo – 想看小米如何把大模型做成完整平台,这个官方入口很值得收藏

小米打造的大模型与开放平台门户,覆盖旗舰模型、API 接入、Code、Studio 与 Agent 生态能力

MiMo 是小米面向模型展示、开发接入与生态布局打造的大模型官方入口,覆盖 MiMo-V2.5、MiMo AP…

0

Qwen3.6 35B A3B 无审查版 – 几乎零拒答的多模态 MoE GGUF 模型

推荐给懂本地部署的进阶用户:多档 GGUF、原生多模态、几乎不拒答,但内容边界与安全责任也需要自己掌控。

HauhauCS 基于 Qwen3.6-35B-A3B 制作的 Aggressive 无审查多模态 MoE 模…

0
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1