暂无菜单项

AMD把“Token自由”塞进电脑:192GB内存跑3000亿模型,云端账单真要被终结?

发布于
34

从Ryzen AI Halo、Project Zenith到2.6TB内存的Threadripper Halo Station,AMD正在把本地AI做成一条从个人电脑通往桌边超算的完整阶梯。

先说预测:未来三年,真正重度使用AI Agent的人,会重新计算一笔账:与其每天为海量Token付费,是否应该把一部分长期、重复、涉及隐私的推理搬回自己的电脑?AMD给出的答案很激进,甚至想把“本地算力 = Token自由”变成新一代PC的购买理由。

但这不意味着云端AI要消失。本地更像一个随时在线、成本可预期的基础层,前沿大模型和突发高负载仍交给云端。真正可能胜出的,是一套会自动判断任务该在本地还是云端运行的混合架构。

Jack Huynh展示面向本地AI计算的新一代个人设备
Jack Huynh展示面向本地AI计算的新一代个人设备。图片为公开演讲与产品资料,点击查看大图。

01 / 128GB还不够,AMD把统一内存推到192GB

AMD在2026年推出的现款Ryzen AI Halo开发平台,使用Ryzen AI Max+ 395处理器和128GB统一内存,官方标称可本地运行最高约2000亿参数模型。它支持Windows与Linux,并围绕ROCm、PyTorch、vLLM、llama.cpp、Ollama、ComfyUI和LM Studio提供开发环境。

下一代平台则将升级到Ryzen AI Max+ PRO 495,最高支持192GB系统内存、160GB可分配显存,把官方本地模型规模目标推到3000亿参数。原文使用“Gorgon Halo”作为平台代号,购买和检索正式产品时,更应该认准AMD公开页面中的Ryzen AI Max PRO 400系列与具体整机型号。

别把“能装下”理解成“跑得飞快”。参数规模只是内存门槛,量化精度、上下文长度、KV缓存、内存带宽、模型架构和软件优化都会决定真实速度。

Ryzen AI Halo详细导航:
https://www.zuoshipin.com/link/33927.html

02 / Token为什么越来越贵?Agent把消耗从“对话”拉到“持续工作”

AMD演讲展示AI Token处理量快速增长的趋势
AMD演讲展示AI Token处理量快速增长的趋势。图片为公开演讲与产品资料,点击查看大图。

在IFA演讲中,AMD计算与图形业务负责人Jack Huynh把个人AI拆成三部分:本地计算、隐私与控制、个人上下文。这三点都与Agent有关,因为Agent不再只回答一句话,而是会读取文件、规划任务、调用工具、检查结果并持续执行。

AMD展示的趋势数据认为,主流模型月度Token处理量正在从约0.7千万亿向1.7千万亿增长,到2030年可能达到120千万亿。预测是否准确仍需时间验证,但方向没有太大悬念:当一个Agent任务从几千Token扩大到几十万、几百万Token,推理费用会从“小额订阅”变成基础设施预算。

AMD官网给出的三年成本对比称,在其设定的持续高负载、约每天630万总Token场景下,Ryzen AI Halo可能比等效云端API低至约6倍成本。不过这属于厂商建模,使用了固定API价格、吞吐、电价和每天8小时有效利用率等假设。轻度用户、偶尔调用最强模型的人,云端通常仍更灵活。

03 / Project Zenith:微软开始给本地Agent准备“开箱即用”Windows

采用下一代Ryzen AI Max PRO平台的移动工作站演示
采用下一代Ryzen AI Max PRO平台的移动工作站演示。图片为公开演讲与产品资料,点击查看大图。

硬件堆到192GB,如果驱动、模型、终端和开发环境仍要折腾几天,就很难进入主流开发者市场。微软因此公布Project Zenith:一套面向开发者级设备的预配置Windows体验,首批支持AMD Ryzen AI Halo。

微软给出的设备基线是64GB以上统一内存、250GB/s以上内存带宽,可本地运行30B以上参数模型。系统会准备常用语言、运行时、源码管理和开发工具,同时结合WSL、Windows本地AI能力,以及面向Agent的系统身份、Microsoft Execution Containers和企业管理基础。

它真正解决的不是“Windows能不能装Ollama”,而是能否让一台新电脑从开机开始就具备稳定的本地模型环境,少踩驱动、版本和依赖冲突的坑。

Project Zenith详细导航:
https://www.zuoshipin.com/link/33929.html

04 / 桌面电脑还不够?AMD直接端出2.6TB内存工作站

AMD在IFA 2026展示Threadripper Halo Station原型机
AMD在IFA 2026展示Threadripper Halo Station原型机。图片为公开演讲与产品资料,点击查看大图。

Threadripper Halo Station把“个人AI”推到了近乎桌边服务器的级别。AMD官方最高配置包括:

  • 96核、192线程Ryzen Threadripper PRO 9995WX;
  • 最多4张Instinct MI350P工作站加速器;
  • 最高576GB HBM3e GPU内存;
  • 最高2TB DDR5 RDIMM系统内存;
  • 总内存约2.6TB,总带宽最高16.4TB/s;
  • 采用液冷方案,面向大模型推理、微调和大量Agent并发。

AMD称它能处理万亿参数级模型并在本地运行数百个Agent工作流。但更准确的理解是“具备装载和调度超大模型的内存基础”,实际交互速度仍由量化、互联、并行策略与软件决定。

这台机器目前不能当成现货产品。它是IFA 2026首次展示的原型,官网标注2027年推出,最终价格、整机厂商、地区和配置都可能变化。

Threadripper Halo Station详细导航:
https://www.zuoshipin.com/link/33928.html

05 / 本地AI的价值,不只是一张更便宜的Token账单

隐私:代码库、客户资料、会议记录和个人偏好可以留在设备上,不必每次上传云端。

低延迟:没有网络往返与共享队列,适合语音助手、实时图像、自动化和需要持续响应的Agent。

可控性:开发者可以选择模型、量化、系统提示词、日志和数据保留策略,避免单一云服务突然涨价或下线。

离线能力:网络受限、现场制作和敏感环境仍可运行基础工作流。

个人上下文:真正懂用户的Agent需要长期访问文件、日程、项目与偏好,本地设备天然更适合作为上下文的控制中心。

06 / “Token自由”并不免费,这六笔成本不能装看不见

成本 本地方案 云端方案
前期投入 硬件一次性支出高 通常按量或订阅,启动成本低
持续费用 电力、折旧、维护和升级 Token、存储、网络和服务费
模型能力 受内存、速度与本地模型限制 可快速使用最新前沿模型
隐私控制 数据可留本地,但需自己治理 依赖服务商政策与企业协议
扩展能力 增加并发通常要买更多硬件 弹性更强,但高负载账单可能陡增

最适合本地化的是高频、稳定、可量化、模型要求相对固定的任务,例如代码补全、内部检索、转写、批量分类、图片初稿和常驻Agent。偶发的复杂推理、最新旗舰模型和突发并发,则更适合云端。

07 / 真要搭本地Agent,建议按这条路线走

  1. 先测工作量:统计一个月Token、峰值并发、上下文长度和隐私等级,不要从硬件广告反推需求。
  2. 从30B级模型开始:先验证任务成功率,再决定是否需要120B、200B或300B模型。
  3. 做混合路由:本地模型处理日常任务,超过能力阈值时再调用云端,并记录升级原因。
  4. 隔离Agent权限:模型本地运行不代表安全,文件、终端、浏览器和网络权限仍要最小化。
  5. 用总拥有成本比较:把硬件、电费、折旧、人工维护和闲置率都算进去,再和API真实账单比较。

我们的观点:AMD并不是要把每个人都变成数据中心,而是在押注PC会成为个人AI的控制平面。模型能在本地跑只是第一步,真正决定成败的是软件兼容、Agent安全、能耗、噪声和用户是否有足够高的持续负载。

如果这些条件成立,“买硬件换Token自由”会成为专业用户的新选择;如果只是偶尔聊天和写文案,云端订阅仍然更省心。未来不是本地替代云端,而是每个任务都被放到最便宜、最快、最可信的位置运行。

常见问题(FAQ)

AMD所说的“Token自由”是什么意思?
主要指购买本地AI硬件后,日常推理不再按每个Token向云端API付费;但仍有硬件、电力、折旧、维护和模型许可成本。
192GB Ryzen AI Halo现在已经上市了吗?
现款Ryzen AI Halo是128GB版本。AMD已预告搭载Ryzen AI Max+ PRO 495、支持192GB内存的下一代平台,具体上市和整机配置需看官方更新。
192GB内存能运行3000亿参数模型吗?
AMD官方标称Ryzen AI Max PRO 400系列可支持最高3000亿参数模型,但实际需要量化,速度也受上下文、缓存、带宽和软件优化影响。
Threadripper Halo Station什么时候上市?
它在IFA 2026以原型形式首次展示,AMD官网标注计划于2027年推出,价格和最终配置尚未完全公布。
本地AI会完全取代云端模型吗?
不会。高频、隐私敏感和稳定任务适合本地;最新前沿模型、偶发复杂任务和弹性并发仍更适合云端,混合路由更现实。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据