暂无菜单项

近期 Agent 模型选用建议:Fable 5 / GPT 5.6 / DS V4 / Kimi K3 / Qwen3.8-Max 五款横评

发布于 更新于
20

导语|本文整理一泽 Eze 在《聊近期 Agent 模型,以及我的选用建议》中对当下热门 Agent 模型的横向评测。原文作者同时在做新产品 Chat Memo 的 Agent 端,把模型拉到了真实生产环境跑了一个遍。五款进入对比的模型分别是:Claude 系列新成员 Fable 5GPT 5.6(Sol)、DeepSeek V4、Kimi K3,以及刚发布的 Qwen3.8-Max。

五款 Agent 模型 logo 横向对比

一、Fable 5:把模型当作「项目合伙人」

作者给出的整体评价是:Fable 5 是当下生成 Agent 产品最值得信赖的选择。理由有三条:

  • 独立性:给完提示词之后,Fable 5 不容易被用户推着走,常常保留独立判断,给出「意料之外、但论证严密」的回应;
  • 不钻牛角尖:对长任务里的死胡同反应快,会主动退一步重新规划,而不是和已写下的代码死磕;
  • 回应风格清晰:相比前几代更容易让人「看懂它在做什么、为什么这么做」。

这一代被一泽 Eze 称为「项目合伙人」,而 Claude 4.8 / Sonnet 5 的对比结论被缩到一句话:高难新任务给 Fable 5,已有模块的修补调整给 Opus 4.8;Sonnet 5 则不爱用

Fable 5 官方宣传文案,强调 Next generation of intelligence for the hardest knowledge work and coding problems

二、GPT 5.6 Sol:最积极的 Skill 驱动者,但也是最听话的模型

5.6 Sol 是 OpenAI 新一代 Codex / Agent 主力。一泽 Eze 的体感是:指令遵循在新一代里明显提高,对装上去的 Skill 几乎「必触发」——这一点比前几代都稳定。同时,5.6 Sol 配套的 Pro 周额度接近 10 亿 token,加上近期「4 天 3 次重置」的强度,已经能做到每天 3 亿 token 以上的中高强度消耗。Codex 的额度政策可以同步参考:把「高强度 + 工具调用」的场景放在 Codex CLI 上能进一步压缩单位成本。

但硬币的另一面是:模型变听话,并不总是好事。容易陷到用户最初的提示方向、已有代码架构里「一直钻牛角尖」。要规避这个风险,作者给出的提示工程建议是:

  • 用任务背景和目标描述意图,避免不必要的个人观点引导;
  • 让模型自己补完方案,而不是替它指定实现;
  • 真遇到想不明白的问题,「可能还是得找 Fable 5 才能逃出牛角尖」。

前端表现上,5.6 Sol 在 PPT、简单 Web 交互上够用,但不是它的强项。

三、DeepSeek V4:性价比被低估的 Agent 默认模型

DeepSeek V4 系列一泽 Eze 的核心定位是「Agent 产品的默认模型」——尤其适合 To C 场景。原因有两层:

  • 推理能力够用:Flash 与 Pro 两个版本之间的差异主要是 Pro 在推理深度和主动性上更优,但即便是 Flash 也能承接对话、tool use 和 sub-agent 调度的日常任务;
  • 成本结构相对最优:DeepSeek 提供的 Prompt Cache 缓存时间窗从小时级到天级,是它相对其他模型最显著的省钱点。

这一代 V4 的能力提升重点是 Pro / Flash 双线齐发,作者本人的体感是「放在 Chat Memo 内作为日常 Agent 对话模型很顺手」。

DeepSeek V4 Pro 与 Flash 的输入/输出 token 与流量数据对比

👉 关于 DeepSeek 网页版、App 和 API 入口,左视频已经做了完整介绍;如果你的 Agent 产品在选默认模型,建议把 DeepSeek V4 加入对照测试。

四、Kimi K3:视觉上限超想象,199 档会员快「卷」没了

Kimi K3 是月之暗面 2026 年下半年最受关注的新模型。一泽 Eze 给出的核心观察:

  • 前端视觉上限超出想象:社区清一色的好评集中在 3D 网页模型的绘制(巧克力工厂物理按压、精细的场景细节都跑得动);
  • 长上下文 + 多话题跳跃:在长对话里频繁切换话题仍然记得「开始那条提醒」,主动调用工具做信息增强;
  • 深推理问题:唯一负担是 199 档会员周额度大约只够 0.8 亿 K3 token,「得精打细算用」。

Kimi K3 官方 3D 网页模型案例:The Chocolate Conservatory 巧克力工厂河流物理

👉 Kimi K3 与 Kimi Work 在左视频的收录页 里有更完整的百万上下文、多 Agent 协作与 PPT/表格交付能力介绍。文中提到的「GPU 挤爆、K3 暂停新订阅」在同一条产品线里也值得一读。

五、Qwen3.8-Max:刚发布的「思考更深」的国产新选择

Qwen3.8-Max 这周才发布,作者只跑了简单的独立 Demo 测试,但他给出的初步印象是「思考有点长,也有点贵」。阿里云也顺势把个人版 Token Plan 重新拉回主流价位,在 Qoder 里白天 1 折、晚间 0.2 折。对重度 Agent 用户来说,新模型的入门成本被显著压低。

Qwen3.8-Max 发布预告图:Qwen3.8 is coming soon

六、归纳:选择 Agent 模型时该看哪三件事

回到一泽 Eze 的结尾观点。比起去年只盯着模型能力,进入 2026 下半年选 Agent 模型大概要看三件事的平衡:

  1. 任务连续性:能不能在长上下文里保持指令记忆、能不能主动调用工具、能不能在多 Agent 调度中不退化;
  2. 输出速度与价格:单次任务越来越复杂,token 消耗跟着涨。模型如果再贵下去,重度 Agent 用户扛不住,普通开发者的产品化路径也会变窄;
  3. 前端质量:当 Agent 真正进入生产环境,前端不再是「模型能力的一个附件」,而是用户每天看到的产品门面。

「希望下半年能在价格上卷出几个好模型。」——一泽 Eze

五模型综合对比图:Fable / GPT / Deepseek / Kimi / Qwen 各自的强项与代际关系

七、关于文中几个开源项目

一泽 Eze 的原文末尾还推荐了几个开源 Agent / 提示词工具。左视频尚未单独收录,不过 GitHub 仓库可以直接访问:

  • AutoGPT:开源让用户创建和运行智能体的项目,强调「AI 有步骤地解决实际问题」。
  • MetaGPT:把「一句话需求」展开成用户故事、竞品分析、API 与文件结构等软件研发产物。
  • LangGPT:模板化的高质量提示词工具,在 Kimi 在线页 也可以直接体验。

参考来源

  • 作者署名:一泽 Eze,原文题为《聊近期 Agent 模型,以及我的选用建议》;本篇按公开转载版本整理。
  • 作者背景:原文底部提及作者在做的产品为 Chat Memo 的 Agent 端(公开内测尚未开放)。

本文基于原作者公开发布的版本做原创整理,未引用任何不对外公开的训练数据、模型权值或身份信息。文中涉及的「Fable 5 / Opus 4.8 / Sonnet 5 / GPT 5.6 / DS V4 / Kimi K3 / Qwen3.8-Max」等代号皆沿用原作者用语,与左视频站内对各厂商的命名保持一致;如发现事实错漏欢迎在评论区指出。

常见问题(FAQ)

什么是 Fable 5?
Fable 5 是本文原作者一泽 Eze 对 Anthropic 新一代 Claude 系列模型的脱敏写法,定位「Agent 场景下的项目合伙人」。它不被动跟随指令,能保持独立判断,并对长任务里的死胡同反应很快。
GPT 5.6 Sol 适合什么样的工作?
GPT 5.6 Sol 是 OpenAI 专门面向 Agent 的主力模型,指令遵循强、对装上去的 Skill 会主动触发,适合中等强度高频调用,可作为 Agent 的默认模型之一。但需注意提示词不要代入过多个人判断,避免它跟着用户一起钻进错误方向。
把哪款模型作为 Agent 产品的默认模型?
一泽 Eze 的建议是 DeepSeek V4:Flash 与 Pro 能覆盖大多数 To C 场景,加上 Prompt Cache 能进一步拉低单位 token 成本。需要更高推理深度或独立判断时,再调度 Fable 5 即可。
Kimi K3 的优势在哪里?
K3 在长上下文与复杂意图理解上都有明显提升,尤其在 3D 网页模型绘制、高质量代码生成与多工具调度上被社区认可。限制是思考较深、单位轮 token 消耗较高,需要按需调度。
国产模型真的卷起来了吗?
本文中复盘了 DeepSeek V4、Kimi K3 与 Qwen3.8-Max 三款国产模型,从性价比、上下文长度到思考深度都在迫近并部分贴近一线。一泽 Eze 末尾观点是希望价格继续被卷出来,让独立开发者能把 Agent 作为产品推出。
0 点赞
0 收藏
分享
0 讨论
反馈
近期热门