导语|本文整理一泽 Eze 在《聊近期 Agent 模型,以及我的选用建议》中对当下热门 Agent 模型的横向评测。原文作者同时在做新产品 Chat Memo 的 Agent 端,把模型拉到了真实生产环境跑了一个遍。五款进入对比的模型分别是:Claude 系列新成员 Fable 5、GPT 5.6(Sol)、DeepSeek V4、Kimi K3,以及刚发布的 Qwen3.8-Max。

一、Fable 5:把模型当作「项目合伙人」
作者给出的整体评价是:Fable 5 是当下生成 Agent 产品最值得信赖的选择。理由有三条:
- 独立性:给完提示词之后,Fable 5 不容易被用户推着走,常常保留独立判断,给出「意料之外、但论证严密」的回应;
- 不钻牛角尖:对长任务里的死胡同反应快,会主动退一步重新规划,而不是和已写下的代码死磕;
- 回应风格清晰:相比前几代更容易让人「看懂它在做什么、为什么这么做」。
这一代被一泽 Eze 称为「项目合伙人」,而 Claude 4.8 / Sonnet 5 的对比结论被缩到一句话:高难新任务给 Fable 5,已有模块的修补调整给 Opus 4.8;Sonnet 5 则不爱用。

二、GPT 5.6 Sol:最积极的 Skill 驱动者,但也是最听话的模型
5.6 Sol 是 OpenAI 新一代 Codex / Agent 主力。一泽 Eze 的体感是:指令遵循在新一代里明显提高,对装上去的 Skill 几乎「必触发」——这一点比前几代都稳定。同时,5.6 Sol 配套的 Pro 周额度接近 10 亿 token,加上近期「4 天 3 次重置」的强度,已经能做到每天 3 亿 token 以上的中高强度消耗。Codex 的额度政策可以同步参考:把「高强度 + 工具调用」的场景放在 Codex CLI 上能进一步压缩单位成本。
但硬币的另一面是:模型变听话,并不总是好事。容易陷到用户最初的提示方向、已有代码架构里「一直钻牛角尖」。要规避这个风险,作者给出的提示工程建议是:
- 用任务背景和目标描述意图,避免不必要的个人观点引导;
- 让模型自己补完方案,而不是替它指定实现;
- 真遇到想不明白的问题,「可能还是得找 Fable 5 才能逃出牛角尖」。
前端表现上,5.6 Sol 在 PPT、简单 Web 交互上够用,但不是它的强项。
三、DeepSeek V4:性价比被低估的 Agent 默认模型
DeepSeek V4 系列一泽 Eze 的核心定位是「Agent 产品的默认模型」——尤其适合 To C 场景。原因有两层:
- 推理能力够用:Flash 与 Pro 两个版本之间的差异主要是 Pro 在推理深度和主动性上更优,但即便是 Flash 也能承接对话、tool use 和 sub-agent 调度的日常任务;
- 成本结构相对最优:DeepSeek 提供的 Prompt Cache 缓存时间窗从小时级到天级,是它相对其他模型最显著的省钱点。
这一代 V4 的能力提升重点是 Pro / Flash 双线齐发,作者本人的体感是「放在 Chat Memo 内作为日常 Agent 对话模型很顺手」。

👉 关于 DeepSeek 网页版、App 和 API 入口,左视频已经做了完整介绍;如果你的 Agent 产品在选默认模型,建议把 DeepSeek V4 加入对照测试。
四、Kimi K3:视觉上限超想象,199 档会员快「卷」没了
Kimi K3 是月之暗面 2026 年下半年最受关注的新模型。一泽 Eze 给出的核心观察:
- 前端视觉上限超出想象:社区清一色的好评集中在 3D 网页模型的绘制(巧克力工厂物理按压、精细的场景细节都跑得动);
- 长上下文 + 多话题跳跃:在长对话里频繁切换话题仍然记得「开始那条提醒」,主动调用工具做信息增强;
- 深推理问题:唯一负担是 199 档会员周额度大约只够 0.8 亿 K3 token,「得精打细算用」。

👉 Kimi K3 与 Kimi Work 在左视频的收录页 里有更完整的百万上下文、多 Agent 协作与 PPT/表格交付能力介绍。文中提到的「GPU 挤爆、K3 暂停新订阅」在同一条产品线里也值得一读。
五、Qwen3.8-Max:刚发布的「思考更深」的国产新选择
Qwen3.8-Max 这周才发布,作者只跑了简单的独立 Demo 测试,但他给出的初步印象是「思考有点长,也有点贵」。阿里云也顺势把个人版 Token Plan 重新拉回主流价位,在 Qoder 里白天 1 折、晚间 0.2 折。对重度 Agent 用户来说,新模型的入门成本被显著压低。

六、归纳:选择 Agent 模型时该看哪三件事
回到一泽 Eze 的结尾观点。比起去年只盯着模型能力,进入 2026 下半年选 Agent 模型大概要看三件事的平衡:
- 任务连续性:能不能在长上下文里保持指令记忆、能不能主动调用工具、能不能在多 Agent 调度中不退化;
- 输出速度与价格:单次任务越来越复杂,token 消耗跟着涨。模型如果再贵下去,重度 Agent 用户扛不住,普通开发者的产品化路径也会变窄;
- 前端质量:当 Agent 真正进入生产环境,前端不再是「模型能力的一个附件」,而是用户每天看到的产品门面。
「希望下半年能在价格上卷出几个好模型。」——一泽 Eze

七、关于文中几个开源项目
一泽 Eze 的原文末尾还推荐了几个开源 Agent / 提示词工具。左视频尚未单独收录,不过 GitHub 仓库可以直接访问:
- AutoGPT:开源让用户创建和运行智能体的项目,强调「AI 有步骤地解决实际问题」。
- MetaGPT:把「一句话需求」展开成用户故事、竞品分析、API 与文件结构等软件研发产物。
- LangGPT:模板化的高质量提示词工具,在 Kimi 在线页 也可以直接体验。
参考来源
- 作者署名:一泽 Eze,原文题为《聊近期 Agent 模型,以及我的选用建议》;本篇按公开转载版本整理。
- 作者背景:原文底部提及作者在做的产品为 Chat Memo 的 Agent 端(公开内测尚未开放)。
本文基于原作者公开发布的版本做原创整理,未引用任何不对外公开的训练数据、模型权值或身份信息。文中涉及的「Fable 5 / Opus 4.8 / Sonnet 5 / GPT 5.6 / DS V4 / Kimi K3 / Qwen3.8-Max」等代号皆沿用原作者用语,与左视频站内对各厂商的命名保持一致;如发现事实错漏欢迎在评论区指出。






