27.5 万字符运行时提示词被公开,但这不等于模型权重被盗,也不能简单等同于服务器遭入侵
Claude Fable 5.1 发布后,一份超过 27.5 万字符的提示词文件迅速出现在 GitHub。“被黑”“破解”“绝密泄露”等标题随之传播,但把这件事说清楚,必须先区分三个概念:Anthropic 主动公开的核心系统提示词、Claude 产品运行时动态组装的完整上下文,以及模型本身的权重和服务器权限。


Fable 5.1 到底发布了什么?
Claude Fable 5.1 于 2026 年 9 月 1 日发布,面向高难度推理与长周期 Agent 工作。官方模型文档显示,它拥有 100 万 Token 上下文、最高 12.8 万 Token 输出、始终开启的自适应思考,并通过 effort 参数在低、中、高、xhigh 和 max 之间调整推理投入。
Fable 5.1 与受限开放的 Claude Mythos 5.1 使用同一底层模型。区别在于:Fable 5.1 面向广泛用户并加入网络安全与生物领域护栏;Mythos 5.1 仅向经过审核的网络防御和生命科学机构开放。想了解完整发布信息,可阅读站内文章:Claude Fable 5.1 与 Mythos 5.1 发布详解。
ARC Prize 的验证结果显示,Fable 5.1 在 max effort 下取得 ARC-AGI-1 半私有集 97.5%、ARC-AGI-2 半私有集 90.0%。对应成本分别是每题 1.40 美元和 4.49 美元。原始报道中“ARC-AGI-2 每题 3.12 美元”的数字与当前 ARC Prize 页面不一致,应以验证页面为准。
“27 万字提示词泄露”究竟指什么?
Anthropic 本来就会公开 Claude 产品使用的核心系统提示词,官方页面展示的是模型身份、行为原则、知识截止时间、产品信息等基础指令。第三方仓库公开的文件则更长,声称包含 Claude 在真实产品中运行时拼接的额外内容:工具说明、记忆规则、搜索策略、界面组件、文件处理规范和大量 JSON Schema。



这两个版本并不必然互相矛盾。现代 AI 产品通常会在基础系统提示词之外,根据账号、入口、可用工具、地区、实验分组和当前任务继续拼接指令。因此,一个聊天会话实际收到的上下文可能远长于官网公开的“核心提示词”。
这算不算“黑客破解”?关键看三个层级
- 系统提示词提取:通过提示注入、行为诱导或客户端观察,让模型复述或暴露隐藏指令。这属于产品安全问题,但不代表获得服务器权限。
- 运行时上下文泄露:如果文件确实来自某次真实会话,它可能暴露工具名称、路由规则和安全策略,攻击者可据此设计更有针对性的绕过方式。
- 模型权重或基础设施失陷:需要证明权重文件、内部代码、密钥或服务器控制权被窃取。目前公开材料并未提供这类证据。
因此,使用“提示词被提取或公开”更严谨。即便文件真实,27.5 万字符也不等于 27.5 万个汉字,更不等于 27.5 万 Token;字符数、字数和 Token 数是不同计量单位。
长提示词里暴露了哪些设计思路?
公开文件最有价值的部分,不是某一句“神秘咒语”,而是展示了一个成熟 AI 产品如何分层治理行为:版权内容、医疗与心理健康、危险化学品、用户记忆、网页搜索、工具调用和 UI 输出都被拆成独立规则。

1. 版权边界被写进生成流程
规则强调不能重现受版权保护的长文本、歌曲、角色、Logo 和高度可识别的商业视觉。对用户而言,这意味着“换个姿势、颜色或风格”并不能自动绕过版权边界;对平台而言,它减少了生成工具被用于仿制知名 IP 的风险。
2. 高风险建议采用“减少伤害”而非完全沉默
在心理健康、药物和危险物质问题上,系统会避免未经依据地诊断用户,也不会提供可直接执行的危险剂量或配方;但仍可提供急救、风险识别和求助渠道。这种设计试图在实用性和安全之间取得平衡。
3. 记忆系统有明确的敏感信息禁区
文件描述的记忆策略会区分可长期保存的偏好与不应持久化的敏感信息,例如未成年人身份、犯罪记录、移民状态、精神健康推断、自残倾向和性史等。需要注意的是,提示词规则只能说明产品意图,实际隐私保障仍依赖后端存储、访问控制、审计和删除机制。
4. 工具 Schema 展示了 Agent 的真实能力边界
第三方文件列出大量显示、搜索、历史对话、文件和应用工具。报道据此统计出 46 个工具,但这更像特定 Claude 产品会话的运行时工具集合,不应理解为 Claude API 对所有开发者默认开放 46 个工具。工具数量也会随入口、账号权限和功能实验变化。
“44 分钟破解历史密码”应怎样看?
报道还引用第三方评测称,Fable 5.1 在约 44 分钟内解析了 17 世纪文本中的 Cyphral Distich,并进一步处理更长的 Cyphral Octastich。其思路不是暴力枚举,而是把密码前后的文章结构、数字 32 和反复出现的“愿望”线索联系起来。



这个案例很能说明长上下文研究与多步推理的潜力,但它不是 ARC Prize 那种可重复的标准化基准。除非原始材料、运行日志、提示、失败尝试和独立复现全部公开,否则更适合作为研究案例,而非证明模型“达到 AGI”的证据。
从黑洞视频到小游戏:真正提升的是长任务闭环
原文实测让 Fable 5.1 用代码生成一段第一人称进入黑洞的视频。任务需要建立物理近似、编写光线追踪、用低分辨率测试、检查数值溢出、调整构图和色调,再并行渲染并验证视频参数。








值得关注的不是某一帧是否漂亮,而是模型能否在二三十分钟的连续任务里发现错误、修改代码、验证输出并完成交付。对 Agent 用户来说,这比单轮回答的“聪明程度”更重要。
社区 Demo 很亮眼,但不能替代系统评测
社区还展示了复古太空游戏、赛车游戏、3D 模型和视觉自画像等案例。这些 Demo 能反映代码生成、视觉理解和工具协作能力,却容易受到提示词质量、人工筛选和展示偏差影响。评估模型时,应同时看公开基准、自己的真实任务通过率、成本、延迟和失败恢复能力。




更强也更贵:Token、速率限制与自动继续问题
官方 API 定价为每百万输入 Token 10 美元、输出 Token 50 美元;缓存读取价格更低,但高 effort、长上下文和复杂工具链仍可能迅速消耗额度。普通用户感受到的限制还包括订阅消息上限、速率限制和长任务中断。


部署到生产环境时,建议为每类任务设置最大 effort、最大输出、工具调用次数、超时和成本预算;长任务应保存中间产物并支持断点续跑,而不是完全依赖一次对话完成。
这次事件对开发者和企业有什么启示?
- 不要把机密只写进系统提示词:提示词应被视为可能被观察到的策略层,密钥、内部接口和商业机密必须放在服务端权限系统中。
- 工具要做最小权限:每个工具都应限制参数、数据范围和可执行动作,并保留审计日志。
- 把提示注入当成输入安全问题:来自网页、文件和连接器的内容不能自动获得系统级权威。
- 敏感操作增加确认与隔离:发送消息、删除数据、付款、发布内容等动作需要单独授权。
- 模型升级要重新做评测:更强的模型可能扩大攻击面,也可能改变拒绝、搜索和工具调用行为。
可通过站内前台导航进入 Claude,也可以查看 Anthropic 官方站导航。
结语:提示词公开值得重视,但不要把它神化
这份 27.5 万字符文件让外界第一次较完整地看到,一个前沿 AI 产品如何把安全、记忆、搜索、工具和界面组织成运行时上下文。它对提示注入防护和 Agent 权限设计有现实价值。
但提示词不是模型权重,也不是模型能力的全部来源。真正决定产品可靠性的,是模型本身、后端权限、工具隔离、数据治理、监控审计和持续红队测试共同构成的系统工程。












