暂无菜单项

Claude Fable 5.1「27万字符提示词」公开:是黑客破解、越狱,还是运行时上下文提取?

发布于
4

27.5 万字符运行时提示词被公开,但这不等于模型权重被盗,也不能简单等同于服务器遭入侵

Claude Fable 5.1 发布后,一份超过 27.5 万字符的提示词文件迅速出现在 GitHub。“被黑”“破解”“绝密泄露”等标题随之传播,但把这件事说清楚,必须先区分三个概念:Anthropic 主动公开的核心系统提示词、Claude 产品运行时动态组装的完整上下文,以及模型本身的权重和服务器权限。

先说结论:目前公开材料能确认的是第三方发布了一份声称从运行环境提取的长提示词;没有证据表明 Fable 5.1 的模型权重、训练数据或 Anthropic 服务器控制权被窃取。将其称为“提示词提取事件”比“模型被黑”更准确。
Claude Fable 5.1 发布与能力数据概览
Claude Fable 5.1 发布与能力数据概览
ARC Prize 公布的 Fable 5.1 验证结果
ARC Prize 公布的 Fable 5.1 验证结果

Fable 5.1 到底发布了什么?

Claude Fable 5.1 于 2026 年 9 月 1 日发布,面向高难度推理与长周期 Agent 工作。官方模型文档显示,它拥有 100 万 Token 上下文、最高 12.8 万 Token 输出、始终开启的自适应思考,并通过 effort 参数在低、中、高、xhigh 和 max 之间调整推理投入。

Fable 5.1 与受限开放的 Claude Mythos 5.1 使用同一底层模型。区别在于:Fable 5.1 面向广泛用户并加入网络安全与生物领域护栏;Mythos 5.1 仅向经过审核的网络防御和生命科学机构开放。想了解完整发布信息,可阅读站内文章:Claude Fable 5.1 与 Mythos 5.1 发布详解

ARC Prize 的验证结果显示,Fable 5.1 在 max effort 下取得 ARC-AGI-1 半私有集 97.5%、ARC-AGI-2 半私有集 90.0%。对应成本分别是每题 1.40 美元和 4.49 美元。原始报道中“ARC-AGI-2 每题 3.12 美元”的数字与当前 ARC Prize 页面不一致,应以验证页面为准。

“27 万字提示词泄露”究竟指什么?

Anthropic 本来就会公开 Claude 产品使用的核心系统提示词,官方页面展示的是模型身份、行为原则、知识截止时间、产品信息等基础指令。第三方仓库公开的文件则更长,声称包含 Claude 在真实产品中运行时拼接的额外内容:工具说明、记忆规则、搜索策略、界面组件、文件处理规范和大量 JSON Schema。

第三方仓库公开的 Claude Fable 5.1 长提示词文件
第三方仓库公开的 Claude Fable 5.1 长提示词文件
Anthropic 官方系统提示词页面
Anthropic 官方系统提示词页面
第三方对运行时上下文规模的说明
第三方对运行时上下文规模的说明

这两个版本并不必然互相矛盾。现代 AI 产品通常会在基础系统提示词之外,根据账号、入口、可用工具、地区、实验分组和当前任务继续拼接指令。因此,一个聊天会话实际收到的上下文可能远长于官网公开的“核心提示词”。

这算不算“黑客破解”?关键看三个层级

  1. 系统提示词提取:通过提示注入、行为诱导或客户端观察,让模型复述或暴露隐藏指令。这属于产品安全问题,但不代表获得服务器权限。
  2. 运行时上下文泄露:如果文件确实来自某次真实会话,它可能暴露工具名称、路由规则和安全策略,攻击者可据此设计更有针对性的绕过方式。
  3. 模型权重或基础设施失陷:需要证明权重文件、内部代码、密钥或服务器控制权被窃取。目前公开材料并未提供这类证据。

因此,使用“提示词被提取或公开”更严谨。即便文件真实,27.5 万字符也不等于 27.5 万个汉字,更不等于 27.5 万 Token;字符数、字数和 Token 数是不同计量单位。

长提示词里暴露了哪些设计思路?

公开文件最有价值的部分,不是某一句“神秘咒语”,而是展示了一个成熟 AI 产品如何分层治理行为:版权内容、医疗与心理健康、危险化学品、用户记忆、网页搜索、工具调用和 UI 输出都被拆成独立规则。

版权与视觉生成限制的示例
版权与视觉生成限制的示例

1. 版权边界被写进生成流程

规则强调不能重现受版权保护的长文本、歌曲、角色、Logo 和高度可识别的商业视觉。对用户而言,这意味着“换个姿势、颜色或风格”并不能自动绕过版权边界;对平台而言,它减少了生成工具被用于仿制知名 IP 的风险。

2. 高风险建议采用“减少伤害”而非完全沉默

在心理健康、药物和危险物质问题上,系统会避免未经依据地诊断用户,也不会提供可直接执行的危险剂量或配方;但仍可提供急救、风险识别和求助渠道。这种设计试图在实用性和安全之间取得平衡。

3. 记忆系统有明确的敏感信息禁区

文件描述的记忆策略会区分可长期保存的偏好与不应持久化的敏感信息,例如未成年人身份、犯罪记录、移民状态、精神健康推断、自残倾向和性史等。需要注意的是,提示词规则只能说明产品意图,实际隐私保障仍依赖后端存储、访问控制、审计和删除机制。

4. 工具 Schema 展示了 Agent 的真实能力边界

第三方文件列出大量显示、搜索、历史对话、文件和应用工具。报道据此统计出 46 个工具,但这更像特定 Claude 产品会话的运行时工具集合,不应理解为 Claude API 对所有开发者默认开放 46 个工具。工具数量也会随入口、账号权限和功能实验变化。

“44 分钟破解历史密码”应怎样看?

报道还引用第三方评测称,Fable 5.1 在约 44 分钟内解析了 17 世纪文本中的 Cyphral Distich,并进一步处理更长的 Cyphral Octastich。其思路不是暴力枚举,而是把密码前后的文章结构、数字 32 和反复出现的“愿望”线索联系起来。

第三方发布的历史密码任务结果
第三方发布的历史密码任务结果
由 64 个数字组成的 Cyphral Distich
由 64 个数字组成的 Cyphral Distich
利用文本上下文推导密码索引关系
利用文本上下文推导密码索引关系

这个案例很能说明长上下文研究与多步推理的潜力,但它不是 ARC Prize 那种可重复的标准化基准。除非原始材料、运行日志、提示、失败尝试和独立复现全部公开,否则更适合作为研究案例,而非证明模型“达到 AGI”的证据。

从黑洞视频到小游戏:真正提升的是长任务闭环

原文实测让 Fable 5.1 用代码生成一段第一人称进入黑洞的视频。任务需要建立物理近似、编写光线追踪、用低分辨率测试、检查数值溢出、调整构图和色调,再并行渲染并验证视频参数。

黑洞视频任务与渲染方案
黑洞视频任务与渲染方案
低分辨率测试暴露过曝和数值问题
低分辨率测试暴露过曝和数值问题
模型根据测试结果反复修正渲染器
模型根据测试结果反复修正渲染器
完整分辨率渲染前的参数调整
完整分辨率渲染前的参数调整
第一人称黑洞视频生成过程
第一人称黑洞视频生成过程
视频结果与时间轴验证
视频结果与时间轴验证
最终动态效果演示
最终动态效果演示
模型对物理近似与局限的自检
模型对物理近似与局限的自检

值得关注的不是某一帧是否漂亮,而是模型能否在二三十分钟的连续任务里发现错误、修改代码、验证输出并完成交付。对 Agent 用户来说,这比单轮回答的“聪明程度”更重要。

社区 Demo 很亮眼,但不能替代系统评测

社区还展示了复古太空游戏、赛车游戏、3D 模型和视觉自画像等案例。这些 Demo 能反映代码生成、视觉理解和工具协作能力,却容易受到提示词质量、人工筛选和展示偏差影响。评估模型时,应同时看公开基准、自己的真实任务通过率、成本、延迟和失败恢复能力。

社区展示的复古太空游戏
社区展示的复古太空游戏
一次生成的赛车游戏示例
一次生成的赛车游戏示例
Fable 5.1 与上一版本的 3D 生成对比
Fable 5.1 与上一版本的 3D 生成对比
社区总结的 Fable 5.1 适用任务
社区总结的 Fable 5.1 适用任务

更强也更贵:Token、速率限制与自动继续问题

官方 API 定价为每百万输入 Token 10 美元、输出 Token 50 美元;缓存读取价格更低,但高 effort、长上下文和复杂工具链仍可能迅速消耗额度。普通用户感受到的限制还包括订阅消息上限、速率限制和长任务中断。

用户对 Token 消耗和速率限制的反馈
用户对 Token 消耗和速率限制的反馈
长任务自动继续与使用上限的社区反馈
长任务自动继续与使用上限的社区反馈

部署到生产环境时,建议为每类任务设置最大 effort、最大输出、工具调用次数、超时和成本预算;长任务应保存中间产物并支持断点续跑,而不是完全依赖一次对话完成。

这次事件对开发者和企业有什么启示?

  • 不要把机密只写进系统提示词:提示词应被视为可能被观察到的策略层,密钥、内部接口和商业机密必须放在服务端权限系统中。
  • 工具要做最小权限:每个工具都应限制参数、数据范围和可执行动作,并保留审计日志。
  • 把提示注入当成输入安全问题:来自网页、文件和连接器的内容不能自动获得系统级权威。
  • 敏感操作增加确认与隔离:发送消息、删除数据、付款、发布内容等动作需要单独授权。
  • 模型升级要重新做评测:更强的模型可能扩大攻击面,也可能改变拒绝、搜索和工具调用行为。

可通过站内前台导航进入 Claude,也可以查看 Anthropic 官方站导航

结语:提示词公开值得重视,但不要把它神化

这份 27.5 万字符文件让外界第一次较完整地看到,一个前沿 AI 产品如何把安全、记忆、搜索、工具和界面组织成运行时上下文。它对提示注入防护和 Agent 权限设计有现实价值。

但提示词不是模型权重,也不是模型能力的全部来源。真正决定产品可靠性的,是模型本身、后端权限、工具隔离、数据治理、监控审计和持续红队测试共同构成的系统工程。

常见问题(FAQ)

Claude Fable 5.1 真的被黑客破解了吗?
公开资料能确认的是第三方发布了一份声称从运行环境提取的长提示词。尚无证据表明模型权重、训练数据或 Anthropic 服务器控制权被窃取,因此称为提示词提取事件更准确。
27万字提示词实际有多长?
第三方文件被描述为超过27.5万字符。字符、汉字和Token是不同计量单位,不能直接把27.5万字符写成27.5万Token。
官方系统提示词和第三方文件有什么区别?
官方页面公开的是核心系统提示词;第三方文件还声称包含运行时动态拼接的工具说明、记忆策略、搜索规则、界面组件与JSON Schema。
提示词泄露等于模型权重泄露吗?
不等于。提示词是输入给模型的指令层,权重是模型训练后形成的核心参数文件,两者的安全等级和影响完全不同。
Fable 5.1 的 ARC-AGI 成绩是多少?
ARC Prize验证页面显示,max effort下ARC-AGI-1半私有集为97.5%,ARC-AGI-2半私有集为90.0%,对应成本分别为每题1.40美元和4.49美元。
Claude Fable 5.1 和 Mythos 5.1 有什么关系?
两者使用同一底层模型。Fable 5.1面向广泛用户并加入网络安全和生物安全护栏;Mythos 5.1仅向经过审核的机构开放。
企业怎样降低系统提示词泄露风险?
不要在提示词里放密钥和真正机密;对工具实施最小权限、参数校验、动作确认、审计日志和提示注入隔离。
在哪里使用 Claude?
可通过本站Claude前台导航进入:https://www.zuoshipin.com/link/876.html。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材