textGrain能在选词里埋入统计信号,却不能证明作者身份、内容真假或人类贡献。
导读:ChatGPT写下的每个词,接下来都可能带着一串肉眼看不见的统计暗号。OpenAI正式公布textGrain文本水印,并准备把它逐步用于欧盟符合条件的ChatGPT与Codex输出。负责这项技术的九人团队中,通讯作者是2026年考普斯会长奖得主苏炜杰。但别急着把水印当成AI测谎仪:一段文字改写25%,检出率就可能从约92%跌到17%。

ChatGPT开始打水印,但不是所有回答、所有地区一起上
OpenAI在2026年10月5日公布了分阶段方案:
- API:全球客户可为部分模型主动开启文本水印,默认仍然关闭。
- ChatGPT与Codex:未来数周内,欧盟地区符合条件的文本输出将加入不可见水印,覆盖各付费与免费计划,但OpenAI没有把它设为全球默认。
- 检测器:首阶段只向通过审核的研究者和专业机构开放,不向普通公众直接提供。

推动这次上线的直接背景是欧盟《人工智能法》第50条。相关透明度义务自2026年8月2日起适用,要求AI生成或操纵的内容带有机器可读标记,并能够被检测。
这不是页面上可见的“AI生成”标签。textGrain把统计信号写进模型的选词过程,人眼正常阅读时看不出来,必须使用持有密钥的检测器分析。
把水印做进产品的人,拿的是考普斯会长奖
textGrain技术报告由九位研究者合作完成,第一作者是宾夕法尼亚大学的Xiang Li,通讯作者为苏炜杰。苏炜杰同时任宾夕法尼亚大学沃顿商学院统计与数据科学系教授,并于2026年加入OpenAI参与模型研究。


他在2026年获得COPSS Presidents’ Award,中文常被媒体称作“统计学界的诺贝尔奖”。这里需要说清楚:它不是诺贝尔奖,而是由统计学界主要学会联合设立、面向杰出青年统计学家的重要奖项。官方获奖理由中特别提到生成式AI的统计基础,包括大模型水印、对齐与排序。

这并不是苏炜杰突然闯入一个新领域。他与合作者此前已经建立大语言模型水印的统计检测框架,研究检测效率、人类编辑后的稳健性、拟合优度检验和混合文本中水印比例估计。



textGrain到底怎么在文字里“藏暗号”?
语言模型每生成一个token,都会从下一词概率分布中抽样。textGrain使用密钥和前文生成伪随机信息,再让抽样结果与这串信息产生可检测的统计关联。检测时,系统拿同一密钥重建随机结构,检查观察到的token是否持续偏向水印选择。

真正困难的不是把信号塞进去,而是既要信号足够强,又不能把模型原本的表达自由锁死。旧式Gumbel-max方案虽然在对密钥取平均时保持“无偏”,但固定密钥和固定前文可能反复选中同一个token,让同一提示词产生高度一致的回答。
关键旋钮:水印最多拿走多少“选词自由”
textGrain把水印看成生成token与密钥随机数之间的耦合。它们偏离相互独立的程度,可以用KL散度衡量;在报告的框架里,这又等于固定密钥后平均损失的抽样熵。
团队因此引入熵预算β:
- β = 0:退化为普通抽样,没有可检测水印信号。
- β提高:密钥对选词的影响增强,水印更容易检测,但模型随机性减少。
- β不是逐词硬指标:它约束的是对密钥取平均后的熵损失,不能保证每个位置都损失完全相同的自由度。

分块最优传输:让十几万词表的计算真正跑得动
直接在完整词表上求最优传输成本太高,textGrain先用密钥把候选token随机分块,再计算每个块的总概率。最优传输只决定“选哪个块”,进入块内以后,token之间的相对概率保持不变。

这把计算规模从完整词表降到“块数 × 列数”。报告中的简化示例把warm、cold、mild等候选词分为三个块,密钥选中一列后改变各块的抽样概率,最后仍在被选块内部按原始比例抽出具体词。
检测端不需要模型,但需要文本和秘密密钥
检测器根据文本前文与密钥重建分块、代价表和选中列,再查看实际token落入哪个块。带水印文本会更频繁地落在低代价组合上,累积后形成统计信号。

理论上可以按目标误报率设定阈值,但报告强调,固定部署密钥、重复前文和有限精度运算都可能破坏理想假设。因此,正式系统仍需用真实数据做经验校准,不能只凭一道理论阈值判定。
效果并不完美:短文本、数学和改写都是弱点
OpenAI公开的Astra基准结果显示,加水印与不加水印的模型总体能力没有出现明显系统性差异。有些项目小幅上升,有些项目下降,不能把单项波动解释成水印一定提升或损害能力。

检测能力的限制更值得注意。在1%目标误报率下:
- 心理学类内容中,约80%的200-token文本能被识别;400-token时约为95%。
- 数学文本因为可选词空间更小,检出率明显更低。
- 400-token文本替换10%同义词后,检出率从约92%降至66%。
- 替换25%后,检出率只剩17%。

最容易被误读的一点:检测不到水印,不代表文字一定由人类写作;检测到水印,也不能说明整篇都由AI完成。翻译、改写、短文本、不支持的模型和水印启用前生成的内容,都可能影响结果。
水印能证明什么,又绝对不能证明什么?
| 可以提供的信号 | 不能得出的结论 |
|---|---|
| 文本中是否存在与OpenAI水印匹配的统计关联 | 不能识别具体用户、账号、提示词或对话 |
| OpenAI系统可能参与过生成或处理 | 不能衡量人类修改、判断和创作贡献 |
| 在给定误报率下提供概率性检测结果 | 不能确定所有权、责任、合法性或内容真假 |
| 帮助研究平台评估内容来源 | 不能把“无水印”直接等同于“人类原创” |
普通用户、媒体和企业应该怎么用?
- 不要把检测结果当裁决:它应是来源判断的一项证据,而不是处罚学生、员工或作者的唯一依据。
- 保留创作过程:重要稿件保存版本记录、引用来源、采访材料和修改痕迹,比一次检测更能说明贡献。
- 公开披露方法:平台若用水印检测参与审核,应说明误报率、适用语言、文本长度和申诉渠道。
- 区分辅助与代写:AI润色、翻译、提纲和整篇生成不能只靠一个二元标签混为一谈。
- 等待更多实测:textGrain计划开源,但真实世界中的翻译、拼接、对抗改写和多模型混合仍需独立研究。
做视频网观点
textGrain最重要的贡献,不是宣布“终于能抓住AI写作”,而是给水印强度找到了一把可计量的尺:为了让信号更明显,模型究竟交出了多少抽样随机性。
这套方法很适合帮助平台建立内容溯源,却不适合扮演“作者审判官”。未来真正可靠的方案,仍会是水印、内容凭证、编辑记录、平台日志和人工核查的组合,而不是押注一个检测分数。
相关站内内容
ChatGPT站内导航:https://www.zuoshipin.com/link/29.html
Codex站内导航:https://www.zuoshipin.com/link/1474.html
GPT-6 Astra站内导航:https://www.zuoshipin.com/link/32152.html
ChatGPT Intelligent UI完整解析:https://www.zuoshipin.com/article/47772
苏炜杰与GPT-6 Astra数学研究:https://www.zuoshipin.com/article/32210






