首页 / 资讯中心 / 文章详情

OpenAI 上线文本水印 textGrain:同义词换掉 10%,检出率就从 92% 掉到 66%

OpenAI 上线文本水印 textGrain:同义词换掉 10%,检出率就从 92% 掉到 66% ★ FEATURED ARTICLE
中午刷到一条消息OpenAI 在 10 月 5 日宣布将给欧盟地区符合条件的 ChatGPT 和 Codex 文本输出加上不可见的文字水印全球 API 客户也可以自行开启。技术名字叫textGrain。一句话概括——模型在选词的时候偷偷改了统计规律检测器去找这个规律判断这段文字是不是 OpenAI 模型写的。这事对写代码的人来说不算小因为它第一次把文本水印从论文搬进了正式产品而且直接跟合规挂钩。水印到底加在哪先说清楚它不是什么。textGrain 不是往文字里塞隐藏字符、零宽空格或特殊符号——那些东西复制粘贴、转格式很容易丢也容易被一眼看出来。它动的是模型生成时选词的概率分布。正常生成是按概率采样textGrain 在采样时引入一个密钥控制的偏好让某些词比原本更容易或更不容易被选到。单看一个词看不出来但整段文字的选词统计模式会整体偏离自然分布检测器拿着密钥一算就能算出这段文字偏了多少。这个思路并不新。早在 2023 年时任 OpenAI 客座研究员的 Scott Aaronson 就公开介绍过一套基于 Gumbel-max 的水印方案。新东西在于它能量化为了信号牺牲了多少生成自由度。按技术报告的说法任何无偏水印都可以看作生成词和密钥随机数之间的一个耦合这个耦合偏离相互独立的程度可以用 KL 散度衡量而它恰好等于两者的互信息也等于固定密钥后平均丢失的抽样熵。于是团队引入了一个叫**熵预算β取值 0~1**的参数β0 就是普通采样β 越大密钥对选词的支配越强、信号越强但模型自由发挥的空间越小。说人话以前谈水印影响只能说基本不失真现在可以给一个比例——我为了可检测性愿意让出多大比例的随机性。对工程团队和监管方这都是更实诚的交代。据报道这份技术报告的通讯作者是今年考普斯会长奖COPSS Presidents’ Award得主苏炜杰。统计学圈的理论工作最后落到产品里也算件挺实在的事。实测数据才是重点OpenAI 自己公布了几组数字值得记一下据报道在**误判率设为 1%**的条件下以心理学这类用词弹性大的内容为例**200 个 token 的段落约 80%**能测出水印400 个 token 约 95%数学这类用词弹性低的内容检出率明显偏低改写测试400 token 英文段落未编辑时检出率约 92%用同义词替换10% 的词降到 66%替换25% 时只剩 17%。这组数据基本点出了这类水印的通病越长、越随意写的文本越容易被检出越短、越模板化、越被编辑过的文本信号越弱。翻译、短文本、二次改写都会掉检出率。还有一个容易误解的点检测器目前不对公众开放只发给获批的研究机构和专业人士。官方也强调“没有水印不等于这是人写的”——很可能只是没开、被改过或者是别的模型生成的。对普通开发者意味着什么API 默认是关的。全球 API 客户可以针对部分模型自行开启 textGrain默认关闭。也就是说如果你在调 OpenAI 的 API 做产品水印不会突然冒出来影响你除非你主动开。但如果你面向欧盟用户就要关注后续的合规要求。背景是欧盟 AI 法案。法案把机器可读标识变成了合规项——AI 生成或修改的内容要用机器可读的方式标记来源。textGrain 不是技术炫技是冲着这条去的。别把水印检测当唯一判据。25% 同义词替换就让检出率掉到 17%说明它能防顺手搬运防不住认真改写。做内容审核、AIGC 识别的时候它只能算一路信号不能算结论。如果自己想做类似检测核心就是把选词偏好还原成一个统计检验。下面这段代码演示的是经典的 green-list 思路可以在本地直接跑帮你理解检测器到底在算什么importhashlibdefis_green(token:str,key:str,gamma:float0.25)-bool:# 用 密钥词 做哈希落到 [0,1) 的“绿色名单”里就记 1hint(hashlib.sha256((keytoken).encode()).hexdigest(),16)return(h/2**256)gammadefwatermark_score(tokens,key):mask[is_green(t,key)fortintokens]# 无偏文本里绿色比例 ≈ gamma带水印时显著高于 gammareturnsum(mask)/len(mask)scorewatermark_score([the,quick,brown,fox],keydemo-key)print(score)# 与 gamma 比较判断是否可疑真正的 textGrain 比这复杂得多要处理熵预算、多密钥、检测统计量但思路一脉相承在没有明显痕迹的地方找统计上的偏心。收个尾textGrain 落地这件事与其说解决了 AI 内容溯源不如说它把溯源这道题有多难变成了可以量化讨论的东西。改几个词就弱一半这正是文本水印的真实水位。以后平台再喊我们能用 AI 检测 AI 生成内容的时候你大概会多问一句误判率多少改写多少词会失效你怎么看文本水印这条路评论区聊聊。
阅读完成 · 觉得有帮助?
咨询建站