textGrain 是 OpenAI 给文本准备的隐形水印。2026 年 10 月 5 日,OpenAI 发布欧盟文本溯源方案,宣布未来几周内为欧盟地区符合条件的 ChatGPT 和 Codex 文本输出启用 textGrain,以满足《欧盟人工智能法案》对生成内容做机器可读标记的要求;全球 API 客户即日起可为部分模型选择开启,也可以在接入时关掉,未来几周还将经 Microsoft Azure 等云伙伴提供。
记号藏在选词里,不在字符里
textGrain 不往文本里塞隐藏字符,也不在段落末尾加可见标记。它在模型生成时调整选词,把一个不可见的统计信号嵌进词与词的组合里;配套的检测器读到文本后,判断其中是否带着 OpenAI 模型的这种信号。OpenAI 特意说明了这个信号能证明什么、不能证明什么:它不识别作者、组织、账号或某次对话的来源,检测到水印也不等于文本内容准确,更不能用来判定版权归属。
官方自测数据:够长才测得准,改词就往下掉
按 OpenAI 公布的测试,在误报率目标 1% 的设置下,约 400 个 token 的心理学类段落里,水印检出率约为 95%;段落缩短到 200 个 token,检出率降到约 80%。题材的影响同样明显:数学内容的选词自由度低,同样长度下检出率只有约 60%。编辑是更大的变量——把 400 token 段落里 10% 的词换成同义词,检出率从约 92% 掉到 66%;换掉四分之一的词,只剩 17%。OpenAI 称 textGrain 在内部测试中追平或超过了 Google 的 SynthID 文本水印,并计划把这项技术开源。在前沿模型 Astra 上开启水印后,GPQA Diamond、BrowseComp、DeepSWE 等 8 项基准没有出现明显性能差异,生成速度和阅读体验也未受影响。
检测器暂时只开给获批研究者
能查水印的人,第一批只有获批的研究人员和专业机构,需要提交申请、逐案审批,依据是欧盟的《通用人工智能行为准则》。OpenAI 给出的理由很直接:检测器既可能把没带水印的文本误报,也可能漏掉带水印的文本,在结果能被负责任地解读之前,不宜直接开放给公众。检测工具本身只回答一个问题——有没有检测到 OpenAI 的水印,不显示用户身份,也不回溯提示词或对话内容。
这套做法和同行形成了鲜明对照。Anthropic 给 Claude 用的是全球范围、不可关闭的强制水印,OpenAI 则把强制范围收在欧盟的产品端,API 侧全球自愿开启。监管压力下,各家都在给文本留记号,但留给谁查、能不能关,答案完全不同。此前加州 SB 574 给 AI 立的新规走的也是同一条线:先要求可核查,再谈责任怎么分。对普通用户来说,最实际的预期管理是:欧盟用户从 ChatGPT 和 Codex 里复制出去的长文,今后可能被检测出 AI 痕迹;但短文本、翻译稿、改写过的文本测不出来,也完全正常——测不到,不等于人写的。