OpenAI近日公布了其应对欧盟《人工智能法案》文本溯源要求的方案。核心信息是:文本水印技术仍处于早期阶段,存在显著局限,因此OpenAI采取分阶段、区域化、研究者优先的落地策略。
三阶段落地路径
根据官方披露,OpenAI的文本溯源方案分为三个并行推进的部分:
第一,API客户全球opt-in。从公布之日起,全球API客户可以自愿选择为特定模型启用文本水印。默认关闭,客户自行决定是否将水印纳入其透明度义务。
第二,欧盟区域默认启用。未来数周内,OpenAI将为欧盟地区符合条件的ChatGPT和Codex文本输出添加不可见水印,覆盖所有套餐。官方明确表示,启动阶段不会将文本水印设为全球默认。
第三,检测器仅限研究者访问。OpenAI开放检测器申请,初期仅限经批准的研究人员和专家组织,用于评估和改进技术。检测器只报告是否检测到OpenAI水印,不识别用户、不泄露提示词或对话内容。
textGrain水印机制
OpenAI的文本水印技术名为textGrain,其原理是在模型的词汇选择中嵌入不可见的统计信号。检测器通过寻找该信号来判断一段文本是否包含OpenAI水印。
官方技术报告将随后续更新补充更多细节,并计划将技术开源。在OpenAI的评估中,textGrain的表现匹配或超过了其测试的其他方案,包括SynthID for text。
但官方同时强调:理想条件下的强性能不保证日常使用中的可靠检测。检测器存在两类错误——假阳性(无水印却报告有水印)和假阴性(有水印却未检出)。
检测能力的边界条件
官方评估数据揭示了几个关键限制:
文本长度影响检出率。 在1%目标假阳性率下,200 token段落的检出率约80%,400 token段落约95%。
内容类型影响显著。 数学类内容因词汇选择灵活性低,检出率大幅低于心理学类内容。
编辑会削弱水印。 在400 token段落中,替换10%的词汇为同义词,检出率从约92%降至66%;替换25%时降至17%。
这些限制直接解释了为何检测器初期仅限研究者访问——OpenAI需要专家帮助评估可靠性和负责任的使用方式。
水印不能告诉你什么
官方明确列出了水印信号的边界:
- 不衡量人类贡献:可指示OpenAI系统生成或处理了部分文本,但无法量化人类判断、编辑或创造力的占比。
- 不确立所有权或责任:不决定文本归属、使用合法性、是否需披露、谁负责。
- 不识别用户:不关联个人、组织、账户、提示词或对话。
- 不验证准确性:不判断内容是否真实、误导、有害或语境恰当。
- 未检测到水印不等于人类创作:文本可能过短、被编辑、被翻译、来自不支持水印的模型、早于水印功能,或由其他公司工具生成。
对输出质量的影响
OpenAI在Astra模型上对比了加水印与不加水印的基准表现。在Artificial Analysis Intelligence Index、AutomationBench、DeepSWE v1.1、Terminal-Bench 4.0、BrowseComp、HealthBench Professional、GPQA Diamond等基准上,未观察到有意义的性能差异。部分基准水印版本略高,部分略低,波动在正常范围内。
更广泛的内容溯源体系
OpenAI强调没有单一溯源技术足够,因此采取分层策略:对支持的图像输出添加Content Credentials,符合C2PA规范,在支持的图像和音频中嵌入不可见SynthID水印,并通过openai.com/verify和Content Provenance API提供图像和音频验证。
这些技术互补:Content Credentials记录文件来源和历史,不可见水印在元数据被移除后仍保留信号。文本溯源的扩展需要额外考虑文本易被改写、翻译或编辑的特性。
开发者应对建议
基于官方披露的事实,开发者可从以下角度规划:
API客户:评估自身透明度义务,决定是否opt-in。水印默认关闭,但若面向欧盟用户提供服务,需关注后续云合作伙伴的可用性。
检测能力集成:目前检测器仅限研究者,公开API尚未提供。开发者不应依赖水印检测作为唯一的内容溯源手段。
合规策略:水印不确立责任归属,也不验证准确性。AIGC标识和内容溯源需要多层机制配合,包括元数据、水印、日志和人工审核。
技术跟踪:OpenAI计划开源textGrain,并持续研究水印对编辑和翻译的鲁棒性。开发者可关注技术报告更新和开源进展,评估自建检测能力的可行性。
OpenAI表示将根据证据、标准和监管要求的变化调整方案,并在认为结果可被负责任解读时扩大检测器访问。对于中国开发者而言,欧盟的文本溯源实践提供了AIGC合规的参考样本,但需注意其技术局限和区域化策略,避免过度依赖单一水印信号。