最严肃的水印工作是 Google DeepMind 的 SynthID,它把人眼不可见的信号直接嵌入 AI 生成的图像、音频、视频和文本。对媒体它确实健壮:Google 设计它扛过裁剪、滤镜、帧率变化和有损压缩,这意味着它通常能扛过杀死一切元数据手段的那个截图。对文本,它靠在生成时微调选词工作,更聪明但更脆:织进选词的水印扛不住有人改写那段话。
漏报本来可以忍,要是误报罕见的话。误报不罕见,而且分布不均。一项斯坦福研究把作文过了七个 AI 检测器:美国出生八年级学生的写作几乎全过,而非英语母语者超过 61% 的作文被标为 AI 生成,其中 97% 至少触发一个检测器。原因是结构性的,不是 bug:检测器标记可预测、朴素的措辞,而这正是人用第二语言写作的样子。研究者还展示了简单提示花招就能把生成文本溜过同一批工具,所以检测器漏掉作弊者、标记诚实者。
上面每次失败的主线:对成品的检查弱,创作时附的证据强。这也是监管推动的方向。欧盟 AI 法案第 50 条已适用,要求生成式系统提供商以机器可读方式标记输出为人工生成,要求部署者披露深度伪造。同一条要求聊天机器人在不明显时告诉你你在和机器说话,并把艺术和讽刺作品排除在外,后者只需承认操纵存在,而不是把标签糊满作品。这些都拦不住截图或笔记本上的开源模型,但它把默认从"除非有人费事否则不标记"推向"除非有人剥掉否则标记",并把责任放到附标记的公司身上,而不是找标记的读者身上。
新默认已经在厂商文档里可见。比如 Anthropic 开始标记 Claude 的输出:生成文本里一个不可感知的水印,加图像文件上的 C2PA 元数据,跨它的 App、API 和云伙伴。但读那个页面的局限部分,因为它就是本文一直在建的那张清单:标记会因重度编辑、截图、格式转换消失,短段落可能没有足够文本可标,而没有标记证明不了任何来源。当附标记的厂商自己先讲这些告诫时,信它们。