Claude隐形水印为何伤害创作者

封面构图,一位中文内容创作者坐在话筒前整理稿件,身后巨大的Claude文字云被半透明机器印章覆盖,左侧是人的手稿与思考路径,右侧是机器可读信号网格,形成劳动归属与AI标记的冲突,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

Anthropic要给自己输出的内容里埋入看不见的记号。这拦不住蒸馏它的那些大厂,反而是在羞辱正在努力做内容的你和我。

大家好,欢迎收听老范讲故事的YouTube频道。老范每天早晨第一件事是阅读,然后对着话筒口述,大概讲五六千字,讲我今天看到了什么、怎么想的、哪些地方拿不准。然后我把内容交给Anthropic Claude,让它核实,来回改三五版,最后拿着稿子坐在这里讲给大家听。这就是我每天的工作。

这两天我照旧这么干,中间刷到一条消息:从8月2号开始,Anthropic所有新出的Claude模型,生成的每一段文字都自带一个看不见的记号。那个瞬间,我想的不是这项技术怎么做,而是另一件事:我做的这些工作是我的,顺序是我定的,结论是我下的,最后也是我讲出来的。可是从今天开始,这整套东西出来以后,上面都盖着一个戳,叫“这是Anthropic Claude碰过的内容”。注意,不是说它生成的,而是它碰过的。

Claude给文本盖上看不见的章

一段中文文本在不同软件窗口之间被复制传递,肉眼看到的文字保持不变,机器扫描器却识别出附着其中的隐形信号,采用左右对照构图,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

先把事情讲全。Anthropic这次公告的意思是,它在自己生成的每一段文字里,埋了一个人读不出来、机器认得出来的信号。这个信号有两个关键特点。第一,读者完全感觉不到。按照Anthropic自己的说法,它不改变含义、质量和可读性。第二,它不是贴在文件外面的一张标签,而是长在文本本身里面。你复制粘贴,从一个软件搬到另一个软件,它会跟着走。公告还留了半句余地:经过一部分编辑之后,这个记号可能还在。由此看,它应该是一种统计结果。

生效范围是在8月2日之后、在欧盟发布的新Claude模型,出厂就带。这里强调欧盟,是因为欧盟法律有这个要求;但Anthropic明确说,这不是只给欧洲人用的,全世界都一样。API、Claude Code、Cowork都算,凡是Claude出来的东西都盖章。Anthropic说接下来会放出检测工具和技术细节,让第三方自行验证;到现在为止,这些细节还没有公布。

由头也很清楚,不是Anthropic自己想干,而是欧盟AI法案第50条在2026年8月2日正式执行。条文要求,凡是生成或合成音频、图像、视频、文本的AI系统,提供方必须让内容以机器可读的格式被标记出来。配套的AI生成内容透明度行为准则在6月10日发布,到7月底大概有190家签署。

下面要回答三个问题:这个记号能不能拦住蒸馏,它到底怎么埋进去,以及既然它拦不住蒸馏,真正拦住的到底是谁。为什么我说,我们这些用Claude认认真真做内容的人被它羞辱了?

水印为什么拦不住工业化蒸馏

大型数据工厂把成批对话文本送入清洗、去重、改写和筛选四道传送带,入口文本带有隐形印记,出口印记被流程冲散,突出工业化数据处理而非具体数据,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

首先必须讲清楚,这个记号拦不住蒸馏。说到Anthropic,大家总想到这是那个喊自己被人蒸馏的公司。今年2月,它公布了三家中国公司:深度求索、月之暗面、MiniMax,说对方用了2.4万个虚假账号,进行超过1,600万次交互,把Claude的能力抽取出来,喂养自己的模型。紧接着又来了一个更大的案例:阿里通义千问实验室用了2.5万个虚拟账号、2,880万次交互,集中在今年4月至6月前后的6周,换算下来平均每天68万次。68万次是什么概念?就像一个中等城市全城的人从早到晚不干别的,全都去和Anthropic Claude聊天。这已经不是偷偷抄作业,而是工业化生产。

所以Anthropic说要给输出加标记,很多人的第一反应是:这下看谁还敢蒸馏,以后不用追问内容是谁做的,拿出来一查就知道是不是Anthropic家的。比如以后拿千问的内容去查,看看是不是Anthropic的,一查就能坐实。这个想法其实不可能实现。

这些信号有一个死穴。Anthropic自己在帮助文档里写得很清楚:经过大幅改写、大量编辑、翻译,或者与别的文字混合以后,信号可能检测不到;文本太短也检测不到。学术界的实测更狠,只要做一遍保持原意的改写,意思不变,但重新组织句子,几乎所有可检测的记号就都没有了。

蒸馏拿几千万次交互抽出的数据回来,是当训练材料用的。训练材料要清洗、去重、改格式、过质量筛选,很多流程本身就会顺手把文字重写一遍。埋在文字里的记号,在数据清洗时就被洗掉了。再往后一层,即使记号侥幸存活并进入训练数据,模型学完以后再生成新内容,记号还在不在?我的判断是基本不可能。模型学的是词与词之间的关系,模仿的是Claude的语气和思路,不是复刻Claude每一次选词的概率。原料里下的料,炖成汤之后就尝不出来了。

还有最要命、也最讽刺的一层:Anthropic现在抓蒸馏,靠的根本不是水印,而是行为分析。它自己讲得很明白,同一个提示词在几百个协同账号上反复出现几万次,而且都冲着同一项能力,这是统计学上极其扎眼的行为特征。辅助信号包括流量时间高度同步,账号之间有负载均衡痕迹,也就是每个账号问的问题数量差不多,不会有的特别重、有的特别轻;此外还有相同的支付方式和IP地址,甚至提供账号的服务商会向Anthropic提交证据。

这一串线索里,没有一样与输出文字有关。抓住2.5万个账号,靠的是共同付款方式和共同IP地址,不是那批内容里有什么标记。所以这个记号真正的用途,我的判断很直接:它不是用来抓大厂的,而是拿去交作业的,作业交给欧盟第50条。

四种标识不是一回事

四个并列展台分别展示肉眼可见标签、藏在文字里的隐形水印、因用户而异的文档指纹、附在媒体文件上的来源凭证,用图标和空间差异表达概念分类,不显示具体数值,不标注具体日期,浅色背景的商业评论版橡皮泥平面信息图的统一风格。只展示以上文字与概念,不补充其他数字、日期、比例、排名或因果关系。

下一个问题是,记号到底怎么埋进去。先把几个常被混用的名词分清楚,市面上被混着叫的是四种不同的东西。

第一种叫显式标识,人眼能看见。比如Nano Banana生成的图片,右下角有一个菱形星星;豆包生成的图片上有“豆包生成”字样;用Seedream生成的图片,左上角会有一个半透明小框,写着“AI生成”。这些都叫显式标识。

第二种叫隐形水印,人读不出来、机器认得出来,长在内容本身里面。Anthropic现在做的就是这件事。

第三种叫指纹。指纹和水印都不能被人直接读出,但两者有一个巨大差异:水印对所有人都一样,只是盖一个“这个东西我摸过了”的戳;指纹则是每一份文档里的信息都不一样,能够识别这份文档或图片到底是谁生成的。

以前我在盛大时,起点中文的小说为了防盗版就会加指纹信息。怎么加?“的地得”这些字,平时阅读时就算写错了,人们也不太注意,于是可以在里面做一套统计结果。只要文本符合某种统计分布,就能认定它从特定账号泄露出去。当时只要抓到有人把起点中文输出成图片的VIP章节传出去,就封他的账号。

第四种叫来源凭证,也就是C2PA。它通常写在图片、视频或音频里,因为这些文件信息量大,而且有文件头。文件开头可以记录作品是谁制作的、由什么设备产生。比如照片的文件头里,通常可以记录相机、光圈、快门、GPS位置和日期等信息。这就是C2PA。不过,这部分很容易被抹掉,而且C2PA里也会记录“你是谁”,这一点一定要注意。

隐形水印如何藏进选词概率

大模型像摇号机一样从候选词卡中逐个挑词,一张暗表悄悄给部分可用词卡加权,最终句子保持通顺,旁边机器扫描器依据分布识别信号,不显示具体比例,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

名词分清以后,再说Anthropic的隐形水印怎么埋。它自己的细节尚未公布,但这条技术路线在业内是公开的。谷歌两年前已经把整套方案写在《自然》上,叫SynthID-Text,并且已经在Gemini上运行。

把原理讲成人话:大模型写字,是一个字一个字往外蹦。每蹦一个字之前,手里有一个巨大的候选字表,每个字都有一个概率,这个过程就像摇号。概率高的字中签多一些,概率低的字中签少一些。

水印的做法,是在摇号之前,按照一张只有模型公司知道的暗表,给一半候选字偷偷加分,让这些字更容易被选中。这一半的字本身也是可用的,放进句子里仍然通顺,所以读起来并不别扭。它没有改变内容和逻辑,改的是挑字时的概率,这就是它为什么敢说不影响含义、质量和可读性。

检测时,把整段话对照暗表数一遍。如果中签的字里,属于暗表的占一半左右,那可能是正常人写的;如果百分之八九十都在表里,那就不是巧合,可以认定是Anthropic生成的。这就是它做标记与检测的大致方式。

有人会问,会不会采用更硬核的日志比对技术?Anthropic有生成日志,直接把外部文本与后台日志比对,不就能认出来了吗?这种方法在学术上也有名字,叫检索式检测。2023年NeurIPS有一篇论文,结论很有意思:所有防御手段中,只有它扛得住改写,因为它比对的是语义相似度,不是文字记号。

但它有一个硬条件:模型方必须把自己生成过的每句话全部存进数据库,每来一段文字,就去库里搜索一次。这件事全世界只有模型方自己能做。Anthropic会不会用这种方式?大概率不会,原因不在技术,而在它自己的承诺。不参与训练的对话默认保留30天;同意参与训练的内容,去标识化后最长保留5年;用户手动删除的内容,后台最多再留30天。

它不是造不出一把撬不开的锁,而是早已答应客人不留钥匙。所以,Anthropic在“更管用”和“更守规矩”之间选择了更守规矩。至少以它现在的人设,这个承诺还是要遵守。但代价是,它选择的这把锁,从一开始就是给守规矩的人用的;真想撬锁的人,过一道改写就走了。

监管、商业选择与开源缺口

三岔路口分别通向法条文件、平台标签和本地开源模型,云端模型被规则围栏约束,本地电脑上的开源模型穿过未封闭缺口,呈现不同治理路径,不标注具体日期,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

既然欧盟有要求,其他公司是什么情况?为什么只有Anthropic喊得这么响?欧盟的透明准则到7月底大概有190多家签署,模型提供方名单里包括Anthropic、谷歌、Meta、微软、Mistral、OpenAI;xAI拒绝签字。这份准则名义上自愿,但“自愿”要打引号:不签的话,第50条到期后就得自己想办法自证清白。

Anthropic签得最早、做得最全、喊得最响,因为在我看来,“我最守规矩”就是它在这条赛道上唯一能拿出来卖的东西。Anthropic这帮人最圣母、最白左。

再看OpenAI,这个例子最能说明问题。它手里早就有这项并不复杂的技术。2024年8月,《华尔街日报》报道过,方案可靠性达到99.9%,但内部争论接近两年,一直没有发布。为什么?OpenAI做过用户调研,大约30%的用户表示,如果ChatGPT加水印,他们就不用了;69%的用户担心水印不可靠,导致自己被冤枉。三成用户说“你上了我就走”,这个数字摆上任何会议桌,事情都没得讨论。于是一个号称99.9%可靠的东西,在抽屉里躺了两年。

OpenAI还公开承认两个顾虑。第一,水印容易被绕过,把文字用谷歌翻译翻出去再翻回来,记号就没了。第二,它可能对非英语母语者造成不成比例的影响。

再看中国。《人工智能生成合成内容标识办法》在去年9月1日施行,由四个部门联合发布,文本也在管理范围内。但它对文本的要求是显式标识加元数据,没有要求把记号埋进文本本身。一个管渠道,一个管源头。管渠道的办法,只需从对话框复制粘贴一次,就可能绕过去。

还有一条能把上述办法全部废掉的路:开源。阿里8月3日发布Qwen3.8,总参数量2.4万亿,同时说Qwen3.8-Max和Qwen3.8-27B下周就要开源。开源意味着权重在自己的硬盘上,模型跑在自己的机器上,摇号过程想怎么改就怎么改。加水印的前提是模型在人家手里运行,一旦模型跑到自己手里,这个前提就没了。

欧盟用法条压着,中国用平台标签盖着,而开源这条路上什么都没有。这个记号从落地第一天起就露着一个大口子,而且口子会越开越大,因为它真的很反人性。

说到这里,我仍然要强调,我觉得自己被它羞辱了。这个标记到底拦住了谁?不是那些做蒸馏的大厂,而是你我这样用Anthropic Claude认真做内容的人,是拿它干活的普通人。而且事情已经发生。

真人创作者也会被平台误伤

真人财经主播站在镜头和财报资料前,频道变现开关被平台机械臂关闭,旁边举报气泡与模糊算法分类框共同施压,强调真人劳动与机器误判的冲突,不展示数字或日期,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

8月6日,一个我经常看的中文财经频道被YouTube判定为AI违规内容,直接停止变现。博主叫Allon Chen,做了700多条视频,真人出镜,真脸真声音,从头到尾都是他自己。他的内容质量很高,风趣幽默,也很耐心地读财报。我相信他使用AI的比例可能比我高,因为读财报很累。他专门录了一条视频解释前因后果,我当天在X上看到了。他说频道被直接停止变现,所有内容仍然公开,只是不再给他变现。他也做了一条视频自证清白,但到当时为止播放量是零。

他是不是用AI做内容?肯定用。现在谁在内容生产过程中不用AI?而且他可能比我用得更多。他的背景是固定的AI图片面板,不像我,后面的背景虽然也是AI图片,但每期都会换。他的视频里也会放AI生成的图片。Nano Banana时期质量稍差,图片里会有错字和数据错误;到GPT Image 2,质量提升很多,但仍可能出错。可这些是否足以把他的内容判定为垃圾?远远不够。

他为什么被拎出来?YouTube在7月16日推出新政策,专门打击非真实内容,列出三类不能变现的内容:模板化批量视频、故意制造恐惧骗点击的视频、使用AI虚拟形象讨论健康或金融等敏感话题的视频。而且执行是在频道层级,不是掐掉某一条视频,而是一次取消整个频道的变现资格。

问题就在这里。这三类主要针对AI假人讲股票,他却是真人讲股票。分类本身没毛病,出问题的是负责判断“你属于哪一类”的机器。分类是对的,标识是错的,代价是700多条视频不能变现,而他有26万粉丝。

我还要给出一个更不客气的推论:我不认为他是被算法自动检测出来的,因为我自己就是活着的反证。老范上传过大量纯AI生成的短视频,画面上还挂着巨大的悬浮水印,晃来晃去写着“即梦AI生成的内容”。一开始我没有主动标识,YouTube能认出多少?大概10条里认出一条。一个连自带显式水印的纯AI视频都只能识别1/10的系统,想让它精准揪出一个真人出镜的财经频道,不太现实。

那它靠什么?我的判断是靠人。评论区里一定有很多人喊“这是AI读稿”,也一定有很多人举报。算法判断内容是不是像人,有一定能力,但没那么准;数一数有多少人在骂、多少人在举报,平台却很熟,这是最偷懒、最高效、最准确的办法。

我记得以前谷歌在台湾有一个商务人员,专门判断哪些人在谷歌平台作弊,他一点技术都不懂。后来谷歌在美国的技术人员问他,为什么判断得这么准,技术团队都判断不了。他说很简单,看有没有人举报。举报的人是谁?竞争对手。最了解你的永远是你的敌人。这句话让技术人员哑口无言。

Allon Chen恰好站在两拨最有动机按举报按钮的人中间。一拨是搬运他内容的机构号,他举报过对方。那些机构对举报系统的运作方式,可能比个人自媒体更清楚,反手一记举报,就可能直接把他摁在那里。另一拨是听了他的判断去买股票、后来赔钱的人。他每天鼓吹别人买SpaceX、买特斯拉,最近回调,肯定会有人心存怨怼。

做财经这条赛道,同一句话放在我身上最多是个乐子,放在他身上就可能被视作实打实的投资意见和建议。所以我每次在频道后面都说,我确实讲了股票,但不构成具体投资意见和建议,赚了是你的,赔了也别来骂我。可他就是财经博主,情况不一样。在这次谷歌整治过程中,财经和健康属于重灾区,原因很简单:怕有人喊单,怕有人做老鼠仓。

这里也要讲我很早就在做的一件事:评论区里凡是喊“AI内容”“AI读稿”的,一律删除屏蔽。当时很多人说老范怎么这么小气,现在回头看,是不是很有先见之明?

至于申诉,Allon Chen说中文内容只有一次申诉机会,用完就没了。我看了YouTube公开规则:申诉窗口是7至21天,14天内回复;停止90天后,可以重新申请变现。规则里没有任何一条按照中文内容分配申诉次数。若真这么做,对中文创作者来说算歧视,可以去告它。规则写在纸上是一套,具体执行又是一套,其中肯定有一部分玄学。以YouTube的速度,这件事想翻过去,我估计得一两个月。

这就是今天平台判断AI的真实状态。标准中肯定有一部分隐藏内容,因为真把标准说清楚,大家就会对症下药,所以平台不可能说得特别明白。而且申诉量与最终处理和审核的人数绝对不成比例:人非常少,申诉量巨大,处理肯定很慢。如果机器无法自动判断,就只能慢慢等,当然也不是说申诉完全没用。

AI检测把概率问题变成处罚依据

一台AI检测仪把不同语言背景的写作者稿件送入同一入口,却输出明显偏斜的警报标签,旁边旧文献也被错误盖上AI章,突出检测偏见与荒谬误判,不展示具体统计值,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

平台检测器不准吗?对,一直就没准过。斯坦福在2023年用7个主流检测器测试托福作文,非英语母语者写的作文有61.3%被判断为AI生成,母语写作者的误判率是3.2%。同一批检测器、同一套标准,误判率相差接近20倍。原因是第二语言学习者的句子更简单、用词更常见、俚语更少,而这正好是检测器眼中“AI味”的全部特征。你越老老实实按照语法写,就越像机器。

更荒唐的是,有人拿检测器测试1787年的美国宪法,判定96.21%由AI生成;测试《创世记》片段,判定88.2%由AI生成。为什么?因为AI就是拿这些东西训练出来的,它最后说出来的话长得像训练材料,本来就顺理成章。现在有25所以上的大学已经禁用或限用AI检测器,这一点非常重要。但这件事仍相对滞后,还有不少大学和老师坚持使用AI检测器,一发现系统说是AI,就直接把学生请出去,不听解释。

Anthropic的记号来了,它比检测器强在哪里?强在它不是猜的。这个记号可以非常精准地判断内容是不是从它家模型输出,把一个概率问题变成是非题。但这也更过分,因为检测结果并不说明创作者付出了多少努力,也不说明Anthropic是否只负责最后一小部分工作。它只是盖一个“这个东西我摸过了”的戳。

为什么只能叫“摸过了”?因为最后一遍文字是它输出的。输出时,它按照自己的隐形词表,提高某些词出现的频率。现在还有人说,一篇内容里用了“不是……而是……”,就一定是AI稿,这种判断太简单,真实的水印检测并不是这么做的。

Anthropic这套东西就像门禁卡系统,认卡不认人。有卡就能进去,哪怕卡是偷来的,或者第一天刚领到;但一个人在楼里住了10年,今天没带卡,也照样不让进。它就是这样运作的。

真正应该提供的是分级系统,能够判断多大比例由Anthropic生成。到底是一句话直接生成,还是像老范这样,先给它几千字稿件,再让它进行哪些搜索、按什么要求整理?应该把参与方式表达出来。就像写论文有许多作者,每个作者的作用不同。Anthropic却只上来盖一个“我摸过了”的章,这就是对所有人劳动的羞辱。

创作者如何应对水印与标注

创作者在工作台前先读懂稿件再合上屏幕对着话筒自由讲述,另一侧本地开源模型帮助按个人语言习惯重写,上传界面主动勾选AI内容标注,三段式行动构图,不展示具体参数,浅色背景的商业评论版橡皮泥平面信息图的统一风格。

接下来怎么办?水印既然已经推出,我可能还是要继续用。虽然觉得被羞辱,但Anthropic整理内容的能力确实比GPT强很多,现在就是最强的,没有之一,只能捏着鼻子用。这里给大家两条建议。

第一,别念,要讲。Anthropic整理完以后,先读,读到自己懂了,然后合上稿子,用自己的话再讲一遍。注意,是讲,不是念。在讲的过程中,我们会用自己的口头语言替换Anthropic塞进去的词。普通人不可能照着它的概率一模一样地输出,所以不要背稿,不要读逐字稿,而要讲这个故事。像我现在面前也有稿,但肯定不会一个字不差地照着念。这样就能把预埋的信息洗掉。

还有一种更折腾的办法,是在本地部署开源小模型,比如Qwen3.8-27B。当时它这周还没有发布,应该快了。甚至可以对小模型做一些微调,让它学习自己的行文习惯,最后用Qwen3.8-27B把稿件再处理一遍,在不影响逻辑和顺序的情况下整体重写,水印就能洗干净。

第二,AI内容由自己老老实实标注。老范那些短视频本来就是纯AI生成,由Seedance 2.0制作。之前我确实没有标,因为标记入口藏在需要展开的菜单里,不展开就看不见。后来被提醒几次以后,我现在上传所有AI生成短视频时都会主动标记“这是AI生成的”。我发现标注后,播放量和变现都没什么变化,不会因为标了AI就不推荐,也不会因此减少变现。所以,该标就标,这才是正确的做法。

推荐算法和识别算法本身没有那么聪明。所有不那么聪明的算法和人都有一个特点,就是自卑。自卑的体现是,一旦发现你骗它,或者它怀疑你骗了它,就会歇斯底里地处罚你,前面Allon Chen的案例就是如此。

最后总结,Anthropic现在这套标记系统,就是对做内容的人一次赤裸裸的羞辱。它把所有经过自己手的内容不分青红皂白盖上“我摸过了”的戳,甚至不能说它生成过,因为它无法标识其中创作者到底付出了多少努力。

真正的解法,是对AI参与度进行分级。如果Anthropic没有这个能力,就请把这套垃圾收回去。如果它实在不愿意收回去,我们只能继续寻找替代方案。

今天的故事就讲到这里。感谢大家收听,请帮忙点赞、点小铃铛、参加Discord讨论群,也欢迎有兴趣、有能力的朋友加入付费频道。再见。


背景图片