
Anthropic要给自己输出的内容里埋入看不见的记号。这拦不住蒸馏它的那些大厂,反而是在羞辱正在努力做内容的你和我。
大家好,欢迎收听老范讲故事的YouTube频道。老范每天早晨第一件事是阅读,然后对着话筒口述,大概讲五六千字,讲我今天看到了什么、怎么想的、哪些地方拿不准。然后我把内容交给Anthropic Claude,让它核实,来回改三五版,最后拿着稿子坐在这里讲给大家听。这就是我每天的工作。
这两天我照旧这么干,中间刷到一条消息:从8月2号开始,Anthropic所有新出的Claude模型,生成的每一段文字都自带一个看不见的记号。那个瞬间,我想的不是这项技术怎么做,而是另一件事:我做的这些工作是我的,顺序是我定的,结论是我下的,最后也是我讲出来的。可是从今天开始,这整套东西出来以后,上面都盖着一个戳,叫“这是Anthropic Claude碰过的内容”。注意,不是说它生成的,而是它碰过的。
Claude给文本盖上看不见的章

先把事情讲全。Anthropic这次公告的意思是,它在自己生成的每一段文字里,埋了一个人读不出来、机器认得出来的信号。这个信号有两个关键特点。第一,读者完全感觉不到。按照Anthropic自己的说法,它不改变含义、质量和可读性。第二,它不是贴在文件外面的一张标签,而是长在文本本身里面。你复制粘贴,从一个软件搬到另一个软件,它会跟着走。公告还留了半句余地:经过一部分编辑之后,这个记号可能还在。由此看,它应该是一种统计结果。
生效范围是在8月2日之后、在欧盟发布的新Claude模型,出厂就带。这里强调欧盟,是因为欧盟法律有这个要求;但Anthropic明确说,这不是只给欧洲人用的,全世界都一样。API、Claude Code、Cowork都算,凡是Claude出来的东西都盖章。Anthropic说接下来会放出检测工具和技术细节,让第三方自行验证;到现在为止,这些细节还没有公布。
由头也很清楚,不是Anthropic自己想干,而是欧盟AI法案第50条在2026年8月2日正式执行。条文要求,凡是生成或合成音频、图像、视频、文本的AI系统,提供方必须让内容以机器可读的格式被标记出来。配套的AI生成内容透明度行为准则在6月10日发布,到7月底大概有190家签署。
下面要回答三个问题:这个记号能不能拦住蒸馏,它到底怎么埋进去,以及既然它拦不住蒸馏,真正拦住的到底是谁。为什么我说,我们这些用Claude认认真真做内容的人被它羞辱了?
水印为什么拦不住工业化蒸馏

首先必须讲清楚,这个记号拦不住蒸馏。说到Anthropic,大家总想到这是那个喊自己被人蒸馏的公司。今年2月,它公布了三家中国公司:深度求索、月之暗面、MiniMax,说对方用了2.4万个虚假账号,进行超过1,600万次交互,把Claude的能力抽取出来,喂养自己的模型。紧接着又来了一个更大的案例:阿里通义千问实验室用了2.5万个虚拟账号、2,880万次交互,集中在今年4月至6月前后的6周,换算下来平均每天68万次。68万次是什么概念?就像一个中等城市全城的人从早到晚不干别的,全都去和Anthropic Claude聊天。这已经不是偷偷抄作业,而是工业化生产。
所以Anthropic说要给输出加标记,很多人的第一反应是:这下看谁还敢蒸馏,以后不用追问内容是谁做的,拿出来一查就知道是不是Anthropic家的。比如以后拿千问的内容去查,看看是不是Anthropic的,一查就能坐实。这个想法其实不可能实现。
这些信号有一个死穴。Anthropic自己在帮助文档里写得很清楚:经过大幅改写、大量编辑、翻译,或者与别的文字混合以后,信号可能检测不到;文本太短也检测不到。学术界的实测更狠,只要做一遍保持原意的改写,意思不变,但重新组织句子,几乎所有可检测的记号就都没有了。
蒸馏拿几千万次交互抽出的数据回来,是当训练材料用的。训练材料要清洗、去重、改格式、过质量筛选,很多流程本身就会顺手把文字重写一遍。埋在文字里的记号,在数据清洗时就被洗掉了。再往后一层,即使记号侥幸存活并进入训练数据,模型学完以后再生成新内容,记号还在不在?我的判断是基本不可能。模型学的是词与词之间的关系,模仿的是Claude的语气和思路,不是复刻Claude每一次选词的概率。原料里下的料,炖成汤之后就尝不出来了。
还有最要命、也最讽刺的一层:Anthropic现在抓蒸馏,靠的根本不是水印,而是行为分析。它自己讲得很明白,同一个提示词在几百个协同账号上反复出现几万次,而且都冲着同一项能力,这是统计学上极其扎眼的行为特征。辅助信号包括流量时间高度同步,账号之间有负载均衡痕迹,也就是每个账号问的问题数量差不多,不会有的特别重、有的特别轻;此外还有相同的支付方式和IP地址,甚至提供账号的服务商会向Anthropic提交证据。
这一串线索里,没有一样与输出文字有关。抓住2.5万个账号,靠的是共同付款方式和共同IP地址,不是那批内容里有什么标记。所以这个记号真正的用途,我的判断很直接:它不是用来抓大厂的,而是拿去交作业的,作业交给欧盟第50条。
四种标识不是一回事

下一个问题是,记号到底怎么埋进去。先把几个常被混用的名词分清楚,市面上被混着叫的是四种不同的东西。
第一种叫显式标识,人眼能看见。比如Nano Banana生成的图片,右下角有一个菱形星星;豆包生成的图片上有“豆包生成”字样;用Seedream生成的图片,左上角会有一个半透明小框,写着“AI生成”。这些都叫显式标识。
第二种叫隐形水印,人读不出来、机器认得出来,长在内容本身里面。Anthropic现在做的就是这件事。
第三种叫指纹。指纹和水印都不能被人直接读出,但两者有一个巨大差异:水印对所有人都一样,只是盖一个“这个东西我摸过了”的戳;指纹则是每一份文档里的信息都不一样,能够识别这份文档或图片到底是谁生成的。
以前我在盛大时,起点中文的小说为了防盗版就会加指纹信息。怎么加?“的地得”这些字,平时阅读时就算写错了,人们也不太注意,于是可以在里面做一套统计结果。只要文本符合某种统计分布,就能认定它从特定账号泄露出去。当时只要抓到有人把起点中文输出成图片的VIP章节传出去,就封他的账号。
第四种叫来源凭证,也就是C2PA。它通常写在图片、视频或音频里,因为这些文件信息量大,而且有文件头。文件开头可以记录作品是谁制作的、由什么设备产生。比如照片的文件头里,通常可以记录相机、光圈、快门、GPS位置和日期等信息。这就是C2PA。不过,这部分很容易被抹掉,而且C2PA里也会记录“你是谁”,这一点一定要注意。
隐形水印如何藏进选词概率

名词分清以后,再说Anthropic的隐形水印怎么埋。它自己的细节尚未公布,但这条技术路线在业内是公开的。谷歌两年前已经把整套方案写在《自然》上,叫SynthID-Text,并且已经在Gemini上运行。
把原理讲成人话:大模型写字,是一个字一个字往外蹦。每蹦一个字之前,手里有一个巨大的候选字表,每个字都有一个概率,这个过程就像摇号。概率高的字中签多一些,概率低的字中签少一些。
水印的做法,是在摇号之前,按照一张只有模型公司知道的暗表,给一半候选字偷偷加分,让这些字更容易被选中。这一半的字本身也是可用的,放进句子里仍然通顺,所以读起来并不别扭。它没有改变内容和逻辑,改的是挑字时的概率,这就是它为什么敢说不影响含义、质量和可读性。
检测时,把整段话对照暗表数一遍。如果中签的字里,属于暗表的占一半左右,那可能是正常人写的;如果百分之八九十都在表里,那就不是巧合,可以认定是Anthropic生成的。这就是它做标记与检测的大致方式。
有人会问,会不会采用更硬核的日志比对技术?Anthropic有生成日志,直接把外部文本与后台日志比对,不就能认出来了吗?这种方法在学术上也有名字,叫检索式检测。2023年NeurIPS有一篇论文,结论很有意思:所有防御手段中,只有它扛得住改写,因为它比对的是语义相似度,不是文字记号。
但它有一个硬条件:模型方必须把自己生成过的每句话全部存进数据库,每来一段文字,就去库里搜索一次。这件事全世界只有模型方自己能做。Anthropic会不会用这种方式?大概率不会,原因不在技术,而在它自己的承诺。不参与训练的对话默认保留30天;同意参与训练的内容,去标识化后最长保留5年;用户手动删除的内容,后台最多再留30天。
它不是造不出一把撬不开的锁,而是早已答应客人不留钥匙。所以,Anthropic在“更管用”和“更守规矩”之间选择了更守规矩。至少以它现在的人设,这个承诺还是要遵守。但代价是,它选择的这把锁,从一开始就是给守规矩的人用的;真想撬锁的人,过一道改写就走了。
监管、商业选择与开源缺口

既然欧盟有要求,其他公司是什么情况?为什么只有Anthropic喊得这么响?欧盟的透明准则到7月底大概有190多家签署,模型提供方名单里包括Anthropic、谷歌、Meta、微软、Mistral、OpenAI;xAI拒绝签字。这份准则名义上自愿,但“自愿”要打引号:不签的话,第50条到期后就得自己想办法自证清白。
Anthropic签得最早、做得最全、喊得最响,因为在我看来,“我最守规矩”就是它在这条赛道上唯一能拿出来卖的东西。Anthropic这帮人最圣母、最白左。
再看OpenAI,这个例子最能说明问题。它手里早就有这项并不复杂的技术。2024年8月,《华尔街日报》报道过,方案可靠性达到99.9%,但内部争论接近两年,一直没有发布。为什么?OpenAI做过用户调研,大约30%的用户表示,如果ChatGPT加水印,他们就不用了;69%的用户担心水印不可靠,导致自己被冤枉。三成用户说“你上了我就走”,这个数字摆上任何会议桌,事情都没得讨论。于是一个号称99.9%可靠的东西,在抽屉里躺了两年。
OpenAI还公开承认两个顾虑。第一,水印容易被绕过,把文字用谷歌翻译翻出去再翻回来,记号就没了。第二,它可能对非英语母语者造成不成比例的影响。
再看中国。《人工智能生成合成内容标识办法》在去年9月1日施行,由四个部门联合发布,文本也在管理范围内。但它对文本的要求是显式标识加元数据,没有要求把记号埋进文本本身。一个管渠道,一个管源头。管渠道的办法,只需从对话框复制粘贴一次,就可能绕过去。
还有一条能把上述办法全部废掉的路:开源。阿里8月3日发布Qwen3.8,总参数量2.4万亿,同时说Qwen3.8-Max和Qwen3.8-27B下周就要开源。开源意味着权重在自己的硬盘上,模型跑在自己的机器上,摇号过程想怎么改就怎么改。加水印的前提是模型在人家手里运行,一旦模型跑到自己手里,这个前提就没了。
欧盟用法条压着,中国用平台标签盖着,而开源这条路上什么都没有。这个记号从落地第一天起就露着一个大口子,而且口子会越开越大,因为它真的很反人性。
说到这里,我仍然要强调,我觉得自己被它羞辱了。这个标记到底拦住了谁?不是那些做蒸馏的大厂,而是你我这样用Anthropic Claude认真做内容的人,是拿它干活的普通人。而且事情已经发生。
真人创作者也会被平台误伤

8月6日,一个我经常看的中文财经频道被YouTube判定为AI违规内容,直接停止变现。博主叫Allon Chen,做了700多条视频,真人出镜,真脸真声音,从头到尾都是他自己。他的内容质量很高,风趣幽默,也很耐心地读财报。我相信他使用AI的比例可能比我高,因为读财报很累。他专门录了一条视频解释前因后果,我当天在X上看到了。他说频道被直接停止变现,所有内容仍然公开,只是不再给他变现。他也做了一条视频自证清白,但到当时为止播放量是零。
他是不是用AI做内容?肯定用。现在谁在内容生产过程中不用AI?而且他可能比我用得更多。他的背景是固定的AI图片面板,不像我,后面的背景虽然也是AI图片,但每期都会换。他的视频里也会放AI生成的图片。Nano Banana时期质量稍差,图片里会有错字和数据错误;到GPT Image 2,质量提升很多,但仍可能出错。可这些是否足以把他的内容判定为垃圾?远远不够。
他为什么被拎出来?YouTube在7月16日推出新政策,专门打击非真实内容,列出三类不能变现的内容:模板化批量视频、故意制造恐惧骗点击的视频、使用AI虚拟形象讨论健康或金融等敏感话题的视频。而且执行是在频道层级,不是掐掉某一条视频,而是一次取消整个频道的变现资格。
问题就在这里。这三类主要针对AI假人讲股票,他却是真人讲股票。分类本身没毛病,出问题的是负责判断“你属于哪一类”的机器。分类是对的,标识是错的,代价是700多条视频不能变现,而他有26万粉丝。
我还要给出一个更不客气的推论:我不认为他是被算法自动检测出来的,因为我自己就是活着的反证。老范上传过大量纯AI生成的短视频,画面上还挂着巨大的悬浮水印,晃来晃去写着“即梦AI生成的内容”。一开始我没有主动标识,YouTube能认出多少?大概10条里认出一条。一个连自带显式水印的纯AI视频都只能识别1/10的系统,想让它精准揪出一个真人出镜的财经频道,不太现实。
那它靠什么?我的判断是靠人。评论区里一定有很多人喊“这是AI读稿”,也一定有很多人举报。算法判断内容是不是像人,有一定能力,但没那么准;数一数有多少人在骂、多少人在举报,平台却很熟,这是最偷懒、最高效、最准确的办法。
我记得以前谷歌在台湾有一个商务人员,专门判断哪些人在谷歌平台作弊,他一点技术都不懂。后来谷歌在美国的技术人员问他,为什么判断得这么准,技术团队都判断不了。他说很简单,看有没有人举报。举报的人是谁?竞争对手。最了解你的永远是你的敌人。这句话让技术人员哑口无言。
Allon Chen恰好站在两拨最有动机按举报按钮的人中间。一拨是搬运他内容的机构号,他举报过对方。那些机构对举报系统的运作方式,可能比个人自媒体更清楚,反手一记举报,就可能直接把他摁在那里。另一拨是听了他的判断去买股票、后来赔钱的人。他每天鼓吹别人买SpaceX、买特斯拉,最近回调,肯定会有人心存怨怼。
做财经这条赛道,同一句话放在我身上最多是个乐子,放在他身上就可能被视作实打实的投资意见和建议。所以我每次在频道后面都说,我确实讲了股票,但不构成具体投资意见和建议,赚了是你的,赔了也别来骂我。可他就是财经博主,情况不一样。在这次谷歌整治过程中,财经和健康属于重灾区,原因很简单:怕有人喊单,怕有人做老鼠仓。
这里也要讲我很早就在做的一件事:评论区里凡是喊“AI内容”“AI读稿”的,一律删除屏蔽。当时很多人说老范怎么这么小气,现在回头看,是不是很有先见之明?
至于申诉,Allon Chen说中文内容只有一次申诉机会,用完就没了。我看了YouTube公开规则:申诉窗口是7至21天,14天内回复;停止90天后,可以重新申请变现。规则里没有任何一条按照中文内容分配申诉次数。若真这么做,对中文创作者来说算歧视,可以去告它。规则写在纸上是一套,具体执行又是一套,其中肯定有一部分玄学。以YouTube的速度,这件事想翻过去,我估计得一两个月。
这就是今天平台判断AI的真实状态。标准中肯定有一部分隐藏内容,因为真把标准说清楚,大家就会对症下药,所以平台不可能说得特别明白。而且申诉量与最终处理和审核的人数绝对不成比例:人非常少,申诉量巨大,处理肯定很慢。如果机器无法自动判断,就只能慢慢等,当然也不是说申诉完全没用。
AI检测把概率问题变成处罚依据

平台检测器不准吗?对,一直就没准过。斯坦福在2023年用7个主流检测器测试托福作文,非英语母语者写的作文有61.3%被判断为AI生成,母语写作者的误判率是3.2%。同一批检测器、同一套标准,误判率相差接近20倍。原因是第二语言学习者的句子更简单、用词更常见、俚语更少,而这正好是检测器眼中“AI味”的全部特征。你越老老实实按照语法写,就越像机器。
更荒唐的是,有人拿检测器测试1787年的美国宪法,判定96.21%由AI生成;测试《创世记》片段,判定88.2%由AI生成。为什么?因为AI就是拿这些东西训练出来的,它最后说出来的话长得像训练材料,本来就顺理成章。现在有25所以上的大学已经禁用或限用AI检测器,这一点非常重要。但这件事仍相对滞后,还有不少大学和老师坚持使用AI检测器,一发现系统说是AI,就直接把学生请出去,不听解释。
Anthropic的记号来了,它比检测器强在哪里?强在它不是猜的。这个记号可以非常精准地判断内容是不是从它家模型输出,把一个概率问题变成是非题。但这也更过分,因为检测结果并不说明创作者付出了多少努力,也不说明Anthropic是否只负责最后一小部分工作。它只是盖一个“这个东西我摸过了”的戳。
为什么只能叫“摸过了”?因为最后一遍文字是它输出的。输出时,它按照自己的隐形词表,提高某些词出现的频率。现在还有人说,一篇内容里用了“不是……而是……”,就一定是AI稿,这种判断太简单,真实的水印检测并不是这么做的。
Anthropic这套东西就像门禁卡系统,认卡不认人。有卡就能进去,哪怕卡是偷来的,或者第一天刚领到;但一个人在楼里住了10年,今天没带卡,也照样不让进。它就是这样运作的。
真正应该提供的是分级系统,能够判断多大比例由Anthropic生成。到底是一句话直接生成,还是像老范这样,先给它几千字稿件,再让它进行哪些搜索、按什么要求整理?应该把参与方式表达出来。就像写论文有许多作者,每个作者的作用不同。Anthropic却只上来盖一个“我摸过了”的章,这就是对所有人劳动的羞辱。
创作者如何应对水印与标注

接下来怎么办?水印既然已经推出,我可能还是要继续用。虽然觉得被羞辱,但Anthropic整理内容的能力确实比GPT强很多,现在就是最强的,没有之一,只能捏着鼻子用。这里给大家两条建议。
第一,别念,要讲。Anthropic整理完以后,先读,读到自己懂了,然后合上稿子,用自己的话再讲一遍。注意,是讲,不是念。在讲的过程中,我们会用自己的口头语言替换Anthropic塞进去的词。普通人不可能照着它的概率一模一样地输出,所以不要背稿,不要读逐字稿,而要讲这个故事。像我现在面前也有稿,但肯定不会一个字不差地照着念。这样就能把预埋的信息洗掉。
还有一种更折腾的办法,是在本地部署开源小模型,比如Qwen3.8-27B。当时它这周还没有发布,应该快了。甚至可以对小模型做一些微调,让它学习自己的行文习惯,最后用Qwen3.8-27B把稿件再处理一遍,在不影响逻辑和顺序的情况下整体重写,水印就能洗干净。
第二,AI内容由自己老老实实标注。老范那些短视频本来就是纯AI生成,由Seedance 2.0制作。之前我确实没有标,因为标记入口藏在需要展开的菜单里,不展开就看不见。后来被提醒几次以后,我现在上传所有AI生成短视频时都会主动标记“这是AI生成的”。我发现标注后,播放量和变现都没什么变化,不会因为标了AI就不推荐,也不会因此减少变现。所以,该标就标,这才是正确的做法。
推荐算法和识别算法本身没有那么聪明。所有不那么聪明的算法和人都有一个特点,就是自卑。自卑的体现是,一旦发现你骗它,或者它怀疑你骗了它,就会歇斯底里地处罚你,前面Allon Chen的案例就是如此。
最后总结,Anthropic现在这套标记系统,就是对做内容的人一次赤裸裸的羞辱。它把所有经过自己手的内容不分青红皂白盖上“我摸过了”的戳,甚至不能说它生成过,因为它无法标识其中创作者到底付出了多少努力。
真正的解法,是对AI参与度进行分级。如果Anthropic没有这个能力,就请把这套垃圾收回去。如果它实在不愿意收回去,我们只能继续寻找替代方案。
今天的故事就讲到这里。感谢大家收听,请帮忙点赞、点小铃铛、参加Discord讨论群,也欢迎有兴趣、有能力的朋友加入付费频道。再见。
背景图片
