<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>验证方法 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/%e9%aa%8c%e8%af%81%e6%96%b9%e6%b3%95/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Wed, 09 Apr 2025 00:44:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>验证方法 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>开源巨头Meta深陷Llama 4作弊风波：高分低能引爆质疑，测试数据竟混入训练集，AI圈还能信任谁？</title>
		<link>https://lukefan.com/2025/04/09/%e5%bc%80%e6%ba%90%e5%b7%a8%e5%a4%b4meta%e6%b7%b1%e9%99%b7llama-4%e4%bd%9c%e5%bc%8a%e9%a3%8e%e6%b3%a2%ef%bc%9a%e9%ab%98%e5%88%86%e4%bd%8e%e8%83%bd%e5%bc%95%e7%88%86%e8%b4%a8%e7%96%91%ef%bc%8c%e6%b5%8b/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 09 Apr 2025 00:44:15 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Meta的故事]]></category>
		<category><![CDATA[AI伦理]]></category>
		<category><![CDATA[AI生成]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[AI负责人辟谣]]></category>
		<category><![CDATA[Benchmark作弊]]></category>
		<category><![CDATA[DLIU DLIU]]></category>
		<category><![CDATA[Llama 4]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[Meta AI]]></category>
		<category><![CDATA[Meta回应]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[作弊指控]]></category>
		<category><![CDATA[内部爆料]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[学术不端]]></category>
		<category><![CDATA[实际使用效果]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[开源社区]]></category>
		<category><![CDATA[快速发布后果]]></category>
		<category><![CDATA[性能评估]]></category>
		<category><![CDATA[技术报告缺失]]></category>
		<category><![CDATA[数据污染]]></category>
		<category><![CDATA[模型蒸馏]]></category>
		<category><![CDATA[沃顿商学院教授]]></category>
		<category><![CDATA[测试集污染 (背真题)]]></category>
		<category><![CDATA[版本不一致 (开源vs测试)]]></category>
		<category><![CDATA[科技争议]]></category>
		<category><![CDATA[科技新闻]]></category>
		<category><![CDATA[稳定性问题]]></category>
		<category><![CDATA[编程能力差]]></category>
		<category><![CDATA[自然语言处理]]></category>
		<category><![CDATA[跑分作弊]]></category>
		<category><![CDATA[过度优化]]></category>
		<category><![CDATA[验证方法]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2084</guid>

					<description><![CDATA[家人们！！！这绝对是我今年吃过最魔幻的AI圈大瓜！！！Meta家的Llama4竟然被程序员扒出作弊实锤了！！！（瑟瑟发抖.jpg）

事情是这样的👇👇👇
1️⃣【作弊双连暴击】
开源版vs测试版根本不是同一个模型！（瞳孔地震）
内部员工爆料偷偷用真题库训练（这不就是高考泄题吗！！）
2️⃣【程序员集体暴走】
编程测试效果直接打脸，跑分高到离谱实际用起来像智障（摔键盘.gif）
沃顿教授亲自下场开撕：这波优化痕迹太明显了！！！
3️⃣【Meta花式甩锅】
AI负责人疯狂否认三连：我没有！不可能！都是发布太赶了！（甩锅姿势满分）
程序员冷笑：过几天要发"稳定版"？这不就是连夜改答案吗？！

💥吃瓜重点：
✔️测试数据混进训练集=考试前偷试卷
✔️Meta技术报告至今不敢发（懂的都懂）
✔️内部大佬提前申请离职（这时间点太微妙）

📢建议所有搞AI的宝子：
1️⃣暂时别用Llama4做项目（会变得不幸）
2️⃣蹲一个下周的"稳定版"（坐等二次打脸）
3️⃣转推文给程序员朋友避雷（救人一命胜造七级浮屠）

现在整个硅谷都在等Meta的回应...（

开源巨头Meta深陷Llama 4作弊风波：高分低能引爆质疑，测试数据竟混入训练集，AI圈还能信任谁？

Meta 最新发布的 AI大模型 Llama 4 正面临严重的 作弊 质疑，尽管其公布的 跑分 数据亮眼，但 开源 版本在实际应用中，尤其是在 编程 任务上表现不佳，引发用户普遍不满。核心指控包括 Meta 可能进行了 数据作弊，将 测试数据 混入了 训练数据 以拔高分数，以及发布的 开源 版本与内部用于 跑分 的测试版本存在显著差异。更有匿名内部 爆料 指出，因不齿此行为，有员工拒绝签署 技术报告 并辞职。外部专家也认为 Llama 4 存在对基准测试 过度调整 的痕迹。对此，Meta 官方紧急 辟谣，否认 数据作弊，将性能问题归咎于为追求 快速发布 而导致的模型 不稳定，并承诺数日内发布稳定实现。这场风波不仅让 Meta 的声誉蒙上阴影，也促使业界反思 AI大模型 的评测标准与发布流程，Llama 4 最终能否自证清白，全球开发者正拭目以待 Meta 后续发布的技术细节与新版本表现。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="开源巨头Meta深陷Llama 4作弊风波：高分低能引爆质疑，测试数据竟混入训练集，AI圈还能信任谁？" width="900" height="506" src="https://www.youtube.com/embed/xG02Aa7UYP8?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Meta的Llama4发布之后，深陷作弊风潮。大家好，欢迎收听老范讲故事的YouTube频道。今天咱们来讲一讲Meta的Llama4被人怀疑作弊，他到底是不是真的作弊了。</p>



<p class="wp-block-paragraph">前面我们做过一期视频，说Llama4发布的时候没有太大的响动，因为它出来以后发现，虽然评测还不错，但是使用起来并没有感觉比现在主流的模型强到哪去。现在不行了，负面消息传出来了，说你大模型出来的时候跑分的成绩很高，但是我们使起来不是这么回事，有点名不副实的样子，特别是编程的效果极差。</p>



<p class="wp-block-paragraph">为什么大家去比较编程呢？两个原因：<br>第一个，去玩这些开源大模型的，一般都是程序员。<br>第二个，编程是一个相对来说标准比较统一的评测。你编得出来编不出来，编完了效果怎么样，这个一眼就能看出来，没法作假。你说我写个诗或者写个小说，这个玩意还有仁者见仁、智者见智的时候。这编程这个东西，对就是对，不对就是不对，或者你做完了以后它的效果有问题，一眼就能看出来。所以现在被人质疑了。</p>



<span id="more-2084"></span>



<p class="wp-block-paragraph">当然了，国内很多大模型发出来以后也是去跑分，跑完分以后也有人质疑，但是呢，并没有那么大的声音。为什么？一般情况下好像分数稍微高那么一分两分，效果差那么一点两点，大家也就认了，不是说一定有什么大不了、过不去的事情。</p>



<p class="wp-block-paragraph">但是为什么这一次质疑很多人要拿出来讲？<br>第一个，因为后边是Meta，是开源大模型的开山鼻祖，是个老大。你位置还在这呢，所以你干这样的坏事，我们要质疑一下。<br>另外一个呢，就是这一次提出了两项非常严重的质疑。这种质疑呢，有的时候说“哎，这个跑的不是特别准”，这个不是特别严重。什么质疑是比较严重的？</p>



<p class="wp-block-paragraph">第一个是开源版本跟测试版本不一致。你自己测的跑分，那个版本你没拿出来。你出来说你开源了，但是呢，这个开源的版本比你测试的版本差。这是一个相对来说比较严重的指控。</p>



<p class="wp-block-paragraph">当然还有一个更严重的是什么呢？就是数据作弊。什么叫数据作弊？大家要知道，所有这些大模型去进行跑分测试，它是有题库的。我是用什么什么样的题库去测，测到多少分以上，它是这样来做的。那怎么能够让它测得更高呢？咱们都懂，背真题呗。像国内你去考什么雅思、托福，或者去考ACT、SAT什么这些东西，他就是背真题。大模型其实也是一样的。</p>



<p class="wp-block-paragraph">现在指控他把测试数据直接混在了训练数据里头，给他训练掉了。那么这个是非常非常严重的指控，因为你一旦这样的话，他等于是在学术不端，或者说你整个的品性是有问题的。</p>



<p class="wp-block-paragraph">Llama 4呢，其实一共有三个版本。现在公开出来的呢，是中型版本和小型版本两个：一个是400B的，一个是105还是幺零几B的。最大的那个没出来，2万亿参数，也就是2,000多B的那个没有出来。那么，它这种中小模型呢，应该是蒸馏出来的，就是拿那个最大版本蒸馏出来。</p>



<p class="wp-block-paragraph">现在出问题呢，就有两种可能。第一种可能是什么呢？就是他去跑分的时候，可能拿这个大模型去跑，或者呢，他训练了一个比现在的中模型和小模型要再大一些的模型，拿这个玩意去跑分了。但是，最后开放出来的模型并没有这么厉害。还有一种可能是什么？就是他在蒸馏的时候，直接把题库混在蒸馏数据里头，拿去做训练了，就直接背真题了。这是两种可能性。</p>



<p class="wp-block-paragraph">而且呢，现在还有匿名爆料。有一个人号称是Meta内部的员工，说我爆料了，他就是用题库数据直接训练了。这个人呢，在Twitter上的账号叫滴溜滴溜，开个玩笑，他的名字叫DLIU DLIU，所以叫滴溜滴溜。这个人呢，说使用了数据作弊的方式进行训练，我很不齿这种行为，还因此辞职，而且拒绝署名技术报告。大家注意，这里有一个很重要的点，叫拒绝署名技术报告。</p>



<p class="wp-block-paragraph">Meta在这一次发布的时候，跟前面Llama 123其实有很大的区别。区别在什么地方？就是他只发布了模型出来，然后发了个博客出来，并没有发论文，没有发白皮书，这些东西都没出来。那现在就有人说了，说这个技术报告我拒绝签字，所以他发不出来，讲了这么个话。而且这个人呢，前面讲的是匿名。</p>



<p class="wp-block-paragraph">另外一点是什么？就是Meta AI研究副总裁，这个名字我们就不念了，已经申请于2025年5月份离职。但是呢，并不确定这个Meta AI研究副总裁到底是不是这个提溜提溜，也没法确认他离职这个事情跟Llama 4是不是有关。所以，并不确定这到底是不是爆料人了。</p>



<p class="wp-block-paragraph">然后，除了他内部爆料之外，还有外部的质疑声音。比如，沃顿商学院的一位教授，这个名字我们也不念了，在评论中指出，AI模型的优化痕迹明显可辨，Llama 4似乎针对基准测试进行了过度调整，而非真正的技术进步。他们甚至做了很多测试以后发现，这东西可能连Llama 3.3什么405B连那个都达不到。这种质疑是非常严重的质疑。</p>



<p class="wp-block-paragraph">针对这些质疑，Meta内部肯定说要出来辟谣。如果这事认了，那就不是说有一个人辞职就完事了，可能会有一帮人要被开除掉。而且这种一旦开除了的话，在圈子里名声就臭了，再去干这个事干不了了。</p>



<p class="wp-block-paragraph">Meta的AI负责人埃哈迈德应该是个穆斯林。他是VP，AI生成这块的负责人。他出来明确否认了作弊指控。他表示：“我们听到了一些关于我们训练时使用测试集的指控，这根本不是真的，我们永远不会这么做。我们目前的理解是，大家看到的质量不稳定是由于快速发布导致的时限问题，需要几天时间来稳定所有的公开时限。”</p>



<p class="wp-block-paragraph">这个老兄原来呢是苹果做自动驾驶的，是苹果汽车部门的一位负责AI的科学家吧。后来进入Meta，在Meta里面干了几年以后，生成了Meta的AI生成部门的老大。数据作弊这个实在是太严重了，绝对不能承认。所以前面讲了，说这个事不可能的，我们永远都不会做。而且也要甩锅，甩锅是什么呢？快速发布，肯定有人逼着我快速发布。谁逼着我快速发布，导致我现在没有办法把最稳定的版本拿出来。这个问题是你的，不是我的，这个锅要甩。</p>



<p class="wp-block-paragraph">然后他讲的是一个什么呢？原因呢就是说这个是一个实现的问题。我们拿这个大模型去蒸馏小模型，他并没有说作弊。他讲的这个词叫不稳定，什么叫不稳定？就是有时候好有时候不好。这个话很重要，因为我们后边如何去验证他到底是不是作弊了，就要从这个点去验证他。他还讲了一个什么呢？我会在未来的几天的时间内（大家注意几天），会拿出一个稳定的实现出来。然后内部呢，也有一些员工出来实名辟谣，说我们没有作弊。前面那个你说我作弊的人，咱们来当面对质。</p>



<p class="wp-block-paragraph">那么到底有没有作弊呢？这个事其实并不难验证。现在呢，有3种可能性，这三种可能性呢都可以验证。第一种可能性是什么？就是参加跑分跟测试的版本与对外发布的版本不一致。这种可能性呢是比较大的，内部呢使用了一个作弊的版本做的这个跑分测试，然后发出来的是一个没有用这些数据去训练的版本，这个可能是存在的。</p>



<p class="wp-block-paragraph">还有一种可能是什么？就是像这个艾哈迈德讲的这样的，就是说他可能是不稳定。那不稳定呢其实是什么？就是你多次跑分，跑了好多次，然后取了一最好的成绩，或者干脆就是我给你一假的跑分成绩，这个可能性也是存在的。</p>



<p class="wp-block-paragraph">第三种可能呢就是直接数据作弊。我给了大家一个用测试训练集训练出来的蒸馏的中模型和小模型。这个是三种可能。那你说我怎么验证这件事呢？很简单，用现在发出来这个版本再去跑分呗。如果你跑完了以后能够复现原来的成绩，比如说他原来发了博客了，说我这个大模型应该是什么什么样的成绩，排名是多少，然后是多少分，我接着跑呗。如果跑完了还是这么多分。</p>



<p class="wp-block-paragraph">那你就是作弊做出来的，没什么好说的。如果你说，我跑完了以后不是那分了，怎么跑也跑不出来了，那就是你内部有作弊版本。我外边拿的这个版本是没有作弊的，但是你那个跑分数据也是假的。那么如果我拿出来去跑分，跑分的成绩呢非常不稳定，时高时低。有个别的时候，能够高到你公布的这个数据来，那就是这个艾哈迈德讲的，就是我发出了这个版本，它很不稳定。他实际上就是这样去测试了。</p>



<p class="wp-block-paragraph">Meta辟谣的信息在什么样的情况下，才有可能是真实的？那你刚才不是讲了吗，就是你测试时高时低。这个可以这么去算，但是还要看什么？还要看刚才都讲了，未来几天我会发一个稳定的版本出来，或者叫稳定的实现出来。他用的这个词是实现，为什么这么讲？因为他这个中模型跟这个小模型，都是拿那个大模型直接蒸馏出来的。如果几天之后他真拿出来了，而且新拿出来的这个实现，是可以稳定的跑分，跑到他承诺的这个数据上的，那么这件事呢才算是说验证了。你们确实没有说谎，你也确实把东西做出来了。如果在这几天之内他拿不出来，或者拿出来这个版本跑分很烂，那么这个事情还是要算他作弊。而且他是有很大问题的，因为开放的版本你是抹不掉的。你说我这前面这个版本有问题，我把它回收出来，那没有，回收不回去的。即使后续开放出新的版本来，我们依然可以拿它前面的版本接着做测试。所以它到底有没有作弊，到底是作弊到哪一步，这个事都是可以验证的。自己说的话到底是不是真的，我们要等他过几天发的版本出来，咱们再去做测试。而且这个就不能等他测了，一定是外边社会上来测。测完了以后看看能不能稳定的达到一个可以接受的分数，这个才是能够让它整个的辟谣成立的一个过程。</p>



<p class="wp-block-paragraph">而且从现在发出来的信息看呢，前面发行的版本在特定的测试中应该是成绩还不错的。但是在其他的领域里头，或者整体的应用过程中表现很差。这件事情呢应该基本实锤了。为什么？就是沃顿商学院的那个教授给出的结论其实就是这样。他讲的是什么？讲的是AI模型的优化痕迹明显可辨，Llama 4似乎对基准测试进行了过度调整，而非真正的技术进步。就是Llama 4现在给出的版本，进行特定的这种跑分的时候，还是可以跑出一个很高的分数来的。所以呢，这就是最糟糕的一个状态，就是他直接把一个用测试数据训练出来的这个作弊版本公开出来了。现在可能性比较大的是这个。</p>



<p class="wp-block-paragraph">那么Meta有没有办法快速补救呢？现在肯定是准备快速补救嘛。第一个要去发技术文档。</p>



<p class="wp-block-paragraph">前面Llama 123发布的时候，都是有论文、白皮书，还有一些微调的说明书，有一大堆这样的技术文档出来。这一次没给，那么你赶快要把这些东西补齐了，甭管是有没有人签字，还是要发出来的。</p>



<p class="wp-block-paragraph">第二个就是尽快发新版本出来。如果想洗脱冤屈，一定要赶快，比如几天之内或者一周之内吧，把一个新版本发出来。发完了以后再去跑分测试，这个跑分还要能够稳定在一个大家可以接受的范围内。你别说发一版本出来，发现一跑分还不如Llama 3呢，这个事就丢人了，这肯定是不行的。这个还是要去看。</p>



<p class="wp-block-paragraph">这种尽快发新版本这件事呢，其实难度是非常高的。为什么？因为大模型这个东西，它不是软件。大模型没法修修补补，你只能是拿一堆训练集重新训练，而这个过程其实是挺慢的。而且每一次训练完了以后的结果呢，他没有办法进行这种迭代更新，或者说迭代调优。这话什么意思？就是我们写软件的时候，你是有一大堆的参数指标，每一次改一点点，发现提高了一点，再改变再提高一点，它是可以干这件事的。</p>



<p class="wp-block-paragraph">而大模型这种东西，你还是需要把完整的数据扔进去，然后去训练。训练完了以后，其实有点像开盲盒，有的时候行，有时候不行，不行也没有什么道理可讲。你只能是重新去整理和收集数据，然后重新训练。所以这个过程呢，没有那么快。这个也确实是对于Meta来说是一个很巨大的考验吧。</p>



<p class="wp-block-paragraph">那你说有什么方法可以提高速度呢？就是投入更大的算力，上显卡。现在呢，Meta也承诺了，说我要放10倍的显卡进去，然后快速的出版本出来。这个呃，不是那么容易的，就是你真的有10倍的显卡放进去以后，你想要协调这十倍的显卡稳定的工作，这也是一个巨大的工程考验，没有那么容易。</p>



<p class="wp-block-paragraph">Meta呢还承诺在2025年，会进一步的发布更多的模型出来。如果过几天大家不再找他要，说你前面那个承诺几天之后发这个模型没出来，或者出来的不好使，他也准备唾面自干了，说我今年接着准备发很多的模型出来。而且呢，这些模型呢，我准备提升语音以及推理的能力，因为现在的Llama 4不是推理模型，它就是一个文本生成模型。他准备在这一块再加强一些，也会呢推出一些商业应用场景的AI agent。因为别人现在也都已经开始卷这一块了，他还在发布原始的这种文本生成模型，这个真的是慢了两三拍了。所以说我这2025年还要接着往前跑。</p>



<p class="wp-block-paragraph">那么结论是什么呢？结论就是，让子弹呢再稍微再飞一会。大概率呢，他们就是直接拿了作弊的模型出来，因为有人验证过了。</p>



<p class="wp-block-paragraph">会有人再去做问题的复现，因为现在他已经站在风口浪尖上了，所以一定还会有人再去复现。这个过程盖子是捂不住的。</p>



<p class="wp-block-paragraph">而且这个事情出来以后，后面比如说千问再去出3.0模型的时候，也会引以为戒，不敢再随便地在跑分的时候作弊。下一个模型出来，甭管是Llama 4的下一个模型，比如Llama 4.1，还是千问3出来，大家一定会更加谨慎地评测之后再拿出来。</p>



<p class="wp-block-paragraph">“萝卜急了不洗泥”，我催你必须在哪天哪天把东西拿出来，这个事情应该是没有人敢干了。因为现在艾哈迈德说了：“我这一次翻车的原因，就是有人催着我必须在4月初把模型拿出来。”为什么必须在4月初？因为他再拿不出来，可能千问3就出来了，所以必须在这个时间点把他拿出来。他又没有进行很好的测试，就导致翻车，导致这种作弊被人抓了个现行。</p>



<p class="wp-block-paragraph">所以科学这个事，还是要讲究科学方法的，太着急了是做不出来的。</p>



<p class="wp-block-paragraph">好，这一个故事咱们就讲到这里。咱们也继续关注后续如何发展。这个故事就讲到这。请帮忙点赞、点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>番茄小说AI附加条款引发网文作者激烈反击，停更、转场、抗议。小说写手，直面AIGC的第一仗，谁能赢？</title>
		<link>https://lukefan.com/2024/07/30/%e7%95%aa%e8%8c%84%e5%b0%8f%e8%af%b4ai%e9%99%84%e5%8a%a0%e6%9d%a1%e6%ac%be%e5%bc%95%e5%8f%91%e7%bd%91%e6%96%87%e4%bd%9c%e8%80%85%e6%bf%80%e7%83%88%e5%8f%8d%e5%87%bb%ef%bc%8c%e5%81%9c%e6%9b%b4%e3%80%81/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 30 Jul 2024 00:46:35 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI与作家合作]]></category>
		<category><![CDATA[AI作品合成]]></category>
		<category><![CDATA[AI使用争议]]></category>
		<category><![CDATA[AI使用条款]]></category>
		<category><![CDATA[AI写作]]></category>
		<category><![CDATA[AI创作工具]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI工具箱]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI训练]]></category>
		<category><![CDATA[AI辅助写作]]></category>
		<category><![CDATA[AI附加条款]]></category>
		<category><![CDATA[互动小说]]></category>
		<category><![CDATA[作品合成]]></category>
		<category><![CDATA[作品授权]]></category>
		<category><![CDATA[作品授权调整]]></category>
		<category><![CDATA[作品数据]]></category>
		<category><![CDATA[作品训练]]></category>
		<category><![CDATA[作家愤怒]]></category>
		<category><![CDATA[作家流失]]></category>
		<category><![CDATA[作家版权]]></category>
		<category><![CDATA[作家离开]]></category>
		<category><![CDATA[作家论坛]]></category>
		<category><![CDATA[作家退网]]></category>
		<category><![CDATA[作者保护]]></category>
		<category><![CDATA[作者抗议]]></category>
		<category><![CDATA[作者权利]]></category>
		<category><![CDATA[停更]]></category>
		<category><![CDATA[公平书写]]></category>
		<category><![CDATA[凤凰网]]></category>
		<category><![CDATA[创作效率]]></category>
		<category><![CDATA[协议]]></category>
		<category><![CDATA[反击]]></category>
		<category><![CDATA[合同条款]]></category>
		<category><![CDATA[图像生成]]></category>
		<category><![CDATA[大模型弊端]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[字节跳动]]></category>
		<category><![CDATA[小说停更]]></category>
		<category><![CDATA[小说内容生成]]></category>
		<category><![CDATA[小说发酵]]></category>
		<category><![CDATA[小说平台]]></category>
		<category><![CDATA[小说版权]]></category>
		<category><![CDATA[小说生成]]></category>
		<category><![CDATA[平台争议]]></category>
		<category><![CDATA[平台调整]]></category>
		<category><![CDATA[搜索增强技术]]></category>
		<category><![CDATA[数字版权]]></category>
		<category><![CDATA[数据合成]]></category>
		<category><![CDATA[数据库信息]]></category>
		<category><![CDATA[数据库建设]]></category>
		<category><![CDATA[数据总结]]></category>
		<category><![CDATA[数据文本素材]]></category>
		<category><![CDATA[数据标注]]></category>
		<category><![CDATA[数据泄露]]></category>
		<category><![CDATA[新技术研发]]></category>
		<category><![CDATA[显著权利]]></category>
		<category><![CDATA[智能对话]]></category>
		<category><![CDATA[智能文本]]></category>
		<category><![CDATA[未来展望]]></category>
		<category><![CDATA[未来技术]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[格式合同]]></category>
		<category><![CDATA[格式合同案例]]></category>
		<category><![CDATA[检测工具]]></category>
		<category><![CDATA[沟通对抗]]></category>
		<category><![CDATA[法律协议]]></category>
		<category><![CDATA[法律纠纷]]></category>
		<category><![CDATA[洗稿]]></category>
		<category><![CDATA[深度合成]]></category>
		<category><![CDATA[版权保护]]></category>
		<category><![CDATA[独立作家]]></category>
		<category><![CDATA[电子书历史]]></category>
		<category><![CDATA[番茄小说]]></category>
		<category><![CDATA[番茄小说协议]]></category>
		<category><![CDATA[番茄小说背后]]></category>
		<category><![CDATA[知识产权]]></category>
		<category><![CDATA[纸质合同]]></category>
		<category><![CDATA[维权方式]]></category>
		<category><![CDATA[网文作者]]></category>
		<category><![CDATA[网文写作]]></category>
		<category><![CDATA[网文创作]]></category>
		<category><![CDATA[网文市场]]></category>
		<category><![CDATA[网文抗议]]></category>
		<category><![CDATA[网文生态]]></category>
		<category><![CDATA[网文连载]]></category>
		<category><![CDATA[自动识别]]></category>
		<category><![CDATA[虚拟现实]]></category>
		<category><![CDATA[跨平台纠纷]]></category>
		<category><![CDATA[转场]]></category>
		<category><![CDATA[连载小说]]></category>
		<category><![CDATA[阅读市场]]></category>
		<category><![CDATA[验证方法]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1444</guid>

					<description><![CDATA[亲爱的家人们！👫👭👬

今天的瓜特别大，特别甜！🍉你知道吗，番茄小说的最新AI条款引发网文圈内的地震啦！🌐

这是怎么回事呢？原来，番茄小说在合同中悄悄加了一项AI附加条款，说是要拿我们心爱的作品去训练他们的大模型。🤖这简直就是在剥削我们的劳动成果啊，不是吗？

想象一下，我们辛辛苦苦码字的日子，竟然成了别人的训练素材？😱😤

所以，在一声令下，网文作者们纷纷停更，甚至有的直接退出番茄，转战其他平台。🏃‍♂️🏃‍♀️

番茄小说的反应也很有意思，他们急忙推出了一个取消AI授权的流程。但别急，家人们，这中间还有更多的戏码！他们的合同上居然写着，即使取消了授权，如果你的作品已经被使用过了，你也不能追究！🤨

是不是觉得有点被耍了？🧐

不过，别担心，我们的网文作者们可不是吃素的。他们已经开始团结起来，用各种方式抗议这种不公平的条款。🔥

至于AI工具箱，虽然听起来很酷，但真正的原创精神和创意是机器无法替代的。🌟

除非，除非AI也学会了感动人心的泪水和笑容，否则它永远只是一个工具。

所以，亲爱的家人们，下次你看到一本看似完美的小说时，记得它背后可能是一个真正活生生的作者，而不是冰冷的代码。📚

让我们拿起笔，继续我们的故事，也让我们为那些勇敢抵制不公的网文作者们点赞！👍🏻

如果你对这个话题有更多的感想或者想了解更多，那就快来评论区，我们一起聊聊吧！🗣️

#番茄小说AI条款 #网文作者反击 #创作者权益保护]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="番茄小说AI附加条款引发网文作者激烈反击，停更、转场、抗议。小说写手，直面AIGC的第一仗，谁能赢？" width="900" height="506" src="https://www.youtube.com/embed/rtOU_g3zGKw?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">网文作者向AIGC发起了反击。中国最大的网文平台番茄小说，因为在协议里要求网文作者授权他们使用作品进行大模型训练，导致这些作家纷纷退网，纷纷停更，向他们正式发起了反击。</p>



<p class="wp-block-paragraph">大家好，这里是老范讲故事的YouTube频道。今天咱们来讲一讲番茄小说的AI附加条款到底是怎么回事。上面写了，任何作者到任何的小说平台上去写小说，都是要跟人家签协议的。说我在你这里写小说，遵守你的规则，你给我分钱。</p>



<p class="wp-block-paragraph">番茄小说的协议里头呢，就突然多了一个条款，这个条款呢叫做AI附加条款。条款怎么写的？甲方可将签约作品的全部部分内容以及相关信息，包括作品名称、简介、大纲、章节、人物、作者个人信息、封面等数据语料、文本素材等，用于标注合成数据数据库建设、AI人工智能研发、机器学习模型训练、深度合成算法研发等目前已知或未来开发的新技术研发应用领域，包括但不限于：一、用于智能对话、智能文本、图像、视听语音等作品成品的编辑生成转换、深度合成、虚拟现实技术等再研发和应用；二、用于任何技术下的AI人工智能模型训练，或用于生成提供给模型训练的合成数据数据库；三、其他任何新技术研发或应用场景。</p>



<span id="more-1444"></span>



<p class="wp-block-paragraph">注：甲方是番茄小说，乙方为作者。他呢是在这个里边加了这么一段。小说网站跟写手之间呢都会去签这种叫格式合同。什么叫格式合同？就是说我不会一个一个给你谈。我今要到先番茄写小说去了，番茄派一个律师跟我的律师去谈，说这个条款怎么样，没这个啊，就是一个标准合同。愿意就愿意，不愿意拉倒。你说我想改任何一个字，滚，对吧？就是这样的一个状态。</p>



<p class="wp-block-paragraph">当年呢，我们在盛大电子书的时候，也遇到过这种问题，盛大文学跟所有的作者……</p>



<p class="wp-block-paragraph">肯定也都签了有类似这样的格式合同。但是，我们当时做电子书的时候，遇到一个什么小奇怪的事情呢？当时签的协议是，我们通过互联网发行他们的内容，我们已经得到授权了。那你说没问题啊，我们做电子书不就行了吗？哎，问题在这了。我们通过互联网网站发行是OK的，但是你通过电子书、通过移动互联网、通过其他的方式再发行呢，这个事是有问题的，没有在合同的范围内。</p>



<p class="wp-block-paragraph">那当时我们怎么办的呢？我们在电子书里头写了个浏览器，所有再去阅读的呢，我们是通过浏览器直接从网站上进行缓存，这样去使用的。这样我等于又在这个合同的范围内了。这也能够理解到，为什么上面番茄写的这个协议写得这么霸道。哪霸道了？现有的技术我都可以用，未来我在研发任何技术，我也都可以用。至于未来我到底想研发什么，我不知道，但都能用上来。就是包括但不限于这个不限于，就是现在我正在用的，未来的这些，没写进去的，你都得让我去用上去。</p>



<p class="wp-block-paragraph">所有的律师写协议都是这么写的，把自己的权利写得无限大，把别人的权利写得无限小，所有解释权在自己。协议写得霸气似漏，但这种协议呢，你说有人看吗？没有人看。整个协议非常长，这只是其中的一个很小的权利而已。这个条款什么时候加的？2023年的11月还是12月份加进去的，大家也没注意。一直到今年的7月份，有些人发现了，哎，说这个版本怎么多了一行，或者多了这么一个小模块在里头。这事不行，有人发现了以后，大家就开始在一些作家论坛里讨论这件事情，逐渐发酵。发酵到一个什么程度呢？说我们要去停耕，要去转场，要去抗议。什么意思？就是现在的小说都是连载小说，我写了个30章，50章后边一章一章往下写，我发现有问题了。</p>



<p class="wp-block-paragraph">那我就停更啊，停止更新了。或者说，我以后不在你这写了，我上其他地方写去，对吧？写小说的网站也不是只有你一家。而且其他各家的小说网站呢，都没有在协议里头增加这样的一个奇怪的条款，只有你番茄小说啊，敢为天下先加进去了。所以大家就开始去抗议。</p>



<p class="wp-block-paragraph">番茄小说呢，也进行了一定的调整。调整是什么呢？特别有意思啊，他推出了一个流程，就是取消AI授权的一个流程。就是你可以到网站上去申请，说我要去取消这个授权了。他会给你寄一个纸质的合同来，你呢，自己去签字，自己去盖章，然后再给人寄回去。这样你就可以取消这个条款了。</p>



<p class="wp-block-paragraph">这个合同上写的是什么呢？就是啊，你前面跟我签的这个协议中间这个条款我们把它作废掉，但是其他的协议上的条款依然有效啊。大概就写这样的一个东西。但是呢，它这个里头，有一个特别有意思的附加项，是什么呢？为避免异议，乙方同意，若甲方使用签约作品训练开发新技术，并生成文字内容进行传播使用，乙方不得因此向甲方或其他经甲方授权，使用新技术的第三方主张任何违约或侵权责任。大家看到耍流氓的地方了吧？哎，说你可以不授权给我，但是我用了以后你不能告我。</p>



<p class="wp-block-paragraph">这个叫取消AI授权条款，一个协议，作者呢，肯定还是不乐意啊，你这不耍流氓吗？很多人就决定要离开啊。但是也有一些新作者说，算了，你学就学吧，反正我们自己也是拿AI去写。也有的人说，我就认了的啊。但是很多觉得自己写的还不错的这些老作者就要纷纷离开了。</p>



<p class="wp-block-paragraph">这个里边呢，也有一些写手说，我去验证一下，他到底有没有拿我们的作品去训练大模型呢？很多人说，哎，我验证了，他真的干了啊。但是在这里要指出呢，就是这些作者也好，写手也好，他们的验证方法都是非常不严谨的。他们的验证的过程呢……</p>



<p class="wp-block-paragraph">证明了他们对于AI使用方式的无知。他们怎么验证这件事呢？通过豆包大模型。因为刚才我们讲了，番茄小说后台是字节跳动，这么多大模型里头，谁是字节跳动出的呢？豆包大模型啊。他到豆包大模型里去问，问道：“我的小说写得怎么样？我的小说里头有哪些人物？我的小说的题纲是什么样的？给我总结一下。”问了一堆这种问题，豆包大模型呢，就非常准确地都给他回答出来了。</p>



<p class="wp-block-paragraph">“你这小说叫什么？主要人物是什么？核心写的是什么东西？有一个什么样的章节？整个的提纲是什么？”都给他拎出来了。于是当时这哥们就惊了，说：“这疯了吧？这我写了半天，付出这么多心血，你怎么就全都给我拎出来了呢？”这里要讲，大模型的训练呢，不是这么简单的。你如果只是使用豆包大模型，直接去问这些问题，他未必可以回答得这么好。而且豆包大模型，实际上在国内各个大模型里头，算是表现比较差的一个。</p>



<p class="wp-block-paragraph">但是怎么又能回答得这么准确呢？他使用的叫搜索增强的一个技术。正常的工作是这样的：当你去输入某本小说，告诉我是在讲什么的时候，他呢，先做的不是内容生成，而是先到网上去搜索了。搜索完了以后，他找到了你这本书，找到了所有公开的章节，然后对这些内容进行了总结归纳，最后再输出。所以你会看到它非常非常的精确。</p>



<p class="wp-block-paragraph">那么这位作者呢，也尝试了使用闻信遗言、通一千问，就是百度、阿里这些工具，去搜索他的小说，发现效果也很好，回答的都非常非常精确。他说：“我没有授权他们呀。”但是这实际上是一个搜索结果的总结，跟你是不是授权给别人是没有关系的。这个作者还有一些作品，没有在番茄小说上，他把有一些作品放在其他的小说网站上了。他去问番茄小说：“我那本作品怎么样？”</p>



<p class="wp-block-paragraph">发现，哎，居然也都说得挺好的啊，说得非常的完整，非常的准确。这个作者说：“你看，我们的小说已经都拿去训练大模型了，这个日子没法过了。”但是呢，整个的验证过程只能说明这个小说的写手并不太了解AI大冒险到底是怎么干活的。现在的AI写作已经带来了一些恐慌了。所有平台实际上都推出了AI写作功能，或者叫AI辅助写作功能，并不是说要给我写本小说，AI吭吭吭给你写去了，不是这样。而是什么呢？他们很多平台推出了叫AI工具箱。在你写小说的时候，可以进行AI扩写。你可以写一个简单的段落，咔一下给你把它写得比较长，这是AI比较擅长的。</p>



<p class="wp-block-paragraph">包括呢，AI改写。你写的文采不是很好，或者是错别字比较多，说来AI给我去处理一下，它会给你整个的润色一下。包括一些自定义的描写，我现在想描述一下这个山庄非常漂亮，像我们刚才讲的，山庄好漂亮，语言很匮乏。那么你就可以交给AI，它会去给你进行一个比较详尽的描写。包括AI续写，你写了一半的说：“来，把这个场景再接着给我看，写下去。”这个现在AI都已经可以实现了。不光是番茄小说，各个小说平台的网站上都有这种AI工具箱了。</p>



<p class="wp-block-paragraph">但是这些呢，并没有吓到作者。真正吓到作者的是什么呢？是有人一天上传了200本小说，不是200个字，不是200个章节，是200本。这个事呢，其实并不是AI直接照着大家的小说去写的，这种东西叫AI洗稿，这是完全另外的一套流程，跟你使用什么样的大模型，这个模型是不是使用了你的作品进行训练，已经没有任何关系了。AI洗稿到底是怎么干的呢？AI写稿实际上是使用的AI agent的这种工作流实现。你先指定一本小说，然后呢……</p>



<p class="wp-block-paragraph">他把这个小说按照章节进行总结归纳，把提纲拎出来。然后再把里面的人物关系、这些主体都拎出来。拎好了以后，他把这些东西填给一个新的作者，说：“来，你现在可以去修改了。”他把这个名字改了，把人名、地名、故事的前后结构因果稍微调整一下以后，等于再生成一个新的提纲。拿到提纲以后，AI按照提纲去生成。通过这样的一个方式，确确实实可以看到这种一天200本的效果。</p>



<p class="wp-block-paragraph">一个人写小说，不要说写一本了，写一个章节那一天也得坐在那，吭哧瘪肚的写两三个小时。上了AI以后说，一天200本，这是一个多么吓人的事情。现在还有很多人在卖这种提纲，什么意思呢？就是他把一些已经总结好的，先干什么后干什么，启程转合，哪个地方被人欺负了，什么地方在翻转打脸，把所有这些提纲东西写好了。他们拿这玩意儿卖钱，你只需要进去干嘛呢？改名字就行了，张三改成李四，李四改成王五，女主角一定记住叫李柳如烟，其他的随便改。改完了以后，一键生成，一分钟可以生成几千字，速度非常非常快。</p>



<p class="wp-block-paragraph">一天你说200倍有点夸张，但如果你有一个账号，如果是在本级跑的话，我觉得一天跑个十几二十本是没什么问题的。如果是在云端开很多个账号并行跑的话，是可以出一天200本这样的速度的。</p>



<p class="wp-block-paragraph">而现在，小说平台已经跟以前不一样了，已经洗过牌了。现在小说平台基本上是大厂的流量厮杀了。我以前在盛大，盛大文学也就是起点，后来起点这套东西卖给了阅文，阅文也上市了，等于在腾讯手底下。那你说当时我们有全中国大概百分之九十几的作者和百分之九十多的更大的一个比例的作品的版权，但现在已经不是这么回事了。</p>



<p class="wp-block-paragraph">现在排第一的是番茄小说，大概有接近2亿的月活用户，字节跳动是背后的东家。第二名是掌阅，掌阅做阅读器，做小说的手机阅读APP。刚才我们讲的阅读器是电子书，他们大概有1.5亿的用户。这个公司除了他们自己的个人创始人之外，真正的机构股东只有一个，占10%股份的叫字节跳动。这也是字节加的。</p>



<p class="wp-block-paragraph">然后是QQ阅读、微信读书、起点读书，这都属于腾讯系的。再往后是七猫免费小说，后边是谁呢？是百度。再往后是书旗小说，图书的“书旗帜”的“旗”，这个后边是谁呢？是阿里。</p>



<p class="wp-block-paragraph">所以现在的整个网文阅读市场基本上是被大巨头们挤干净了。那么作者应该如何跟AI一起前进呢？千万不要想着说我们就不用AI，这个事是不对的。另外，也不要想着不劳而获，认为我在网上报个课，拿着人家的题纲改几个名字，然后命令AI去生成，生成完了以后就去投放，就可以躺着挣钱了。这事也别想。</p>



<p class="wp-block-paragraph">我反复跟大家讲，面对AI的时候不能退缩，也不能想着不劳而获，这两个永远是错误的。作者真正应该跟AI做的，是一起前进，与AI互补，快速地让AI来完成一些自己不擅长的事情，快速地产出更多的内容。但是绝不是说一天200本。比如说我，还是按原来的这个故事大纲再往前写，故事大纲我自己有一个设定，包括故事的各种深层次含义的设定，我们都把它写好，写完了以后再让AI去帮我们填肉，让AI帮我们去检查，让AI帮我们去润色。这个过程应该是人跟AI一起配合来工作的。</p>



<p class="wp-block-paragraph">就像Photoshop刚出来的时候，很多传统的设计师是不愿意使用Photoshop的，但是现在他们认为……</p>



<p class="wp-block-paragraph">使用Photoshop，已经算是设计师的基本技巧了。比起这些使用AIGC的人，还是算原创了。再往后一步，可能使用AIGC的人也算原创了。那种不劳而获的人，才是真正应该去骂的人。或者应该快速地拥抱AI。那么，平台应该如何拥抱AI呢？不是像现在这样，就给大家提供一堆的AI创作工具就完事了，而是什么呢？平台应该会封杀AI洗稿内容，对吧？就像刚才我们讲的，有一个基本的框架了，然后只管在后边改名字就完事了。这是不对的。</p>



<p class="wp-block-paragraph">其实洗稿这件事，在AI出来之前就有人洗。我们也见过很多的公司，直接把中文系的学生毕业了以后全包下来，坐在那写稿。他们怎么写呢？他们有完整的流程，先看看哪本小说好，完了以后进行提纲的提炼，再进行前后次序的颠倒，然后改名字，再去让人照着这个提纲去写小说。现在呢，只是把这些人的工作替换掉了，由AI来搞定。</p>



<p class="wp-block-paragraph">但是以前人写稿的小说，都是出现在什么火车站、飞机场、长途汽车站。它就属于是盗版书，他们那种书印的字特别小。现在呢，通过网络去传播，通过微信公众号，通过很多这种私域的方式去传播这种小说。以前大家也知道，这些小说算盗版小说，不敢明着卖。现在平台也是会封杀这些小说的，为什么呢？因为这些小说多了以后，对于平台本身是不利的。你太多的这种喜感小说进来以后，真人作者就全跑了，以后就没有新套路。</p>



<p class="wp-block-paragraph">大家始终在这里去洗这种最底层套路的东西。你的用户可能也就慢慢流失掉了，留下来的都是一些缺乏购买力的用户。不是说吸引不到人，还是会吸引到一些人，但是这些人就属于三低人群：低年龄、低文化、低收入。你希望他给你创造很多的收益吗？这事是很难的。</p>



<p class="wp-block-paragraph">平台下一件事该做的是什么呢？就是提升检测工具，这种内容给它识别出来啊，谁是写稿的文啊，谁不是要能认出来。然后呢，版权保护的标准也有待提升。原来这种书因为比较少，所以呢，他可以靠举报来去找到这种盗版书，现在已经不一样啊，这种内容非常多，一天可以生产200本了。那么，他需要靠自动化的方式，光靠一尺道高一丈啊，我们应该可以能够识别这样的洗稿内容。只有原创的新故事，才是真正有价值的东西，也只有真人才能生产出来这种原创的新故事，至少目前为止是这样。</p>



<p class="wp-block-paragraph">平台还需要干的一件事呢，就是积极的探索新的阅读与交互方式。因为传统的都是说啊，写出小说来大家看，看完了以后，甭管你是去看广告也好，还是去付费也好，平台以此来盈利。现在因为你创造内容更多了嘛，就可以有些新互动模式。是什么呢？比如互动小说如何服务好作者，而作者跟读者之间的界限呢，就会更加模糊一些啊。最早的网文作者其实也都是读者，我们看别人写的很好，我也要写一个，也是这么来的。</p>



<p class="wp-block-paragraph">那么以后的话，可能这个界限就会更模糊。平台最终所需要的呢，还是有流量，但流量一定是要靠什么？更多的原创故事，你才可以有更高质量的流量回来。所以平台呢，会在AI应用的过程中进行一个平衡路线的选择。他们需要AI来去帮他们创作更多的内容，但同时呢，他们也会限制AI，不能把真正的真人作的内容给他洗掉，把所有真人都洗跑了，这事就没法玩了。</p>



<p class="wp-block-paragraph">这个呢，就是今天我们讲的网文作者面对中国最大小说平台番茄小说打响了反对AI训练的第一枪的故事。感谢大家收听，请帮忙点赞点小铃铛，参加Disco讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道，再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
