<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>幻觉问题 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/%E5%B9%BB%E8%A7%89%E9%97%AE%E9%A2%98/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Sun, 04 May 2025 00:47:44 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>幻觉问题 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>阿里Qwen3重磅发布：是超越Llama 4的划时代的胜利，还是性能未达预期、被过度炒作的技术翻车现场深度剖析？</title>
		<link>https://lukefan.com/2025/05/04/%e9%98%bf%e9%87%8cqwen3%e9%87%8d%e7%a3%85%e5%8f%91%e5%b8%83%ef%bc%9a%e6%98%af%e8%b6%85%e8%b6%8allama-4%e7%9a%84%e5%88%92%e6%97%b6%e4%bb%a3%e7%9a%84%e8%83%9c%e5%88%a9%ef%bc%8c%e8%bf%98%e6%98%af/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 04 May 2025 00:47:42 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Agent能力]]></category>
		<category><![CDATA[AI agent开发]]></category>
		<category><![CDATA[DeepSeek R1 对比]]></category>
		<category><![CDATA[Gemini 2.5 Pro 对比]]></category>
		<category><![CDATA[GitHub 开源]]></category>
		<category><![CDATA[GPT-4o 对比]]></category>
		<category><![CDATA[Grok 对比]]></category>
		<category><![CDATA[Llama 4 对比]]></category>
		<category><![CDATA[MCP协议支持]]></category>
		<category><![CDATA[MOE模型 (混合专家模型)]]></category>
		<category><![CDATA[Ollama]]></category>
		<category><![CDATA[Open Router]]></category>
		<category><![CDATA[PC端应用]]></category>
		<category><![CDATA[Qwen3]]></category>
		<category><![CDATA[XAI 对比]]></category>
		<category><![CDATA[上下文窗口 (128K/256K)]]></category>
		<category><![CDATA[专业数据]]></category>
		<category><![CDATA[云部署]]></category>
		<category><![CDATA[人工智能 (AI)]]></category>
		<category><![CDATA[代码生成]]></category>
		<category><![CDATA[优缺点]]></category>
		<category><![CDATA[全系列模型 (0.6B-235B)]]></category>
		<category><![CDATA[划时代的胜利 vs 翻车]]></category>
		<category><![CDATA[千问3]]></category>
		<category><![CDATA[原生数据]]></category>
		<category><![CDATA[参数效率]]></category>
		<category><![CDATA[合成数据]]></category>
		<category><![CDATA[后训练]]></category>
		<category><![CDATA[商业应用]]></category>
		<category><![CDATA[多场景适配]]></category>
		<category><![CDATA[多语言支持 (119种)]]></category>
		<category><![CDATA[大语言模型 (LLM)]]></category>
		<category><![CDATA[工具调用]]></category>
		<category><![CDATA[幻觉问题]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[强化学习 (RLHF)]]></category>
		<category><![CDATA[微调 (Fine-tuning)]]></category>
		<category><![CDATA[性能分析]]></category>
		<category><![CDATA[性能评测]]></category>
		<category><![CDATA[技术创新]]></category>
		<category><![CDATA[指令遵循]]></category>
		<category><![CDATA[数学推理]]></category>
		<category><![CDATA[数据来源]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[模型使用]]></category>
		<category><![CDATA[模型发布]]></category>
		<category><![CDATA[模型对齐]]></category>
		<category><![CDATA[混合推理架构]]></category>
		<category><![CDATA[用户体验]]></category>
		<category><![CDATA[田忌赛马策略]]></category>
		<category><![CDATA[真实感受]]></category>
		<category><![CDATA[硅基流动]]></category>
		<category><![CDATA[移动端应用]]></category>
		<category><![CDATA[稠密模型]]></category>
		<category><![CDATA[评测数据]]></category>
		<category><![CDATA[逻辑推理]]></category>
		<category><![CDATA[长思维链]]></category>
		<category><![CDATA[阿里云百炼]]></category>
		<category><![CDATA[阿里大模型]]></category>
		<category><![CDATA[预训练 (36T数据)]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2156</guid>

					<description><![CDATA[啊啊啊啊啊啊不允许还有人不知道这个AI圈大地震！！！连夜实测Qwen3模型全家桶，这波阿里真的赢麻了！！（疯狂拍桌.gif）

🔥🔥全尺寸覆盖的AI大杀器
从0.6B到235B全系通杀！
手机跑AI不是梦！！！
（掏出手机狂戳.jpg）
0.6B模型在iPhone15上丝滑运行
写文案/改代码/做翻译三秒出结果
学生党上课摸鱼神器实锤了！！

💥推理黑科技原地封神
发现惊天隐藏开关！！
长按对话框输入「/推理模式on」
瞬间开启学霸解题模式
（数学题解题过程疯狂滚屏.gif）
考研党/码农/科研狗集体起立鼓掌！！！

🌍119语种支持实测
（掏出祖传方言测试）
东北话十级选手狂喜！！
「整两斤猪肉炖粉条子」
秒出菜谱+热量计算+采购清单
（但斯瓦西里语有待调教）

🚀Agent模式原地起飞
接入高德API实测：
「从三里屯到798的文艺路线」
自动规划咖啡馆+美术馆打卡点
打工人摸鱼旅行一键生成！！

（敲黑板！！重点来了）
⚠️避坑指南：
1️⃣ 8B模型跑复杂任务会卡壳
2️⃣ 小语种生成建议切中英模式
3️⃣ 伦理安全锁记得开最高档

（疯狂安利环节）
学生党闭眼冲4B版！！
打工人直接上32B云端！！
极客大佬235B本地部署走起！！
（附部署教程指路评论区）

现在立刻马上！！
去阿里云百炼薅羊毛！！！
新用户免费额度够玩三天三夜
（别等被卷王们挤爆服务器！！）

（结尾暴言）
Qwen3这波操作我直接跪了！！
AI全民化时代真的来了！！！

阿里Qwen3重磅发布：是超越Llama 4的划时代的胜利，还是性能未达预期、被过度炒作的技术翻车现场深度剖析？

阿里最新开源大模型Qwen3震撼发布，引发业界对其究竟是“划时代的胜利”还是“翻车”的热烈讨论。本文深度解析Qwen3的全配置特性，覆盖从0.6B到235B MOE多种参数量模型，支持Ollama等方式进行本地部署及云端便捷使用，具备高达128K上下文窗口和119种多语言处理能力。评测显示Qwen3性能优越，部分场景接近Gemini 2.5 Pro，在Agent能力上通过原生支持MCP协议实现突破，显著提升工具调用效率，优于DeepSeek R1。尽管在复杂推理和指令遵从上仍有提升空间，但相较于Llama 4在开放性、模型尺寸及MCP支持上的不足，Qwen3凭借其完全开源、尺寸灵活、易于微调的优势，被视为AI和LLM领域的一次重要成功，有望在Agent时代引领微调生态发展，挑战现有格局。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="阿里Qwen3重磅发布：是超越Llama 4的划时代的胜利，还是性能未达预期、被过度炒作的技术翻车现场深度剖析？" width="900" height="506" src="https://www.youtube.com/embed/POB_gaK1Anc?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Qwen3发布了。这到底是划时代的胜利，还是翻车了呢？</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。Qwen3真的是千呼万唤始出来。前面好几周就已经不断有传言说Qwen3要发布，要多么多么强大。突然发布之后，当然也肯定是伴随着一大堆的评测数据了。官方评测数据呢，永远是我超越了谁、超越了谁。但是很多评测的人呢，觉得好像差那么一点点意思，没有达到预期。所以今天我们来讨论一下，这到底是又一次划时代的胜利，还是翻车。</p>



<p class="wp-block-paragraph">Qwen3呢是凌晨发布的，4月29日凌晨上线，在Github上全面开放。我呢已经开始用上了。使用的方法有几种：</p>



<p class="wp-block-paragraph">第一种是本地部署。我是MacBook Pro，M2 Max的芯片，32G内存。其他的不重要，你到底有多少硬盘，这个事没有那么重要。本地使用OlAmA部署，我使用了8B、32B和30B-A3B。最后这个是什么意思？最后是一个MOE的模型，它是30B-A3B，就是说它每一次干活的时候激活3B，也就是30亿参数。它是这样的一个标注。就这三个版本的模型，在我本机都可以跑，速度呢都是还可以接受。</p>



<span id="more-2156"></span>



<p class="wp-block-paragraph">云端，第一个你肯定上阿里他们自己家玩去。阿里云百炼平台，使用支付宝或者淘宝账号刷一下，就可以进去使用了。价格还是很便宜的，特别是一些很大的模型，还是要在这个上面才能去跑起来。然后open Router永远是最快的。4月29号凌晨发布的，4月29号白天就可以在这个平台上用上了。硅基流动稍微晚一点，大概到5月1号可以去使用了。</p>



<p class="wp-block-paragraph">那么Qwen3有什么样的特性呢？第一个是全配置，这个非常非常重要。什么叫全配置？就是它从很小的模型到很大的模型，所有的配置都是完整的。首先它提供了稠密模型，不是MOE，就是单个的这种稠密模型，从0.6B、1.7B、4B、8B、14B、32B，这些都提供了。MOE模型提供了30B-A3B和235B-A22B。235B-A22B这种模型什么意思？就是说一共是2,350亿参数，每一次激活220亿个参数。它是这样的两个MOE模型。</p>



<p class="wp-block-paragraph">全场景。你在移动端0.6B到4B这样的模型，在移动端没有任何问题都可以跑。说我在终端推理，或者是在PC端跑一跑，做一些商业应用，8B、14B、32B都是可以跑的。你说我有一些复杂任务，或者做一些AI agent开发，30B或者是235B的两个MOE模型非常好用。而且呢是全语种，它支持119种语言。不过这块有人在吐槽。</p>



<p class="wp-block-paragraph">这119种语言，好像除了中文、英文和常见的几种语言之外，其他什么斯瓦西里语这种奇奇怪怪的语言，支持的并没有那么好。</p>



<p class="wp-block-paragraph">训练的过程呢，稍微的跟大家展开讲一讲。预训练用了36T的数据。LLAMA4的预训练数据的话是30T，Qwen3的话，比LLAMA4的训练数据集还要再大一些。</p>



<p class="wp-block-paragraph">它的第一阶段呢，是使用了30T的数据，训练了一个基础语言模型出来。第二阶段用5T的数据呢，去强化STEM，也就是这种科学相关的能力，以及编程相关的能力。到第三阶段呢，就是扩大上下文。一开始这个上下文是比较小的，经过第三阶段的扩大以后：</p>



<p class="wp-block-paragraph">&#8211; 4B以下的模型，也就是刚才我们说的0.6B、1.7B、4B这三个模型，它们的上下文呢达到了32K。<br>&#8211; 大于4B的模型，也就是8B、14B、32B，以及MOE的两个模型30B和235B这几个模型，他们的上下文呢都已经达到了128K。<br>&#8211; 在一些特殊情况下，可以达到256K的上下文。</p>



<p class="wp-block-paragraph">这块呢，有待继续提升吧，因为LLAMA4的上下文是10兆，要比它大很多。</p>



<p class="wp-block-paragraph">数据来源，就是拿什么数据来训练的这个东西：<br>&#8211; 60%的数据呢，是互联网原生数据。<br>&#8211; 25%呢，是专业领域的数据，包括GitHub上面的代码、数学公式、科学数据。<br>&#8211; 还有15%呢，是合成增强数据，就是拿其他的大模型去生成的一些数据，用的是Qwen2.5的一些模型生成了一些数据。这块呢，主要是做一些推理链的训练，而且也可以做多语言的对齐。</p>



<p class="wp-block-paragraph">这就是它的数据来源。这块呢，跟LLAMA4就有很大的区别。LLAMA4大量的使用的都是合成数据，而这个Qwen3的话，使用的大量是原生数据。</p>



<p class="wp-block-paragraph">在预训练之后，还会进行后训练。后训练的话，实际上是对模型做微调了。他呢，在分四步对Qwen3进行微调：<br>1. 第一步是长思维链冷启动的训练，注入数学、代码等领域的常推理数据。<br>2. 第二步呢，是强化学习探索强化学习，就是你给我生成结果，我们来打分，然后你根据我的打分来决定说这个结果对不对。它是基于规则奖励，提升复杂推理能力的一个训练。<br>3. 第三步呢，是模式融合。这个东西特别好玩，它是一个融合模式的推理模型。什么意思呢？因为我们使用推理模型的时候，有一个特别讨厌的东西，就是有些特别简单的东西呢，给你推理半天，甚至推理的TOKEN还消耗了很多。对于Qwen3来说呢，它里头有一个参数，就是你是不是要打开推理。同一个模型呢，你可以在这设说你不要打开推理，他就快速的给你出一结果。你说你给我做推理。</p>



<p class="wp-block-paragraph">就给你啰里八嗦的去想去了，这个也算是个创新吧。原来都是推理模型，就是必须要推理。他是做了这样的一个训练，然后第四步呢是进行通用校准，特别是覆盖20多个领域的强化学习，修正一些不良行为。他等于做了预训练之后，还做了大量的微调后训练。</p>



<p class="wp-block-paragraph">那么，Qwen3的技术创新到底有哪些呢？</p>



<p class="wp-block-paragraph">第一个就是它这个混合推理架构。就是你到底想不想让它推理，你告诉他就完了。他给你去推去，或者是直接给你一个答案。</p>



<p class="wp-block-paragraph">第二个技术创新呢，就是它的MOE的参数效率极大提升了。它的235B的模型里头，每一次激活只激活22B的参数。它要比DeepSeek R1激活的参数要少很多，只有DeepSeek R1 1/3的参数。它整个的模型尺寸也只有DeepSeek R1的1/3。所以呢它的部署成本要比DPC卡R1要低很多，推理的效率也要高非常多。</p>



<p class="wp-block-paragraph">第三个呢就是多语言和多模态的支持。第一次支持了119种语言，2025年内将推出Qwen3-Vl多模态版本。现在的Qwen3还不支持多模态，你给他张图片他还是认不出来的。这块还是比LLAMA4要差一点。LLAMA4是你给他个视频，他都可以给你进行推理。</p>



<p class="wp-block-paragraph">最后，Agent能力增强。它呢是直接支持MCP，原生支持MCP协议，工具调用准确率提升40%，API代码量减少70%。这个是Qwen3在这一个时代里头，必须要去实现的功能。这也是它比LLAMA4强的地方。</p>



<p class="wp-block-paragraph">对Qwen3的期待、评分以及使用感受方面，还是有一些落差的。各项评分一定是高的吓人。因为你现在说，我今天推出一个新模型出来，你一定会自己做一大堆评测，然后跟模型一起推出。如果你说我自己做的评测就比谁都差，那这事你还推它干嘛？一定是说我现在评测了，比大家都强了，我才可以推出来。所以评分一定都比大家强。这块呢，就不跟大家详细去列举说那个评分是多少了，没有什么意义。</p>



<p class="wp-block-paragraph">但是呢，这个里头比较好玩的是什么？就是它是一个田忌赛马的故事。大家知道什么叫田忌赛马吗？用我们的比较差的马，跟人家那个最好的马比，我输掉了。然后呢我用我的最好的马去跟人家的中马比，我赢了。用我的中马去跟他的最差的马去比，我又赢了。等于三局两胜，我赢两盘。他是很多做这样的这种比较。</p>



<p class="wp-block-paragraph">为什么Qwen3有田忌赛马的这个能力呢？你比如说，8B的模型可以达到人家的32B的效果。我现在是32B的模型，我可以达到原来72B的效果。他等于做了很多这种错位的比较，我用更小的模型。</p>



<p class="wp-block-paragraph">达到了以前必须用更大规模模型才可以达到的效果。当然，田忌赛马呢，也未必都是好事。为什么？因为很多人会对这种小参数模型抱有不切实际的期望。一堆人拿来说：“我拿这个8B的模型跑一跑试试，看看我去做一些很复杂的任务，到底效果怎么样？”肯定效果不好。千万不要认为你用8B的模型就可以跑出非常非常好的效果来，这个肯定还是有一些差距的。它可能会在某些特定的领域，或者经过一些微调和训练之后，可以达到32B的效果。</p>



<p class="wp-block-paragraph">绝大部分人对大模型的认知都是停留在什么GPT-4O这个水平的。你要想拿8B的模型去跟这样的模型去比的话，没有任何可比性。那你说我使用这些32B的模型呢？就属于在大部分情况下可以接近GPT-4O这样的一个水平。咱不研究多模态那些东西，就是正常的内容生成，算是接近。至于说它的235B呢，现在距离Gemini 2.5 Pro还是有一些差距的。但是呢，相对于其他的模型来说，基本上算是跑在同一个基准线上了，不比别人差了。</p>



<p class="wp-block-paragraph">Qwen3 235B-A22B的这个最大模型在数学、代码、Agent等方面都是全面超越了DeepSeek R1。部分场景呢，接近Gemini 2.5 Pro。这什么意思？就是全部的场景肯定离Gemini 2.5 Pro还是有一定的差距的，但是有一部分场景接近了。但在复杂语义理解，就特别复杂的情况下，还是有一些差距的。特别是一些复杂的逻辑分析，它是有问题的。真实使用的感受呢，算是能用。比起DeepSeek R1强吗？其实感觉不太出来，基本上可以达到DeepSeek R1的水平。</p>



<p class="wp-block-paragraph">指令依存方面呢，肯定还有一点点欠缺。让他做一个很复杂的动作，他有的时候还是会丢三落四一些。这块我自己试过的，网上也有很多吐槽的人。第一个，复杂推理中的逻辑断层和幻觉生成的问题。所有推理模型身上都有这样的问题，Qwen3即使是最大的模型235B，在这块呢，也不比别人好多少。第二个呢，就是过度思考跟效率问题。有些人发现说：“我给他一个很复杂的问题，他自己开始进行推理了，推理来推理去，直接死在里头了，彻底推不出来了。”这种情况现在也还是存在的。</p>



<p class="wp-block-paragraph">但是呢，也不用太着急。他既然可以进行后训练，可以进行微调，那我相信大家有各种问题去提就完了。Qwen应该会快速的微调出不同的版本出来的。多语言支持的不均衡，你说119种语言，那些小语种支持的肯定没有那么好，因为语料也没那么多嘛。但这一块你想让它提高支持的话。</p>



<p class="wp-block-paragraph">也很简单，拿足够多的语料去微调就完了。他也是可以去支持的。然后还有一些伦理跟隐私方面的风险，因为它可以有非常非常小的模型。所以你可以把这种模型，比如部署在你们家洗衣机里，或者部署到一些很奇奇怪怪的这种角落里面。他的能力还很强。而且这种全开源的模型，还有一些人微调了以后，是可以把他的一些安全限制去掉的。这个就会比较吓人，所以大家对这块呢也有一些担心。</p>



<p class="wp-block-paragraph">还有呢，就是模型对齐和偏好上面的一些问题。比如说吧，生成内容有时候会偏离用户的意图。它对一些指令的依从，还是会稍微差一些的。那么给出一个简单的结论吧，这到底是一次划时代的成功呢，还是翻车呢？我个人的感受呢，这又是一次划时代的胜利。</p>



<p class="wp-block-paragraph">Qwen3真正在跟谁竞争？大家要想清楚：LLAMA 4、DeepSeek R1、Claude 3.7、Gemini 2.5、GROK3、GPT O3 O4这样的模型，到底在跟谁竞争？实际上真正去跟Qwen3竞争的只有一个，就是LLAMA4。其他的都不在同一个起跑线上。</p>



<p class="wp-block-paragraph">LLAMA4呢，是翻车了。它怎么翻车的？第一个是数据造假，或者叫过拟合。拿直接去跑分的题目进行训练，这样跑分效果特别好，但是实际使用的效果差异巨大。这是LLAMA4翻车的一个最根源的原因。</p>



<p class="wp-block-paragraph">咱们从另外一个角度上来讲，LLAMA4自己其实是有一些问题的。第一个是什么？就是它公开的模型太大，占资源很多，放弃了绝大多数的场景。他就开源了一个104B，一个400B的模型。普通人你拿他没办法，像我的电脑根本跑不起来。你就算部署到云端的话，它占资源也是占的非常多的。就对于这个经济性来说，一点优化都没做。你说我想在手机上跑，想在嵌入式设备上跑，没做这个准备，他就不惦记。甚至还有一个两T的模型，压根都没有发布出来。他就发布了一个109B，一个400B，其他都没有了。</p>



<p class="wp-block-paragraph">而且这么大的模型，你想去微调那太痛苦了。就是你想微调一个模型，模型越小越好调。你模型越大的话，你调起来甭管是你的数据还是算力，都是非常巨大的成本。现在看的LLAMA，应该是准备走XAI这条路。</p>



<p class="wp-block-paragraph">XAI是什么路？假开源。为什么马斯克的XAI叫假开源呢？就是我确实把东西开出来了。他承诺的是什么呢？就是我发布新版本，我就把旧版本开源。而且呢，开出来的东西，你要想调用的话，你也调不了。为什么？我只把那最大的模型出来，哐昌往那一扔就完了。各种的文档，各种东西都很少，你部署上去也不划算。</p>



<p class="wp-block-paragraph">所以呢，我开源了吗？开了，东西也放这了。能用吗？没法使。你提任何问题、提任何要求，说哪给我改一东西，也没人理你。这就是XAi的玩法。</p>



<p class="wp-block-paragraph">你要想调用这些东西怎么办？到我服务器上来调用XAI的API，这个是没问题的。我现在也在Grok的服务器上去调用它的API，效果也还可以。但是你说有没有第三方去部署Grok模型，然后让大家去调用呢？没有。因为你现在开源出来的版本低，它的效果没有那么好。你要想使用最新的，你只能在他的服务器上使。以后呢，Meta估计也要走这条路。</p>



<p class="wp-block-paragraph">那你说为什么没有人骂XAi呢？原因很简单，因为XAi一直就这样。从x开放出来的这个推荐算法，开放出来以后，就再也没有更新过任何代码。你提的所有问题，连回复都没有人回复。XAi更新出来的Grok开源模型也是如此，开源出来啪往那一扔，彻底没人理你了。所以它一直这样。</p>



<p class="wp-block-paragraph">而LLAMA呢，原来是比较开放的。现在大量的模型都是在LLAMA基础上做出来的，包括Qwen早期的模型，都是在LLAMA基础上做出来的。那现在呢，有点越来越回去了，所以有点怒其不争。大家要骂一骂他，看看能不能把他骂回来。</p>



<p class="wp-block-paragraph">然后另外一个，LLAMA4被人骂的原因是什么？他不支持MCP。现在是一个做Agent的时代，你不支持MCP，你模型能力再强，你也搞不定各种场景。现在即使是你使用GBT 4O或者GBTO 3这样的模型，你没有一些外接的组件，你根本就跑不出结果来。所以你不支持MCP，这事肯定不行。</p>



<p class="wp-block-paragraph">还有呢，就是LLAMA对用户是有限制的。LLAMA虽然是开源模型，但是呢，不能进行商业使用。你只能拿去做研究。你说我拿这东西做商业使用了，对不起，你会收到律师函的。而且如果你是一个大公司，月活用户数超过7亿的公司，你如果想使用LLAMA4或者LLAMA早期版本，你需要向Meta做单独的申请。申请通过了以后你才可以去使用，否则不让用，就做了很多限制。</p>



<p class="wp-block-paragraph">这个反面典型讲完了，咱们讲一讲Qwen3跟LLAMA4比较起来是怎么样的。Qwen3完全开源，你爱干嘛干嘛去，想怎么调怎么调。第二个，体积小，参数少，规格全，性能高。从0.6B就开始，所有的都给你发一遍，爱用哪个版本用哪个版本。这些小体积的模型，经过微调之后应该会一统江湖。</p>



<p class="wp-block-paragraph">什么意思？就是现在在hugging face上，绝大部分的模型都是拿Qwen2.5、Qwen2这些各个尺寸的模型调出来的。</p>



<p class="wp-block-paragraph">早期的LLAMA还是各个尺寸都有的。现在到LLAMA4，前面那些小的模型就不出了。Qwen3又把所有的模型都出了一遍，那大家就拿来微调呗。你说哪块不满意，我就专门把它调一调，训练一下上去使不就完事了吗？所以一定会一统江湖的。</p>



<p class="wp-block-paragraph">而且，Qwen3是原生支持MCP的。我在本地部署了OLAMA 8B的模型，使用Cherry studio测试了一下，支持没有任何问题。但是呢，支持的并不是那么顺畅。30B和32B的模型我在本地也装了，完美支持MCP，没有任何问题。</p>



<p class="wp-block-paragraph">那你说什么叫支持的不顺畅？什么叫支持的顺畅呢？在这跟大家讲一讲使用MCP的过程。其实很简单，MCP也是描述一下工具，说我这有一工具，这工具叫什么什么名字，输入的参数是什么，输出的参数是什么，能干什么。大概是有这样的一个描述文件，你把这描述文件给到大模型以后呢，大模型会根据你提出的要求，来生成一个调用这个工具接口的代码。</p>



<p class="wp-block-paragraph">这个8B的模型呢，有时候生成的代码会有点小错误，导致呢调用失败。那调用失败了以后呢，他会换一个方式，再调另外一个接口，然后会得出一个需要的结果出来。你使用32B模型，或者30B的Qwen3模型的话，你把一大堆的描述扔给他以后，他就会正确的找到需要使用的接口，需要使用的工具，然后生成调用代码直接调。调完了以后得到结果，需要再调用的话，还可以在一次推理里头多次调用，然后得到结果。</p>



<p class="wp-block-paragraph">因为我是放的高德地图的MCP进去，说来给我规划一个旅游路线，这个效果好极了。完完全全在本地，当然高德地图那个服务器不在本地。其他的，他的Qwen3，OLAMA，Cherry studio都是在本地跑起来了，所以这块效果好极了。</p>



<p class="wp-block-paragraph">现在呢是大模型密集发布的一个周期。前面我们看到了Gemini 2.5 Pro，Gemini 2.5 Flash，GPT也在快速的连续发布。后边还会很快看到一些新东西，包括马斯克下周要发布的Grok 3.5。Qwen3出来以后，如果有哪些方面超越了它，那它是肯定是要更新的嘛。GPT5应该也快了，这就是这样的一个风起云涌的大时代。</p>



<p class="wp-block-paragraph">好，总结一下吧。Agent时代一定要有一个对Agent友好的模型发布出来，才会被大家叫好，才算是一次成功的发布。体积小，参数少，规格全，性能高，只要可用性不退步，方便微调，这些特性都具备的话，再加上前面的MCP的功能，Qwen3绝对是一次划时代的成功。好，这就是今天讲的故事。</p>



<p class="wp-block-paragraph">大家赶快去玩耍起来！好，感谢大家收听。请帮忙点赞，点小铃铛。参加DISCORD讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？</title>
		<link>https://lukefan.com/2025/02/20/grok-3%e5%8f%91%e5%b8%83%ef%bc%9aelon-musk%e7%a7%b0%e5%85%b6%e4%b8%ba%e5%ae%87%e5%ae%99%e6%9c%80%e8%81%aa%e6%98%8e%e5%a4%a7%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%9a%b4%e5%8a%9b%e5%87%ba/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 20 Feb 2025 00:40:03 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Musk传奇]]></category>
		<category><![CDATA[20万GPU]]></category>
		<category><![CDATA[AI API]]></category>
		<category><![CDATA[AI参数]]></category>
		<category><![CDATA[AI商业化]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI安全性]]></category>
		<category><![CDATA[AI对比]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[AI快速迭代]]></category>
		<category><![CDATA[AI排行榜]]></category>
		<category><![CDATA[AI架构]]></category>
		<category><![CDATA[AI模型评测]]></category>
		<category><![CDATA[AI模型选择]]></category>
		<category><![CDATA[AI流量大战]]></category>
		<category><![CDATA[AI测试策略]]></category>
		<category><![CDATA[AI用户体验]]></category>
		<category><![CDATA[AI直播发布]]></category>
		<category><![CDATA[AI订阅]]></category>
		<category><![CDATA[AI训练]]></category>
		<category><![CDATA[AI语音识别]]></category>
		<category><![CDATA[AI迭代]]></category>
		<category><![CDATA[Deep Research功能]]></category>
		<category><![CDATA[Deep Search功能]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek对比]]></category>
		<category><![CDATA[DeepSeek开源]]></category>
		<category><![CDATA[DeepSeek模型]]></category>
		<category><![CDATA[DeepSeek训练]]></category>
		<category><![CDATA[DeepSeek论文]]></category>
		<category><![CDATA[Grok 2]]></category>
		<category><![CDATA[Grok 3]]></category>
		<category><![CDATA[Grok 3发布会]]></category>
		<category><![CDATA[Grok 3对齐]]></category>
		<category><![CDATA[Grok 3费用]]></category>
		<category><![CDATA[Grok APP]]></category>
		<category><![CDATA[OpenAI对比]]></category>
		<category><![CDATA[Think与Deep Search对比]]></category>
		<category><![CDATA[Think功能]]></category>
		<category><![CDATA[XAI]]></category>
		<category><![CDATA[XAI发展]]></category>
		<category><![CDATA[XAI发布会]]></category>
		<category><![CDATA[XAI合伙人]]></category>
		<category><![CDATA[XAI商业方向]]></category>
		<category><![CDATA[XAI测试]]></category>
		<category><![CDATA[x平台]]></category>
		<category><![CDATA[X平台订阅]]></category>
		<category><![CDATA[世界工厂]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[合成数据]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[大模型幻觉]]></category>
		<category><![CDATA[幻觉问题]]></category>
		<category><![CDATA[推理功能]]></category>
		<category><![CDATA[数据清洗问题]]></category>
		<category><![CDATA[智能模型]]></category>
		<category><![CDATA[暴力迭代]]></category>
		<category><![CDATA[最聪明模型]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[深度研究功能]]></category>
		<category><![CDATA[马斯克]]></category>
		<category><![CDATA[马斯克AI]]></category>
		<category><![CDATA[马斯克的大模型]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1923</guid>

					<description><![CDATA[🚀 **我宣布！Grok 3 真的可以改变阶级！**

大家好，今天我要跟大家聊一聊马斯克的Grok 3，这款被马斯克誉为“世界上最聪明的大模型”的AI神器！😱

首先，Grok 3的发布可谓是科技界的一大盛事。在2月18号，马斯克和他的小伙伴们通过一场直播正式发布了Grok 3。作为一个科技迷，我当然第一时间去体验了这款新模型！🔍

Grok 3的功能非常强大，它有两个主要按钮：Deep Search和Think。Deep Search类似于OpenAI的Deep Research，可以搜索大量的内容并生成详细的报告。而Think则类似于推理模型，可以进行逻辑推理并生成简短文案。这两个功能可以单独使用，但不能同时使用。🤔

不过，Grok 3的体验也有一些小瑕疵。比如，在Deep Search时，生成的报告有时会出现内容重复的情况。而Think功能虽然能生成较为简洁的文案，但在编程方面的表现还有待提升。😅

总的来说，Grok 3作为一款新晋的大模型，虽然存在一些小问题，但其强大的功能和潜力不容小觑。如果你是科技爱好者，或者想要在AI领域有所突破，Grok 3绝对值得一试！💪

#Grok 3 #马斯克 #AI大模型 #科技前沿 #智能助手

Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？

马斯克自称Grok 3是“世界上最聪明的大模型”，但其功能和使用体验正引发广泛争议。Grok 3采用了高昂的订阅费用，仅支持高级用户访问，其深度研究（Deep Search）和推理（Think）功能虽颇具创新但问题频繁，如重复内容和严重幻觉。其基于20万张GPU暴力迭代的快速开发模式，更是被比喻为“AI界的世界工厂”，但用户体验仍未达到预期。文章详细剖析了Grok 3的架构、功能、发布策略以及与DeepSeek和其他开源模型的对比，探讨XAI未来的竞争策略与挑战。关键词：Grok 3、马斯克、XAI、DeepSeek、AI大模型、暴力迭代、幻觉问题、用户体验。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？" width="900" height="506" src="https://www.youtube.com/embed/qBvMVcGKFws?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">马斯克的Grok 3到底是不是世界上最聪明的大模型？暴力真的能出奇迹吗？大家好，欢迎收听老范讲故事的YouTube频道。世界上最聪明的大模型，这是马斯克对他自己家的Grok 3给的定义。如果有人不同意的话，那么会被开除的。因为XAI某一位员工在X上发帖说，Grok 3好像并没有那么聪明，然后就被XAI找到说，你要么删帖要么开除。后来这哥们想了想说，我得捍卫一下自己的言论自由，于是这哥们就被开除了。</p>



<p class="wp-block-paragraph">在说所有细节之前，咱们先说说Grok 3到底怎么用。在2月18号北京时间中午12点的时候，马斯克跟另外三位小伙伴，一共四个人坐着开了场直播，把这个Grok 3发布了。我就四处去找，首先我是X每个月交8美金的Premium用户，我在X上使不了。X上你必须是40美元的Premium+用户，才可以去使用。在Grok的这个网站上呢，你也需要30美元一个月的账号才可以用。免费用户只能用Grok 2，API不充钱已经不让用了。如果是团队的话，至少花了5美元以上，每个月他会赠送你150美金，但前提呢是要跟XAI共享你的数据。</p>



<p class="wp-block-paragraph">目前Grok 3的版本还没有上，你就算交钱了，你在XAI的网站上，也只能得到Grok 2的API，还要再等几周才会上线。Grok的苹果APP上面，是可以使用Grok 3 Beta这个版本的，即使是免费用户也可以去用。因为我呢对于XAI来说是一个免费用户，我就通过iOS，也就是iPhone和iPad这个版本上去，好好儿的测试了一下。后边儿呢咱们再去讲具体效果怎么样。</p>



<span id="more-1923"></span>



<p class="wp-block-paragraph">Grok 3有哪些具体信息呢？在整个的发布过程中呢，并没有特别详细的讲，只是说，我各种排行榜都排在第一了。Grok 3，Grok 3 mini是怎么去排上去的，讲了很多这样的话。但是呢，这个系统本身的一些细节，并没有那么详细的公开。因为可能在Grok 3稳定下来以后，会把Grok 2开源。现在Grok 1是开源的。</p>



<p class="wp-block-paragraph">Grok 2可能有一些细节会被披露出来，但是Grok 3的话应该很长一段时间不会有特别详细的细节披露出来。现在能够知道的就是，Grok 3应该也是一个MoE模型，跟DeepSeek是一样的。它到底有多少参数呢？现在猜测是有1.2万亿个参数，DeepSeek是6,710亿，它呢应该是在DeepSeek的基础上翻了一番。至于这个数字是不是准确，我不知道，因为呢我去问了Grok 3，也去问了ChatGPT，最终是给了我一个这样的数字，我并没有去查原文件。</p>



<p class="wp-block-paragraph">Grok 3的使用感受到底是什么样的？它呢，下边有两个按钮，一个叫Deep Search，一个呢叫Think。Deep Search实际上就类似于OpenAI的Deep Research，就是这种深度研究，它会搜索大量的内容，然后呢，再去给你出报告。Think的话实际上就是类似于O1、O3这样的推理模型。这两个按钮它特别有意思，这两个按钮呢你可以都不按，也可以按其中一个，但是不允许两个都按。这个意思大家能够理解吧？你不能又要Think，又要Deep Search，这个事是不允许的。那你说我既不Think也不Deep Search，这事行不行？可以。</p>



<p class="wp-block-paragraph">然后呢，我都试了一下。在Deep Search的时候，它会直接引用几十个甚至上百个网页，非常非常多的网页，然后呢给你一个似模似样的报告，很长，格式非常非常好的一份报告。在Think的时候呢也会搜索，并不是自己去瞎编的，他呢，会搜索25个网页，以及呢X上的帖子。大家注意，Deep Search时候是不搜索X的，在Think的时候是会搜索25个网页，加上X上的可能5个帖子吧，反正我搜了几次都是5个帖子，然后给你进行一定的推理，总结出一个小的文案出来。这就是这两个功能。如果两个都不选，我既不Think也不Deep Search，它呢就不联网了，就直接是给你编一个结果出来。</p>



<p class="wp-block-paragraph">大家注意，所有的大模型，甭管是谁家模型多聪明，你让他直接编出来的这个结果，都是最不靠谱的。那么，他这三个功能，就是两个都不选，或者选其中任何一个。这三个功能呢，特别有意思的一点是什么？他可以混用。</p>



<p class="wp-block-paragraph">在OpenAI上呢，这种模型混用是比较严格的。你如果开始一个新话题，选择了一个模型，提了几个问题之后，你现在想去切模型的时候，你这个模型，比如说允许有图片呢，下面你要去切的时候，只允许再切换到允许图片的模型。它不允许你切换到不允许读图片的模型去。这个是有限制的。但是呢，在Grok里面它是没有限制的。就是你随时可以开始新对话，对话的过程中可以随时切模型，你可以来回切来切去。</p>



<p class="wp-block-paragraph">但是呢，在这个过程中呢，有一些不是那么有趣的地方是什么？就是如果你俩都不点上来，直接让模型去编，他就不联网了。他编完第一句以后呢，你说我现在要开始进行深度的搜索了，deep search了，这个时候他也不联了。或者说我现在需要think了，他也不会去联网，他就根据现有的内容接着编下去。他是这样的一种过程。</p>



<p class="wp-block-paragraph">但如果你是以deep search开始的，那么think的时候呢，他就不去搜索帖子，因为deep search是不搜索X的。如果你是以deep search或者think开始，然后你最后切换回到完全编的，既不deep search，也不think的这样的一个裸模型，去输出的时候，继续搜索。所以它整个的逻辑，还稍微有一点点小混乱吧。</p>



<p class="wp-block-paragraph">那么，Grok 3到底是不是宇宙第一聪明的这个模型呢？因为你如果用iOS APP你去选的时候，后面会写一个叫smartest，最聪明的。它是Grok 3 beta，后边写一个小括号，smartest，这个是最聪明的。到底是不是？我个人感受呢，现在相差还比较远。为什么呢？为了准备这期节目呢，我其实用Grok 3去做了很多的工作，包括是他的deep search或者think。但是最终呢。</p>



<p class="wp-block-paragraph">Grok3生成的所有结果都被我扔掉了。最后的内容还是靠豆包和GPT search来完成的。原因也很简单，Grok 3 deep search现在报告的格式非常好，非常中规中矩，但是大量的段落是重复的。前边写了一遍，后边车轱辘话又写了一遍，用不同的格式，用同样的话来回来去说，这个是很讨厌的。</p>



<p class="wp-block-paragraph">还有一个问题是幻觉大到完全无法使用的一个状态。比如说，我问他XAI现在有多少人了，图说现在有900多人了。后来我问了其他几个模型，都告诉我是有100多人，这个可能还是稍微靠谱一点点。都是联网搜索吗？你都不是自己瞎编的，那我不知道他这个900多人这个数是哪来的。</p>



<p class="wp-block-paragraph">然后我说四个人在上面开发布会嘛，中间两个人是华人。这两天在国内又嗨起来了，说你看马斯克发布Grok3的时候，马斯克只能在一边点头，点头机器。中间是做C位的两个都是华人，旁边还有一个白人。那我就问他，我说这俩华人到底是谁，什么教育背景，然后就开始给我胡说八道。他也是举的XAI里边的一些华人高管，但是呢并不是当时坐在台上这两个人。</p>



<p class="wp-block-paragraph">发生这种事情的原因很简单，就是他在deep search的时候，一下瞪了可能几十个上百个网页，回来拿这么多个网页进行总结的时候呢，把内容搞串了，实际上就产生幻觉嘛，就完全没法使。</p>



<p class="wp-block-paragraph">然后呢，我去尝试了一下think。think呢其实没有特别细致的测试，为什么呢？本来我想去让他做编程，但是呢，他没有API。你没有API的话，就没有办法接到IDE里边去，你没办法作为插件接进去，就没有办法详细地参与到我的这整个的编程过程里头去。我做了些简单的测试，但是感觉呢think模型对于各种编程的复杂的环境，和各种的版本和类库的话，并不是那么熟悉。这块的话可能以后等他有了API以后，再去做详细测试了。直接生成还过得去，就是如果两个都不点，让他直接生成。但是呢，因为在手机上用，并没有办法进行。</p>



<p class="wp-block-paragraph">特别大规模的使用和测试，现在看来呢，XAI的Grok 3采用的是叫分梯度发布的一个方式。就是说，我先发布一点，然后慢慢地让更多的人能用，再慢慢地发布更多的内容出来，然后不断地去迭代。他现在干这样的事情。现在呢，就是手机用户可以用。那么手机用户呢，第一个用户量不会特别大，而且在这个时候，可能还能够为Grok APP带来一批的下载，这个也算是一个小心思吧。</p>



<p class="wp-block-paragraph">在手机用户使用的过程中呢，你不会给他特别繁重的任务。因为你要跟他做这种很复杂的沟通的话，你需要打好多字，举了个手机在这噼里啪啦打字，很费劲的。你像我，为了做这个测试，最后是把我的iPad接到了机械键盘上，夸啦夸啦往里打字，这个还是能够问一些稍微复杂一点东西。要真是拿着手机，在那个屏幕上打字的话，这个还是挺费劲的。还有什么呢，就是不会有太正式的任务是通过手机来进行的。比较正式的任务一般会通过网页，通过电脑来去工作。</p>



<p class="wp-block-paragraph">Grok跟X网站上还是有一些付费的人能够使用的。你不能说老范你没交钱，你就说这玩意不好使。这些比较高付费的用户，比如说在X平台上交了40美金一个月的，或者在Grok平台上交了30美金一个月的，这些用户呢，他是可以去用的。但是这些用户呢，数量肯定会少很多。还有一点呢，就是皇帝的新衣嘛，我付了这么多钱了，我就不能允许任何人说我是傻子，我一定要说这个钱付的是值的。所以呢，就算他们遇到问题了，上来骂街的可能性也不是那么大。这个就是马斯克当前发布了一个版本，比较聪明的地方吧。</p>



<p class="wp-block-paragraph">后面语音模式的话，可能还要再等一周。我估计语音识别率这块还有待优化吧，因为语音你认不出来就是认不出来，还有口音还有乱七八糟这种事情。咱们再看看，后边会做出一个什么样的结果出来。API的话，还需要再等几周。为什么API要这么费劲，原因呢是现在大家只能看马斯克官方的排行榜，我的测试数据是什么样的，排行榜是什么样的，你自己没法去测取，给你一个手机版本。</p>



<p class="wp-block-paragraph">或者给你一个网页版本。你现在想把这几千道题输进去，测试这个事太费劲了。你要想测试这东西，必须要拿API写程序去测。这个过程其实有点像法拉利的一个跑车。法拉利就说了，这个东西太贵，而且做测速的时候太危险。如果你自己去测的话，非常不安全，而且保险公司也不允许我们干这个事情。所以，法拉利跑车的最高极速，只有法拉利官方出的这个版本是唯一标准，任何人不得私自去测试法拉利跑车的最高极速。这个事情我们不承认，而且这个事我们也不允许。</p>



<p class="wp-block-paragraph">现在，XAI的Grok也就是在这样的一个阶段。等以后API上来以后，每一个人都会自己去跑各种各样的测试，或者做多模型的输出结果比较。到那个时候，丑媳妇就真的要见公婆了。下一步的话是要开源Grok 2。DeepSeek是上来直接把最新的模型开源了，而且上来说，你们每家部署的跟我现在自己官网上跑的是一模一样，没有任何差别的。而且不断的有新的技术演进，不断的有新的技术新发现，都直接发论文发出来了。</p>



<p class="wp-block-paragraph">但是，马斯克永远是开源上一代模型。就是他在用Grok 2的时候，他把Grok 1开源了。Grok 3能够稳定正常运转的时候，他会把Grok 2开源出来，可能还要再等那么几周或者是几个月的时间。山姆·奥特曼现在也惦记开源，刚在X平台上发了帖子说：“唉，咱们投个票吧，你们觉得OpenAI应该开源什么样的模型出来？我们是不是应该开源一个在PC本地就可以跑的O3 mini模型出来，还是说我可以在手机端跑一个这个小模型出来？”</p>



<p class="wp-block-paragraph">他们是准备走谷歌跟微软这条路的。谷歌也是这样，它有一个叫Gemmar的模型，比较小的这个模型是开源的，主要也是让大家在端侧来用的。还有，微软做的这个Phi模型，这个模型也是开源的，也是让大家在端侧去使用的。但是我觉得，OpenAI如果真的把它的O3的模型，或者哪怕是O3 mini的模型拿出来开源了，或者让大家能用上了。</p>



<p class="wp-block-paragraph">这也是一个值得期待的事情。讲远了，再往后呢？发布会上，中间两个华人做C位了。这种事情呢，肯定会引起国内的热议嘛。你看，还得看华人吧？华人也比较好认嘛，中国脸。</p>



<p class="wp-block-paragraph">台上是四个人。第一个是马斯克，马斯克坐一个角嘛。另外一个角呢，这个人叫巴布斯基，这个人呢，是个俄罗斯人。中间的两个人呢，一个呢，叫做吴宇怀，XAI的合伙人，浙江人，在国内上完初中，15岁去了加拿大多伦多大学的博士，后来呢，是斯坦福大学的博士后，现在是XAI的合伙人。还有一个呢，叫Jamie BA，这个人呢，没有看到他前面的一些履历，是多伦多大学计算机科学系的助理教授，AI教父Joffrey Hinton的学生。</p>



<p class="wp-block-paragraph">等于一边一个白人，中间两个华人。但其实你要再仔细看一下，这个是全世界人民在美国进行AI创业。一个俄罗斯人，剩下三个可能都是加拿大人。马斯克自己其实是有美国国籍、加拿大国籍和南非国籍的。中间两个，一个是多伦多大学的博士，他大概从15岁就开始在加拿大生活。另外一个的话，Jamie BA是多伦多大学计算机科学系的助理教授。所以有可能，这台上坐的是三个加拿大人和一个俄罗斯人。只是看着脸的话，是这个两个白人和两个华人。</p>



<p class="wp-block-paragraph">那么，XAI未来的策略会是什么样的呢？XAI现在应该也就是100多人吧。它具体是多少，这个数字呢，并没有那么确定。但我还是相信GPT search给我的结果吧，就是不要说900多人了，就是100多人的一个公司。这种公司呢，不太可能进行全面开花，七扯咔嚓我把整个的C端到B端所有东西都做起来。这个事其实有点难度。</p>



<p class="wp-block-paragraph">20万张卡这个事呢，其实是别人都不具备的这个条件。它就可以进行快速的迭代。各种方法只要确认了，说我知道这个方法是什么样的。比如说DeepSeek出了论文了，出了开源模型了，那我方法确认以后，我就可以快速的在20万张卡上给你重现出来，甚至把你的参数翻多少倍再重现一遍。这个事他都是可以干的。这呢，就是暴力出奇迹。</p>



<p class="wp-block-paragraph">就会有这样的结果。这个过程其实大家看看有点像什么呀？是不是有点像世界工厂？别人只要做出来了，反正我这有的是生产力，快速的复制、迭代更新就完了。所以，这个应该就是AI未来的路，就是甭管谁做出来的东西，我都可以快速验证、快速改进我的模型。</p>



<p class="wp-block-paragraph">而且呢，它使用了完全的合成数据进行训练，可能有很少一部分真实数据吧，绝大部分数据都是合成数据。所谓合成数据呢，就是由其他大模型生成的数据。他通过一定的策略，要求其他大模型去给他吐数据出来，然后拿这个模型去训练。</p>



<p class="wp-block-paragraph">Grok 3一旦使用了合同数据的话，会不断的说自己是Grok 2，或者说自己遵守open AI标准。这个事情你就避免不了，因为是用别的模型生成的数据嘛。虽然XAI说我们在生成数据的过程中呢，我们还进行了反复的检查，有错误都给去处理掉了，但是他不断的说自己是Grok2，说自己是遵守open AI的安全准则，这件事来说呢清洗的还不够干净。</p>



<p class="wp-block-paragraph">Grok3呢，应该只做了很少的对齐和测试，就扔出来了。后面呢，是准备快速迭代的。你如果现在去问Grok3，或者是问open AI的话，他们都会告诉你说，Grok3本身呢安全性还是不错的。但是有一点是不可否认的，他训练完成一个月就发布了，训练完了以后，只是在XAI内部测试了两周，就直接把产品扔出来了。这个是挺难以想象的，因为像open AI这样的这种模型，它每一次训练完了以后，可能后边都是需要用年为单位去进行对抗测试，或者说进行调整，然后才敢把这东西放出来。现在XAI就是我这边训练完了，我就把它扔出来了。</p>



<p class="wp-block-paragraph">而现在呢，对外公布的是，Grok呢是通过思维列进行道德商值评测，就是它等于是一个思考过程吧。那我在思考的时候，我就把所有的输入输出的信息，进行道德商值的加权平均，或者说做一个加权复合吧，做一个这样的这个分数出来。如果这个分数达到一定的阈值以后，就禁止回答了。他大概是用通过这种方式来去工作的。</p>



<p class="wp-block-paragraph">但是呢，并没有进行大规模的真人对抗测试。当然了，这个东西你说以后是不是都需要像OpenAI这么干呢？不好说。OpenAI现在还没有特别大的问题，但是谷歌就属于有点走火入魔了，直接被忽悠瘸了那种，就是画出黑人华盛顿那样的，这个就属于忽悠瘸了。未来可能大家都会去像XAI这样往前走。其实像DeepSeek也是这样，它从2.5到3.0之间的发布，也是大概一个多月或者一个月左右的时间就扔出来了，所以都不会做特别详细的或者长时间的这种真人对抗。未来可能都是通过逻辑的方式，让模型的安全性达到一个可以接受的程度就完了。我不保证这东西绝对安全，大家凑合使就可以了。我在不进行严格测试的情况下，不断地去迭代，这个其实才是DeepSeek也好，像Grok也好，最大的一个优势。每个小时都在改进和升级，全世界都在开发新的算法和架构嘛。马斯克有20万张卡，就可以把所有的这些公开的信息都在我这20万张卡里头去试一下。别人只能进行小规模测试的时候，XAI就可以进行全量测试，甚至我可以在你原来的数据基础上，用两三倍或者更大的数据集进行测试，得到一个世界上最聪明的大模型。所以我说这个就像中国世界工厂的工作方式是一模一样的。</p>



<p class="wp-block-paragraph">那么XAI的下一步会是什么样呢？应该是会通过快速迭代，把当前的模型整个先稳定下来。现在已经可能是世界上最聪明的模型了，咱们就相信马斯克说的吧。但是呢，这个世界上最聪明的模型还经常会胡说八道。当它的模型彻底稳定下来，基本上可以达到可用的状态以后，下一步其实呢都是流量大战。这些人去搞C端估计应该是比较难，因为就100来口子人吧。最新的模型不开源，你去在B端竞争的话，也是有一定难度的。你比如说我现在一个公司里边需要去部署大模型了，那我不能去部署Grok 2吧，我肯定是部署DeepSeek V3或者DeepSeek R1这样的模型。</p>



<p class="wp-block-paragraph">因为这是当前开源的最好模型，所以在这一块儿的竞争上也会有一些难度。那么，XAI的策略应该是依靠不断的快速迭代更新，始终保持自己是世界上最聪明的模型，这样的一个位置，吸引部分B端和C端的用户加入进来。自己虽然是有一定的流量，但是X自己的流量对于XAI来说应该是不够的，因为Open AI已经花费1,400万美金打超级碗广告了。所以，现在的AI行业已经进入了一个流量争夺的时代。在这个时候，可以靠产品好，靠模型最聪明，吸引一部分用户进来。像DeepSeek美国排行榜排第一，就是因为模型好，不是因为其他任何原因。他也没有那么多钱去烧这个流量去，他也不可能花1,400万美金去砸超级碗。XAI可能以后也只能是向这个方向走了。后面的路其实并不明朗，怎么依靠XAI把这个钱挣回来，现在还不清楚，还要等马斯克脑筋急转弯，让大家眼前一亮。</p>



<p class="wp-block-paragraph">好，这就是我们今天讲的XAI的Grok 3大模型，到底是不是世界上最聪明的模型？暴力真的可以出奇迹吗？感谢大家收听，请帮忙点赞、点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？</title>
		<link>https://lukefan.com/2024/11/19/%e7%99%be%e5%ba%a6%e4%b8%ba%e4%bb%80%e4%b9%88%e4%b8%8d%e5%81%9asora%ef%bc%9f%e6%8e%a2%e7%b4%a2%e7%99%be%e5%ba%a6%e7%9a%84%e7%8b%ac%e7%89%b9ai%e5%8f%91%e5%b1%95%e8%b7%af%e5%be%84%e4%b8%8e%e6%9c%aa/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Tue, 19 Nov 2024 00:52:17 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AIagent]]></category>
		<category><![CDATA[AI创新]]></category>
		<category><![CDATA[AI发展路径]]></category>
		<category><![CDATA[AI商业化]]></category>
		<category><![CDATA[AI商业探索]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[AI市场]]></category>
		<category><![CDATA[AI平台]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI方向]]></category>
		<category><![CDATA[AI模型调用]]></category>
		<category><![CDATA[AI生成]]></category>
		<category><![CDATA[AI竞争]]></category>
		<category><![CDATA[AI节目主持]]></category>
		<category><![CDATA[AI落地应用]]></category>
		<category><![CDATA[AI行业]]></category>
		<category><![CDATA[AI行业评论]]></category>
		<category><![CDATA[AI视觉生成]]></category>
		<category><![CDATA[AI革命]]></category>
		<category><![CDATA[AI项目]]></category>
		<category><![CDATA[IRAG]]></category>
		<category><![CDATA[IRAG系统]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Scaling law]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[Token计费]]></category>
		<category><![CDATA[YouTube频道]]></category>
		<category><![CDATA[中国AI]]></category>
		<category><![CDATA[中国式创新]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[产品发布]]></category>
		<category><![CDATA[创新保守]]></category>
		<category><![CDATA[创新挑战]]></category>
		<category><![CDATA[前沿科技]]></category>
		<category><![CDATA[发展趋势]]></category>
		<category><![CDATA[商业逻辑]]></category>
		<category><![CDATA[图像RAG]]></category>
		<category><![CDATA[图像技术]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大企业应用]]></category>
		<category><![CDATA[市场策略]]></category>
		<category><![CDATA[市场需求]]></category>
		<category><![CDATA[幻觉问题]]></category>
		<category><![CDATA[快手]]></category>
		<category><![CDATA[技术发展]]></category>
		<category><![CDATA[技术定向]]></category>
		<category><![CDATA[技术路线]]></category>
		<category><![CDATA[抖音]]></category>
		<category><![CDATA[搜索增强生成]]></category>
		<category><![CDATA[政府应用]]></category>
		<category><![CDATA[文心一言]]></category>
		<category><![CDATA[文心智能体]]></category>
		<category><![CDATA[文心研]]></category>
		<category><![CDATA[无代码工具]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[智能体平台]]></category>
		<category><![CDATA[智能技术]]></category>
		<category><![CDATA[智能生成]]></category>
		<category><![CDATA[未来展望]]></category>
		<category><![CDATA[未来技术]]></category>
		<category><![CDATA[李彦宏]]></category>
		<category><![CDATA[消除幻觉]]></category>
		<category><![CDATA[涌现]]></category>
		<category><![CDATA[爱奇艺]]></category>
		<category><![CDATA[现有需求]]></category>
		<category><![CDATA[百度]]></category>
		<category><![CDATA[百度AI战略]]></category>
		<category><![CDATA[百度AI技术路径]]></category>
		<category><![CDATA[百度世界大会]]></category>
		<category><![CDATA[百度发布会]]></category>
		<category><![CDATA[百度应用]]></category>
		<category><![CDATA[百度战略分析]]></category>
		<category><![CDATA[百度技术展示]]></category>
		<category><![CDATA[百度智能眼镜]]></category>
		<category><![CDATA[百度的未来]]></category>
		<category><![CDATA[百度视频平台]]></category>
		<category><![CDATA[确定性创新]]></category>
		<category><![CDATA[科学家质疑]]></category>
		<category><![CDATA[科技前沿]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[秒哒]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[规模法则]]></category>
		<category><![CDATA[视觉数据库]]></category>
		<category><![CDATA[视频模型]]></category>
		<category><![CDATA[超级APP]]></category>
		<category><![CDATA[超级智能体]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1706</guid>

					<description><![CDATA[大家好呀！今天我们来聊聊一个让人惊讶的话题——为什么百度选择不做Sora？啊啊啊！这个问题真的是激动人心，背后有没有什么内幕呢？

在11月12号的百度世界大会上，李彦宏亲口说出，百度从来没有想过要进入Sora这样的竞争。这让我不禁思考，难道真的是因为吃不到葡萄就说葡萄是酸的？🤔 百度到底在想什么？！

百度选择的道路是“消除幻觉”的方向，IRAG技术的发布就是他们的一大步！🤯 这个技术看似复杂，但其实是通过图像产生生成，然后来保证生成的准确性！说到这里，我忍不住想试试效果，结果测试后发现——画小米苏7完全失败，反而是画出了一辆问界M5！😂

不过，画郭德纲的效果简直让人震撼，逼真得以假乱真！但对比于谦却又变成了两个郭德纲，这让我一下子笑掉大牙！🤣 这是算法数据的不够精准造成的。看得出来，百度这条路走的还是有些吃力啊！

而且我们也要注意，百度的15亿调用量听上去很牛，但换算一下，实际收入却让人无奈，只能算个小打小闹🙄。李彦宏提出的方向，似乎更依赖的是产业应用和政府合作。这种中国式创新，真的能带来可持续的发展吗？🤨

所以，百度不做Sora，深思熟虑之后选择了踏实的IRAG，并不是因为他们没有能力，而是有着超凡的商业思维和稳定的操作方案。不管未来会如何发展，我期待能看到百度带来更多惊艳的产品和技术！💪

希望你们喜欢今天的话题，记得点赞关注我哦～我们下次再见！💖

百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？

在百度世界大会上，李彦宏揭示了百度不同于OpenAI的AI发展路径，即不开发Sora这样的视频模型，而是专注于多模态技术和消除AI幻觉。在大会上，百度发布了全新的IRAG技术，以图像为基准的搜索增强生成系统，以及无代码工具“秒哒”，引发了广泛的关注。然而，尽管有着15亿日均调用的文心一言，百度在AI领域的收益有限。百度不参与视频平台的竞争，背后的原因是其没有类似抖音或快手的平台支持。最终，百度选择了确定性更高的技术路线，但这一保守策略是否能使百度在未来AI竞争中占据领先地位，仍需时间验证。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？" width="900" height="506" src="https://www.youtube.com/embed/Ep_ehhnY-Tc?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">百度为什么不做Sora？是不是吃不到葡萄就说葡萄是酸的呢？大家好，这里是老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">11月12号，百度世界大会上就透露出来说，百度从来就没有想去过做Sora这样的世界模型，或者叫视频模型，从来没想过。百度呢，是一直希望走自己的多模态道路，不希望去跟OpenAI这样的公司卷入世界模型的竞争。虽然到现在为止，Sora也没出来，但是跟在后面跑的人还是很多的，特别是抖音、快手，都推出了各自的视频模型，还有很多国际上的厂商也在视频模型上争先恐后地往前跑。</p>



<p class="wp-block-paragraph">但百度说，我不干这个事，我有更重要的事情在做。这是百度李彦宏亲口说的。那么，百度努力的方向到底是什么呢？百度努力的方向是消除幻觉。大模型都是有幻觉的，百度呢说，我们作为一个中国公司，你可以不说话，但是说错了是很麻烦的，所以我们不能产生幻觉，保证我们说的都是对的。而且这个是在各种角度上，所有的评判标准来看，都得是对的，不能有任何问题。因为有的时候，你说的你觉得对了，但别人觉得不开心，这也是不行的。</p>



<span id="more-1706"></span>



<p class="wp-block-paragraph">所以百度呢，作为一个有中国特色的AI领军公司，他们向着消除幻觉的方向前进了。他们准备怎么去消除呢？他们这一次在11月12号的百度世界大会上，推出了一个很有趣的东西，叫IRAG。大家要知道，RAG是我们在做AI agent，或者叫AI智能体里头，用得比较多的一个技术，叫搜索增强生成。就是我们先搜索，搜索完了以后，根据搜索的内容再去生成，这样的话，能够保证生成出来的东西没有什么幻觉，是在你给定的范围内去生成的。它倒不一定说保证生成出来的东西是对的，但呢，它保证说你给我的是什么，我生成出来的就是什么。</p>



<p class="wp-block-paragraph">那么，IRAG是一个什么样的东西呢？这个前面这个I到底是做了一个什么样的单词放进去了呢？I这个词呢，是图像（image），以图像为基准的RAG。什么叫以图像为基准的RAG呢？就是正常情况下，咱们RAG都是做的文本或者是表格。</p>



<p class="wp-block-paragraph">搜索完了以后，把这些文本和表格通通都做成矢量数据库里面的一个点。然后找到离他比较近的点拿出来，去生成跟问题相关的答案。这是RAG的标准过程。IRAG呢，就是百度说我有好多图片，我把所有这些图片，以及图片识别出来以后的各种信息，直接拿去做嵌入，然后形成史料数据库。在这个里边去搜索，搜索完了以后再去重新生成图片。这意思是什么呢？就是你去训练说这个人叫张三，张三长这个样子，张三坐着，张三站着，张三乐了，张三哭了，张三吃东西了。他把所有这些东西都训练好了，放到一个矢量数据库里边。等你下次要求他去生成图片的时候，说张三穿着什么什么样的衣服，站在哪里，在做一个什么动作，有什么样的表情，有什么样的风格，他就可以从矢量数据库里头把你要的这些信息都找出来。张三长这样，我有了；然后呢，穿什么衣服，我在数量数据库里再去查。查完了以后，哦，衣服长这样我也有了。做什么动作他可以画得很准。他做了这么一个很神奇的技术出来，但是我看到这个介绍以后说：“哎，这玩意好玩哈，我得去试试。”然后我就跑去试了一下。首先我跑到了百度文心一言的网站上，测试一下，发现文心一言3.5版本一如既往的拉胯，依然在那胡说八道，依然在那前言不搭后语，咱就对他没有什么预期了吧。然后闻心欲言4.0依然需要收费，算了不测试了。那么画图吧。画图的过程呢，稍微有些吓人。首先让他画车，你让他画各种型号的车，都非常的准。说我迈巴赫哪个款，在巴黎的凯旋门下，哎呀，那个做的非常的漂亮，一张照片绝对一下乱真。大众这个车呢，除了车牌子上看不太清楚之外，也是非常像的。比较遗憾的是，我要求他画小米苏7，他没画出来，估计是小米苏7他的素材不够多，或者训练这个模型的时候没有用很多的小米苏7的图片，或者说他的IREG的这个矢量库里头没有那么多的小米苏7的图片。每次要求他画小米苏7的时候，他画出来的呢，都是问界M5，这个就没办法了。然后画人吧，要求他画郭德纲。</p>



<p class="wp-block-paragraph">哎呀，我天呐，简直就是拿照片直接贴上来。你说郭德纲干什么？马上就给你做一个一模一样，绝对以假乱真。但是呢，你要求他画于谦，这个事就没法整了。画出来的也是郭德纲。大家想明白了没有？为什么会这样呢？</p>



<p class="wp-block-paragraph">说为什么我要求他画于谦，这个IRAG产生的结果是郭德纲呢？因为很简单，你所有在百度图片里头搜索于谦的照片，郭德纲都站旁边了。于谦、郭德纲，郭德纲、于谦，你郭德纲站的照片多一些，那么他就认为说是不是于谦应该也长这样。可是这样的一种运作方式，实际上呢，他向我们展示了用IRAG的这个技术，依然是没有办法避免幻觉的。你要求他画于谦，他画的是郭德纲。</p>



<p class="wp-block-paragraph">有一张照片，我告诉他说，来，给我画一个郭德纲跟于谦在德云社说相声的照片。画完了以后，就是两个郭德纲，都很像。就是你单独拆出任何一个来，都是以假乱真的。俩郭德纲站在台上说相声了，就变成这样了。要求画其他人，就没有那么像了，比如说郭麒麟、马斯克，这个就不太容易认出来了。其他的我就没有再敢去测试，再测试可能会被警告了。</p>



<p class="wp-block-paragraph">但是呢，他整个这套的IRAG的系统还是挺吓人的。如果你想让他去给你生成一些广告图片或者是一些假图，就是郭德纲出去做了一些丢人现眼的事情，绝对以假乱真，画的极像，已经是可以达到一定的商业用途了。特别是你，比如说我做一些店铺的装修或者是这种电商的图片生成，这个玩意还是可以的。</p>



<p class="wp-block-paragraph">除了这个IRAG之外，这一次的百度世界大会上呢，还发布了无代码工具“秒哒”。一秒、两秒的秒，哒呢是一个口一个到达的达。所谓的无代码工具“秒哒”呢，其实类似于字节跳动的codes，对吧？也是让大家把智能体拼起来，然后形成AI agent去干活了。只是呢，秒哒现在呢还不开放使用，依然是让企业去报名排队。据说已经有很多人排队了。这些企业不知道为什么想不开，Codes现在就可以免费使，你干嘛还要去使用秒哒呢？像我这种稍微有点动手能力的人，可以使用Defi。</p>



<p class="wp-block-paragraph">这个咱们就不说到这么远了。今年，除了前面我们讲的IRAG以及秒哒之外，还发布了什么呢？这个牛肯定还是要吹的嘛。现在吹的牛是什么？就是文心一言大模型，日均调用量15亿。我们已经数涨上来了，去年是5,000万，现在涨了30倍了。这个15亿呢，大家注意，没有单位，15亿次，15亿人，不可能15亿人，中国没有。15一次，这个也稍微有点不太好去评估，怎么算一次呢？那么我们就稍微保守一点评估吧，我们把这个单位写成TOKEN，就是每天可以生成15亿TOKEN。</p>



<p class="wp-block-paragraph">哎呀，很多人说这个数好大呀，百度文心一言好厉害，这么多人使用它，生成了这么多的内容。但是你要想想，15亿TOKEN按照百度的收费标准，能够挣多少钱呢？百度文心一言4.0 Turbo，按照每千TOKEN的价格乘上15亿的话，一天的收入大概不到10万块钱。那你以为像百度这样的一个公司，这样的一个项目，值得上来去讲吗？如果这就是他的AI未来的话，百度一年挣个3,000万、4,000万这种水平，这个够干嘛的呀？</p>



<p class="wp-block-paragraph">所以呢，这个数字基本上可以忽略不计，他只是跟大家玩了一个文字游戏，一天15亿，好大好大。你把它乘上钱数，你看看有多少。除了给自己吹牛之外，当然还要指明一下方向，说未来的AI发展是哪个方向呢？两个大方向，一个是智能体，应该也就是刚才我们讲的AI Agent这样的东西；另外一个呢叫产业应用，就是政府有钱或者是大的企业有钱，你们愿意为这个事情买单，你们就是未来方向了。这是李彦宏为AI中国指明的两个方向。</p>



<p class="wp-block-paragraph">而且呢，保证说百度自己不会去做超级APP，实际上他也没这个本事，所以干脆吃不到葡萄说葡萄是酸的，我不做这个事。然后呢，要去打造上百万个超级APP，也不知道李彦宏怎么想的。超级APP不可能有上百万，到上百万了，以后这东西就不叫超级APP了，你没有那么多用户，叫什么超级APP？但那意思呢，就是降维打击，这个是很多互联网人喜欢讲的一种说法。</p>



<p class="wp-block-paragraph">你是二维生物，我用三维的方式去干掉你；你是三维生物，我用四维的方式去干掉你。这是《三体》里边的一个词。这个所谓的降维打击是什么呢？就是你们都去卷超级APP去了，我要当你爹。在百度下边做的应用都是超级APP，我比你高一个层次。</p>



<p class="wp-block-paragraph">当然了，也展示了一些智能体，包括百度自己的文心智能体平台。这个上面呢，号称有15万家企业使用，有80万开发者，但是也没有看到砸出什么响动来。如果产生了超级APP的话，广大的民众应该是能够有感知的。咱们现在没有感知，别说上百万个了，一个都没看到。然后也展示了一些超级智能体，什么法律问答呀，基本上也就是说我们通过百度的文心研做的一些AI Agent，怎么能够解决一点点的实际问题，这个也给大家展示了一下。</p>



<p class="wp-block-paragraph">另外，时髦还是要赶的，赶什么时髦呢？百度智能眼镜，扎克伯格干成了，我们也得干去。这就是这一次的百度世界大会上发的东西。那咱们回过来说，百度为什么自己不做Sora呢？其实这个里头最本质的原因只有一个，就是百度自己是没有视频平台的。虽然百度有视频，百度有爱奇艺什么这些东西，但是百度自己没有像抖音、快手这样的平台。你像国内现在即梦跟可灵，卷的那叫死，天天俩人卷来卷去的。即梦后边是字节跳动是抖音，可灵后边是快手。生成完了视频，就放在我们的抖音、快手平台上，大家就可以宣传了，就可以直接用上了。百度自己没这东西，所以说那我就不跟你费这劲了。</p>



<p class="wp-block-paragraph">而百度跟Sora呢，实际上是两条完全不同的路径。Sora是什么路径？Sora的路径是scaling low，大力出奇迹。中间很多东西我们也不去研究了，我们就把料堆齐了，数据堆齐了，算法堆齐了，再加上足够的算力，烧钱等待它涌现。原来的这些传统的方式，我们就不去考虑了，think differently。我们不用再去想说要不要更快的马车，我们直接去造飞机去了，还不是汽车。这就是Sora干的事情，是一帮有理想的人去做的事情。</p>



<p class="wp-block-paragraph">而且呢，未必有结果。其实到现在为止，Sora都没有任何要做出来的迹象。而百度他们做的事是什么呢？是在现有的技术范畴下，满足现有的需求。这个呢，就属于典型的中国式创新了。要求的是什么？确定性高。我们要卷吗？卷的一定要确定性很高。哪方面要确定呢？第一，技术路线要确定。一帮老学究们，他们来去确定技术路线，不能让年轻人上。年轻人，你们没有经验，万一走错了路怎么办呢？这个你们不要去动。第二个呢，成本要确定。我投入多少钱以后，可以得到一个什么样的结果。成本确定了以后呢，收益也要确定。我做出来的东西得有人用，我得卖得掉，这个事才能去干。就比较现实。这个就是百度走的这条路。百度呢，要求是有市场能赚钱，所以呢，百度算是比传统的中国式创新更加保守一点的一个公司。</p>



<p class="wp-block-paragraph">那么现在有很多人去讲说，scaling low现在到底行不行？美国有很多大学、很多机构，甚至一些著名的科学家都出来讲，scaling low是不是玩不转了，这种规模法则是不是有问题了？再往前堆，是不是堆不出东西来了？这件事呢，只能这么说，从scaling low诞生的第一天开始，质疑就从来没有停止过。为什么呢？因为scaling low指望的那个东西，就是scaling low成功的最终结果叫涌现。这个词什么意思？就是你不确定他来不来，你不确定哪次行哪次不行，你也不确定说我到底是增加多少。以后有这么一次，因为涌现这个东西，它一定是不连续的。不是说我上了10块显卡，出了一个东西；上了11块显卡，又出了一个东西；上了12块显卡，又出了一个东西。这个是不连续的。你有可能10块显卡，你最后算出来一个数据可以用，然后呢，11、12、13都没用。结果你发现上到第100块显卡的时候，又跑出一个结果来，又有一个跳跃式的创新，又往前走了一步。那你说咱堆吧，堆到1,000块显卡，咱再做一次，发现哎，好像有那么点提升，但是又不是那么明显。哎呀，这个好像不对。</p>



<p class="wp-block-paragraph">但这个事情是不是就不行了？不一定，因为在下一个节点在哪，谁也不知道。这个才叫涌现呢。如果你知道下一个节点在什么地方，比如说有这么多数据堆在一起以后得到结果，那下一个节点，比如说我们说是乘10倍、乘20倍、乘30倍或者是1,000倍，这都不知道。这个才叫真正的 scaling law。就是我们就只管往前堆，未来是不可预期的，不确定的不连续的。</p>



<p class="wp-block-paragraph">这个东西从开始的那天大家就质疑它。这个过程呢，其实很像什么？就是咱们小时候都看过一个故事，叫小马过河。什么意思呢？这个小马背着一包货准备过河，人家就跟他讲说你这个过不去的，这个河很深，会淹死你的。这个不同的人就都跟他讲不同的话。就是每一个老的科学家或者是一些进行成本核算的会计师们，看到 scaling law 就会跟他讲：“小马过河，你是过不去的，你这个事有问题的。”那这个怎么办呢？必须要往前蹚，蹚完了以后去寻找下一个的节点，这个是没有什么办法的。</p>



<p class="wp-block-paragraph">百度这么想到底对不对？百度说我不去作死 Sora，我要去做 IRAG，我要去消除幻觉，做有中国特色的创新，这事对不对呢？其实百度这么想并不丢人，作为一家成熟的商业企业，这样思考算是一个正常的商业逻辑。但是呢，如果按照百度自取的那样，他是中国 AI 行业的领军企业，这么想问题的话，就有点可悲了。</p>



<p class="wp-block-paragraph">但好在是什么？就是中国做 AI 这一块，反正至少我测试的各种产品里头，我觉得百度基本上还是排不上号的。百度自称是中国 AI 行业的领军企业，这个事呢，让百度自己开心就好了，关起门来称大王就可以了，让我们每天看着百度是怎么思考问题的。我觉得他思考问题的很多的方式还是有借鉴意义和价值的。但是呢，作为一个国家的这种 AI 领军人物，最好还是有一点梦想，愿意努力的，跳一步往前走一走，有可能你就会走到一些不一样的地方。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里，感谢大家收听，请帮忙点赞，点小铃铛，参加 Discord 讨论群。</p>



<p class="wp-block-paragraph">也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
