<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Function Call &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/function-call/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Tue, 21 Oct 2025 00:48:19 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.2</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>Function Call &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>继Model Context Protocol后，AI下一个新标准已现雏形？Anthropic凭“简单、开放、中立”三原则再次领先｜Claude Skills、Anthropic、OpenAI</title>
		<link>https://lukefan.com/2025/10/21/anthropic-skills-new-standard-llm-capabilities/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 21 Oct 2025 00:48:17 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Agent Skills]]></category>
		<category><![CDATA[AI Agents]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[AI新标准]]></category>
		<category><![CDATA[AI能力拓展]]></category>
		<category><![CDATA[AI行业标准]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Claude Code]]></category>
		<category><![CDATA[Claude Skills]]></category>
		<category><![CDATA[Excel处理]]></category>
		<category><![CDATA[Function Call]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[MCP]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[PPT制作]]></category>
		<category><![CDATA[Word处理]]></category>
		<category><![CDATA[上下文工程]]></category>
		<category><![CDATA[企业级AI]]></category>
		<category><![CDATA[低代码AI]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[大模型应用]]></category>
		<category><![CDATA[技能固化]]></category>
		<category><![CDATA[技能重用]]></category>
		<category><![CDATA[提示词工程]]></category>
		<category><![CDATA[文档格式化]]></category>
		<category><![CDATA[格式化文档]]></category>
		<category><![CDATA[模型能力拓展]]></category>
		<category><![CDATA[自动化工作流]]></category>
		<category><![CDATA[自定义AI]]></category>
		<category><![CDATA[非程序员AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2716</guid>

					<description><![CDATA[Claude又放王炸了！这次Skills技能直接让我跪了！😭 以前MCP配置像修仙渡劫，现在？兄弟们，写个纯文本Markdown就完事！律所文档字号字号行距要求诡异如玄学？AI秒变“格式卷王”，排版强迫症直接被治愈！📄💥

关键绝了：错别字AI都能自动脑补修好！😂 中文用户血泪警告：根本不支持中文啊！我充了20刀想试试，结果…算了，Anthropic爸爸快开光吧🇨🇳 但Skills真香到上头——技能固化复用超简单，比如“Excel大师”直接打包带走，在Claude Code本地跑还能联网替MCP！未来必成新标准，卷死OpenAI！🔥

打工人泪目了！再也不用被老板骂格式乱了，社畜的痛AI终于懂了👏 感觉明天就能躺着出PPT…点赞求速推中文版！#AI神器 #打工人之光

**评论区炸锅：** 你想让AI学啥技能？求扩散救救中文党！👇（哥们儿蹲一个律所文档秒排版）💻✨

标题1：Anthropic再次定义行业标准，OpenAI的GPTS为何注定失败？关键在于开放与封闭的路线之争｜Claude Skills、Anthropic、LLM、AI Agents
标题2：告别MCP繁琐配置！普通人也能玩的AI技能固化来了，用Markdown就能搞定复杂工作流—Claude Skills、Anthropic、AI Agents、Custom AI Workflows
标题3：“你是一个XX专家”提示词真相：我们被忽悠了多久？AI模仿角色≠掌握真技能，这才是根本解决方案｜Claude Skills、Anthropic、LLM、AI Capabilities
标题4：90%的配置时间或被节省！从部署服务器到编写Markdown，大模型能力拓展迎来降维打击｜Claude Skills、Anthropic、Agent Skills、Enterprise AI
标题5：继Model Context Protocol后，AI下一个新标准已现雏形？Anthropic凭“简单、开放、中立”三原则再次领先｜Claude Skills、Anthropic、OpenAI、New Standard
简介：Anthropic再度出手，推出革命性的Claude Skills功能，旨在为LLM能力拓展设立新标准。与复杂的服务器配置不同，该工具允许任何人通过简单的Markdown文件，为AI定义、固化并复用特定技能，极大地降低了构建Custom AI和Workflows的门槛。这一开放性设计，或将重塑未来AI Agents的开发范式。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="“你是一个XX专家”提示词真相：我们被忽悠了多久？AI模仿角色≠掌握真技能，这才是根本解决方案｜Claude Skills、Anthropic、LLM、AI Capabilities" width="900" height="506" src="https://www.youtube.com/embed/s4fBBbvrJTs?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Anthropic Claude出了新工具，叫skills技能。这是不是MCP的升级版本呢？</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>，咱们又有新玩具了。这一次，Anthropic出了一个东西，叫skills技能。它呢，应该是大模型功能拓展标准的一个新尝试。</p>



<p class="wp-block-paragraph">大模型除了可以一本正经地胡说八道之外呢，你还需要去做一些技能拓展。比如说，你可以去写PPT，可以去做Excel，skills就主要干这玩意儿使的。这也算是AI agent以及上下文工程有可能会迎来的一个新标准，甚至呢，在部分功能上已经取代了MCP的功能。待会儿咱们再讲哪一部分可以取代MCP了。</p>



<p class="wp-block-paragraph">到底什么是skills呢？它呢，是直接给Claude去赋能，让Claude code去做一些琐碎的工作。我举一个例子吧，比如说一个律所，你律所里头需要干一个什么事？就是你们出的所有的这个文件，它是有排版要求的。哪个地方用几号字，哪个地方用几号字，什么地方要用什么样的方式来表述，这个都是有要求的。以前我们律师给写的文件，大概每一个文章倒数第二段的时候，要写一个“以及”还是什么，反正有一个特别奇怪的要求。我第一次看到，我说：“你们为什么写这个？”他说：“律所要求就是必须这么写。”包括哪个标题需要使用什么字号、什么字体、字间距、行间距，他们都有要求。</p>



<span id="more-2716"></span>



<p class="wp-block-paragraph">这个东西你要让大模型去干活呢，就很费劲，特别是大模型每一次干出来不一样。那现在就是你，可以通过skills直接给它赋能，说我们以后按照这个律所什么什么要求去做，甚至是哪个版本的要求，去处理这些文件，最后处理出来的格式跟你的要求是一致的。</p>



<p class="wp-block-paragraph">这东西呢，配置起来要比MCP省事。MCP配置还挺麻烦的，你需要在本地起服务器，或者就算是远程服务器，你也需要在本地去进行MCP服务的配置。这个配置的过程，可能普通非程序员不是说完全处理不了，但是还是比较费劲的。但是skills就省事多了，直接写个Markdown文件扔里头，完事。你就是建个目录，写一个skills.MD的一个文件，告诉它说，我什么样的字需要使用什么字号，或者说我这个信的结尾要加“此致敬礼”什么，你可以写一大堆这样的要求进去。写完了以后呢，直接在执行的时候告诉它说：“这是我的技能文件，请照着这个干活。”它就去照着执行去了。</p>



<p class="wp-block-paragraph">而且skills呢，是可以在全客户端执行的。它可以在API上跑，也可以在Web端、手机端客户端，都是可以跑的。甚至呢，还可以在Claude code里头去跑，这个都没问题。如果你是在Claude code这样的本地的AI agent里头跑的话，它可以基本上覆盖MCP的功能。为什么？待会儿咱们细讲。在其他端这个还不太行，它是有一定限制的，至少目前还有吧。</p>



<p class="wp-block-paragraph">现在呢，普通人都可以用这个skills工具。它主要是用两个格式的文件往里写东西：一个是Markdown。Markdown其实你基本上认为它是个纯文本就完了，只是呢，里头有一点点的简单的这种格式标记，写一个井号后边是大标题，两个井号是中标题，三个井号是小标题，它就是有一些这样的标记在里头，其他的也没有跟普通文本差异的地方。你用任何的纯文本编辑器都可以打开它，只是呢，没有渲染的效果而已。另外一个呢，叫YAML。YAML呢，实际上也是一种纯文本的配置文件，它呢，特点就是缩进，就是你通过缩进的方式来去写配置。现在大家看到很多的项目里头，都有这种文件，前面基本上是一个属性，打个冒号，后边是要赋的一个值。现在很多配置文件都是拿这玩意儿写的。</p>



<p class="wp-block-paragraph">当然了，skills你要想处理一些更复杂的东西呢，它也允许你加代码进去，但是代码执行呢会比较受限制。因为这个skills是在哪跑的呢？它是在一个虚拟机里跑的，是在Anthropic本地的一个虚拟机里边去跑。这个虚拟机是不能联网的，也不能去调用很多的这种库文件进来，所以它的功能比较受限。</p>



<p class="wp-block-paragraph">只有是在Claude code，就是在我们本地跑的时候，它可以联网。所以呢，你在本地跑的时候，它不是在虚拟机里头，你就可以基本上取代MCP的功能了。甚至你在skills里头直接写说，我要调一个什么API，这个API的调用方法是什么，返回值是什么，就是我们把很多那个API的文档文件直接贴在那个Markdown文件里就完事了，它就直接干活去了。所以只有在Claude code里头才可以替代MCP，如果不是在Claude code里头，它是不允许联网的。它的格式刚才我们讲了，就是一个叫skills.MD的一个文件放在一个目录里，或者再加一些其他的这种配置文件就完事了，极个别的情况需要加代码。</p>



<p class="wp-block-paragraph">现在呢，Anthropic官方呢，也给出了一些skills，比如说一些Excel、Word、PDF、PPT这样的处理方式。我本来想去充一个Anthropic的会员，20美金充一个会员，后来翻了翻，发现这东西就完完全全的不支持中文，连繁体中文都不支持，最后算了，就不跟它费劲了。我相信skills应该很快就会普及出来，就像MCP一样，不是只有Anthropic自己可以用。</p>



<p class="wp-block-paragraph">那skill适合做什么呢？最适合做文件处理、格式处理。如果在Claude code里头，基本上是全能的。技能和标准的固化和重用，这是它主要干的活。这个什么意思？比如说有一个人说：“我就擅长整理律所的文件格式。”这个东西呢，叫一个技能。你要再找一个人来说：“你给我把这个律所的文件都处理成我们要求的格式呢？”他需要重新学习。现在呢，等于是我们把这个东西固化下来了，说这个skills就叫“律所文件格式处理”，把它固定下来了。固定下来以后呢，就直接可以反复地重用了。我下一次需要去处理文件的时候，直接告诉Anthropic我的skills叫这个名字，去干活去吧，它就去干活去了。</p>



<p class="wp-block-paragraph">Anthropic为什么总能拿出这种推动行业的新标准来呢？这样的一个功能，现在大家都在讨论的核心原因，就是大家觉得这可能是未来的标准。最早它推出的MCP标准虽然不完美，因为它调用的时候必须要起个服务器，这个事还是很讨厌的，但是呢，现在已经是标准了。谷歌、OpenAI都已经跟进了，国内的各大模型厂商、各大AI agent和工具厂商也都跟进了MCP了。原因很简单，就是它会秉承着叫“简单、开放、中立”这样的一个原则，这才是真正的关键。你把这事搞得很复杂，各种方方面面我都想到了，或者说我只能在自己的平台上使，我又不开放，或者说我虽然是中立的，但是呢，我们中间的这些代码是不给别人看的，其他的人你是不知道我怎么去调用这个功能的，这些都很难成为标准。你必须要简单、开放、中立。除了大模型的处理能力这些，MCP也好，skills也好，它基本上不依赖其他技术，这个也是非常非常重要的。你说我现在做了一个新的标准出来，我需要依赖很多很多东西，这个就很麻烦。像MCP呢，还是需要依赖一些外部服务，需要依赖一些这样的技术，但是skills就更简单，什么也不依赖，你直接拿出来就可以用的东西。</p>



<p class="wp-block-paragraph">大模型能力拓展的尝试呢，其实一直在持续。从ChatGPT 3.5开始，GPT进入到公众视野以后，大家一直在尝试这东西到底能干嘛，除了一本正经地胡说八道之外还能干点什么。现在每天大模型的能力在上升，我又训练出GPT-5了，又训练出GPT-6了，但是还有一些东西呢，是它搞不定的。第一个是角色的固化，或者说技能的固化与重用，这个事情呢，是大模型自己搞不定的，因为大模型都是按照通用的模式来去训练的。另外一个就是要调用外部工具，我不可能自己把所有外部工具都跑通，它真跑通了就吓人了，有可能这个人类就没有存在的必要了。它还是有一定的能力边界的，这一块呢，就是在不断地拓展。</p>



<p class="wp-block-paragraph">很多人可能会记得，咱们经常在写提示词的时候，第一句话干嘛？第一句话赋能，说“你是一个编辑”，“你是一个律所的文档格式大师”。我们经常会写这样的话在第一句。那你说这个真的会让ChatGPT也好，Anthropic Claude也好，像律所里边的文档编辑大师一样工作吗？是不能的。为什么呢？因为每个律所的文档格式要求是不一样的，它也不知道你要用什么方式去干活。所以你去写提示词的时候，对大模型进行角色赋值，说“你是什么什么”的时候，到底起什么作用？告诉大家，不会提升答案的质量，他原来该答什么还是答什么，但是呢，会让大模型将结果模仿成指定角色的方式说出来。他会去想说，这样的这个角色是怎么说话的，我先生成结果，然后模仿这个人的方式再重新说一遍。这个就是我们每一次去指定说“你是谁谁谁”的时候得到的一个结果。这肯定不是我们所希望的嘛，我们还是希望它真的具有相应的能力。</p>



<p class="wp-block-paragraph">现在我们就要去做固定技能以及能力拓展，咱们做了很多尝试。前面OpenAI做的一个东西叫GPTS，这个东西呢，推出来的时候我就说这玩意没戏，现在呢，基本上已经没有什么人去玩耍了。GPTS主要干的活，实际上就是一个固定技能，当然它还有很多其他的功能，那个调用处理起来就非常非常麻烦了，你需要在里头写程序的。而且GPTS还有一个问题是什么呢？就是它必须在ChatGPT里头跑，它不能出来，这个是很麻烦的。刚才我们讲了，你要想确立标准的话，必须得中立，它的中立性就没有了。而且这个东西做起来其实没有那么容易，GPTS刚出来的时候我也做过一些，效果呢，差强人意，不一定每一次按照你的要求去做，因为当时模型的能力也没有那么强。折腾了半天GPTS以后，发现不是我想要的东西，所以现在呢，基本上玩的人很少了。</p>



<p class="wp-block-paragraph">第二个就是function call，就是直接让大模型去通过代码干活。这块呢，甭管是国内的模型，还是国外的这种主流模型，都是支持function call。OpenAI、Anthropic的Claude，还有Grok、Gemini，都是支持function call。但是呢，这个东西比较麻烦，在哪呢？你必须写程序，你不写程序这事搞不定。只能在API里头使，你说我在客户端用，我在Web端用，这事你是没有办法拿它干活的。所以这东西呢，对于非程序员来说，基本上相当于没有。这就是function call的一个情况。</p>



<p class="wp-block-paragraph">再往后呢，就是MCP了。MCP呢，比function call要简单一些，不再需要那么高的程序能力了。我可以说直接把一个MCP的配置文件写到比如Cursor，或者写到一些其他的这种支持MCP的客户端里去，他就可以去干活了。这个对于很多这种非程序员来说呢，就已经比较友好了。现在呢，你要去调MCP，可以写程序，也可以直接在支持它的客户端里配置就可以用。现在呢，有很大一部分的服务平台都将自己的服务包装成了MCP。你比如说支付宝、微信支付、高德地图、百度地图、大众点评，都开始出MCP了。这一块呢，就是只要上大模型，你挂上这些MCP以后，就可以实现相应的一些功能了。MCP主要干的活是什么呢？就是能力拓展，它并没有说把一些能力固化下来。你说我告诉大模型我有MCP了，那不能保证你每一次输出的结果都是你想要的，但是呢，它可以保证说大模型可以去调用百度地图了，知道这周围有什么好吃的，这个他可以去干了。</p>



<p class="wp-block-paragraph">现在呢，skills来了。skills呢，和MCP比起来，对于非程序员就更加友好。原来MCP你要去做配置的话，还需要去写JSON，JSON还算是一种程序员使用的配置语言，而现在的话直接Markdown了，你就直接用自然语言去写就完了。JSON的话你要是把它写错了，大模型拿它也没办法，但是Markdown的话，你写错了以后，比如我写了几个错别字在里头，或者哪个地方我写点病句在里头，大模型就直接处理掉了。所以这一块容错率还是比较高的。它呢，可以很好地将技能固化下来，让你再去重用，也可以去拓展一些外部功能。但是拓展外部功能就只能是在Claude code里头用。我相信未来可能会有更多的客户端去支持skills，只要是有客户端支持的skills，就可以去允许你拓展外部功能，可以去联网。否则的话，你跑到Anthropic的自己的服务器上开虚拟机的话，它就不会让你干这个活。现在呢，在网页、API都可以去跑，但是网页、API包括手机端、PC端的这些客户端里头，它都是调用的Anthropic自己的虚拟机，不允许联网。如果你是在本地跑，它是允许你去联网的。</p>



<p class="wp-block-paragraph">那你说未来大家会不会跟进呢？一个新技术，你不能说上来我就要做标准，这事是不对的。一个新技术出来了以后，一定是什么呢？一定是自己先用起来，大家喜欢了以后，逐渐去遵循你为标准。而且你前提还得是开放，你如果不开放的话，别人想去遵循你为标准也没有这个能力。我觉得呢，大概率skills会成为下一个标准，继MCP之后的下一个标准。为什么呢？就是skills的技术是完全中立的一个技术，因为你写进去的就是一堆Markdown，其他的没有什么，就算写一些Python代码，或者是一些TypeScript，或者是其他的这种代码进去，它要求的也都比较简单，不会要求写特别复杂的代码，因为它是在一个没有网络、也不可以调用外部代码库的一个虚拟机里去执行的，所以这个代码也不会太复杂。所以第一个，完全中立。第二个呢，就是它直接开放的，Markdown文件拿出来看就完了，我到底是一个什么样排版的文件，我直接看就可以了。</p>



<p class="wp-block-paragraph">WPS里头有非常非常多的模板库，班级的点名表，或者是各种的报告，它都有模板库。以后这些东西通通都可以写成skills，我们就直接调用的时候，就可以产生出符合各个单位里头要求的格式化文档，这个还是很棒的。甚至呢，可以进行一些逻辑上的检查，比如说所有的股权算完cap table以后，加起来必须是100%，你这些东西通通都可以在skills里去干。现在大量的skills文件呢，已经开源了，都在GitHub上，大家可以自己去找去，直接下载下来就可以用。而且支持skills这件事呢，本身对于大模型也没有什么新的要求，完完全全是可以在这种客户端上就跑。你比如说Cursor或者是VS Code，这些东西就直接可以去支持了，并不需要模型做任何的修改，也不需要在模型API上做特别多的调整。所以这个东西成为标准的门槛是比较低的。</p>



<p class="wp-block-paragraph">skills对模型唯一的要求是什么？就是你模型的上下文要进一步的提升，要有更好的指令依存度。我要求你干什么，你必须老老实实给我干去，这就是skills对模型的要求。现在Anthropic Claude对于skills的这种要求，特别是现在的4.5的版本，基本上是可以满足的。Gemini 2.5相信应该也没有任何问题，甚至马上要出Gemini 3，可能这个礼拜就要出Gemini 3，做这些事情应该也都是OK的。GPT-5处理skills这样的一些小问题，应该也没有任何毛病。国内的话，豆包、DeepSeek和千问应该也都可以完成相应的这种改造，就是你模型不用动，直接在这个客户端上处理一下就可以了。</p>



<p class="wp-block-paragraph">未来的话，可能就是我们只要告诉大模型说，我有哪些function就是哪些功能，哪些MCP，比如说我可以调用百度地图、高德地图，然后呢，我们再告诉他，我还有哪些skills，哪些技能，我想干什么，然后它就给你干去了。我举一个例子吧，我们现在有MCP是高德地图的，有一个skills叫做“Excel格式整理和数据校验”，然后我们就可以告诉它什么呢？我现在想知道某一个地区周围有哪些日料店，他们都是一个什么样的情况，按照这个打星的情况去排序，还是按照价格排序，还是按照一个什么样的方式排序，然后呢，请给我去进行什么样的格式。把这个命令整个交给这个大模型以后，它就会自动地去调用MCP得到某一个地区附近的日料店，然后把里头所有数据都拎出来，再按照我们的要求调用skills，把这些东西通通都塞到Excel里头去进行校验、进行排序、进行这种格式的梳理，然后生成一个我们所要的这种Excel文件出来。它就是这么干活的。</p>



<p class="wp-block-paragraph">跟这种标准，国内的这些公司应该会跑得很快的。国内一大堆抄袭Claude code的这种工具，像现在阿里、字节、腾讯都开始出这种客户端上直接进行命令行输入的、类似于Claude code的工具了，他们想去支持skills还是非常容易的。国内的这些AI IDE应该也会第一批跟上。云厂商跟进应该会更快一些，因为刚才我们讲了，skills执行的一个原理是开一台虚拟机，处理完了以后把它关上，这个对于所有的云服务厂商来说，“这个我们熟”，他们会更快的跟上。而国内最大的云厂商是谁？阿里。千问未来去支持skills应该是顺理成章的，国内MCP最早支持的应该也是阿里。</p>



<p class="wp-block-paragraph">总结一下吧，你想去建立一个新的AI标准，你必须按照“简单、开放、中立”这个标准去，而且除了大模型能力之外，你其他的都不能要求。这个就是MCP成功的原因，也是skills我认为未来有可能会成功的一个底层逻辑。Anthropic呢，可以不断地确立新的行业标准，就是遵守了简单、开放、中立这样的一些基础。当然优点呢，是标准性；缺点是什么呢？就是不能吃独食。很多国内的这些厂商说，我也要去建立标准，建立了半天，他老惦记吃独食，这事你肯定就做不起来。现在AI领域里头是什么？就是一帮巨头，甭管美国的OpenAI、Anthropic、谷歌、Grok，这些都是巨头，非常非常值钱的公司。国内的字节、阿里，这都是巨头，可能DeepSeek稍微小一点点。在这个时候，没有谁说我确立一个标准，你必须在我这跑，其他人都不兼容，这事是跑不起来的。OpenAI就老惦记干这种活，吃个独食，把自己的私货加进去，但是效果非常的不好，所以他建立的各种标准一般是没有人用的，都是Anthropic在建立标准，大家去使用。</p>



<p class="wp-block-paragraph">好，这就是今天要给大家讲的故事。感谢大家收听，请帮忙点赞、点小铃铛、参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">Discord讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek R2难产真相！金融时报爆料：华为昇腾芯片训练失败，揭秘国产AI算力的“卡脖子”困境。</title>
		<link>https://lukefan.com/2025/08/18/deepseek-r2%e9%9a%be%e4%ba%a7%e7%9c%9f%e7%9b%b8%ef%bc%81%e9%87%91%e8%9e%8d%e6%97%b6%e6%8a%a5%e7%88%86%e6%96%99%ef%bc%9a%e5%8d%8e%e4%b8%ba%e6%98%87%e8%85%be%e8%8a%af%e7%89%87%e8%ae%ad%e7%bb%83%e5%a4%b1/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 18 Aug 2025 13:35:27 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[华为很厉害]]></category>
		<category><![CDATA[英伟达，NVIDIA，黄教主，GPU]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AI训练]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[B100]]></category>
		<category><![CDATA[Claude 4]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Deepseek R2]]></category>
		<category><![CDATA[Function Call]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[Google]]></category>
		<category><![CDATA[GPT-5]]></category>
		<category><![CDATA[Grok 4]]></category>
		<category><![CDATA[H100]]></category>
		<category><![CDATA[H20]]></category>
		<category><![CDATA[H800]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[Llama 4]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[NVIDIA]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[TPU]]></category>
		<category><![CDATA[XAI]]></category>
		<category><![CDATA[中美科技战]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[传闻]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[升腾910C]]></category>
		<category><![CDATA[华为]]></category>
		<category><![CDATA[华为升腾]]></category>
		<category><![CDATA[国产替代]]></category>
		<category><![CDATA[国产芯片]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[字节跳动]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[技术瓶颈]]></category>
		<category><![CDATA[推理]]></category>
		<category><![CDATA[散热问题]]></category>
		<category><![CDATA[浸没式液冷]]></category>
		<category><![CDATA[液冷]]></category>
		<category><![CDATA[深度求索]]></category>
		<category><![CDATA[百度]]></category>
		<category><![CDATA[算力]]></category>
		<category><![CDATA[腾讯]]></category>
		<category><![CDATA[芯片战争]]></category>
		<category><![CDATA[英伟达]]></category>
		<category><![CDATA[辟谣]]></category>
		<category><![CDATA[金融时报报道]]></category>
		<category><![CDATA[难产]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2469</guid>

					<description><![CDATA[兄弟们，震惊部又来！FT曝：DeepSeek R2被升腾拖进产房卡壳，华为救火队常驻也拉不动，最后无奈切回NVIDIA 🙃。更离谱：8.15-8.30的“官宣”，居然是R1自己幻觉出来的…😂

现实是：训练≠推理。海外已是10万块H100开团，我们这边910C一热就“打怪不能存档”🫠；液冷得全浸泡，相关股票倒是先起飞了💦📈。真能稳训大模型的，除了英伟达就剩谷歌TPU了。

两大“国运级”相撞，先躺的不是DeepSeek，只能继续等奇迹。DeepSeek不融资不表演，憋大招也许真有可能？点个赞，保佑R2别再难产；评论区站队：N卡、TPU还是升腾，你押谁？🤔🔥

 DeepSeek R2难产真相！金融时报爆料：华为昇腾芯片训练失败，揭秘国产AI算力的“卡脖子”困境。

揭秘DeepSeek R2发布推迟的真正原因：传闻因华为升腾芯片在关键的大模型训练阶段遭遇技术瓶颈，导致项目被迫换回英伟达GPU。这不仅暴露了国产AI算力在稳定性与多卡协同上的严峻挑战，更凸显了我们在追赶GPT-5、Llama 4等动辄需要20万块H100训练的顶级模型时所面临的巨大算力差距。

本期视频将深度剖析《金融时报》报道的背后细节，探讨为何被寄予厚望的华为升腾芯片难以胜任长时间、高强度的大模型训练任务。从散热问题到多芯片互联速度，我们将层层解析国产算力芯片的现状与困境。同时，我们也将追踪DeepSeek R2发布的“乌龙”传闻——竟是其上一代模型AI自己的“幻觉”所致？

当全球AI竞赛进入算力决战阶段，DeepSeek作为国内的希望之星，它的每一步都牵动人心。国产AI算力能否突破重围，支撑我们走向真正的AI强国？观看完整视频，了解这场AI算力之战的幕后故事。别忘了点赞、订阅并分享你的看法！

###
#DeepSeek #华为 #AI芯片]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="DeepSeek R2难产真相！金融时报爆料：华为昇腾芯片训练失败，揭秘国产AI算力的“卡脖子”困境。" width="900" height="506" src="https://www.youtube.com/embed/RfBUVJ6pHTI?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">8月14号，英国金融时报发了一篇报道，说Deepseek R2模型之所以难产，是因为在使用华为升腾芯片训练的时候，持续遇到了技术问题，最后被迫改用了英伟达芯片。甚至透露华为曾经派出一支救火队，常驻在Deepseek，手把手帮忙调教升腾服务器，但仍然无法完成训练。无奈之下，Deepseek只能退回老路训练，重新切换回性能更加可靠的Nvidia的GPU，升腾芯片仅退居辅助，用于模型推理环节。</p>



<p class="wp-block-paragraph">虽然没有华为和Deepseek官方的回应，也没有他们的辟谣，但是呢，据说是援引了三位知情人士的一些说法，也进行了很多交叉验证，所以这个事情呢，大概率是真的。</p>



<p class="wp-block-paragraph">国运跟国运相碰撞的时候，升腾也号称是国运级产品，Deepseek肯定是国运级产品，为什么是升腾不灵呢？升腾芯片是可以替代的，也还有一堆竞争对手，所以出现问题以后，他的竞争对手会帮他去宣传。而Deepseek虽然在国内也有模型在追赶，但是地位是不一样的。升腾和国内的其他算力芯片，以及其他那些大模型，从来没有像Deepseek那样震动过世界。所以呢发生碰撞的时候，必须是升腾不行了，不可能是Deepseek不行了。</p>



<span id="more-2469"></span>



<p class="wp-block-paragraph">大家为什么会这么期待Deepseek R2呢？现在又有千问3，也有Kimi、Mini Max，还有豆包等，有一大堆的这些模型出来，怎么就只有Deepseek才行呢？其他人为啥都不行呢？其实现在呢，很多新的这些模型已经并不比Deepseek R1的性能差了，基本上是可以替代使用的。但是大家依然在期盼Deepseek R2，而且你只要讲Deepseek要出R2了，就会有流量。这个原因其实很简单，因为我们在跟国外的大模型竞争中打不过了。</p>



<p class="wp-block-paragraph">国外已经进入了10万级芯片的训练时代了。Llama4，40万块H100训练出来的。虽然Llama4翻车了，但那也是10万块。而马斯克XAI的Grok 4，20万块H100训练出来的，效果相当不错。GPT5的话，现在推测也是20万块H100训练出来的。Anthropic的Claude 4，据说呢是40万块H100，但是呢它这个数并不是那么准确，40万块H100呢是一个部署的数量，并不是精确的训练的数量。另外一个没说的是Gemini 2.5。Gemini的2.5是没有公开数据，因为他们家使的TPU，其他人都是使的GPU，所以呢没有办法去比较，但应该也是几十万块H100的一个算力，才有可能训练出Gemini 2.5来。</p>



<p class="wp-block-paragraph">以前是一个国外大模型特别强，特别是GPT4压着所有的模型的时候，我们终于期盼到了Deepseek R1一出来，觉得我们好像又可以了。但是现在我们发现，国内的大模型跟国外这些明显有差距了。我们只能再去期盼Deepseek，因为其他这些肯定是追不上的。那没有20万块H100，这个日子就没法过了。国内的算力芯片呢，大家也都知道不是那么靠谱。这个时候大家期待的就是奇迹了。</p>



<p class="wp-block-paragraph">Deepseek V3、Deepseek R1，他们呢号称使用了2,048块H800，还不是H100。他们这个算力转换，可能也就是1,000多块H100。拿这样的算力就直接训练出来了，大家觉得你们可以用很少的卡训练出来，还可以震惊世界。现在我们还搞不定20万块的H100，是不是依然可以期待Deepseek再创造一次奇迹呢？</p>



<p class="wp-block-paragraph">Meta花了好多钱收入进去的亚历山大王曾经在接受采访的时候说，Deepseek手里头有5万块H100，压根就不是他讲的几千块就给这事搞定的事。而且呢，新加坡3月份还抓了一些向大陆走私英伟达芯片的人，有传闻说这些芯片的采购方里边包括Deepseek。</p>



<p class="wp-block-paragraph">Deepseek呢也正式做出过回应，2025年2月份做了回应。Deepseek强调，仅使用了2023年合法采购的H800芯片，其他我都没用。但是讲完了这个以后，甭管你原来这个东西到底有还是没有，你讲这个话以后肯定就不能再用了吧？所以呢现在大家期待说，这个反正你们原来是这么讲的，我们就这么信了。那以后呢创造奇迹也只能是等着你了。哪怕是使用H20芯片，用很少的芯片训练出来，堪比20万块H100芯片训练结果的这种奇迹，也不是完全不可能吧？这个怎么说呢，人有多大胆，地有多大产吧。我们总还是要有一些希望吧。</p>



<p class="wp-block-paragraph">新的模型没有出来，但是新的论文呢，Deepseek其实一直不断在产生。在V3跟R1之前，Deepseek也没做什么铺垫，这不也就突然蹦出来了吗？他是这样去期待这个Deepseek的。</p>



<p class="wp-block-paragraph">原来讲是8月15号到30号之间要发新版本，最后Deepseek自己出来辟谣说：“对不起，我们发不出来。”英国金融时报出来说，被这个升腾给拖累了。那这消息是怎么传出来的呢？Deepseek原来是有没有说过自己要去发Deepseek R2这件事呢？</p>



<p class="wp-block-paragraph">首先呢，是Deepseek R1震动了世界，应该是在2025年春节前后的时候，我印象里特别深刻。Deepseek R1出来以后，我还连续做了很多天的直播来跟大家讲这个事情。国际大厂呢，在Deepseek R1的这种搅动之下，纷纷转向。转向什么呢？主攻数学、科学与编程，然后呢是长上下文、工具调用和agent，以及指令依从、降低幻觉。</p>



<p class="wp-block-paragraph">数学跟科学这块呢实在太难了，这个咱们不擅长，而且那个你真的是需要可能10万块、20万块卡，你才可以把这事搞定，咱们没有。那编程呢基本可用，国内的这些模型做编程，肯定没有Anthropic的Claude 4好用，但是呢也基本上可以跑。长上下文、工具调用和agent这块呢，包括指令依从这一块呢必须要有，这一块其实国内的大模型基本上已经追上了。剩下的呢降低幻觉这事咱们就不谈了，反正有幻觉还是可以甩锅的事情。全面开源，这个是国内大模型真正卷的地方。千问直接把200多b的模型直接就开源出去了，Deepseek 600多b的模型直接开源出去了。这件事情我们在努力的往前走，所以各有所长吧。基础设施这块、数学科学这部分实在是费劲，大家就期待Deepseek来再创辉煌了，其他人就不管了。</p>



<p class="wp-block-paragraph">Deepseek发R2这件事呢，其实传了两回。一回呢5月份，风起云涌。每一次说Deepseek要出R2的时候呢，都是风起云涌的时候，大家都在上新模型，说呀Deepseek你也得上，所以就会开始给他传这个事儿。</p>



<p class="wp-block-paragraph">今年5月份，发生了一些什么样的事情呢？首先呢Claude 4、Opensource和sonnet这些模型直接出来了，王炸。5月份开谷歌IO，Gemini 2.5 Pro和Gemini 2.5 Flash直接发布，这个其实现在已经是我的主力模型了。GPT呢当时倒是没有什么特别大的动作，上了一个Deepseek 4.5，但是呢也没有引起特别多的响动。大家就说Deepseek你们也该来了。但其实呢Deepseek没有去出R2，而是把Deepseek R1的模型稍微的小步更新了一点点。</p>



<p class="wp-block-paragraph">6月26日，the information就做了一个报道，说Deepseek R2原来计划是5月份发布的，但是呢因为梁文峰对于Deepseek R2表现的性能不是很满意，决定推迟了。路透社呢也引用了the information的这个报道，国内的媒体呢也纷纷去引用。但是这件事呢，并没有得到Deepseek官方的回应。Deepseek这个公司就是这样，他基本上不怎么回应大家的这个响动。你们猜吧，猜完了以后我也不理你，除非是有一些太过分的，否则他一般不说什么。</p>



<p class="wp-block-paragraph">Deepseek呢也不是说没更新，就是做小版本更新。像Deepseek V3出了0324版，也就是2025年3月24号出了一个版，把分数又往上刷了刷。因为每一次去更新这些模型，一定要刷分数上去。代码能力，特别是前端代码能力呢，有所提升。拿这玩意写个网页没什么问题，但你说我要做一些大的架构，或者做一些这种后端的东西，可能就要稍微费劲一点。做算法的东西要费劲一点。为什么？因为它Deepseek有一个问题，就是它的上下文比较短，想去做一些大的架构上的东西，你必须上下文长，你得能把整个代码塞进去才行，这块还是要费点劲的。然后他把中文写作能力做了一些提升，Deepseek其实一直在努力的方向，就是中文推理。因为在海外的这些模型，很多都是使用英文推理，然后再翻译成中文的。他说我们直接用中文推理这个事，是不是OK？他们一直在努力干这件事情。使用体验上呢也有所提升，特别是function call更加准确了。在做AI agent的时候，其实核心就是function call的能力，就是我们先描述一堆的功能，然后交给大模型，大模型在完成整个的语言生成的过程中呢，去根据你描述进来的这些function，去决定我要调哪个、不调哪个，或者如何去调用、什么时候调用。Deepseek V3 0324呢，就在这一块做了一些增强。</p>



<p class="wp-block-paragraph">Deepseek的R1呢，其实也更新了一个版本，就是0528。大家在传说Deepseek要出R2，讲的其实就是0528的这个版本。而这个版本呢，其把这个分又往前刷了刷，减少生成的一些错误信息。因为Deepseek最大的让大家无法忍受的东西是什么呢？就是胡编乱造，他太喜欢瞎编了。所以在这一块呢，稍微做了一些调整，但是依然胡编乱造的很厉害。Deepseek 210528呢，还支持了Json输出和function coding，提升了调用的准确度，但是呢不能叫R2。这就是5月28号的这个版本。</p>



<p class="wp-block-paragraph">紧跟着就开始传说了，说8月15号到8月30号，要准备发布Deepseek R2了。这个消息是怎么来的呢？首先肯定还是要风起云涌一下。8月份发生了些什么事情呢？马斯克XAI的GROK4发布了，Anthropic又发布了Claude 4.1 Opensource，OpenAI发布了GPT5。GPT5这东西到底好不好使，大家各自去领会。大家可以认为说，GPT5是一个划时代的产品，但是也可以认为说，GPT5就是山姆奥特曼为了要去忽悠融资去搞的一个事情。因为GPT5出来以后，OpenAI的估值已经正式从3,000亿美金提升到5,000亿美金了，而且是孙正义要去买这个单，说您这5,000亿美金我认了，我去买去。</p>



<p class="wp-block-paragraph">所以呢8月份风起云涌了。那么空穴来风呢，你这事怪不得别人。在Reddit上有人发了个帖子，这个帖子特别有意思，他说他去问了Deepseek R1：“Deepseek R2什么时候发布？”他等于是把这个东西交给Deepseek R1了。但是大家注意，Deepseek R1这个大模型呢，它并不代表Deepseek这公司的一些官方的观点，只是说这个模型给你生成了这样的一个结果。Deepseek R1回答了：“8月15号到8月30号之间发布。”而且号称呢是引用了雪球和东方财富等可信的信源，而且进行了多个渠道的证实。</p>



<p class="wp-block-paragraph">Deepseek R1的幻觉其实一直都是很严重的，虽然经过0528的调整以后，但依然很吓人。而且Deepseek R1的最大幻觉是什么？就是编造可信的信源。说我从哪哪引用了，你点进去以后，压根就没有这篇文章。但是甭管怎么说，这个文章就在Reddit上就贴出来了，随后呢这个消息就逐渐的被传播和放大了。国内的很多的媒体、自媒体就开始引用这篇消息，特别呢是华为下边的一些科技媒体进行了转载。而且呢在标题里边还夹带了私货，讲的是什么呢？讲的是深度求索，就是Deepseek这个公司，“升腾芯片版本Deepseek R2预计在本月发布”。它讲的就是说，它是使用升腾芯片来去做训练的。</p>



<p class="wp-block-paragraph">华为都说了，两大国运级产品强强联合了，那信吧，这事怎么办呢？国内一帮的媒体就冲上去说：“我们信了，确实是有这事了。”到8月14号，英国的金融时报出来报道，说升腾芯片拖累了Deepseek 2。然后动点科技、腾讯科技就出来辟谣，原引自公司内部人士，也就是Deepseek这公司里边的人说了，说8月份不会发布Deepseek R2。所以呢，8月15号到30号之间发布Deepseek R2的一个消息，实际上是Deepseek R1自己编出来的，其他人把这个编的信息信了，直接截了个图发到这个Reddit上，以此来发酵出来的一个过程。</p>



<p class="wp-block-paragraph">那么Deepseek R2到底遇到了一些什么样的问题呢？首先升腾芯片确实是有问题的。升腾910C的这个芯片，虽然单芯片的算力在部分指标上呢，已经达到了H100的水平，但是呢显存的带宽不够，想从显存里调数据回来，速度是没有H100快的。而且最大的问题是什么？就是多个芯片之间的速度，就是我需要把数据在多个芯片之间进行流通的时候，这个速度是相对来说比较差的，而且差的很远。你要想去做同样的训练的话，你就需要更多的时间全功率的去运转。因为你想，人家都已经达到20万块H100这样的集群的规模再去训练新的模型了，你没准就是需要这个50万块或者60万块升腾910C串在一起，才能达到人家那个算力，而且你需要很长的时间去连续的运作，这个对于升腾910C的这种考验来说就比较大了。</p>



<p class="wp-block-paragraph">这样的芯片，其实是没有办法长时间稳定地去运行的。并不是说训练一个模型，这头输入进去数据，过三个月去开盖看结果。中间每过一段时间，可以取得阶段性成果，再继续往下训练。但是中间这个过程呢，你是不能停的。你中间比如说准备了一批数据，你去训练了，如果这批数据没有训练完，升腾910C就直接冒烟了，就不干活了，这一波呢就白干了，你必须要从这个节点接着往后干。这个玩意有点像什么？有点像打怪升级，你一定要打死这个妖怪才能存盘，你没打死这个妖怪就不让你存盘。升腾910C在这块差一点。</p>



<p class="wp-block-paragraph">那为什么差呢？升腾910C呢，是两个910B堆叠在一起的，散热肯定会出问题。就算是上了液冷以后，依然是搞不定这个事情。</p>



<p class="wp-block-paragraph">其实同样的坑，英伟达也踩过。大家还记得H100独挑大梁好久了吗？很多人应该还是有印象的。甚至呢到现在为止，H100已经成为一种计量单位了。现在我们再去算说：“你这个算力相当于多少英伟达芯片呀？”我们都是以H100的这个算力作为一个计量单位的。就是因为H100挺长时间在那孤独一只。为什么它会孤独一只呢？本来计划替代H100的这个产品叫B100，叫Blackwell黑井100，这个芯片直接就跳票了。研究完了以后开了发布会，开完了以后，这个芯片压根就没有大规模的部署，也没有交付。为什么呢？就是他做的就是这种堆叠技术，导致散热失败。散热失败了以后会直接把版卡烧掉，这压根就没有办法去交付。到H200出来了以后说：“那这咱交付这个呗。”但是一开始依然是受困于散热问题，导致了大规模交付的延迟，一直到今年才开始去交付H200。</p>



<p class="wp-block-paragraph">后面的工艺呢不断的进步，再加上全面液冷。H100这些机器是可以进行风冷的，你拿风扇吹它是OK的。但是到H200这个机器开始交付的时候，你必须是液冷。而且这种液冷呢，还不是种普通的液冷，叫完全浸泡式液冷。见过这种游戏主机装机视频的这些人，会知道他们那个液冷是怎么做的。他在芯片外面给你涂散热的胶，然后呢把这个液冷管贴上去，靠这个液体呢快速的把你热量带走到外边，再去找风扇把这个水给你吹凉了，再重新循环，它是这样来工作的。但是这种工作方式对于H200来说还是不行的，它必须是全浸泡式的，就是把整个的H200的芯片，或者包括它整个的板卡，一起泡在这个液体里头。这就肯定不是水了嘛，是一些不导电的水，整个泡在里头，才能够达到散热的这个能力。</p>



<p class="wp-block-paragraph">当然了，甭管是英伟达也好，还是升腾也好，散热都是有问题的，导致什么呢？就是液冷概念股都涨疯了。你只要说我这公司是做液冷的，就赶快涨。而且现在都是浸没式液冷，就把整个板卡都泡里头。A股上强瑞科技、英维克、深林环境、飞龙股份，大概有十来家公司，都是专门做液冷的。飞龙股份是专门给升腾这个384超节点做液冷的。美股那边的话，有一个叫VERTIV的一个公司，它的代码是VRT，是专门给英伟达做液冷的公司，这个公司的股票也是涨的可好了。</p>



<p class="wp-block-paragraph">讲回来，910C这个芯片连续的做长时间训练的话，液冷也压不住，直接把板卡烧掉。即使是有大量的华为的工程师坐在Deepseek公司里头，出来我帮你调，他也调不过去。实际上这些华为工程师能调什么呢？他们只能调一件事，就是CUDA里头没有实现的部分，我来帮你去实现一下。华为的这个升腾910C，他们使用的训练相关的代码的话，是华为自己开源的一套训练框架。这套框架据说是可以实现CUDA 70%的功能，但是还有30%你是实现不了的。那这一部分由华为的工程师到现场来搞定。再怎么搞，该冒烟、该着火、机器直接停摆，这个事它是解决不了这问题的。</p>



<p class="wp-block-paragraph">另外一个传闻，DEEPSEEK R2出不来的原因是什么呢？是数据标注的质量跟速度不过关。这个呢也没有得到官方的证实，也是坊间在流传。因为在中国嘛，很多的数据肯定还是需要去审核一下的，这个审核的过程是相对来说比较麻烦的。</p>



<p class="wp-block-paragraph">而且Deepseek呢，其实一直也是一个比较低调的公司。提前预热，不停的出来吹牛，这件事呢是容易翻车的。山姆奥特曼每次出来讲GPT5，说：“我太震惊了，我从来没见过这么棒的。”等GPT5发布的时候，大家说：“这就能让你震惊了？您到底是眼皮子有多浅？”马斯克在发布GROK4之前，也在说：“这是我所见过的最聪明的大模型。”也有人认为老马吹的有点过头了。</p>



<p class="wp-block-paragraph">其他的公司都必须不断的发模型，跟着一起卷，不断的来吹牛，这个事是有原因的。为什么？因为这些公司是需要融资的。马斯克发GROK4发完了以后，马上就给XAI去融资。山姆奥特曼GPT5发完了马上融资，这公司直接值到5,000亿美金了，他现在已经是没有上市公司里头最贵的一家了。第二家应该是SpaceX，再往后是3,000多亿的字节跳动。但是大家注意，字节跳动的收入现在好像已经超过Meta了，这个是非常吓人的一个事情。所以这些人他有融资的需求，你就必须得不断的出来炒这个热点。不炒的话，你说我现在想提高估值，融资这事费劲了。而且现在Anthropic也在融资，而且是要按照1,500亿美金的估值要去融资，我估计他们后边的日子不是那么好过，现在他们的CEO应该已经奔中东，找中东土豪去给钱去了。</p>



<p class="wp-block-paragraph">谷歌呢虽然不需要融资，但它后边有股市、有股价、有市值这些东西，所以呢不能落后，所以谷歌也必须要不停的推陈出新。实在做不出来东西呢，确实哪块也做的不太行，怎么办呢？你还可以像扎克伯格那样，表演抢人大戏这种行为艺术。我发2亿美金的薪水，我把人抢回来。虽然你的Llama4像屎一样，Llama再往后怎么走谁也不知道，但是看到你表演行为艺术表演的这么热闹的话，Meta的股价涨的也还可以。所以大家必须不停地去表演。</p>



<p class="wp-block-paragraph">但Deepseek自己，他没有这种融资的需求，所以呢也并不太需要出来表演，自己踏踏实实做自己的事就好了。至于说他到底做成什么样，咱们也只能在外边来看。</p>



<p class="wp-block-paragraph">大家有没有想过这样的一个问题：到底是谁家的芯片能够训练大模型呢？训练跟推理是完全两个不同的概念。训练你是必须要长时间高强度的工作，而且在中间是不允许停的。而且在训练的过程中，我们需要在更多的芯片之间进行数据的调度，更更大规模的这种协同。国内的这些算力服务器都搞不定这件事情，他没有办法说让这么多的芯片相互之间进行协调的情况下，这么长时间稳定的工作下去。推理的话相对来说要简单一些，可能只要几个芯片读出很少的数据来，他就可以把这事干完。比如说我们去提了一个问题，他给我们过了几秒钟做了一个反馈，反馈完了以后呢，他就可以再给我们分配其他芯片了。在这个过程中，芯片出现任何的问题，过热了或者说你对资源进行切换了，它是不影响的。所以呢推理咱们国内的这套系统是可以的，但是训练搞不定。</p>



<p class="wp-block-paragraph">那么到底谁家的芯片可以做训练？英伟达这个必然是可以的。除了英伟达之外，还有哪些芯片可以进行大规模的这种模型训练呢？你说我这个芯片训练了一个10B的、20B的模型，这不算。或者说你说我这个虽然能够训练，但是我训练的模型从来没有人用过，这个也不算。现在唯一证实了可以进行大规模训练的，而且是训练这种大模型的，还被大家普遍接受和使用的，猜猜是谁？</p>



<p class="wp-block-paragraph">很多人可能会猜是不是AMD？AMD MI300，或者现在应该是MI三百零几了吧，这样的一个芯片。不是他们。现在唯一的一个能干这个活的人，是谷歌的TPU。Gemini大模型是在上面训练出来的，Anthropic的Claude模型有部分声称是在TPU上训练的。除了英伟达之外就是他们了，再没有第二家了。</p>



<p class="wp-block-paragraph">那老牌厂商像AMD、英特尔，号称我这个芯片是可以进行大规模的模型训练的，也给出了一些用他们的芯片训练大模型的实例，甚至呢还训练了一些不太流行的小模型拿出来去开源，但是他们训练出来的模型也没人用。AMD跟英特尔呢，一般大概也就是10B或者20B以内的这些小模型。另外一个呢就是富士通，富士通用一款ARM的CPU呢，也训练过一点可能也是10B以内的这种小模型吧，也没有听说过谁去用他们。</p>



<p class="wp-block-paragraph">其他的一些ASIC芯片呢，也是号称自己能做。所谓ASIC芯片呢叫专用集成电路，像升腾、谷歌TPU呢都属于ASIC。亚马逊、阿里、百度呢，也都号称可以进行训练，但是呢没有实例。亚马逊号称是我拿自己的ASIC芯片呢，做了一些训练，也有几个模型，但是呢谁都没用过。OpenAI的模型，有些据说是在亚马逊上进行训练，但这个事呢，也没有得到最终的证实。百度呢是号称自己设计的ASIC芯片可以去进行训练，但是反正百度自己家的模型烂的跟屎一样，我们就不去评论了。</p>



<p class="wp-block-paragraph">至于华为的升腾芯片呢，科大讯飞号称是在上面训练的。但是呢也有朋友跟我讲说，科大讯飞其实是在英伟达上训练出来的，只是呢对外宣称是在升腾上训练的，这个我们就不去做考证了。只是科大讯飞的模型，其实也没有那么普遍，除了一些教育领域里头有些人会去用，其他的让你自由选择的时候，很少有人会去选择用科大讯飞的模型。华为呢自己号称是在升腾模型上训练了盘古大模型，但是呢前面被内部的人指责蒸馏、指责抄袭，之后就不再有任何声音了。所以现在华为已经不再提他的盘古大模型这事了，估计是准备装一段时间的死狗以后，再次遥遥领先。所以华为的升腾模型，其实没有证实过训练成功过任何的大模型。Deepseek R2呢，应该是真的尝试过，但是败下阵来。</p>



<p class="wp-block-paragraph">华为跟Deepseek官方呢，都没有出来证实，就既没有出来说我用了，也没有出来说我没用。所以呢升腾芯片，没有成功的训练出过任何一款大家普遍使用的模型。</p>



<p class="wp-block-paragraph">那么国内的算力芯片是怎么样去竞争的呢？英伟达大概占54%，就一半多。升腾呢占28%，其实已经占的非常非常多了。像寒武纪等等其他的一些芯片公司的，所有的加在一起，可能还加上AMD的吧，一共占18%。这个大就是国内整个的算力芯片的一个分布情况。</p>



<p class="wp-block-paragraph">国产的芯片呢，目前来看都是可以去做推理了，但是呢没有哪一个真的跑出来模型过。所以国内的算力芯片，基本上是没有办法做训练的。</p>



<p class="wp-block-paragraph">现在呢还有一群的“赢学家”在鼓吹英伟达芯片里头有追踪器。但是这些“赢学家”呢，现在有点吹不下去了。他说呀：“这个英伟达的芯片里头，是不是在集装箱里装追踪器了？”还有人说：“是不是在包装箱里装追踪器了？”或者是说：“在服务器里边装追踪器了？”因为他们也知道，在这个芯片里头是装不上的。还有人说：“H20这里头肯定没有追踪器，但是呢H100、B200这个里头有追踪器。”这个呢都想多了。因为中国人是经历过挖矿的，我们是完完全全可以把芯片整个扒下来，重新拿新的版卡去焊。而且大量的，其实做英伟达版卡的公司就在国内，所以我们完全可以拿他的版卡，自己回来去加工这个事情。装追踪器这个事是没用的。</p>



<p class="wp-block-paragraph">中国官方对于H20的态度呢，也很暧昧。有人就到外交部的新闻发布会上就问：“说你们是不是要准备禁售H20？”外交部的新闻发言人回答是：“没听说过这件事情。”中国的这些官员回答，一般都不会说是或者不是，通常回答是：“请你看以前的表态”，或者“请你看有关部门的表态”，或者说“我不知道”、“没有听说过”。所以他这一次的回答叫“没听说过”。</p>



<p class="wp-block-paragraph">中国政府呢，也没有明令禁止说我们去销售H20或者谁去买这东西。但是呢潜规则就是这样去运营的。多家媒体，比如说Bloomberg、Marketwatch就做了些报道，说中国的监管部门针对H20芯片表达了强烈的不信任和谨慎态度，尤其是强调相关芯片可能存在后门的风险和数据隐患，建议企业回避在政府或敏感用途使用H20。所以呢这些H20可能最后去做训练就完了，推理的这块就通通交给国内的升腾384超节点就OK了。</p>



<p class="wp-block-paragraph">还有报道说字节跳动、腾讯、百度等企业被召集，这些人是准备去买H20的。国内的有关部门把你们都召集一块说：“你们为什么要买这东西？买多少？”给他们开这样的会。监管侧重国家安全与网络安全审查，并未提出商业禁令，就是我们还是让你买，但是你买之前呢，我们得把你拎来稍微恶心恶心。所以现在都约谈过了。</p>



<p class="wp-block-paragraph">总结一下吧。Deepseek R2呢确实是难产了，肯定的没有出来。国内的算力芯片目前呢，也无法进行大规模的模型训练，可以进行推理这个事没问题了，但是训练搞不定。20万块H100量级以上的大模型训练，国内很难突破。如果20万块串在一块可以训练大模型的话，我们可能至少需要40万块或者50万块，比如像升腾910C这样的芯片凑在一起，而且我们所需要消耗的电和时间，可能都是要呈几何级数上升的。因为我们卡之间的联通的速度是相对来说比较慢的。所以比如说H100，它也不是说一直就不坏，它可能工作个20个小时或者是40个小时都会坏一次，会出现问题，对于老外来说就可以去接受了。对于我们来说呢，我们可能要求要连续坚持500个小时不出问题，才能够回收回来数据了，因为算的慢嘛，真的达不到。大概就是这样的一个情况。</p>



<p class="wp-block-paragraph">国内算力卡的这些供应商呢，很有可能会阻碍中国大模型的进展和训练。为什么呢？自己做不好，你又不让别人买H20，可能中国的大模型再往下一步走，就会变得非常非常困难了。</p>



<p class="wp-block-paragraph">未来国内算力卡是不是可以训练大模型呢？反正一两年之内呢稍微有一些困难吧。国内的大模型到底能不能用呢？基本还是能跑的。高深的数学、科研研究、物理学或者这些基础学科，我们不去研究了。就是让你去做一些信息整理，现在国内大模型基本上都是可以用的。</p>



<p class="wp-block-paragraph">还是稍微耐心地等待一下Deepseek的慢慢发展吧，它反正中间只要不需要融资，它也不需要出来吆喝，万一有惊喜呢？这个也不好说。这就是我们今天要讲的故事。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？</title>
		<link>https://lukefan.com/2025/04/07/llama-4%e6%82%84%e7%84%b6%e5%8f%91%e5%b8%83%e9%9c%87%e6%92%bc%e4%b8%8d%e8%b6%b3%ef%bc%9f%e5%af%b9%e6%af%94deepseek%e4%b8%8e%e5%8d%83%e9%97%ae%ef%bc%8cmeta%e7%9a%84moe%e6%9e%b6%e6%9e%84%e5%92%8c/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 07 Apr 2025 00:45:28 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[1000万Token上下文]]></category>
		<category><![CDATA[400B]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI应用场景]]></category>
		<category><![CDATA[AI新闻]]></category>
		<category><![CDATA[AI未来发展]]></category>
		<category><![CDATA[AI模型发布]]></category>
		<category><![CDATA[AI竞赛]]></category>
		<category><![CDATA[AI算力]]></category>
		<category><![CDATA[Claude 3.7]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[FP8精度]]></category>
		<category><![CDATA[Function Call]]></category>
		<category><![CDATA[Gemini 2.5 Pro]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[Grok (XAI)]]></category>
		<category><![CDATA[H100 GPU]]></category>
		<category><![CDATA[INT4量化]]></category>
		<category><![CDATA[Llama 3]]></category>
		<category><![CDATA[Llama 4]]></category>
		<category><![CDATA[Llama 4 Behemoth]]></category>
		<category><![CDATA[Llama 4 MARVELIC]]></category>
		<category><![CDATA[Llama 4 Scout]]></category>
		<category><![CDATA[Llama 4发布反响平淡原因]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[Meta AI]]></category>
		<category><![CDATA[Meta战略]]></category>
		<category><![CDATA[Mixture of Experts]]></category>
		<category><![CDATA[MOE架构]]></category>
		<category><![CDATA[专家模块]]></category>
		<category><![CDATA[中文能力提升]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[全模态AI进展]]></category>
		<category><![CDATA[千问 (Qwen)]]></category>
		<category><![CDATA[卡估值]]></category>
		<category><![CDATA[多模态输入]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[字节AI]]></category>
		<category><![CDATA[小模型竞争]]></category>
		<category><![CDATA[开源LLM对比]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[开源模型内卷]]></category>
		<category><![CDATA[开源社区]]></category>
		<category><![CDATA[推理速度]]></category>
		<category><![CDATA[文本输出]]></category>
		<category><![CDATA[模型微调]]></category>
		<category><![CDATA[模型性能比较]]></category>
		<category><![CDATA[模型测评]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[活跃参数]]></category>
		<category><![CDATA[流量入口]]></category>
		<category><![CDATA[知识蒸馏]]></category>
		<category><![CDATA[硬件要求]]></category>
		<category><![CDATA[端到端模型]]></category>
		<category><![CDATA[腾讯AI]]></category>
		<category><![CDATA[谷歌AI]]></category>
		<category><![CDATA[超级APP趋势]]></category>
		<category><![CDATA[长上下文]]></category>
		<category><![CDATA[阿里AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2075</guid>

					<description><![CDATA[🔥家人们！今天凌晨Meta直接扔核弹了！！
LLAMA4带着1千万token上下文杀疯了啊啊啊！！！
（ps：1千万token≈20小时超长视频解析能力‼️）

这次直接祭出3大杀器：
1️⃣【侦察兵版】109B参数+16专家模块
2️⃣【独行侠版】400B参数吊打GPT4O
3️⃣【巨兽版】2000B参数+32K显卡训练（国内集体倒吸凉气）

最绝的是那个1千万token！！
别人家还在卷64k/200万
Meta直接拉满到10M级！这是什么概念？
相当于一口气读完30本《三体》全集！！
（DeepSeek连夜改PPT了吧🤣）

但这次为啥没刷屏？
真相太扎心👇
👉国产千问/DeepSeek早就把赛道占满
👉109B起步的巨无霸根本跑不动！
👉超级APP大战已经白热化...

最恐怖的是！！
Meta明牌说要搞端到端全模态！！
（语音/视频/图片直接互转要来了‼️）
现在压力给到某讯某里某节...

评论区快告诉我！！
你们站LLAMA4还是国产大模型？

Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？

eta **Llama 4发布**，扎克伯格亲自官宣，但市场反响平平。这款采用**MOE架构**（**混合专家模型**）的**AI大模型**分为Scout (109B)、Marvelic (400B)和未来发布的Behemoth (2000B)版本，最大亮点是支持业界领先的**1000万TOKEN**超**长上下文**处理，支持**多模态**输入（文本、图像、音视频）和文本输出。性能上，**Llama 4**较Llama 3有显著提升（尤其**中文**能力），基本追平**GPT-4O**、**Claude 3.7**，但可能稍逊于**Gemini 2.5 Pro**。然而，其发布未如预期般震撼，原因在于**开源大模型**领域竞争激烈，已有**DeepSeek**、**千问**等强劲对手，且Llama 4放弃小模型（最低需**H100 GPU**运行），未能带来颠覆性突破，引发“审美疲劳”。当前**AI趋势**聚焦**超级APP**竞赛、端到端**多模态**能力及**AI Agent**/**Function Call**整合（**Meta**在此落后）。**Meta AI**虽手握资源，但在**AI竞争**中面临挑战，其**开源大模型**领导地位受**Grok**等模型冲击，亟需在“卡估值”逻辑减弱前，拿出成功的应用场景与**超级APP**，否则将面临严峻考验。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？" width="900" height="506" src="https://www.youtube.com/embed/vWmFaUzNqlg?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Llama4发布了。这里的黎明静悄悄，没有什么响动。这是怎么回事？</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。一觉醒来，Llama4就发布了。扎克伯格亲自在Facebook的REELS（也就是Facebook的短视频里面）发了一条视频，说Llama4发布了，今天是Llama4日。</p>



<p class="wp-block-paragraph">Llama4呢，一共是有三个版本：<br>第一个叫Scout（侦察兵版本），总参数1,090亿（也就是109B），活跃参数是170亿，包含16个专家模块。对的，Llama终于也放弃抵抗了，从Llama4开始变成Moe了。在Llama4之前的版本都是单一体的模型，Llama3.3还给了一个400多B的单一模型，到Llama4彻底放弃抵抗了。</p>



<p class="wp-block-paragraph">现在呢，支持1,000万TOKEN这种上下文，这个是Llama4最大的一个特点。DeepSeek是64K（也就是64,000个TOKEN上下文），现在上下文比较大的Gemini大概是能到2兆（200万），Llama4直接给了一个10兆（1,000万TOKEN），这是它做的一个很创新的点。</p>



<span id="more-2075"></span>



<p class="wp-block-paragraph">1,000万TOKEN的上下文可以干嘛？可以处理20小时以上的视频或者超长文档，是行业领先的长上下文技术。采用了混合专家模型（也就是MOE架构），在INT4量化后，可以在单个的H100 GPU上运行，每秒处理42,400个TOKEN，还是速度比较快的。但是要注意，即使经过量化到Intel4上，它也必须要有H100，否则跑不起来这东西。所以咱们普通的电脑就别惦记了，最小的模型就是它了，没有更小的了。</p>



<p class="wp-block-paragraph">所以这一次Llama4的发布，并不像以前的Llama1、Llama2、Llama3似的，把各个尺寸的模型都做出来（从7b、14b、72b、32b什么这些都做一遍），没有，上来最小的一个就是109B。它可以支持文本、图像、音频、视频的输入，目前呢只支持文本的输出，未来应该会出现全模态输出的版本。这是它最小的一个侦察兵。</p>



<p class="wp-block-paragraph">中间的模型呢叫MARVELIC（独行侠），总参数量400B，活跃参数量17B，包含128个专家模块。它的专家模块变多了，超越GPT4O、DeepSeek V3，仅次于闭源模型Gemini2.5 Pro。Gemini2.5 Pro现在还是最强的，没有之一。在编程和数学任务中，仅用DeepSeek V3一半的参数即可达到相当的性能，但是你上再多参数也就这水平了。</p>



<p class="wp-block-paragraph">所以，它在数学跟编程角度上来说，跟DeepSeek V3应该是半斤八两，只是它的运算效率要更高一些。最大的一个叫Behemoth（巨兽），总参数量2000B，活跃参数量288B，包含16个专家模块，使用30万亿多模态TOKEN（就是文本、图像、视频），在32K（也就是32,000个GPU）上训练，FP8精度，提升效率。所以，你有足够的显卡才可以玩这件事情——32,000块显卡。Deepseek到现在为止，都没有承认它有这么多块显卡。所以，这种巨兽，国内追赶起来是比较费劲的。</p>



<p class="wp-block-paragraph">只是呢，这一个产品目前并没有发布出来，前面两个发布了，这个应该是在2025年的下半年发布。这个巨兽在数学、科学等基准测试中，超越了GPT 4.5、Claude sonnet 3.7和Gemini2.0 Pro。但是是不是超越了2.5 Pro，我现在没有看到相应的介绍。它呢，主要的作用是作为教师模型，用于知识蒸馏——就是我做一最大的，然后下边这些小的模型、中型的模型，都是拿这个最大的进行蒸馏，蒸馏出来的。现在呢，它也转向了MOE，性能有所提升，但是呢并没有那么明显。最大的特点就是1,000万输入，这个是Llama4做的最不一样的一个点。</p>



<p class="wp-block-paragraph">目前呢，支持全模态输入、文字输出；未来呢，会支持全模态输出，就是端到端的全模态输出。你甚至可以跟它去直接聊天，还可以打断它，就像现在的GPT4O高级语音功能一样。但是这个什么时候出来还不确定。如果能够有全模态输出的话，还是值得期待一下的。未来的方向一定是全模态、端到端的输入输出，现在新的模型都在向这个方向走。</p>



<p class="wp-block-paragraph">那么，为什么没有什么声音讨论它呢？Llama1出来的时候，整个的行业都震动了——这样程度的一个模型一下就开源了，大家都可以拿来去研究了。Llama2出来一看，又可以往前走一步。其实Llama1跟GPT3.5还是有差距的，到Llama2出来以后说“哎，可以用了”，进行一些微调以后，就真的可以去解决一些ToB的，或者说使用范围相对比较集中的应用，就可以直接用起来了。我记得是在两年前，就很多国内的项目就在微调Llama。等到Llama3出来的时候说，这个虽然达不到GPT4的水平，但是已经很接近了，大家拿这个东西去稍微调一调，就可以跑了。</p>



<p class="wp-block-paragraph">在Llama3出来以后的话，千问就开始疯狂的去输出各种各样尺寸的模型，就是千问2.0、千问2.5，这一批就直接追赶上来了。但是到Llama4出来，大家没说什么。</p>



<p class="wp-block-paragraph">这到底是什么样的一个情况？我呢，第一时间还上去试了一下。现在你到Open Router这个网站上，你是可以进行测试的，而且是免费的。侦察兵版和独行侠版都可以使用，也有收费的版本。收费版本就是比免费的版本稍微快一点点，主观感受上没有特别大的差异。</p>



<p class="wp-block-paragraph">那你说真的没有什么提升吗？这个肯定不对。它呢，跟现在的GPT-4O、Gemini 2.5、Claude 3.7这种主流模型比起来，确实没有什么提升。哈哈，这个基本上跟他们算站在同一个起跑线上，可能跟Gemini 2.5还稍微的差一点。Gemini 2.5不太友好的地方就是它比较慢，现在的Llama 4是很快的。但是呢，这个Llama 4比Llama 3、3.1、3.2、3.3这些版本还是有巨大提升的，特别是在中文这一块，效果好了非常非常多。大家可以去试一试，就完全可以达到能用的状态了。这个原来在Llama 3的水平上还是达不到的。</p>



<p class="wp-block-paragraph">那么为什么不觉得震撼了呢？原来Llama虽然和闭源模型比起来稍有差距，但是呢，毕竟你是开源的吧，开源圈里的扛把子。现在的开源模型也卷起来了，DeepSeek绝对达到了可用程度，千问现在也绝对在数量上碾压。怎么叫数量上碾压？就是千问的模型是数量非常大呀，零点几B，然后到4B、7B、14B、32B、34B，多模态的推理的全都有。这块非常非常完善，而且有非常多的人在以千问模型为基础进行微调。因为你要到手机上，或者到一些嵌入式设备上去进行操控的话，你拿千问这种小模型微调是很方便的。给你一个105B的模型，你拿去微调的话，这个就有点费劲了。所以现在你到Hugging Face上去看，最受欢迎的开源模型基本上都是千问或者是千问系的。</p>



<p class="wp-block-paragraph">所以从数量上，千问绝对赶超Llama。从能用程度上说，DeepSeek比它早发布了几个月，已经达到完全可用的一个状态了。现在Llama 4再拿出来，并没有划时代的提升。同样作为开源版本的大模型，他就没有那么震撼，已经有审美疲劳了。当然了，Llama 4出来，应该大家还是会去抄的。这Llama 1、Llama 2、Llama 3出来以后，实际上对至少国内的大模型产业都是有极强的促进作用的。Llama 4出来呢，应该也是有这种意义。千问和DeepSeek应该会尝试使用这种超长上下文的技术，因为它是1,000万TOKEN嘛。所以这一块至少千问应该会去追赶一下，DeepSeek的话……</p>



<p class="wp-block-paragraph">现在到底在忙什么？不确定。当然，DeepSeek呢，应该也会在多模态上奋起直追。只是奋起直追多莫泰这个事呢，对于卡的数量是一个考验。DeepSeek前面一直说我没有那么多卡，看看后边这个话怎么把它说圆回来吧。</p>



<p class="wp-block-paragraph">那么现在大模型到底在卷什么？大模型最终有可能还是会走向超级APP的道路。好像现在各大厂商依然在尝试卷超级APP，而且超级APP才是流量入口的一个锚点。你没有流量入口的话，你的模型做的再好，其实没有什么意义。这件事情上，以谷歌和Meta作为反面典型，大家看一看。谷歌的大模型其实一直做的还可以的，只是呢它的入口做的比较烂，大家就一直用的比较少。谷歌每一次出新的大模型，先给程序员用，他自己telegram内部用户，甭管是付费的还是免费的，都要很晚才能接触到他们最新的模型。而Meta，Llama做到现在了，做的这么热闹，Meta的用户，甭管是Facebook用户、Instagram用户，其实并没有感觉有特别大的体验上的提升。这个是两个典型案例。</p>



<p class="wp-block-paragraph">这里还有一个正面案例，谁啊？就是马斯克的Xa i 1，一做出来以后，第一件事在x平台上，直接给了一个最核心的入口，直接给了一个Grok的入口，你一点就可以进去聊天去了。现在ChatGPT呢已经是超级APP了，Claude呢应该也接近成为超级APP了。谷歌呢算突然惊醒，ChatGPT 2.5 Pro上来以后，直接把Gemini客户端的经理给干掉了，把Notebook LM的负责人拎回来，你去给大家继续去做Gemini客户端去。这个Notebook LM是用户所喜欢的，Gemini被人骂了这么久了，我们要换一换了。而且Gemini 2.5 Pro一上来，就直接给Gemini的免费用户就开放了。所以谷歌已经醒过味了，说我们要换一个姿势了。</p>



<p class="wp-block-paragraph">现在呢卷王们已经下场了。阿里还在内斗，千问跟夸克还要在内部做一次赛马。腾讯的元宝已经开始疯狂砸钱了。现在的进展到什么样的一个状态了？就这些超级APP都是带有搜索、知识库和靠谱推理的一个结果生成。目前我们现在看到的所有的超级APP，或者叫AI方面的超级APP，基本上都是在这个起跑线上。语音端到端呢，OpenAI做了，Claude我不确定做没做，好像没有。Grok英文的部分已经有了，中文的部分没有。豆包已经做出来了，千问和夸克现在正在奋起直追，腾讯的元宝也还在努力的往前走。</p>



<p class="wp-block-paragraph">DeepSeek在这一块做的稍微有点拉胯。它的语音部分和图屏的部分，就是多模态的部分，稍微差那么一点点。再往后就是图片、视频、音频的理解和生成。现在这些呃超级APP，OpenAI是完全可以实现图片理解、图片生成，甚至是视频生成，这些功能都是完整的。谷歌其实它的功能都做出来了，但是Gemini里头好多没接，这块还要再奋起直追一下。</p>



<p class="wp-block-paragraph">阿里的千问还有像夸克，包括字节的豆包，在这一块已经都做了图片理解、图片生成，包括修图改图，包括一些视频生成，现在他们都已经做出来了。其他的还在奋起直追。全新的形态是无法跟传统的形态进行有机结合的，或者结合起来比较费劲。现在唯一结合成功，或者大家感觉还比较顺眼的，就是x集合XAI，而且两个公司还合并了。</p>



<p class="wp-block-paragraph">其他公司都是尝试在传统的产品形态之外，寻找新的应用形态，或者新的用户使用形态。所以都是做的独立的APP，甭管是腾讯、阿里还是谷歌，或者是字节，都是做出独立APP来，希望能够去抢占新的入口。现在呢是新场景已经有了，底层技术基本上拉平，就这么一个状态。甭管是豆包的推理模型，还是腾讯推理模型，包括DeepSeek，还有像谷歌的Gemini 2.5 Pro、GPT-4O、Claude 3.7这些模型，它们其实基本上算是拉平了。谁比谁好一些，但是并没有好出那么多去。</p>



<p class="wp-block-paragraph">现在可能唯一能够明显感觉到有差距的，是Gemini 2.5 Pro。那么当新场景出现了，底层技术又基本拉平以后，剩下的就是一个字了——卷吧。这件事咱们中国人擅长，后面还要看大家怎么冲上去。</p>



<p class="wp-block-paragraph">现在留给Meta的时间已经不多了，开源大模型的老大位置应该已经不是他的了。Grok的卡应该比Llama可能稍微少一些，但是XAI的卡要比Llama的新。Grok也是开源的，只是Grok没有把最新的开源出来。它现在是上一代的Grok 2要去开源，现在Grok 3出来以后，它准备把2开源出来。这个3的话可能要等到Grok 4出来以后再去开源。但是呢，你也是开源模型，而且Grok 3特别是配上AI agent以后，相当的好用。</p>



<p class="wp-block-paragraph">DeepSeek在多模态和长文本上呢，还有所欠缺，但是达到可用状态，这个要比Llama4要早好几个月。所以在这一块上，Meta的开源大模型老大的位置也被动摇了。再加上可能在最近的一两周里头，千问3也要出来。现在大家使用都是千问2.5，千问3一旦下来以后的话，有可能整个开源大模型的座次……</p>



<p class="wp-block-paragraph">还要再重排一次。开发独立APP对于美塔来说，应该是刻不容缓了。Meta也有计划，在4月份准备上线超级APP。</p>



<p class="wp-block-paragraph">这个中间呢，还少了一步。Meta少哪一步？AI agent它没做。就甭管是deep search、deeper search或者这些东西，他都没做。而且呢，他还缺一个什么东西？就是他的function call和MCP都没有。他的模型你只能是给出提示词，然后那边生成结果。你说我在这边给一大堆的function call的描述，或者是给MCP的描述，我在生成的过程中可以调用外部数据，这个到Llama4依然没有。所以这一块，Meta稍微有些落后了。</p>



<p class="wp-block-paragraph">而且现在从Meta发布的Llama4来看，它已经完全退出了小模型的竞争。最小的侦察兵109B，你没有H100跑不起来。在这一块上，阿里已经算是稳赢了。所以阿里作为AI公司，基本上已经站住脚跟了。现在其他还在做小模型的公司，一个是微软，一个是谷歌。谷歌的Gemma3现在是有各种小模型的。还有就是欧洲的Mistral，他们也有一些小模型，只是呢Mistral的声音没有那么大。</p>



<p class="wp-block-paragraph">Meta呢，算是手里有卡，有数据、有用户、有钱，还有一大堆的现成的用户使用场景。必须要做的事情，是探索新的用户使用场景。如果老惦记去玩眼镜的话，那可能真的会被抛下的。AI的牛皮不能总靠卡的数量来维持下去，卡估值的逻辑正在坍塌。所以Meta必须要在卡估值逻辑坍塌之前，拿出来一个被大家可以接受的超级APP，或者说一个全新应用场景的服务，可以去跟其他的这些大模型超级APP去进行竞争。否则的话，它的故事会讲不下去的。</p>



<p class="wp-block-paragraph">好，这就是今天Llama 4发出了以后的第一期视频。未来的话，Llama 4可能更进一步的功能被暴露出来，或者说大家又试出什么好玩的来，那再去录视频跟大家分享。好，这一期就讲到这里，感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
