<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Deepseek V3 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/deepseek-v3/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Wed, 16 Apr 2025 00:52:33 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.2</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>Deepseek V3 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？</title>
		<link>https://lukefan.com/2025/04/16/%e9%9c%87%e6%92%bc%e5%8f%91%e5%b8%83%ef%bc%81gpt-4-1%ef%bc%8c%e7%89%9b%e9%a9%ac%e7%9a%84%e6%96%b0%e5%b7%a5%e5%85%b7%e6%9d%a5%e4%ba%86%ef%bc%8c%e4%b8%93%e4%b8%ba%e7%a8%8b%e5%ba%8f%e5%91%98%e6%89%93/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 16 Apr 2025 00:52:31 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[100万Token上下文]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI agent开发]]></category>
		<category><![CDATA[AI工具更新]]></category>
		<category><![CDATA[AI市场竞争]]></category>
		<category><![CDATA[AI成本优化]]></category>
		<category><![CDATA[AI技术更新]]></category>
		<category><![CDATA[AI模型对比]]></category>
		<category><![CDATA[API发布]]></category>
		<category><![CDATA[API调用]]></category>
		<category><![CDATA[B端市场]]></category>
		<category><![CDATA[Claude 3.5]]></category>
		<category><![CDATA[Claude 3.7]]></category>
		<category><![CDATA[C端用户]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[Gemini 2.0]]></category>
		<category><![CDATA[Gemini Pro 2.5]]></category>
		<category><![CDATA[GPT-4.1]]></category>
		<category><![CDATA[GPT-4.1评测]]></category>
		<category><![CDATA[Grok 3 mini]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI战略]]></category>
		<category><![CDATA[RAG (检索增强生成)]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[价格便宜]]></category>
		<category><![CDATA[低成本AI]]></category>
		<category><![CDATA[可控性强]]></category>
		<category><![CDATA[多模态AI]]></category>
		<category><![CDATA[多版本 (Standard/Mini/Nano)]]></category>
		<category><![CDATA[大海捞针测试]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[实时AI (Realtime AI)]]></category>
		<category><![CDATA[工程应用]]></category>
		<category><![CDATA[工程需求]]></category>
		<category><![CDATA[开发者API]]></category>
		<category><![CDATA[开发者福音]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[技术发展趋势]]></category>
		<category><![CDATA[技术解读]]></category>
		<category><![CDATA[技术选型]]></category>
		<category><![CDATA[指令遵循度高]]></category>
		<category><![CDATA[推理能力]]></category>
		<category><![CDATA[模型评测]]></category>
		<category><![CDATA[牛马工具 (程序员自嘲)]]></category>
		<category><![CDATA[程序员工具]]></category>
		<category><![CDATA[稳定性好]]></category>
		<category><![CDATA[编程能力提升]]></category>
		<category><![CDATA[观点分享]]></category>
		<category><![CDATA[视频理解能力]]></category>
		<category><![CDATA[速度快]]></category>
		<category><![CDATA[长上下文处理]]></category>
		<category><![CDATA[高性价比]]></category>
		<category><![CDATA[高效AI模型]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2104</guid>

					<description><![CDATA[**不允许有人不知道！牛马程序员续命神器GPT4.1杀疯了！**

家人们谁懂啊！！OpenAI这次真的把程序员当亲爹宠了！！💥
新出的GPT4.1简直是把「便宜大碗+指哪打哪」刻进DNA！！程序员看完直接跪着喊爸爸！！

**🔥 炸裂亮点速看：**
1️⃣ **100万TOKEN白给价！！**
扔100万字文档进去才花7毛钱！！（输入0.1刀/百万token）
什么会议纪要合同小说直接无脑塞！！不用分段不用切！！
打工人的本地知识库直接下岗！！

2️⃣ **指令依存度拉满！！**
程序员狂喜！！终于不用和AI斗智斗勇了！！
「标号必须用#1#2#3」「输出给我JSON格式」...
以前GPT4o像叛逆期儿子，现在GPT4.1秒变听话小奶狗！！🐶

3️⃣ **速度卷死同行！！**
Nano版回车一按秒出结果！！（虽然跑不过GROK3 mini但够用！）
搞什么RAG什么向量库？？直接暴力塞文档问就完事！！

4️⃣ **价格屠夫实锤！！**
输出100万token才0.4刀！！（DeepSeek看了连夜改价）
程序员薅羊毛姿势+1！！甲方爸爸需求改100遍也不心疼预算！！

**🤯 普通人和程序员的区别：**
普通人：要AI写诗写歌风花雪月！
程序员：AI你给我老实当工具人！！
而GPT4.1！！就是程序员梦中的牛马！！拉磨快还不吃草！！

**🚨 紧急通知：**
搞副业的！做知识库的！玩Agent的！现在立刻马上调API！！
我已经玩了一上午！！会议纪要总结比实习生快10倍！！（实习生：？？）

⚠️注意：非程序员用不上网页版！！这是API玩家的狂欢！！
但！你们马上会用到基于4.1开发的超便宜APP！！（资本家狂喜）

**👉 最后说句大实话：**
OpenAI这次被Gemini/Claude逼疯了吧？？
但...卷死同行造福百姓的事儿请多来点！！程序员集体起立鼓掌！！👏👏

**#AI神器 #打工人自救 #程序员福音 #OpenAI杀疯了**

震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？

OpenAI突发**GPT-4.1**，这款并非面向普通用户的**大模型**更新，而是专为**程序员**和**开发者**通过**API**设计的强大工具。其核心亮点包括惊人的**100万TOKEN上下文窗口**，显著提升的**指令依存度**与**稳定性**，以及极具竞争力的**价格**——特别是**Nano版**和**Mini版**，成本极低且**速度**飞快，堪称“**牛马**”程序员的福音。**GPT-4.1**旨在满足**工程市场**对**可控性**和效率的需求，虽然**编程能力**相较于**Gemini**或**Claude 3.7**仍有提升空间，但在处理大规模文档（强大的“**大海捞针**”能力）和无字幕**多模态视频理解**方面表现突出。面对来自**DeepSeek**、**Grok**等对手在价格、速度、特定能力上的挑战，**OpenAI**此举意在稳固并夺回**API**市场份额，为**AIGC应用开发**和构建**AI Agent**提供了更具性价比和稳定性的新选择，预示着更高效、廉价的AI工具将加速落地。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？" width="900" height="506" src="https://www.youtube.com/embed/xWY-HIosMsM?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT4.1发布了！牛马们的好工具终于上线了。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">GPT4.1突然发布，这是程序员们的工具。普通的用户你是用不上的。你用网页版，你用APP，甭管是手机端的还是电脑端的，你是付费用户还是免费用户，你都用不到GPT4.1。只有程序员可以通过API调用GPT4.1。</p>



<p class="wp-block-paragraph">但是这个事儿对于非程序员来说，也是有很大改变，很大帮助的。那么我们今天来讲一讲，GPT4.1到底是一个什么样的东西。</p>



<p class="wp-block-paragraph">首先，它有100万TOKEN的上下文，这个是非常吓人。100万单词吧，基本上你可以直接塞到GPT4.1里头去，它统一给你处理。而且大海捞针做的也很不错。</p>



<span id="more-2104"></span>



<p class="wp-block-paragraph">什么叫大海捞针？就是比如说你找一个100万字以内的小说，你直接扔进去，然后呢，在里面稍微插几句。比如说OpenAI干什么了，山姆奥特曼干什么了，甭管在文章的任何地方，你稍微插几句，然后你提相关的问题，它能给你找出来。这个玩意叫大海捞针。</p>



<p class="wp-block-paragraph">很多的模型都需要做类似这种测试。为什么呢？就是说我一次给了你一大堆上下文以后，你是不是通盘考虑了？不会说把其中的一部分扔掉了，或者说我看看开头看看结尾，就告诉你是怎么回事了，不会干这个事。所以GPT4.1的100万TOKEN还是非常强的，绝大部分场景直接可以应对了。</p>



<p class="wp-block-paragraph">但是现在还不是最强的。现在Gemini Pro 2.5是可以走200万TOKEN的，Gemini Pro 2.0也是可以有100万TOKEN的。但是在其他的模型就没有了，可能也就是64K（64,000 TOKEN），也有一些是128K（128,000 TOKEN）。但是到100万TOKEN的其实还是比较少的。</p>



<p class="wp-block-paragraph">指令依存度非常的高。什么叫指令依存度？就是你让它干嘛，它就给你干什么，不会说每一次出来的都是惊吓惊喜。你让他去找什么什么样的文章，找什么样的信息，做什么样的排序，按照什么格式输出，他都会非常非常认真的按照你的要求去把它做好。</p>



<p class="wp-block-paragraph">编程能力有了非常大的提升，但是依然比不过Gemini 2.5 Pro，也比不过Claude 3.7。它的编程能力只是在原来GPT4O的基础上有了很大的提升。</p>



<p class="wp-block-paragraph">标准版、mini版和Nano版，分了三个版本。为什么要分这么三个版本？速度飞快。当然现在速度最快的不是它，现在速度最快的是Grok 3 mini。这个版本是所有程序员能够使用到API里头速度最快的，原因也很简单。</p>



<p class="wp-block-paragraph">用的人不多，模型又小，而且后边是马首富。家里头穷的光剩卡了，所以那东西跑的飞快飞快的。我前面有一个项目拿这玩意做，一个回车下去，夸夸夸那个刷的那个字你都看不过来。</p>



<p class="wp-block-paragraph">价格非常便宜，GPT4.1，特别是这个Nano的版本，100万TOKEN的输入只需要0.1美金，换人民币7毛多钱，就可以输入100万TOKEN了。输出的话是0.4美金100万TOKEN输出，是目前大家能够用到的所有付费模型里头最便宜的一个，没有比它更便宜的了。就算是GROK3 mini，大概也要到0.3美金100万TOKEN的输入。</p>



<p class="wp-block-paragraph">那么牛马们工具终于更新了，要好好去干活了。程序员们对大模型的要求，其实跟普通人还是有一些差别的。普通人呢说我要跟他聊天，他要显得聪明一点，要给我写的不像AI，要给我有很好的创造力，这个是普通人的要求。</p>



<p class="wp-block-paragraph">但是程序员呢，通常要求的叫指令依存度、可控性，在这两方面要求是非常高的。因为既然是程序员，我们只是让大模型成为我们整个程序中的一个模块。我们要求的是输入，然后按照一个统一的逻辑，有一个可以预期的输出，这个是程序员想干的。就是真正那些才华横溢，不太听招呼的不是好牛马哈，所以一定是要让干嘛就干嘛的这种。</p>



<p class="wp-block-paragraph">工程方面呢对于大模型的要求，跟普通人也是有一定差异的。为什么呢？普通人说你这个模型越大越好，越聪明越好。但是对于工程上来说，在满足预期的情况下，尽可能的降低成本，提高效率，提升一致性跟稳定性。在可以接受的成本下，获得可预期的结果，我给了一分钱还是给了两分钱，我就要这个结果出来，这个是工程上的需要。</p>



<p class="wp-block-paragraph">GPT4.1呢，就像是牛马们突然得到了曲辕犁，这个也是中国古代的一个很著名的发明。有了这个农具以后，牛马犁地的这个效率就会极大提升。GBT4.1基本上就是这么个东西，价格便宜速度快。刚才我试了一下，至少Nano的版本，那个速度非常的快，虽然还没有GROK3 MINI那个快，但是已经很快了。</p>



<p class="wp-block-paragraph">MINI的版本效果也还是不错的。这三个版本里头，大家可以按照需求自己去选择和优化。你让他做很复杂的事情，你就是选用GPT4.1。稍微简单一些的事情，或者我不需要你去发挥创造力，我给你一堆的会议纪要，你给我总结归纳一下。或者说我去到本地知识库，检索完了东西以后，你给我总结一下，这种事情你用Nano版或者是用mini版足够了，这个效果非常非常的好。</p>



<p class="wp-block-paragraph">100万TOKEN的上下文。</p>



<p class="wp-block-paragraph">绝大部分场景都可以满足了。你都不需要去做本地知识库做RAG，你可以直接把文档啪一把都扔给他，说来给我看看怎么回事，不需要去做更复杂的分段了。指令依存度高，这件事是非常非常重要的。</p>



<p class="wp-block-paragraph">程序员最怕的是什么？叫指东打西，指南打北。像我原来使用GPT-4O的很多模型的时候，每一次输出的结果都不一样，这个让我很烦。我举一个例子吧，我让他给我的视频起标题，每一个标题后头有一个标号，但是呢，他每一次输出的都不一样。有的时候输出的是123，有的时候呢先要写一个引号，再写123，有的时候在前面给你写中文的123。这个就很烦，因为我到下一个环节去处理这个标题的时候，我需要去找到数字123打个点，然后后边是标题的这三行字，但我就找不到。经常是找着找着就出错了，因为我写程序的时候，必须是通过这个比较固定的格式去读取信息，经常会错。现在的话就不会出这种问题。</p>



<p class="wp-block-paragraph">程序员喜欢的是不需要太聪明，让往东绝不往西，让追狗绝不撵鸡。GPT-4.1就是这样的一个工具。OpenAI在这个时候呢，推出GPT-4.1也是无奈之举。这个老大真的很难当，为什么这么讲？因为AIGC呢是一个基础技术，OpenAI想把AIGC的整个的盘都占住，在里头当老大，这个是很难的。</p>



<p class="wp-block-paragraph">因为对于大模型的评判标准在快速的分裂。有的说我这个大模型创意最好，就像前面的GPT-4.5似的，我可以去生成各种各样的内容，而且你可以指定说给我按鲁迅那样说，他都可以做的很好。有些呢，是需要做可衡量的项目。什么叫可衡量的项目？就刚才那种创意项目是没法衡量的到底好不好，大家是要靠主观去评测的。可衡量的项目最简单的就是编程，你这个程序编的对不对，里头是不是有错误，是不是把上下文和所有的东西都考虑到了，这个叫可衡量项目。这块也是可以去评估的，谁的大模型编程最好，而且还有稳定性的要求，指令依存性的要求，这块也可以去评测。</p>



<p class="wp-block-paragraph">大模型还有推理能力的要求，这块你的推理能力够不够好，这也是一个新的维度了。包括速度和价格以及多模态，多模态包括理解和生成以及realtime。Realtime是什么？就是我实时的输入，实时的输出。现在谷歌也好，OpenAI也好，都可以去进行这种real time的回复。就是你拿着一个摄像头，对着人呢也好，对着外面也好，你说这是一什么东西，那是一什么东西，就像是一个真人一样跟他聊天，去打断他，它可以实时的根据摄像头拍到的东西。</p>



<p class="wp-block-paragraph">和听到的内容，给你进行回复。而且这个多模态还要去评估音频，还有是语音和音乐，还有图片，还有视频。我们要做这么多行业，这么多领域去进行评估。</p>



<p class="wp-block-paragraph">而这一次，GPT-4.1可以对没有字幕的视频进行理解和分析，而且它现在在这一块的得分是最高的。它比其他所有的这些Gemini也好，包括GPT自己早期的版本也好，都提升了非常多。</p>



<p class="wp-block-paragraph">GPT-4.5呢，算是一次失败的表演。就是前面先发了一个4.5出来，然后现在又发4.1。因为4.5这个东西其实是给这种Pro用户用的，就是你一个月交200美金以上可以用。后来呢，发现实在用的人很少，它又降低下来，一个月交20美金的人也可以用吧。</p>



<p class="wp-block-paragraph">现在我也可以用4.5，只是到目前为止我都没有用过。为什么呢？第一个，很贵。虽然我一个月交20美金，他让我用，但是这个效果对于我来说其实看不太出来。为什么呢？因为他的文学上，在他的很多这种创意上做的非常好，但是我是一个程序员，是个直男，他写的天花乱坠的东西，到我这看不出来，还真会有这样的问题。</p>



<p class="wp-block-paragraph">而且呢，4.5这东西还挺慢，这个也不是我喜欢的。所以到现在为止我没怎么用过，包括4.5的API我也没怎么调过，因为实在是贵。调API的话，你是要按TOKEN付钱的，不是说一个月交20美金就完事了。</p>



<p class="wp-block-paragraph">GPT-4.5在工程方面绝对是战五渣。为什么呢？就这个价格，就让工程师直接望而却步了，实在是玩不转。稳定性、指令依存度这一块的话，肯定也不怎么样。我看创意越好的东西，这个指令依存度和稳定性就越差。</p>



<p class="wp-block-paragraph">OpenAI现在在表演什么节目呢？叫“六大派围攻光明顶”。什么意思？就是在推理上被DeepSeek-R1摆了一道。并不是说OpenAI的推理做的不好，只是它原来呢，因为没有其他人竞争，所以它的推理是隐藏的，就整个的推理过程不给你看，只给你推理的结果。</p>



<p class="wp-block-paragraph">而DeepSeek-R1是上来我就把整个推理的结果原原本本拿出来给你看。很多人看了推理过程之后，我还受到了启发，我还发生了思维的碰撞，可以有一些新的想法出来。在这一块，真的是给OpenAI了一些教训。山姆·奥特曼现在自己出来也承认这件事，他说：“我们并不认为DeepSeek-R1真的有做的多好，但是呢，在这一点上，确实是我们原来没想到。”</p>



<p class="wp-block-paragraph">价格上呢，也被DeepSeek-R1和DeepSeek-V3摆了一道。这东西确实是便宜。这东西花多少钱训练的咱不管它，但是呢，因为它是完完全全开源免费，各个平台都在部署。</p>



<p class="wp-block-paragraph">所以呢，DeepSeek V3也好，DeepSeek R1也好，对于很多的第三方开放平台来说，它所提供的这个基本可用的功能是相当便宜的。但是现在，4.1的MINI和Nano的价格已经下来了，但是4.1标准版还是稍微有一些贵的，比4O要便宜。但是应对DeepSeek的V3和R1来说，还是稍微贵一些。</p>



<p class="wp-block-paragraph">在编程能力上呢，被Claude 3.5长期碾压。现在呢，还有Gemini 2.5 Pro和Claude 3.7。到目前为止，GPT 4.1在编程上的评分依然赶不上Gemini 2.5 Pro和Claude 3.7。在多模态生成这一块呢，视频，它的Sora基本上是废了，现在大家再也不想这事了。图片距离Midjourney还是有非常遥远的距离的，很难追赶。</p>



<p class="wp-block-paragraph">AI agent方向就是它的下一个大方向。现在面对Anthropic的MCP和Gemini，以及Grok给出的deep research或者deep search这些功能来说，现在还是需要去追赶的。因为它下一个GPT5的版本应该就是要追赶这一块了，所以真的是四面楚歌。</p>



<p class="wp-block-paragraph">除了这些之外，还有一大堆千问小模型在不停的跑冒滴漏，把各种各样零碎的用户需求都给实现掉了。为什么说一大堆呢？现在通过各种尺寸的千问模型微调出来的一个小模型，在Huggingface上大概有十几万种，所以这个是非常大批量的。</p>



<p class="wp-block-paragraph">现在的OpenAI呢，在个人用户这边那绝对是遥遥领先。从用户数量、使用时长，其他所有的AI助手加一块大概都赶不上它。但是在程序员和工程方面，已经被Claude、Gemini和DeepSeek给吃干抹净了。我自己应该已经有几个月没有再调用过OpenAI的API了，没必要。你效果又不好，价格还挺贵，还不快，我为什么要调你？</p>



<p class="wp-block-paragraph">所以我现在已经把自己的很多AI agent里头的大模型都换成Gemini，换成Grok，换成Claude和DeepSeek，都换成这些东西了。当然，我今天上午又把它很多换回4.1了，效果很好，好极了。</p>



<p class="wp-block-paragraph">现在GPT4.1呢，就是为了挽救工程市场，挽救API市场而诞生的。这个东西并不是给c端用户去用的。那你说4.1是不是牙膏呢？你看这数就知道了呀，人家不叫4.5，不叫4.6，不叫4.7，人家叫4.1，这个肯定还是一个小牙膏。它呢，在这个创意上，在模型更聪明这块做的一般，只是说这是一个比较老实的。</p>



<p class="wp-block-paragraph">指哪打哪的一个工程工具而已，这个还是很好用的。GPT5呢，估计后边还是要稍微难产一些。现在OpenAI也出来说了，我们低估了GPT5训练的困难，可能还需要再多等几个月，大家才可以看到GPT5。必须在这个时候先稳住局面，使用DeepSeek、Gemini、Claude以及MCP，其实已经可以做很多真正有用、有价值的商品了。</p>



<p class="wp-block-paragraph">如果OpenAI继续放任这个事情往前走的话，程序员们可能就会被这几种模型直接都抢走了，就不会再向OpenAI去迁移了。那么OpenAI就有可能会变成一个像苹果那样的纯C端公司，这个是OpenAI所不希望看到的。他作为AIGC行业的排头兵，他希望在所有的方方面面都领头，这是他现在会遇到的问题。</p>



<p class="wp-block-paragraph">OpenAI手里边的各种模型、技术和工程实践呢，肯定还是非常多的。我们现在看到的应该是冰山一角。OpenAI目前在做的事情是什么呢？如果没有人震动它，它可能还在那继续挤牙膏，继续在这晃荡。实际上2024年一整年，它就是这么个状态。但是到2025年，随着DeepSeek R1的出现，发现不行了，必须要冲出来，赶快把后院里头各种能跑能跳的东西都拎出来，稍微的包装一下，打扮打扮就直接上线了。</p>



<p class="wp-block-paragraph">所以现在我们看到，OpenAI的动作是非常多的。但是即使如此，每一次我们所看到的，依然是OpenAI内部技术的冰山一角。</p>



<p class="wp-block-paragraph">总结一下：如果不是程序员，GPT4.1跟大家呢，会有一些间接的关系，就是很多新的应用会出来。因为用GPT4.1做应用会更方便一些，而且这些应用呢，速度会更快，价格会更便宜，而且也会更稳定。如果是程序员，或者是说您虽然不是程序员，但是呢，想搞点Agent自己玩一下，那么4.1是一个非常非常有趣的小工具，赶快去玩起来。我已经玩了一上午了，非常非常有意思。</p>



<p class="wp-block-paragraph">好，这期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>从557万美金训练成本到545%利润，DeepSeek如何用惊悚的数字，震撼AI行业的？这些数字，靠谱吗？</title>
		<link>https://lukefan.com/2025/03/04/%e4%bb%8e557%e4%b8%87%e7%be%8e%e9%87%91%e8%ae%ad%e7%bb%83%e6%88%90%e6%9c%ac%e5%88%b0545%e5%88%a9%e6%b6%a6%ef%bc%8cdeepseek%e5%a6%82%e4%bd%95%e7%94%a8%e6%83%8a%e6%82%9a%e7%9a%84%e6%95%b0%e5%ad%97/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 04 Mar 2025 00:40:05 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[DeepSeek大模型]]></category>
		<category><![CDATA[545%利润]]></category>
		<category><![CDATA[557.6万美金]]></category>
		<category><![CDATA[AI优化]]></category>
		<category><![CDATA[AI优化技术]]></category>
		<category><![CDATA[AI公关策略]]></category>
		<category><![CDATA[AI公司争斗]]></category>
		<category><![CDATA[AI利润计算]]></category>
		<category><![CDATA[AI商业模式]]></category>
		<category><![CDATA[AI商战]]></category>
		<category><![CDATA[AI基准价格]]></category>
		<category><![CDATA[AI市场格局]]></category>
		<category><![CDATA[AI开源项目]]></category>
		<category><![CDATA[AI成本分析]]></category>
		<category><![CDATA[AI投资策略]]></category>
		<category><![CDATA[AI推理市场]]></category>
		<category><![CDATA[AI推理未来]]></category>
		<category><![CDATA[AI数据中心]]></category>
		<category><![CDATA[AI服务器管理]]></category>
		<category><![CDATA[AI生态小厂]]></category>
		<category><![CDATA[AI硬件]]></category>
		<category><![CDATA[AI自由市场]]></category>
		<category><![CDATA[AI行业内幕]]></category>
		<category><![CDATA[AI行业梗]]></category>
		<category><![CDATA[AI行业盈利]]></category>
		<category><![CDATA[AI话题营销]]></category>
		<category><![CDATA[AI资源分配]]></category>
		<category><![CDATA[AI量化交易]]></category>
		<category><![CDATA[AI量化模型]]></category>
		<category><![CDATA[AI高峰时段]]></category>
		<category><![CDATA[API定价]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek开源库]]></category>
		<category><![CDATA[DeepSeek计算精度]]></category>
		<category><![CDATA[GPU全天运营]]></category>
		<category><![CDATA[GPU租赁成本]]></category>
		<category><![CDATA[GPU负载均衡]]></category>
		<category><![CDATA[H100芯片]]></category>
		<category><![CDATA[H800]]></category>
		<category><![CDATA[MAAS厂商]]></category>
		<category><![CDATA[MAAS盈利模式]]></category>
		<category><![CDATA[MAAS竞争]]></category>
		<category><![CDATA[R1价格]]></category>
		<category><![CDATA[中国AI企业]]></category>
		<category><![CDATA[中美AI价格差]]></category>
		<category><![CDATA[中美AI市场对比]]></category>
		<category><![CDATA[云服务厂商]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[华为云]]></category>
		<category><![CDATA[商业逻辑]]></category>
		<category><![CDATA[大模型服务]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[字节跳动DeepSeek]]></category>
		<category><![CDATA[并行计算]]></category>
		<category><![CDATA[开源协议]]></category>
		<category><![CDATA[推理利润]]></category>
		<category><![CDATA[推理效率]]></category>
		<category><![CDATA[推理系统]]></category>
		<category><![CDATA[数据参考价值]]></category>
		<category><![CDATA[数据水分]]></category>
		<category><![CDATA[数据逻辑]]></category>
		<category><![CDATA[模型优化策略]]></category>
		<category><![CDATA[模型即服务]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[硅基流动]]></category>
		<category><![CDATA[腾讯DeepSeek]]></category>
		<category><![CDATA[腾讯IMA]]></category>
		<category><![CDATA[芯片性能]]></category>
		<category><![CDATA[训练成本]]></category>
		<category><![CDATA[路深科技]]></category>
		<category><![CDATA[达芬奇架构]]></category>
		<category><![CDATA[阿里云投资]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1960</guid>

					<description><![CDATA[啊啊啊啊啊啊啊！！！DeepSeek推理利润545%，行业炸裂！🏆

家人们，谁懂啊！DeepSeek这次真的玩大了，推理利润直接干到545%！！！行业彻底炸裂了💥！你们还记得当年那个557.6万美金的训练成本吗？这次又来了个更狠的！🔥

**为什么这么炸？**
DeepSeek这次公布的数据，直接让所有人傻眼！别人都说亏钱，DeepSeek直接赚到飞起！背后的秘密就是——负载均衡和并行计算！🍃

**负载均衡？**
把每一层的模型专家分配到不同的设备上，让所有芯片都动起来，一点都不浪费！效率直接拉满！🚀

**并行计算？**
所有芯片一起干活，速度飞快！一边干活，一边读写数据，完全不耽误！这操作，简直绝了！🎯

**还有更绝的！**
DeepSeek还用了“驴粪蛋表面光”的策略，表面光滑，细节忽略，效率直接飞升！这操作，真的太秀了！🤯

**545%的利润怎么算的？**
GPU满负荷工作，优化手段全用上，按最贵的价格算，直接算出545%的利润！虽然有点水分，但这数据还是有参考价值的！📊

**DeepSeek的目的？**
证明自己用H800就能搞定一切，顺便让大家都卷起来！这波操作，真的太顶了！🎉

家人们，这波真的不冲不行了！DeepSeek的操作，直接改变了行业规则！赶紧收藏，随时学习！📚

#DeepSeek #推理系统 #行业革命 #负载均衡 #并行计算

从557万美金训练成本到545%利润，DeepSeek如何用惊悚的数字，震撼AI行业的？这些数字，靠谱吗？

DeepSeek以一场让人措手不及的“one more thing”，震撼性地展示其推理系统的超高利润率达545%。从557.6万美金的训练成本到惊为天人的运营优化，DeepSeek凭借负载均衡、并行计算等技术手段实现了“极致节约”。然而，其计算逻辑背后隐藏的水分也备受行业诟病。与此同时，硅基流动与路深科技就DeepSeek的利益布局展开激烈争斗，MAAS厂商格局愈加扑朔迷离。在全球AI推理市场中，DeepSeek如何借助中国价格锁死策略与开源项目继续站稳脚跟？本期深度解读，带你全面认知AI时代下数据逻辑的权衡与商战背后的复杂博弈，探索AI推理的未来发展方向。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="从557万美金训练成本到545%利润，DeepSeek如何用惊悚的数字，震撼AI行业的？这些数字，靠谱吗？" width="900" height="506" src="https://www.youtube.com/embed/4xBnIP0EtYw?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">DeepSeek也玩“one more thing”，突然公布了它的推理利润达到545%，就像当初557.6万美金的训练成本那样，再次震惊了行业。大家好，欢迎收听老范讲故事的YouTube频道。今天咱们来讲一讲，DeepSeek结束了连续5天的开园周之后，到礼拜六玩了一次“one more thing”。这个“one more thing”呢，应该是当年乔布斯的梗。他每一次开发布会到最后的时候呢，都要说“还有一件事，等一等”，而且这一件事呢，往往是特别重要、特别颠覆性的事情。那么这一次又来了，DeepSeek公布了它的V1和R3推理系统相关内容，及大规模部署的成本和收益数据。就是说我部署了这东西以后，到底是挣了多少钱？非常非常让人震惊，因为所有人做这个东西都说我不挣钱，我亏钱，结果等到他这好，545%的利润，所有人都傻了，说你到底咋干的？</p>



<p class="wp-block-paragraph">具体的实现方法呢，就不再跟大家详细分析了。简单来说，第一个负载均衡，你想他有这么多的GPU，这么多的核心，在他这种MOE的架构下，他把每一层的模型里边每一个专家，分配到不同的设备上面去进行运算。这个呢，就是一个负载均衡，尽量让所有的芯片都动起来，不要说有的芯片闲着呢，有的芯片在那排队。第二个，并行计算。并行处理是什么呢？所有的芯片一起来干活，这个速度肯定会变快。另外呢，一边干活的时候，另外一边呢，再同时进行数据的读写。你不能说我这需要数据了，你给我读，然后处理完了以后你再去写，这样就变慢了嘛。所以基本上在做这样的事情，负载均衡和并行处理。</p>



<p class="wp-block-paragraph">另外还有一个什么样的事情在做呢？就是有一点点叫“驴粪蛋表面光”。这个也算是老北京的一个俏皮话，什么意思呢？就是这个驴粪球外边是很光滑的，但是里边呢，就是一堆的没有消化好的碎草。DeepSeek也是如此，他把很多的计算精度呢进行了调整，他尽可能的能够达到大家的要求，但是很多细节上的这些你看不到的环节呢，就给你忽略掉了。</p>



<span id="more-1960"></span>



<p class="wp-block-paragraph">所以，这个也可以极大地提高效率。他说：“我通过了这样的方式，达到了545%的利润。”当年给出的DeepSeek V3 557.6万美金的训练成本，已经成为了一个业内的计量标准，或者计量单位了。就跟你说这个东西是一牛顿，那个东西叫一瓦特，他这个557万的训练成本，也成了一个计量单位。OpenAI用了1,400万美金投超级碗广告的时候，很多人就说：“你这玩意够训练几次DeepSeek了？”这个已经成为一个业内梗了。</p>



<p class="wp-block-paragraph">在制造话题这块，DeepSeek作为AI时代的顶级企业是合格的。大家注意，AI时代跟以前不一样。原来呢是酒香不怕巷子深，但是现在你从OpenAI、Anthropic，再到国内的DeepSeek，每一个都是制造话题的好手。必须要会讲故事，才可以在这个时代好好地玩下去。</p>



<p class="wp-block-paragraph">那么，545%的利润和557.6万美金的训练成本，到底是一个什么样的概念呢？是真的还是假的？是不是吹牛？很多人一上来就会问这样的问题。事情呢，没这么简单。数据肯定有一定水分，咱们一定要承认这件事。但是呢，这个数据也是有参考价值的，不是说你这个东西是真是假，一刀切完事了。这个还是要具体来去分析一下。</p>



<p class="wp-block-paragraph">咱们呢来看一看，545%的利润到底是怎么算出来的。说这个GPU都是7*24小时满负荷工作，然后呢把所有的优化手段都用到极致，就是他这5天发布的这些优化手段，我都给用上了。然后计算输出TOKEN的总量，就是我这么长时间，一共可以输出多少TOKEN出来。按照最贵的DeepSeek R1的价格来去收钱，这个是100万TOKEN 16块钱，这个是DeepSeek自己给的价格。国内的这些云服务厂商，基本上都是按这价格做的。等于就是说我一天24小时，满负荷输出这么多的TOKEN，能够说到多少钱。再以GPU租赁的价格，两美金一小时作为成本，把这俩数一除，就算出了一个545%的一个利润率来。他是这么算出来的。那这个水分在什么地方呢？</p>



<p class="wp-block-paragraph">第一个GPU是不可能7*24小时满负荷工作的。就跟送外卖一样，赶上午餐时间大家都得去送外卖，午餐吃完了以后所有人都在那闲着，这个才是正常的状态。GPU也是如此的，你不可能说大家都商量好了，这个7*24小时达到均匀的来，我们让所有的GPU跑满，谁都别闲着。这个事是绝不可能的，而且距离现实情况相距甚远。</p>



<p class="wp-block-paragraph">正常应该是什么呢？为了保障高峰时期的服务不崩，必须要容忍非高峰时期，可能有70%到80%的服务器是冗余的，或者在那闲置的。那你说到底有多少这个时间算高峰时间，有多少时间是非高峰时间呢？这个一天里头的高峰时间，可能能够有这么三五个小时也就到头了，不会到8个小时的。</p>



<p class="wp-block-paragraph">像我们以前做游戏的时候，是什么时候高峰时间呢？中午吃饭的时候，还有吃完晚饭9点以后算是高峰时间。那你说我这是工作上班的事情，那他应该是在早晨10点、11点，你没准是个高峰，然后下午2点多到四五点钟，是有一个高峰。其他的时候这个服务器都是闲着的。所以千万不要觉得说，能够跑20个小时的高峰，想都不想，你能跑4个已经算很好很好了。</p>



<p class="wp-block-paragraph">那么DeepSeek也不是所有服务都收费的，它是按最贵的那个算，按DeepSeek R1每100万TOKEN 16块来算的。你如果按照DeepSeek V3，每100万TOKEN也才8块钱，就肯定没有500%多的利润。而且DeepSeek上呢，比如说他的网页还有他的APP，这些都是不要钱的，你也得为人服务。那这一块他就没算在里头，都按这个R1去收费了，所以这个肯定是不对的。</p>



<p class="wp-block-paragraph">而且现在DeepSeek呢，在晚上的非高峰时期，也就是凌晨3点到第二天8点这段时间，他还对这个API的价格打折。这块他也没算在里头。其实我觉得他真没必要打折，因为我在这个时间段试过，依然很慢，他的服务器依然是不反应的。所以呢，他做这样的事情，应该还是有一些奇怪目的的吧。他现在的这个成本呢，只计算了GPU的租赁成本。</p>



<p class="wp-block-paragraph">这个肯定也是有水分的。当然了，GPU租赁呢，是包含服务器、水电、制冷、相关人员成本的，甚至还包括资金占压成本和一些利润。因为你找别人去租GPU来，人家还挣钱呢。所以这块呢，一个小时两美金这个事还是比较宽裕的。而且DeepSeek自己部署机房的话，可能它的成本还要比一个小时两美金要稍微低一点点。但是呢，他的研发、训练、数据准备等等这些成本都没算在里头去。所以呢，他在整个计算成本的时候呢，肯定是极大的降低了成本的总量。</p>



<p class="wp-block-paragraph">这个呢，就跟前面咱们讲557.6万美金的DeepSeek V3训练成本其实是一样的，也是这么算出来的。它只计算了2,048块GPU运算了多长时间，其他的什么人员工资、数据准备这些全都没算进去。咱们这里的人员工资就是分两块，一块是机房维护的人员工资，这块呢，应该已经算到了GPU租赁的价格里边去；另外一块是他自己那帮科学家的人员工资，这部分那是没算的。</p>



<p class="wp-block-paragraph">那么实际利润应该有多少呢？你说没有545%，那到底应该有多少？可以跟大家负责任的说，实际利润一定是亏损的，谁也不可能靠这玩意挣钱，按这价格都挣不回来。那么为什么还说这个数据是有参考价值的呢？大家注意在投融资的时候，或者是在做量化交易的时候，你需要一些简单快捷的方式去计算出某一个数值的极限范围。这个东西最多能挣多少钱，最多能亏多少钱，是要快速的算一下的。只有算完了这个以后，才可以去做一些决策。完全准确的数据说，我这东西算完了以后特别精确，就是挣这么多钱，就是亏这么多钱，这个数呢有时候没有什么意义，时间更重要。</p>



<p class="wp-block-paragraph">DeepSeek呢就是做量化出身的，所以呢，他们很习惯这样去计算数据。你也不能说人家故意坑你。所以先计算极限，然后再向极限前进。如果发现没法到达，咱们再去分析原因调整数据。这个是甭管做投融资还是做量化，必须要干的事情。那么我们应该如何看待这样的数据呢？无脑吹，无脑喷。</p>



<p class="wp-block-paragraph">一上来说看DeepSeek好厉害，中华之光。另外一帮人说你看这就是骗人的，这个不可能的。这个呢，您开心就好，您走错频道了，不应该来看老范讲故事。您去找一些更二极管一点的频道去看，会更加开心一点点。还有一些人呢，找出证据来论证他不靠谱，或者是让别人自证清白。你找出证据来呀，你自己列出这个数据来呀，你看你不靠谱吧。这些人呢其实也是一种无脑的表现，就是你要知道这个东西背后的逻辑是什么，以及它的价值在哪个范围内是有效的，而不是说上来体现一下自己的优越感。这种人也没什么意思。还有些人呢上来就说，哎呀，这个事情很复杂，一句两句解释不清楚，然后呢给你说一大堆的专有名词出来。这种人可能是骗子，他总是惦记从你身上得到一些什么的。</p>



<p class="wp-block-paragraph">所以我们真正要做的是什么呢？就是理解这种数据产生的逻辑意义，以及呢价值，在其合理的范围内使用这些数据作为参考，但是不能迷信。为什么要有合理的范围内使用呢？真理还有适用的范围呢，没有哪项真理是放之四海皆准的。真理离开了他的适用范围就是谬误。同时呢我们要训练自己快速得出类似的这种数据的能力，或者呢，是加强我们对此类数据进行判断的这种能力。</p>



<p class="wp-block-paragraph">那么DeepSeek为什么要公布这样的一个数据呢？这个目的和险恶用心何在呢？这个才是我们吃瓜的乐趣所在。第一个他要证明自己在H800下完全能够搞定所有的事情，还能挣钱。因为一直有人在质疑DeepSeek走私了H100，手里边有5万块H100，大家都在讲这个事。但是呢，DeepSeek自己不会去证明说我手里有还是没有，这个都没有任何意义。有呢，肯定有问题，可能会造成你这种技术在海外被彻底封禁。你就算是开源说，你这个技术因为是违法获得的，所以谁都不许用，他有可能会得到这样的一个结果。那你说我没有呢，你又很难证明这个事情，说我没有，自证清白这个事是挺难的。那么干脆我们就不证明了，我既不说我干了，我也不说我不干了。他干嘛呢？</p>



<p class="wp-block-paragraph">他说：“我证明一下，我不需要H100，我用H800完全可以搞定。我把这个事儿证明一次就完事了。DeepSeek现在也没办法把这些H100拿出来，开足马力来为大家服务。现在突然服务的很顺畅了，说你是不是把H100拿出来偷偷用了？没有，你看我说都算好了。这个我是挣钱的，我不需要把他们拿出来。他现在需要给自己做这样的一个辩白，这是第一点。”</p>



<p class="wp-block-paragraph">“第二点是什么呢？就是我没赚着钱，你们也别想赚钱，大家一起来卷。什么意思？这个学霸经常出来说：‘你看我没有复习功课哦，我就是天天玩，但是我考得很好。’他们是很气人的。可能这跟你说完了不复习功课，炫耀了一下我怎么去玩耍了，回家就苦读到半夜。这个是很多学霸的一种套路。DeepSeek可能也是这么搞的。他自己的网页、APP和API现在基本无法使用的一个情况下，国内的各大厂呢，都在拼命地接DeepSeek。但是呢，又没有给DeepSeek付钱。那DeepSeek只能出来阴阳一下说：‘看我还是挣545%呢，你们挣老鼻子钱了，是不是得意思一下？’那干脆大家一起卷就完了。然后在这个过程中，把这些不挣钱的小的卷死。大的也不是说就挣钱了，大的是有其他业务可以补贴，他赔得起。等到最后剩这帮大的的时候，咱们再来谈这个事情。咱先把这帮小的都卷死。他在干这样的一个事情。你想学霸上来说：‘我从来不复习功课，我上来就考第一。’他干嘛呀？第一个，心里要开心一下，要稍微秀一下优越。另外一个呢，就还是说，咱们这个各层次咱们分别卷起来，要干这个事情。”</p>



<p class="wp-block-paragraph">“那么这个事情发布了以后呢，周末还炸出一个小瓜来。这只能算小瓜了，就是硅积流动跟路深科技两边掐起来了。这两家呢，都是做MAAS的，就是大模型作为服务。咱们做云计算，有IAS，就是基础架构作为服务；SAS是软件即为服务；PAAS是平台即为服务；MAAS呢，叫model as service，就是大模型就是服务。是这样的两个厂商自己就掐起来了，为什么呢？”</p>



<p class="wp-block-paragraph">现在，他们都接了DeepSeek，但是肯定都不挣钱，而且亏得很厉害。路深科技呢，就卷不动了。这位CEO是UC Berkeley的博士，所以我看他的这个签名是伯克利什么什么。这个人我也不认识，所以这名字咱就不记了。他呢，算是有一些网红包袱。你说我卷不动这事呢，我又不能承认。我不能承认这个网红塌房了，别人能搞定，我搞不定。所以呢，一定要找一个出口说，你看他们其实也不挣钱，他们就想卷我们，他们也有问题。他找到了谁？找到硅基流动了。这个不能是自己的问题，也不能是DeepSeek的问题。DeepSeek现在是中国之光嘛，这事一定是你自己技术不好。而且这事还不能是华为的问题，这事跟华为有什么关系呢？就是路深科技跟硅基流动，他们接DeepSeek都是跑的华为云的升腾910芯片的，他们没有跑英伟达芯片。那这个事这几家都怪不了，不能怪自己，不能怪DeepSeek，也不能怪华为。那我们怪友商吧，怪这个硅基流动吧。他说硅基流动你春节加班，因为DeepSeek的发布是在春节期间发布的嘛，而且呢还在卷砍一刀的事情。因为这个硅基流动发了好多的代金券出去，赚了一波流量。你发了这个多少亿的代金券出去，你手里就1亿2亿的现金，你根本就没有办法兑现这个事情。这个其实也是有点骗傻子了，代金券出去并不是需要用你手里的现金去兑换的，你是要用服务慢慢地去把这些代金券消耗掉，跟你手里有多少现金本身是没有关系的。当然，卷这个事呢，在中国企业的竞争过程中呢，算是一种常态吧。现在硅基流动的DeepSeek R1也基本上处于不可用状态，我现在也不用他们家的，都是用火山的。待会咱们再讲为什么用火山的。到这了这两家就开始互相掐了，硅基流动说人家是已经发布了这些开源项目了，我们照着去学就完了，但是这个事很难，你搞不定，你不要说别人也搞不定，开始阴阳这个路深科技。这两边就开始相互的指责，说你挖我的人。</p>



<p class="wp-block-paragraph">硅基流动说你抄袭，开始互相怼起来，这已经离开事实本身了。这个呢，稍微有一点点low。卷不动呢，你就默默地退出就完了。当然，内部人设立不住呢，你就需要在外边立靶子。我们也见到了很多这样的案例了，最后呢在外部还翻了车了，只能回去继续统一思想。</p>



<p class="wp-block-paragraph">怎么在外部翻车了呢？因为路深科技呢，被硅基流动指责说你抄袭。然后路深科技说，抄袭的那个是原来我CTO干的，CTO已经把它开了。而且呢，CTO被开了以后，还去你硅基流动上班去了。现在这个CTO也出来回复了这件事情，他说我就是当年那CTO，我去的时候这项目就已经是这样了，那个代码也不是我抄进去的。说我去了以后呢，还整理了所有的代码，把所有引用的东西呢，给他写清楚出处。</p>



<p class="wp-block-paragraph">这个开源项目怎么算抄袭，怎么算不抄袭？就是你违反了人家的开源协议，你用了人代码你没有写说这是哪来的，这就算抄袭。你说我用了人代码了，但是我写清楚我用了谁谁谁家代码，符合人家的协议，然后我在这个基本上做什么修改了，这个就算给开源做贡献。人家的CTO说压根跟我没关系。</p>



<p class="wp-block-paragraph">然后第二个说我为什么离开呢，是因为他们用假的期权合同骗我，让我去的时候给我承诺了期权，结果最后呢没法兑现。因为这个事情我质问了他们，所以最后离开了。在其他的一些抄袭事件，因为这个路深科技，还有其他的抄袭事件，说这个就跟我完全没关系，等于又把这个路深科技整个放这了。</p>



<p class="wp-block-paragraph">那么DeepSeek的推理市场，未来到底怎么走呢？首先腾讯去加单了，订购了10-20万块的H20，这个是现在允许向中国出口的型号，全线接入DeepSeek。在它的微信，IMA，还有元宝这些程序里边都接了。IMA呢是一个办公用的AI助手，元宝呢，是个人用的AI助手。现在元宝在疯狂的做推广，微信的搜索里边，现在也在进行灰度测试，直接在里边可以使用DeepSeek R1进行搜索推理。字节呢，本身就是算力大户，它是全世界第二名的算力大户，第一名是微软，第二名就是它。</p>



<p class="wp-block-paragraph">DeepSeek只做ToB的服务，就是你可以在字节的火山引擎上用它。字节自己的产品里是没有去接DeepSeek R1的，他们还是比较骄傲的，希望这个豆包模型可以追上来。所以字节的DeepSeek R1是我现在用过的所有DeepSeek R1里头最快的，因为算力足够多，用的人不是很多，所以他最快。</p>



<p class="wp-block-paragraph">阿里云呢，未来三年投入3,800亿人民币做算力投入，说那我们就疯狂去买就完了。至于这些MAAS厂商，就是叫模型及服务的厂商，这个背后都是华为云，价格又被DeepSeek给锁死了，这个就很痛苦。所谓锁死了什么意思？DeepSeek在中国给出的价格，咱们就说R1的输出价格吧，是最贵的一个价格，是每100万TOKEN 16块钱。现在甭管是路深科技还是硅基流动，或者是阿里云火山云，都是用同样的价格给的，100万TOKEN 16块人民币。但你知道国外多少钱吗？在together上刚才我查了一下，美国的服务器上部署的DeepSeek R1，它的100万TOKEN大概是七八块美金了，应该到50多块钱人民币，所以这个还是挺贵的。</p>



<p class="wp-block-paragraph">他们的V3其实价格都差不太多，咱们的V3的输出呢，是八块钱人民币100万TOKEN，在美国的话是1.25美金100万TOKEN，这个是相差不多的。但是R1这个真的是差三倍的钱，国内这个锁死价格了，以后他们就必然会按照这个价格赔钱赔下去。</p>



<p class="wp-block-paragraph">至于DeepSeek所开源的这些库呢，他们只能去借鉴一个思路，肯定用不上。为什么？因为DeepSeek所有开源库都是基于CUDA的，都是基于英伟达芯片的。这帮人看着一堆的华为升腾910，只能说，咱们看看这个大概思路是不是可以参考一下。那这个想去做的话难度就大了，而且整个的服务过程必然亏损。原因也很简单，就是你的服务器绝不可能7*24小时很均匀、很平顺的满负荷运转，这个事情从头到尾就是个伪命题，所以肯定是亏的。</p>



<p class="wp-block-paragraph">而且，华为呢是不会承担这种亏损的。你跟华为合作，人家还忙着爱国呢。你亏了钱，肯定是你自己的问题。而且，人家DeepSeek说了：“我这能挣钱，你亏了，你不能怪我，你也不能怪华为。你看看你自己的技术哪不对。”</p>



<p class="wp-block-paragraph">而且，这些MAAS的厂商呢，还没有大厂其他的业务可以补血。你比如像刚才我们讲，腾讯在这个IMA或者是元宝里边，去使用DeepSeek R1的时候，你是不用付钱的，免费的。但是，腾讯有游戏收入，有广告收入，还有各种电商收入。他有一堆收入可以补这个窟窿。他去买20万张的H20，花不了多少钱，对于他整个利润来说，都是可以承担的成本。</p>



<p class="wp-block-paragraph">硅基流动，路深科技，你跟他卷，这你肯定卷不过他。更别说字节跳动了，字节跳动比腾讯还能挣钱呢。所以呢，跟大厂他们也卷不过。model as a service的这些厂商呢，只能看谁坚持到最后。坚持到最后，也不是说他们就能胜出。坚持到最后呢，也就是看最后谁能够下车，被这些大厂所收购。这应该就是他们的出路。</p>



<p class="wp-block-paragraph">当然，你说我未来是准备被收购的，那也就不能长太胖。什么意思？你不能拿太多的融资，必须要自己挣钱。因为你拿了很多融资以后，你的估值会变得非常高。等到最后大厂去选择一家，把它收下来的时候呢，通常还是要去衡量一下性价比的。</p>



<p class="wp-block-paragraph">那么，总结一下。首先呢，要感谢DeepSeek又给了一话题，又可以跟大家扯一会儿。如何理性地判断各种夸张数据背后的逻辑和价值，才是今天我们要讲这期视频的核心点。而不是说，我们来批判一下这东西合理还是不合理，这个没有什么意思。</p>



<p class="wp-block-paragraph">AI正在走向新的时代，过去很多的商业逻辑呢会发生变化。过去的经验未必有效，但是依然是会有一定的价值。你像我给大家分析很多东西，都是根据我过去的很多商业逻辑来分析，但是也不能迷信这个东西。像我每次都会跟大家强调，这个东西呢，有可能分析的不全面，未来有可能会出现我们想象之外的东西。那这个才是我们这个频道始终跟大家所强调的东西。好，这期就讲到这里。</p>



<p class="wp-block-paragraph">感谢大家收听。请帮忙点赞、点小铃铛，参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？</title>
		<link>https://lukefan.com/2025/02/20/grok-3%e5%8f%91%e5%b8%83%ef%bc%9aelon-musk%e7%a7%b0%e5%85%b6%e4%b8%ba%e5%ae%87%e5%ae%99%e6%9c%80%e8%81%aa%e6%98%8e%e5%a4%a7%e6%a8%a1%e5%9e%8b%ef%bc%8c%e6%9a%b4%e5%8a%9b%e5%87%ba/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 20 Feb 2025 00:40:03 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Musk传奇]]></category>
		<category><![CDATA[20万GPU]]></category>
		<category><![CDATA[AI API]]></category>
		<category><![CDATA[AI参数]]></category>
		<category><![CDATA[AI商业化]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI安全性]]></category>
		<category><![CDATA[AI对比]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[AI快速迭代]]></category>
		<category><![CDATA[AI排行榜]]></category>
		<category><![CDATA[AI架构]]></category>
		<category><![CDATA[AI模型评测]]></category>
		<category><![CDATA[AI模型选择]]></category>
		<category><![CDATA[AI流量大战]]></category>
		<category><![CDATA[AI测试策略]]></category>
		<category><![CDATA[AI用户体验]]></category>
		<category><![CDATA[AI直播发布]]></category>
		<category><![CDATA[AI订阅]]></category>
		<category><![CDATA[AI训练]]></category>
		<category><![CDATA[AI语音识别]]></category>
		<category><![CDATA[AI迭代]]></category>
		<category><![CDATA[Deep Research功能]]></category>
		<category><![CDATA[Deep Search功能]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek对比]]></category>
		<category><![CDATA[DeepSeek开源]]></category>
		<category><![CDATA[DeepSeek模型]]></category>
		<category><![CDATA[DeepSeek训练]]></category>
		<category><![CDATA[DeepSeek论文]]></category>
		<category><![CDATA[Grok 2]]></category>
		<category><![CDATA[Grok 3]]></category>
		<category><![CDATA[Grok 3发布会]]></category>
		<category><![CDATA[Grok 3对齐]]></category>
		<category><![CDATA[Grok 3费用]]></category>
		<category><![CDATA[Grok APP]]></category>
		<category><![CDATA[OpenAI对比]]></category>
		<category><![CDATA[Think与Deep Search对比]]></category>
		<category><![CDATA[Think功能]]></category>
		<category><![CDATA[XAI]]></category>
		<category><![CDATA[XAI发展]]></category>
		<category><![CDATA[XAI发布会]]></category>
		<category><![CDATA[XAI合伙人]]></category>
		<category><![CDATA[XAI商业方向]]></category>
		<category><![CDATA[XAI测试]]></category>
		<category><![CDATA[x平台]]></category>
		<category><![CDATA[X平台订阅]]></category>
		<category><![CDATA[世界工厂]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[合成数据]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[大模型幻觉]]></category>
		<category><![CDATA[幻觉问题]]></category>
		<category><![CDATA[推理功能]]></category>
		<category><![CDATA[数据清洗问题]]></category>
		<category><![CDATA[智能模型]]></category>
		<category><![CDATA[暴力迭代]]></category>
		<category><![CDATA[最聪明模型]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[深度研究功能]]></category>
		<category><![CDATA[马斯克]]></category>
		<category><![CDATA[马斯克AI]]></category>
		<category><![CDATA[马斯克的大模型]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1923</guid>

					<description><![CDATA[🚀 **我宣布！Grok 3 真的可以改变阶级！**

大家好，今天我要跟大家聊一聊马斯克的Grok 3，这款被马斯克誉为“世界上最聪明的大模型”的AI神器！😱

首先，Grok 3的发布可谓是科技界的一大盛事。在2月18号，马斯克和他的小伙伴们通过一场直播正式发布了Grok 3。作为一个科技迷，我当然第一时间去体验了这款新模型！🔍

Grok 3的功能非常强大，它有两个主要按钮：Deep Search和Think。Deep Search类似于OpenAI的Deep Research，可以搜索大量的内容并生成详细的报告。而Think则类似于推理模型，可以进行逻辑推理并生成简短文案。这两个功能可以单独使用，但不能同时使用。🤔

不过，Grok 3的体验也有一些小瑕疵。比如，在Deep Search时，生成的报告有时会出现内容重复的情况。而Think功能虽然能生成较为简洁的文案，但在编程方面的表现还有待提升。😅

总的来说，Grok 3作为一款新晋的大模型，虽然存在一些小问题，但其强大的功能和潜力不容小觑。如果你是科技爱好者，或者想要在AI领域有所突破，Grok 3绝对值得一试！💪

#Grok 3 #马斯克 #AI大模型 #科技前沿 #智能助手

Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？

马斯克自称Grok 3是“世界上最聪明的大模型”，但其功能和使用体验正引发广泛争议。Grok 3采用了高昂的订阅费用，仅支持高级用户访问，其深度研究（Deep Search）和推理（Think）功能虽颇具创新但问题频繁，如重复内容和严重幻觉。其基于20万张GPU暴力迭代的快速开发模式，更是被比喻为“AI界的世界工厂”，但用户体验仍未达到预期。文章详细剖析了Grok 3的架构、功能、发布策略以及与DeepSeek和其他开源模型的对比，探讨XAI未来的竞争策略与挑战。关键词：Grok 3、马斯克、XAI、DeepSeek、AI大模型、暴力迭代、幻觉问题、用户体验。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="Grok 3发布：Elon Musk称其为“宇宙最聪明”大模型，暴力出奇迹的xAI，是否可以成为AI时代的世界工厂？" width="900" height="506" src="https://www.youtube.com/embed/qBvMVcGKFws?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">马斯克的Grok 3到底是不是世界上最聪明的大模型？暴力真的能出奇迹吗？大家好，欢迎收听老范讲故事的YouTube频道。世界上最聪明的大模型，这是马斯克对他自己家的Grok 3给的定义。如果有人不同意的话，那么会被开除的。因为XAI某一位员工在X上发帖说，Grok 3好像并没有那么聪明，然后就被XAI找到说，你要么删帖要么开除。后来这哥们想了想说，我得捍卫一下自己的言论自由，于是这哥们就被开除了。</p>



<p class="wp-block-paragraph">在说所有细节之前，咱们先说说Grok 3到底怎么用。在2月18号北京时间中午12点的时候，马斯克跟另外三位小伙伴，一共四个人坐着开了场直播，把这个Grok 3发布了。我就四处去找，首先我是X每个月交8美金的Premium用户，我在X上使不了。X上你必须是40美元的Premium+用户，才可以去使用。在Grok的这个网站上呢，你也需要30美元一个月的账号才可以用。免费用户只能用Grok 2，API不充钱已经不让用了。如果是团队的话，至少花了5美元以上，每个月他会赠送你150美金，但前提呢是要跟XAI共享你的数据。</p>



<p class="wp-block-paragraph">目前Grok 3的版本还没有上，你就算交钱了，你在XAI的网站上，也只能得到Grok 2的API，还要再等几周才会上线。Grok的苹果APP上面，是可以使用Grok 3 Beta这个版本的，即使是免费用户也可以去用。因为我呢对于XAI来说是一个免费用户，我就通过iOS，也就是iPhone和iPad这个版本上去，好好儿的测试了一下。后边儿呢咱们再去讲具体效果怎么样。</p>



<span id="more-1923"></span>



<p class="wp-block-paragraph">Grok 3有哪些具体信息呢？在整个的发布过程中呢，并没有特别详细的讲，只是说，我各种排行榜都排在第一了。Grok 3，Grok 3 mini是怎么去排上去的，讲了很多这样的话。但是呢，这个系统本身的一些细节，并没有那么详细的公开。因为可能在Grok 3稳定下来以后，会把Grok 2开源。现在Grok 1是开源的。</p>



<p class="wp-block-paragraph">Grok 2可能有一些细节会被披露出来，但是Grok 3的话应该很长一段时间不会有特别详细的细节披露出来。现在能够知道的就是，Grok 3应该也是一个MoE模型，跟DeepSeek是一样的。它到底有多少参数呢？现在猜测是有1.2万亿个参数，DeepSeek是6,710亿，它呢应该是在DeepSeek的基础上翻了一番。至于这个数字是不是准确，我不知道，因为呢我去问了Grok 3，也去问了ChatGPT，最终是给了我一个这样的数字，我并没有去查原文件。</p>



<p class="wp-block-paragraph">Grok 3的使用感受到底是什么样的？它呢，下边有两个按钮，一个叫Deep Search，一个呢叫Think。Deep Search实际上就类似于OpenAI的Deep Research，就是这种深度研究，它会搜索大量的内容，然后呢，再去给你出报告。Think的话实际上就是类似于O1、O3这样的推理模型。这两个按钮它特别有意思，这两个按钮呢你可以都不按，也可以按其中一个，但是不允许两个都按。这个意思大家能够理解吧？你不能又要Think，又要Deep Search，这个事是不允许的。那你说我既不Think也不Deep Search，这事行不行？可以。</p>



<p class="wp-block-paragraph">然后呢，我都试了一下。在Deep Search的时候，它会直接引用几十个甚至上百个网页，非常非常多的网页，然后呢给你一个似模似样的报告，很长，格式非常非常好的一份报告。在Think的时候呢也会搜索，并不是自己去瞎编的，他呢，会搜索25个网页，以及呢X上的帖子。大家注意，Deep Search时候是不搜索X的，在Think的时候是会搜索25个网页，加上X上的可能5个帖子吧，反正我搜了几次都是5个帖子，然后给你进行一定的推理，总结出一个小的文案出来。这就是这两个功能。如果两个都不选，我既不Think也不Deep Search，它呢就不联网了，就直接是给你编一个结果出来。</p>



<p class="wp-block-paragraph">大家注意，所有的大模型，甭管是谁家模型多聪明，你让他直接编出来的这个结果，都是最不靠谱的。那么，他这三个功能，就是两个都不选，或者选其中任何一个。这三个功能呢，特别有意思的一点是什么？他可以混用。</p>



<p class="wp-block-paragraph">在OpenAI上呢，这种模型混用是比较严格的。你如果开始一个新话题，选择了一个模型，提了几个问题之后，你现在想去切模型的时候，你这个模型，比如说允许有图片呢，下面你要去切的时候，只允许再切换到允许图片的模型。它不允许你切换到不允许读图片的模型去。这个是有限制的。但是呢，在Grok里面它是没有限制的。就是你随时可以开始新对话，对话的过程中可以随时切模型，你可以来回切来切去。</p>



<p class="wp-block-paragraph">但是呢，在这个过程中呢，有一些不是那么有趣的地方是什么？就是如果你俩都不点上来，直接让模型去编，他就不联网了。他编完第一句以后呢，你说我现在要开始进行深度的搜索了，deep search了，这个时候他也不联了。或者说我现在需要think了，他也不会去联网，他就根据现有的内容接着编下去。他是这样的一种过程。</p>



<p class="wp-block-paragraph">但如果你是以deep search开始的，那么think的时候呢，他就不去搜索帖子，因为deep search是不搜索X的。如果你是以deep search或者think开始，然后你最后切换回到完全编的，既不deep search，也不think的这样的一个裸模型，去输出的时候，继续搜索。所以它整个的逻辑，还稍微有一点点小混乱吧。</p>



<p class="wp-block-paragraph">那么，Grok 3到底是不是宇宙第一聪明的这个模型呢？因为你如果用iOS APP你去选的时候，后面会写一个叫smartest，最聪明的。它是Grok 3 beta，后边写一个小括号，smartest，这个是最聪明的。到底是不是？我个人感受呢，现在相差还比较远。为什么呢？为了准备这期节目呢，我其实用Grok 3去做了很多的工作，包括是他的deep search或者think。但是最终呢。</p>



<p class="wp-block-paragraph">Grok3生成的所有结果都被我扔掉了。最后的内容还是靠豆包和GPT search来完成的。原因也很简单，Grok 3 deep search现在报告的格式非常好，非常中规中矩，但是大量的段落是重复的。前边写了一遍，后边车轱辘话又写了一遍，用不同的格式，用同样的话来回来去说，这个是很讨厌的。</p>



<p class="wp-block-paragraph">还有一个问题是幻觉大到完全无法使用的一个状态。比如说，我问他XAI现在有多少人了，图说现在有900多人了。后来我问了其他几个模型，都告诉我是有100多人，这个可能还是稍微靠谱一点点。都是联网搜索吗？你都不是自己瞎编的，那我不知道他这个900多人这个数是哪来的。</p>



<p class="wp-block-paragraph">然后我说四个人在上面开发布会嘛，中间两个人是华人。这两天在国内又嗨起来了，说你看马斯克发布Grok3的时候，马斯克只能在一边点头，点头机器。中间是做C位的两个都是华人，旁边还有一个白人。那我就问他，我说这俩华人到底是谁，什么教育背景，然后就开始给我胡说八道。他也是举的XAI里边的一些华人高管，但是呢并不是当时坐在台上这两个人。</p>



<p class="wp-block-paragraph">发生这种事情的原因很简单，就是他在deep search的时候，一下瞪了可能几十个上百个网页，回来拿这么多个网页进行总结的时候呢，把内容搞串了，实际上就产生幻觉嘛，就完全没法使。</p>



<p class="wp-block-paragraph">然后呢，我去尝试了一下think。think呢其实没有特别细致的测试，为什么呢？本来我想去让他做编程，但是呢，他没有API。你没有API的话，就没有办法接到IDE里边去，你没办法作为插件接进去，就没有办法详细地参与到我的这整个的编程过程里头去。我做了些简单的测试，但是感觉呢think模型对于各种编程的复杂的环境，和各种的版本和类库的话，并不是那么熟悉。这块的话可能以后等他有了API以后，再去做详细测试了。直接生成还过得去，就是如果两个都不点，让他直接生成。但是呢，因为在手机上用，并没有办法进行。</p>



<p class="wp-block-paragraph">特别大规模的使用和测试，现在看来呢，XAI的Grok 3采用的是叫分梯度发布的一个方式。就是说，我先发布一点，然后慢慢地让更多的人能用，再慢慢地发布更多的内容出来，然后不断地去迭代。他现在干这样的事情。现在呢，就是手机用户可以用。那么手机用户呢，第一个用户量不会特别大，而且在这个时候，可能还能够为Grok APP带来一批的下载，这个也算是一个小心思吧。</p>



<p class="wp-block-paragraph">在手机用户使用的过程中呢，你不会给他特别繁重的任务。因为你要跟他做这种很复杂的沟通的话，你需要打好多字，举了个手机在这噼里啪啦打字，很费劲的。你像我，为了做这个测试，最后是把我的iPad接到了机械键盘上，夸啦夸啦往里打字，这个还是能够问一些稍微复杂一点东西。要真是拿着手机，在那个屏幕上打字的话，这个还是挺费劲的。还有什么呢，就是不会有太正式的任务是通过手机来进行的。比较正式的任务一般会通过网页，通过电脑来去工作。</p>



<p class="wp-block-paragraph">Grok跟X网站上还是有一些付费的人能够使用的。你不能说老范你没交钱，你就说这玩意不好使。这些比较高付费的用户，比如说在X平台上交了40美金一个月的，或者在Grok平台上交了30美金一个月的，这些用户呢，他是可以去用的。但是这些用户呢，数量肯定会少很多。还有一点呢，就是皇帝的新衣嘛，我付了这么多钱了，我就不能允许任何人说我是傻子，我一定要说这个钱付的是值的。所以呢，就算他们遇到问题了，上来骂街的可能性也不是那么大。这个就是马斯克当前发布了一个版本，比较聪明的地方吧。</p>



<p class="wp-block-paragraph">后面语音模式的话，可能还要再等一周。我估计语音识别率这块还有待优化吧，因为语音你认不出来就是认不出来，还有口音还有乱七八糟这种事情。咱们再看看，后边会做出一个什么样的结果出来。API的话，还需要再等几周。为什么API要这么费劲，原因呢是现在大家只能看马斯克官方的排行榜，我的测试数据是什么样的，排行榜是什么样的，你自己没法去测取，给你一个手机版本。</p>



<p class="wp-block-paragraph">或者给你一个网页版本。你现在想把这几千道题输进去，测试这个事太费劲了。你要想测试这东西，必须要拿API写程序去测。这个过程其实有点像法拉利的一个跑车。法拉利就说了，这个东西太贵，而且做测速的时候太危险。如果你自己去测的话，非常不安全，而且保险公司也不允许我们干这个事情。所以，法拉利跑车的最高极速，只有法拉利官方出的这个版本是唯一标准，任何人不得私自去测试法拉利跑车的最高极速。这个事情我们不承认，而且这个事我们也不允许。</p>



<p class="wp-block-paragraph">现在，XAI的Grok也就是在这样的一个阶段。等以后API上来以后，每一个人都会自己去跑各种各样的测试，或者做多模型的输出结果比较。到那个时候，丑媳妇就真的要见公婆了。下一步的话是要开源Grok 2。DeepSeek是上来直接把最新的模型开源了，而且上来说，你们每家部署的跟我现在自己官网上跑的是一模一样，没有任何差别的。而且不断的有新的技术演进，不断的有新的技术新发现，都直接发论文发出来了。</p>



<p class="wp-block-paragraph">但是，马斯克永远是开源上一代模型。就是他在用Grok 2的时候，他把Grok 1开源了。Grok 3能够稳定正常运转的时候，他会把Grok 2开源出来，可能还要再等那么几周或者是几个月的时间。山姆·奥特曼现在也惦记开源，刚在X平台上发了帖子说：“唉，咱们投个票吧，你们觉得OpenAI应该开源什么样的模型出来？我们是不是应该开源一个在PC本地就可以跑的O3 mini模型出来，还是说我可以在手机端跑一个这个小模型出来？”</p>



<p class="wp-block-paragraph">他们是准备走谷歌跟微软这条路的。谷歌也是这样，它有一个叫Gemmar的模型，比较小的这个模型是开源的，主要也是让大家在端侧来用的。还有，微软做的这个Phi模型，这个模型也是开源的，也是让大家在端侧去使用的。但是我觉得，OpenAI如果真的把它的O3的模型，或者哪怕是O3 mini的模型拿出来开源了，或者让大家能用上了。</p>



<p class="wp-block-paragraph">这也是一个值得期待的事情。讲远了，再往后呢？发布会上，中间两个华人做C位了。这种事情呢，肯定会引起国内的热议嘛。你看，还得看华人吧？华人也比较好认嘛，中国脸。</p>



<p class="wp-block-paragraph">台上是四个人。第一个是马斯克，马斯克坐一个角嘛。另外一个角呢，这个人叫巴布斯基，这个人呢，是个俄罗斯人。中间的两个人呢，一个呢，叫做吴宇怀，XAI的合伙人，浙江人，在国内上完初中，15岁去了加拿大多伦多大学的博士，后来呢，是斯坦福大学的博士后，现在是XAI的合伙人。还有一个呢，叫Jamie BA，这个人呢，没有看到他前面的一些履历，是多伦多大学计算机科学系的助理教授，AI教父Joffrey Hinton的学生。</p>



<p class="wp-block-paragraph">等于一边一个白人，中间两个华人。但其实你要再仔细看一下，这个是全世界人民在美国进行AI创业。一个俄罗斯人，剩下三个可能都是加拿大人。马斯克自己其实是有美国国籍、加拿大国籍和南非国籍的。中间两个，一个是多伦多大学的博士，他大概从15岁就开始在加拿大生活。另外一个的话，Jamie BA是多伦多大学计算机科学系的助理教授。所以有可能，这台上坐的是三个加拿大人和一个俄罗斯人。只是看着脸的话，是这个两个白人和两个华人。</p>



<p class="wp-block-paragraph">那么，XAI未来的策略会是什么样的呢？XAI现在应该也就是100多人吧。它具体是多少，这个数字呢，并没有那么确定。但我还是相信GPT search给我的结果吧，就是不要说900多人了，就是100多人的一个公司。这种公司呢，不太可能进行全面开花，七扯咔嚓我把整个的C端到B端所有东西都做起来。这个事其实有点难度。</p>



<p class="wp-block-paragraph">20万张卡这个事呢，其实是别人都不具备的这个条件。它就可以进行快速的迭代。各种方法只要确认了，说我知道这个方法是什么样的。比如说DeepSeek出了论文了，出了开源模型了，那我方法确认以后，我就可以快速的在20万张卡上给你重现出来，甚至把你的参数翻多少倍再重现一遍。这个事他都是可以干的。这呢，就是暴力出奇迹。</p>



<p class="wp-block-paragraph">就会有这样的结果。这个过程其实大家看看有点像什么呀？是不是有点像世界工厂？别人只要做出来了，反正我这有的是生产力，快速的复制、迭代更新就完了。所以，这个应该就是AI未来的路，就是甭管谁做出来的东西，我都可以快速验证、快速改进我的模型。</p>



<p class="wp-block-paragraph">而且呢，它使用了完全的合成数据进行训练，可能有很少一部分真实数据吧，绝大部分数据都是合成数据。所谓合成数据呢，就是由其他大模型生成的数据。他通过一定的策略，要求其他大模型去给他吐数据出来，然后拿这个模型去训练。</p>



<p class="wp-block-paragraph">Grok 3一旦使用了合同数据的话，会不断的说自己是Grok 2，或者说自己遵守open AI标准。这个事情你就避免不了，因为是用别的模型生成的数据嘛。虽然XAI说我们在生成数据的过程中呢，我们还进行了反复的检查，有错误都给去处理掉了，但是他不断的说自己是Grok2，说自己是遵守open AI的安全准则，这件事来说呢清洗的还不够干净。</p>



<p class="wp-block-paragraph">Grok3呢，应该只做了很少的对齐和测试，就扔出来了。后面呢，是准备快速迭代的。你如果现在去问Grok3，或者是问open AI的话，他们都会告诉你说，Grok3本身呢安全性还是不错的。但是有一点是不可否认的，他训练完成一个月就发布了，训练完了以后，只是在XAI内部测试了两周，就直接把产品扔出来了。这个是挺难以想象的，因为像open AI这样的这种模型，它每一次训练完了以后，可能后边都是需要用年为单位去进行对抗测试，或者说进行调整，然后才敢把这东西放出来。现在XAI就是我这边训练完了，我就把它扔出来了。</p>



<p class="wp-block-paragraph">而现在呢，对外公布的是，Grok呢是通过思维列进行道德商值评测，就是它等于是一个思考过程吧。那我在思考的时候，我就把所有的输入输出的信息，进行道德商值的加权平均，或者说做一个加权复合吧，做一个这样的这个分数出来。如果这个分数达到一定的阈值以后，就禁止回答了。他大概是用通过这种方式来去工作的。</p>



<p class="wp-block-paragraph">但是呢，并没有进行大规模的真人对抗测试。当然了，这个东西你说以后是不是都需要像OpenAI这么干呢？不好说。OpenAI现在还没有特别大的问题，但是谷歌就属于有点走火入魔了，直接被忽悠瘸了那种，就是画出黑人华盛顿那样的，这个就属于忽悠瘸了。未来可能大家都会去像XAI这样往前走。其实像DeepSeek也是这样，它从2.5到3.0之间的发布，也是大概一个多月或者一个月左右的时间就扔出来了，所以都不会做特别详细的或者长时间的这种真人对抗。未来可能都是通过逻辑的方式，让模型的安全性达到一个可以接受的程度就完了。我不保证这东西绝对安全，大家凑合使就可以了。我在不进行严格测试的情况下，不断地去迭代，这个其实才是DeepSeek也好，像Grok也好，最大的一个优势。每个小时都在改进和升级，全世界都在开发新的算法和架构嘛。马斯克有20万张卡，就可以把所有的这些公开的信息都在我这20万张卡里头去试一下。别人只能进行小规模测试的时候，XAI就可以进行全量测试，甚至我可以在你原来的数据基础上，用两三倍或者更大的数据集进行测试，得到一个世界上最聪明的大模型。所以我说这个就像中国世界工厂的工作方式是一模一样的。</p>



<p class="wp-block-paragraph">那么XAI的下一步会是什么样呢？应该是会通过快速迭代，把当前的模型整个先稳定下来。现在已经可能是世界上最聪明的模型了，咱们就相信马斯克说的吧。但是呢，这个世界上最聪明的模型还经常会胡说八道。当它的模型彻底稳定下来，基本上可以达到可用的状态以后，下一步其实呢都是流量大战。这些人去搞C端估计应该是比较难，因为就100来口子人吧。最新的模型不开源，你去在B端竞争的话，也是有一定难度的。你比如说我现在一个公司里边需要去部署大模型了，那我不能去部署Grok 2吧，我肯定是部署DeepSeek V3或者DeepSeek R1这样的模型。</p>



<p class="wp-block-paragraph">因为这是当前开源的最好模型，所以在这一块儿的竞争上也会有一些难度。那么，XAI的策略应该是依靠不断的快速迭代更新，始终保持自己是世界上最聪明的模型，这样的一个位置，吸引部分B端和C端的用户加入进来。自己虽然是有一定的流量，但是X自己的流量对于XAI来说应该是不够的，因为Open AI已经花费1,400万美金打超级碗广告了。所以，现在的AI行业已经进入了一个流量争夺的时代。在这个时候，可以靠产品好，靠模型最聪明，吸引一部分用户进来。像DeepSeek美国排行榜排第一，就是因为模型好，不是因为其他任何原因。他也没有那么多钱去烧这个流量去，他也不可能花1,400万美金去砸超级碗。XAI可能以后也只能是向这个方向走了。后面的路其实并不明朗，怎么依靠XAI把这个钱挣回来，现在还不清楚，还要等马斯克脑筋急转弯，让大家眼前一亮。</p>



<p class="wp-block-paragraph">好，这就是我们今天讲的XAI的Grok 3大模型，到底是不是世界上最聪明的模型？暴力真的可以出奇迹吗？感谢大家收听，请帮忙点赞、点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>深度求索满血版DeepSeek全攻略｜教你快速上手火山方舟与Cherry Studio部署方法，没有搜索的DeepSeek，不是完整的DeepSeek。</title>
		<link>https://lukefan.com/2025/02/16/%e6%b7%b1%e5%ba%a6%e6%b1%82%e7%b4%a2%e6%bb%a1%e8%a1%80%e7%89%88deepseek%e5%85%a8%e6%94%bb%e7%95%a5%ef%bd%9c%e6%95%99%e4%bd%a0%e5%bf%ab%e9%80%9f%e4%b8%8a%e6%89%8b%e7%81%ab%e5%b1%b1%e6%96%b9%e8%88%9f/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 16 Feb 2025 00:41:12 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[DeepSeek大模型]]></category>
		<category><![CDATA[671B参数]]></category>
		<category><![CDATA[AI工具推荐]]></category>
		<category><![CDATA[AI模型整合]]></category>
		<category><![CDATA[AI辅助工具]]></category>
		<category><![CDATA[AI辅助工具使用]]></category>
		<category><![CDATA[Cherry Studio]]></category>
		<category><![CDATA[Cherry Studio功能]]></category>
		<category><![CDATA[Cherry Studio操作指南]]></category>
		<category><![CDATA[Cloud AI]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[DeepSeek API Key获取]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[DeepSeek R1搭建]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek V3搭建]]></category>
		<category><![CDATA[DeepSeek使用教程]]></category>
		<category><![CDATA[DeepSeek大模型应用]]></category>
		<category><![CDATA[DeepSeek实时搜索]]></category>
		<category><![CDATA[DeepSeek应用广场]]></category>
		<category><![CDATA[DeepSeek接入点创建]]></category>
		<category><![CDATA[DeepSeek推理模型]]></category>
		<category><![CDATA[DeepSeek替代方案]]></category>
		<category><![CDATA[DeepSeek模型参数]]></category>
		<category><![CDATA[DeepSeek模型广场]]></category>
		<category><![CDATA[DeepSeek满血版]]></category>
		<category><![CDATA[DeepSeek联网搜索]]></category>
		<category><![CDATA[云计算AI模型]]></category>
		<category><![CDATA[云计算大模型部署]]></category>
		<category><![CDATA[云计算平台]]></category>
		<category><![CDATA[云计算教程]]></category>
		<category><![CDATA[人工智能部署]]></category>
		<category><![CDATA[大模型使用]]></category>
		<category><![CDATA[如何配置DeepSeek]]></category>
		<category><![CDATA[字节跳动]]></category>
		<category><![CDATA[方舟平台]]></category>
		<category><![CDATA[本地部署DeepSeek]]></category>
		<category><![CDATA[深度求索]]></category>
		<category><![CDATA[满血版DeepSeek]]></category>
		<category><![CDATA[火山引擎]]></category>
		<category><![CDATA[火山引擎操作]]></category>
		<category><![CDATA[火山方舟]]></category>
		<category><![CDATA[火山方舟优势]]></category>
		<category><![CDATA[火山方舟模型设置]]></category>
		<category><![CDATA[火山方舟部署]]></category>
		<category><![CDATA[火山方舟配置]]></category>
		<category><![CDATA[联网搜索功能]]></category>
		<category><![CDATA[联网搜索设置]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1914</guid>

					<description><![CDATA[家人们！我真的要吹爆满血版 DeepSeek 🚀！！你们知道吗？终于找到了一个超级简单的方法，不用被官网虐，也不用搞复杂的本地部署，直接上手开玩，效果炸裂！

我宣布，火山方舟平台 yyds！🔥
它虽然不是官网，但配置起来真的比其他云计算平台简单多了！不管是 DeepSeek V3 还是 R1，671B 参数直接拉满！而且还有联网搜索功能，再也不用担心模型一本正经地胡说八道了！😆

为什么要放弃本地部署？🧐
因为真的玩不起！一个满血版 DeepSeek 的服务器动辄上百万，耗电噪音还大，普通家庭或办公室根本扛不住！所以，别折腾了，直接上火山方舟+ Cherry Studio，小白也能轻松搞定！

步骤超简单：
1️⃣ 登录火山方舟，找到 DeepSeek V3 或 R1 模型，直接开通服务！
2️⃣ 下载 Cherry Studio，把火山平台的 API Key 填进去，配置模型！
3️⃣ 挂载联网搜索功能，实时查询资料！
整个过程简单到不行，而且前期还有免费额度，完全不用担心费用问题！

种草理由：

满血版 DeepSeek，参数拉满，效果炸裂！
火山方舟速度快，配置简单，不用被官网卡顿劝退！
Cherry Studio 本地应用，下载即用，超级方便！
联网搜索功能，实时获取最新资料，拒绝胡说八道！
家人们，真的别再被官网虐了，赶紧试试火山方舟+ Cherry Studio 的组合，满血版 DeepSeek 的体验感直接拉满！✨
别忘了点赞收藏，快去试试吧！评论区等你分享体验！💬

#满血版DeepSeek #火山方舟 #CherryStudio #AI神器 #科技探索

深度求索满血版DeepSeek全攻略｜教你快速上手火山方舟与Cherry Studio部署方法，没有搜索的DeepSeek，不是完整的DeepSeek。

本篇文章深入讲解了如何使用满血版DeepSeek V3和R1，并提供了详细的部署指南。从官网无法使用开始，介绍了选择放弃本地部署的原因，最终将重点放在火山方舟平台的优势及Cherry Studio的简单操作上。火山方舟作为字节跳动推出的云计算平台，以其快速响应和简化配置的特点帮助用户轻松上手DeepSeek的联网搜索功能。而Cherry Studio因为其跨平台客户端特性为普通用户提供了极大的便利。无论是探索671B参数的大模型性能，还是实现联网搜索增强结果精度，这里都有清晰的方案。文章还涵盖了如何完成API Key获取、设置模型接入点、激活联网搜索功能和具体实现方法，使您从零到一全面掌握DeepSeek的使用流畅体验。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="深度求索满血版DeepSeek全攻略｜教你快速上手火山方舟与Cherry Studio部署方法，没有搜索的DeepSeek，不是完整的DeepSeek。" width="900" height="506" src="https://www.youtube.com/embed/bUaHxdeFQj8?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">真正满血版的DeepSeek到底应该怎么用？在官网基本趴菜的情况下，我们是不是还可以使用到真正满血版的DeepSeek？有什么简单一点的方式可以让普通人用吗？这就是今天要讲的事情。</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。今天我们会先介绍一下什么是满血版DeepSeek，为什么要放弃本地部署，以及官网现状替代方案。今天的替代方案是火山方舟平台的替代方案。这个是字节跳动下面的，这个是目前为止相对来说比较均衡的一个方案。为什么？你比如像硅基流动，配置是相对来说比较简单的，但是实在是很慢。你使用的时候非常的不流畅，而且经常没有办法得到完整的答案。所以我现在基本上放弃了硅基流动这个平台，现在主要是使用方舟平台。方舟平台跟其他的像什么阿里云、腾讯云比起来，虽然都是云计算平台，但是配置起来相对还没有那么复杂。因为越是云计算平台的配置越麻烦。</p>



<p class="wp-block-paragraph">讲完了这个方舟平台之后，我们要讲一下Cherry Studio啊。这个是目前普通人可以使用的比较简单的AI辅助工具。因为现在绝大部分的AI辅助工具都是网页。你让一个没有学过电脑的人去部署网页，去部署一个网站，还是挺麻烦的。有这个客户端，Cherry Studio就是Windows和Mac OS的一个客户端，下载下来就直接可以用。这个要相对来说简单很多。</p>



<span id="more-1914"></span>



<p class="wp-block-paragraph">好，这就是我们今天大概要去讲的东西。首先，什么是满血版的DeepSeek？DeepSeek直接使用的版本是两个，一个是V3版本，一个是R1版本。V3其实就是一个语言模型，671B的这个参数就是6,710亿参数。这是一个非常大的一个模型。R1呢，满血的应该也是671B，它是做推理用的一个模型。大家记住这两个就行了。我们要用满血版就一定要用这两个。那你说，很多平台都有满血版的DeepSeek出来，甭管是BAT也好，还是各大运营商也好，都有。那这个有什么区别？</p>



<p class="wp-block-paragraph">他们是不是真满血版？我告诉大家，还不算。那你说还缺什么？还缺一个很重要的东西，就是联网要搜索。你不联网搜索，你光有俩模型，你只能等着他一本正经地跟你胡说八道了。所以我们所要的完学版的DeepSeek，是DeepSeek V3和DeepSeek R1，671B的，加上联网搜索功能，这个才是我们所需要的。</p>



<p class="wp-block-paragraph">我们今天就来教大家怎么去部署这个东西。那么为什么要去放弃本地部署？你如果想在本地把满血版的DeepSeek跑起来，基本上那个服务器上百万了，可能100万都搞不定，两三百万那个服务器能跑起来。而且这种服务器甭管是噪音还是耗电，都不是普通家庭或者是普通办公室可以忍受的。所以咱们就不要再去尝试本地部署了。任何人告诉你本地部署这东西，就直接跳过就好了。所有本地部署的DeepSeek，也就是最大32B，再往大了可能70B的有，但是效果都非常差，所以完完全全的不考虑。</p>



<p class="wp-block-paragraph">官网现在算力是什么样？这个基本上不可用。你上去以后，可能问一个问题，或者问两个问题就给你踢出来了。虽然很多人都号称在接这个东西，一堆公司，BAT三大运营商，刚才我们讲的字节跳动、硅基流动、华为，什么全都在接。但是接的目的是什么？自己赚钱。从来没有谁说我接了DeepSeek以后，我去给深度求索公司贡献算力的，一个都没有。所以到现在为止，深度求索公司依然是卡顿的一塌糊涂。你进去问了一两个问题以后，直接给你踢出来，还是这样的一个情况。</p>



<p class="wp-block-paragraph">那么接入的意义就是，大家可以在不同的平台上选择DeepSeek的模型进行工作了。但是这个事跟深度求索，就是DeepSeek这公司，其实没有什么关系。替代方案除了官网之外，还有谁干了？比如说轨迹流动、火山方舟、百度、腾讯、阿里三大运营商，这个包括华为，基本上你只要想得到的，跟云计算相关的这些平台，他们都部署上去了。而且，今天DeepSeek官方出了一个x的推文，上面写了。</p>



<p class="wp-block-paragraph">说你们每一家儿部署的这个开源版 DeepSeek 完全版的，跟我在自己的服务器上部署的，是完全一样的，没有任何差别。打开去用就好了。</p>



<p class="wp-block-paragraph">今天，我们主要是跟大家介绍火山方舟平台。它作为一个云计算平台，它的设置还是要相对复杂一些的，所以待会我会带着大家去做一下设置。整个的过程，我现在讲一下。</p>



<p class="wp-block-paragraph">上面画着一个蓝色的山的，这个就是火山方舟。它的火山引擎其实是字节跳动下边的，所有跟云计算相关的都在这，包括什么数据分析，或者是什么数据存储。方舟是什么？这个方舟，是火山引擎里面的一个子模块。这个模块就是各种大模型相关的事情，叫方舟。</p>



<p class="wp-block-paragraph">我们下面到这个火山方舟，点进去就长这样。我们就需要去注册了。啊，这个下面很复杂，反正云计算东西很多。我一般情况下，如果非必要，是不会在云计算的平台上，去选择模型来用的，因为设置起来太麻烦。这个还算是能跑的。</p>



<p class="wp-block-paragraph">登录，反正账号登录，手机号登录，咱们用个简单的，抖音登录。我去找一下我的抖音，找个抖音这扫一扫，扫你，这个，同意，好，登录进来了。</p>



<p class="wp-block-paragraph">好，登录进来以后，下头这一大堆的我们也不用去管他。这告诉你各种模型什么，这跟我们都没关系。我们只到这点，这个叫控制台，最右上角，点进来以后，你们正常进来，这应该是空的，不会有火山方舟，因为我是已经开始用这个平台了，所以这有一个叫火山方舟。这边告诉你，这个是老范讲故事，已经实名认证了。这个是必须要实名认证的，这个没有办法，只要在国内使用，所有云计算平台都要实名认证。没有绑定邮箱，大概也就是这样。我还充了5块钱进去。</p>



<p class="wp-block-paragraph">好，如果你说我这没有怎么办？没有火山方舟，把这个三个小横线，把鼠标挪到这个三个小横线这，他就出来了。以后你看，有云服务器，GPU云服务器，弹性裸金属，这都有。这跟我们没关系。数据库什么的，这都跟我们没关系。网络也不用管它。存储安全，这个容器我们这都不是我们需要的。我们需要的是哪去了？视频云，哇，这东西多去了。方舟这热门产品。</p>



<p class="wp-block-paragraph">方舟扣子专业版云服务器、云对象存储、域名服务，我们需要的是这个。点一下就进来了，这就是模型广场。你可以用哪些模型？这个模型里，你看自己家的豆包1.5，有Vision的，一般是可以进行视觉判断的，你可以去做图片识别。这个是有Vision的。后边这个32K的，意思就是说你输入的内容最大就是32K。然后这个是相对比较新的，这个豆包1.5 Pro 256K，这个还是不错的。这就是我们的DeepSeek R1，你看，写着671B满血版，上次专门写着满血版，限时折扣。我们现在开始用这玩意不要钱。DeepSeek V3，这个上头也写着是满血的，这个也是671币的。</p>



<p class="wp-block-paragraph">下一件事，干嘛我们要去开通管理？这个是使用云计算的时候，比较讨厌的一点。这个现在看，我是因为进来还没用，所以我只开通了两个，剩下的我们没有开通。比如说这个豆包的这些模型，这个我们都没有去开通。我现在是把这个DeepSeek R1开通了，DeepSeek V3已开通。这个一旦开通了以后，它不让你关，所以没法给大家显示一开始的样子。然在这个折扣使完之前，现在是每个人给了50万TOKEN跟去用。折扣使完以后，这个折扣价格是每次输入1,000个TOKEN，应该是0.001，实际上也就是100万TOKEN是一块钱，大概就是这样。如果是R1的，100万TOKEN是两块钱，输出100万TOKEN，这个是8块，这个是4块大概，这么来看就可以了。这就是它的价格。</p>



<p class="wp-block-paragraph">好，首先要去点，打开开通服务。我们再去开一个别的，比如说开一个Pro 256K，这个我是比较喜欢的。你点这个开通的时候，他就说我们会进入到一个开通的页面。因为云计算嘛，你现在还要去选择，你是在哪个地方开通，他应该都在北京，反正都开开，同意，立即开通，创建了一大堆啊，回控制台去。这些我实际上都已经开开了，这个除了Embedding的没开，其他的我都把它打开了。这就是这一步。</p>



<p class="wp-block-paragraph">叫开通。开通了以后，要去创建我们的接入点。你就创建一个新接入点，先给它起个名字，比如说ABC。这个名字随便起，描述不描述其实没什么关系了。添加模型，你可以在这去接DeepSeek模型，DeepSeek-R1模型，用这个OK。它是允许你去反复创建的。为什么可以反复创建？因为走不同的预算。这个创建接入点的主要目的是为了控制预算的啊。确认接入，我等于又创建了一个叫ABC的接入点。最后用的时候，实际上主要用的是这个key，大家要注意。</p>



<p class="wp-block-paragraph">那么好了，我们现在有一个test1，一个test2。这个名字有点怪，改一下，编辑一下，我们叫做DS-V3。对，这个才稍微的好听一点。这个改成叫DS-R1，编辑这个叫DS-R1，保存。</p>



<p class="wp-block-paragraph">那么Cherry Studio这个设置就相对来说简单一些。它反正我们到网站上去把它下载下来，这个下载完了，就是个本地应用，打开用就好了。这个并没有那么复杂，要相对来说比其他的这种什么大模型、聊天工具都要简单的多。那么下载配置这个模型，我们在这里添加火山相关的模型就可以了。</p>



<p class="wp-block-paragraph">这个到目前为止，我们先去添加DeepSeek R1，DeepSeek-V3是Cherry Studio的这个页面。这个大家注意它的网址，这里<a href="https://cherry-ai.com/" target="_blank" rel="noreferrer noopener">https://cherry-ai.com</a>。到这个网址上去，当然你也可以搜索Cherry Studio，这个是没问题的。但为什么要告诉大家网址？因为有人仿冒他们家网站，有人去做假的网站去骗人，所以还是把这个网址写出来。那么下载就好了。他下载的时候，我们有这个网盘，百度网盘，夸克网盘，123网盘都可以下载。有Linux版，Mac版和这个Windows版也都是存在的。啊，这个就是我们的Cherry Studio啊。</p>



<p class="wp-block-paragraph">Cherry Studio正常的配置是什么样？进来大概长得就是这个样，你就可以去用它了。把这个页面清空。</p>



<p class="wp-block-paragraph">这就是我们的正常的Cherry Studio。在这里有一个齿轮，这个在最下面有一个齿轮的图标，点一下设置。设置的时候我们要去找，这就是各种各样的大模型的设置的地方。我们要去找这个火山，长得还是这个蓝色的山这个样子。在设置火山的时候，我们要的第一个是什么？我们的API key是什么？这个API Key上哪找？火山控制台，到方舟。对我们在这里创建，拷贝一个API Key就可以了。做好了之后，把这个key填进去。这个地址，一般我们用这个默认就可以了，在北京的这个地址就可以了。好，检查一下。</p>



<p class="wp-block-paragraph">先要添加模型，这个就要比较麻烦了。说这儿有一个，大家注意下，这儿有一个开关，把它打开，我就可以来使用这个模型了。那么我下一件事要添加第一个，大家注意模型的ID是模型的名称，是模型的分组名称。我们来，好我们的刚刚在在线推理这，好我们在这去设置。比如说我现在需要DeepSeek V3，先把这ID抄下来，复制。大家注意，需要抄这个东西的时候，一般计算机设计，他会在后边画两个小方块，这个就是复制的意思，点一下就复制成功了。这个复制好了以后，我们把它去贴出来。这里贴完了以后，他后边都给默认填上了啊，我们要自己去改。这个是V3，这个是DeepSeek V3，我们可以自己在这写这个名字，V3，这个叫DeepSeek。因为这个火山引擎里有很多的模型，有豆包自己加的，有DeepSeek的，还有kimi的，都有，所以它最好让你去加一个分组。这个我们要检查一下，好确定连接成功。再加，再添加，把这个R1的也抄下来，DeepSeek-R1。你不用抄我这个数，你拿了我这个数是没用的，自己去申请添加。好，这就有了以后，我们可以去试一下。他有一个默认的助手，选一下，因为我设的比较多，哪去了？这，刚才我们设的DeepSeek R1，我们来试一下，1+1为什么等于2，推理，推理，人就推理去了，大家已经看到了。</p>



<p class="wp-block-paragraph">他是在很努力地在思考这个问题。想明白了，零是自然数的。我天，我我，我也没想到1+1等于为什么等于2，会写出这么啰里八嗦的一堆东西出来。好吧，我们就推理模型已经成功了，我们的V3模型也是没问题的。你好啊，今天天气怎么样？这是V3模型。根据资料，这个是这个，大家注意啊，什么，这个是错的，为什么？因为他没有联网搜索，这个是完全给你瞎编的，这就叫一本正经的胡说八道了。这个同时什么山西五台山，这个都是扯淡的，我不用理他。好，我这个是，我们就可以把它清空了。好，下一件事，我们去做联网挂载。所谓联网什么意思？就是搜索，添加搜索功能。离开搜索以后，大模型只会干一件事，叫一本正经的胡说八道。那么火山引擎呢？这个地方有一个优势，他除了有模型之外，实际上还可以创建，这个叫聊天机器人应用。我们现在去创建一个聊天机器人应用。搜索这个事是要收钱的。你说我使谷歌搜索不收钱，使百度搜索不收钱，对人家还给你打广告，你等于看了广告，是靠看广告的，等于是让人挣着钱了，所以他不找你收钱。但是我们直接使用搜索都是要收钱的。那么我去充个5块钱，咱们就可以使用搜索了。好，下面我们要处理联网的问题了。我已经充了5块钱，你不充钱，好像是不让你使了。对，火山方舟引擎，点进来了，大家注意，这个点进来以后，他默认的是叫模型广场，看的是各家模型。模型广场下头还有一行字，大家注意看，最左侧叫应用广场，还有好多应用。我们现在使用这个DeepSeek联网搜索版，这个是我们要用的。点进来以后你就可以去搜索了，北京天气怎么样？走，他现在搜索去了，还思考北京天气怎么样，这个找到了，10个网页，如何如何的，干活去了。这个时间点，找到了，最后总结一下，北京的天气是如何如何的，这个就不再是一本正经的胡说八道了。啊，这个就是适时地去进行了搜索。好，我们要干嘛？复制，复制了，等于这个应用就从原来人家那个模板，变成了我们自己平台上的一个应用了。复制了以后。</p>



<p class="wp-block-paragraph">这有一个要联网搜索，你要点这个。现在我是一点就点开了，你们一般进来以后点是点不开。这个“on”联网内容插件，这个你点不开，为什么？他有一个地方需要授权，你要授权我去使用。所有的云计算平台都是这样的，只要涉及花钱了，他就要求你是授权。你授权的时候，他要跳转到允许他花钱的这个页面去，这个要注意。你充5块钱，充个几块钱，他就让你用1,000次搜索，是6块钱，我印象里是这样的。这个搜索10条，你说我一次要5条行不行？还是一次要10条？多搜几条都可以。下头还有一些东西，是可以进行一些设置的。</p>



<p class="wp-block-paragraph">好，这个搜索完了以后，知识库干嘛？你还可以再挂一些RAG的本地知识库进来，这个我们就不管他了。下面都是默认的，都不动他了。那么这里我们要去使用推理的接入点，这个我们使用DeepSeek R1，刚才我们创建好的DeepSeek R1的接入点。这个花钱的这部分是从他这花的，大家注意，跟云计算相关的，所有跟花钱有关的事情，都是需要单独去处理的。这好设好了再往后发布，发布出去了。大家注意这号，复制，这个地方是待会我们要去使用的这个号了。</p>



<p class="wp-block-paragraph">好，我们下一步干嘛？到这个Cherry Studio里边儿去，把它挂上去。我们不能在这儿使，大家注意这个地方是什么？这个地方是火山引擎云后台的一个设置的平台，这是一个后台网站，所以我们平时使用的时候不在这使。我们下一步创建好了以后，我们把搜索的这个应用，它实际上是个聊天机器人，是个BOT，我们再把这个BOT再重新挂载到Cherry Studio上去，我们就可以正式的在Cherry Studio上有一个完整的带着搜索的一个项目了，我就可以在这干活了。</p>



<p class="wp-block-paragraph">齿轮，大家注意，我们现在要新加的，不要在这个火山引擎里边去加，不要在这去加。你说我在这加一新模型行不行？不要，我们在这重新加一个新的，比如说模型提供商，我们就选Open AI就可以了，比如说我们管它叫豆包。</p>



<p class="wp-block-paragraph">bot，这个我们起了这样的一个名字。哎，这个名字怎么这么怪？编辑好API Key哪去找去？这个火山引擎的API Key，然后这个是什么呢？这个是地址，这个地址要填什么？这个地方呢，要稍微的注意一点。点了上面前面这一节，就是到V3这一节，都是火山引擎的。这个地址跟这个，我们前面去做火山方舟引擎是一样的。这ark是方舟嘛，ark.cn-beijing，然后是火山.com API V3，走到这儿都是一样的。然后后边儿这个叫bots，就是所有我们创建的应用，它这个地址后边儿会多这样一截儿。然后我们来添加，添加什么呢？这个刚才我们看了，就是我们去创建这个DeepSeek R1搜索的时候，他给了我们一个ID，刚才我们把它抄下来，比如说模型名叫DeepSeek-R1-Search，这个比如说是search。好，添加，测试一下，有点慢，连接成功了。好，那么连接成功了，我们就这个，到这。好，默认助手，我们就可以选了，DeepSeek R1 search，比如说天津未来几天的天气怎么样？为什么问天气？因为这东西必须实时搜索。有错误，模型不存在，或者是要求的路径错误。那我们来研究一下，这又出什么毛病了？这，刚才把这个斜线删了。好，你看搜索去了。好的，我去根据用户要求，去搜索天津的天气怎么样了。2月15号是15:08，去查了一下。综上所述，这都还是在思考部分，把思考的部分关掉，思考了22秒。这是今天的，明天的，后天的，每天都算一下。未来一周整体气温偏低，如何如何说。这个就是我们可以有了，满血版的DeepSeek R1加上搜索。还有一个比较方便的小工具，叫Cherry Studio，大家就可以去用下来了。但是注意，用的时候，这个DeepSeek本身是要付钱的，但是这个钱是一开始送了，我记得是刚才50万TOKEN，大概是这样。搜索一次应该是1,000次6块钱，一次应该是0.6分钱，大概是这样的一个价格。</p>



<p class="wp-block-paragraph">好，这就是我们今天的内容。稍微总结一下：首先，什么是满血版的DeepSeek啊？V3跟R1的671B，不要惦记去做什么本地部署，真不是一般人玩得动的。你说我这个公司很大，这个单位非常大，我一定要自己弄。呃，你先想一想你有没有机房，这个机房里头装个几百万的服务器，甚至你可能跟他配合的服务器加一块，没准上千万了。呃，值不值当？你说我真的值当，我一定要干这个事，哈，那也行，这个没有问题。</p>



<p class="wp-block-paragraph">选择平台，为什么选择火山方舟平台？因为速度快，第二个，配置起来在云计算里边算简单的。所有云计算平台配置这玩意都麻烦，在这个Cherry Studio上，让我们能够把它跑起来，再把我们的搜索配置进去。这就是我们今天讲的内容。</p>



<p class="wp-block-paragraph">感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>中国AI力量崛起：DeepSeek如何成为国运级创新的代表，搅动全球AI格局？</title>
		<link>https://lukefan.com/2025/02/11/%e4%b8%ad%e5%9b%bdai%e5%8a%9b%e9%87%8f%e5%b4%9b%e8%b5%b7%ef%bc%9adeepseek%e5%a6%82%e4%bd%95%e6%88%90%e4%b8%ba%e5%9b%bd%e8%bf%90%e7%ba%a7%e5%88%9b%e6%96%b0%e7%9a%84%e4%bb%a3%e8%a1%a8%ef%bc%8c%e6%90%85/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 11 Feb 2025 12:05:47 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[DeepSeek大模型]]></category>
		<category><![CDATA[2025美中脱钩法案]]></category>
		<category><![CDATA[360智能云]]></category>
		<category><![CDATA[AI与股市]]></category>
		<category><![CDATA[AI云服务]]></category>
		<category><![CDATA[AI产业链]]></category>
		<category><![CDATA[AI产业革命]]></category>
		<category><![CDATA[AI公司估值]]></category>
		<category><![CDATA[AI公司分析]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI国际化]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI开源技术]]></category>
		<category><![CDATA[AI开源模型]]></category>
		<category><![CDATA[AI技术划时代]]></category>
		<category><![CDATA[AI技术合作]]></category>
		<category><![CDATA[AI技术壁垒]]></category>
		<category><![CDATA[AI投资趋势]]></category>
		<category><![CDATA[AI推理芯片]]></category>
		<category><![CDATA[AI核心技术]]></category>
		<category><![CDATA[AI概念股]]></category>
		<category><![CDATA[AI模型免费]]></category>
		<category><![CDATA[AI模型统一]]></category>
		<category><![CDATA[AI生态统一]]></category>
		<category><![CDATA[AI股票涨停]]></category>
		<category><![CDATA[AI行业投资]]></category>
		<category><![CDATA[AI革命]]></category>
		<category><![CDATA[ASIC芯片]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek与英伟达]]></category>
		<category><![CDATA[DeepSeek国运创新]]></category>
		<category><![CDATA[DeepSeek影响力]]></category>
		<category><![CDATA[DeepSeek技术解析]]></category>
		<category><![CDATA[DeepSeek股票影响]]></category>
		<category><![CDATA[DeepSeek部署]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[Josh Holy]]></category>
		<category><![CDATA[LLaMA]]></category>
		<category><![CDATA[TPU]]></category>
		<category><![CDATA[东升西降]]></category>
		<category><![CDATA[中国AI]]></category>
		<category><![CDATA[中国AI崛起]]></category>
		<category><![CDATA[中国AI未来]]></category>
		<category><![CDATA[中国移动]]></category>
		<category><![CDATA[京东云]]></category>
		<category><![CDATA[人工智能禁令]]></category>
		<category><![CDATA[全球AI竞争]]></category>
		<category><![CDATA[全球AI部署]]></category>
		<category><![CDATA[六小虎]]></category>
		<category><![CDATA[华为盘古]]></category>
		<category><![CDATA[博通]]></category>
		<category><![CDATA[国运级创新]]></category>
		<category><![CDATA[国运级创新意义]]></category>
		<category><![CDATA[国际AI格局]]></category>
		<category><![CDATA[大模型微调]]></category>
		<category><![CDATA[字节豆包]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[概念股]]></category>
		<category><![CDATA[游戏科学]]></category>
		<category><![CDATA[火山引擎]]></category>
		<category><![CDATA[百度]]></category>
		<category><![CDATA[百度智能云]]></category>
		<category><![CDATA[硅基流动]]></category>
		<category><![CDATA[科技公司涨停]]></category>
		<category><![CDATA[美股蒸发]]></category>
		<category><![CDATA[腾讯]]></category>
		<category><![CDATA[腾讯浑元]]></category>
		<category><![CDATA[英伟达]]></category>
		<category><![CDATA[金山云]]></category>
		<category><![CDATA[阿里云]]></category>
		<category><![CDATA[阿里千问]]></category>
		<category><![CDATA[黑神话悟空]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1901</guid>

					<description><![CDATA[我宣布！DeepSeek绝对是国运级的创新！🔥

大家都知道，AI领域一直是全球科技竞争的焦点。最近，游戏科学的创始人冯骥提到，DeepSeek是一个国运级的创新。这个消息一出，直接让美股市值蒸发了一大笔钱，甚至有美国参议员提出严厉的法案来禁止DeepSeek！😱

**为什么DeepSeek这么牛？**
1. **统一思想**：以前各大公司和研究所各自为战，做着五花八门的大模型，现在大家都用DeepSeek，效果又好又省钱！💡
2. **划时代**：DeepSeek的出现，直接让大家都从模型逐鹿中原进化到模型统一，一起搞应用就完事了！🚀

**DeepSeek的使用方式**
如果你在美国，千万别去DeepSeek网站挂，根本得不到服务！最好是在美国的云主机上使用。国内的话，阿里云、腾讯云、华为云等都有部署，火山引擎现在还是限时免费，赶紧去试试！💻

**DeepSeek概念股涨停板揭秘**
- 金山云、美图、腾讯、阿里、百度等都在涨，阅文集团更是直接涨停板！📈
- 这些公司虽然跟DeepSeek关系不大，但大家都觉得有了开源大模型，云计算一定会涨！

**结论**
DeepSeek绝对是划时代的创新，就像当年的瓦特改良蒸汽机一样！从国际上看，唯一有可能跟DeepSeek媲美的就是Llama 4了。希望杨立昆和扎克伯格再努力努力，看看能不能站住这个里程碑！🌟

家人们，赶紧关注DeepSeek，搞钱机会来了！💰

#DeepSeek #国运级创新 #AI #美股暴跌 #中国股票暴涨 #搞钱必看

中国AI力量崛起：DeepSeek如何成为国运级创新的代表，搅动全球AI格局？

DeepSeek，一个被称为“国运级创新”的中国AI开源大模型，正在深刻改变全球AI产业格局。文章提到，美国共和党参议员因DeepSeek威胁而提出极端禁令，虽然未通过，但足以反映DeepSeek的国际影响力。它统一了国内AI模型生态，推动了A股与港股的相关概念股暴涨，包括金山云、腾讯、百度等科技企业，甚至中国移动、火山引擎等云服务商也纷纷部署。同时，其国际影响力也搅动了美股市场和其他国家的科技自信。而从全球产业视野来看，DeepSeek被认为是推动AI革命的“瓦特改良时刻”，直接威胁英伟达、Llama等国际巨头的位置。随着国内外技术和资本对DeepSeek的广泛部署，它可能成为中国AI发展的重要里程碑，真正实现“东升西降”的产业愿景。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="中国AI力量崛起：DeepSeek如何成为国运级创新的代表，搅动全球AI格局？" width="900" height="506" src="https://www.youtube.com/embed/Cf6jqlqhV_k?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">第二个故事：DeepSeek到底是不是国运级的创新呢？国运级创新这个事呢，是游戏科学的创始人兼CEO冯骥他去讲的。DeepSeek是一个国运级的创新。游戏科学，就是黑神话悟空的这个开发商。DeepSeek呢，也确实让美股市值蒸发了很多很多钱。而且还有一位美国的参议员说：“我们要下最严格的法令来禁止DeepSeek。谁敢下载DeepSeek判20年，哪个企业敢去用DeepSeek罚1亿美金。”</p>



<p class="wp-block-paragraph">这个是个共和党参议员叫Josh Holy，写了一个法案，叫2025年美国人工智能能力与中国脱钩法案。禁止技术交流与使用，禁止美国公民、企业与中国开展任何AI技术合作，包括研发、投资、数据共享等。非美国公民若涉及技术转移，可以驱逐出境。然后切断资本与人才流动，禁止美国资本对中国AI企业投资，并限制美籍科研人员参与中国AI项目。任何与中国高效实验室合作的美国机构将面临重罚。违反本法案的个人将被视为严重犯罪分子，可能影响其移民身份、绿卡申请和入籍资格。美国公司不能直接或间接向中国企业提供AI技术支持或者服务。但是这个法案呢，因为太过极端已经被搁置了。</p>



<p class="wp-block-paragraph">先讲一下使用DeepSeek的方式到底是什么样的。如果你在美国使用DeepSeek，那千万千万不要去DeepSeek网去挂，那是根本得不到服务的。最好是什么呢？就是去在美国的云主机上去使用。现在DeepSeek自己的网站基本上是半瘫痪状态，聊两句就趴菜。我基本上是第一句能聊，第二句能聊，第三句你再怎么跟他聊都趴。他是这样的一个状态。你可能明天再跟他聊，还可以聊两句。API调用的话非常非常慢。而且呢，现在禁止充值了。整个春节期间，API调用的这个页面就打不开了，把整个API后台给你封掉了。现在的话是后台重新有了，但是不允许充值。现在呢，国内是各种云上都有，国内的是阿里云、腾讯云、华为云。华为云的DeepSeek呢。</p>



<span id="more-1901"></span>



<p class="wp-block-paragraph">通过硅基流动可以使用起来，京东云也整起来了。上面也有DeepSeek、百度智能云。我就不知道，李彦宏怎么会有脸干这个事，前面还发表演说，说开源不如闭源，你们就好好使用闭源就好了。人家DeepSeek来了以后，百度也部署了DeepSeek，也给大家去使用，还要收费。然后，火山引擎，火山引擎是字节跳动的，现在是我的主力服务商了，速度还可以，而且现在限时免费，就是你现在上去使用它的DeepSeek，这些模型是不要钱的。它设置起来相对麻烦一点，就是所有这种云计算厂商，你去设置大模型都比较麻烦，但是比BAT还是要简单。</p>



<p class="wp-block-paragraph">然后，中国移动、中国联通、中国电信，他们参加的云也都有DeepSeek的部署，也都可以上去用去。360智能云上头也有DeepSeek。海外的话，亚马逊AWS、微软Azure，还有一个叫GMI、Claude、together、grok，但是grok上面部署的是蒸馏模型，它就没有布这个满血模型，together上是有满血模型的。英伟达上面也是有满血模型可以去用的。所以如果你在海外说我想去用这个东西怎么办，你就要去这些平台上去使用了。</p>



<p class="wp-block-paragraph">DeepSeek的这些概念股，我们一说这个东西，国运之战嘛，他一定是有一些概念股的。首先从港股来看，金山云直接涨停板，我去问我说金山云跟这玩意到底有啥关系，没有任何关系。DeepSeek到现在为止，都没有部署到金山云上去。但是呢，大家觉得，这个云计算一旦有了这种通用的可用的开源大模型以后，一定会涨，所以金山云在港股上就直接涨停板了。美图也涨停了，美图其实跟DeepSeek可以也没什么关系，但是他做AI的嘛。腾讯、阿里、百度都在涨。阅文集团，也就是起点中文，做小说类网站，直接涨停板，为什么？因为推出了使用DeepSeek的作者助手以后，作者可以使用DeepSeek来去写小说，可以进行各种的架构设定，各种的环节设定，效果很好的。</p>



<p class="wp-block-paragraph">我试了一次用DeepSeek R1这种大推理模型去做各种设定的配置，效果非常好，导致其他科技股也跟着上涨，包括地平线、中国软件国际、微盟、联想和中兴国际。</p>



<p class="wp-block-paragraph">在A股市场上，第一个上涨的是每日互动。每日互动之所以上涨，是因为它有一个联合创始人叫徐进，这个人曾是九章资本（即换方量化）的股东。然而，他现在应该已经从每日互动离职了，与公司完全没有任何关系，只是蹭了这样一个共同的联合创始人的名头。每日互动表示，未来准备使用DeepSeek的大模型进行一些应用，但目前没有任何直接的关系。</p>



<p class="wp-block-paragraph">第二个DeepSeek概念股是安凯威。这家公司主要生产录音笔。虽然做录音笔与DeepSeek看似没有直接关系，但录音笔录制的内容需要处理，而安凯威的后台使用的是DeepSeek大模型进行处理，因此安凯威也作为DeepSeek的概念股涨停了。</p>



<p class="wp-block-paragraph">青云科技和Ucloud也涨停了，因为它们都是专门为企业部署私有云的服务商，它们都部署了DeepSeek，并开始为这些企业提供服务。</p>



<p class="wp-block-paragraph">还有一个公司叫宝兰德，这家公司是由以前Borland的一帮老同事创业成立的，创始人都是我在Borland的同事。他们在国内起名叫宝兰德，主要从事系统集成项目，底层集成的是DeepSeek大模型，因此也涨停了。</p>



<p class="wp-block-paragraph">比亚迪这两天也涨停了，但它们与DeepSeek的关系应该没有那么大。比亚迪现在称要发布“天神之眼”，原来讲比亚迪自己准备做大模型，大家不信，但有了DeepSeek以后，大家说比亚迪没准也能做出来，于是开始相信。</p>



<p class="wp-block-paragraph">万兴科技、360和昆仑万维也都擦边跟涨，特别是360，大概连着涨了两个涨停板。但360这事有些乌龙，它确实部署了DeepSeek，但需要在360纳米AI搜索里边使用。</p>



<p class="wp-block-paragraph">他是不开放出来给别人用的。周鸿祎这一段时间不停地在喊话凑热闹，上来说：“我要给DeepSeek保驾护航。有黑客去攻击DeepSeek了，我要去提供免费的支持服务，我有什么专线，我怎么去做这个事情。”喊得特别特别热闹。喊完了以后，两个涨停板之后，他是需要出来解释的。360出来发了个公告，说与DeepSeek后边的深度求索公司之间，没有任何业务往来和合作。这个整完了以后，大家就觉得说：“你喊了半天到底在干嘛？”所以我在前面想，攻击DeepSeek的这些美国IP，后边有可能是360吧？但是这个咱们只是说猜测，没有任何事实依据。反正他喊得非常非常欢。</p>



<p class="wp-block-paragraph">那么，到底什么是国运级的创新呢？让美国暴跌，让中国股票暴涨。而且刚才我们讲的这些，好多都是连着出涨停板的这种股票。这是不是就是国运级的创新了呢？我觉得已经有一些这样的苗头了。第一个就是DeepSeek干了一个很重要的事情，叫统一思想。原来有一大堆的公司、研究所，都在那儿做大模型，像刚才我们讲的中国移动、中国联通、中国电信，三大运营商自己都惦记做自己的大模型。实际上就是一帮人拿着什么Llama呀，拿着这些东西再给他调来调去的。现在别费劲了，我们已经不用再去追究你是不是浪费钱了，是不是把钱揣自己口袋里了。现在有DeepSeek，大家一起使呗。原来那个东西做的没有DeepSeek好，这个也没有什么可值得怪罪的地方。这个钱就相当于打水漂就没了，我们就通通都去使用DeepSeek就完事了。因为谁用DeepSeek谁涨停板，就这么简单的一个问题。那干脆赶快都去用吧。</p>



<p class="wp-block-paragraph">第二个就是什么？他划时代了。国运级的创新一定是要划时代的。原来是各自为战，大家都在做自己的模型，都在互相比较互相踩，说我这个做的比他哪哪好，他那个呢怎么怎么不行。现在没有了，大家都是DeepSeek。我们原来那个还差一点，不丢人，都变成这样了。那么现在的话，底层用DeepSeek可没毛病。</p>



<p class="wp-block-paragraph">包括像百度李彦宏这样的人，他都把DeepSeek部署上去了。而且我原来也碰到过华为的人，就是他们的盘古大模型，其实他们也不怎么使。他们在内部其实早早就是DeepSeek。所有大厂都装了。从模型逐鹿中原，进化到模型统一了，底层统一了，一起搞应用就完事了。这个事情，我们现在已经把这步迈过去了。那么他也搅动了国际局势，说东升西降这个扯淡了，这个咱们就开个玩笑。美国股市肯定是被搞得动荡不安了一下，而这几天在慢慢的修复吧。A股跟港股呢，正好赶上春节这几天休市，就是最恐慌那段时间，咱们都休息了。而等开市呢，情绪稳定了，咱们就一起跟着涨就完事了。</p>



<p class="wp-block-paragraph">那么，DeepSeek之后的这个格局，会是什么样的呢？第一个，国内的六小虎都危险，没有哪一个不危险。大家注意，六小虎里头不包括DeepSeek，因为他原来比较低调，排六小虎的时候没给他排进去。原来你有自己的模型，它算是一个竞争上的加分项。原来你有独立模型，还有一个很高的估值，因为我需要很多的钱去做预训练嘛。现在都不用了，大家都是DeepSeek了。你为什么要有这么高的估值？就有这样的问题。</p>



<p class="wp-block-paragraph">以DeepSeek V3作为基座模型，用DeepSeek R1直接蒸馏微调迁问，肯定要比他们自己的模型还好使。原来那些必源模型还扭扭捏捏的出来说：“你想私有化部署吗？我再收你点私有化部署的钱吧。”现在DeepSeek直接开源免费了，那你还好意思找人收钱吗？大厂呢，可能还会坚持，但这些小厂就六小虎肯定都完蛋了。</p>



<p class="wp-block-paragraph">现在各大厂有些呢，还会投进去，比如说千问，就是阿里的千问，其实还是很有价值的。另外一个就是字节的豆包，还会继续往前走。但是腾讯的浑元是不是接着做，这个要看了。华为的盘古大模型估计也可以休息了。至于百度的文新一言，从开始那天就是个笑话，一直笑到最后。</p>



<p class="wp-block-paragraph">国际上呢，现在各国实际上都在开始进行DeepSeek部署，全都在干这事。英国说我又行了，印度说我也行了。</p>



<p class="wp-block-paragraph">他们都说我有DeepSeek，我就可以自主创新了。别人一开源，我就自主创新，自主知识产权。这事不光是咱们中国人干，全世界人都是这么看的。有了DeepSeek加持的中国，软件厂商也可以去大杀四方了。因为有了基础模型以后，再往后的事情就是卷了。那卷这个事，他们还是卷不过咱们的。</p>



<p class="wp-block-paragraph">很多AI agent的公司，都可以自己训练自己的大模型了。比如说Perplexity，比如说Cursor，或者是其他的一些AI agent的公司，现在都可以去搞这件事情。而且他们都是底层，直接挂DeepSeek。很多的AI agent的公司有自己模型了以后，他们就可以去买英伟达的显卡，他就可以去部署自己的云服务了。当大家都开始部署自己大模型的时候，就要去买英伟达。</p>



<p class="wp-block-paragraph">那你说为什么不去买博通？为什么不去买阿斯克芯片？咱们这稍微的岔开一点点。咱们平时看到的芯片基本上是三个：塞斯克芯片叫CISC，瑞斯克叫RISC，阿斯克呢就是ASIC，这是三个不同的词。博通中间有一段时间涨得很猛，就是因为它做的阿斯克芯片，做推理效果巨好。</p>



<p class="wp-block-paragraph">什么是ASIC芯片呢？CISC芯片是叫做丰富指令级芯片，就是它的指令非常长，而且指令很多。RISC芯片的话，咱们最常见的RISC芯片就是ARM芯片，手机芯片都是RISC芯片，它叫短指令级芯片，而且它指令很少。而这个ASIC芯片呢，它其实不是固定意义上的这种有IP的芯片，它是什么呢？叫专用集成电路。这个东西有一个特殊的名字，它不是处理器，它叫专用集成电路。谷歌的TPU就属于是ASIC，Grok做的那个叫LPU语言处理模块，它们呢也是ASIC。</p>



<p class="wp-block-paragraph">博通为什么要涨那么猛？博通涨得猛的原因就是，谷歌也好，亚马逊也好，自己去做这个专业推理芯片的时候，都是博通代为设计，台积电代为生产，大家都是这么来的。所以博通就涨吧。如果大家都集中在一起，就是说我们都是使用亚马逊云、谷歌云、微软云。</p>



<p class="wp-block-paragraph">他们是有动力去使用ASIC芯片。我专门自己去设计一个新的芯片，然后装在自己的服务器上去。这样的话，我统一来维护。他们有这个动力。但是一旦分散了，你这个部署的是DeepSeek，它部署的Llama，那个部署的是这个微调以后的模型。大家都分散了以后，那就只能用英伟达，就没法使用这个ASIC。这个就非常非常麻烦。为什么？因为ASIC芯片你一旦做出来以后，你需要重新去做适配，重新去做很多兼容性方面的调试。而且做完了以后，你还有很大的可能性不稳定，挂上去以后会出问题。为了最大的稳定性，为了最大的兼容性，就通通都是英伟达。所以为什么说这一步出来以后，英伟达巨大利好。这就是对于国际上的一些影响吧。</p>



<p class="wp-block-paragraph">那么结论是什么呢？这个DeepSeek到底是一个什么样的创新呢？还记得瓦特发明蒸汽机的故事吗？其实瓦特并没有发明蒸汽机。瓦特干的事情是什么？叫改良蒸汽机。它提升了效率。原来比如说我需要烧4吨煤能干的活，我现在烧一吨煤就干出来了。然后增强了动力。原来这个蒸汽机是上下动的，现在它可以进行转动了。这个动力变得很强，而且稳定运行广泛应用。就是瓦特以后，蒸汽机可以广泛应用。瓦特改良蒸汽机，被视为工业革命的重要里程碑。</p>



<p class="wp-block-paragraph">那么转过来看，DeepSeek能不能成为像瓦特改良蒸汽机这样的一个重要里程碑呢？至少在中国，DeepSeek肯定是瓦特这样的里程碑了。因为甭管是OpenAI、Gemini还是Claude，它不给你使，那你只能是使用DeepSeek。从国际上看的话，还有机会是谁呢？就是Llama 4。如果今年Llama 4出来，有一个革命性的飞跃，在DeepSeek基础上还能再飞跃一次，那可能Llama 4会成为瓦特发明蒸汽机，或者瓦特改进蒸汽机上的那个里程碑。如果Llama 4出来了以后，跟DeepSeek差不多，那么对于全世界来说，DeepSeek就是整AI革命的这个里程碑了。</p>



<p class="wp-block-paragraph">就像当年的瓦特改进蒸汽机那样，闭源模型是没有办法参与这种竞争的，这个肯定就不用想了。微软、谷歌他们其实也有开源模型，但都是小模型。微软的模型叫Phi，谷歌的模型叫GEMMA。这两个模型都是小模型，就是在客户手机、PC上使用的，他们是没有这种开源大模型。XAI呢，号称是开源，但是呢，那就是个假开源。到现在Grok 2没出来，开源版本没放出来。而且开源出来以后，他什么也不讲，你上去提任何问题，他不理你，那就是个假开源。</p>



<p class="wp-block-paragraph">所以，现在唯一有可能能够站住这个里程碑位置的人，除了DeepSeek之外，剩下就是Llama。咱们希望杨立昆也好，扎克伯格也好，再努力努力，多砸一些钱进去，让大家可以看看美国人能不能站住这个里程碑。好，这就是我们今天讲的第二个故事：DeepSeek到底是不是国运级的创新？从我的角度上来说，从中国角度上来说，它应该算是一个国运级的创新了。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek现象引发中文圈狂热：开源的胜利还是遥遥领先的争议?</title>
		<link>https://lukefan.com/2025/01/28/deepseek%e7%8e%b0%e8%b1%a1%e5%bc%95%e5%8f%91%e4%b8%ad%e6%96%87%e5%9c%88%e7%8b%82%e7%83%ad%ef%bc%9a%e5%bc%80%e6%ba%90%e7%9a%84%e8%83%9c%e5%88%a9%e8%bf%98%e6%98%af%e9%81%a5%e9%81%a5%e9%a2%86%e5%85%88/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Tue, 28 Jan 2025 00:36:14 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[DeepSeek大模型]]></category>
		<category><![CDATA[AI Agent公司]]></category>
		<category><![CDATA[AI Agent生态]]></category>
		<category><![CDATA[AIGC领域]]></category>
		<category><![CDATA[AI云计算]]></category>
		<category><![CDATA[AI产业标准]]></category>
		<category><![CDATA[AI协作方式]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[AI开源项目]]></category>
		<category><![CDATA[AI推理能力]]></category>
		<category><![CDATA[AI数据偏见]]></category>
		<category><![CDATA[AI显卡优化]]></category>
		<category><![CDATA[AI显卡禁令]]></category>
		<category><![CDATA[AI研发成本]]></category>
		<category><![CDATA[AI蒸馏微调]]></category>
		<category><![CDATA[AI闭源模型]]></category>
		<category><![CDATA[AMD MI 300]]></category>
		<category><![CDATA[AMD显卡兼容]]></category>
		<category><![CDATA[Anthropic压力]]></category>
		<category><![CDATA[Claude模型]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[DeepSeek代码]]></category>
		<category><![CDATA[DeepSeek原创性]]></category>
		<category><![CDATA[DeepSeek影响]]></category>
		<category><![CDATA[DeepSeek成果]]></category>
		<category><![CDATA[DeepSeek数据来源]]></category>
		<category><![CDATA[DeepSeek美国市场]]></category>
		<category><![CDATA[DeepSeek英文论文]]></category>
		<category><![CDATA[Deepseek训练成本]]></category>
		<category><![CDATA[DeepSeek论文]]></category>
		<category><![CDATA[Huggingface]]></category>
		<category><![CDATA[Kimi 1.5]]></category>
		<category><![CDATA[Meta AI发展计划]]></category>
		<category><![CDATA[Meta震惊]]></category>
		<category><![CDATA[Minimax 01]]></category>
		<category><![CDATA[OpenAI竞争]]></category>
		<category><![CDATA[Oracle云计算]]></category>
		<category><![CDATA[PyTorch开源工具]]></category>
		<category><![CDATA[中文社交媒体]]></category>
		<category><![CDATA[中美AI竞争]]></category>
		<category><![CDATA[中美科技博弈]]></category>
		<category><![CDATA[亚马逊AI]]></category>
		<category><![CDATA[人工智能创新]]></category>
		<category><![CDATA[华为AI标准]]></category>
		<category><![CDATA[大模型训练路径]]></category>
		<category><![CDATA[字节跳动AI]]></category>
		<category><![CDATA[开源模式]]></category>
		<category><![CDATA[开源胜利]]></category>
		<category><![CDATA[微软AI]]></category>
		<category><![CDATA[英伟达显卡]]></category>
		<category><![CDATA[谷歌AI]]></category>
		<category><![CDATA[谷歌AI研究]]></category>
		<category><![CDATA[豆包1.5]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[闭源与开源]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1877</guid>

					<description><![CDATA[DeepSeek突然出圈，引发了中文圈的争吵。大家好，欢迎收听老范讲故事的YouTube频道。 DeepSee ... <a title="DeepSeek现象引发中文圈狂热：开源的胜利还是遥遥领先的争议?" class="read-more" href="https://lukefan.com/2025/01/28/deepseek%e7%8e%b0%e8%b1%a1%e5%bc%95%e5%8f%91%e4%b8%ad%e6%96%87%e5%9c%88%e7%8b%82%e7%83%ad%ef%bc%9a%e5%bc%80%e6%ba%90%e7%9a%84%e8%83%9c%e5%88%a9%e8%bf%98%e6%98%af%e9%81%a5%e9%81%a5%e9%a2%86%e5%85%88/" aria-label="阅读 DeepSeek现象引发中文圈狂热：开源的胜利还是遥遥领先的争议?">阅读更多</a>]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="DeepSeek现象引发中文圈狂热：开源的胜利还是遥遥领先的争议?" width="900" height="506" src="https://www.youtube.com/embed/MSJuK3Q8TeE?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">DeepSeek突然出圈，引发了中文圈的争吵。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">DeepSeek在前面，我们已经出了一期视频，去讲它到底是怎么回事了。那么，DeepSeek最近肯定是更加的出圈。首先，DeepSeek V3，据说训练成本只有557万美金，震惊了扎克伯格，震惊了Meta。Meta说：“我们有好多的老大，他们的年薪都超过557万美金了。人家训练了个模型才用了557万美金，那我花了这么多钱去组建AI团队，花了这么多钱去囤显卡，是不是亏了？”现在就有这样的声音出来。</p>



<p class="wp-block-paragraph">而且，最新的DeepSeek R1，也就是它的推理模型，推理能力已经接近o1了。蒸馏微调出来的这些小模型，已经在很多领域里头超越了o1 Mini。在这儿多补充一句，什么叫蒸馏微调的小模型？像我的电脑上，也是跑了一个DeepSeek R1-32B的模型。这个模型是怎么来的？它实际上是由DeepSeek R1去输出数据，然后拿输出的数据再去调通义千问2.5-32B的这个模型，最后得到的结果。这就是DeepSeek R1-32B，他在我的电脑上做各种推理，效果相当不错。</p>



<span id="more-1877"></span>



<p class="wp-block-paragraph">那么，据说受到DeepSeek R1的影响，山姆奥特曼已经做出了改变。原来，它的o3模型，包括o3 mini模型，免费用户是用不了的。就是o3 mini，可能能够给plus用户稍微用一用。现在他说：“不，这个o3 mini模型，我们要直接向免费用户开放。”而plus用户，也就像我这样的，每个月只要20美金的用户，每天可以用到上百次。其实这种o系列的模型，甭管是o1也好，o3也好，你一天真的想不出100个问题来，问他100次足够用了。</p>



<p class="wp-block-paragraph">至于说完整的o3模型，以后是不是依然要在200美金一个月，甚至是更贵的这个版本里面才可以去用到，他现在应该正在抓耳挠腮地想这个问题。美国的媒体也做了一些报道。</p>



<p class="wp-block-paragraph">而且，这些媒体肯定是看热闹不嫌事大的，就去说：“你看，我们封禁了半天，人家做出这样的一个东西来，震惊我们了。”这些话好多是他们讲出来的，各路大佬也都出来说话了。比如说，谷歌的前CEO原来就讲过：“我们遥遥领先，在这块比中国领先好多年，他们不可能追上。”再问他：“你说我们还是领先吗？”当时我觉得我们还领先一到两年，但是他们正在快速的追赶。</p>



<p class="wp-block-paragraph">像这个杨立昆，Meta他们家AI领袖人物，他也上来说：“这个是开源的胜利。”都在去讲这个事情，包括很多在美国相对比较有影响力的这些AI圈的创始人，现在也都在纷纷接受采访，再去谈论DeepSeek的事情。所以，这确确实实是出圈了。</p>



<p class="wp-block-paragraph">那你说，这样出圈的一个事，怎么在中文圈，或者叫中文社交媒体圈里头，大家就吵起来了？这个原因也很简单，因为中文的，特别是简体中文的社交媒体圈，一直都是非常割裂的。一群的二极管在里边去吵来吵去的。什么叫二极管？只有一边是通的，另外一边是不通的。</p>



<p class="wp-block-paragraph">那么正面的声音是什么？第一个，厉害了我的国。你看，我们好厉害，你封禁了我半天，我小米加步枪也能够打赢胜仗。原来就是说，美国人有飞机大炮，日本人有坦克、飞机、大炮，但是我们小米加步枪，我就把仗打赢了。这个是我们一直津津乐道的一个事情。第二个，就是大量的震惊体。这个就是“谁谁震惊了，谁谁大吃一惊。”这个我们也使用了大量的震惊体来去描述境外势力看到DeepSeek以后的那种反应。</p>



<p class="wp-block-paragraph">还有什么上来说，这个超英赶美那套东西，英伟达完了，Meta完了，OpenAI完了，他们都完了，以后AI这个圈子就全都是中国人的事了。这样也还有人在想，说美帝的封锁就是个笑话，封了半天，最后做出最好的东西的人还是在我们中国。这是正方的观点，或者我们叫粉红观点。</p>



<p class="wp-block-paragraph">当然，还有反面观点，永远在讲说中国人还是不会从0到1的。DeepSeek其实是有更多的显卡的，并不是像他们说的只有1万张显卡，而是有5万张H100，也就是美国封禁的这种显卡。</p>



<p class="wp-block-paragraph">这个也有人在去讲，还有些人说什么，说DeepSeek，这帮人就是一个小聪明，没有大智慧，都是在投机取巧而已。当然，也有些人上来说，这根本不是什么民营公司，后边一定是国家的一盘大企业，这都后边收归国有了，不用讲这事，这个都属于是知黑们，或者反贼们的一些惯常的话术。</p>



<p class="wp-block-paragraph">继续来了，当然还有一些人再去讲，说这个数据是不是从其他大模型里头出来的，因为中国很多的大模型，训练数据都是从OpenAI来的。所以你每次问他说你是哪个大模型，上来都是说我是OpenAI家的ChatGPT，这个大家都会去做的。我记得DeepSeek V3当时好像也干过这样的丢人事，甚至还有人去怀疑，说DeepSeek这个数据是不是有侵犯版权，是不是有些其他的问题也都在询问。</p>



<p class="wp-block-paragraph">甚至还有一些人上来说，美国是不是应该把这个封锁，搞得再严格一下，让他彻底做不出来不就完事了吗？这个没有办法，这些人他就是恨国党，只要是中国人做的稍微好一点点，他们就完全看不下去那个状态。这就是正反两面，现在正在中文的社交媒体圈里头撕来撕去。</p>



<p class="wp-block-paragraph">当然还有一些困扰的声音，既不是正面也不是反面，或者说稍微偏正面一点的声音，他们说什么，这么好的东西干嘛开源给外国人看，咱自己留着偷偷藏起来，这个可能也是一部分粉红会有这样的声音吧。那么到底谁对谁错呢？我觉得我们没有必要去讨论谁对谁错的事情。</p>



<p class="wp-block-paragraph">DeepSeek到底是不是遥遥领先，这件事其实是一个伪命题。我们一旦想出来遥遥领先了，这个其实是有问题的，因为遥遥领先这件事了，说我们不讲道理了，我就在你前面，你也不可能超过我。你只要超过我，他等于政治就不正确了，这个玩意才叫遥遥领先。</p>



<p class="wp-block-paragraph">我们在某些领域里头得出了一些领先的结果，其他领域还在追赶。我们领先的这些领域里头，别人也在追赶，然后你追我赶的，把整个的AIGC事业往前推荐，这个才是真正大家应该去思考的问题。所以在所有的这些大佬的讲话里边，真正有价值的是谁讲的。</p>



<p class="wp-block-paragraph">就是杨立昆，这个Meta的AI首席科学家，他讲的是什么？他说这根本就不是中美两国谁胜谁负的问题，这跟这事没关系。他讲的是什么？这是开源战胜了闭源，这是开源的胜利。这个是为整个DeepSeek事件定性的最好的一句话，请大家记住，这里头跟中国和美国没有什么特别大的关系。这些人在美国也能做出同样的东西来，也许他们的方向不一样，会做的跟现在的结果有差异，但也依然是可以做出震惊世界的东西出来的。而真正胜利的是开源，开源是一种最新的、最先进的软件开发的协作方式，是这样的一种协作方式战胜了原来这种闭源的传统方式。</p>



<p class="wp-block-paragraph">那么这个项目到底是不是原创呢？DeepSeek你们是从0到1原创的，还是说在人家的基础上耍了个小聪明，没有真实的原创性创新？这个有很多人就上来说，中国人就不可能有原创性创新，我觉得这样讲是很不负责任的。第一个，在没有GPT-2，没有Llama，整个这些开源的大模型的情况下，就不会有中国的大模型产业，整个产业都不会存在，这个大家还是要去承认的。</p>



<p class="wp-block-paragraph">我觉得与其去讨论是不是原创，我们更应该想的是什么，如何加入到创新大潮中去贡献力量，这才是真正应该想的。每一个创新都是可贵的，我只要是遇到问题，把问题解决掉了，它就是创新。至于说这个创新到底有多大价值，是不是可以积少成多、聚沙成塔，变成了一个很伟大的工程项目，我觉得我们只要慢慢地去堆砌，慢慢地去积累，总会有这样的一个量变，实现质变的时间点。</p>



<p class="wp-block-paragraph">就算是美国人用的很多的，这些现在我们看到的很新的技术，其实也是有很多过去几十年，甚至上百年研究出来的。这些基础都是在上面逐渐地去改进，逐渐地去解决问题，逐渐积累起来的。我们不要老去上来就说，这个事你耍了个小聪明，那个事你搞了一个从1到100，没有从0到1，别想这个事，没有那么重要。那么DeepSeek是不是确实触动了美国大模型的产业圈呢？从DeepSeek开放出来的论文和原代码，大家都在努力地下载。</p>



<p class="wp-block-paragraph">去尝试，去复现，去部署，去使用这块来看，确实是这样。这个DeepSeek确实触动了美国整个的大模型产业圈。而且DeepSeek的方法将会深刻地影响美国项目未来的方向，或者说将会深刻影响全世界AI项目未来的方向。那么是不是应该收紧制裁呢？</p>



<p class="wp-block-paragraph">如果前面没有制裁，没有这么多拜登说我要去怎么制裁，哪个学生不能来，什么国防七子怎么回事，没有搞这些事，DeepSeek团队中的可能一大部分人现在应该都在美国。这就是制裁的结果。如果没有前面的显卡禁令，那么国内可能会更早地贡献出来比DeepSeek更加有趣的模型。这就是制裁的结果。</p>



<p class="wp-block-paragraph">千万不要想着可以靠制裁去得到什么样的后果，唯一的后果就是本来应该在美国的很多创新的人才，他们留在了中国，在中国做出了DeepSeek。本来让全世界、全人类可以在大模型的方向上跑得更快的很多的发明创造，因为限制没有做出来，这就是制裁的后果。</p>



<p class="wp-block-paragraph">那么“厉害了我的国”这件事到底对不对，其实完全没有必要。咱们举个例子，相当于什么？四个人在这打麻将，咱们四个劈了啪啦，打麻将打得很开心，打了一晚上了也得胡个多少圈牌了。突然有一个人开了个杠出来，开完杠出来以后，他身后有一堆的亲友团，直接就爆发了：“你好厉害，你居然开杠了！”导致这个麻将没法打下去了，这到此结束了。这个其实是没有必要的，开杠就开杠呗，这一圈你要领先了一次，那咱后边还打不打了？</p>



<p class="wp-block-paragraph">整个的大模型产业创新，实际上就像是大家在这打麻将。你不能说你取得了任何成绩，大家停下来等我先庆祝个两年，咱们再接着往下打，这没有任何意义。麻将还要接着打下去，这才是真正看待“厉害了我的国”的方法。</p>



<p class="wp-block-paragraph">你像中国人，当然有的时候会有一些怪癖。你比如说，国人看到了一个会讲中文的老外，哇，那叫激动：“你的中文讲得实在太好了！”觉得特别有面子。但是如果老外看到了一个会讲英文的中国人，完全没有反应：“讲英文呗。”这些讲英文的人，有黑人，有白人。</p>



<p class="wp-block-paragraph">有华人，有各种面孔的人，还有印度人。有的讲得好，有的讲得不好，都没有任何问题。就算讲得再字正腔圆，他也没觉得这事有多稀奇。但是你像中国人，你要看到一个老外讲中文讲得再荒腔走板，你都要冲上去，哎呀，你实在讲得太好了，我觉得太有面子了。这个算是中国人的一个民族性。</p>



<p class="wp-block-paragraph">对于被DeepSeek所震惊的这些美国人来说，他们真正看到的是什么？他们真正看到的是，有人做出了新的科技创新，仅此而已。而且还发表的是英文论文，内容放在Huggingface上没有什么障碍，大家就可以直接用了。你并没有说我把这东西写成中文论文，只放在国内的，比如说某一个开源平台上。你要想用，我还要爬进来去使用，还要找人去看这些中文文件，没有。你上来，你也是发表的英文论文，大家全世界的人都是这么干的呀。你法国的这个团队，你去发表论文，你也是发表英文的；以色列团队，你去发表论文，你也是发表英文的；中国团队，你也发表了英文论文；美国团队也是发表英文论文。这有什么差异吗？没有什么差异，大家一起推着这个事情往前走就好了。而且他们自己的团队里边也有一大堆的亚洲脸，这事不是很正常吗？你们在瞎激动什么呀？</p>



<p class="wp-block-paragraph">这个就是“厉害了，我的国”。这个事其实是不可取的。再往后咱们来讲一讲，哪个老外要完蛋了没有？咱们前头不是想Meta是不是要完蛋了，英伟达是不是要完蛋了，OpenAI是不是要完蛋了？咱们看一看，首先对于Meta来说，有些事情是有些过分了，比如说557万美金完成的训练，这个里头是仅仅计算了用了这么多显卡，应该是2048块显卡，训练了多少个小时，只是算了这个数。他是557万美金，你的数据是什么样的成本，你的人工是什么样的成本？而且训练这个东西，它不是训练一次就行了的，特别是像MoE这样复杂的架构，它可能中间会失败非常多次，然后进行架构的调整和重新设计，重新训练。那么最后你用一次训练的，而且仅仅是训练成本。</p>



<p class="wp-block-paragraph">来去替代Deepseak V3的开发成本，这件事本身是不对的。所以不要想着说，这边557万美金就训练了一个大模型出来，Meta就天塌了，没有这事。Meta现在也表态了，我们要继续加大力度买显卡。原来有60万块显卡，今年准备买到130万块，充分的去买显卡。买完显卡以后，还要再继续努力的去训练新的模型。</p>



<p class="wp-block-paragraph">现在等于又多了一条训练的路径。原来Meta说我这有训练的路径，怎么去从LLama1、LLama2、LLama3、LLama3.1、3.2、3.3怎么训练上来。现在DeepSeek又给我提供了很多新思路，那我在做新的训练任务的时候，可以有很多的新的训练方案去尝试。最后可能再训练出来的LLama4，就会比原来的LLama3要强，非常大的一块，这个还是不一样的。</p>



<p class="wp-block-paragraph">所以对于Meta来说，那咱们就上呗。原来可能我一共有5条路可以尝试，现在又多了两条路。那么排列组合一下，怎么能够把这些路径都设计好，去训练出新的LLama3来，这个是大家可以看的。XAI其实没说什么，但是Grok 3的训练，估计也会增加很多新的训练方法，可以进行尝试。</p>



<p class="wp-block-paragraph">对于英伟达来说，千万别建议英伟达废了。当然英伟达确确实实最近的股价又在开始波动，现在都不敢讲是英伟达股票涨了还是跌了，因为总有人过了半个月回来说，你现在不是说跌了吗？你看涨回来了。这个英伟达作为这么高市值的公司来说，他的股价来回发生波动是很正常的。那么对于英伟达来说，这应该是一个巨大的利好。为什么？因为有人能够把这样的模型用起来了，能够这么便宜、这么好用的模型开源出来，那么大家就会疯狂的去买显卡回来，把自己原来的模型增加上这些新的方法，重新去做训练，重新去做微调或者去做蒸馏，这是大家要去干的事情。</p>



<p class="wp-block-paragraph">所以这个事对英伟达是有好处的。另外很多的AI agent公司，也会自己去部署自己的算力中心，然后去部署这个开源的DeepSeek模型，就可以跑起来。</p>



<p class="wp-block-paragraph">这个对于英伟达来说也是利好。大模型应用的成本更低，效果更好，各大公司都会疯狂地买显卡的。至于闭源模型来说，他们确实是要压力山大了。刚才我们讲的这些，不管是Meta，还是XAI，还是最基础的英伟达，实际上我们都是在讲开源路径。那么闭源路径，比如说OpenAI，他们就要想一想怎么办。它的领袖地位在发生动摇，Anthropic肯定也要承受一定的压力，因为它的价值肯定会下降的。</p>



<p class="wp-block-paragraph">至于谷歌到底发生什么事了，这么大的公司还没反应过来。云计算厂商应该是久旱逢甘霖，不管是微软、亚马逊，还是谷歌、Oracle，都是说我是云计算厂商，你是开源的模型，我给你部署上来。那么以后使用我们云计算机房里边这些客户，你就可以在我这直接使用同一个机房里面部署的DeepSeek大模型了。这个对于他们来说肯定是好事，他们也还会再去买一些显卡回来。当然了，这块就有可能会去买AMD的显卡了，因为AMD的MI 300据说已经把DeepSeek V3跑起来了。</p>



<p class="wp-block-paragraph">这个其实也很简单，因为AMD是Pytorch基金会的一个核心贡献者，给钱的人。你要去跑这样的模型，肯定还是要去使用类似于Pytorch这样的工具。只要能够让这个工具可以跟AMD的显卡进行很好的兼容，可以进行推理，那么AMD现在号称说我内置了DeepSeek V3，这个话就是稍微有一点点歧义。但是大家可以认为说，我只要是买AMD的显卡，就可以把DeepSeek V3跑起来，这个没毛病。</p>



<p class="wp-block-paragraph">那么其他的这些AI Agent厂商，这个也是救命稻草来了，比如说Perplexity，还有Cursor这样的AI Agent公司。他们原来必须要去调用OpenAI，要去调用Claude，这个东西很贵，而且你掌握在别人的手里面，你所有的用户数据别人都可以看到，这个肯定是非常不爽的。现在这两家公司已经都在产品内部集成了DeepSeek V3。</p>



<p class="wp-block-paragraph">甚至可能正在集成 DeepSeek R1 这样的推理模型。那么未来可能越来越多的 AI Agent 的公司会走这条路。2025 年就是 AI Agent 年，而他们可能很多的这种应用，都将在 DeepSeek V3 或者是 DeepSeek R1 这样的模型上继续往前快速奔跑。</p>



<p class="wp-block-paragraph">至于国内的公司，肯定也在努力。这两天，第一个是豆包 1.5 Pro 版本出来了，也是 Moe 模型。而且豆包喊的是什么？“我所有的数据都不是来自于蒸馏，都不是来自于其他模型，所有数据都是我自己的。”这个确实在这点上要比 DeepSeek 要好一点。为什么？因为使用了别人的数据后，可能会把一些偏见带到自己的模型里，而这往往比较难以发现。就经常你去问他说：“你是谁？”上来说：“我是 OpenAI 的 ChatGPT。”</p>



<p class="wp-block-paragraph">那么豆包为什么有这样的底气？后边是字节跳动，有今日头条，有抖音，这样的平台在后头顶着。他有的是数据，而且他的数据都可能经历了几万人的筛选、过滤和标注的。所以在这块上，它确实是有一定的优势。我这两天也试了一下豆包 1.5 Pro，除了这个政治正确太严重之外，没什么大毛病。它这个豆包 1.5 还更便宜，它比 DeepSeek 还便宜。原因也很简单，DeepSeek 再怎么便宜，是人家成本低，而豆包的话，我可以赔钱，我可以发补贴，这个事你是比不了的。</p>



<p class="wp-block-paragraph">另外，Minimax 也出了一个 01 的模型，叫 Minimax 01。它原来没有开源，从 Minimax 01 这个版本开始去开源了，刷分刷各种排行榜，也刷得很高，但没有什么响动，大家也没有觉得 Minimax 怎么样。原因也很简单，开源这个事并不是一蹴而就的。我今儿开源了，大家就必须要马上冲下来三拜九叩，没有这事。开源是要长期的开源，开源很长时间了以后，才会有人慢慢地去看你的代码、看你的论文、看你这些信息。</p>



<p class="wp-block-paragraph">因为我们要去使用一个开源系统，一开始这个成本是很高的，你需要招聘这些会使用开源的人。</p>



<p class="wp-block-paragraph">这些人的本身的薪资，就要比那些不会使用开源的人要高。高好大一快的，而且这么大的模型，这么大的系统，我们要把整个的系统都进行阅读、进行理解，这个成本是要支付的。如果你今天突然说我开源了，那么大家也要看一看，日久见人心，明天你万一不开了呢？这个还是要逐渐积累。而且这个Minimax的开源，应该开的也没有DeepSeek那么彻底、那么完整。DeepSeek就属于彻底，所有东西都拿出来，你们就看着，照着东西可以重现。这个迷你Max还惦记着说我是不是开点源，吸引点用户回来，我是不是又可以找他们收钱去了。他在想这样的事情，那这个就一看，就不是一个真心开源的项目。</p>



<p class="wp-block-paragraph">在这种基础上，他现在依然没有什么响动。Kimi 1.5也出来了，刷了分。咱们中国大模型出来，甭管豆包、Minimax和Kimi，都是先去刷分，刷排行榜。排行榜刷完了以后，好像也就没有什么响动了。一个闭源模型，那在这样的情况下，我有开源的，我干嘛要用你？闭源一定是如此的一个情况了。而且Kimi 1.5的政治正确，要比这个豆包还严重，所以也就到这了。</p>



<p class="wp-block-paragraph">最后总结一下，这是开源对闭源的胜利，这点非常重要。而且真开源是很难的，也是会被认可的。那些假开源，你要看看是不是愿意坚持下去，把自己的假开源慢慢的做成真开源。而且大力出奇迹这件事情依然存在，现在只是说在大力出奇迹的时候，我可以多换几个姿势，多换几个角度了，但是大力依然出奇迹。</p>



<p class="wp-block-paragraph">不要老想着中国到底能不能创新，是不是遥遥领先，这件事根本就不重要。重要的是什么？重要的是在开源的模式下，快速的奔跑，参与到标准的制定者中间去，这个才是重要的。否则可能折腾了半天，你压根就不在这个标准制定者里面。因为现在大家都在开业，大家都是说我们向标准里边贡献东西。那么你不能说在前面贡献的时候，我们没有上去，我们都敝帚自珍，把门关起来自己偷偷的在这研究，等人家把这个标准拿出来以后，冲上来说不行。</p>



<p class="wp-block-paragraph">我们要改一下这标准。我不认你这个标准，谁理你？所以在这个时候，大家就要疯狂地冲上去，参与到标准制定里边去。其实在这里再补充一句，原来在国内各个企业里边，在全世界标准组织里边，贡献最多的公司，在开源项目里边贡献最多的公司是谁？是华为。如果没有制裁，可能华为已经在这条路上走得很远了。但是因为制裁的原因，现在只能自己把门关起来，喊“遥遥领先了”。这个也是制裁造成的一个非常惨重的结果。</p>



<p class="wp-block-paragraph">好，这就是今天跟大家稍微总结一下，DeepSeek出圈了以后，中文圈到底在吵什么，以及我的一些观点。好，这期就讲到这里，感谢大家收听，请帮忙点赞，点小铃铛，参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Deepseek V3搅动AI格局！从细颗粒度专家到多头潜在注意力机制深度剖析</title>
		<link>https://lukefan.com/2025/01/07/deepseek-v3%e6%90%85%e5%8a%a8ai%e6%a0%bc%e5%b1%80%ef%bc%81%e4%bb%8e%e7%bb%86%e9%a2%97%e7%b2%92%e5%ba%a6%e4%b8%93%e5%ae%b6%e5%88%b0%e5%a4%9a%e5%a4%b4%e6%bd%9c%e5%9c%a8%e6%b3%a8%e6%84%8f%e5%8a%9b/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 07 Jan 2025 13:25:33 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI开源模型]]></category>
		<category><![CDATA[AI技术解析]]></category>
		<category><![CDATA[Deepseek AI发展]]></category>
		<category><![CDATA[Deepseek MoE模型解析]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[Deepseek V3技术优势]]></category>
		<category><![CDATA[Deepseek V3技术难点]]></category>
		<category><![CDATA[Deepseek V3效率]]></category>
		<category><![CDATA[Deepseek V3特点]]></category>
		<category><![CDATA[Deepseek V3解析]]></category>
		<category><![CDATA[Deepseek VS密集模型]]></category>
		<category><![CDATA[Deepseek与Claude]]></category>
		<category><![CDATA[Deepseek与GPT-4对比]]></category>
		<category><![CDATA[Deepseek与Llama]]></category>
		<category><![CDATA[Deepseek与李开复]]></category>
		<category><![CDATA[Deepseek与零一万物]]></category>
		<category><![CDATA[Deepseek国内模型]]></category>
		<category><![CDATA[Deepseek国际关注]]></category>
		<category><![CDATA[Deepseek学术价值]]></category>
		<category><![CDATA[Deepseek应用场景]]></category>
		<category><![CDATA[Deepseek开源代码]]></category>
		<category><![CDATA[Deepseek开源项目]]></category>
		<category><![CDATA[Deepseek微调难点]]></category>
		<category><![CDATA[Deepseek性能优化]]></category>
		<category><![CDATA[Deepseek技术革新]]></category>
		<category><![CDATA[Deepseek推理成本]]></category>
		<category><![CDATA[Deepseek训练成本]]></category>
		<category><![CDATA[Deepseek通信开销]]></category>
		<category><![CDATA[MoE架构创新]]></category>
		<category><![CDATA[MoE模型]]></category>
		<category><![CDATA[中国AI模型]]></category>
		<category><![CDATA[医院分诊模型]]></category>
		<category><![CDATA[地址邮编模型]]></category>
		<category><![CDATA[多任务AI学习]]></category>
		<category><![CDATA[多头潜在注意力机制]]></category>
		<category><![CDATA[密集模型对比]]></category>
		<category><![CDATA[混合专家模型]]></category>
		<category><![CDATA[细颗粒度专家模型]]></category>
		<category><![CDATA[细颗粒度模型解析]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1832</guid>

					<description><![CDATA[大家好呀！今天要跟你们聊的是一个绝对不能错过的科技盛事——Deepseek V3！🔥 最近这个模型简直是引起了轩然大波，真的是太强大了，根本不允许你忽视它的存在啊啊啊啊！！

首先，Deepseek V3可不仅仅是个普通的AI模型，它是一个创新的混合专家模型（MoE），就像一个超级医院的分诊中心一样！你知道的，以前的模型就像是一个全能大医生，虽然能力强，但效率真的很低！😫而Deepseek V3呢？它把专家分散得更细致，每层都有多个实习生来“会诊”，让你在解决问题时不仅快速，而且高效！每次调用的都是多达522个专家，简直是“明星医院”的感觉呀！🏥✨

而且，Deepseek V3的创新之处不仅于此！它引入了细颗粒度专家模型和多头潜在注意力机制（MLA），在训练和推理的成本上都是大幅度下降！就像是把计程车的导航系统升级了，立刻精准到位！🚖💨

你会问：这么好的技术，为什么不人人都在用呢？不得不提的是，MoE模型有很多优缺点！虽然它在处理多任务时非常划算，但却需要更多的存储空间和更复杂的微调！而且小规模任务时可能会出现过拟合，哎呀，听起来是不是有点复杂？🤔

但是，作为普通用户的我们，使用Deepseek V3进行正常沟通和编程任务，简直是“如鱼得水”般顺利！💻💪 如果你是个打工人，想提高工作效率，这绝对是你不能错过的选择！

所以，家人们！Deepseek V3真的可以改变我们的生活！赶快试试这个未来科技的新宠吧！⚡️🔥

Deepseek V3搅动AI格局！从细颗粒度专家到多头潜在注意力机制深度剖析

Deepseek V3作为最新的MoE（混合专家）模型，凭借细颗粒度专家模型和多头潜在注意力机制（MLA）的两大技术突破，引发了全球AI行业的关注。文章以生动的医院分诊和邮政编码故事，将复杂的Deepseek V3架构解析得浅显易懂。在使用成本降低和效率提升的同时，Deepseek V3也面临存储、通信开销、微调复杂等挑战。对比密集模型与MoE模型的优劣，深刻探讨了中国AI发展适合的路径和场景需求。Deepseek V3的开源模式及其对MoE架构的创新改进，使其成为国内外科研和工业领域的热门选择。无论是Deepseek的发展历程还是全面的技术解析，都展现了它在突破国际壁垒和推动AI平权方面的巨大潜力。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="Deepseek V3搅动AI格局！从细颗粒度专家到多头潜在注意力机制深度剖析" width="900" height="506" src="https://www.youtube.com/embed/3qH1hl7WSIA?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。今天咱们来讲一讲Deepseek V3搅动风云的事情。Deepseek V3到底先进在什么地方？我在这一段时间呢，也看了一些人的介绍，甚至也看了一些人的视频，尝试用人话来讲清楚，还是很困难的。有一些人很扑克脸，上来就把论文念了一遍，底下一堆人在那评论说有听没有懂。咱们呢尽量避免看这个事情，想办法呢，用举例子和讲故事的方式，让大家能够稍微的了解一下Deepseek V3到底干了点什么。</p>



<p class="wp-block-paragraph">但是呢，这个里头就会有一个问题，就是例子跟故事呢，有时候不一定准确。所以呢，我们尽量的传递，让大家可以对相关的概念有一个感性的认知。跟大家先讲一个故事吧，这样的话，你们就可以理解待会我要讲的故事大概在什么层面上了。</p>



<p class="wp-block-paragraph">说爱因斯坦在晚年，有一次去参加美国的一个慈善晚会，来了位盲人。说：“您看，这是个盲人，您能给他解释一下什么是相对论吗？”从来也没见过任何的光，也就没见过任何东西。你告诉我怎么叫相对论。爱因斯坦想了想，说：“这个相对论呢，就是相对的，就是黑的跟白的，你能理解吗？”这个盲人说：“我生下来就是盲人，我没法理解什么是黑的跟白的。”爱因斯坦说：“那你想想有一只大鹅，大鹅你知道吗？这个鹅是白的。”盲人说：“我从小就是盲人，我没见过鹅。”爱因斯坦继续说：“鹅有一个长长的脖子，你能想象吗？”盲人说：“哎呀，我从小是盲人，我没见过鹅，也没见过什么叫长长的脖子。”爱因斯坦说：“这个鹅的长长的脖子是可以弯的。”盲人问：“怎么弯呢？”爱因斯坦说：“来，我给你比划一下。你把这个手伸出来，这个手伸出来，然后呢，这是直的，这是弯的，你懂了吧？”盲人说：“哎呀，我好像已经懂了，什么是脖子是直的是弯的，也能够想象一下什么是鹅了，甚至呢，我都觉得我理解了什么是相对论了。”</p>



<span id="more-1832"></span>



<p class="wp-block-paragraph">所以今天有很多的故事呢，可能是按照这个力度跟大家讲的，但我觉得我应该比爱因斯坦还稍微差一点点。大家也肯定比这个盲人的理解能力要强。首先，Deepseek呢，它是一个MoE的模型。</p>



<p class="wp-block-paragraph">这个MoE呢，叫做混合专家模型。这个混合专家模型的概念呢，是1991年由Jeffrey Hinton和Michael Jordan这两个人提出的，发表的论文在91年就提出来了。这个Hinton老爷子是今年还得了诺贝尔奖的那个老爷子，所以这个混合模型专家是非常非常早就有了。</p>



<p class="wp-block-paragraph">从17年以后，谷歌开始持续使用这种MoE的模型去推出各种产品，Gemini也是MoE的模型。这种叫混合专家模型，跟它对应的就是这种密集模型。像咱们用的LLama，梅塔做的这套东西都是密集模型，Claude也是密集模型。至于OpenAI的GPT到底是什么呢，不确定，因为它没有公开，大家猜测它是MoE，但既然它自己不说，也就没办法去说它是什么。</p>



<p class="wp-block-paragraph">现在比较有名的MoE模型，第一个是法国的叫Mixtra，这个是微软投资的。另一个非常非常有名的MoE模型是谁呢，就是马斯克XAI里边用的Grok，Grok 1和Grok 2都是MoE模型。然后GPT-4呢，大家猜测它是MoE，但它自己既没有承认，也没有否认。GPT-4OMINI呢，最近微软泄密了，写了篇论文出来，说这个GPT-4OMINI只有8B，也就是80亿参数的一个模型。</p>



<p class="wp-block-paragraph">现在大家普遍猜测GPT-4OMINI是一个MoE模型，为什么呢？因为每一个专家可能是8B，最后可能是7*8B或者8*8B这样的一个模型。因为单纯的8B模型是不太可能达到GPT-4OMINI这样的回复能力的。Gemini的话，现在确认是在1.5以后的版本，肯定是MoE，前面的不太好说。</p>



<p class="wp-block-paragraph">然后国内呢，其实很多模型也是MoE的，比如说Minimax，他们号称是中国的第一个MoE模型。今天我们要讲的Deepseek，也一直在搞MoE，Deepseek从V1、V2、V2.5到今天的V3，实际上都是MoE模型。通义千问就是阿里的这套模型。</p>



<p class="wp-block-paragraph">是在1.5以后的版本引入了MoE的架构。它里头就是有一部分是MoE，有一部分不是。零一万物李开复的这个模型呢，是到后面1 lighting这个模型，应该是一个MoE模型，应该是从Deepseek的这个架构转过来的。因为李开复的零一万物在早期是使用的LLama的架构，后面的使用的是Deepseek的架构。腾讯的浑元大模型也是个MoE，豆包的最新的模型已经转型向MoE了，就是豆包早期模型不是，现在最新的已经转到MoE去了。</p>



<p class="wp-block-paragraph">百度的文心一言呢，号称的是MoE，或者说采用了类似这样的架构。但是这种完全不开源的项目，你就听他说就完了，这个不是那么重要的一个事情。然后Deepseek本身的发展历程是什么样的呢？2023年Deepseek当时出的这个模型叫Deepseek code，就是做编码的。Deepseek V1这个模型呢，当时其实并没有大张旗鼓地去发布，所以呢没有说Deepseek V1到底是哪天发布的。Deepseek V1的模型呢，算是验证了MoE模型的一个架构。</p>



<p class="wp-block-paragraph">到2024年的5月份呢，Deepseek V2这个模型就出来了。在V1的基础上，参数量扩大。Deepseek V2呢，就已经在当时国内的各种模型里边算是能打的了。到2024年的12月份，Deepseek呢就出了V2.5的一个模型，进行了大量的优化以及提速。Deepseek 2.5出来以后，在国内的各种应用上，很多人就会去使用了。原来国内普通人去用的时候的话，如果不是说是这种系统集成签单的说，我必须要用谁家的模型，原来很多人会去喜欢用通义千问，喜欢用Moonshot Kimi后边那个模型。后来呢，到2024年12月份，大家就普遍的开始向Deepseek 2.5上去转了。到2024年12月26号，上面这个2.5模型发布了，不到一个月的时间，Deepseekk V3的模型就出来了。</p>



<p class="wp-block-paragraph">Deepseekk V3的模型到底创新在什么地方呢？前面那么多的中国模型，甭管是通义千问，还是零一万物，也在四处打榜，也在四处刷排行榜，但是国际上基本上没声音。为什么呢？因为你拿别人的模型架构，甚至是用别人的大模型生成的数据，回来训练，没有对底层架构做出任何贡献。即使是在中文方面有一些进展，也不会引起关注的，也不会有人来重视你。</p>



<p class="wp-block-paragraph">但是，Deepseekk V3就不一样了。国际上各个大厂的专家们发现了，他们对MoE模型做了很多的改进，使得这个模型的训练成本和推理成本都急剧下降。他们觉得，唉，这个确实是值得大家去学习一下，值得大家去研究一下。所以，Deepseekk V3是在国际上炸出声音来了。</p>



<p class="wp-block-paragraph">而且，Deepseekk V3是一个真正的开源模型。它不像Kimi等这些模型，我是闭源的，我就自己在这闷头干，嗯，到底好不好使，我反正评测完了就这样了，其他的我不管了。但Deepseekk V3开源了，论文也发了，代码也在GitHub上，Hugging Face上都有。有谁愿意去折腾这个事，你们自己就下载去试去。</p>



<p class="wp-block-paragraph">所以，现在很多人都在尝试部署Deepseekk V3。对于MoE架构所做出来的调整，很多人也开始在尝试在自己的架构中使用。就像前面我们讲的李开复的零一万物，发现Deepseekk的模型很好，他就直接把人的架构用到自己的1 Lighting里边去了。那么，未来肯定也有很多人继续做这个事情。现在，甚至还有人在尝试微调Deepseekk V3，这其实是一个挺麻烦的事情，后边我们再去详细讲。</p>



<p class="wp-block-paragraph">那么，Deepseekk V3到底对于MoE模型做了哪些改变呢？它叫细颗粒度专家模型。传统的MoE模型是什么样的？就是上面有一个路由网络，下头有若干个专家，每次调用一个或者两个专家，然后把问题解决掉。比如说像前面我们讲的这个Grok或者是Mixtra这样的模型，它一般是8个专家。</p>



<p class="wp-block-paragraph">每一次调其中的两个专家解决问题。而Deepseek V3的话，它就把这个专家变得很细碎。它呢，一共在模型上分了61层。首先是分层，前三层呢叫密集的多层感知机，咱们就不用去管这个名字到底是什么意思了。我们举一个例子，它像什么呢？像医院门口的分诊台。你说我现在要看病了，我到底要看哪个大夫，这就在前三层给你处理掉，告诉你应该从哪走，上哪上楼，下哪下楼，在这哪个大夫那去看病，给你做这个分诊。这个前三层是像干这个似的。</p>



<p class="wp-block-paragraph">后边呢是58层，这58层呢叫混合专家层。每一层呢有一个共享专家和256个路由专家。每次共享专家都会参与，路由专家呢启动8个。每一次干活的时候，一个共享专家和8个路由专家一起干活。所以呢，每层有9个专家干活。对于所有的输入数据来说呢，相当于什么呢？它会激活9乘以58等于522个专家。但是不是每一次都会这样。他有的时候，比如走了几层以后发现这个结果已经可以用了，就直接把这个结果输出了。如果说走完这一层以后，发现结果不可以用，他就走下一层，走到头就是58层。522个专家为我们服务，得到一个结果。</p>



<p class="wp-block-paragraph">咱们还是以医院为例吧。如果在医院里头，我们使用像Claude这样的密集型模型，相当于什么呢？他有一个全知全能的专家。我们甭管得什么病，有什么问题，我就坐在这，应该怎么怎么治，在这他就给你去解答，这类似于这样。</p>



<p class="wp-block-paragraph">那你说Mixtral或者是Grok他们是怎么干活的呢？Mixtral是32层，Grok是64层，每一层呢有八个专家。你前头分诊也是要干这个事，干完了以后，你到每一层去，他们动用两个专家来替你服务。他是这样的一个工作方式。Grok也是这样，每层8个专家，每次动用两个。Deepseek V3呢，它就跟刚才这个状态不一样了。为什么呢？它是门口分诊，这个大家都要干，前面也分层。Mixtral是32层，Grok是64层，每个环节、各层级之间呢，就相当于有一科室。</p>



<p class="wp-block-paragraph">Grok也好，Mixtral也好，是每层有8个专家，给你挑俩专家会诊一下就完事了。到这个Deepseek V3，这不这样了。它相当于每个科室里头做了一个分诊护士，就是他这个叫做通用专家，啥都懂点。然后呢，有256个实习生。你说256个，你再管人叫专家有点不大合适，太多了。</p>



<p class="wp-block-paragraph">然后每次来了这个病人之后呢，你先走到这个科室去。到了科室以后，分诊护士要过一下手，然后呢再分配8个实习生过来会诊。会诊完了以后，看看你是不是需要到下一个环节去。比如说检查完了说没毛病，滚吧；或者检查完了去开药吧；再检查完了你开完药还得去上药，或者还要做个手术，还要去做康复。他得一个环节一个环节这么往下走。这就是Deepseek的V3干的活。</p>



<p class="wp-block-paragraph">原来是每层还是有专家，现在等于每层上了一大堆实习生。所以呢，这个训练成本和这个推理成本就急剧下降了。这是他的整个架构上做的一个重大贡献吧。</p>



<p class="wp-block-paragraph">然后他们做的另外一项特别大的贡献是什么呢？叫多头潜在注意力机制MLA。原来呢是叫MHA，就是叫多头注意力机制。这个东西什么意思呢？这个东西也很简单，像GPT也好，像任何这个大模型，写一句话进去，输入了一个东西，然后呢他会把这一句话分拆成很多段。每一段呢去来决定说：“我到底应该是在说什么？”然后把这个多段就变成多头了。</p>



<p class="wp-block-paragraph">比如说我今儿说了一句话：“明天我们一起去吃炸酱面吧。”明天我们一起去吃炸酱面吧，然后再写个问号，这就是可能分成这么多头。他拿着这些东西干嘛使呢？拿着这些东西呢要进行匹配，说我到底应该让哪一部分知识，哪一科专家来给你干活。我要把它拆吧拆吧。</p>



<p class="wp-block-paragraph">那么怎么匹配呢？在这个大模型的空间里头呢，它是一个矢量空间。矢量空间就是，如果你只有一个坐标的时候就在一条线上，两个坐标是一个平面，三个坐标就是一个空间。但是呢，在这个大模型的这个空间里，它的可能是512个坐标，或者是1,024个，有的是2,048个坐标。它是一个非常复杂的这种空间。</p>



<p class="wp-block-paragraph">他把所有的知识放在这些空间里头去。我们拿着一句话，把它拆成一大堆头了，然后把每一个头呢，也在尺量空间里去做映射。映射完了以后呢，找到这个多头所映射的这些点，每一个点离他们最近的这个位置。你们到底要去回答什么东西，然后再把要去回答的这句话拼出来。这就是大模型干活的一个过程。</p>



<p class="wp-block-paragraph">包括咱们前头讲了要去分诊，你到底分给哪个模型干呢？他也是要靠这种矢量空间去分，找离你这个矢量空间里最近的那几个点来。你们这几个专家或者实习生去给我干活去。那么在这个里头就有一个问题，是什么呢？数据在拆开了以后呢，它会形成一个叫KV对，对key and value，就是一个是键值，一个是里头的数值。那什么意思呢？比如说像刚才我们讲的这个拆分的过程，我把它拆成了一个，比如说1,024个维度的这样的一个坐标。那么这个key呢，就是一个1,024个数，这个坐标肯定是由1,024个数组成的吧。value，比如说是吃炸酱面，我到那个里头找，离这个点最近的8个专家，你来干活来，去处理一下吃炸酱面的事情。这叫key value。</p>



<p class="wp-block-paragraph">那么大家发现了一个问题没有？1,024个整数那很大的呀。在这个MLA里头，就是说叫多头潜在注意力机制里头呢，他们把这玩意做了个压缩，就不会再有1,024个整数在对应后面那个炸酱面了。然后至于怎么去压缩降维这个事呢，说实话咱也没看懂。但是呢，可以给大家举例子。你想他如果前面这个数变少了，不是1024个了，比如说我就变成一个数，那肯定你在每一次进行比较的时候，每一次内存里边去存的时候，就会极大的提升比较速度，降低内存占用空间嘛。</p>



<p class="wp-block-paragraph">那么他呢，干的活其实有点像什么呢？这个咱们讲一个我去新加坡的故事吧。就是我那时候去新加坡， 经常找不着地。一问你们在哪，哪个街哪个哪个路哪个号。后来人家那个新加坡的坡县朋友跟我讲了，说你不要这么去问路，在新加坡不是这么问路的。我说那怎么问呢？他说这个新加坡……</p>



<p class="wp-block-paragraph">有一种非常有效的地址压缩方式，就是邮政编码。新加坡是每一栋建筑有一个邮政编码，每一个邮政编码呢，也就对应一栋建筑。所以这个呢，其实有点像key和value，邮政编码就是这个key，这栋建筑呢，就是这个value。</p>



<p class="wp-block-paragraph">所以呢，你只要知道邮政编码了，你就肯定能找着他。大家把这个压缩的过程，就是key value压缩的过程，基本上可以把它看作一个什么样的过程。就是原来我记得是哪个区，哪条路多少号，哪个建筑物，现在呢，变成一个邮政编码，他就这么给你做压缩了。然后你要去找到他，也相对来说要容易一些，而且是一一对应的。所有key跟value的这个东西，就是一一对应。如果说一个邮政编码对应好多个建筑物的话，那就不叫key value了。像中国大陆，因为邮政编码比较少，所以我们经常是一片地区是一个邮政编码。但是新加坡这种，就是他每个邮政编码就一栋建筑物。</p>



<p class="wp-block-paragraph">当然像这个Deepseek呢，并不是说把一个矢量的空间就压成了一个数，但是呢，他压少了。原来比如说是1024个，现在呢，压完了以后，比如剩了64个，这个呢，比较起来去做存储都会提高很多的效率。</p>



<p class="wp-block-paragraph">那你说这两个点之间算距离怎么算？这个咱们学过数学，学过几何。如果是二维平面，就是x方加y方，那边呢是x1方加y1方。只要是俩数呢一减，如果这个数很小，就说明离得比较近，大概就这样的一个状态。三维空间呢，就是XYZ，那边也是XYZ，把这个东西都平方了以后，然后一减，如果这个数值很小，就说明比较近。如果是数值是0，那就说明这是在同一个地方。它就是这样的一个计算方式。</p>



<p class="wp-block-paragraph">如果这个更多的维度，你就需要好多好多的XYZE，什么什么这样的坐标，然后都是平方，把它加起来，然后算出一个这个距离位置来。肯定是数越小，他算的越快，占的空间越小。这个是这一次Deepseek做出的一个重大贡献，就是两个贡献。大家记住了，第一个是细颗粒度专家模型，第二个贡献呢，就是叫做多头潜在注意力机制。</p>



<p class="wp-block-paragraph">所以呢，就是Deepseek。你说，唉，到底先进在哪？就是这两个先进度，这个到底怎么回事？你们记住我前面讲的这个医院看病的故事和后边这个地址编邮政编码的故事，就可以大概有一个感性的认识了。</p>



<p class="wp-block-paragraph">那么，下边一个问题是什么呢？你说这么好的技术，为什么不每个公司都用呢？Meta你做Lama的时候，为什么不用MoE呢？Claude你为啥不用MoE呢？这个技术这么好，为什么还会有人做这种叫密集模型呢？这个MoE它是有好多缺点，咱们刚才光讲优点了。优点就是说，你这个训练的时候比较省成本，推理的时候比较省成本，而且跑得很快。MoE模型要比密集型模型跑得要快得多，而且呢，他对于这个显卡要求没有那么高，比较适合于穷人玩这个东西。</p>



<p class="wp-block-paragraph">那你说MoE模型的缺点是什么？第一个呢，它对于存储的要求是很大的。这些模型虽然很多在干活的时候，这些专家没干活，但是呢，你也得给他个屋子，你也得让他坐在那个诊疗室里等着。哪怕现在没有病人，你也得在那等着。所以呢，他们特别耗地儿，这个是MoE模型的一个非常讨厌的地方。</p>



<p class="wp-block-paragraph">然后第二个讨厌的地方是什么呢？就是它微调非常麻烦。因为如果你要是做这种大的模型，就是做这种密集型模型，你是可以对它比较简单的行微调的。但是MoE模型呢，因为它本身的架构非常非常复杂。咱们就还是想刚才医院那例子吧，你有这么多实习生在里头做好了，你现在想让他们学习一个新技能，对于他们来说是很麻烦的一个事情。而且学完了以后，到底会有什么样的效果，这个事是比较难以预期的。所以呢，MoE模型比较难微调。</p>



<p class="wp-block-paragraph">还有什么呢？就是负载均衡。咱呢还想回刚才那个医院那故事。有的医生一堆的病人在那看他，有的医生没人理他，这对MoE模型来说也是很灾难的。他们希望呢，尽可能所有的医生也好，专家也好，或者是实习生也好，都有事干，谁也别太累了，谁也别太闲了。但是呢，这件事情呢，是比较难以控制的。有些医生他就经常遇到相同的这种问题，可能就都是他管。</p>



<p class="wp-block-paragraph">其他的医生，可能我们就是顺着这个罕见病的，可能就很少有人过来。这个事呢，你是在设计架构的时候，就比较难以去搞定。然后呢，MoE模型的下一个缺点是什么？就是通信开销很大。你想，他这么多的模型，又分层又分专家，还需要各种调度。他就会进行很多的计算机与计算机，或者显卡与显卡之间的这个调度，这块是相对来说要慢一点点。还有呢，就是部署比较麻烦。刚才我们讲这过程，你就知道这事部署有多费劲。你说我有一个大专家，坐在一个巨大的房子里头给大家看病，这玩意部署起来多简单。比如刚才我们讲的分58层，每层256个实习生，加一个会诊护士，这玩意多费劲。你还得盖多大的楼，把他们塞进去，这个部署很麻烦。</p>



<p class="wp-block-paragraph">最后，有一个MoE模型比较难以避免的问题在哪呢？就是现在很多的大公司不愿意用，它的一个核心原因是这种小规模任务的容器出现过拟合。那有人问了，什么叫过拟合？这个老范你又在说黑话了。这个过拟合的意思呢，是小规模数据训练之后，在这个训练数据范围内，效果特别特别好。这不是好事吗？但是呢，你一旦遇到新的数据了，超出数据范围呢，效果的波动就会很大。有的时候可能还不错，有的时候就会变得很差。这个过程呢，就叫过拟合。</p>



<p class="wp-block-paragraph">说还是听不懂，那么咱再讲一个故事吧。咱按刚才那实习生看病的故事。为什么我一定要强调这个是实习生，他不是专家呢？正常的学习，咱们是怎么学的？咱们正常的学习呢，是学习基础知识，做实验做练习，考试循序渐进这么学上来的。当你说：“哎，我这做一屋子实习生，我们没有空给你做”，这样比较慢的学习了，那怎么办呢？这个实习生要看病了，那咱们干脆分科目刷题吧。就跟这个咱们考驾照似的，上来有一个题目库，800道题，刷完了以后，到时候再考的时候呢，抽100道题考。你只要是在这800道题里头抽出来的，那我肯定是考得好。而且我可以通过快速的刷题，我没准可能两三天的时间，就可以把这个题都刷好了，然后我就可以去考，考试100分。</p>



<p class="wp-block-paragraph">因为大家知道考驾照这个事是100道题，错5个以上就不及格。你至少要考到95分才可以去过关。这些实习生我们就用这种方式去训练。他在题库范围内表现都非常好，但是这些人一旦超出题库范围了，没学过呀，怎么办？不会了。他就会出现这样的问题，这个过程就是过拟合。他呢，现在把这种模型缩得这么小颗粒度，所以呢，每一个这个小颗粒度的专家，或者叫实习生，他们其实可以处理的问题是很少的。他们都是这种刷题、紧急训练出来的实习生。一旦超出了一定的范围以后，他的结果大家就比较难以去处理。</p>



<p class="wp-block-paragraph">现在有很多人在去尝试使用Deepseek V3。就是你用这个正常的东西跟他沟通和交流，让他写程序什么的，效果都很好。但是呢，一些比较偏门的这个语言，或者一些比较小众的语言，跟他讲完了以后，他会出现听不懂的情况。你要求他去做一些比较复杂的、比较小众的算法的时候，他输出的效果也会明显下降。这个就跟我们每天上街去开车，像我开车肯定是个熟练工，但是我们跟赛车手比起来，我们这个技术还是差的比较远的，所以他会有这样的缺陷。</p>



<p class="wp-block-paragraph">现在呢，MoE模型跟这种密集型模型呢，各有各的使用场景。MoE模型呢是大规模多任务学习，就是我们任务很杂，什么都干一点点，什么都懂一点。这有点像老范，老范就属于是什么都懂一点，但哪块都不是特别精通，受资源限制的这种环境。因为你如果资源多的话，谁跟你费这劲，MoE直接上密集模型就完事了。</p>



<p class="wp-block-paragraph">需要处理多样化的数据场景，就是什么事都要去折腾一下。所以呢，这个MoE模型呢，很适合中国的一条道路，因为我们缺乏高性能显卡，也没有办法去搞这种高运算密度的集群出来，所以咱们比较适合干MoE。密集型的模型，就是像Claude、Kimi的这个moonshot模型，还有像Llama这样的模型，都是密集型模型，单一任务、同质化任务，这是他们比较擅长的，高稳定性要求的任务是他们比较擅长的。</p>



<p class="wp-block-paragraph">它有一个比较大的好处，是什么呢？叫做训练容易。刚才我们讲到58层，每层256个专家。那你要想训练这些人，刚才不是说吗？我们不是刷题就行了吗？对，但是呢，你要给58层每一层256个实习生确定不同的题目让他们刷，这个过程是很麻烦的。如果你说刷的题不对了，那最后他们就没有办法很好地配合在一起工作。</p>



<p class="wp-block-paragraph">我们要整体设计这个体系架构，这个事情是很麻烦的。所以，MoE模型本身的训练不是那么简单，虽然它的训练成本并不高，但你要去规划它的训练进程，规划它的训练数据，这个事情是非常非常麻烦的。我们给这么多的实习生，每个人出一套不同的题目让他们去刷题，这事有多费劲。</p>



<p class="wp-block-paragraph">密集型模型呢，只要有数据就开始升榜，这个是比较容易的。还有一个就是密集型模型比较容易去做微调，因为我就是训练了一个学生，从头到尾都训练下来了，那我在后边给你加一门课或者什么的，你去微调一下，这块也比较方便。</p>



<p class="wp-block-paragraph">那么我个人的使用感受呢，正常的沟通和回答基本上可以达到GPT-4O的水平了。刷题就是因为现在有很多测试题嘛，刷的肯定也是很高的。但是呢，一些比较偏门的东西，有的时候还是会出现“咦，没见过呀，不会玩了”，这个事情还是会发生的。GPT-4O在这一点上要比它强一些。</p>



<p class="wp-block-paragraph">上下文的这个参数呢，不太够多，这是现在我遇到的一个问题，因为它现在应该是128K。像我们使用GPT-4O也好，使用Gemini也好，现在都已经可以达到每一次输入到100万到200万这个TOKEN进去了。所以呢，在这一块，Deepseek V3还是要稍微差一些。目前呢还不支持多模态，据说是在开始做了。在国内的或者资源受限的情况下，处理纯文本内容，包括编程或者说普通编程吧，Deepseek V3应该已经是完完全全够用的一个状态。这就是今天跟大家讲的Deepseek V3技术上的故事吧。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>雷军千万年薪挖AI天才少女，到底值不值？</title>
		<link>https://lukefan.com/2025/01/06/%e9%9b%b7%e5%86%9b%e5%8d%83%e4%b8%87%e5%b9%b4%e8%96%aa%e6%8c%96ai%e5%a4%a9%e6%89%8d%e5%b0%91%e5%a5%b3%ef%bc%8c%e5%88%b0%e5%ba%95%e5%80%bc%e4%b8%8d%e5%80%bc%ef%bc%9f/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 06 Jan 2025 00:44:28 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[雷军、小米]]></category>
		<category><![CDATA[雷军与小米]]></category>
		<category><![CDATA[ACL大会]]></category>
		<category><![CDATA[AI人才]]></category>
		<category><![CDATA[AI人才评估]]></category>
		<category><![CDATA[AI公司招聘]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI天才少女]]></category>
		<category><![CDATA[AI实验室]]></category>
		<category><![CDATA[AI小模型]]></category>
		<category><![CDATA[AI工程团队]]></category>
		<category><![CDATA[AI工程师]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI技术圈]]></category>
		<category><![CDATA[AI新闻]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[AI炒作]]></category>
		<category><![CDATA[AI炒作价值]]></category>
		<category><![CDATA[AI热点]]></category>
		<category><![CDATA[AI研究]]></category>
		<category><![CDATA[AI科技企业]]></category>
		<category><![CDATA[AI科研]]></category>
		<category><![CDATA[AI竞争]]></category>
		<category><![CDATA[AI自然语言处理]]></category>
		<category><![CDATA[AI萝莉]]></category>
		<category><![CDATA[AI语音技术]]></category>
		<category><![CDATA[AI趋势]]></category>
		<category><![CDATA[AMR解析]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[Model训练]]></category>
		<category><![CDATA[NLP]]></category>
		<category><![CDATA[万卡集群]]></category>
		<category><![CDATA[北京大学]]></category>
		<category><![CDATA[北大]]></category>
		<category><![CDATA[北师大]]></category>
		<category><![CDATA[千万年薪]]></category>
		<category><![CDATA[国际计算语言学年会]]></category>
		<category><![CDATA[学术圈]]></category>
		<category><![CDATA[学术履历]]></category>
		<category><![CDATA[小米]]></category>
		<category><![CDATA[小米AI]]></category>
		<category><![CDATA[小米AI实验室]]></category>
		<category><![CDATA[小米AI生态]]></category>
		<category><![CDATA[小米AI计划]]></category>
		<category><![CDATA[小米万卡集群]]></category>
		<category><![CDATA[小米发展]]></category>
		<category><![CDATA[小米市值]]></category>
		<category><![CDATA[小米战略]]></category>
		<category><![CDATA[小米手机]]></category>
		<category><![CDATA[小米新动向]]></category>
		<category><![CDATA[小米模式]]></category>
		<category><![CDATA[小米科技]]></category>
		<category><![CDATA[小米股价]]></category>
		<category><![CDATA[小米股市]]></category>
		<category><![CDATA[小米高端手机]]></category>
		<category><![CDATA[小米高薪]]></category>
		<category><![CDATA[工程技术人才]]></category>
		<category><![CDATA[工程技术能力]]></category>
		<category><![CDATA[市值管理]]></category>
		<category><![CDATA[幻方量化]]></category>
		<category><![CDATA[技术IP]]></category>
		<category><![CDATA[技术储备]]></category>
		<category><![CDATA[技术创新]]></category>
		<category><![CDATA[有向无环图]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[深度求索]]></category>
		<category><![CDATA[清北校友]]></category>
		<category><![CDATA[清北班]]></category>
		<category><![CDATA[清北精英]]></category>
		<category><![CDATA[清华]]></category>
		<category><![CDATA[热点事件]]></category>
		<category><![CDATA[科技人才争夺]]></category>
		<category><![CDATA[科技圈]]></category>
		<category><![CDATA[科技大牛]]></category>
		<category><![CDATA[科研能力]]></category>
		<category><![CDATA[端测模型]]></category>
		<category><![CDATA[米粉]]></category>
		<category><![CDATA[罗福莉]]></category>
		<category><![CDATA[自然语言处理]]></category>
		<category><![CDATA[计算语言学]]></category>
		<category><![CDATA[论文发表]]></category>
		<category><![CDATA[语言学]]></category>
		<category><![CDATA[语言学研究]]></category>
		<category><![CDATA[超级小爱]]></category>
		<category><![CDATA[达摩院]]></category>
		<category><![CDATA[雷军]]></category>
		<category><![CDATA[雷军AI战略]]></category>
		<category><![CDATA[雷军亲自招人]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1827</guid>

					<description><![CDATA[嘿嘿，大家好呀！今天咱们来聊聊雷军亲自挖来的AI天才少女——罗福莉！啊啊啊！这个消息让我心头一震，竟然要开出千万年薪！究竟她值不值这个价格呢？🤔

首先，这位罗福莉可不是普通的角色！她可是个95后的学霸，从四川宜宾市第一中学到北师大，实习期间3个月自学Python，就在国际计算语言学年会上发表了8篇论文！这简直是学术界的闪亮星星啊！✨

可是，她加入小米后真能发光发热吗？小米的AI实验室已经有一整套体系，她的科研能力能不能转化为工程技术的价值，是个大问号！而且，大家都知道的，背负着千万年薪的压力，工作起来也会变得不那么轻松吧？😅

而且啊，小米这次挖人背后，绝不仅仅是为了做技术，更是为了吸引眼球，提升市值！👏雷军亲自出手，动静可不小~~小米的股价已经接近万亿市值，真是赚翻了！💰

所以说，大家觉得，这位AI萝莉值不值这个千万年薪呢？我觉得，未来仍旧充满悬念，咱们可以继续关注哦！记得点赞支持我，咱们下次再聊更劲爆的科技内幕！再见啦！👋

雷军千万年薪挖AI天才少女，到底值不值？

雷军以千万年薪挖掘95后AI天才少女罗福莉，这一事件在科技圈和财经界掀起了不小的风波。罗福莉拥有清北背景和丰富的语言学科研履历，从Deepseek到小米的跳槽使她成为舆论焦点。然而，雷军此举是科研需求还是市值策略？文章深入探讨了罗福莉的科研与工程能力，以及她的IP价值能否为小米的AI未来铺路。此外，媒体热炒背后，小米的市值因此冲刺万亿大关，也让外界对罗福莉的实际贡献产生了更多期待与质疑。关键词：雷军、AI萝莉、千万年薪、小米、罗福莉、Deepseek、AI实验室、市值、科研能力、人脉资源。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="雷军千万年薪挖AI天才少女，到底值不值？" width="900" height="506" src="https://www.youtube.com/embed/ouCqyo_Nxkk?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">雷军千万年薪挖回来的AI萝莉，到底值不值呢？大家好，欢迎收听老范讲故事的YouTube频道。今天咱们来讲一讲，雷军花了千万年薪挖回来的天才少女，到底价值几何的故事。</p>



<p class="wp-block-paragraph">首先，这个消息并不是小米官方放出来的，而是证券时报等一大堆媒体报道出来的。报道出了这样的一个故事之后，肯定就会被舆论热炒。第一个，AI现在肯定是全村最靓的仔，跟AI相关的事情更容易被媒体所报道。第二个，小米跟雷军本身就是顶流，任何事情只要沾着小米，沾着雷军了，都会被过度的炒作。</p>



<p class="wp-block-paragraph">现在这位AI天才少女叫罗福莉，号称是雷军亲自下场捞的人。这个事情到底有多亲自呢？不好说。很多记者也去找小米核实，问有没有这么个事情，是不是有千万年薪，雷军到底是怎么谈的这个事情呢？目前为止，小米没有给出官方确认。但是，如果千万年薪是真的，那这个事雷军必须是要签字确认的。如果不签字的话，这样高的薪水是开不出来的。</p>



<span id="more-1827"></span>



<p class="wp-block-paragraph">这是一方面，另外一方面，Deepseek V3也是现在的顶流。新的模型出来以后，包括美国很多AIGC圈的老大，都给出了很高的评价。国内一定是说，哎呀，你看我们做出来的东西被别人夸奖好了，这个事情我们与有荣焉一下。这位天才少女从Deepseek这边出来的，也成为了整个事件炒作中的一个推手。1,000万年薪，加上小米最近在宣传的万卡集群，也算是这个事件能够不断在热搜上停留的催化剂。</p>



<p class="wp-block-paragraph">而且前几天超级小爱演示的翻车，你也需要一些AI相关的新闻出来中和一下吧。所以这个事情被舆论热炒了。小米官方刚才我们讲了，并没有正式的回应这件事情，原因也很简单。第一个是薪资，在小米这样的公司里边，她应该是保密的。如果有谁把这个薪资泄露了，肯定还是要受到一定处罚的。第二个，这个人如果真的去了，炒的太热了是没法干活的。这个人就是千万年薪的AI萝莉，那剩下的这些没挣到1千万的人，你咋跟她一块配合干活嘛？中国人向来都不是喜欢。</p>



<p class="wp-block-paragraph">把薪资贴在脑门上的，而且有些人说呀，说你能干啥呀？就雷军亲自去请你，我不服气，她会有这样的事情。所以这个人就算是真的去了小米了，为了未来能够干活，为了能够跟团队合作。所以小米估计在回应的时候，也会相对比较谨慎。</p>



<p class="wp-block-paragraph">记得当年遇到过一个擦桌子故事。什么呢？就是我原来是清华同方的员工。有一次清华同方的一位，应该叫事业部经理吧，说：“哎，我为咱们事业部找了一个销售大牛回来，这个人可厉害了。”这位事业部经理在入职之前，就跑去把人桌子给擦了一遍。</p>



<p class="wp-block-paragraph">清华同方呢，有一点跟其他地方不太一样。什么呢？就是这帮事业部经理在当时，97年98年的时候，都是清华大学里边的老师，很多是系里边的比较大的老师，一些教授，一些副教授，在当事业部经理。然后她下边的很多员工呢，是她的学生。所以这帮学生一看，哎，这个老师到底是怎么回事呢？招了一个什么神奇的人回来？来之前你还把人桌子擦了。我们跟着你坐了这么多年，也没看你给谁擦过桌子呀。</p>



<p class="wp-block-paragraph">这个人进来，我们一定要好好称量称量她。这哥们入职了以后呢，大概没两个月就离职了。甭管她自己的能力怎么样，你进来了以后，所有人都要看看你说：“哎，这个老师给你擦过桌子，你到底是个什么样的人？”所以这样的人这么高调加入团队以后，相对来说是比较难以去开展工作的。</p>



<p class="wp-block-paragraph">那么罗福莉到底是何许人也呢？从网上公开的信息来看，95后小镇做题家，她是四川宜宾市第一中学清北班毕业的。就在这样的学校里头，专门会有这种尖子班，她们叫清北班。然后呢，去了北师大计算机系上大学，算是第一次接触电脑，以前没接触过，所以呢，一开始成绩并不好。</p>



<p class="wp-block-paragraph">大三呢，去了北大语言计算实验室实习，三个月自学Python，选择了NLP方向。NLP叫自然语言处理，就是向语言学的方向，或者计算语言学的方向转移了。开始呢，在别人的论文上署名了，就别人写的论文上头，已经开始有她名字了，这时候还没有大学毕业呢。然后保研到了北大，在北大的语言计算实验室里边。</p>



<p class="wp-block-paragraph">继续深造。2019年，在ACL大会上发表了8篇文章，这个大会叫国际计算语言学年会，简称ACL。其中有两篇是第一作者，剩下的算第二作者。第一作者的文章中，第一个是《在文本和语音中检测隐藏信息》。意思是什么呢？就是说，如果我们的语音具备某些特征的时候，这个人可能在信息里边隐藏了一些东西。比如说在隐瞒信息的时候，讲话者的最大音高强度和语速增加，而讲话持续时间减少。这些特征与欺骗检测研究中的发现相似。如果你突然声音变大了，语言变短了，就有可能在骗人。</p>



<p class="wp-block-paragraph">如果是语言特征，前面是语音特征，后边是语言特征的话，隐瞒信息的文本中，认知过程词汇，比如说“我认为怎么怎么样”、确定性词汇和正面情感词汇的使用频率更高。这表明隐藏信息可能增加认知负荷，同时伴随着更高的自信水平。这个有点像《Lie to Me》，谁说谎了是不是？这是一篇。</p>



<p class="wp-block-paragraph">另外一篇是《将AMR解析视为序列到图的转换》。这个AMR的意思是抽象意义表示有向无环图。什么意思呢？就是我们说了一句话以后，在计算机要去处理之前，要把整个这句话变成一个有向无环图。什么叫有向无环图？就是她有方向，从前到后；而无环呢，就是她最后不是循环的，是这样的一个顺序的，由点和线连接出来的一个图，有这个正确的方向，但不能循环。她做的这个论文是在这种有向无环图上进行一些数学变化，变化了以后可以进行进一步的训练或者进行进一步的识别，而且在识别率上会有一些变化。这就是她作为第一作者的两篇论文。</p>



<p class="wp-block-paragraph">研究生期间，总共发表了20多篇论文。看来这个北大还是很厉害的。2021年毕业后，加入了阿里达摩院。当时，她还写了一个公众号，告诉大家要选择有科研也有业务的公司。如果选择这种完全没有科研的公司，只做业务的，那么大概率只会去做一些边缘业务，这是没有办法在科研领域里继续深造的。所以，她当时在一堆的顶流offer里，挑中了阿里达摩院。</p>



<p class="wp-block-paragraph">觉得这边还是可以做一些科研的。2022年呢，这就是在阿里达摩院里头待了一年，跳槽去了换方量化。据说呢，也是在这一年里头领证结婚，夫妻两个在杭州还买了房。幻方呢，在2023年分拆深度求索，也就是开始做Deepseek的这个公司。那么这位罗福莉呢，也就跟着去了深度求索。罗福莉在Deepseek Coder这个论文上作为第六作者，也是署名的。幻方以及深度求索，其实发的各种文章还是很多的。而且呢，她们会很大方的将所有贡献者都写在作者名单里头，或者叫贡献者名单里头。</p>



<p class="wp-block-paragraph">比如说最近大火的Deepseek V3里边儿，大概是有200个贡献者。这200个贡献者呢，有150个是工程师，还有一些其他的支持人员，还包括10名已经离职的人员。罗福莉的名字呢，是在为Deepseek V3做贡献的已经离职人员这个里面还是有的。号称呢，她是参与了Deepseek V2版本的开发。当然了，这些都是大家的描述，具体在里边参与了什么，其实并没有表述。</p>



<p class="wp-block-paragraph">2024年年底跳槽去了小米，这就是她整个的一个履历。那么下面我们就要去看千万年薪到底值不值的问题了。其实挖技术大牛回来，我们到底应该如何评价其价值呢？这个一直是很多的投资人，包括一些大老板需要去思考的问题。你挖回来以后是给钱呀，给期权呀，然后给她各种的资源呀，还是给她一个大的团队，一个很好的研发环境，你到底给她什么，这都是我们要先对人的价值进行评估的一个过程。</p>



<p class="wp-block-paragraph">在挖人回来的时候，科研能力到底重不重要？如果这是一个科研院所，我们需要再去国家申请经费，再去做一些更新的科研研发的时候，那她的科研能力可能是重要的。但是对于小米这样的一个产品型的公司来说，这个挖回来的人科研能力到底有多大，其实没有那么重要。那么这种技术带头人呢，她们需要的能力是什么？第一是对前沿的理解和认知。你真挖一个人回来，说这个最前沿的东西是什么，我说不清楚，我看不懂，谁在搞这个事我不知道。</p>



<p class="wp-block-paragraph">这个事是不允许的。而且这种认知呢，是真的可以去跟最前沿研究的人进行面对面的沟通和讨论的。我们也见过很多，比如说像猎头公司这些人，对这个最前沿的发展也是有一定认知的。但是呢，她一旦是跟前沿的这些人去沟通的时候，就会露馅。像罗福莉在这块应该还是可以的。</p>



<p class="wp-block-paragraph">工程技术能力呢，这块要看你具体要她干什么。你比如说，有些人说：“我真的是需要有一个人回来替我解决一个很难的难题。”那么在这个时候呢，就需要有工程技术能力的人回来。她能够管理团队、能够面试团队，甚至能够挖角原来的团队，可以带出一个团队出来，这个是工程技术能力，还有人脉资源。</p>



<p class="wp-block-paragraph">但是人脉资源呢，一方面是说你能不能忽悠起一帮人来跟你干活，另外一方面的话，就是你做出来的产品是不是可以让顶流的圈子快速去认可。因为任何人，只要做出这种高精尖的东西来，她的这种认可的速度或者认可的成本都是挺高的。认可的速度都不会那么快，但一旦是有一个自己人，大家都已经熟悉了，你就是这圈子的人，你也做出过相应的成绩来。那你说：“我继续在发表相应的论文或者发表相应的成果。”那么别人就会优先选择相信你，所以这也是人脉的一个很重要的点。</p>



<p class="wp-block-paragraph">最后呢，就是她的IP价值，这个人是不是有一定的影响力。通过这几个方面来评估一个技术大牛的价值。从能够公开找到的信息呢，其实没有办法去评定罗福莉具体都做过些什么东西。这个事现在发出来的信息比较少，不是写了什么论文就会什么东西。刚才我们说了她写了哪些论文，我们认为说她就会这几样东西，这个事一定是非常片面的。她可能研究的涉猎非常广泛，而且最前沿的很多科学与技术其实是相通的。只是可能这几个点，它是适合出来写论文的，剩下的点呢，虽然不适合出来写论文，但你要在Deepseek这样的参与到里边去，你还是要去解决或者还是要去做事情的。所以呢，并不能认为说她就会这个自然语言的这点东西。</p>



<p class="wp-block-paragraph">罗福莉呢，应该还是一个语言学方面的研究型人才。罗福莉的价值到底应该如何去评价呢？第一个，它的IP价值呢，现在还算是拉满了。为什么叫还算是拉满呢？因为有的时候，就叫“花花轿子人人坐，人人抬”。现在这样的一个消息出来了以后，她也借助了Deepseek的光环，以及小米和雷军的光环，有大量的媒体出来炒作，来捧这个事情了。</p>



<p class="wp-block-paragraph">这个人在她的行业内，到底有什么样的名声，我们不去管她，但至少在公众视角里头，这已经算是一个很厉害的人了。当然了，以深度求索的这种招聘以及用人原则来说呢，像罗福莉这样的履历的人，其实在里面还是蛮多的，因为里面各种清华、北大、德大这些人其实是蛮多的。而且这些人呢，好多还没有毕业，就是可能在里边做博士实习，或者做很多这样的事情，她们就都已经开始在各个论文里边去署名了。</p>



<p class="wp-block-paragraph">所以呢，并不是说以这个论文量，以她的师从，或者是北大的这个学历，她是个硕士嘛，还不是博士，她就已经是站到一个什么顶流上了，其实距离那个还是有一点点差距的。只是呢，现在通过炒作的方式，让她站得比较靠前。</p>



<p class="wp-block-paragraph">在Deepseek里面呢，毕业了一两年的人呢，就可以在里边挑大梁干事了。真正负责的呢，可能是有个四五年经验的一些人。而以罗福莉的这个资历，进去的时候呢，有可能能够负责一个项目，但也未必，因为呢它属于是相对来说比较专项的科学家，并不是工程方面的这种专家。因为工程专家是写不出这么多论文来的。</p>



<p class="wp-block-paragraph">在科研能力上，至少是语言学方面的，罗福莉应该还是有所建树的，写论文绝对好手。工程技术能力的话，没有验证。人脉资源的话，大家注意，工程技术方面的人脉资源跟学术圈的人脉资源是完全两回事。她有可能在学术圈有人认识了，知道这个名字，她可能参加各种会，很多的会议上的这些教授，这些大拿也都能跟她聊得来。但是呢，你说真正能够拉起一帮人来，把事干出来的，那是完全另外一拨人。</p>



<p class="wp-block-paragraph">至于她能不能做工程技术方面的事情，有没有工程技术方面的人脉，这件事呢？</p>



<p class="wp-block-paragraph">我只能说，没有验证过，不知道。那么小米到底想干什么呢？大概率呢，也没指望罗福莉真的能做出什么来。因为小米自己也是有AI实验室，而且成立了很长时间。这个AI实验室自己也是有完整的体系架构。你不可能说我招了一个新人，然后你现在就给你另起一摊，或者说我把原来的架给我打散了，现在你就是老大了。她肯定还是要在小米的AI实验室里边，在她相应的位置去进行工作和研究的。</p>



<p class="wp-block-paragraph">Deepseek这样的模型应该也不是小米追求的，因为如果要部署和训练Deepseek这样的模型的话，罗福莉应该是可以给出一些指导的。你毕竟原来在一个屋里，把东西做出来的。通常的科研和工程是两条线，罗福莉未必能够有能力挖角组建面试带领工程团队。像我们以前也招过这种工程老大，那就是招完了以后就问她说：“你能不能带回团队来？”像以前你前面几家老板的这个团队，你能不能找得来？如果找不来的话，那给你机会去面试，你能不能去面试一堆能干活的人出来？</p>



<p class="wp-block-paragraph">等你把这个团队组建起来以后，你能不能带着这个团队去把这个事干出来？这个是对于工程老大的这种要求，这不是对于科研老大的要求。</p>



<p class="wp-block-paragraph">小米最近还在说：“我们就训练端侧模型小模型。”这都是雷军最近说的话。当然了，说什么并不重要，做什么呢其实也不重要。那什么重要呢？就是为什么这么说，这个才是最重要的。小米毕竟是个卖手机的，你不这么说怎么让用户下单去买那个更贵的、更高端的手机呢？所以她一定会去喊说：“我们不去关注这种大模型，我们要关注端测小模型。”</p>



<p class="wp-block-paragraph">但是呢，我相信小米也还是会照着Deepseek的这个套路，自己在训练一套云端模型。当然这个训练的应该也算是一个技术储备吧。像小米这样的公司，更大概率会在国内的各个大模型厂商之间进行平衡。就是什么字节、百度、阿里，包括Minimax，她可能都会用那么点，包括Deepseek可能都会去用一点点，然后在不同的应用里边去调用不同的模型。这应该是小米的一个策略。</p>



<p class="wp-block-paragraph">然后自己同时训练一个模型呢，算是有一个技术储备，可以跟这些大模型厂商进行平等对话的一个东西。在中国就是这样，如果别人发现你不懂的话，总是要在你身上咬一口的。所以小米在这块呢，应该还是会做。</p>



<p class="wp-block-paragraph">另外，对于小米来说，超级小爱的翻车，这个热度也还是要压一下的。讲到这呢，你说我们的结论，这个1,000万的年薪到底值不值？这个事情我觉得，大家自己去做判断就好了。你让我现在来给大家下一结论，说这事太值了，反正我没看出来；说这事肯定不值，咱们了解的信息呢也不够充分，也就只能是这样的一个情况。</p>



<p class="wp-block-paragraph">我只能说以这个罗福莉现在从外界可以披露的公开信息来看，这个1,000万的年薪呢，稍微有一点点存疑。但是我相信呢，小米这个事情，甭管是她有意做的，还是无意做的，她的目的已经实现了。她的目的是什么呢？她股价涨了。除了卖车之外，现在我们还做AI了，还有一个万卡集群了，还从现在当红炸子鸡Deepseek挖了人出来了，号称雷军亲自下手，给了千万年薪了。</p>



<p class="wp-block-paragraph">小米现在已经接近1万亿港币的市值了，她现在的市值是9,097亿港币，可能到周一开盘的时候，就直接冲万亿就过去了。所以我觉得小米呢，这个事情肯定已经好处落袋了，这个市值已经收获了，收获的还是很高的一个市值。</p>



<p class="wp-block-paragraph">至于未来罗福莉到底能够在小米里边做什么东西出来，或者她到底能够在小米里边混多久，或者说小米未来到底会如何对此事进行官方回应，我觉得还是可以拭目以待的。未来也许还有新的瓜可以去吃。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里，感谢大家收听，请帮忙点赞，点小铃铛，参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道，再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
