<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>模型训练 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/%e6%a8%a1%e5%9e%8b%e8%ae%ad%e7%bb%83/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Thu, 10 Apr 2025 13:46:10 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1.2</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>模型训练 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？</title>
		<link>https://lukefan.com/2025/04/07/llama-4%e6%82%84%e7%84%b6%e5%8f%91%e5%b8%83%e9%9c%87%e6%92%bc%e4%b8%8d%e8%b6%b3%ef%bc%9f%e5%af%b9%e6%af%94deepseek%e4%b8%8e%e5%8d%83%e9%97%ae%ef%bc%8cmeta%e7%9a%84moe%e6%9e%b6%e6%9e%84%e5%92%8c/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 07 Apr 2025 00:45:28 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[1000万Token上下文]]></category>
		<category><![CDATA[400B]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI应用场景]]></category>
		<category><![CDATA[AI新闻]]></category>
		<category><![CDATA[AI未来发展]]></category>
		<category><![CDATA[AI模型发布]]></category>
		<category><![CDATA[AI竞赛]]></category>
		<category><![CDATA[AI算力]]></category>
		<category><![CDATA[Claude 3.7]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[FP8精度]]></category>
		<category><![CDATA[Function Call]]></category>
		<category><![CDATA[Gemini 2.5 Pro]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[Grok (XAI)]]></category>
		<category><![CDATA[H100 GPU]]></category>
		<category><![CDATA[INT4量化]]></category>
		<category><![CDATA[Llama 3]]></category>
		<category><![CDATA[Llama 4]]></category>
		<category><![CDATA[Llama 4 Behemoth]]></category>
		<category><![CDATA[Llama 4 MARVELIC]]></category>
		<category><![CDATA[Llama 4 Scout]]></category>
		<category><![CDATA[Llama 4发布反响平淡原因]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[Meta AI]]></category>
		<category><![CDATA[Meta战略]]></category>
		<category><![CDATA[Mixture of Experts]]></category>
		<category><![CDATA[MOE架构]]></category>
		<category><![CDATA[专家模块]]></category>
		<category><![CDATA[中文能力提升]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[全模态AI进展]]></category>
		<category><![CDATA[千问 (Qwen)]]></category>
		<category><![CDATA[卡估值]]></category>
		<category><![CDATA[多模态输入]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[字节AI]]></category>
		<category><![CDATA[小模型竞争]]></category>
		<category><![CDATA[开源LLM对比]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[开源模型内卷]]></category>
		<category><![CDATA[开源社区]]></category>
		<category><![CDATA[推理速度]]></category>
		<category><![CDATA[文本输出]]></category>
		<category><![CDATA[模型微调]]></category>
		<category><![CDATA[模型性能比较]]></category>
		<category><![CDATA[模型测评]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[活跃参数]]></category>
		<category><![CDATA[流量入口]]></category>
		<category><![CDATA[知识蒸馏]]></category>
		<category><![CDATA[硬件要求]]></category>
		<category><![CDATA[端到端模型]]></category>
		<category><![CDATA[腾讯AI]]></category>
		<category><![CDATA[谷歌AI]]></category>
		<category><![CDATA[超级APP趋势]]></category>
		<category><![CDATA[长上下文]]></category>
		<category><![CDATA[阿里AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2075</guid>

					<description><![CDATA[🔥家人们！今天凌晨Meta直接扔核弹了！！
LLAMA4带着1千万token上下文杀疯了啊啊啊！！！
（ps：1千万token≈20小时超长视频解析能力‼️）

这次直接祭出3大杀器：
1️⃣【侦察兵版】109B参数+16专家模块
2️⃣【独行侠版】400B参数吊打GPT4O
3️⃣【巨兽版】2000B参数+32K显卡训练（国内集体倒吸凉气）

最绝的是那个1千万token！！
别人家还在卷64k/200万
Meta直接拉满到10M级！这是什么概念？
相当于一口气读完30本《三体》全集！！
（DeepSeek连夜改PPT了吧🤣）

但这次为啥没刷屏？
真相太扎心👇
👉国产千问/DeepSeek早就把赛道占满
👉109B起步的巨无霸根本跑不动！
👉超级APP大战已经白热化...

最恐怖的是！！
Meta明牌说要搞端到端全模态！！
（语音/视频/图片直接互转要来了‼️）
现在压力给到某讯某里某节...

评论区快告诉我！！
你们站LLAMA4还是国产大模型？

Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？

eta **Llama 4发布**，扎克伯格亲自官宣，但市场反响平平。这款采用**MOE架构**（**混合专家模型**）的**AI大模型**分为Scout (109B)、Marvelic (400B)和未来发布的Behemoth (2000B)版本，最大亮点是支持业界领先的**1000万TOKEN**超**长上下文**处理，支持**多模态**输入（文本、图像、音视频）和文本输出。性能上，**Llama 4**较Llama 3有显著提升（尤其**中文**能力），基本追平**GPT-4O**、**Claude 3.7**，但可能稍逊于**Gemini 2.5 Pro**。然而，其发布未如预期般震撼，原因在于**开源大模型**领域竞争激烈，已有**DeepSeek**、**千问**等强劲对手，且Llama 4放弃小模型（最低需**H100 GPU**运行），未能带来颠覆性突破，引发“审美疲劳”。当前**AI趋势**聚焦**超级APP**竞赛、端到端**多模态**能力及**AI Agent**/**Function Call**整合（**Meta**在此落后）。**Meta AI**虽手握资源，但在**AI竞争**中面临挑战，其**开源大模型**领导地位受**Grok**等模型冲击，亟需在“卡估值”逻辑减弱前，拿出成功的应用场景与**超级APP**，否则将面临严峻考验。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="Llama 4悄然发布震撼不足？对比DeepSeek与千问，Meta的MOE架构和千万级上下文能否挽回开源领导地位，避免被超级APP浪潮抛弃？" width="900" height="506" src="https://www.youtube.com/embed/vWmFaUzNqlg?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Llama4发布了。这里的黎明静悄悄，没有什么响动。这是怎么回事？</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。一觉醒来，Llama4就发布了。扎克伯格亲自在Facebook的REELS（也就是Facebook的短视频里面）发了一条视频，说Llama4发布了，今天是Llama4日。</p>



<p class="wp-block-paragraph">Llama4呢，一共是有三个版本：<br>第一个叫Scout（侦察兵版本），总参数1,090亿（也就是109B），活跃参数是170亿，包含16个专家模块。对的，Llama终于也放弃抵抗了，从Llama4开始变成Moe了。在Llama4之前的版本都是单一体的模型，Llama3.3还给了一个400多B的单一模型，到Llama4彻底放弃抵抗了。</p>



<p class="wp-block-paragraph">现在呢，支持1,000万TOKEN这种上下文，这个是Llama4最大的一个特点。DeepSeek是64K（也就是64,000个TOKEN上下文），现在上下文比较大的Gemini大概是能到2兆（200万），Llama4直接给了一个10兆（1,000万TOKEN），这是它做的一个很创新的点。</p>



<span id="more-2075"></span>



<p class="wp-block-paragraph">1,000万TOKEN的上下文可以干嘛？可以处理20小时以上的视频或者超长文档，是行业领先的长上下文技术。采用了混合专家模型（也就是MOE架构），在INT4量化后，可以在单个的H100 GPU上运行，每秒处理42,400个TOKEN，还是速度比较快的。但是要注意，即使经过量化到Intel4上，它也必须要有H100，否则跑不起来这东西。所以咱们普通的电脑就别惦记了，最小的模型就是它了，没有更小的了。</p>



<p class="wp-block-paragraph">所以这一次Llama4的发布，并不像以前的Llama1、Llama2、Llama3似的，把各个尺寸的模型都做出来（从7b、14b、72b、32b什么这些都做一遍），没有，上来最小的一个就是109B。它可以支持文本、图像、音频、视频的输入，目前呢只支持文本的输出，未来应该会出现全模态输出的版本。这是它最小的一个侦察兵。</p>



<p class="wp-block-paragraph">中间的模型呢叫MARVELIC（独行侠），总参数量400B，活跃参数量17B，包含128个专家模块。它的专家模块变多了，超越GPT4O、DeepSeek V3，仅次于闭源模型Gemini2.5 Pro。Gemini2.5 Pro现在还是最强的，没有之一。在编程和数学任务中，仅用DeepSeek V3一半的参数即可达到相当的性能，但是你上再多参数也就这水平了。</p>



<p class="wp-block-paragraph">所以，它在数学跟编程角度上来说，跟DeepSeek V3应该是半斤八两，只是它的运算效率要更高一些。最大的一个叫Behemoth（巨兽），总参数量2000B，活跃参数量288B，包含16个专家模块，使用30万亿多模态TOKEN（就是文本、图像、视频），在32K（也就是32,000个GPU）上训练，FP8精度，提升效率。所以，你有足够的显卡才可以玩这件事情——32,000块显卡。Deepseek到现在为止，都没有承认它有这么多块显卡。所以，这种巨兽，国内追赶起来是比较费劲的。</p>



<p class="wp-block-paragraph">只是呢，这一个产品目前并没有发布出来，前面两个发布了，这个应该是在2025年的下半年发布。这个巨兽在数学、科学等基准测试中，超越了GPT 4.5、Claude sonnet 3.7和Gemini2.0 Pro。但是是不是超越了2.5 Pro，我现在没有看到相应的介绍。它呢，主要的作用是作为教师模型，用于知识蒸馏——就是我做一最大的，然后下边这些小的模型、中型的模型，都是拿这个最大的进行蒸馏，蒸馏出来的。现在呢，它也转向了MOE，性能有所提升，但是呢并没有那么明显。最大的特点就是1,000万输入，这个是Llama4做的最不一样的一个点。</p>



<p class="wp-block-paragraph">目前呢，支持全模态输入、文字输出；未来呢，会支持全模态输出，就是端到端的全模态输出。你甚至可以跟它去直接聊天，还可以打断它，就像现在的GPT4O高级语音功能一样。但是这个什么时候出来还不确定。如果能够有全模态输出的话，还是值得期待一下的。未来的方向一定是全模态、端到端的输入输出，现在新的模型都在向这个方向走。</p>



<p class="wp-block-paragraph">那么，为什么没有什么声音讨论它呢？Llama1出来的时候，整个的行业都震动了——这样程度的一个模型一下就开源了，大家都可以拿来去研究了。Llama2出来一看，又可以往前走一步。其实Llama1跟GPT3.5还是有差距的，到Llama2出来以后说“哎，可以用了”，进行一些微调以后，就真的可以去解决一些ToB的，或者说使用范围相对比较集中的应用，就可以直接用起来了。我记得是在两年前，就很多国内的项目就在微调Llama。等到Llama3出来的时候说，这个虽然达不到GPT4的水平，但是已经很接近了，大家拿这个东西去稍微调一调，就可以跑了。</p>



<p class="wp-block-paragraph">在Llama3出来以后的话，千问就开始疯狂的去输出各种各样尺寸的模型，就是千问2.0、千问2.5，这一批就直接追赶上来了。但是到Llama4出来，大家没说什么。</p>



<p class="wp-block-paragraph">这到底是什么样的一个情况？我呢，第一时间还上去试了一下。现在你到Open Router这个网站上，你是可以进行测试的，而且是免费的。侦察兵版和独行侠版都可以使用，也有收费的版本。收费版本就是比免费的版本稍微快一点点，主观感受上没有特别大的差异。</p>



<p class="wp-block-paragraph">那你说真的没有什么提升吗？这个肯定不对。它呢，跟现在的GPT-4O、Gemini 2.5、Claude 3.7这种主流模型比起来，确实没有什么提升。哈哈，这个基本上跟他们算站在同一个起跑线上，可能跟Gemini 2.5还稍微的差一点。Gemini 2.5不太友好的地方就是它比较慢，现在的Llama 4是很快的。但是呢，这个Llama 4比Llama 3、3.1、3.2、3.3这些版本还是有巨大提升的，特别是在中文这一块，效果好了非常非常多。大家可以去试一试，就完全可以达到能用的状态了。这个原来在Llama 3的水平上还是达不到的。</p>



<p class="wp-block-paragraph">那么为什么不觉得震撼了呢？原来Llama虽然和闭源模型比起来稍有差距，但是呢，毕竟你是开源的吧，开源圈里的扛把子。现在的开源模型也卷起来了，DeepSeek绝对达到了可用程度，千问现在也绝对在数量上碾压。怎么叫数量上碾压？就是千问的模型是数量非常大呀，零点几B，然后到4B、7B、14B、32B、34B，多模态的推理的全都有。这块非常非常完善，而且有非常多的人在以千问模型为基础进行微调。因为你要到手机上，或者到一些嵌入式设备上去进行操控的话，你拿千问这种小模型微调是很方便的。给你一个105B的模型，你拿去微调的话，这个就有点费劲了。所以现在你到Hugging Face上去看，最受欢迎的开源模型基本上都是千问或者是千问系的。</p>



<p class="wp-block-paragraph">所以从数量上，千问绝对赶超Llama。从能用程度上说，DeepSeek比它早发布了几个月，已经达到完全可用的一个状态了。现在Llama 4再拿出来，并没有划时代的提升。同样作为开源版本的大模型，他就没有那么震撼，已经有审美疲劳了。当然了，Llama 4出来，应该大家还是会去抄的。这Llama 1、Llama 2、Llama 3出来以后，实际上对至少国内的大模型产业都是有极强的促进作用的。Llama 4出来呢，应该也是有这种意义。千问和DeepSeek应该会尝试使用这种超长上下文的技术，因为它是1,000万TOKEN嘛。所以这一块至少千问应该会去追赶一下，DeepSeek的话……</p>



<p class="wp-block-paragraph">现在到底在忙什么？不确定。当然，DeepSeek呢，应该也会在多模态上奋起直追。只是奋起直追多莫泰这个事呢，对于卡的数量是一个考验。DeepSeek前面一直说我没有那么多卡，看看后边这个话怎么把它说圆回来吧。</p>



<p class="wp-block-paragraph">那么现在大模型到底在卷什么？大模型最终有可能还是会走向超级APP的道路。好像现在各大厂商依然在尝试卷超级APP，而且超级APP才是流量入口的一个锚点。你没有流量入口的话，你的模型做的再好，其实没有什么意义。这件事情上，以谷歌和Meta作为反面典型，大家看一看。谷歌的大模型其实一直做的还可以的，只是呢它的入口做的比较烂，大家就一直用的比较少。谷歌每一次出新的大模型，先给程序员用，他自己telegram内部用户，甭管是付费的还是免费的，都要很晚才能接触到他们最新的模型。而Meta，Llama做到现在了，做的这么热闹，Meta的用户，甭管是Facebook用户、Instagram用户，其实并没有感觉有特别大的体验上的提升。这个是两个典型案例。</p>



<p class="wp-block-paragraph">这里还有一个正面案例，谁啊？就是马斯克的Xa i 1，一做出来以后，第一件事在x平台上，直接给了一个最核心的入口，直接给了一个Grok的入口，你一点就可以进去聊天去了。现在ChatGPT呢已经是超级APP了，Claude呢应该也接近成为超级APP了。谷歌呢算突然惊醒，ChatGPT 2.5 Pro上来以后，直接把Gemini客户端的经理给干掉了，把Notebook LM的负责人拎回来，你去给大家继续去做Gemini客户端去。这个Notebook LM是用户所喜欢的，Gemini被人骂了这么久了，我们要换一换了。而且Gemini 2.5 Pro一上来，就直接给Gemini的免费用户就开放了。所以谷歌已经醒过味了，说我们要换一个姿势了。</p>



<p class="wp-block-paragraph">现在呢卷王们已经下场了。阿里还在内斗，千问跟夸克还要在内部做一次赛马。腾讯的元宝已经开始疯狂砸钱了。现在的进展到什么样的一个状态了？就这些超级APP都是带有搜索、知识库和靠谱推理的一个结果生成。目前我们现在看到的所有的超级APP，或者叫AI方面的超级APP，基本上都是在这个起跑线上。语音端到端呢，OpenAI做了，Claude我不确定做没做，好像没有。Grok英文的部分已经有了，中文的部分没有。豆包已经做出来了，千问和夸克现在正在奋起直追，腾讯的元宝也还在努力的往前走。</p>



<p class="wp-block-paragraph">DeepSeek在这一块做的稍微有点拉胯。它的语音部分和图屏的部分，就是多模态的部分，稍微差那么一点点。再往后就是图片、视频、音频的理解和生成。现在这些呃超级APP，OpenAI是完全可以实现图片理解、图片生成，甚至是视频生成，这些功能都是完整的。谷歌其实它的功能都做出来了，但是Gemini里头好多没接，这块还要再奋起直追一下。</p>



<p class="wp-block-paragraph">阿里的千问还有像夸克，包括字节的豆包，在这一块已经都做了图片理解、图片生成，包括修图改图，包括一些视频生成，现在他们都已经做出来了。其他的还在奋起直追。全新的形态是无法跟传统的形态进行有机结合的，或者结合起来比较费劲。现在唯一结合成功，或者大家感觉还比较顺眼的，就是x集合XAI，而且两个公司还合并了。</p>



<p class="wp-block-paragraph">其他公司都是尝试在传统的产品形态之外，寻找新的应用形态，或者新的用户使用形态。所以都是做的独立的APP，甭管是腾讯、阿里还是谷歌，或者是字节，都是做出独立APP来，希望能够去抢占新的入口。现在呢是新场景已经有了，底层技术基本上拉平，就这么一个状态。甭管是豆包的推理模型，还是腾讯推理模型，包括DeepSeek，还有像谷歌的Gemini 2.5 Pro、GPT-4O、Claude 3.7这些模型，它们其实基本上算是拉平了。谁比谁好一些，但是并没有好出那么多去。</p>



<p class="wp-block-paragraph">现在可能唯一能够明显感觉到有差距的，是Gemini 2.5 Pro。那么当新场景出现了，底层技术又基本拉平以后，剩下的就是一个字了——卷吧。这件事咱们中国人擅长，后面还要看大家怎么冲上去。</p>



<p class="wp-block-paragraph">现在留给Meta的时间已经不多了，开源大模型的老大位置应该已经不是他的了。Grok的卡应该比Llama可能稍微少一些，但是XAI的卡要比Llama的新。Grok也是开源的，只是Grok没有把最新的开源出来。它现在是上一代的Grok 2要去开源，现在Grok 3出来以后，它准备把2开源出来。这个3的话可能要等到Grok 4出来以后再去开源。但是呢，你也是开源模型，而且Grok 3特别是配上AI agent以后，相当的好用。</p>



<p class="wp-block-paragraph">DeepSeek在多模态和长文本上呢，还有所欠缺，但是达到可用状态，这个要比Llama4要早好几个月。所以在这一块上，Meta的开源大模型老大的位置也被动摇了。再加上可能在最近的一两周里头，千问3也要出来。现在大家使用都是千问2.5，千问3一旦下来以后的话，有可能整个开源大模型的座次……</p>



<p class="wp-block-paragraph">还要再重排一次。开发独立APP对于美塔来说，应该是刻不容缓了。Meta也有计划，在4月份准备上线超级APP。</p>



<p class="wp-block-paragraph">这个中间呢，还少了一步。Meta少哪一步？AI agent它没做。就甭管是deep search、deeper search或者这些东西，他都没做。而且呢，他还缺一个什么东西？就是他的function call和MCP都没有。他的模型你只能是给出提示词，然后那边生成结果。你说我在这边给一大堆的function call的描述，或者是给MCP的描述，我在生成的过程中可以调用外部数据，这个到Llama4依然没有。所以这一块，Meta稍微有些落后了。</p>



<p class="wp-block-paragraph">而且现在从Meta发布的Llama4来看，它已经完全退出了小模型的竞争。最小的侦察兵109B，你没有H100跑不起来。在这一块上，阿里已经算是稳赢了。所以阿里作为AI公司，基本上已经站住脚跟了。现在其他还在做小模型的公司，一个是微软，一个是谷歌。谷歌的Gemma3现在是有各种小模型的。还有就是欧洲的Mistral，他们也有一些小模型，只是呢Mistral的声音没有那么大。</p>



<p class="wp-block-paragraph">Meta呢，算是手里有卡，有数据、有用户、有钱，还有一大堆的现成的用户使用场景。必须要做的事情，是探索新的用户使用场景。如果老惦记去玩眼镜的话，那可能真的会被抛下的。AI的牛皮不能总靠卡的数量来维持下去，卡估值的逻辑正在坍塌。所以Meta必须要在卡估值逻辑坍塌之前，拿出来一个被大家可以接受的超级APP，或者说一个全新应用场景的服务，可以去跟其他的这些大模型超级APP去进行竞争。否则的话，它的故事会讲不下去的。</p>



<p class="wp-block-paragraph">好，这就是今天Llama 4发出了以后的第一期视频。未来的话，Llama 4可能更进一步的功能被暴露出来，或者说大家又试出什么好玩的来，那再去录视频跟大家分享。好，这一期就讲到这里，感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>英伟达黄仁勋CES霸气登场！鳄鱼皮夹克发售5090显卡，钱包快捂住还是准备剁手？</title>
		<link>https://lukefan.com/2025/01/09/%e8%8b%b1%e4%bc%9f%e8%be%be%e9%bb%84%e4%bb%81%e5%8b%8bces%e9%9c%b8%e6%b0%94%e7%99%bb%e5%9c%ba%ef%bc%81%e9%b3%84%e9%b1%bc%e7%9a%ae%e5%a4%b9%e5%85%8b%e5%8f%91%e5%94%ae5090%e6%98%be%e5%8d%a1%ef%bc%8c/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 09 Jan 2025 00:39:50 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[英伟达，NVIDIA，黄教主，GPU]]></category>
		<category><![CDATA[英伟达，黄仁勋的故事]]></category>
		<category><![CDATA[30系显卡]]></category>
		<category><![CDATA[40系显卡]]></category>
		<category><![CDATA[5070显卡]]></category>
		<category><![CDATA[5080显卡]]></category>
		<category><![CDATA[5090D显卡]]></category>
		<category><![CDATA[5090显卡]]></category>
		<category><![CDATA[50系列性能]]></category>
		<category><![CDATA[50系列显卡]]></category>
		<category><![CDATA[AI主机]]></category>
		<category><![CDATA[AI硬件选择]]></category>
		<category><![CDATA[ARM CPU]]></category>
		<category><![CDATA[Blackwell架构]]></category>
		<category><![CDATA[CES发布]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GBNV Link 72]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[Llama3 405B]]></category>
		<category><![CDATA[Mac mini M4]]></category>
		<category><![CDATA[MacBook]]></category>
		<category><![CDATA[Project DigITs]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[云主机显卡]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[光鲜亮丽]]></category>
		<category><![CDATA[大力水手4]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[工程师]]></category>
		<category><![CDATA[数据分析]]></category>
		<category><![CDATA[数据科学家]]></category>
		<category><![CDATA[显卡与大模型]]></category>
		<category><![CDATA[显卡与游戏]]></category>
		<category><![CDATA[显卡价格]]></category>
		<category><![CDATA[显卡兼容性问题]]></category>
		<category><![CDATA[显卡创新]]></category>
		<category><![CDATA[显卡功耗]]></category>
		<category><![CDATA[显卡升级]]></category>
		<category><![CDATA[显卡对比分析]]></category>
		<category><![CDATA[显卡市场]]></category>
		<category><![CDATA[显卡市场动态]]></category>
		<category><![CDATA[显卡性能]]></category>
		<category><![CDATA[显卡推荐]]></category>
		<category><![CDATA[显卡散热]]></category>
		<category><![CDATA[显卡构建]]></category>
		<category><![CDATA[显卡架构]]></category>
		<category><![CDATA[显卡游戏需求]]></category>
		<category><![CDATA[显卡的使用]]></category>
		<category><![CDATA[显卡的未来]]></category>
		<category><![CDATA[显卡科技产品]]></category>
		<category><![CDATA[显卡租赁]]></category>
		<category><![CDATA[显卡设置]]></category>
		<category><![CDATA[显卡购买建议]]></category>
		<category><![CDATA[显卡适配]]></category>
		<category><![CDATA[显卡金融属性]]></category>
		<category><![CDATA[显卡降价]]></category>
		<category><![CDATA[显卡需求分析]]></category>
		<category><![CDATA[服务器部署]]></category>
		<category><![CDATA[本地渲染]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[游戏显卡]]></category>
		<category><![CDATA[游戏玩家]]></category>
		<category><![CDATA[硬件发展趋势]]></category>
		<category><![CDATA[硬件性能对比]]></category>
		<category><![CDATA[硬件推荐]]></category>
		<category><![CDATA[硬件推荐指南]]></category>
		<category><![CDATA[硬件用户体验]]></category>
		<category><![CDATA[硬件评论]]></category>
		<category><![CDATA[科技发展]]></category>
		<category><![CDATA[统一内存]]></category>
		<category><![CDATA[英伟达]]></category>
		<category><![CDATA[英伟达发布会]]></category>
		<category><![CDATA[高端显卡]]></category>
		<category><![CDATA[高级硬件]]></category>
		<category><![CDATA[鳄鱼皮印花夹克]]></category>
		<category><![CDATA[黄仁勋]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1836</guid>

					<description><![CDATA[哇哇哇，大家好啊！今天咱们来聊聊CES上最靓的仔——黄仁勋！他这次可真是带着大招而来，钱包准备好了吗？？？？？？💵💥

首先，大家都知道英伟达如今是AI领域的巨头，黄教主秒杀一切对手，今天在CES上发布的新品简直让人心动得不行！🔥尤其是5090显卡和神秘的Project DIGITS，令人不禁想要加入购物车！

5090显卡，不就是我电脑里那颗3060的升华版吗？但是这次教主玩得真不简单！5090D的降价策略让原本囤货的朋友们瞬间有了“一地鸡毛”的感觉！📉😱可别小看了这个显卡，黑井系列的设计简直逆天，想玩高分辨率游戏的小伙伴，5090绝对是个不二之选！！！

但是，Project DIGITS更是引发了全场热议！3000美金的价格和它的实际用途成了大家关注的焦点。🤔花这么多钱，是为了把它放在家里供着吗？我觉得，得考虑一下哦！而且，它可不是普通消费者能纳入使用范围的产品，只有真正的数据工程师才能驾驭它，以至于普通用户可能还得绞尽脑汁才能搞定！

总而言之，黄教主这次在CES的表现确实让人惊艳，但消费决策可得谨慎！如果你是有钱人，炫耀一下也无妨；但如果你只是普通玩家，买之前先考虑一下用得上吗？💭✨

所以，大家听到这里，是不是也觉得心里有点小紧张呢？快来评论区嗨聊一下你们的想法吧！❤️别忘了点赞，支持一下哦！我们下期再见！✌️

英伟达黄仁勋CES霸气登场！鳄鱼皮夹克发售5090显卡，钱包快捂住还是准备剁手？

英伟达黄仁勋以鳄鱼皮印花夹克亮相CES，震撼发布新一代50系列显卡和Project DIGITS AI主机。其中，5090显卡基于Blackwell架构的性能升级备受关注，而大力水手4插帧技术更是游戏体验的革新。不仅如此，小巧强悍的Project DIGITS 吸睛无数，凭借支持200B模型的能力俨然成为AI领域的新选择。然而，高昂的价格和复杂的维护需求让许多玩家和用户望而却步。到底是购买还是观望？了解英伟达新品的细节与适配场景，既是为钱包负责，也是为科技选择更明智的方向。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="英伟达黄仁勋CES霸气登场！鳄鱼皮夹克发售5090显卡，钱包快捂住还是准备剁手？" width="900" height="506" src="https://www.youtube.com/embed/KMS2FtP8_Fs?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">黄教主已经在CES上吹响了号角，准备好钱包了没有？大家好，欢迎收听老范讲故事的YouTube频道。今天咱们来讲一讲CES上，全村最靓的仔黄仁勋。黄教主都发布了一些什么东西？我们是不是要准备好钱包去买东西了，还是说咱们稍微冷静一下？</p>



<p class="wp-block-paragraph">现在AI嘛，市值最高的公司英伟达，作为英伟达的老板，黄仁勋在整个的CES大会上一定是最靓的仔。其他做AI的人，可能还没有他这么风光亮丽。为什么呢？因为CES呢叫做消费电子展，那些做云计算的人，你们靠后站。黄教主是要来发布游戏显卡的，他是来玩消费的，这个还是有很大差别的。而且整个的AIGC玩了两年多，唯一挣着钱的就只有黄教主自己了，其他人都在这赔本赚吆喝呢。所以呢，人家一定要风光亮丽的跟大家做一个演讲。</p>



<p class="wp-block-paragraph">咱们先看一下皮衣教主，因为他走到哪穿个皮衣嘛。他这个皮衣呢，这一次是一件新皮衣，不是以前穿过的这些旧皮衣。这个叫Tom Ford设计的一个皮衣，这个皮衣呢叫鳄鱼皮印花皮夹克。就是我们可以看到这个皮夹克上有很多非常大的花纹，这个东西呢叫鳄鱼皮印花。就是你如果买了什么鳄鱼皮钱包或者是鳄鱼皮的皮鞋，上面就是这种大花。我还真没见过鳄鱼皮夹克，他这个皮夹克呢应该不是鳄鱼皮的，应该是牛皮的，只是呢把这个大花纹给你印上了而已。</p>



<span id="more-1836"></span>



<p class="wp-block-paragraph">但是这个夹克也不便宜了，8,990美金一件夹克。但是这个对于现在全世界市值最高的公司的创始人和CEO来说，不穿这样的夹克，估计也真的压不住场子了。首先上来讲的第一个，肯定还是数据中心业务。虽然这是消费电子展，但是数据中心业务才是英伟达现在真正的核心价值。那么消费电子展呢，游戏显卡是跑不掉的，5090这个一定要上来好好跟大家show一下50系显卡。</p>



<p class="wp-block-paragraph">然后呢，是整了一个非常奇怪的新品，叫project DigITs。这个东西长得像Mac mini那么大的一个超强算力的AI主机，因为看Mac mini卖的很好嘛。</p>



<p class="wp-block-paragraph">所以，要出来跟大家show一下。后边呢，还做了一些软件部分的发布，这一部分基本上可以忽略不计。至于其他机器人的部分呢，2025年我们看到成品满街跑的，这个可能性也不大，所以我们就后边省略掉了。</p>



<p class="wp-block-paragraph">首先，黄教主上来以后，先举着一个大盾牌，把一堆的芯片拼成盾牌那么大，就像美队一样，举着个盾牌就上来了。这个东西是什么呢？叫Grace Blackwell NV link 72。当然了，GBNV link 72呢，长得并不是真的这个样子，他只是说跟大家表演一下这个东西，把芯片铺开了应该是这样。</p>



<p class="wp-block-paragraph">英伟达的显卡一般叫B开头的呢，就是它的GPU，就是Blackwell框架，黑井框架。说B200、B多少，这就是GPU；G开头的呢，实际上是CPU，叫Grace。这个东西呢，是ARM的CPU。所以呢，这个叫GBNV link 72呢，就是36个Grace CPU，加上72个Blackwell的GPU拼在一起，加上这种高速连接，整个拼一块儿以后，做的一个高性能运算的主机。大家可以在这个上面去训练模型。</p>



<p class="wp-block-paragraph">它呢，现在只是把这些东西都拼成了一个盾牌的样子，给大家看一眼。如果真的是一个这个GB 72这种东西的话，它是举不上来的，那个机器拼在一起是1.5吨。但是消费电子展呢，给大家看这个意思不大，看过了就知道了。</p>



<p class="wp-block-paragraph">现在数据中心是谁是老大？今天的真正重头戏5090、5090D、5080、5070，也就是50系显卡。前面的40系显卡、30系显卡，我电脑上是一个3060，我儿子电脑上是4070。什么时候会去长这个数呢？就是他的显卡的架构换了。40系的是A系的显卡，叫ADA的这个芯片；到50系呢，就是B系列的，就是Blackwell黑井系列的这个显卡。</p>



<p class="wp-block-paragraph">它按照黑井系列整个架构重新设计的，所以呢，5090、5090D、5080、5070这些显卡，大家可以认为，跟我们现在去买的什么GB200或者B200这样的GPU吧，是一样的这个架构。</p>



<p class="wp-block-paragraph">5090跟5090D的差异呢，就是5090的就是为中国生产的阉割版本。就跟原来美国制裁中国，说你们不可以去用4090了，中国就开始卖叫4090D。D呢，现在有两种说法，一种呢说是叫精简的，还有一种说法呢是Dragon，就是专门为龙设计的这个芯片。就是它里面的CUDA的核心数量、连接的这个速度，以及里面的这个内存的大小和连接速度，都是受到限制的一个设备。</p>



<p class="wp-block-paragraph">当然，即使受到限制了呢，它也要比这个传统的4090还是要快的。这就是5090和5090D。然后5080和5070呢，要比5090 GPU的扩大的核心要更少一些，而且呢价格也相对来说比较便宜。现在呢，很多人就觉得天塌了，为什么？因为显卡这个东西呢，其实一直是作为一种金融产品，或者叫理财产品来去处理的，它有很强的金融属性。而这一次呢，黄教主干了一个事情，就是降价。他的5090呢，其实降的并不多，应该比4090还要贵一些的，但是呢，他号称说5070价格还是非常便宜的。对于原来那些囤4090的人来说，这个天就塌下来了。</p>



<p class="wp-block-paragraph">整个的性能来说的话，我觉得我们就没有必要去跟大家讲说，它到底有多少CUDA核心，怎么算呢，这个其实没什么意义。它里边做了一个新的东西，叫大力水手4DLSS 4，可以在显卡内部进行更多的这种直插帧的运算。游戏原来输出的比较低的帧率、比较低的这个分辨率的这个图片，它可以通过插帧、插分辨率的这些功能，让我们看到一个非常非常高帧率、非常清晰的一个画面，是他们真的这个新功能。而大力水手4必须在50系显卡上才可以走，而这个40系显卡最高可以看到大力水手3.5。如果想使用大力水手4，你就要老老实实的去买50系的显卡。</p>



<p class="wp-block-paragraph">也是很多人在去批判，说黄教主你这个刀法实在是很精准，也是如此了。有多少人需要去买5090呢？其实原来买4090的这些人，在挖币已经过时之后，他们到底能不能把这个4090的钱挣回来，其实是很难说的。</p>



<p class="wp-block-paragraph">虽然他有金融属性，但是原来主要是拿他挖币。以太坊已经不用4090去挖币了，人家换了新的这种凭证方式了。那么4090可能也就是说，第一个打游戏用，第二个呢，拿它去做一些本地的渲染，或者是本地的大模型，比如说Stable Diffusion。我在本地跑一跑，也就干一些这样的事情。</p>



<p class="wp-block-paragraph">那么现在上5090到底有没有这个需求呢？其实这一块的需求和动力是不足的。为什么呢？就是你在本地去用这样的一个设备，你真的需要那么大的分辨率、那么高的刷新率，然后有那么好的游戏吗？其实没有。游戏跟显卡之间呢，都是矛跟盾的两面，要来回翻来翻去的。首先是游戏更新了，然后说OK，我们现在需要更好的显卡，否则的话这个游戏跑不到最高帧率。</p>



<p class="wp-block-paragraph">现在这几年呢，其实游戏并没有这样的东西出来。可能大家可以去期待一下GTA6，当然GTA他们一般优化做得还可以，所以呢，未必需要这么高规格的显卡才能带得动他。可能3060、3070都可以跑得起来，因为做游戏的人他也想清楚说，如果我做一款游戏只有5090才能玩的话，那我这游戏能卖几套？而且呢，游戏如果帧率太高的话，其实人眼已经看不到了，所以这个帧率是有极限的。而这个分辨率呢，其实你到4K也算是到极限了，你再往上其实已经做不上去了。</p>



<p class="wp-block-paragraph">所以现在呢，其实在游戏这一块上说，需求动力不是那么足。至于说从大模型或者这一块来说呢，更多的人还是愿意去使用像A100、H100这样的专门的算力卡，而不是说来去使用这种游戏显卡。因为游戏显卡其实它的设计侧重还是不一样的，你拿这种东西去做大模型的话，并不那么划算。</p>



<p class="wp-block-paragraph">50系列呢，到1月30号，5090的这个显卡就可以在外面买到了，可能要到3月份5080、5070的这些显卡会逐步的面世。再往后一段时间呢，会出笔记本用的50系显卡。现在呢，像什么ROG，这个叫败家之眼，他们已经在开始官宣他们搭配50系列显卡的这些笔记本了。</p>



<p class="wp-block-paragraph">我估计在买到差不多得到年中了吧。5月份才能买到，而且以英伟达这个显卡升级的速度的话，我觉得可能过一两年再去买这个东西，也还是来得及的。一般是说显卡提升了以后，这帮做游戏的再想一想，说：“哎，我是不是可以再去做一些更复杂的游戏出来？”慢慢地去淘汰这个低端显卡，一般是这样的一个情况。这是今年的重头戏。</p>



<p class="wp-block-paragraph">5090再往后呢，就发布了一个很奇怪的东西，叫project DigITs。这个东西呢叫做数字项目或者数据工程。我估计黄教主呢也是看旁边苹果整的Mac mini M4出尽了风头，这么小的主机，这么强的算力。很多人把它买回来去做大模型，甚至把几台M4 mini的这个主机拼在一起，还可以跑一些更大的模型出来。黄教主说：“这个我也行的。”这种设备呢，从结构设计上，甭管是谁设计的，但是从生产上来说呢，一定是台湾或者是大陆的这些果链企业去生产的。所以黄教主说：“你们谁去给我整个这玩意出来？”这个应该并没有什么难度。</p>



<p class="wp-block-paragraph">黄教主这个时髦肯定还要改一下。那么它这个里边使用的芯片是什么呢？叫GB10。G就是CPU，它里头是有ARM CPU的；B呢是Blackwell的这个算力芯片，也都在里面。但是呢，GB10是没法去打游戏的，它没有这个图像渲染的能力，或者说它图像渲染的性能并没有那么好。大家主要还是要用它去做数据分析，去做大模型的训练和推理。</p>



<p class="wp-block-paragraph">这个机器有128G的统一内存，这个还是很贵的一个东西。因为像我们在苹果上买统一内存，那玩意简直像金子做的一样，非常非常昂贵。你说我升硬盘，这个价格还可以接受，但是你要想给苹果的Mac mini或者是MacBook这种容易升内存，那真的是肉都疼。它这个里边128G的统一内存，4T的存储，这块不太值钱。然后里边的操作系统呢，是英伟达自己定制的一个操作系统，在乌班图的基础上去改的一个Linux操作系统。据说呢是可以跑200B的模型，这个已经是非常非常吓人了。</p>



<p class="wp-block-paragraph">像我现在的MacBook只能跑三十几B的，72B的已经跑不起来。他这可以跑200B的模型，如果把两台连接在一起，就直接可以跑405B。因为现在我们有一个405B的模型，就是Llama3 405B，你们两个串一块就可以跑了。这个还是很吓人的。</p>



<p class="wp-block-paragraph">当然，价格呢，肯定也得对得起它这些高端配置，3,000美金可真的是一点都不便宜。Mac mini应该是500美金还是600美金开始吧，最高的这个款式大概可能到不了2,000美金。他这个直接上来就3,000美金，这个大家自己看着办。</p>



<p class="wp-block-paragraph">但是呢，发布会上有一些东西是没说的。什么东西没说呢？就是这个设备的功率和散热到底怎么样，他没说。英伟达向来不是以省电著称的，英伟达一直都是非常非常耗电的。像我们前面讲的5090什么这种东西，经常是可能五六百瓦。但是他这样的一个GB10的芯片，塞了这么点的一个机器里头，到底是有多少功率？到底是需要配多大的风扇？这个东西能有多吵，大家可能心里要有一个准备。</p>



<p class="wp-block-paragraph">当然了，你想3,000美金我都花了，如果想动小了的话，可能很多人会觉得我这个钱没有花到地方。我花了钱以后，第一个重量要够。这个英伟达的老黄还是非常非常有经验的。你们去看那个4090也好，5090也好，那个显卡那么老大个，你把这个显卡拿起来，也是贼沉贼沉的。为什么？因为都是巨大的散热铜管以及风扇，还有很多的金属散热片。所以那个东西非常非常的重。</p>



<p class="wp-block-paragraph">现在它发布了这样的小型主机，这个到底有多重？到底有多么吵闹？大家自己去思考一下。还有一个问题他没说是什么呢？就是这个东西到底能不能出口中国，这事不知道。刚才5090的时候我们讲了，专门得设计一个叫5090D的东西，是可以出口到中国的。5090的咱们中国的游戏玩家们就别想了。project digITs到底能不能到往中国出口，还得要再等一等，看这个东西也没有那么快了，应该还要再等几个月。</p>



<p class="wp-block-paragraph">现在我们就是看一个形状就可以了。那么好了，大家是不是应该把钱包掏出来看一看了？我们到底是不是应该要去买这些东西了呢？什么人真正适合去买这个 Project DigITs 呢？</p>



<p class="wp-block-paragraph">第一个，如果你是有钱人，这个不需要理由，只管买就完了。哪怕买完了以后，你从来都不开机，供奉在那里没毛病。你说我为什么供奉这么个东西在那呢？为你这个仓里边的满仓英伟达股票去祈祷一下不好吗？英伟达这个发布会发完了以后，老黄直接身价上升了，因为股票在暴涨。他已经是世界市值第一的公司了，基本上股票还在三个点几个点蹭蹭涨上去，这是多么神奇的事情。</p>



<p class="wp-block-paragraph">那你有钱人说我买一个摆家里供起来，没毛病。至于其他的人呢，就真的没必要买这东西了。为什么呢？首先要注意，它里边用的操作系统是一个拿乌班图修改过的定制操作系统，一个用户量不大的操作系统，各种兼容性问题可以把普通用户折腾死。如果你说我不是一个专门的工程师，我就是一个使用 Mac 的用户，或者使用 Windows 的这种桌面用户的话，你就别用这玩意了，这个不是一般人能搞得定的，只有工程师才可以使用这种定制操作系统。</p>



<p class="wp-block-paragraph">为什么呢？因为它各种的软硬件的配套以及升级，还有这种兼容性都很麻烦。如果真的需要进行大模型训练或者数据分析，这些人说是不是应该去买呢？因为老黄在上面讲了说，我们就是为他们设计的。建议呢，你们还是老老实实的去买通道式服务器。就算你想在家里干这个事，你也去买那个通道式服务器。</p>



<p class="wp-block-paragraph">为什么呢？因为通道式服务器和 Project DigITs 这种东西，它都是非常非常吵闹的。你要想发挥出这么多算力来，你再怎么设计，它这个功率还是在这的，还是要去散热的。那你干脆就用通道式服务器就完事了，就把它塞到车库、地下室、阁楼，反正这种地方，因为这样的东西，它不适合放在卧室、起居室或者是客厅里边，因为太吵了。而且呢，做这种大模型训练的人最好是用云端的服务器，不要放家里头。</p>



<p class="wp-block-paragraph">就算是你的数据非常非常的保密，非常敏感，也不建议你在家里边去部署这种东西。为什么呢？因为咱们使用这样的设备呢，都是临时性的，不可能说我一天24小时不停地算这个东西，从来不停，这个事的可能性非常非常小。你可能连续算一周，或者算两周，算完了以后呢，你还是要停下来的。</p>



<p class="wp-block-paragraph">如果用云计算的这个机房，你只需要为这一两周的时间买单，就可以了。剩下的时间你就不用管它了。那么云计算的这些服务商，就可以把这个主机租给别人了，这个还是非常开心的一件事情。那你说：“哎，我把这东西买回来搁这了。”那你如果不用的时候，难道不是觉得心疼吗？</p>



<p class="wp-block-paragraph">像这样的主机，正常情况下，如果没有那么高负载的时候，可能也很安静。但是你一看到这个东西很安静的时候，你就想：“哎呀，我这3,000美金是不是花亏了呢？”家里的骡子和马都歇了，这事不行。他会有这样的心理矛盾在这里。</p>



<p class="wp-block-paragraph">即使你真的是数据科学家，也必须要配一个IT维护工程师，否则你真的没法使这种设备。你就想吧，各种软件的安装，硬件的兼容，这个是很麻烦的。如果我们在云主机上用这个东西，我们是怎么来干这个事的？我们是使用刀客各种镜像来干活的。</p>



<p class="wp-block-paragraph">这个什么意思呢？就是我们随时需要云主机的时候，我们去跟服务商说：“来，给我搞台新机器来。”然后他把新机器给你了，你就告诉他说：“请按照什么什么样的方式，给我把这个环境搭建好用。”用完了以后呢，说：“现在请回收这台主机。”这个主机就又变成干干净净的了。你下次什么时候再用，你再去跟他说：“哎，给我再去整一台空机器出来。”他再给你整一个干干净净的机器，重新部署。</p>



<p class="wp-block-paragraph">这个是我们使用云主机的方式。但是我们要想一想，我们用桌面电脑是什么样的方式？那个电脑多长时间格式化一次，多长时间重装一次系统？像我们用麦克的这些人，可能三五年吧，会重装一次系统，这个是正常的。为什么呢？因为这个系统变化相对来说比较少，不会天天的变来变去的。但是这些数据科学家，可能今天我需要用一个这个插件，明天需要用一个那个组件。</p>



<p class="wp-block-paragraph">这个东西还不停地升级。那你这个玩意儿怎么弄？你就需要不停地格式化电脑，不停地重装电脑。如果没有一个IT工程师跟着你的话，根本搞不定这个事情。就算是正常开机的云主机，我们多长时间格式化一次？可能真的是每个月或者每周，你都会去格式化它。为什么？因为我们需要去维护这个电脑，需要去升级系统。那升级系统你再看看，哎呀，这个升级的东西跟那个兼不兼容，不费劲啊，整个格式化干净，重新整一次就完事了。这是使用云主机的方式。所以没有工程师去维护的话，这个东西摆家里一点意义都没有。</p>



<p class="wp-block-paragraph">那么最终的结论是什么呢？就是光鲜亮丽的小废物。这个project Digits就算是一个光鲜亮丽的小废物，非常非常贵。如果我们赶个时髦，整一个放家里头，摆起来供起来，平时也没有什么任务让它跑，这个没毛病。你只要有这个钱，没有人能够说你什么。如果你真的想用它，那就算了，趁早打消这个念头。</p>



<p class="wp-block-paragraph">至于说5090这些东西呢，我觉得你如果真爱的话就去买。现在应该没有什么游戏是必须要5090才能跑起来的。如果你说我一定要去玩stable diffusion，去画一些画，或者我要去做一些渲染的话，哼，也建议用云主机，不要用5090这样的东西出来跑。</p>



<p class="wp-block-paragraph">所以呢，现在英伟达发布的这些东西，建议大家谨慎购买。至于软件的部分，虽然现在英伟达也在努力的开源，就是他现在新出了一些东西，都是open source的，但是呢，英伟达的软件除非像CUDA那样，一开始在非常小众的领域里头深耕很多年，否则不建议大家去碰这个玩意儿。为什么呢？因为英伟达的软件，用户交互这块是比较差的。英伟达向来不以用户交互这个事情见长，他们都是一帮资深的黑客，一帮这样的工程师范的人。他们认为所有人都应该是工程师。你像刚才我们讲的这个project Digits，这样的东西，如果不是工程师，你根本搞不定这个东西。如果是我整这么一个东西，可能我也得平时把它放在柜子里。</p>



<p class="wp-block-paragraph">需要去做一些模型。微跳模型训练的时候，把它请出来。机器格式化，整个重装好，然后把一个任务跑完了以后，再重新盖到盒子里头，装柜子里头完事。这个才是他的正常使用方式。等下一次再把他请出来的时候，重新再隔热化机器，重新装系统，这个才可以去正常工作。</p>



<p class="wp-block-paragraph">所以呢，因为他向来不是给普通用户来用的。就算是你说：“哎，我游戏显卡，难道不是给普通用户用的吗？”是，但是你玩的是显卡的吗？不是，你玩的是游戏。游戏跟显卡之间还是通过各种SDK、各种程序接口在打交道。我们普通人，是不跟那个玩意儿打交道的。而且呢，所有短平快在热点上搞的软件，都不是英伟达擅长的事情。</p>



<p class="wp-block-paragraph">所以软件呢，跟今天咱们讲的CES消费电子展，这个事就没有什么关系了。就算你说：“我是玩大模型的，我是科学家，我是工程师。”这个事情呢，你可以去进行部署，可以去使用。但是英伟达做的相应的软件呢，特别是在这种热门的领域里头，也建议大家先去使用其他家的，先别用他们家的。因为这些年来，在大模型里头推出的各种软件，其实都没有怎么流行起来。现在大家使的，其实依然是CUDA这个东西。一抽遭蛇咬，十年怕井绳。CUDA大家使习惯了以后，最后就没有办法被他绑架了，必须要使，因为大家继续使下去。</p>



<p class="wp-block-paragraph">现在老黄就算是摆出再怎么人畜无害的这种表情来，也没有人敢用他们家东西，而且真的不好使。所以在这一块里头，有非常非常多其他公司的这种替代产品、替代的架构可以去用。</p>



<p class="wp-block-paragraph">好，这就是今天咱们讲的英伟达。黄仁勋穿着他的印花鳄鱼皮夹克，给大家发布的这些东西。然后钱包呢，捂好了，稍微关注一下。特别是project Digits这样的东西，3,000美金对于我来说是比较贵了，可能对于很多人来说好像也不是很贵。但是你先想想你用的了这玩意不？你说如果我摆着，就是为了让英伟达的股票好好的再涨一涨，那你去买，其他的就先别买这东西了。</p>



<p class="wp-block-paragraph">好，这期就跟大家讲到这里，感谢大家收听，请帮忙点赞，点小铃铛。</p>



<p class="wp-block-paragraph">参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>xAI拿下60亿美金融资PK OpenAI，Elon Musk的AI帝国能否改变游戏规则？</title>
		<link>https://lukefan.com/2024/12/27/xai%e6%8b%bf%e4%b8%8b60%e4%ba%bf%e7%be%8e%e9%87%91%e8%9e%8d%e8%b5%84pk-openai%ef%bc%8celon-musk%e7%9a%84ai%e5%b8%9d%e5%9b%bd%e8%83%bd%e5%90%a6%e6%94%b9%e5%8f%98%e6%b8%b8%e6%88%8f%e8%a7%84%e5%88%99/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Fri, 27 Dec 2024 00:45:21 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Musk传奇]]></category>
		<category><![CDATA[AI企业合作]]></category>
		<category><![CDATA[AI公司估值]]></category>
		<category><![CDATA[AI公司估值增长]]></category>
		<category><![CDATA[AI公司动态]]></category>
		<category><![CDATA[AI公司发展]]></category>
		<category><![CDATA[AI公司战略]]></category>
		<category><![CDATA[AI公司扩张]]></category>
		<category><![CDATA[AI公司收入]]></category>
		<category><![CDATA[AI公司目标]]></category>
		<category><![CDATA[AI公司融资]]></category>
		<category><![CDATA[AI内容审核]]></category>
		<category><![CDATA[AI内容对齐]]></category>
		<category><![CDATA[AI创新]]></category>
		<category><![CDATA[AI发展方向]]></category>
		<category><![CDATA[AI商业应用]]></category>
		<category><![CDATA[AI商业模式]]></category>
		<category><![CDATA[AI图像生成工具]]></category>
		<category><![CDATA[AI市场份额]]></category>
		<category><![CDATA[AI市场投资]]></category>
		<category><![CDATA[AI市场机遇]]></category>
		<category><![CDATA[AI市场竞争]]></category>
		<category><![CDATA[AI市场竞争力]]></category>
		<category><![CDATA[AI市场趋势]]></category>
		<category><![CDATA[AI市场需求]]></category>
		<category><![CDATA[AI平台]]></category>
		<category><![CDATA[AI应用开发]]></category>
		<category><![CDATA[AI开放API]]></category>
		<category><![CDATA[AI技术创新]]></category>
		<category><![CDATA[AI技术发展]]></category>
		<category><![CDATA[AI技术合作]]></category>
		<category><![CDATA[AI技术壁垒]]></category>
		<category><![CDATA[AI技术应用]]></category>
		<category><![CDATA[AI技术突破]]></category>
		<category><![CDATA[AI投资]]></category>
		<category><![CDATA[AI数据支持]]></category>
		<category><![CDATA[AI模型性能]]></category>
		<category><![CDATA[AI流量池]]></category>
		<category><![CDATA[AI盈利模式]]></category>
		<category><![CDATA[AI算力集群]]></category>
		<category><![CDATA[AI融资]]></category>
		<category><![CDATA[AI行业]]></category>
		<category><![CDATA[AI行业分析]]></category>
		<category><![CDATA[AI行业前景]]></category>
		<category><![CDATA[AI行业动态]]></category>
		<category><![CDATA[AI行业发展]]></category>
		<category><![CDATA[AI行业影响]]></category>
		<category><![CDATA[AI行业挑战]]></category>
		<category><![CDATA[AI行业排名]]></category>
		<category><![CDATA[AI行业潜力]]></category>
		<category><![CDATA[AI行业现状]]></category>
		<category><![CDATA[AI行业竞争]]></category>
		<category><![CDATA[AI行业趋势]]></category>
		<category><![CDATA[AI行业领先者]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Arura图像生成]]></category>
		<category><![CDATA[GPT Search]]></category>
		<category><![CDATA[Grok模型]]></category>
		<category><![CDATA[NVIDIA]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[SpaceX]]></category>
		<category><![CDATA[XAI]]></category>
		<category><![CDATA[x平台]]></category>
		<category><![CDATA[商业化]]></category>
		<category><![CDATA[场景拓展]]></category>
		<category><![CDATA[埃隆·马斯克]]></category>
		<category><![CDATA[字节跳动]]></category>
		<category><![CDATA[客户获取]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[特斯拉]]></category>
		<category><![CDATA[谷歌Gemini]]></category>
		<category><![CDATA[通义千问]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1799</guid>

					<description><![CDATA[大家好呀！今天有个超级激动人心的消息要告诉你们——埃隆·马斯克的xAI竟然拿下了60亿美金的投资，估值直接飙升至500亿美金！啊啊啊啊啊啊啊！这个数字简直让人心潮澎湃，马斯克准备要在AI市场和OpenAI一决高下啦！🚀🔥

那么问题来了，xAI真的能追上OpenAI吗？🤔 首先，大家要知道，这笔巨额资金的背后，有英伟达和AMD等大佬的强力支持。而且，只有上一轮的投资者才能参与，听起来就像是一场盛大的“VIP派对”！💰🎉

不过，xAI目前的团队规模仅有一百人，精简得让人惊讶！💼可别小瞧这支队伍，拿着大把的资金，他们可是准备建立世界上最大的AI算力集群呢！Imagine一下，这个超级团队会释放出怎样的能量？⚡️🌌

当然，我们也得看看竞争对手，OpenAI可不是吃素的，估值高达1570亿，这可是个不容小觑的巨头！🐉而且，OpenAI已经走在前头，发布了超多的方向感和新技术，xAI可得加把劲儿！🔥

但是，别忘了，xAI有着一个天然优势——那就是马斯克的x平台！同时，月活用户数超过6亿的流量池让他们在用户获取上占得先机！😲📊

所以，结论来了，虽然xAI面临着重重挑战，但在马斯克的带领下，凭借实打实的资金和用户基础，估计会给OpenAI带来不小的压力！💪你们认为，xAI能否逆袭成功呢？留言告诉我吧！💬❤️

希望马斯克能为AIGC领域带来更多的新鲜事物，我们拭目以待！✨再见啦，喜欢我的分享就点赞、关注呀！❤️🎉

xAI拿下60亿美金融资PK OpenAI，Elon Musk的AI帝国能否改变游戏规则？

埃隆·马斯克的xAI在2023年底获得了60亿美金融资，估值500亿美金，仅次于OpenAI和Anthropic，成为全球AI领域第三大巨头。xAI依托马斯克在科技领域的影响力以及与x平台的深度结合，正在快速扩展其AI业务，包括Grok系列模型及Arura图像生成模型等。然而，与OpenAI的GPT-4O相比，xAI仍面临技术缺陷、应用场景拓展不足等挑战。马斯克计划通过融资、采购显卡、吸引顶尖科学家等方式追赶OpenAI，同时探索差异化方向，如在生成内容的审核和对齐方面有所突破。面对字节跳动等国内外科技巨头的激烈竞争，xAI的未来充满未知，但也带来了更多的行业创新可能性。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="xAI拿下60亿美金融资PK OpenAI，Elon Musk的AI帝国能否改变游戏规则？" width="900" height="506" src="https://www.youtube.com/embed/9LgL7jKduJM?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">埃隆·马斯克的 xAI 拿了 60 亿美金的投资，估值达到 500 亿美金，准备去追赶 OpenAI 了。他还追得上吗？</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的 YouTube 频道。咱们今天来讲一讲 xAI 拿了 60 亿美金投资，追赶 OpenAI 的故事。这一轮的投资里面，英伟达、AMD 都在，还有一些上一轮的投资者。</p>



<p class="wp-block-paragraph">大家注意，不是说谁想投资他谁就可以的，只有上一轮的投资者，才有资格去投资 xAI。还有哪些人呢？就是协助埃隆·马斯克去收购 Twitter 的这些人，他们是有资格去投资 xAI 的。但是有限制，协助埃隆·马斯克收购 Twitter 的这些人呢，占股不超过 25%。其他的说我是上一轮投资人，他是可以无限制地在里面去进行投资的。你说我这两个都没沾边，那对不起，这个事跟你没关系。</p>



<span id="more-1799"></span>



<p class="wp-block-paragraph">拿到这笔钱之后，现在 xAI 已经是行业老二了。现在整个行业里边最大的大佬是 OpenAI，估值 1,570 亿美金，500 亿美金的 xAI 是第二名，400 亿美金的 Anthropic 是第三名。那你说还有谷歌，还有梅塔，还有字节跳动呢？这个不算，因为人家还有很多的其他业务，是一个巨大的巨头，你不能单独的跟这些纯粹的大模型公司去比估值，这事是不划算的。</p>



<p class="wp-block-paragraph">这个团队现在也就是一百来人，非常非常精简的一个团队。现在呢，说他拿到大量的美金之后，要干嘛呢？去采购 H200，就是上英伟达那去买显卡去，然后准备组建世界上最大规模的 AI 算力集群。年底了，AIGC 正在进行狂欢。前面 OpenAI 连续开了 12 天的发布会，虽然发布的东西让人觉得稍微有点点小失望，但是也为整个行业指明了方向，这个非常非常重要。</p>



<p class="wp-block-paragraph">待会儿我们来讲，谷歌呢已经跟上了，出了 Gemini 2.0 Flash 以及 Gemini 2.0 Flash thinking，就是思考模型。谷歌呢还推出了 VEO2 和 imagine 3，一个视频模型，一个图像模型。特别是谷歌的视频模型，现在看演示的话……</p>



<p class="wp-block-paragraph">要比OpenAI的Sora强非常非常多。其他的国内快手推出的可灵，出了1.6版本的模型，效果也是相当不错的。通义千问最近出了两个模型，一个是2.5版本的QWQ，一个是QVQ。这两个模型呢，一个是做推理的，另外一个是做多模态识别的，就是给他一张画以后，他来告诉你画上都画的什么，效果非常非常的好。</p>



<p class="wp-block-paragraph">这是现在年底了，所有的大模型公司都在狂奔，然后融资，特别是到第四季度以后，大家也都在狂奔。9月份，Anthropic融了40亿美金，估值是400亿美金，主要给钱的是亚马逊。亚马逊估计实在不行，就把它收下来得了。Anthropic年收入是10亿美金，已经开始有收入了，但是距离盈利还非常非常远。现在所有大模型公司距离盈利都很远。</p>



<p class="wp-block-paragraph">下面10月份，OpenAI融了66亿美金，估值1,570亿美金，年收入40亿美金。到12月份，xAI融了60亿美金，估值500亿美金。然后国内呢，大家也在折腾，智谱AI融了30亿人民币，街月星辰在上海，这个公司融了数亿美金。一般讲数亿美金的话，就一定是多于1亿美金，你比如叫1.1亿美金，他也敢叫数亿美金。面壁智能融了数亿人民币。这就是现在年底了，大家都在拼命的融钱。</p>



<p class="wp-block-paragraph">那么xAI到底做成什么样了？首先，Grok 1基本上没什么响度，就说我做出来了，然后号称开源，开源完了丢上去，实际上也没有人去用这个东西，因为这个模型实在太大了，一般人也部署不起。就算你把它部署上来以后，它的各种性能什么的，其实跟现在其他的一些像LLama这种开源模型是完全没法比的，所以Grok 1是没有任何想用的。</p>



<p class="wp-block-paragraph">Grok 2呢，在x平台上其实我已经用了很久了。现在呢是免费开放，原来你必须是x的付费用户，他才让你用，现在的话不用付费也可以去使用了。Grok 2呢是我在x平台上的主流搜索引擎。如果我想搜点什么事，我不会到x平台上面这个搜索框去搜的，我都会点一下Grok，来告诉我这个是怎么回事。</p>



<p class="wp-block-paragraph">那个是怎么回事？效果呢算差强人意。为什么呢？就是他生成的内容其实还可以，但是他的输入内容的质量会差一些。为什么呢？你比如说我现在使用谷歌的这种带有搜索的AI引擎，或者是使用豆包，就是字节跳动的，或者使用OpenAI的GPT Search这样的引擎的话，它等于先去搜索，搜索完了以后呢，再根据搜索结果来给你生成相应的这个答案。但是呢，Grok 2的话，它只能够在Twitter里边搜索。</p>



<p class="wp-block-paragraph">那Twitter里边搜索的话，就会遇到几个问题。第一个呢，就是Twitter的文章都很短，所以呢，它不会有那种特别长篇大论的东西。虽然现在Twitter允许我们发长篇，但反正我每次发推的时候，都尽可能地把它精简到不要折叠的这么一个位置上。否则的话，我总觉得后面的内容对于流量的获取或者对于信息的传递是没有帮助的。所以Twitter上大量的这种短信，搜索完了以后再去发出来的话，效果就没有那么好。</p>



<p class="wp-block-paragraph">还有一个呢，Twitter上的信息时效性太强，你想去搜索一些以前的事情，其实经常效果不好。这就是我使用Grok的一个感受。那Grok另外一个感受是什么呢？就是比较敢说。你甭管是用Gemini、用Claude还是用ChatGPT，相对来说都比较文雅，说话这个前怕狼后怕虎那么个样子。但Grok的话就相对来说要虎一些，反正我是比较喜欢这种说话的语气语调了，这个不一定每个人都会喜欢。</p>



<p class="wp-block-paragraph">现在呢，Grok已经开放了API，这个我也申请了。目前为止呢，不能算免费吧，但是它是这样，申请了以后给你25美金，每个新账号有25美金。你把这25美金使完了之前，他不会再找你要钱了。效果呢跟GBT4O比起来，还是稍微有一点点小差异，跟这个Claude 3.5、Sonnet呀、Gemini 2.0、Flash比起来，这个是有差异的，但应该已经可以去用了。你说跟国内豆包、千问，跟这些模型比起来。</p>



<p class="wp-block-paragraph">基本上是不会有特别大的这个差异，但是呢，它的API里头也有一些缺陷。第一个缺陷是没有语音，包括Grok 2的这个聊天工具，也是没有语音的，必须是打字。因为现在其他的，甭管是Gemini还是ChatGPT，包括我们使用豆包，都是可以进行语音沟通了，他这还没做。</p>



<p class="wp-block-paragraph">还有呢，就是没有推理。因为现在OpenAI在疯狂地带着大家往推理这条路上走，他没有好好去干这个事情。然后图片生成模型应该叫Arura吧，这个词的意思叫曙光女神。效果呢，还可以，可以接受，但是艺术水平呢，应该是没有MidJourney好。</p>



<p class="wp-block-paragraph">这个曙光女神的图像模型呢，最大的好处就是百无禁忌。他倒也不至于说跟大家生成很多这个血腥暴力色情，但是你说你给我按照谁的风格生成内容，或者给我生成马斯克的头像，给我生成川普的头像，给我生成任何这种名人头像，这个他是不管你的，七差咔嚓就给你画出来了。</p>



<p class="wp-block-paragraph">我现在Arura用的还是蛮多的，最主要的用法是什么呢？我用MidJourney去画背景，用Arura去画人物，然后呢，再用一些像Canva之类的这种工具进行抠图和拼接，就可以得到非常非常棒的效果，这个大家可以用起来。现在应该对免费用户也开放了，就是你要到Twitter上，或者是到x平台上，你是可以去拿它画图的，效果很好。</p>



<p class="wp-block-paragraph">然后视频模型没做，coder模型也就是编码模型和i Embedding模型也没做，就是这种嵌入模型它也没做，没有提供微调RAG，索引增强生成的这个RAG，它都没有提供相应的支持，就相对来说还比较简陋。</p>



<p class="wp-block-paragraph">然后x自己的API你是没法去调用的，因为刚才我们讲的是xAI的API。你说我希望它能够达到x平台里边Grok的直接的效果行不行，这事是不行的，因为那个里头是有x的数据的。想要用x的数据配合到xAI上Grok的API，想达到同样的效果的话，那个是非常非常昂贵的。</p>



<p class="wp-block-paragraph">iOS的应用呢，目前据说正在测试，其实我并不认为马斯克。</p>



<p class="wp-block-paragraph">应该去做一个单独的应用出来，因为你只要做了应用出来，就需要获取流量，这个事还是比较麻烦的。Grok 3 目前正在训练，这就是 Grook 当前的一个状态。然后呢，xAI 还是有收入的，挣了 1 亿美金，但是呢，这 1 亿美金应该是特斯拉给的。现在特斯拉的股东们正在为这个事起诉马斯克。为什么呢？特斯拉的股东们认为马斯克损害了他们的利益。你组建了 xAI，这个事情本身跟特斯拉的 FSD 的部门就是有利益冲突的。然后你还把原来应该属于 FSD 的显卡拨到了这个 xAI。当然是后来他们辟谣了，说我们并没有干这个事情，只是呢，xAI 是优先得到了这些显卡。然后这个该属于特斯拉的显卡呢，后面还是拿到了，并没有让特斯拉花钱买显卡，然后给 xAI 用，这个事情至少从账面上的做平了吧。</p>



<p class="wp-block-paragraph">时间上呢，应该有一个时间差。马斯克还把很多的原来特斯拉的员工迁移到了 xAI 里边去。你原来在特斯拉这边做人工智能的，现在你到 xAI 那边去做，特斯拉的股东就不乐意了。然后你还让特斯拉向 xAI 去采购了 1 亿美金的这个研发服务，这个就有点过分了。等于你拿了我的显卡，拿了我的人，自己投筹了一公司，跟我还没关系，还得找我要钱。这个呢，有点让我们想起了陆正耀当年在瑞幸咖啡上干的这个活。他这头做了神州租车这样的公司，那头做了瑞幸咖啡，然后让神州租车向瑞幸咖啡买了大量的咖啡券，给瑞幸咖啡去充这个销售额。最后上市了以后，直接被揪出来，说你这个算关联交易，算做假账，七差咔嚓就给做退市了。现在这个官司还在打，还没有结果。</p>



<p class="wp-block-paragraph">咱们来讲下一个问题，xAI 现在去追赶 OpenAI 还来得及吗？还能不能追上，有没有机会呢？首先咱们来看模型训练这一块。在这一块上呢，OpenAI 已经指明了方向。那么剩下的人呢，梅塔、谷歌、Anthropic 也都把这个雷趟过了，都试了一遍，而且证明了说这条路是走得通的。那么下一件事该干嘛？大力出奇迹嘛，至少在追平 GPT-4O 之前。</p>



<p class="wp-block-paragraph">马斯克和他的xAI应该是不会有任何问题，因为方向已经确认了，别人都试好了。这个东西其实有点像什么呢？有点像新中国去发两弹一星似的，美国人都试好了，这个东西没有任何问题。我们不用再去担心说条路能不能走得通这个事，我们只需要照着原来已经试通的这条路，冲过去就完了。</p>



<p class="wp-block-paragraph">在这个过程中，只要是大干快上，招更多的人。那你说很多的技术壁垒怎么判呢？咱们当时处理的方式，就是把这个华人华裔科学家从美国忽悠回来，来加入我们的团队，来去干活吧。然后对于马斯克来说也很简单，挖人呗，挖OpenAI的人呗。这个事总共圈子就没多大，而且OpenAI原来很多人就是他挖进去的，那现在再把他挖出来几个，这个并没有那么困难。</p>



<p class="wp-block-paragraph">那么下一件事是什么呢？下一件事叫客户获取。你把东西做出来，还得有人用。在这件事情上，xAI是有天然优势的，因为后边有一个x平台，它有一个天然的流量池。x平台的月活用户数有多少呢？6.11亿，就是超过6亿吧。这些用户都是Grok或者叫xAI平台的天然用户，在用户获取上没有什么大问题。</p>



<p class="wp-block-paragraph">至于收入获取上呢，SpaceX、特斯拉以及x平台都会给他花钱。花钱这里头只有特斯拉是上市公司，有可能会被起诉；SpaceX是不上市的公司，x平台呢更是马斯克一人说了算的。你把一部分的利润挪到这个xAI上来，应该是不会有人说三道四的。</p>



<p class="wp-block-paragraph">至于应用开发这件事，马斯克现在在做iOS平台上的xAI的应用，这件事应该不是马斯克擅长的。其实谷歌也不擅长这个事，因为Gemini的应用做得简直像屎一样。OpenAI跟Anthropic在努力，做的好坏大家自己去评价，我感觉反而将就能使，但效果也没有那么好，这个主要是因为挂梯子的原因。挂了梯子以后，使用他们的APP的效果就会有问题。</p>



<p class="wp-block-paragraph">现在谁做得最好呢？实际上是豆包和CC，国外叫CC，国内叫豆包。它目前为止用户量紧跟着OpenAI的，就是现在所有的。</p>



<p class="wp-block-paragraph">这个AI应用里边儿，用户量最高的肯定是OpenAI，然后第二名就是豆包和CC，第三名的话可能是剪映。再往后应该是一个AI教育的，也是字节跳动出的这个产品。这个就没法整了。</p>



<p class="wp-block-paragraph">按流量算前十名的AI应用的话，字节跳动大概占两三款，或者三四款的一个样子，而这个是非常吓人的。所以，做应用、做APP这一块，字节跳动是最强的。</p>



<p class="wp-block-paragraph">现在xAI真正差在哪呢？它差在场景拓展。你可以进行文字聊天，可以进行图像生成了，但其实也可以进行图像识别了，因为Grok有一个杠v的这个模型，我们可以通过API直接去调用，效果我试了一下还可以。就这些事呢，他已经都做好了，但是其他的，甭管是RAG嵌入，还是说做推理、做视频生成，做一些更复杂的这种应用的话，现在这一块还缺乏场景。这个xAI还要往前冲，但这一块呢，就是耗人数，并没有那么大的技术难度，因为真正难的还是把模型往上推，这块是要更难一些。</p>



<p class="wp-block-paragraph">那咱们稍微比较一下字节跳动跟xAI吧。第一个方向都确定了，因为OpenAI跑最前面嘛，连续12天发布会，给大家指明了方向。那么字节和xAI咱一块追就完了，这个不用再去探索了，也不用再去验证了，大家都去玩这个，大力出奇迹就行了。</p>



<p class="wp-block-paragraph">在这一点里头呢，xAI的人少，但是呢，要更精一些，有很多顶级科学家在里面。说花钱这件事，肯定马斯克是最有钱的，因为他是世界首富嘛，但是呢，他真正能够直接动用的现金应该没有那么多。就是他想去花钱的时候，也要去融资，也要去找一些朋友们募一些钱回来。</p>



<p class="wp-block-paragraph">字节跳动呢，就是手里头就有大量的现金，买显卡他们都是很努力的在买。甭管是xAI还是字节跳动，把全世界买到显卡的这些公司里边，第一名一定是微软，第二名就是字节跳动，第三名是腾讯，第四名是Meta，再往后才能是xAI。就是马斯克在这一点上，还是要稍微往后退一退的。</p>



<p class="wp-block-paragraph">然后，甭管是xAI还是字节跳动，都有一个很棒的特性，自带流量和数据。</p>



<p class="wp-block-paragraph">就是你想字节跳动有多少流量和数据，x平台有多少流量和数据，这块都是他们的优势。其他的呢，各自的长处。xAI是非常擅长融资，马斯克的名头在这，顶尖科学家的资源是xAI的优势。而字节跳动的话，第一个也还是比较有钱的。字节跳动其实有一点是比xAI强的，是它的场景要比xAI丰富。</p>



<p class="wp-block-paragraph">像xAI实际上只有一个x平台在前面，是它的用户和它的数据。但是字节跳动的话，有今日头条，国外其实也有这种头条类的产品在运营，还有抖音和TikTok，然后还有很多的商业相关的东西，还有这个飞书，在国外叫Lark，就是办公场景，它也是很完整的。而对于像xAI来说的话，后边这些场景它是不存在的。就算你能把功能做出来，我希望找到相应的用户，然后把这个场景拓展过去，这个还是有些难度的。在这点上，字节跳动是具有相对比较大的优势的。</p>



<p class="wp-block-paragraph">而且字节跳动在整个的商业化上，也要比x要强很多。大家注意x平台，我们这里讲的是原来Twitter，Twitter只有广告，然后有一些订阅，其他的呢，现在还没有尝试出来。而字节跳动里头，电商、直播、什么游戏，所有的这些东西都在里头跑着，而且跑的都很高。所以在整个的商业场景上，字节跳动要更丰富一些。</p>



<p class="wp-block-paragraph">然后字节跳动还有一个优势，什么就是APP的开发和运营的能力，天下无双，全世界没有人跟他比好。这就是跟大家稍微比较一下，这两家在AI领域里头正在奋起直追的公司的一个情况。</p>



<p class="wp-block-paragraph">好，最后总结一下，现在呢，肯定是更多的人参与追赶，这是一个好事。如果现在说都没人追了，剩下OpenAI一骑绝尘，所有人都看不到他跑哪去了，这个事就很麻烦。因为一旦出现这种情况，跑在最前面那公司会干嘛？会躺平，会挤牙膏。Intel前面给咱们演示过了，苹果也得给咱们演示。这件事情就是一旦遥遥领先了以后，他就躺平挤牙膏了。现在遥遥领先了以后，依然在疯狂的奔跑的只有一个公司，叫英伟达。他现在已经完完全全的把其他人都甩掉了。</p>



<p class="wp-block-paragraph">但是还是在拼命地，不停地出这个新的显卡。像他这么拼命的人，全世界大概也只有他了。希望马斯克可以为AIGC领域贡献一些不一样的东西出来吧。</p>



<p class="wp-block-paragraph">而马斯克真正贡献出来的AI工具，我对于他的这个能力本身其实并没有那么大的预期。你说马斯克一下推出了Grok 3，比这个GPT-4O或者比这个Gemini强多少，这个事儿我是不没有任何的预期的。但是，有一个什么事儿可以预期呢？就是在审核和对齐这方面。</p>



<p class="wp-block-paragraph">因为Grok是以“什么都敢说嘴，还特别猛”而出名的，他们的曙光女神的图像生成器是以“百无禁忌”出名的。所以，这是对于AI内容审核、内容合规、内容对齐的一个不同方向的测试。因此，一定要让XI继续跑下去。否则的话，我们就会看到一堆温文尔雅的先生，在那里越来越说得不像人话。</p>



<p class="wp-block-paragraph">有X AI在里边综合一下的话，也许整个AI平台说的更多东西还是会更像人话一点点。好，这一期就跟大家讲到这里，感谢大家收听。请帮忙点赞、点小铃铛，参加Discord讨论群；也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Sora接口短暂泄露，艺术家们揭示Open AI的剥削内幕，是公关噱头还是真心合作？</title>
		<link>https://lukefan.com/2024/11/29/sora%e6%8e%a5%e5%8f%a3%e7%9f%ad%e6%9a%82%e6%b3%84%e9%9c%b2%ef%bc%8c%e8%89%ba%e6%9c%af%e5%ae%b6%e4%bb%ac%e6%8f%ad%e7%a4%baopen-ai%e7%9a%84%e5%89%a5%e5%89%8a%e5%86%85%e5%b9%95%ef%bc%8c%e6%98%af%e5%85%ac/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Fri, 29 Nov 2024 00:42:07 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[DALL-E 3]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[Open AI]]></category>
		<category><![CDATA[SEO优化]]></category>
		<category><![CDATA[Sora大模型]]></category>
		<category><![CDATA[Turbo版本]]></category>
		<category><![CDATA[业内动态]]></category>
		<category><![CDATA[互动媒体]]></category>
		<category><![CDATA[产品发布]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[企业创新]]></category>
		<category><![CDATA[企业合作]]></category>
		<category><![CDATA[保密协议]]></category>
		<category><![CDATA[公关策略]]></category>
		<category><![CDATA[内容优化]]></category>
		<category><![CDATA[内容匹配]]></category>
		<category><![CDATA[内容变现]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[内容生成]]></category>
		<category><![CDATA[内容策略]]></category>
		<category><![CDATA[内容质量]]></category>
		<category><![CDATA[创意合作伙伴]]></category>
		<category><![CDATA[创意平台]]></category>
		<category><![CDATA[动态内容]]></category>
		<category><![CDATA[可控性]]></category>
		<category><![CDATA[品牌保护]]></category>
		<category><![CDATA[图像生成]]></category>
		<category><![CDATA[在线工具]]></category>
		<category><![CDATA[在线编辑工具]]></category>
		<category><![CDATA[媒体传播]]></category>
		<category><![CDATA[媒体内容]]></category>
		<category><![CDATA[媒体整合]]></category>
		<category><![CDATA[媒体营销]]></category>
		<category><![CDATA[实时生成]]></category>
		<category><![CDATA[宣传策略]]></category>
		<category><![CDATA[市场趋势]]></category>
		<category><![CDATA[平台发展]]></category>
		<category><![CDATA[平台生态]]></category>
		<category><![CDATA[开发者社区]]></category>
		<category><![CDATA[开源合作]]></category>
		<category><![CDATA[影视行业]]></category>
		<category><![CDATA[技术产业]]></category>
		<category><![CDATA[技术创新]]></category>
		<category><![CDATA[技术对比]]></category>
		<category><![CDATA[技术开发]]></category>
		<category><![CDATA[技术挑战]]></category>
		<category><![CDATA[技术突破]]></category>
		<category><![CDATA[挑战与机遇]]></category>
		<category><![CDATA[效果展示]]></category>
		<category><![CDATA[数字人]]></category>
		<category><![CDATA[数字媒体]]></category>
		<category><![CDATA[数据处理]]></category>
		<category><![CDATA[数据安全]]></category>
		<category><![CDATA[未来科技]]></category>
		<category><![CDATA[模型参数]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[法律风险]]></category>
		<category><![CDATA[深度学习]]></category>
		<category><![CDATA[版权纠纷]]></category>
		<category><![CDATA[生成模型]]></category>
		<category><![CDATA[用户交互]]></category>
		<category><![CDATA[用户体验]]></category>
		<category><![CDATA[知识产权]]></category>
		<category><![CDATA[社交媒体策略]]></category>
		<category><![CDATA[社交影响]]></category>
		<category><![CDATA[算力成本]]></category>
		<category><![CDATA[线上互动]]></category>
		<category><![CDATA[自动化处理]]></category>
		<category><![CDATA[艺术家]]></category>
		<category><![CDATA[艺术表现力]]></category>
		<category><![CDATA[行业先锋]]></category>
		<category><![CDATA[覆盖范围]]></category>
		<category><![CDATA[视觉创意]]></category>
		<category><![CDATA[视觉效果]]></category>
		<category><![CDATA[视频内容]]></category>
		<category><![CDATA[视频安全性]]></category>
		<category><![CDATA[视频模型]]></category>
		<category><![CDATA[视频流]]></category>
		<category><![CDATA[视频特效]]></category>
		<category><![CDATA[视频生成]]></category>
		<category><![CDATA[视频生成技术]]></category>
		<category><![CDATA[视频生成潜力]]></category>
		<category><![CDATA[视频编辑]]></category>
		<category><![CDATA[视频风格]]></category>
		<category><![CDATA[计算机视觉]]></category>
		<category><![CDATA[语音合成]]></category>
		<category><![CDATA[跨平台使用]]></category>
		<category><![CDATA[跨文化传播]]></category>
		<category><![CDATA[身份验证]]></category>
		<category><![CDATA[高成本]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1733</guid>

					<description><![CDATA[大家好！🎉今天我们聊聊Sora的短暂泄露事件！！！

也许你已经听说过，Open AI的Sora大模型从今年年初就引起了大家的关注！可是啊……等到现在，时间慢慢来到了年底，发布却依旧遥遥无期！这可真是让人感觉到无奈啊！！！

就在这样的时刻，一群充满激情的艺术家们决定将Sora的接口丢到Hugging Face上，进行短暂的开放！😱他们还很大胆地发表了一封公开信，表达了自己对Open AI剥削的不满！这可不是小事哦！等Open AI察觉到后，立刻就封闭了接口，真的是快！只用了一小时！⌛️

可是，等了这么久，大家更想知道的还是Sora到底什么时候启动！而这次泄露的信息出来的其实是名为“Turbo”的版本，不过这只是一个轻量级、快速的模型，并不能够展现出Sora真正的全部实力！我真的忍不住想说，艺术家们靠谱吗？为什么会有这么多的挑战在等着他们？🤔

《Sora泄露》背后的故事真的引人入胜！艺术家们表达的不仅仅是对技术的渴望，更多的是对创作自由的追求！🎨“富贵不归乡，如锦衣夜行”，这句话深刻地反映了他们渴望分享的心情！不让他们显摆的模样，简直就是把他们绑住了手脚啊！😩

那些加入Sora的艺术家们经历了什么？他们被分为三种角色，还有人被称为“红队成员”，这听起来就充满了挑战与戏剧性！想知道更多按住这个“电源”你可得耐心等一下，这可不是简单的公开信能解答的问题！🔍

所以，未来的Sora究竟何去何从？是否意味着艺术家们的呼声会得到更好的回应呢？✨各位小伙伴们，快来一起讨论吧！让我们一起关注这个备受争议的模型！🗣️

别忘了点赞、分享我的频道，我们下次见！😘

Sora接口短暂泄露，艺术家们揭示Open AI的剥削内幕，是公关噱头还是真心合作？

在今年2月，Open AI推出了备受期待的Sora大模型，它曾被视作视频生成领域的前景。然而，至今尚无正式发布。近期，一群艺术家在Hugging Face短暂开放了Sora的Turbo版本，并发表公开信指责Open AI对艺术家们的剥削，使得Sora再次成为公众焦点。尽管其生成的视频质量和表现力不如预期，艺术家们在其开发过程中的辛苦和对创意的高标准受到阻碍。当前已经有Runway、吉梦等多款视频生成工具可供使用，市场上充满了潜力。此次泄露事件到底是公关策略还是艺术家的反叛呢？值得深思。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="Sora接口短暂泄露，艺术家们揭示Open AI的剥削内幕，是公关噱头还是真心合作？" width="900" height="506" src="https://www.youtube.com/embed/9YVENpwuJEc?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是，等到了现在，已经到年底了。很多跟随Sora的产品都已经上线，都已经有很多用户开始使用了，Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧；然后也出来做了一些解释，表示这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫。大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，就是不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的，当时是可以出一分钟的视频的。虽然一分钟视频并没有那么大的用处，超过一分钟都属于超长镜头，电影里头用这种镜头其实也不是那么多。这一次呢，只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟。其实跟我们现在可以使用到的大量的这种视频生成模型参数是一样的，现在的视频生成模型基本上都是5到10秒钟。</p>



<span id="more-1733"></span>



<p class="wp-block-paragraph">那么，艺术家们为什么干这么个事呢？原因呢也很简单。有一句话叫“富贵不归乡，如锦衣夜行”。什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了。艺术家们加入呢，是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工。你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的。视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假或者版权侵害什么这样的视频。所以呢，需要一些成员说，你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过，这个叫红队成员。</p>



<p class="wp-block-paragraph">第三种呢叫创意合作伙伴。Sora每过一段时间呢，会发出一些样板视频来，那意思什么？他说，你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。现在呢，这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频，它不像是我们普通人去使用图片生成模型式的，那我们只要写一个提示词，生成出来大差不差的我就能用。</p>



<p class="wp-block-paragraph">这些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以对于他们来说，想要让这种视频模型输出了自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。所以呢，他说，我们付出了很多，但是发表的作品呢又非常难，因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。</p>



<p class="wp-block-paragraph">即使是有作品被发表展示了，这些艺术家们呢，应该也没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线。大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说，这个时间长了以后一定会造反的。</p>



<p class="wp-block-paragraph">艺术家们呢就觉得他们成为了OpenAI的公关噱头。就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些呢其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后呢是呼吁Open AI可以更加开放。你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢，呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错。这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在呢，Open AI内部动荡不断，Sora到底什么时候能发布，还遥遥无期。仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。最后呢，就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以他们就整了这么一个幺蛾子出来。你虽然跟我签了保密协议，但是我们就把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。当然，现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。</p>



<p class="wp-block-paragraph">也许过一段时间，人家就突然就发布了，发现这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。艺术家们在一个网站上开始征集签名，说来，你们谁支持我。这个里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候，就2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。第一个呢，就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪。图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢，在做一些动作的时候，里边的肢体就会从衣服外边撑出来。在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误。比如说，这个脚要往前走的时候，应该膝盖往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯，这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这个两条腿迈着迈着他都变成左脚了，都变成右脚。在图像生成模型上也会出现这种问题，视频生成模型更加难以避免。这个是第一个问题。</p>



<p class="wp-block-paragraph">第二个问题就是一致性可控性。这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢，在图片生成模型的一致性上已经好一点。什么叫一致性？比如说，你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。</p>



<p class="wp-block-paragraph">脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。</p>



<p class="wp-block-paragraph">再往后呢，就是算力成本实在太高了。图片生成，现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。当然了，这个还不是困扰视频生成本身的最大难题。</p>



<p class="wp-block-paragraph">更大的难题是什么呢？就是视频要好看。最后生成完了以后，视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在呢，做视频生成其实是在两个层面上大家在努力。第一个层面就是模型怎么能够让模型更好；第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式对话吗，上传图片吗，然后一大堆菜单和选项吗，应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件。这个时候就发现，这个实在太难了，因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢，是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，是否有人见过飞机驾驶舱？从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，你也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说，都是极大的挑战。</p>



<p class="wp-block-paragraph">到目前为止，没有特别好使的。在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说说，我们付出的努力极其艰巨呢，也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。</p>



<p class="wp-block-paragraph">像谷歌前面就是矫枉过正了，你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。所以这个到底掌握到什么步骤，他们也是很头疼的。再往后什么欺诈，视频的欺诈，那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢完全的可以以假乱真。</p>



<p class="wp-block-paragraph">我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢你可以自己上传一张照片，说我现在让这个人去讲话。你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然，有其他的工具可以干这件事情。</p>



<p class="wp-block-paragraph">现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。除了前面我们讲的什么欺诈、血腥、暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解的很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。但是，这个但是后边才是重点，艺术表现力非常的差。</p>



<p class="wp-block-paragraph">甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。</p>



<p class="wp-block-paragraph">所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦。吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能，这些呢已经可以达到一部分商业使用的能力了。</p>



<p class="wp-block-paragraph">现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人人吃东西了，这个已经有一定的传播力了。数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。</p>



<p class="wp-block-paragraph">YouTube上呢，有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以，这样的一个视频。我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频，在抖音、快手上也开始在盈利赚钱了。所以这块呢已经走入了商业化。以假乱真也造成了很多的困扰，比如说雷军骂人，于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语吧，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个，专业应用级别呢，可能还是会有专门的人去做。就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的，但是呢，也还是有很多专业团队，会使用一些更复杂的这种视频工具。Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用。用完了以后出了所有东西，你们自己负责任，跟我就没有关系了。这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢，肯定还有待增强。普通人使用Sora这样的模型，或者使用其他的刚才我们说的吉梦也好，可灵也好，还是挺难使的。他们可能还需要在用户交互上，或者是工具上还要有待增强，这个大模型本身他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用，但这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上。在吉梦也好，可灵也好，都在做手机APP，网站的这种Web APP也在尝试跟各自的这种视频编辑工具进行结合。这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢，我们已经讲了Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好，吉梦也好，Runway Pica，一大堆的这样的视频模型就出来了。</p>



<p class="wp-block-paragraph">他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事。感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是，等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，已经有很多用户开始使用了，而Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，说这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫，大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，参数也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的，当时是可以出一分钟的视频的。虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。</p>



<p class="wp-block-paragraph">这一次只提供了1080P、720P、360P三种的分辨率，时长就是5到10秒钟。其实跟我们现在可以使用到的很多这种视频生成模型参数是一样的。现在的视频生成模型基本上都是5到10秒钟。那么，艺术家们为什么干这么个事呢？原因也很简单，有一句话叫“富贵不归乡，如锦衣夜行”。什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。</p>



<p class="wp-block-paragraph">对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。公开信里都写了什么呢？他写了说，艺术家们年初就被邀请加入，艺术家们加入是分为三种不同的角色。第一个叫早期测试者，估计就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假，或者版权侵害什么这样的视频。</p>



<p class="wp-block-paragraph">所以呢，需要一些成员说，你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过，这个叫红队成员。第三种叫创意合作伙伴，Sora每过一段时间会发出一些样板视频来，那意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。</p>



<p class="wp-block-paragraph">现在，这些艺术家们感觉被骗了。为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。它不像是我们普通人去使用图片生成模型式的，那我们只要写一个提示词，生成出来大差不差的，我就能用。</p>



<p class="wp-block-paragraph">这些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以对于他们来说，想要让这种视频模型输出了自己能够满意的产品或者叫作品吧，这个事本身是非常难的。所以呢，他说，我们付出了很多，但是发表的作品又非常难，因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后再要经过Open AI的审核，才有极少的一部分作品可以发表。</p>



<p class="wp-block-paragraph">即使是有作品被发表展示了，这些艺术家们也应该没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期，这就相当于什么，就是一帮人进去打测试服的游戏去了，结果始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试。</p>



<p class="wp-block-paragraph">然后，所有的测试还需要签保密协议，你还不能出来说。这个时间长了以后一定会造反的。艺术家们就觉得他们成为了OpenAI的公关噱头，每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后呢，是呼吁Open AI可以更加开放。你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢，呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错，这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期。仅仅依靠零星露出的作品保持社交媒体关注度，Open AI是可以接受的，但是艺术家们肯定接受不了。最后，艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以，他们就整了这么一个幺蛾子出来。你虽然跟我签了保密协议，但是我们就把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。当然，现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。</p>



<p class="wp-block-paragraph">也许过一段时间，人家就突然就发布了，发现这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。这些艺术家们在一个网站上开始征集签名，说来你们谁支持我。这个里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候就已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。第一个就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说，你穿了件衣服，里边有个人，但是呢，人在做一些动作的时候，里边的肢体就会从衣服外边撑出来。你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯，这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这两条腿迈着迈着它都变成左脚了，或者是变成右脚。在图像生成模型上，也会出现这种问题，视频生成模型更加难以避免。这是第一个问题，第二个问题就是一致性可控性。这个其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。</p>



<p class="wp-block-paragraph">现在在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。</p>



<p class="wp-block-paragraph">像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。再往后呢，算力成本实在太高了。图片生成，现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，它需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。</p>



<p class="wp-block-paragraph">当然了，这个还不是困扰视频生成本身的最大难题。更大的难题是什么呢？就是视频要好看。最后生成完了以后，视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在，做视频生成其实是在两个层面上大家在努力。第一个层面就是模型怎么能够让模型更好；第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗？上传图片吗？然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件，这个时候就发现，这个实在太难了，因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢，是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，是否有人见过飞机驾驶舱，从头到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，你也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。</p>



<p class="wp-block-paragraph">这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说，都是极大的挑战。到目前为止，没有特别好使的。在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说我们付出的努力极其艰巨呢，也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。</p>



<p class="wp-block-paragraph">像谷歌前面就是矫枉过正了。你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。所以，这个到底掌握到什么步骤，他们也是很头疼的。再往后什么欺诈，视频的欺诈，那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。</p>



<p class="wp-block-paragraph">因为这个东西完全可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是你可以自己上传一张照片，说我现在让这个人去讲话。你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。</p>



<p class="wp-block-paragraph">你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然，有其他的工具可以干这件事情。现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。除了前面我们讲的什么欺诈、血腥暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这对于视频来说也很麻烦。</p>



<p class="wp-block-paragraph">什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。</p>



<p class="wp-block-paragraph">但是，这个但是后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的。稍微擦点边的都拒绝服务。</p>



<p class="wp-block-paragraph">你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝。请给我画个什么星球大战、什么米老鼠，马上拒绝。</p>



<p class="wp-block-paragraph">所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能，这些已经可以达到一部分商业使用的能力了。</p>



<p class="wp-block-paragraph">现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人人吃东西了，这个已经有一定的传播力了。数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。</p>



<p class="wp-block-paragraph">YouTube上有很多的这种预告片开始吸引流量。什么意思呢？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以，这样的一个视频我已经被这种视频骗了好多回了。</p>



<p class="wp-block-paragraph">我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。现在很多的漫画小说详解相关的视频在抖音、快手上也开始在盈利赚钱了，所以这块已经走入了商业化。</p>



<p class="wp-block-paragraph">那么，以假乱真也造成了很多的困扰，比如说雷军骂人，于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语，这个也是很容易骗到人的。下一步的AI工具会是什么样的呢？第一个专业应用级别，可能还是会有专门的人去做。</p>



<p class="wp-block-paragraph">就像现在我们，比如说在视频领域里头，我的视频处理都是用剪映的，但是呢也还是有很多专业团队会使用一些更复杂的这种视频工具。Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用。用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢肯定还有待增强。普通人使用Sora这样的模型，或者使用其他的刚才我们说的吉梦也好，可灵也好，还是挺难使的，他们可能还需要在用户交互上或者是工具上还要有待增强。这个大模型本身，他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用，但是呢，这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上。在吉梦也好，可灵也好，都在做手机APP，网站的这种Web APP也在尝试跟各自的这种视频编辑工具进行结合，这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢？我们已经讲了Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好、吉梦也好、Runway Pica，一大堆的这样的视频模型就出来了。</p>



<p class="wp-block-paragraph">他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索寻找新方向，但是呢，都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事。感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是，等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，都已经有很多用户开始使用了，Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，称这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫，大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型吧，可以仿真出世界来的，当时是可以出一分钟的视频的。虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。这一次呢只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟。其实跟我们现在可以使用到的很多视频生成模型参数是一样的。</p>



<p class="wp-block-paragraph">现在的视频生成模型基本上都是5到10秒钟。那么，艺术家们为什么干这么个事呢？原因呢也很简单。有一句话叫“富贵不归乡，如锦衣夜行”，什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了，艺术家们加入呢是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假呀，或者版权侵害什么这样的视频，所以呢需要一些成员说你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过，这个叫红队成员。</p>



<p class="wp-block-paragraph">第三种呢叫创意合作伙伴，Sora每过一段时间呢会发出一些样板视频来，那意思什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。现在呢这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。它不像是我们普通人去使用图片生成模型式的，我们只要写一个提示词，生成出来大差不差的，我就能用。</p>



<p class="wp-block-paragraph">这些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以，对于他们来说，想要让这种视频模型输出了自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。所以呢，他们说：“我们付出了很多，但是发表的作品呢又非常难。”因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。</p>



<p class="wp-block-paragraph">即使是有作品被发表展示了，这些艺术家们呢应该也没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试。</p>



<p class="wp-block-paragraph">然后，所有的测试还需要签保密协议，你还不能出来说，这个时间长了以后一定会造反的。艺术家们呢就觉得他们成为了OpenAI的公关噱头，就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。其实，这些呢是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后呢，是呼吁Open AI可以更加开放，你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢，呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错，这就是他们的一个公开信。现在呢，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。</p>



<p class="wp-block-paragraph">最后呢，就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。所以，他们就整了这么一个幺蛾子出来，你虽然跟我签了保密协议，但是我们就啪，把这个东西扔到世界上最大的开元大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。</p>



<p class="wp-block-paragraph">当然，现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢？现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。也许过一段时间，人家就突然就发布了，发现哎，这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。</p>



<p class="wp-block-paragraph">这些艺术家们在一个网站上开始征集签名，说来你们谁支持我。这个里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢并不需要进行身份验证，所以也不知道这个是真是假。那么，视频生成为什么这么费劲呢？Open AI在年初的时候，就在2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。</p>



<p class="wp-block-paragraph">但是呢，视频生成本身的难度是很大的。第一个呢，就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢人在做一些动作的时候，里边的肢体就会从衣服外边撑出来。在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯？这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的内容，两条腿突然走着走着就变三条了，或者是这两条腿迈着迈着就都变成左脚了，变成右脚。在图像生成模型上，也会出现这种问题，视频生成模型更加难以避免。这是第一个问题。</p>



<p class="wp-block-paragraph">第二个问题就是一致性可控性，这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢，在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。</p>



<p class="wp-block-paragraph">脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。</p>



<p class="wp-block-paragraph">再往后呢，就是算力成本实在太高了。图片生成，现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。当然了，这个还不是困扰视频生成本身的最大难题。</p>



<p class="wp-block-paragraph">更大的难题是什么呢？就是视频要好看。最后生成完了以后，视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在呢，做视频生成其实是在两个层面上大家在努力，第一个层面就是模型，怎么能够让模型更好；第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗，上传图片吗，然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件，这个时候就发现，哎呀，这个实在太难了。因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢，是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，就是有没有人见过飞机驾驶舱？从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，你也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。</p>



<p class="wp-block-paragraph">这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说，都是极大的挑战。到目前为止没有特别好使的，在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说说我们付出的努力极其艰巨呢，也是如此。</p>



<p class="wp-block-paragraph">他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。</p>



<p class="wp-block-paragraph">咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，还不能矫枉过正。像谷歌前面就是矫枉过正了，你跟他说任何的提示词里边一定是有黄种人、有黑人、有白人、有男的、有女的，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。</p>



<p class="wp-block-paragraph">所以这个到底掌握到什么步骤，他们也是很头疼的。再往后，什么欺诈？视频的欺诈那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢完全可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢，你可以自己上传一张照片，说我现在让这个人去讲话。</p>



<p class="wp-block-paragraph">你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然，有其他的工具可以干这件事情。现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。</p>



<p class="wp-block-paragraph">除了前面我们讲的什么欺诈呀、血腥、暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。</p>



<p class="wp-block-paragraph">但是，这个但是后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjourney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。</p>



<p class="wp-block-paragraph">你只要提到任何人的名字，直接拒绝。说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝。请给我画个什么星球大战，什么米老鼠，马上拒绝。所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。</p>



<p class="wp-block-paragraph">现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能。这些呢已经可以达到一部分商业使用的能力了。现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。</p>



<p class="wp-block-paragraph">很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个说话了，这个吃东西了，这个已经有一定的传播力了。数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。YouTube上呢，有很多的这种预告片开始吸引流量。什么意思呢？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。</p>



<p class="wp-block-paragraph">当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以，这样的视频我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画、小说详解相关的视频，在抖音、快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。那么，以假乱真也造成了很多的困扰，比如说雷军骂人，于东来骂人，甚至还有人把德国选择党的那个女党首的这个视频配上中文上来，讲一些比较激烈的这种话语吧，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个专业应用级别呢，可能还是会有专门的人去做，就像现在我们，比如说在视频领域里头，我的视频处理都是用剪映的。但是呢，也还是有很多专业团队会使用一些更复杂的这种视频工具，Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用，用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢肯定还有待增强，普通人使用Sora这样的模型，或者使用其他的，刚才我们说的吉梦也好，可灵也好，还是挺难使的。他们可能还需要在用户交互上或者是工具上还要有待增强，这个大模型本身他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用，但这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上。在吉梦也好，可灵也好，都在做手机APP，网站的这种Web APP，也在尝试跟各自的这种视频编辑工具进行结合。这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢？我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好，吉梦也好，Runway Pica，一大堆的这样的视频模型就出来了。</p>



<p class="wp-block-paragraph">他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事。感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是，等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，都已经有很多用户开始使用了。Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，说这些艺术家们呢，都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫，大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，就是不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的。当时是可以出一分钟的视频的，虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。这一次呢只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟，实际上跟我们现在可以使用到的大量的这种视频生成模型参数是一样的。</p>



<p class="wp-block-paragraph">现在的视频生成模型基本上都是5到10秒钟。那么，艺术家们为什么干这么个事呢？原因呢也很简单，有一句话叫“富贵不归乡，如锦衣夜行”。什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了，艺术家们加入呢是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假呀，或者版权侵害什么这样的视频，所以呢需要一些成员说，你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过，这个叫红队成员。</p>



<p class="wp-block-paragraph">第三种呢叫创意合作伙伴。Sora每过一段时间呢会发出一些样板视频来，那意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。现在呢，这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。</p>



<p class="wp-block-paragraph">它不像是我们普通人去使用图片生成模型，式的那我们只要写一个提示词，生成出来大差不差的，我就能用。那些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以对于他们来说，想要让这种视频模型输出了自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。</p>



<p class="wp-block-paragraph">所以呢，他说哎，我们付出了很多，但是发表的作品呢又非常难，因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。即使是有作品被发表展示了，这些艺术家们呢应该也没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。</p>



<p class="wp-block-paragraph">这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说。这个时间长了以后一定会造反的。艺术家们呢就觉得他们成为了OpenAI的公关噱头，就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些呢其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后呢是呼吁Open AI可以更加开放，你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错。这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在呢，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。最后呢，就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以他们就整了这么一个幺蛾子出来，你虽然跟我签了保密协议，但是我们就啪，把这个东西扔到世界上最大的开元大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。当然，现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。</p>



<p class="wp-block-paragraph">也许过一段时间，人家就突然就发布了，发现哎，这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。艺术家们在一个网站上开始征集签名，说来你们谁支持我，这里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候，2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。第一个呢，就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题，咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢人在做一些动作的时候呢，里边的肢体就会从衣服外边撑出来。你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯，这件事告诉大模型，让他每一次生成的时候都向后弯，这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这个两条腿迈着迈着他都变成左脚了，都变成右脚。在图像生成模型上，也会出现这种问题，视频生成模型更加难以避免。这是第一个问题。</p>



<p class="wp-block-paragraph">第二个问题就是一致性可控性，这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢，在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。</p>



<p class="wp-block-paragraph">像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说，非常非常难以控制和把握。再往后呢，就是算力成本实在太高了。图片生成，现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。</p>



<p class="wp-block-paragraph">当然了，这个还不是困扰视频生成本身的最大难题。更大的难题是什么呢？就是视频要好看，最后生成完了以后视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在呢，做视频生成其实是在两个层面上大家在努力，第一个层面就是模型，怎么能够让模型更好。第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗？上传图片吗？然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件，这个时候就发现，哎呀，这个实在太难了。因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢，是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，就是有没有人见过飞机驾驶舱，从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置，才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，你也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说，都是极大的挑战。</p>



<p class="wp-block-paragraph">到目前为止没有特别好使的。在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说说我们付出的努力极其艰巨呢，也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。像谷歌前面就是矫枉过正了，你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。</p>



<p class="wp-block-paragraph">所以这个到底掌握到什么步骤，他们也是很头疼的。再往后什么欺诈？视频的欺诈，那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢完全的可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢你可以自己上传一张照片，说我现在让这个人去讲话。你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。</p>



<p class="wp-block-paragraph">你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然有其他的工具可以干这件事情，现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。除了前面我们讲的什么欺诈呀、血腥暴力歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解的很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。但是，这个但是后边才是重点，艺术表现力非常的差。</p>



<p class="wp-block-paragraph">甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来。说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。</p>



<p class="wp-block-paragraph">所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部，也集成了视频直接生成的这种功能，这些呢已经可以达到一部分商业使用的能力了。</p>



<p class="wp-block-paragraph">现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人人吃东西了，这个已经有一定的传播力了。数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。</p>



<p class="wp-block-paragraph">YouTube上呢，有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以。这样的一个视频，我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频在抖音在快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。那么，以假乱真也造成了很多的困扰，比如说雷军骂人、于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语吧，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个专业应用级别呢，可能还是会有专门的人去做，就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的。但是呢，也还是有很多专业团队会使用一些更复杂的这种视频工具，Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用，用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢肯定还有待增强。普通人使用Sora这样的模型，或者使用其他的刚才我们说的吉梦也好、可灵也好，还是挺难使的。他们可能还需要在用户交互上或者是工具上还要有待增强，这个大模型本身他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用，但这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上，在吉梦也好、可灵也好，都在做手机APP，网站的这种Web APP也在尝试，跟各自的这种视频编辑工具进行结合，这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢？我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆，可灵也好、吉梦也好、Runway Pica，一大堆的这样的视频模型就出来了。他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。</p>



<p class="wp-block-paragraph">今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事。感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，都已经有很多用户开始使用了，Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，说明这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫，大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的，当时是可以出一分钟的视频的，虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。这一次呢只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟，实际上跟我们现在可以使用到的很多视频生成模型参数是一样的。</p>



<p class="wp-block-paragraph">现在的视频生成模型基本上都是5-10秒钟。那么，艺术家们为什么干这么个事呢？原因呢也很简单，有一句话叫“富贵不归乡，如锦衣夜行”。什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了。艺术家们加入呢，是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假呀，或者版权侵害什么这样的视频，所以呢需要一些成员说，你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过。</p>



<p class="wp-block-paragraph">这个叫红队成员。第三种呢叫创意合作伙伴，Sora每过一段时间呢会发出一些样板视频来，那意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。现在呢，这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。</p>



<p class="wp-block-paragraph">它不像是我们普通人去使用图片生成模型那样。我们只要写一个提示词，生成出来大差不差的，我就能用。这些人是艺术家，之所以能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以，对于他们来说，想要让这种视频模型输出自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。</p>



<p class="wp-block-paragraph">所以呢，他们说：“我们付出了很多，但是发表的作品呢又非常难。”因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。即使是有作品被发表展示了，这些艺术家们呢，应该也没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。</p>



<p class="wp-block-paragraph">这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说。这个时间长了以后一定会造反的。</p>



<p class="wp-block-paragraph">艺术家们呢，就觉得他们成为了OpenAI的公关噱头。就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些呢，其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。再往后呢，是呼吁Open AI可以更加开放。</p>



<p class="wp-block-paragraph">你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢，呼吁艺术家们开始使用开源的视频模型，表示现在有很多开源模型已经可以用了，效果还不错。这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在呢，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。最后呢，就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以，他们就整了这么一个幺蛾子出来。你虽然跟我签了保密协议，但是我们就啪，把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。当然现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。</p>



<p class="wp-block-paragraph">也许过一段时间，人家就突然就发布了，发现哎，这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。这些艺术家们在一个网站上开始征集签名，说来，你们谁支持我。这个里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢，并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候，2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。第一个呢，就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢人在做一些动作的时候，里边的肢体就会从衣服外边撑出来。你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯？这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这两条腿迈着迈着都变成左脚了，都变成右脚。在图像生成模型上也会出现这种问题，视频生成模型更加难以避免。这是第一个问题。</p>



<p class="wp-block-paragraph">第二个问题就是一致性可控性，这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢，在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这种方式是可以让这个脸稍微的稳定一点的。</p>



<p class="wp-block-paragraph">脸是一方面，然后这个身材、身上的衣服、各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。</p>



<p class="wp-block-paragraph">再往后呢，就是算力成本实在太高了。图片生成，现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高的。当然了，这个还不是困扰视频生成本身的最大的难题，更大的难题是什么呢？就是视频要好看。</p>



<p class="wp-block-paragraph">最后生成完了以后视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在呢，做视频生成其实是在两个层面上大家在努力。第一个层面就是模型，怎么能够让模型更好。第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗，上传图片吗，然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件，这个时候就发现，哎呀，这个实在太难了。因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢，是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，有没有人见过飞机驾驶舱，从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。</p>



<p class="wp-block-paragraph">这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说都是极大的挑战。到目前为止没有特别好使的，在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说，我们付出的努力极其艰巨呢？也是如此，他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。</p>



<p class="wp-block-paragraph">像谷歌前面就是矫枉过正了。你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人，有男的、有女的，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。所以这个到底掌握到什么步骤，他们也是很头疼的。</p>



<p class="wp-block-paragraph">再往后什么欺诈，视频的欺诈那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢，完全的可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢你可以自己上传一张照片，说我现在让这个人去讲话。</p>



<p class="wp-block-paragraph">你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然有其他的工具可以干这件事情，现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。</p>



<p class="wp-block-paragraph">除了前面我们讲的什么欺诈、血腥、暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。</p>



<p class="wp-block-paragraph">但是，这个但是后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。</p>



<p class="wp-block-paragraph">所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能，这些呢已经可以达到一部分商业使用的能力了。</p>



<p class="wp-block-paragraph">现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人吃东西了，这个已经有一定的传播力了。数字人呢，也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。</p>



<p class="wp-block-paragraph">YouTube上呢，有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以，这样的一个视频。我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频在抖音、快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。以假乱真也造成了很多的困扰，比如说雷军骂人，于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个专业应用级别呢，可能还是会有专门的人去做，就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的。但是呢，也还是有很多专业团队会使用一些更复杂的这种视频工具。Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用。用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢肯定还有待增强，普通人使用Sora这样的模型，或者使用其他的刚才我们说的吉梦也好，可灵也好，还是挺难使的。他们可能还需要在用户交互上，或者是工具上还要有待增强，这个大模型本身，他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用，但这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上。在吉梦也好，可灵也好，都在做手机APP，网站的这种Web APP，也在尝试跟各自的这种视频编辑工具进行结合，这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢？我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好，吉梦也好，Runway Pica，一大堆的这样的视频模型就出来了。他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。</p>



<p class="wp-block-paragraph">今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么，虽然很多的厂商也在尝试去摸索寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事，感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，都已经有很多用户开始使用了。Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，说这些艺术家们呢，都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫，大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，就是不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的。当时是可以出一分钟的视频的，虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。这一次呢只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟，其实跟我们现在可以使用到的大量的这种视频生成模型参数是一样的。</p>



<p class="wp-block-paragraph">现在的视频生成模型基本上都是5到10秒钟。那么艺术家们为什么干这么个事呢？原因呢也很简单，有一句话叫“富贵不归乡，如锦衣夜行。”什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了，艺术家们加入呢是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假呀，或者版权侵害这样的视频，所以呢需要一些成员说，你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务或者怎么能够规避，怎么能绕过，这个叫红队成员。</p>



<p class="wp-block-paragraph">第三种呢叫创意合作伙伴。Sora每过一段时间呢会发出一些样板视频来，那意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。现在呢这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。它不像是我们普通人去使用图片生成模型式的，那我们只要写一个提示词，生成出来大差不差的，我就能用。</p>



<p class="wp-block-paragraph">这些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以对于他们来说，想要让这种视频模型输出了自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。于是他们说：“我们付出了很多，但是发表的作品呢又非常难。”因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。</p>



<p class="wp-block-paragraph">即使是有作品被发表展示了，这些艺术家们呢应该也没有得到什么回报。对应一个1,500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说，这个时间长了以后一定会造反的。</p>



<p class="wp-block-paragraph">艺术家们呢就觉得他们成为了OpenAI的公关噱头，就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些呢其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。再往后呢是呼吁Open AI可以更加开放，你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错，这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在呢Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。最后呢就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。所以他们就整了这么一个幺蛾子出来，你虽然跟我签了保密协议，但是我们就把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。</p>



<p class="wp-block-paragraph">当然现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。也许过一段时间，人家就突然就发布了，发现这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。</p>



<p class="wp-block-paragraph">这些艺术家们在一个网站上开始征集签名，谁支持我，这里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢并不需要进行身份验证，所以也不知道这个是真是假。那么视频生成为什么这么费劲呢？Open AI在年初的时候，2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。</p>



<p class="wp-block-paragraph">第一个呢就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪。图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢人在做一些动作的时候呢，里边的肢体就会从衣服外边撑出来。</p>



<p class="wp-block-paragraph">你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误。比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯，这个挺难的。我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这个两条腿迈着迈着他都变成左脚了，都变成右脚。在图像生成模型上，也会出现这种问题，视频生成模型更加难以避免。</p>



<p class="wp-block-paragraph">这是第一个问题。第二个问题就是一致性可控性，这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上。现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。</p>



<p class="wp-block-paragraph">像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。再往后呢就是算力成本实在太高了。图片生成现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。</p>



<p class="wp-block-paragraph">当然了，这个还不是困扰视频生成本身的最大的难题。更大的难题是什么呢？就是视频要好看。最后生成完了以后视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。现在呢做视频生成，其实是在两个层面上大家在努力。第一个层面就是模型，怎么能够让模型更好；第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式对话吗，上传图片吗，然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件。这个时候就发现，哎呀，这个实在太难了，因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。这大家想象一下，就是有没有人见过飞机驾驶舱？从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。</p>



<p class="wp-block-paragraph">视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说，都是极大的挑战。</p>



<p class="wp-block-paragraph">到目前为止没有特别好使的。在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说说：“我们付出的努力极其艰巨呢？”也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大得多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。像谷歌前面就是矫枉过正了，你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人、有男的、有女的，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。 所以这个到底掌握到什么步骤，他们也是很头疼的。</p>



<p class="wp-block-paragraph">再往后什么欺诈，视频的欺诈那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢完全可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢你可以自己上传一张照片，说我现在让这个人去讲话。你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。 当然有其他的工具可以干这件事情，现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。</p>



<p class="wp-block-paragraph">除了前面我们讲的什么欺诈呀、血腥暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。那么我们到底还需不需要等Sora呢？</p>



<p class="wp-block-paragraph">其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去。这个Dalle3算是最强的。但是，这个但是后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢，画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。</p>



<p class="wp-block-paragraph">你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝。请给我画个什么星球大战、什么米老鼠，马上拒绝。所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。</p>



<p class="wp-block-paragraph">现在可以用的视频大模型其实已经不少了，甭管是runway还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能，这些呢已经可以达到一部分商业使用的能力了。现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人吃东西了，这个已经有一定的传播力了。</p>



<p class="wp-block-paragraph">数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。YouTube上呢有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以，这样的视频我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频在抖音、快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。以假乱真也造成了很多的困扰，比如说雷军骂人、于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语吧，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个专业应用级别呢，可能还是会有专门的人去做，就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的，但是呢也还是有很多专业团队会使用一些更复杂的这种视频工具。Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用。用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用呢肯定还有待增强，普通人使用Sora这样的模型或者使用其他的刚才我们说的吉梦也好，可灵也好，还是挺难使的。他们可能还需要在用户交互上或者是工具上还要有待增强，这个大模型本身他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用。但是呢，这个可能距离我们还稍微远一些。这种半专业应用的话，应该正在路上，在吉梦也好可灵也好呢，都在做手机APP，网站的这种Web APP也在尝试跟各自的这种视频编辑工具进行结合，这一块的话有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢？我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好、吉梦也好、Runway Pica，一大堆的这样的视频模型就出来了。他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。</p>



<p class="wp-block-paragraph">今天我还装了一个叫QWQ，通义千问做的推理模型。在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索，寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。</p>



<p class="wp-block-paragraph">所以我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。好，这是今天讲的故事，感谢大家收听，请帮忙点赞点小铃铛，参加discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">其实，从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去。这个Dalle3算是最强的。但是，这个“但是”后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是画的过程还是比较粗糙的。稍微擦点边的都拒绝服务。</p>



<p class="wp-block-paragraph">你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来。说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝。请给我画个什么星球大战，什么米老鼠，马上拒绝。所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。</p>



<p class="wp-block-paragraph">现在可以用的视频大模型其实已经不少了，甭管是runway还是国内能够使用的吉梦。吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能。这些呢，已经可以达到一部分商业使用的能力了。现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人说话了，这个人吃东西了，这个已经有一定的传播力了。</p>



<p class="wp-block-paragraph">数字人呢，也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。YouTube上呢，有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个你也不能说他粗制滥造，有的做的还可以。这样的一个视频，我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频，在抖音、快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。至于Open AI下边该干嘛去呢，我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这个方向以后，大家就赶快都去出了一堆可灵也好，吉梦也好，Runway Pica，一大堆的这样的视频模型就出来了。</p>



<p class="wp-block-paragraph">所以，我们期待Open AI可以给大家指明下一个方向。等指明了以后，全球的厂商再顺着这个方向往前跑。好，这是今天讲的故事，感谢大家收听，请帮忙点赞、点小铃铛，参加discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂地泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，已经有很多用户开始使用了。Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂地开放了一段时间。这些艺术家还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，称这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫。大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，不是一个全尺寸的模型，参数也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的，当时是可以出一分钟的视频的。虽然一分钟视频并没有那么大的用处，超过一分钟都属于超长镜头了，电影里头用这种镜头其实也不是那么多。这一次只提供了1080P、720P、360P三种的分辨率，时长就是5到10秒钟。其实跟我们现在可以使用到的大量这种视频生成模型参数是一样的，现在的视频生成模型基本上都是5到10秒钟。</p>



<p class="wp-block-paragraph">那么，艺术家们为什么干这么个事呢？原因很简单。有一句话叫“富贵不归乡，如锦衣夜行”。什么意思呢？有钱了得回家显摆显摆，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">那公开信里都写了什么呢？他写了说，艺术家们年初就被邀请加入了。艺术家们加入是分为三种不同的角色。第一个叫早期测试者，估计就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假，或者版权侵害什么这样的视频。所以需要一些成员不断地向他提这样的要求，看看能不能都识别出来，拒绝服务或者怎么能够规避，怎么能绕过，这个叫红队成员。第三种叫创意合作伙伴，Sora每过一段时间会发出一些样板视频来，意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。</p>



<p class="wp-block-paragraph">现在，这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，需要付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。它不像是我们普通人去使用图片生成模型式的，我们只要写一个提示词，生成出来大差不差的我就能用。</p>



<p class="wp-block-paragraph">这些人是艺术家，之所以能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。所以对于他们来说，想要让这种视频模型输出自己能够满意的产品，或者叫作品，这个事本身是非常难的。他们说，我们付出了很多，但是发表的作品又非常难，因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后再要经过Open AI的审核，才有极少的一部分作品可以发表。</p>



<p class="wp-block-paragraph">即使是有作品被发表展示了，这些艺术家们应该也没有得到什么回报。对应一个1500亿美金的Open AI来说，大家觉得这个事有点太不公平了。而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期。这就相当于什么？就是一帮人进去打测试服的游戏去了，结果始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说。这个时间长了以后一定会造反的。</p>



<p class="wp-block-paragraph">艺术家们就觉得他们成为了OpenAI的公关噱头。就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。这些其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后是呼吁Open AI可以更加开放。你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错，这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI是可以接受的，但艺术家们肯定接受不了。最后，艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以，他们就整了这么一个幺蛾子出来。你虽然跟我签了保密协议，但是我们就把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上，让大家都瞅了这么一眼。当然，现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢，现在不知道，因为Open AI绝对是社交媒体公关大师，不停地玩各种奇怪的事情。</p>



<p class="wp-block-paragraph">也许过一段时间，人家就突然就发布了，发现这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。这些艺术家们在一个网站上开始征集签名，说来，你们谁支持我，这里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候，2月份的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是，视频生成本身的难度是很大的。第一个，内容合理性其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边有个人，但是人在做一些动作的时候，里边的肢体就会从衣服外边撑出来。你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，膝盖应该往后弯的。但是，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯，这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的内容，两条腿突然走着走着就变三条了，或者是两条腿迈着迈着都变成左脚了，变成右脚。图像生成模型上也会出现这种问题，视频生成模型更加难以避免。这是第一个问题。第二个问题就是一致性可控性，这个其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。</p>



<p class="wp-block-paragraph">现在在图片生成模型的一致性上，已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。脸是一方面，然后这个身材、身上的衣服、各种配饰，你要让所有的这些图片都很稳定地保持一致性，这个很难。</p>



<p class="wp-block-paragraph">像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。再往后，算力成本实在太高了。图片生成，现在我们画一幅1080P的图像，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。</p>



<p class="wp-block-paragraph">当然了，这还不是困扰视频生成本身的最大难题。更大的难题是什么呢？就是视频要好看。最后生成完了以后，视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。</p>



<p class="wp-block-paragraph">现在做视频生成，其实是在两个层面上大家在努力。第一个层面就是模型，怎么能够让模型更好。第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗？上传图片吗？然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件，这个时候就发现，哎呀，这个实在太难了。因为最早的时候，视频编辑这件事情都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。</p>



<p class="wp-block-paragraph">当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。大家想象一下，有没有人见过飞机驾驶舱？从头上到脚下，你身边所有能看见的地方，都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。</p>



<p class="wp-block-paragraph">现在我们要做视频生成的这种工具了，在有大模型的基础上，你也需要大量的开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。这些交互的过程应该如何去安排，这个对于现在所有的做视频生成工具的人来说，都是极大的挑战。</p>



<p class="wp-block-paragraph">到目前为止，没有特别好使的。在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以，为什么这帮艺术家也说我们付出的努力极其艰巨呢，也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大得多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时，你还不能矫枉过正。</p>



<p class="wp-block-paragraph">像谷歌前面就是矫枉过正了。你跟他说，任何的提示词里边一定是有黄种人、有黑人、有白人、有男的、有女的，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。所以，这个到底掌握到什么步骤，他们也是很头疼的。</p>



<p class="wp-block-paragraph">再往后，什么欺诈，视频的欺诈那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西完全可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是你可以自己上传一张照片，说我现在让这个人去讲话。</p>



<p class="wp-block-paragraph">你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话它就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。当然，有其他的工具可以干这件事情。现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。</p>



<p class="wp-block-paragraph">除了前面我们讲的什么欺诈、血腥、暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西，这个都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看Dalle3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去，这个Dalle3算是最强的。</p>



<p class="wp-block-paragraph">但是，这个“但是”后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjorney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝；你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝；你只要提到任何人的名字，直接拒绝；说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝；请给我画个什么星球大战、米老鼠，马上拒绝。</p>



<p class="wp-block-paragraph">所以，他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。现在可以用的视频大模型其实已经不少了，甭管是Runway，还是国内能够使用的吉梦，吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能，这些已经可以达到一部分商业使用的能力了。</p>



<p class="wp-block-paragraph">现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人吃东西了，这个已经有一定的传播力了。数字人也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。</p>



<p class="wp-block-paragraph">YouTube上有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以。这样的一个视频，我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。</p>



<p class="wp-block-paragraph">现在很多的漫画小说详解相关的视频，在抖音、快手上也开始在盈利赚钱了，所以这块已经走入了商业化。那么，以假乱真也造成了很多的困扰，比如说雷军骂人、于东来骂人，甚至还有人把那个德国选择党的那个女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语，这个也是很容易骗到人的。</p>



<p class="wp-block-paragraph">下一步的AI工具会是什么样的呢？第一个专业应用级别，可能还是会有专门的人去做。就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的。但是，也还是有很多专业团队会使用一些更复杂的这种视频工具。Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用。用完了以后出了所有东西，你们自己负责任，跟我就没有关系了，这是一种方式。</p>



<p class="wp-block-paragraph">半专业的应用肯定还有待增强，普通人使用Sora这样的模型，或者使用其他的，刚才我们说的吉梦也好、可灵也好，还是挺难使的。他们可能还需要在用户交互上，或者是工具上还要有待增强。这个大模型本身，他们自己慢慢训就可以了。至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用。但是，这个可能距离我们还稍微远一些。</p>



<p class="wp-block-paragraph">这种半专业应用的话，应该正在路上。在吉梦也好、可灵也好，都是在做手机APP，网站的这种Web APP也在尝试，跟各自的这种视频编辑工具进行结合，这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢，我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这个方向以后，大家就赶快都去出了一堆可灵也好、吉梦也好、Runway、Pica，一大堆的这样的视频模型就出来了。他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。</p>



<p class="wp-block-paragraph">今天我还装了一个叫QWQ，通义千问做的推理模型，在32B的参数下，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。</p>



<p class="wp-block-paragraph">所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索，寻找新方向，但是都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。所以，我们期待Open AI可以给大家指明下一个方向，等指明了以后，全世界的厂商再顺着这个方向往前跑。</p>



<p class="wp-block-paragraph">好，这是今天讲的故事，感谢大家收听，请帮忙点赞点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>



<p class="wp-block-paragraph">昨天，Sora短暂的泄露。但是，我们真的还需要等待Sora吗？大家好，欢迎收听老范讲故事的YouTube频道。在今年2月份，Open AI公布了他们的Sora大模型之后，大家一直在等待这个产品的正式发布。但是，等到了现在，已经到年底了，很多跟随Sora的产品都已经上线，已经有很多用户开始使用了。Sora自己还遥遥无期。</p>



<p class="wp-block-paragraph">在这样的一个时间点里，突然有一群艺术家将Sora的这个接口公开到了Hugging Face上面去，短暂的开放了一段时间。这些艺术家呢，还发表了一封公开信，表达了自己对于Open AI的各种剥削的不满。Open AI呢，及时发现，在一小时之后封闭了接口，说你们就到这吧，然后也出来做了一些解释，说明这些艺术家们都是跟我们一起去合作的，他们都是自愿参加的，没有什么强迫。大概也是讲了一些这种片汤话。</p>



<p class="wp-block-paragraph">至于Sora什么时候能发布，人家也没有再继续提供更进一步的信息。那么，这一次泄露出来的呢，是Sora的Turbo版本。Turbo是轻量级快速的版本，就是不是一个全尺寸的模型，参数呢也并不是很突出。2月份，Sora当时号称自己是世界模型，可以仿真出世界来的，当时是可以出一分钟的视频的，虽然一分钟视频并没有那么大的用处，超过一分钟都属于是超长镜头了，电影里头用这种镜头其实也不是那么多。这一次呢只提供了1080P、720P、360P三种的分辨率，然后时长呢就是5到10秒钟，实际上跟我们现在可以使用到的大量的这种视频生成模型参数是一样的。</p>



<p class="wp-block-paragraph">现在的视频生成模型基本上都是5-10秒钟。那么，艺术家们为什么干这么个事呢？原因呢也很简单。有一句话叫“富贵不归乡，如锦衣夜行。”什么意思呢？有钱了得回家显摆显摆去，要不然的话就跟穿了个好衣服，晚上出门没人看见那是一样的。对于这帮艺术家们来说，有了一个好东西，你又不让他们显摆，这肯定是非常非常不爽的。</p>



<p class="wp-block-paragraph">公开信里都写了什么呢？他写了说，艺术家们年初呢就被邀请加入了，艺术家们加入呢是分为三种不同的角色。第一个呢叫早期测试者，估计呢就是最一开始的一批人，还没有进行详细的分工，你们先来试试各种的接口能不能跑起来。第二个角色呢叫红队成员，这是干嘛使的？视频模型非常害怕一件事情，就是生成一些有害视频，色情、暴力、虚假呀，或者版权侵害什么这样的视频，所以呢需要一些成员说你不断的向他提这样的要求，看看能不能都识别出来，拒绝服务，或者怎么能够规避，怎么能绕过，这个叫红队成员。第三种呢叫创意合作伙伴，Sora每过一段时间呢会发出一些样板视频来，意思是什么？他说你看我还活着呢，我还在继续往前走，你们其他人怎么追赶也追不上。</p>



<p class="wp-block-paragraph">现在呢，这些艺术家们感觉被骗了，为什么呢？因为付出很多，Sora这种模型绝对没有那么好使。不是说它输出的东西不好，而是说你要想使用这个模型，付出的努力一定是非常艰巨的，因为你需要向它描述你到底要一个什么样的视频。它不像是我们普通人去使用图片生成模型式的，那我们只要写一个提示词，生成出来大差不差的，我就能用。这些人是艺术家，之所以他能成为艺术家，一定是他们对于自己的艺术产品有极高的要求。</p>



<p class="wp-block-paragraph">所以，对于他们来说，想要让这种视频模型输出了自己能够满意的产品，或者叫作品吧，这个事本身是非常难的。所以呢，他说：“我们付出了很多，但是发表的作品呢又非常难。”因为他们发表作品一定是经过层层筛选，甚至是竞赛，然后呢再要经过Open AI的审核，才有极少的一部分作品可以发表。即使是有作品被发表展示了，这些艺术家们呢应该也没有得到什么回报。对应一个1500亿美金的Open AI来说，大家觉得这个事有点太不公平了。</p>



<p class="wp-block-paragraph">而且这么长时间，你要说时间短了还可以，Sora大模型的发布又遥遥无期，这个就相当于什么？就是一帮人进去打测试服的游戏去了，结果呢始终也不给你公测，或者始终也不给你进正式上线，大家只能在里边参加各种删号测试，然后所有的测试还需要签保密协议，你还不能出来说。这个时间长了以后一定会造反的。艺术家们呢就觉得他们成为了OpenAI的公关噱头，就是每过一段时间，他们会在这么多艺术家，可能300多个艺术家里头，挑选那么几个作品放出来，说：“你看，这就是Sora现在能够达到的成就，你们其他人就羡慕去吧。”这些呢其实是艺术家们的艰苦工作，并不是Sora本身模型到底有多好。</p>



<p class="wp-block-paragraph">再往后呢是呼吁Open AI可以更加开放。你不要上来就是签一大堆保密协议，这个实在是对于艺术家们来说太不友好了。而且呢呼吁艺术家们开始使用开源的视频模型，说现在有很多开源模型已经可以用了，效果还不错。这就是他们的一个公开信。</p>



<p class="wp-block-paragraph">现在呢，Open AI内部动荡不断，Sora到底什么时候能发布还遥遥无期，仅仅依靠零星露出的作品保持社交媒体关注度，Open AI呢是可以接受的，但是艺术家们肯定接受不了。最后呢就是艺术家毕竟不是工程师，不是律师，不是会计师，不是其他的这种社畜。如果他们完全按照逻辑，按照大家签的协议去做事的话，就不是艺术家了。</p>



<p class="wp-block-paragraph">所以，他们就整了这么一个幺蛾子出来。你虽然跟我签了保密协议，但是我们就把这个东西扔到世界上最大的开源大模型的集散网站Hugging Face上去，让大家都瞅了这么一眼。当然现在也有人在讲说这个事情是不是又是Open AI的一次公关策略呢？现在不知道，因为Open AI绝对是社交媒体公关大师，不停的玩各种奇怪的事情。也许过一段时间，人家就突然就发布了，发现这个江湖上又没有哥的声音再传播了，咱们得再整出点幺蛾子出来，这个都难说。</p>



<p class="wp-block-paragraph">这些艺术家们在一个网站上开始征集签名，说来你们谁支持我。这个里边还有一个签名的人，号称叫埃隆·马斯克。只是签名的过程呢并不需要进行身份验证，所以也不知道这个是真是假。</p>



<p class="wp-block-paragraph">那么，视频生成为什么这么费劲呢？Open AI在年初的时候，已经为全世界整个的AIGC行业指明了方向，这个贡献还是非常巨大的，我们要承认。但是呢，视频生成本身的难度是很大的。第一个呢就是内容合理性，其实很难保持。六个手指头、七个手指头，手长得很奇怪，图片生成模型既然已经有这种问题了，那么视频生成模型有同样的手指头问题，或者各种的合理性问题，这个都是很正常的，避免不了的。</p>



<p class="wp-block-paragraph">还有就是物理破膜的问题。咱们做过3D动画的人都知道，经常是就会出现这种叫物理破膜。什么叫物理破膜？你比如说你穿了件衣服，里边呢有个人，但是呢人在做一些动作的时候，里边的肢体就会从衣服外边撑出来。你在视频模型生成的时候，有可能也会发生同样的事情，包括一些解剖学错误，比如说这个脚要往前走的时候，应该膝盖是往后弯的。但是呢，你怎么能够把这个膝盖必须往后弯这件事告诉大模型，让他每一次生成的时候都向后弯？这个挺难的。</p>



<p class="wp-block-paragraph">我们看过很多视频模型生成的这种内容，两条腿突然走着走着就变三条了，或者是这个两条腿迈着迈着他都变成左脚了，都变成右脚。在图像生成模型上，也会出现这种问题，视频生成模型更加难以避免。这是第一个问题。</p>



<p class="wp-block-paragraph">第二个问题就是一致性可控性，这个呢其实也是从图像生成模型那边就遇到的问题，到视频生成模型依然难以搞定。现在呢，在图片生成模型的一致性上已经好一点。什么叫一致性？比如说你说让老范讲故事这张脸出现在不同的角色身上，或者是不同的艺术风格上，现在图片生成模型有一些方法，比如说自己去训练小模型，这个方式是可以让这个脸稍微的稳定一点的。脸是一方面，然后这个身材，身上的衣服各种配饰，你要让所有的这些图片都很稳定的保持一致性，这个很难。</p>



<p class="wp-block-paragraph">像一个视频，一秒钟25帧到30帧，你要保证每一帧上，比如说这里都带着一个麦克风，这个对于他们来说非常非常难以控制和把握。再往后呢就是算力成本实在太高了。图片生成现在我们画一幅1080P的这种图像吧，大概就需要几个美分。那你想一秒钟25帧到30帧的视频，他需要多少算力？大家去做各种测试和实验的时候，这个成本是非常非常高。</p>



<p class="wp-block-paragraph">当然了，这个还不是困扰视频生成本身的最大的难题。更大的难题是什么呢？就是视频要好看。最后生成完了以后视频难看，没有人愿意看，没有人愿意传播，这个本身是没有任何意义和价值的。</p>



<p class="wp-block-paragraph">现在呢，做视频生成其实是在两个层面上大家在努力。第一个层面就是模型怎么能够让模型更好。第二个层面是什么？就是怎么去操控，我到底应该用一些什么样的方式，对话吗？上传图片吗？然后一大堆菜单和选项吗？应该怎么能够让他进行顺畅的操作，把这个视频生成出来，这个其实非常难。</p>



<p class="wp-block-paragraph">我记得在2014年的时候，有大量的团队尝试去做手机端的视频编辑软件。这个时候就发现，哎呀，这个实在太难了。因为最早的时候，视频编辑这件事情，都是在视频编辑机，那是个硬件，在那个上面弄的。再往后呢是在这种很专业的视频编辑电脑上面去操作，而且是由一些专业人士操作。当你要把视频编辑这件事情弄到手机上去操作的时候，需要调控的东西实在太多了，非常麻烦。</p>



<p class="wp-block-paragraph">这个大家想象一下，就是有没有人见过飞机驾驶舱？从头上到脚下，你身边所有能看见的地方，全都是各种各样的开关和仪表。视频编辑其实跟这个过程很像，大量的参数和开关选项需要设置才能够得到你满意的视频。现在我们要做视频生成的这种工具了，你在有大模型的基础上，你也需要大量的这种开关选项、菜单或者是提示词，才能够告诉大模型我们到底要生成什么样的视频。这些交互的过程应该如何去安排，这个对于现在所有的这种做视频生成工具的人来说都是极大的挑战。</p>



<p class="wp-block-paragraph">到目前为止没有特别好使的，在这么难操控的情况下，你要能保证输出出来的视频是有人愿意看的，这个难度就会更大一些。所以为什么这帮艺术家也说说：“我们付出的努力极其艰巨呢？”也是如此。他们想控制Sora这样的一个半成品，甚至可能都没有界面，你还需要去写代码，才可以让他跑起来的一个系统，让这样的系统去输出需要的视频，这个是非常非常麻烦的。</p>



<p class="wp-block-paragraph">除了视频模型操作的问题之外，下一个问题就是视频安全性，风险要比图片、文字、音频都要大的多，甚至把所有的这些前面我们讲的这些风险都盛起来，都没有视频所生成的这种风险更大。咱们前面讲的红队要去处理的问题，就是看怎么能够把这些风险在发布之前尽可能地发现，尽可能地排除掉。这些风险包括色情、暴力、歧视性的，而且歧视性你不能出现的同时呢，你还不能矫枉过正。像谷歌前面就是矫枉过正了。你跟他说，任何的提示词里边一定是有黄种人，有黑人，有白人，有男的，有女的，还有奇奇怪怪性别的人凑在一起，最后被骂的直接把这个接口封掉了。所以这个到底掌握到什么步骤，他们也是很头疼的。</p>



<p class="wp-block-paragraph">再往后什么欺诈，视频的欺诈那要比文字欺诈、图片欺诈、声音欺诈都要吓人，因为他真的像真的一样。因为这个东西呢完全可以以假乱真。我今天测试了一下，在剪映里边去使用真人数字人。什么叫真人数字人？就是有一个数字人在这讲话，但是呢你可以自己上传一张照片，说我现在让这个人去讲话。你要想做这个操作的话，剪映要干嘛？要去做人脸识别，保证你上传的这个照片是你自己，否则的话他就拒绝工作了。你说我今天上传一个雷军的，让他去骂人，去让他去做一些其他的事情，这个事他不干。</p>



<p class="wp-block-paragraph">当然有其他的工具可以干这件事情。现在雷军骂人也好，于东来骂人也好，这种视频都是在满天飞的。除了前面我们讲的什么欺诈呀，血腥、暴力、歧视之外，还有一个问题叫版权纷争。你一旦是遇到了版权纷争，这个对于视频来说也很麻烦。什么叫版权纷争？比如说请给我按照宫崎骏的风格画一个什么东西，或者生成一个什么动漫，或者星球大战里的一个什么角色去做一个什么样的事情，或者说你现在请用马斯克的脸给我生成一个什么东西。这呢都面临着版权纠纷，包括一些品牌和形象的纠纷，这些是需要去注意的。</p>



<p class="wp-block-paragraph">那么，我们到底还需不需要等Sora呢？其实从达利3的这个角度上来看，我觉得我们完全不需要再去期待Sora了。为什么呢？我们看看DALL·E 3现在画图的效果。首先，咱们先说优点，文字理解还是相当不错的。当你给他一个很长的提示词的时候，他会把提示词中的各个部分都理解得很清楚，而且尽量的都给你画到这个图片上去，这个DALL·E 3算是最强的。但是，这个“但是”后边才是重点，艺术表现力非常的差。甭管是跟最新的Flex比，还是跟Midjourney 6.1比，完全没法看。细节也是非常差的。他虽然可以把每一个提示词里边要求的东西都给你画上，但是呢画的过程还是比较粗糙的，稍微擦点边的都拒绝服务。</p>



<p class="wp-block-paragraph">你比如说，我要求给我按照迪士尼的3D风格画一个什么东西，马上拒绝。你说现在请给我按照日本漫画风格画，可以画出来；说现在请按照宫崎骏的风格给我画，马上拒绝。你只要提到任何人的名字，直接拒绝。说现在请按照哪一个漫画里的这个情节，七龙珠的漫画情节给我画一个东西，马上拒绝。请给我画个什么星球大战、什么米老鼠，马上拒绝。所以他的拒绝的东西实在是太多了。如果按照同样的政策去执行的话，那我觉得Sora是完全不值得期待的一个东西。</p>



<p class="wp-block-paragraph">现在可以用的视频大模型其实已经不少了，甭管是Runway还是国内能够使用的吉梦。吉梦是剪映下面的字节跳动做的，效果还可以。快手做的可灵效果其实也能够使用了，甚至在剪映内部也集成了视频直接生成的这种功能。这些呢已经可以达到一部分商业使用的能力了。现在的各种亲友照片变成视频，这种内容已经有很强的传播力了。很多人会把一些过世亲友的照片拿出来，给他一个提示词，说这个人现在笑了，这个人人说话了，这个人吃东西了，这个已经有一定的传播力了。</p>



<p class="wp-block-paragraph">数字人呢也已经开始赚钱了，甭管是数字人直播，还是数字人带货，或者数字人骂街，这块已经可以跑了。YouTube上呢，有很多的这种预告片开始吸引流量。什么意思？就是他经常告诉你说，现在哪一部大片后边要拍续集了，大家赶快去看呀。当你看了以后，发现是有很多的前作剪辑，然后再加上一些AI生成的内容，拼凑起来的一个，你也不能说他粗制滥造，有的做的还可以。</p>



<p class="wp-block-paragraph">这样的一个视频，我已经被这种视频骗了好多回了。我现在再看到说哪个大片要准备拍续集，上预告片了，我先得看谁发布的。如果不是原来那个电影的制作公司发布的，我就直接跳过不看了，很容易上当受骗。现在很多的漫画小说详解相关的视频在抖音、快手上也开始在盈利赚钱了，所以这块呢已经走入了商业化。</p>



<p class="wp-block-paragraph">那么，以假乱真也造成了很多的困扰，比如说雷军骂人、于东来骂人，甚至还有人把那个德国选择党的女党首，她的这个视频配上中文上来，讲一些比较激烈的这种话语，这个也是很容易骗到人的。下一步的AI工具会是什么样的呢？第一个专业应用级别呢，可能还是会有专门的人去做，就像现在我们，比如说在视频领域里头，我的这个视频处理都是用剪映的，但是呢也还是有很多专业团队会使用一些更复杂的这种视频工具。</p>



<p class="wp-block-paragraph">Sora以后可能就会向那个方向发展，说我们干脆就永远不再向公众开放了，就是直接签约给这些电影公司，让他们去用，用完了以后出了所有东西，你们自己负责任，跟我就没有关系了。这是一种方式。半专业的应用呢肯定还有待增强，普通人使用Sora这样的模型，或者使用其他的刚才我们说的吉梦也好，可灵也好，还是挺难使的。他们可能还需要在用户交互上，或者是工具上还要有待增强，这个大模型本身他们自己慢慢训就可以了。</p>



<p class="wp-block-paragraph">至于个人应用的话，是否能够爆发，我觉得应该还是可以爆发的，就是使用AI大模型生成视频的这种个人应用。但是呢，这个可能距离我们还稍微远一些。这种半专业应用的话，应该正在路上。在吉梦也好，可灵也好，都在做手机APP，网站的这种Web APP也在尝试，跟各自的这种视频编辑工具进行结合，这一块的话，有可能会最先让我们看到成绩。</p>



<p class="wp-block-paragraph">至于Open AI下边该干嘛去呢，我们已经讲了，Open AI的Sora已经不值得期待了。Open AI作为行业的排头兵老大，它有一个非常重要的职策，就是为整个行业指明下一个方向。他指明了Sora这一个方向以后，大家就赶快都去出了一堆可灵也好、吉梦也好、Runway、Pica，一大堆的这样的视频模型就出来了。他说我们要做O1这种可以带推理的模型，然后一堆的推理模型在这个后边就出来了。</p>



<p class="wp-block-paragraph">今天我还装了一个叫QWQ通义千问做的推理模型，在32B的参数下吧，可以达到甚至是部分超越O1 mini的这个能力了。他现在还达不到O1 Preview的这个能力，但是可以达到O1 Mini的能力，只有32B，那这个还是非常棒的一个东西。所以再往下一个方向到底是什么？虽然很多的厂商也在尝试去摸索，寻找新方向，但是呢都没有Open AI指的方向。他只要摇旗呐喊，大家就直接跟风往上冲，没有这种号召力。</p>



<p class="wp-block-paragraph">所以，我们期待Open AI可以给大家指明下一个方向。等指明了以后，全世界的厂商再顺着这个方向往前跑。好，这是今天讲的故事。感谢大家收听，请帮忙点赞、点小铃铛，参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道，再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>一年亏损50亿美元，OpenAI压力山大：再不推出GPT5，可能没有机会了——GPT-4面临Anthropic Claude 3.5 Sonnet和Meta的LLama 3.1 405b的挑战</title>
		<link>https://lukefan.com/2024/07/28/%e4%b8%80%e5%b9%b4%e4%ba%8f%e6%8d%9f50%e4%ba%bf%e7%be%8e%e5%85%83%ef%bc%8copenai%e5%8e%8b%e5%8a%9b%e5%b1%b1%e5%a4%a7%ef%bc%9a%e5%86%8d%e4%b8%8d%e6%8e%a8%e5%87%bagpt5%ef%bc%8c%e5%8f%af%e8%83%bd/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 28 Jul 2024 00:47:20 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Aceropic Cloud 3.5 Sonnet]]></category>
		<category><![CDATA[API销售]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[GPT-4 Mini]]></category>
		<category><![CDATA[GPT-5发布]]></category>
		<category><![CDATA[GPT5]]></category>
		<category><![CDATA[GT5推出]]></category>
		<category><![CDATA[iPhone 16发布会]]></category>
		<category><![CDATA[Microsoft OpenAI合作]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI Plus]]></category>
		<category><![CDATA[OpenAI估值]]></category>
		<category><![CDATA[OpenAI压力]]></category>
		<category><![CDATA[OpenAI发展策略]]></category>
		<category><![CDATA[Redit]]></category>
		<category><![CDATA[Steal the home]]></category>
		<category><![CDATA[上市计划]]></category>
		<category><![CDATA[云服务成本]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[亚马逊因素]]></category>
		<category><![CDATA[人员成本]]></category>
		<category><![CDATA[估值]]></category>
		<category><![CDATA[商业模式创新]]></category>
		<category><![CDATA[大模型之争]]></category>
		<category><![CDATA[小模型调试]]></category>
		<category><![CDATA[市场份额]]></category>
		<category><![CDATA[市场机制]]></category>
		<category><![CDATA[市场竞争分析.]]></category>
		<category><![CDATA[市场策略]]></category>
		<category><![CDATA[市场验证]]></category>
		<category><![CDATA[开放AI生态系统]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[微调与RAG]]></category>
		<category><![CDATA[微调免费]]></category>
		<category><![CDATA[微软]]></category>
		<category><![CDATA[微软销售策略]]></category>
		<category><![CDATA[投资风险]]></category>
		<category><![CDATA[拉玛3.1405B]]></category>
		<category><![CDATA[数据处理]]></category>
		<category><![CDATA[新兴竞争者]]></category>
		<category><![CDATA[新技术应用]]></category>
		<category><![CDATA[未来科技趋势]]></category>
		<category><![CDATA[核心竞争力]]></category>
		<category><![CDATA[梅塔]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[特斯拉案例]]></category>
		<category><![CDATA[研发经费]]></category>
		<category><![CDATA[竞争力提升]]></category>
		<category><![CDATA[竞争激烈]]></category>
		<category><![CDATA[端到端语言训练模型]]></category>
		<category><![CDATA[苹果]]></category>
		<category><![CDATA[融资需求]]></category>
		<category><![CDATA[行业前景]]></category>
		<category><![CDATA[行业开拓]]></category>
		<category><![CDATA[行业新趋势]]></category>
		<category><![CDATA[行业规范]]></category>
		<category><![CDATA[行业震荡]]></category>
		<category><![CDATA[计算成本]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[谷歌I/O]]></category>
		<category><![CDATA[高性能计算]]></category>
		<category><![CDATA[高质量训练数据]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1437</guid>

					<description><![CDATA[GPT5如果再不出的话，可能就没有机会了。大家好，这里是老范讲故事的YOUT5频道。今天咱们来讲一讲OpenA ... <a title="一年亏损50亿美元，OpenAI压力山大：再不推出GPT5，可能没有机会了——GPT-4面临Anthropic Claude 3.5 Sonnet和Meta的LLama 3.1 405b的挑战" class="read-more" href="https://lukefan.com/2024/07/28/%e4%b8%80%e5%b9%b4%e4%ba%8f%e6%8d%9f50%e4%ba%bf%e7%be%8e%e5%85%83%ef%bc%8copenai%e5%8e%8b%e5%8a%9b%e5%b1%b1%e5%a4%a7%ef%bc%9a%e5%86%8d%e4%b8%8d%e6%8e%a8%e5%87%bagpt5%ef%bc%8c%e5%8f%af%e8%83%bd/" aria-label="阅读 一年亏损50亿美元，OpenAI压力山大：再不推出GPT5，可能没有机会了——GPT-4面临Anthropic Claude 3.5 Sonnet和Meta的LLama 3.1 405b的挑战">阅读更多</a>]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="一年亏损50亿美元，OpenAI压力山大：再不推出GPT5，可能没有机会了——GPT-4面临Anthropic Claude 3.5 Sonnet和Meta的LLama 3.1 405b的挑战" width="900" height="506" src="https://www.youtube.com/embed/cbA0B8tLYws?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT5如果再不出的话，可能就没有机会了。大家好，这里是老范讲故事的YOUT5频道。今天咱们来讲一讲OpenAI现在身上的压力到底有多大。再不出GPT5，可能真的要出事儿了，因为前面吹过的牛实在太多了，特别是Sola这样的模型，号称可以直接生成长的视频出来，到现在已经半年了，还没有真正拿出来，只是每个月放出几个视频而已。而其他各个公司，按照Sora方向做的产品，已经都开始在公众测试了，这对他们来说一定是巨大的压力。</p>



<p class="wp-block-paragraph">前一段时间发布的Anthropic Claude 3.5 Sonnet，也把压力给到了OpenAI，因为这个模型的效果已经非常好，而且极其便宜。更不要说昨天刚刚发布的Llama3.1405B这样的一个开源模型。前面咱们讲的Anthropic的模型还是闭源的，而Llama可是个开源模型。405B的话，在各个层次上，都赶超了OpenAI的Chat GPT-4。老大的位置有可能会丧失。</p>



<span id="more-1437"></span>



<p class="wp-block-paragraph">大家注意，OpenAI这样的一家公司，可能不会轰然倒下，但对于一个领域的开拓者来说，丢失老大的位置是非常非常可悲的，基本上跟死掉了没有太大的区别。所以现在对于OpenAI来说，他们最害怕的就是把老大的位置丢了。</p>



<p class="wp-block-paragraph">目前的应对方式也很怪，头一天先发了GPT-4欧MINI，第二天人家Llama3.1405B就开始偷跑。是谁在偷谁的家？我们现在看到了一个叫互相偷家的故事。</p>



<p class="wp-block-paragraph">就是每一边都是在对方最强大的地方打了一根钉子。GPT-4o mini是打的Llama这样的小模型。原来很多人图便宜啊，我要用这种8币的模型，用70币的模型去进行微调，去进行各种各样的定制化开发，以后满足特定场景需求。那么好了，我现在推出GPT-4o mini啊，把这个市场抢过来。这边一个嘴巴子扇过去了，那头一看说：“哎，还有这事呢，老师来，我给你上个大的。你们原来不是说大模型厉害吗？PPT4O厉害，对吧？我直接给你上一个拉嘛，3.1405B超越你的碳模型。”所以叫相互偷家。</p>



<p class="wp-block-paragraph">咱们还记得谷歌I/O开始的前一天，OpenAI在干嘛吗？啊，他发布了GPT-4o 端到端的语言训练模型。其实到现在为止，我们依然没有看到端到端的语言模型。现在看到的GPT-4o 依然是啊，要给它进行语音识别，处理完了以后，再给我们念回来的一个过程。这个端到端的模型，包括加上视觉的模型这一部分，现在也没拿出来。但是，就是要赶在谷歌I/O之前发，提前一天，导致了谷歌I/O上发布的Gemini 1.5 Flash，本来是做类似事情的模型一下就显得不香了，对吧？</p>



<p class="wp-block-paragraph">那么这一次呢，我们看到的是非常神奇的GPT-4o mini，应该是啊，计划好了进行发布。阿克伯格那边说：“哎，我们原来虽然没计划好，但是咱们表演一个偷家吧，直接把磁力链放到Reddit里头，就直接偷跑出来了。”所以这一次呢，应该算是OpenAI被梅塔抄了后路了。</p>



<p class="wp-block-paragraph">OpenAI GPT-4o mini 这样的一个模型，最初想去偷梅塔拉嘛的，后加的时候还有后续的动作出来。这个后续动作是什么呢？免费微调啊。什么意思呢？就是我们发布的这种预训练模型，如果想让它按照你所期望的方式去工作，是需要去微调的。微调这种模型本身是比较贵的，原来 GPT3.5 和 GPT4 都是允许微调的。</p>



<p class="wp-block-paragraph">这个怎么干呢？就是说你上传一个文件上去，这个文件就是我说什么你回答什么，大概是这样的一个格式。当你把这个文件上传上去以后，就可以请求这个文件给你微调一个版本出来。那么这个版本的模型，是只有你自己能用的。原来也有这样的功能，现在到 GPT-4o mini 这儿，我们不是要抢Llama 38B 这样的生意吗？来，微调免费了，至少在一段时间内，微调是限时免费的。</p>



<p class="wp-block-paragraph">本身这种小模型的微调就比较便宜，GPT-4o mini 就算是过完了限面，开始收费了。它的调试成本也是相对来说比较低的，100 万 TOKEN 的调试可能是 3 美金还是 5 美金。但是微调以后的那个模型，你再去使用就要贵一些了。GPT-4o mini 正常的输出 100 万 TOKEN 是 60 美分，而微调过的版本，因为这个版本只给你一个人用或者只给你一个团队来使用，这个成本就都要你自己来承担，100 万 TOKEN 是 1.2 美金，价格翻了一倍。这就是直接放出来的价格，这就是要抄家了。</p>



<p class="wp-block-paragraph">大家知道Llama3这种东西的微调成本是多少吗？你说自己有显卡啊，或者说我用谷歌的云上，谷歌云上是可以薅羊毛的啊。你是可以免费开一个云主机，快速的调完了把它关掉，这个过程是不用付钱的。咱们不去参考这个价格，咱们看看gather上的价格是什么样的啊。</p>



<p class="wp-block-paragraph">Llama3.18B的模型啊，咱们不要去调那个405B啊，那个东西很贵的。咱们调这个8B的模型，100万TOKEN，10次以内的迭代。因为你微调的时候，它会让你选你到底是调几次，10次以内的迭代，5美金啊，基本上是在同样的价格。所以我也在猜测GPT-4o mini的大小，应该也就是8币9币这样的一个程度，否则的话，这个价格是没法去比对的。</p>



<p class="wp-block-paragraph">因为Llama3.18币啊，输出100万TOKEN的价格大概是0.9美金，微调100万TOKEN的价格是5美金。那GPT四O Mini输出100万TOKEN的价格是0.6美金，微调的话是3美金。当然现在是限免啊。</p>



<p class="wp-block-paragraph">稍微在这里讲一下微调跟RAG之间的差别。以前我们讲了很多跟RAG自我、本地知识库相关的这种知识。那么什么时候上微调，什么时候上RAG呢？举一个简单案例吧，就是现在来了一个新的毕业生。微调相当于什么呢？叫入职培训。你来了以后，我先给你做个入职培训，看到领导要鞠躬，看到客户要说，先说你好，然后呢再给你一个入职手册，先把这东西都背下来。你以后就按照这个方式去工作。微调了以后，这样的版本。</p>



<p class="wp-block-paragraph">我们经过了入职培训以后的版本。你问他相关的问题，就是入职手册写过的问题，他都会对答如流，按对入职手册回答给你，没有任何问题。而且呢，按照你要求的格式来输出。看见领导鞠躬，他会干的。</p>



<p class="wp-block-paragraph">微调有一个问题是什么呢？就是超出手册的东西就没有了，这就是微调干的活。那你说RAG是干什么呢？RAG相当于给你发了一本字典，你随时需要查，随时可以查。说我现在需要查一下这个问题怎么办？那个问题怎么办？你随时在字典里去查。</p>



<p class="wp-block-paragraph">我们一个新员工入职了，比如某位同学大学毕业，到公司上班来了，入职培训要做，对吧？字典也要发。这就是微调跟RAG之间的关系。RAG其实对于OpenAI来说，对于Llama来说没有太大的区别，大家都可以做。但是呢，微调原来GPT这块是要贵很多的，这个模型也贵。你微调了以后，整个微调的过程也都相对来说比较贵。</p>



<p class="wp-block-paragraph">现在，OpenAI就在这一块跟Llama彻底找齐了。你说我们去调那个405B去，其实意义不大。一般微调就是调小模型，你去找一个大模型出来调，这实在太贵了。咱们还是以刚才这个新员工入职的过程来讲微调。你去找一个应届毕业生，让他做新员工入职培训，这个效果是相对来说比较好的。</p>



<p class="wp-block-paragraph">对，我找猎头公司，从别的公司挖一大牛回来，或者我从其他公司挖一CEO回来，让他坐在这给新员工培训，这不扯淡吗？就这样，微调大模型的效果就是这样，又费劲效果还未必好。</p>



<p class="wp-block-paragraph">所以，一般微调都是调小的。那么，OpenAI到底挣不挣钱呢？今天看了一些数据，OpenAI是真的不挣钱啊。前面还有人讲说OpenAI的收入已经很厉害了，今年可以达到30亿美金了。30亿美金的收入对于很多公司来说，是完全可望而不可及的一个数字。作为一个新创建没几年的公司，能够入账30亿美金的收入，这个非常厉害。</p>



<p class="wp-block-paragraph">但是，挣的多，人家花的更多。花了多少钱呢？因为OpenAI不是一个上市公司，所以大家只能去根据各种蛛丝马迹去算它到底花了多少钱。基本上算下来的，它的成本大概是80亿美金，所以它一年亏50亿美金。</p>



<p class="wp-block-paragraph">这80亿美金怎么算出来的呢？每年交给微软的钱就是去买算力的钱，大概是40亿。这个是微软内部的一些人，或者说了解OpenAI向微软付款的一些内部员工透露的，这个数基本认为是靠谱。第二块是什么呢？就是OpenAI还需要购买很多数据，比如说上Reddit里去买数据，包括一些其他的数据集，去购买和清洗加工，这个钱他是要去花的。</p>



<p class="wp-block-paragraph">还有一块的钱是什么呢？人家那么多新员工，对吧？现在有1500人了，而且还在快速扩张，现在还有200个职位开着，准备再接着招人呢，这个也是一大笔钱。所以呢，他现在每年的成本大概在80亿美金左右，而且这个成本还在快速上升之中。你想，他还在疯狂的招人进来，前面还吹了那么多牛皮，还没有抹上呢。你要想把前面吹的牛皮补上，要干嘛？接着开足马力训练大模型啊。</p>



<p class="wp-block-paragraph">Scaling啊，scaling low啊，接着跑啊。我进一步扩大模型的规模，进一步整更多的数据，然后整更多的人回来。而且现在整个行业已经热起来了啊，他这一千几百口的人，那一定得给到比较高的薪水，比较高的这种收益才可以啊，要不然别人会挖人的。全世界都在盯着他的人吧，哪怕是一个街边扫地的。你说我在OpenAI扫过地，那其他人说我把你请回来，是不是多给你点钱啊？OpenAI的人员成本一定是不低的。</p>



<p class="wp-block-paragraph">微软呢，其实已经算是对OpenAI很好了啊，为什么呢？就是微软给OpenAI机房的价格应该是一个成本价，并没有真正的按照微软云的那种啊，对外报价去找OpenAI收钱，已经算是非常非常支持了。销售呢，这个没办法，特别是B端销售，大家都有KPI，谁也不能让着谁。所以微软在B端销售上，包括在Windows客户端的Copilot的这种产品的竞争上，肯定是跟OpenAI有一定的约定的啊。B端销售各打各的，你要能卖掉是你的，我要能卖掉是我的，Windows客户端你别碰啊，这个是我的。</p>



<p class="wp-block-paragraph">所以现在OpenAI只有Mac版的客户端，没有Windows版的客户端啊，那边是留给微软自己家亲儿子Copilot的。作为一个公司来说呢，微软对OpenAI已经是非常非常好了啊，那么对比起Anthropic，OpenAI算是好的。这个玩意叫不患寡而患不均，那你说Anthropic后边是谁？是亚马逊。</p>



<p class="wp-block-paragraph">微软对OpenAI好，这一定要有对比，那就要对比亚马逊对Anceropic。推理成本肯定是不低的，而且Anthropic其实并没有跑那么多的大模型。新的模型训练、新的模型的推理没有做这么多，而且用户量也没有OpenAI高。可是呢，以亚马逊找Asopic收的钱是不少的。</p>



<p class="wp-block-paragraph">另外一个Anthropic，如果通过亚马逊云赚到了钱，比如说我把这个产品卖掉了一些弊端的用户买了我的产品，亚马逊是要在里边抽成的。所以Anthropic跟OpenAI比起来，属于过得更凄惨一点。Anthropic收入的话，大概是OpenAI的1/5。刚才我们讲了OpenAI是30亿美金，它大概有个五六亿美金的样子吧。</p>



<p class="wp-block-paragraph">因为都不是上市公司，所以大家都不会说这个事。亏损也亏，他亏多少呢？亏大概是OpenAI的一半。OpenAI大概亏50亿美金，他亏25亿美金，就是这样的一个比例。所以前面我们也讲过，Isopic现在也快玩不下去了，玩不下去的话，亚马逊可以落袋为安了。</p>



<p class="wp-block-paragraph">我记得以前有一个故事，电影院想去卖饮料，怎么能够把饮料卖得更多一些呢？我把空调开的小一点，让电影院里稍微热一点，这样我就可以多卖一些饮料出去。看看亚马逊跟Anceropic之间的故事，是不是有点像这个？当然了，OpenAI现在也很渴，也需要去买饮料喝了，像微软爸爸去买，现在山姆奥特曼的应该正在努力地找钱。</p>



<p class="wp-block-paragraph">愿意给钱的人肯定不少啊，这个不用担心。毕竟是开拓一个新领域里边的老大，那这个时候肯定很多人都愿意给钱。那你说愿意给钱不就没事了吗？拿着钱接着烧呗。不那么容易啊，为什么？因为你要问微软同不同意。微软占49%，给了130多亿美金进来了。你现在再找，说我让苹果给钱啊，苹果愿意给，那微软说不行啊，这个必须排他。</p>



<p class="wp-block-paragraph">像我们以前签很多这样的协议，进去的时候，特别是我成为大股东的时候，一定会有排他条款的，对吧？你让我的竞争对手进去，这事不行啊。微软就是说，我虽然愿意看着你努力成长，但我也更愿意看到你落到我的口袋里，在我这再多买些饮料。我说算了，我卖身给你得了，这个也是微软乐见其成的事情。</p>



<p class="wp-block-paragraph">所以并不是谁的钱他都可以去拿的。一些微软的竞争对手，比如谷歌，比如说苹果是愿意给钱的时候，他就需要做微软的工作，说求求你让他们进来吧，他就会变成这样。那么下一个问题是什么呢？到底估值是什么样的？估值涨到多少，这个事微软才能乐意啊？其实还是跟微软有关。</p>



<p class="wp-block-paragraph">现在OpenAI的估值是860亿美金，这个估值是OpenAI上一次进行内部的股票兑现的时候，或者说一些内部员工股票变现的时候的估值，并不是一个正式的估值。正式的估值的话，我觉得他现在有个大概两三百亿应该是合理的。嫁一个人进来，到底按什么样的估值进去，这个就很难去平衡。为什么？因为这个数已经很大了。嫁一个人，你说我为什么进去，投资这样的公司的目的。</p>



<p class="wp-block-paragraph">一定是说你以后能够长得更高啊。然后呢，你去上市，我能够啊，多少倍啊，能够退出，至少是3-5倍能够退出，因为这么高的估值嘛，承担这么高的风险，一定希望能够尽快的按更高的倍数退出。现在已经是两三千亿了，你再往上翻这个数就不好翻了。而且如果真的是几千亿的估值，又拿了钱了，你上市怎么办？股市能不能支撑得住这样的公司？几千亿美金的公司上市，还是有一些难度的。</p>



<p class="wp-block-paragraph">像AM上去，也就是几百亿上去，虽然上去了以后快速在增长，但是你说我直接就是按照几千亿，没准这一轮再上去了以后，大家就希望他上1万亿美金去上市。这个纽交所也好，纳萨克也好，虽然是注册制，只要是你提交的申请文件符合格式，你就可以去上市。但是这些地方啊，这些基金们啊，因为所有的美股大量的都是基金盘，很多基金经理会去看你这个产品到底值不值这么多钱，所以这个事对于所有人来说都是很有压力的。</p>



<p class="wp-block-paragraph">那么现在怎么办呢？比当前的估值直接上市也许就是唯一的解决方案了。坚持到年底，Open I的业绩还是有爆发的可能性的。于现在，大家虽然预估他一年挣三十几亿美金，这事儿是怎么算出来的呢？是他每个月大概能挣到两点几亿美金，这两点几亿美金里头大概2亿美金，是他去卖那个20美金一个月的Plus的费用，在七八千万美金吧，是卖API的费用啊。他是这样来算的。那么，为什么到年底的时候会业绩大爆发呢？咱们想一想，9月份会发生什么大事情？9月份iPhone 16发布。</p>



<p class="wp-block-paragraph">iPhone 16如果发布了，虽然它的成本会进一步上升，因为所有用iPhone的至少在国外吧，就可以去访问GPT-4了。但是，另外一方面，这些用户会大批量地转换成OpenAI Plus用户。那么它的收入也会爆炸式增长一下。所以到今年年底，还可以再大涨一波。</p>



<p class="wp-block-paragraph">苹果算是OpenAI的一个救命稻草。如果它能够坚持到年底，数据再大涨一波，为所有的股民展示一下未来美好的前景，然后直接去上市，这个事还是有得救的。现在行业的心态肯定也是很矛盾的，竞争跟追赶这是必须的。甭管是谷歌、Anthropic还是Meta，都是在努力的竞争与追赶。但是谁也承担不起一个后果，就是老大倒下。</p>



<p class="wp-block-paragraph">这是一个全新的行业，在全新的行业里头，一旦老大倒了，对于整个行业来说都是巨大的打击。每次开新行业的时候，有几件事是比较害怕的。第一是老大废了，一旦老大废了以后，就相当于是老大证明了跑得最快的人没跑出来，拼命往前跑，跑到头上是一条死路，撞在墙上，磕地上了。那后边紧追不舍的人该咋办，这事是很危险的。</p>



<p class="wp-block-paragraph">另外一个是什么呢，就是老大上市了。上市了以后，发现业绩一般，因为大家一般在上市之前会冲业绩嘛。上市了以后，你要公布财报，很多东西变成公开透明了。那么下面的人也会觉得很危险。这就是一个新行业的宿命，至少要验证行业有未来。在这之前，老大是不能倒下的。如果说没有验证，直接就趴下了。</p>



<p class="wp-block-paragraph">那么，整个行业都很麻烦啊。开天辟地的这种新行业，肯定都是非常困难的。这个呢，分几种情况。</p>



<p class="wp-block-paragraph">第一种情况叫大企业开创新市场。举一个案例，比如说亚马逊，开创云计算这个新市场。这就是大企业开创新市场。但是，亚马逊也很痛苦。在开始的很长一段时间里，顶着非常大的压力，再往前走，也是用了好几年的时间，才慢慢地验证了说，云计算这个市场是一个真正的方向，大家要去向这个方向前进。这是大企业开创新方向。</p>



<p class="wp-block-paragraph">当然，也有走得不是那么好的例子。比如说，梅塔做的梅塔Wars，原来叫Facebook，后来改名叫梅塔。他去做元宇宙这件事呢，就不是那么好。一直到现在，虽然名字还没改回来，但他得挂在那，挂上了还没有死掉。可是，他挂在那，所有人看着。在这么大一只半死不活的尸体挂在这个枝头上，所有人在想去做元宇宙的时候，都要稍微掂量掂量。而且，现在这个枝头上，还挂了另外一颗叫Vision Pro的东西，也挂在那了。在剩下的人就在这看着，在下面驻足观望，再也没有人敢往上冲了。这就是大企业开创的两种结果：坚持到底能够成功，或者跨在上面挂着。</p>



<p class="wp-block-paragraph">那么，小公司开创新天地是什么样的呢？比如说，特斯拉、SpaceX，都是一开始的小公司。马斯克冲上来说，我要开创新天地了，开创一个新赛道出来。那是什么？就是耐心的，经历很长时间的亏损，十几年的亏损，不停地融钱，所有人都不看好，独自前行，慢慢把这个项目做起来。那你说，再举个失败的例子。</p>



<p class="wp-block-paragraph">失败的例子没有啊。那么是不是小企业开创新天地就都能成功？错了，你只能看到成功的，剩下的全都不见了。我们没有机会看到，所以小企业开创新天地，我们只能看到幸存者。这是一种幸存者偏差。那你说一群人一拥而上，大家看好了方向，大家全上。这种事呢，通常是发生在商业模式创新上。如果是技术创新的话，这个机会不是特别大。</p>



<p class="wp-block-paragraph">这种方式呢，也有成功的。你比如像国内的千团大战，最后就跑出了像美团这样的公司；滴滴共享单车大战，最后也是跑出来一些结果，是有能成功的案例的。但是呢，也有一些最后失败的，比如像刚才咱们讲的VR，所有人都冲，最后什么也没剩下。</p>



<p class="wp-block-paragraph">现在的OpenAI呢，有点儿是骑虎难下的状态。按道理说呢，它应该是小公司，独自慢慢发展。但是它一下把这个热度炒太高了，现在搞成什么了？现在搞成一群人一拥而上了。这种乱拳打死老师傅的状态呢，一定是最危险的。</p>



<p class="wp-block-paragraph">所以为了稳住阵脚，现在OpenAI必须拿出重量级的拳头产品出来，也就是咱们开篇时候讲的GPT-5，一定要拿出这种产品。如果在今年年底之前GPT-5还出不来的话，它的老大位置真的是危险了。而且它一旦倒下的话，可能整个行业都要至少颤三颤。不能说整个行业会为它陪葬，但颤抖一下是跑不了的。</p>



<p class="wp-block-paragraph">好，这一期就讲到这里。感谢大家收听，请帮忙点赞，点小铃铛，参加Discord讨论群。也欢迎有兴趣有能力的朋友加入我们的付费频道，再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>黄仁勋AI时代英伟达GPU革命：一场市值2.7万亿美金的狂欢，COMPUTEX 2024重磅发布Blackware GPU，1.8万亿参数GPT4揭秘！</title>
		<link>https://lukefan.com/2024/06/04/%e9%bb%84%e4%bb%81%e5%8b%8bai%e6%97%b6%e4%bb%a3%e8%8b%b1%e4%bc%9f%e8%be%begpu%e9%9d%a9%e5%91%bd%ef%bc%9a%e4%b8%80%e5%9c%ba%e5%b8%82%e5%80%bc2-7%e4%b8%87%e4%ba%bf%e7%be%8e%e9%87%91%e7%9a%84%e7%8b%82/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 04 Jun 2024 01:02:00 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[英伟达，黄仁勋的故事]]></category>
		<category><![CDATA[1.8万亿参数]]></category>
		<category><![CDATA[2.7万亿美金]]></category>
		<category><![CDATA[AI]]></category>
		<category><![CDATA[AIPC]]></category>
		<category><![CDATA[AI工厂]]></category>
		<category><![CDATA[AI工厂时代]]></category>
		<category><![CDATA[AR]]></category>
		<category><![CDATA[Blackware]]></category>
		<category><![CDATA[COMPUTEX]]></category>
		<category><![CDATA[GPT-4]]></category>
		<category><![CDATA[GPT4]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[GPU技术大会]]></category>
		<category><![CDATA[GPU核心]]></category>
		<category><![CDATA[GTC]]></category>
		<category><![CDATA[H1]]></category>
		<category><![CDATA[H100]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[NVIDIA]]></category>
		<category><![CDATA[NVlink]]></category>
		<category><![CDATA[RTX]]></category>
		<category><![CDATA[scoring low]]></category>
		<category><![CDATA[SERVER]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[TOKEN]]></category>
		<category><![CDATA[TX]]></category>
		<category><![CDATA[VR]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[内存]]></category>
		<category><![CDATA[军备竞赛]]></category>
		<category><![CDATA[分析]]></category>
		<category><![CDATA[参数]]></category>
		<category><![CDATA[参数量]]></category>
		<category><![CDATA[台积电]]></category>
		<category><![CDATA[合作伙伴]]></category>
		<category><![CDATA[商业]]></category>
		<category><![CDATA[垄断地位]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[工程师]]></category>
		<category><![CDATA[市值]]></category>
		<category><![CDATA[应用开发]]></category>
		<category><![CDATA[开发者]]></category>
		<category><![CDATA[微软]]></category>
		<category><![CDATA[戴尔]]></category>
		<category><![CDATA[技术大会]]></category>
		<category><![CDATA[投资人]]></category>
		<category><![CDATA[推理]]></category>
		<category><![CDATA[推理能耗]]></category>
		<category><![CDATA[支架]]></category>
		<category><![CDATA[数据中心]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[机器人]]></category>
		<category><![CDATA[机箱]]></category>
		<category><![CDATA[模型]]></category>
		<category><![CDATA[模型训练]]></category>
		<category><![CDATA[游戏助手]]></category>
		<category><![CDATA[版本]]></category>
		<category><![CDATA[生态链]]></category>
		<category><![CDATA[用户]]></category>
		<category><![CDATA[硬件]]></category>
		<category><![CDATA[科技]]></category>
		<category><![CDATA[移动互联网]]></category>
		<category><![CDATA[竞争]]></category>
		<category><![CDATA[竞争对手]]></category>
		<category><![CDATA[竞争者]]></category>
		<category><![CDATA[算力]]></category>
		<category><![CDATA[算力成本]]></category>
		<category><![CDATA[算力芯片]]></category>
		<category><![CDATA[缩放定律]]></category>
		<category><![CDATA[股价]]></category>
		<category><![CDATA[能耗]]></category>
		<category><![CDATA[芯片]]></category>
		<category><![CDATA[英伟达]]></category>
		<category><![CDATA[苹果]]></category>
		<category><![CDATA[行业秘密]]></category>
		<category><![CDATA[计算机]]></category>
		<category><![CDATA[计算机大会]]></category>
		<category><![CDATA[训练能耗]]></category>
		<category><![CDATA[设计]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[贷宽]]></category>
		<category><![CDATA[超威]]></category>
		<category><![CDATA[车载芯片]]></category>
		<category><![CDATA[软件]]></category>
		<category><![CDATA[铁皮]]></category>
		<category><![CDATA[黄仁勋]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1286</guid>

					<description><![CDATA[大家好，欢迎收听老范讲故事YouTube频道。今天，咱们来讲一讲黄仁勋在COMPUTEX上的狂欢。COMPUT ... <a title="黄仁勋AI时代英伟达GPU革命：一场市值2.7万亿美金的狂欢，COMPUTEX 2024重磅发布Blackware GPU，1.8万亿参数GPT4揭秘！" class="read-more" href="https://lukefan.com/2024/06/04/%e9%bb%84%e4%bb%81%e5%8b%8bai%e6%97%b6%e4%bb%a3%e8%8b%b1%e4%bc%9f%e8%be%begpu%e9%9d%a9%e5%91%bd%ef%bc%9a%e4%b8%80%e5%9c%ba%e5%b8%82%e5%80%bc2-7%e4%b8%87%e4%ba%bf%e7%be%8e%e9%87%91%e7%9a%84%e7%8b%82/" aria-label="阅读 黄仁勋AI时代英伟达GPU革命：一场市值2.7万亿美金的狂欢，COMPUTEX 2024重磅发布Blackware GPU，1.8万亿参数GPT4揭秘！">阅读更多</a>]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph"><br></p>



<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="黄仁勋AI时代英伟达GPU革命：一场市值2.7万亿美金的狂欢，COMPUTEX 2024重磅发布Blackware GPU，1.8万亿参数GPT4揭秘！" width="900" height="506" src="https://www.youtube.com/embed/AOpATS-sitc?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事YouTube频道。今天，咱们来讲一讲黄仁勋在COMPUTEX上的狂欢。COMPUTEX是一年一度在台湾举行的计算机大会。黄仁勋，作为现在真正AI时代的当红炸子机，可能是唯一靠AI赚了大钱的人。虽然微软也在赚钱，但是微软整个靠AI挣的钱并没有那么多。真正靠AI赚了大钱的公司只有他一家——英伟达。刚才我看了一下，英伟达现在市值2.7万亿美金。大家知道，再往前就是微软的3.2万亿，第二名是苹果，2.9万亿，还差那么一点点。可能稍微一哆嗦，英伟达就有可能成为世界第二市值的公司了。那么，黄仁勋上面都讲了什么呢？作为网红，肯定还要先暴露一下行业秘密，别人都不知道他知道的事情。上来先说一下他现在讲的是什么——就是GPT-4到底有多少参数。GPT-3.5大家知道是1,700多亿参数，就是一个170多亿级别的模型。但是到GPT-4的时候，OpenAI就再也没有出来说它到底有多少参数。很多人说你是不是超过万亿了，对OpenAI来说，这个数据不是很准确。我来辟谣了，但是具体有多少，从来没有讲过。黄仁勋在前面的GTC，就是GPU技术大会上，每年一次的英伟达自己的开发者大会上，上面也讲了……</p>



<p class="wp-block-paragraph">说起来1.8T，这个1.8T指的是什么呢？其实就是1.8万亿参数，而且它是一个Moe模型。当时OpenAI并没有对此多说什么，但这一次，在《Computer Text》上，他们又反复强调了这个事情，明确指出GPT-4的训练参数达到了1.8T。这让人们意识到，想要达到GPT-4的水平，还有很长的路要走。尽管现在大家都在努力研发号称能达到或接近GPT-4水平的模型，比如几百亿参数的模型，比如梅塔的拉马3可能会有一个400亿参数的模型，国内也出现了很多一两百亿参数的模型。但事实是，即使提到的1.8T参数，如果考虑到是Moe模型，分成八份来看，那么单个模型可能也就相当于200多亿参数的水平。</p>



<span id="more-1286"></span>



<p class="wp-block-paragraph">这次先通过揭示现状，然后发布新GPU，但对于具体数据——多少核心、多大算力、内存多大、带宽多少，人们似乎已经感到麻木。现在大家更关心的是，如何将这些GPU有效地集成起来，如何把它们拼装成服务器，以实现更强大的计算能力。这背后的提升，不是5%或10%的增长，而是几倍的飞跃。这成了技术关注的新焦点。</p>



<p class="wp-block-paragraph">如何装到机房里头，统一为别人去服务，这个是现在大家更关心的事情。所以现在呢，他们发布的叫Blackware GPU，而且，它取出来那个板子上是两块GPU和一个CPU，应该是他们自己做的CPU。这是一整块，然后可以装到一个大的服务器里面去。再把这些服务器堆叠在一起，使用它的NV link，让这些GPU可以像一块完整的GPU那样工作。这样说，你就可以去训练更大的模型了。而且，今年是这个Blackville，明年就是Blackville Ocho，再往后是Robin。就是说，往后一代都给你规划好了。再往后一步，是叫Robin Ocho，所有的GPU一直规划到2027年，一定让2027年之前的GPU都给你规划好了。</p>



<p class="wp-block-paragraph">现在呢，很多大佬还在惦记着买H100。他现在就专门告诉你说，你看我这个艾克威尔跟这个H100比，它强在什么什么地方，好在哪哪哪。但是很多人还想买H100，这是为什么？可能Blackware它的这种工作方式，或者说它可能需要跟更多的设备先行捆绑，而H100的话，相对来说可能兼容性会更高、更好一些。就是你用任何的这种通道服务器，都能相对容易地兼容和使用。</p>



<p class="wp-block-paragraph">你把它插上去都是可以用的。likerware我倒是真没看到它出这种——就是像原来金砖啊，像我们以前讲的A100、H100这样的，我们管它叫金砖嘛，就是它的卡还是金黄色的，方方的一块，可以插上去的。好像没有看到这样的东西啊。现在呢，基本上都是以两个black Verre在一起，然后头上带一个CPU，是完整的这个配置。</p>



<p class="wp-block-paragraph">当然了，这些大佬，包括马斯克、扎克伯格，可能也不是说我就一定要去买H100。对于他们来说，H100就算是一种计量单位，就是说啊，他们会算上自己到底买了多少H100，或者说现在手里的算力相当于多少H100。你像扎克伯格之前讲，说他买了35万块，加上他手里现成的有60万了，再加上后面再接着买，现在扎克伯格手里的大概有接近100万块H100，相当的算力。这就跟我们造炸弹的时候说，这个炸弹相当于多少吨TNT啊，最后变成了一种衡量单位了。</p>



<p class="wp-block-paragraph">老黄（指NVIDIA的CEO 黄仁勋）就告诉大家说啊，你们来买新的吧。而且这种升级是呈几何级数升级的，所以不要去买旧的，去买新的，这样的话才能够保持它的垄断地位。如果说哎，我现在这个GPU再涨上去，涨了10%，涨了20%，那大家就不买它的了，就去买AMD，买英特尔，买其他的这些算力芯片去了。</p>



<p class="wp-block-paragraph">甚至像高通这样的公司，都能做出一定的算力芯片来。这样一来，人们可能就不会一定买它的产品了。但是现在的情况是，我们谈论的是算力要涨十倍、百倍、千倍，而且每年都要这样增长。为什么呢？因为这成了一场军备竞赛。每个人都害怕落后，就像人们常说的“输在起跑线上”。我们从小让孩子上补习班，是为了什么？就是出于这种害怕，这种焦虑感。老黄就是在给大家制造焦虑：你现在买了旧的，等明年出了新的，你就落后了。你必须去买新的，然后当更新的版本出来时，你又要再买。毕竟，GPU不像软件，软件可以逐年升级，而且升级成本相对较低。但GPU，你需要整块购买，一年后淘汰，再换新的，这成本实在太高了。一片就是4万美金，Blackwell的价格我虽然没查，但肯定不便宜。所以，要让大家每年跟着升级，必须讲出一些更有诱惑力的故事来。目前，从算力成本和能耗几个方面看，确实在全面升级。一方面，算力成千倍增长，成本自然是变贵了。这没什么可争议的。但就单位算力的成本来说，它是下降了。比如，原来的H100卖4万美金，但使用Blackwell之后……</p>



<p class="wp-block-paragraph">你可能继续达到H100同样的算力，这只需要原来1/10，甚至1%的成本，是这样大幅下降的。能耗方面也是如此，比如说，要达到原来H100的算力，所需消耗的能耗可能也只是原来的1%。如此发展，GPT-4的1.8T训练能耗引人注目，因为之前很多人讨论，GPT-4训练一次的能耗相当于多少个家庭一年的电力消耗，让人担忧AI发展的能源瓶颈。但现在的进展是，重新训练一遍的能耗降低了99.7%，仅为原来的1/350。而进行推理时，即训练完成后用于问答等任务，能耗更是降低到原来的1/45,000。这样的发展速度令人惊叹，从GPT-4推出至今不过一两年，能耗的减少就达到了如此程度。</p>



<p class="wp-block-paragraph">军备竞赛在AI领域体现为不断制造焦虑，促使各方持续投入。这就像冷战时期的军备竞赛，你有武器，我必须跟进。如今在技术领域，特别是英伟达所处的，情况类似，但效果是整体提升，正如“一人得道，鸡犬升天”。之所以提到这一点，是因为他们还强调了除了芯片本身，还有Vlink技术，能够将服务器像拼图一样连接，整个机房的服务器作为一个单一GPU工作，展示了技术整合带来的巨大效能提升。</p>



<p class="wp-block-paragraph">因为，这些服务器在一起，你的GPU的算率越大，可以并行处理的东西就越多，与内存和CPU之间的通道越宽，整个进行大模型训练的效果就会越好。所以他说，他可以干这件事情，但在这个过程中，这些服务器，或者其他一些相关的配件，都跟着他“鸡犬升天”了。比如说，像戴尔、超微电子这些给他造服务器的公司，全都因此受益，一路上涨。因为你不能只有GPU，不能只有他们的加速卡，还得把所有配件凑在一起，这些东西才能正常工作。而这些配件，都是值钱的。</p>



<p class="wp-block-paragraph">在这个过程中，服务器肯定变得更贵了。比如说，原来用的是H100的服务器，现在变成了更高级的查克威尔的服务器，那自然是服务器变贵了。但你想，服务器变贵的过程中，到底是什么东西变贵了呢？其实，只有与H100相关的专利费变贵了。大家要注意，因为大家自己并不造芯片，也不造服务器，他也不造算力中心。他只是设计好GPU，交给台积电去生产、封装、测试，然后下交给板卡厂商制作成板卡，再由服务器厂商组装成服务器，最后等待比如马斯克这样的人购买安装。所以，整个服务器链条上的价格上涨，实际上主要是由于关键技术组件的成本上升，特别是H100相关的专利费用。</p>



<p class="wp-block-paragraph">除了GPU价格飙升之外，其它相关成本也难免水涨船高。你不能期望其它东西都保持低廉，这显然不合逻辑。我们整体的成本基数提高了，但单位成本可能有所下降。不过，要注意的是，老黄的市场策略极为精准。GPU的知识产权价值多少，或者说它的设计成本是多少，他们心中有数。如果没有竞争对手，价格自然可以定得更高。但即便如此，人们依然能看到成本在以惊人的速度下降，甚至是以十倍、百倍的幅度。然而，GPU的设计价值却在不断提升。</p>



<p class="wp-block-paragraph">除了NVIDIA本身，那些制造显卡、服务器以及各种配件的厂商，它们的产品也会随之增值。比如，如果你用一个价值4万美金的H100来搭建服务器，仅这一部分就是一笔昂贵的投入。而且，随着Nvlink标准的采用，替代了以往的Pcie标准，意味着新的配件、新的线缆等都将应运而生，价格自然比过去高出许多。</p>



<p class="wp-block-paragraph">我记得早些时候，为惠普的小型机配备一个简单的支架，就是一个铁质架子，都能卖出数千元的高价。原因在于它专为小型机设计，很多工程师甚至会私下找工厂定制支架，替换官方配件以赚取差价。这背后反映的是，即便是一些看似不起眼的配件，在特定情境下也能变得极其值钱。</p>



<p class="wp-block-paragraph">大家其实也都知道，那个铁皮的支架，你说能值多少钱？你凭什么一定要买惠普的？他只要是惠普的工程师给你装上，下次他接着给你修不就完事了吗？你跟着这个比较贵的东西一块去卖，他就会卖的很贵。但是这几天呢，戴尔和这个超威的股价，其实已经快有点绷不住了。大家心里也明白，虽然你们跟老黄跟的很紧，但是这个里头真的，你就是个卖支架的，卖个铁皮，卖个机箱的，你跟着里头的GPU一起水涨船高，这件事稍微的有点侮辱大家的智商。</p>



<p class="wp-block-paragraph">现在呢，是AI工厂时代，现在老黄也讲说我们现在就是AI factory。在这样的一个时代，我们应该如何与时俱进呢？我记得在移动互联网刚开始的时候，我们写很多应用，当时我们在思考说，哎呀，我怎么能够省一点流量，因为那个时候流量很贵。我们都想着如何去节省流量，如何在使用的时候联网，不使用的时候怎么把它断开，想着怎么去省一点电，怎么去做一些其他的节省资源的事情，可以少占一些硬盘的空间，可以交互的时候少交互一些流量。当时的我一位老板就跟我讲，说你们想这个事情是错的，说为什么呢？就是因为很简单，随着时代的发展，这些东西都会变得不值钱的。比如说现在，流量咱们现在……</p>



<p class="wp-block-paragraph">其实，基本上是没有流量焦虑的。我记得最早开始使用手机，那时候刚进入3G时代，我们都会做什么呢？每天定时打开流量，收完邮件后立即关掉。为什么会这样？因为酷，而且节省。现在，还有人这样做吗？没有了。现在，我们走到哪儿，站在哪儿，就开始刷抖音、看视频。已经很少有人会说，我必须节省流量，等到有WiFi的地方再做这些。绝大部分人没有这个意识了。</p>



<p class="wp-block-paragraph">电的问题现在也不那么大了。虽然手机应用还需要省电模式，但现在的手机几乎都是一天一充。你的应用再费电，能比微信还费电吗？能比原神还费电吗？所以，这些问题也变得无关紧要。因此，很多以前为了省电而做的操作，实际上已经没有意义了。</p>



<p class="wp-block-paragraph">再往后说，我们是否会考虑在硬盘或手机上占用更少的空间？以前在猎豹工作时，我们还在研究如何让软件占用空间尽可能小。但现在看看《原神》有多大，看看那些手机游戏的大小，再看看微信在你手机里占了多少空间，就会觉得，我们当初那么精良的考虑，好像都没什么大作用。是的，所以在AI Factory这个时代，也就是AI工厂时代，我们仍在思考如何能省一点TOKEN，情况依然如此。</p>



<p class="wp-block-paragraph">我怎么能够让它反应得稍微快一点？我怎么可以调用不同的大模型？这个模型贵一点，那个模型便宜点。我尽量让便宜的模型干尽量多的事情，让贵的模型干少一点的事情，做一些其他的，比如优化（reg）或者做一些这种节省沟通交互的事情。可能真的再过一年，这些就会变得很可笑，就像我前面讲的，我们在做手机应用的时候，让它怎么去省流量，从网上下载的东西少一点，占的硬盘空间少一点。我们现在回想，那时候想的这些事情就显得很可笑。但是在AI时代，刚才我们讲的怎么能够省一点TOKEN，怎么能够让便宜的模型多干点，贵的模型少干点，怎么能够让多个模型相互搭配起来使用，可能也会变得很可笑。而且，这个时间会来的非常快。</p>



<p class="wp-block-paragraph">黄仁勋呢，除了讲数据中心业务，就像我们刚才提到的Blackvail，一切都是数据中心业务，这也是现在英伟达核心的收入来源，没有之一。现在，他主要就靠这个业务玩。那么其他的呢？也还在讲，英伟达这家公司特别有意思，它不会说某一个业务特别好，就把所有的身家都压上去。它永远是在所有它认为有趣的地方投注，即使这一个方向很长时间没有结果，它依然会在里面坚持。那么，它肯定还有些其他的业务在做什么呢？</p>



<p class="wp-block-paragraph">比如说，RTX加载的AIPC，因为前面微软发布的AIPC是基于高通的。现在，英伟达说了，你们使用英伟达的GPU，也可以达到同样的水平。英伟达专门为了AIPC设计了一款很小很轻薄的GPU，而且很省电。但这一块上，它稍微有一点尴尬。为什么呢？你如果真的要轻薄省电，你一定使用ARM的，对吧？就是使用高通的就好了。那你说，我现在稍微费点电也可以，这个英特尔自己也出了，英特尔说，你们就直接用英特尔完整的GPU加上算力核心就完事了，你不用再去单独配独立的GPU，依然可以达到AIPC的能力。包括AMD也是这么干的，AMD自己也产X86的CPU，AMD说：“来哇，你直接买我的APU加我的算力核心，就一次搞定。”</p>



<p class="wp-block-paragraph">那么，英伟达的RTX这个方案为什么尴尬呢？就是它必须要再搭配一块Intel或者是AMD的X86的CPU，它才可以正常工作起来。这对于强调轻薄便携的AIPC来说，就稍微有些尴尬了。但是，英伟达也强调了，加上他们的技术后，算力是苹果的多少多少倍，主要是与苹果的M系列芯片在比较。在这方面，我们还是要相信老黄的，他的算力确实是靠功率支撑起来的，如果他真想达到某个目标，他有这个实力。</p>



<p class="wp-block-paragraph">说我在电脑上做Stable Diffusion的，这样出图，速度很快。那一定是配着呼啸的风扇声，以及呼呼转的电表，一起来工作的。除了AIPC之外，还在讲游戏助手。但是这个呢，我觉得大家看着开心一下就可以了。他说我做个助手帮大家打游戏，这个呢，就属于工程师思维——一拍脑袋觉得，“我需要一个这个”。其实，游戏跟这个没有那么大关系。就算是AI应用在游戏里面，应该也不是通过游戏助手的方式去应用的。</p>



<p class="wp-block-paragraph">另外，还展示了机器人。他说所有跟机器人相关的东西，我们都上，也做了全套的机器人套件。还有，其实VR、AR以及车载芯片，其实都在英伟达的整个路线图里边。再往前走，很多人就会关心，英伟达到底还能坚持多久呢？他真的还差2,000亿美金就追上苹果了，对吧？苹果2.9万亿，他2.7万亿，真的差的不多了。他到底能不能超过苹果，甚至能不能超过微软，成为全世界最值钱的公司？这个其实大家心里都在打鼓。</p>



<p class="wp-block-paragraph">英伟达呢，跟其他不管是微软也好，苹果也好，有一个特别本质的区别，就是它是一个“轻公司”。这个“轻公司”赶上时代红利是可以的，但是到底能不能长久地坚持下去，这个就很难了。黄仁勋展示现在的成就，未来的路线图，让人充满期待的同时，也不免有几分疑虑。</p>



<p class="wp-block-paragraph">但是，并没有说我要砸重金进去，变成一个重型公司。大家注意，苹果是个很重的公司，它生产电脑——虽然电脑也是台湾人给他造的——它的手机是富士康，包括比亚迪都在给他造手机。它是这样的一个公司，虽然供应链在外面，但是这些货品、这些设计，包括全球的仓储物流，很多东西都是属于苹果自己的。所以，苹果是个很重的公司。微软其实也是一个很重的公司，微软自己在造Surface，那个东西虽然卖的并没有那么好，但是它也是电脑平板，甚至还有很多其他的硬件，比如说键盘鼠标。微软键盘鼠标其实做得非常好。而且微软其实还有一块很重的资产，那就是云计算中心，它有很多的数据中心。微软现在是全世界可能GPU最多的公司了，因为后边有OpenAI这样的一个“亲儿子”，那你肯定是要靠这么多的GPU去养的。微软现在的GPU，如果大概核算成H100的话，应该有180万块，这都是重资产。</p>



<p class="wp-block-paragraph">谷歌呢，也是一个很重资产的公司。谷歌紧跟在英伟达之后，他现在是市值第四的公司。谷歌我记得在云计算兴起之前，曾经有一段时间，他拥有全世界大概6%的服务器，这是一个多么恐怖的数字。而现在，虽然应该没有那么多，但谷歌的数据中心依然规模惊人。</p>



<p class="wp-block-paragraph">也是一块非常非常沉重的业务。而且，另外一点是什么呢？就是我们来看，整个的生态是否稳固，或者说，整个的价值体系是否可以稳定地升级上去。还有一个点可以看是什么？就是你上下游的生态链是否足够稳定。围着你吃饭的人到底有多少？以前我们在学生物的时候讲过一点：在一个自然环境里头，食物链越长，或者说参与到食物链里的动物、植物越多，它整个的生态系统就越稳定。为什么呢？因为其中有一些波动，其他的这些生态位上的人，或者这些动物，就可以慢慢地把它平衡回来，而不是说啊，我的食物链很短，就两三节，参与的动物也不是很多，植物也不是很多，可能中间稍微有一点闪失，这个食物链就崩溃了。</p>



<p class="wp-block-paragraph">咱们来看看苹果，上下游其实有非常多的人围着他吃饭。我们不说这些果链企业，就光在苹果应用市场里头，做应用的这些人，也有几十万人，对很多人来说，这是他们的收入来源。再看谷歌，像我们现在在这看YouTube，我在这拿着YouTube的广告费，那我们也算是谷歌生态链里边的一环。那是非常多的人靠着谷歌生活。啊，微软那不必说这些靠广告吃饭的，因为微软的广告并没有那么多，但是微软上下游，是有大量的系统集成公司，靠着微软吃饭的。</p>



<p class="wp-block-paragraph">还有微软云上的大量客户，但是英伟达有没有这么多人靠着它吃饭呢？英伟达虽然一直努力地在打造他的生态链，整个生态环境，但是并没有那么多。所有能战胜英伟达的，像刚才我们说的戴尔、超威等，这些已经都涨疯了。剩下的呢，其实没有那么容易贴上去。虽然有很多人说，“我们拿英伟达的CODA，我们去写这些Transformer的大模型。”但是这些人呢，实际上在整个的生态链里面是非常非常小的一群。现在能够真正把这个东西跑通的人非常少，虽然这个领域的人才工资非常高，但是人数真的不多，它没有真正撬动大众。所以，我从这两个方面来论述，英伟达到目前为止，依然是一个很轻的公司，资产很轻，它的整个生态链其实也是相对短而且相对脆弱的。</p>



<p class="wp-block-paragraph">那么英伟达现在能够赌的是什么呢？就是这个缩放定律，叫“scoring low”。只要这个东西依然有效，黄仁勋呢，就还可以继续狂飙那么一段时间。“scoring low”是什么东西？就是我堆更多的数据，上更大的模型，上更大的算力去计算，然后得到的模型效果就更好。这个东西只要依然在，还可以大力出奇迹。那么大家就说，那我们就接着老老实实地买他们家显卡。</p>



<p class="wp-block-paragraph">而且，这种倍速一定是十倍、百倍、千倍这样往上涨，为什么呢？因为如果你说，我英伟达下一代的GPU就比现在快20%，那大家就不更新了。或者说，我干脆去买AMD吧，AMD的比你这还便宜点，算力也没有那么差，只是这个过程稍微麻烦一点——我需要重新去适配AMD的算力卡。大家要注意，因为做这行的人很少，这些人很聪明，对他们来说，适配一个新的算力卡，难度并没有那么高。</p>



<p class="wp-block-paragraph">刚才我为什么专门讲了苹果的生态链、谷歌的生态链、微软的生态链？因为它们里面有很多低端开发者，对他们这些低端开发者来说，技术迁移的门槛是很高的。你让他重新换一下，比如说，“你原来做安卓的，现在去给我做iOS开发去”，他真不会。甚至说，他学会了以后还能涨些薪水。但是对于英伟达来说，如果他没有办法快速地让算力十倍、百倍、千倍地涨上去，那么大家就会渐渐背离他，对他的忠诚度是相对比较低的。</p>



<p class="wp-block-paragraph">有可能造成英伟达崩塌的原因有三个，咱们最后总结一下：</p>



<p class="wp-block-paragraph">第一个就是摩尔定律失效了，缩放定律已经没效果了。大家发现，上更多的数据，配更大的模型，训练完了以后效果提升了。一旦到这样的情况，就不会有人再疯狂地去买他的新显卡了。</p>



<ol class="wp-block-list"></ol>



<p class="wp-block-paragraph">第二个中心转移了。突然间，又一个特别赚钱的应用方向爆发起来。大家注意，现在为什么大家都在选择这个？因为“缩放法则”——谁都用不好。大家只能去比谁的模型做得更好，然后去跑这个，跑那个。但是一旦发现，这个模型在做一些特定应用时，效果好得一塌糊涂，而且极其赚钱，那么这个时候，就不会有那么多人继续投入资金去做新模型的研发了。他们可能觉得，现在的模型就够了。这相当于什么呢？就是说，虽然“缩放法则”仍然有效，并没有崩塌，但是没有人愿意再往上堆成本了。因为，尽管“缩放法则”有效，但增加更多的算例、更多的数据，那都是钱。一旦出现特别赚钱的领域，即使“缩放法则”依然有效，增长也会停止。</p>



<p class="wp-block-paragraph">第三个因素是巨头合作，突破并扩大了垄断。现在，大家离不开英伟达的原因，就在于它推进的这套扩大——可以称之为通用计算方法，具体的名称我不再详查，它是不开源的，而且英伟达拥有专利。因此，大家都在这个基础上进行了应用开发和大模型的训练。之后，想要更换这个技术，就会有一个成本。这个成本，我们要反复讲，不高也不低，为什么会这样呢？</p>



<p class="wp-block-paragraph">肯定换过去以后会有些兼容性的问题。但是呢，因为你后边真正使用你的H100也好，Blackware也好，都是些什么人？特斯拉、苹果、谷歌、微软、亚马逊——他们可以花最贵的钱，雇最好的工程师，说来咱们今天去改一遍就完事了。这个都是有可能的。但是，这个临界点在什么地方？临界点就是，如果涨不上去了，那咱就改；或者说突然有人说，“我愿意砸一笔更大的钱进来，咱就改。”为什么？詹奥特曼说，“咱们砸一笔大钱啊，1,000亿美金，或者说1,000万块H100算力的这个GPU，我们统一搞一次，做星际之门去。”这个对于英伟达来说，都是比较大的威胁。就是这三个威胁。</p>



<p class="wp-block-paragraph">英伟达呢，也算是我们现在的一个传奇故事。我相信在整个的AICC大时代里头，我们还可以不断地看到它的故事继续。好啊，今天我们要讲的故事就到这里。感谢大家收听，请帮忙点赞点小铃铛，参加Disco讨论群，也欢迎有兴趣有能力的朋友加入我们的付费频道，再见！</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
