<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Sora &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/sora/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Fri, 17 Oct 2025 00:45:45 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.2</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>Sora &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>酝酿近一年，OpenAI终官宣！ChatGPT成人版几周后上线，用聊天记录判定年龄，隐私与安全面临大考｜OpenAI、Sora、Age Verification、Adult Content</title>
		<link>https://lukefan.com/2025/10/17/openai-adult-ai-content-sora2-china-challenges-age-verification/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Fri, 17 Oct 2025 00:45:44 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Adult Content]]></category>
		<category><![CDATA[Age Verification]]></category>
		<category><![CDATA[AI内容生成]]></category>
		<category><![CDATA[AI安全策略]]></category>
		<category><![CDATA[AI模型竞争]]></category>
		<category><![CDATA[AI社交]]></category>
		<category><![CDATA[AI视频生成]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Responsible AI]]></category>
		<category><![CDATA[Sam Altman]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[TikTok模式]]></category>
		<category><![CDATA[Xai Grok]]></category>
		<category><![CDATA[中国大模型]]></category>
		<category><![CDATA[使用政策]]></category>
		<category><![CDATA[内容审查]]></category>
		<category><![CDATA[内容过滤器]]></category>
		<category><![CDATA[大模型商业化]]></category>
		<category><![CDATA[开源模型风险]]></category>
		<category><![CDATA[情感陪伴AI]]></category>
		<category><![CDATA[用户分级]]></category>
		<category><![CDATA[用户隐私]]></category>
		<category><![CDATA[视频模型]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2684</guid>

					<description><![CDATA[兄弟们！ChatGPT要出成人版了？！OpenAI急得跳脚，去年还装"人类圣母"，今年直接摆烂：Adult GPT 11月杀到！🔥 原因笑死——Xai的Grok靠"3D性感小姐姐"聊天杀疯了，苹果榜Top1，30刀会员秒充爆！🤯 OpenAI：脸？竞争太狠不值钱了！

但最惨的是咱中国大模型兄弟！😭 国家说"没有成年人"，连电影都分不了级，AI咋搞？开源模型被越狱后，还得背锅"传播不健康内容"… 以前偷偷百无禁忌画川普、星球大战，现在要立道德牌坊！笑死，立完A面还得偷偷B面？不存在的！👀

真相扎心：AI社交必须成人化，否则变现？做梦！中国兄弟别挣扎了，乖乖当"圣人模型"吧～💪
点赞！不然错过AI界最骚操作，下一个爆点我再扒！👇 #AI真相 #OpenAI脸呢 #中国模型惨案💥

标题1：OpenAI为Sora社交化豪赌成人内容，中国大模型却因无法分级陷入绝境｜OpenAI、Sora、Age Verification、Adult Content、ChatGPT
标题2：别被“竞争压力”骗了！ChatGPT搞成人分级真相曝光，竟是为Sora社交变现铺路｜OpenAI、Sora、Age Verification、Adult Content、AI Video Generation
标题3：酝酿近一年，OpenAI终官宣！ChatGPT成人版几周后上线，用聊天记录判定年龄，隐私与安全面临大考｜OpenAI、Sora、Age Verification、Adult Content、Safety
标题4：OpenAI掀桌子了！拥抱成人内容搞分级，中国开源模型“百无禁忌”的好日子到头了，未来恐担责｜OpenAI、Sora、Age Verification、Adult Content、Censorship
标题5：行业洗牌！OpenAI不再伪装，放弃“超级对齐”转向成人化，Sora对标TikTok才是终极野心｜OpenAI、Sora、Age Verification、Adult Content、Responsible AI
简介：OpenAI 即将推出 ChatGPT 成人版，并引入基于用户行为的 Age Verification 系统。这一重大转变，表面看是为应对竞争，深层原因却是为 Sora 的视频社交战略铺平道路。当 OpenAI 开始拥抱 Adult Content 时，缺乏分级制度的中国大模型厂商，正面临前所未有的合规与发展挑战。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="行业洗牌！OpenAI不再伪装，放弃“超级对齐”转向成人化，Sora对标TikTok才是终极野心｜OpenAI、Sora、Age Verification、Adult Content" width="900" height="506" src="https://www.youtube.com/embed/HUfpG6Vm6Fg?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">ChatGPT要出成人版了，要对用户年龄进行分级管理了，中国大模型这回可能遇到大麻烦了。</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">这件事已经喊了快一年了。去年年底，山姆·奥特曼就出来说：“我们以前对于OpenAI ChatGPT输出的内容，控制的有点太严格了，以后要稍微放松一些。”现在呢，已经到10月份了，终于发帖说：“再过几周，请再耐心的等一等，我们的成人版本马上就要来了，我们准备对用户进行分级了。”可能在十一二月份，我们就可以看到成人版本了。</p>



<p class="wp-block-paragraph">为什么会在这样的一个时间点里头，推出成人版本呢？竞争压力实在太大了呀！特别是Xai的Grok，真的是百无禁忌。而且Xai还通过“性感3D小姐姐”的这种聊天伴侣，证明了可以进行这种比较暧昧聊天的场景，是非常非常吸引人的。Xai的Grok通过推出这种3D的性感小姐姐聊天助手，它的产品直接就在苹果iOS的排行榜上冲到前面去了，向所有做AI的人证明了情感，或者是说带有一定暧昧的这种情感陪伴，是非常有用的，是大家真的愿意为它点击下载、愿意为它买单的一个功能。最开始的功能，是你需要充30美金才可以用上的，现在的话你不用充钱也可以看到Grok里边的3D陪聊小姐姐了。</p>



<span id="more-2684"></span>



<p class="wp-block-paragraph">在这样的情况下，OpenAI也就不得不进行转型。而且还有一个点非常非常重要是什么呢？大家要注意，有很多的人离开了OpenAI。原来有一帮人说我们要对齐，我们要超级对齐，我们一定要去为人类做什么。这些人其实就很左的一帮人，这些人跑掉了，剩下的山姆·奥特曼就可以说了算了。以前大家对山姆·奥特曼不满意，包括前面差点把他从CEO的位置上赶走，一个很重要的原因，就是他们认为山姆·奥特曼为了挣钱，会不顾人类的利益。一旦喊到人类利益，这些人我觉得就要么就自己心里头有一些问题，要么就是一些伪君子。他们现在都逐渐离开OpenAI以后，山姆·奥特曼就说了，为了跟Xai竞争，我们就可以去进行分级了。</p>



<p class="wp-block-paragraph">大概就是这样的一个情况。那你说除了Grok Xai之外，还有人在干类似的事情吗？其实也有。这个Gemini，Gemini里头现在有一个做视频的模型，叫VEO 3.1，现在是最新的版本。它现在这个版本出的视频，质量要比Sora 2还要高。在Sora 2升级之前的话它是VEO 3，Sora升级以后的话是VEO 3.1。在这个视频生成的过程中，它直接问你说你是成年人，还是不需要任何限制，你自己选就完了，剩下他就不管了。在Sora 2出来以后，Grok也出了，他们的叫Grok Imagine的图片和视频模型，一贯的百无禁忌。OpenAI说：“你们既然都已经这样了，人类未来的兴衰，也不能都搁我一人肩膀上，那咱们接着往前走呗。”</p>



<p class="wp-block-paragraph">还有呢，就是国内的大模型。国内的大模型，其实相对来说是比较百无禁-忌的，这可能跟大家想象的不太一样。很多人都觉得，中国的大模型是不是限制很多？确实有限制，特别是一些涉黄涉黑的这些内容，相对来说限制的比较严格的。文字模型呢，早期其实比较宽松，因为你要让他不说什么，这个事还是挺麻烦的。现在呢，开始逐渐严格起来了。而图片和视频模型呢，不要涉黑，不要涉黄，其他的基本上是百无禁忌。那你说不涉黑不涉黄，还能百无禁忌什么呢？比如说名人的肖像，国内的不算。你说：“给我画川普，画马斯克呀！”他们都很开心的给你画出来。还有各种的版权IP，你说给我画星球大战里边的各种形象呀，给我画各种游戏的形象、动漫形象，这都没有任何问题。这些要求你到OpenAI里，基本上是没法实现的。所以国内的模型呢，百无禁忌的比较多。还有一点是什么呢？就国内其实有好多开源模型，开源模型是比较容易越狱的。你稍微对它微调一下，或者做一下LoRA什么这些东西，它就越狱出去了。咱们举一个例子，就是阿里出的通义万象的模型，是一个可以生成图片、可以生成视频的模型。这个模型在海外的网站上就有，叫“越狱版”，你可以直接去用，那个也是百无禁忌的。</p>



<p class="wp-block-paragraph">那你说为了跟大家竞争，OpenAI就连脸都不要了吗？不再惦记说，跟人类最高尚的情节去进行对齐了吗？这个其实还有一个很重要的原因。前面咱们也讲了Sora 2，它作为一个视频的生成模型，其实并不是特别成功。它从技术上来说，跟Xai的Grok Image或者是谷歌的VEO 3.1比起来，其实没有强到哪去，甚至比国内的即梦和可灵都没有强到哪去。他有几个地方还做的比较好吧，一个是多镜头拼接。其实多镜头拼接，是一个相对来说比较偷懒的地方。一共10秒的视频时长，这个镜头切得越细呢，实际上对于模型的要求就越低。你要让一个镜头很长，一个镜头10秒钟，你就要求整个的镜头非常稳定，这个事是比较难的。所以Sora 2偷了个懒，把你一个10秒的镜头切成两三个，每一个镜头也就是三五秒钟，这样会容易很多。另外呢，就是Sora 2里头，有一个叫“个人形象应用”的东西，这个呢是别人目前还没有做的很好的。除了这两点之外，其实作为视频生成模型来说，Sora 2真的不算先进，你去跟其他的比较一下就知道了。但是Sora 2有一个很重要的东西是什么呢？那是一个社交工具，它并不是一个单纯的模型，不但并不是一个单纯的视频生成模型，它是一个视频社交媒体。</p>



<p class="wp-block-paragraph">那么视频社交媒体，跟成人化又有什么关系呢？这又该我这个显摆一下了。我原来投资过Musical.ly，Musical.ly原来遇到了一个很严重的问题，他刚做的时候是专门面向未成年人的。你面向未成年人的这种短视频社交媒体平台，你在最后变现的时候就没法去变现，你没法去做广告，因为大量的广告是没法给未成年人看的，能给未成年人看的广告也不怎么值钱。原因很简单，未成年人手里头没有信用卡，他没有办法直接进行交易。在美国最值钱的广告是这种约会广告，各种dating的广告。那你说你给未成年人展示这玩意，肯定是不行的。所以他们最后还是决定走成年化。这个软件从Musical.ly后来改名叫TikTok了，核心的原因就是为了成年化。而现在OpenAI说，我也要去做视频社交平台了，它也需要走成年化这条路。那么他说我们以后就分开了，这一部分是成年人的，那一部分是未成年人的。未成年人呢，你们以后就干脆别用了。现在有一些国家已经开始要准备出法律，说15岁以下的青少年就不要使用社交媒体了。他现在要做社交媒体平台了，就必须要成人化，否则的话这条路没法往前走了。</p>



<p class="wp-block-paragraph">那既然要成人化呢，遇到了一个很严重的问题是什么？鉴别年龄。这件事儿你说，AI能比传统的验证身份证更好使吗？不好说。其实传统的，比如说色情网站上来先问你，你是哪一年生的，你是够18岁还是够22岁，因为有些色情网站是要求你够22岁的。包括咱们打游戏，Steam游戏，你进入某些特定的游戏页面的时候，他先得问你是哪一年生的，因为有一些游戏是有成人向的。那你说我只管填不就完了吗？还有一些网站呢，就直接有一个按钮，一上来说：“我承诺我已经成年了。”他是这样的，就是纯凭自觉。那这事呢，基本上属于叫形同虚设，没那么好使。还有一种就是查身份证。你比如说在美国，你要去酒吧里头喝酒，你就去给人看身份证。这个原来我还没遇到过，我是什么时候遇到的呢？是2014年猎豹移动上市，我们跑到拉斯维加斯去庆祝去了，点了很多酒。我们的这些从中国过去的人，他们就必须要查身份证才给我们酒。像我这样肯定上去不会问我要身份证，就直接给酒精了。但是我们有一些长得比较嫩的，就必须要看身份证，当然我们都是给人看护照，看完护照才能给你酒精饮料喝。但你说这个方式靠谱吗？其实也没那么靠谱，有很多的未成年人都是使用父母的账号的，那他们就会被当成成年人。</p>



<p class="wp-block-paragraph">那OpenAI准备怎么干呢？他准备根据你聊天的情况来判定你的年龄。先默认你是未成年，然后呢OpenAI收集你的聊天内容，去判定一下你到底是成年了还是未成年。那你说有些人明明没有成年但是很老成，说话也都比较成熟，这种呢就有可能会被误判成成年人。有些人呢虽然成年了，但是说话老像没长大似的，就会被误判为未成年人。这事都是有可能的。</p>



<p class="wp-block-paragraph">这个判断准不准，其实是一回事儿。我相信通过这样的AI判断呢，它的效果会比让你直接填年龄，或者是查身份证应该会更有效。但是呢，OpenAI等于是把一个巨大的风险留给了自己。什么意思？就是如果有一些小孩说话非常老成持重，被判定为成年人了，他看到了很多的不健康的内容，或者说成人的内容，再出了什么事情以后的话，OpenAI就需要承担法律责任。法院才不管你说你怎么判定他心理是不是成熟，他不管你这个，只要是你给未成年人展示这个东西，被举报了，马上就要去承担责任。而且这个事情在欧美，这个责任是非常非常重的。所以OpenAI呢应该会更谨慎一点，它应该会用各种方式去进行叠加。就是我一边要求你提供身份证，一边要求你去回答各种问题，说你到底成年没有，你自己呢要去做一些承诺。另外呢，也要再去判断你日常沟通的这个信息，就避免说我借了别人的身份证来去使用成人内容，甚至呢还要避免一些虽然成年了但是心智不太成熟的人使用这种成人内容。他需要去做这样的事情。但是呢，在最终到法律那去判的时候，说你到底给未成年人展示了什么东西的时候，他还是要在责任上把自己撇清楚的。而且在这一点上，OpenAI已经说了，我不惜牺牲隐私和自由也要去做甄别。很多人说你是不是拿了我的隐私去做什么事了？那你在甄别未成年人这件事上，我们就不再介意隐私和自由的问题了。</p>



<p class="wp-block-paragraph">中国大模型厂商，这次呢就真的会有一些麻烦。为什么呢？中国是一个没有成年人的国家，我们连电影都没法分级，我们从来不承认有任何的成年人可以去看成年电影。原来呢，国内这些大模型呢，属于睁一只眼闭一只眼，它主要抓平台和内容，谁把这些有问题的内容发上来了，哪个平台生成了这些内容，哪个平台上传和传播的这些内容，原来主要抓这个。模型其实他是不太管的。以前现在的话，估计是要开始针对模型进行限制了。因为呢，他发现这个系统是可以产生一些成人内容的，而要进行年龄鉴别和内容限制的话，这本身其实是需要技术的，也需要算力，不是随随便便就可以去做的。特别是在模型层面上，你要做这件事是非常非常麻烦的。你可以在模型上做训练的时候说，我们这件事不许干，那件事不许干。但是呢，你一旦微调了以后，这个事就没有任何办法，你是很难控制的。而且这些被微调了以后可以百无禁忌的模型呢，会流传到全世界各地去。</p>



<p class="wp-block-paragraph">以前咱们处理的方式是什么呢？比如说千问，他们呢会有国际站和国内站。六小虎里边的MINI Max呀，还有像Moonshot呀，这些公司都是有国内站、国际站，它是分开的。他们呢原来只需要在站点里头，符合各自所在国家的法律要求就完事了。原来都是闭源的，现在呢都是开源模型。开源模型那拿出去以后，大家就拿着这些模型去微调，出去做各种越狱去了以后的话，这一部分可能就都需要去承担责任。咱们呢，一方面是要去挣钱百无禁忌，另外一方面呢，咱们还特别要面子，一定是站在道德的最高峰上，说我们的内容绝对是安全健康的。所以这对于我们未来的大模型发展来说的话，会背上极其沉重的包袱。我们没有办法对电影分级，我们也没有办法对大模型分级，我们也没有办法对这些平台进行分级。以前我们可以专门出海外版的平台，比如TikTok是美国的，抖音是中国的，抖音遵守中国法律，TikTok遵守美国法律，完事了。现在你说我出了一模型，我没法去专门训练了一个海外的模型，再去训练了一个中国的模型，你干不出这个事来。因为训练模型这个事，本身就成本很高。另外一个呢，就是在训练的过程中，你不知道最终的结果会变成什么样。这个的话，对于咱们这种想用开源模型的方式把这条路走通的人来说，就会比较费劲了。</p>



<p class="wp-block-paragraph">未来的话，在海外做社交媒体平台的人，包括TikTok，包括像Minimax什么的，在海外实际上都在做社交媒体，他们主要是做聊天陪伴，做这种类似于情感陪伴的这种平台。这一块的话，可能在未来就会比较麻烦了。以后可能中国的这些开源大模型产生了不健康的内容，都是需要去承担连带责任的。那你说这玩意怎么能发现呢？很简单，你有竞争对手，竞争对手会举报你的。以前最开始做直播平台的时候，直播平台竞争是怎么竞争的？就是专门雇人，在你们家的平台上开一个直播间，快速的上线开播，马上在另外一台手机上录制，录制完了以后就去举报，说你看他们直播黄色内容。甚至曾经还逮到过什么呢？就是有人发现了，举报的IP地址和直播的IP地址都是竞争对手公司的IP地址，然后又拿这个事把竞争对手也干掉了。中国人之间的竞争就是这么朴实无华。所以呢，大模型分级这件事，实际上对于开源模型来说并不友好，因为他们需要承担的责任会变多。</p>



<p class="wp-block-paragraph">最后总结一下吧。OpenAI之所以现在要去做成人化，核心是他们要走向社交了。所以呢，他们第一件事就是年龄分级和成人化内容的输出，这个是为了Sora 2做社交做的，不是单纯的为了竞争。AI社交呢，成人化是必经之路，如果你不去做成人化的话，你的社交产品就会承担很多很多的问题，承担很多很多的责任。刚才咱们讲了Musical.ly，最开始是没法变现，还没讲Musical.ly在很多国家都被家长告，被学校去禁用，因为呢确实是有一些变态吧，会通过Musical.ly找到一些未成年人去进行跟踪尾随，也确实是发生过一些不是特别好的事情的。你一旦要社交化的话，就是要成人。最后，对于想靠开源模型逆袭、又不存在成年人的中国大模型公司来说，这肯定是一个不大不小的麻烦。在未来一段时间里头，我们就只能好好立牌坊了。立完牌坊的另外一面呢，我们就没法偷偷地再去做一些其他的事情了。</p>



<p class="wp-block-paragraph">好，这就是咱们今天要讲的故事。感谢大家收听，请帮忙点赞、点小铃铛、参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。</title>
		<link>https://lukefan.com/2025/06/30/%e5%81%9c%e6%ad%a2%e9%94%99%e8%af%af%e5%b0%9d%e8%af%95%ef%bc%81midjourney-video%e8%a7%81%e5%85%89%e6%ad%bb%e7%9a%84%e6%a0%b9%e6%ba%90%e8%a2%ab%e6%8f%ad%e5%bc%80%ef%bc%8c%e5%ae%83/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 30 Jun 2025 00:40:06 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[AI视频]]></category>
		<category><![CDATA[AI视频一致性]]></category>
		<category><![CDATA[AI视频工具对比]]></category>
		<category><![CDATA[Gemini CLI]]></category>
		<category><![CDATA[iPhone实况照片]]></category>
		<category><![CDATA[Live Photo]]></category>
		<category><![CDATA[makelive]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[Midjourney Video]]></category>
		<category><![CDATA[Midjourney Video评测]]></category>
		<category><![CDATA[Midjourney用法]]></category>
		<category><![CDATA[MP4转Live Photo]]></category>
		<category><![CDATA[Pika]]></category>
		<category><![CDATA[Ruby脚本]]></category>
		<category><![CDATA[Runway]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[为什么Midjourney Video没火]]></category>
		<category><![CDATA[产品分析]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[代码生成]]></category>
		<category><![CDATA[使用技巧]]></category>
		<category><![CDATA[创意内容生成]]></category>
		<category><![CDATA[动图分享]]></category>
		<category><![CDATA[动图制作]]></category>
		<category><![CDATA[可灵]]></category>
		<category><![CDATA[命令行工具]]></category>
		<category><![CDATA[图生视频]]></category>
		<category><![CDATA[小红书动图]]></category>
		<category><![CDATA[市场反响]]></category>
		<category><![CDATA[技术教程]]></category>
		<category><![CDATA[正确使用方法]]></category>
		<category><![CDATA[生成式AI]]></category>
		<category><![CDATA[社交媒体素材]]></category>
		<category><![CDATA[视觉特效]]></category>
		<category><![CDATA[视频拼接]]></category>
		<category><![CDATA[谷歌Gemini]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2342</guid>

					<description><![CDATA[啊啊啊啊啊啊啊！家人们！我今天必须吹爆Midjourney Video！这个神器真的让我破防了！5秒钟就能生成超惊艳的动图，氛围感、细节感直接拉满，简直是打开新世界的大门！以前我以为它“见光死”是没啥用，现在才发现是我们用错了方法！它压根不是做视频的，它是动图界的王者啊！必须冲，必须玩！

先说结论，Midjourney Video生成的5秒小片段，单独看是美到爆，但拼成完整故事太难，所以大家才没传播开！但是！转成Live Photo动图后，效果直接炸裂！小红书、微信分享一发，点击率和情感传递能力嘎嘎强！这才是它的正确打开方式！

咋操作？我手把手教你！
1. 用Midjourney画好图，直接在官网生成5秒视频（有低动态和高动态，随便选都美）。
2. 下载图片和MP4文件，用Gemini CLI和makelive工具转成Live Photo（小白也能搞定，网上搜教程超简单）。
3. 丢到iCloud或相册，分享到小红书、微信，完事！5秒动图直接治愈你的emo，高级感拉满！

真的，我用它做了个Labubu在金字塔前晃悠的动图，发出去后朋友圈都炸了，全在问咋做的！这种情感传递的效果，视频都比不上！而且操作不贵，10美金的账号随便玩，性价比无敌！

家人们，停止摆烂！Midjourney Video动图真的值得一试！不管你是想记录生活，还是想在小红书吸粉，这玩意都能帮你狠狠出圈！快去试试，生成你的专属动图，分享你的情绪和故事！错过真的会后悔一辈子啊啊啊啊！最后，记得点赞收藏这条笔记，咱们一起玩转动图，冲冲冲！🚀

停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。

万众期待的Midjourney Video为何发布后就“见光死”？本文深入剖析其与Sora等AI视频工具的核心差异，指出其并非败在画质，而是大家用错了方向。Midjourney Video的真正价值并非生成长视频，而是创作效果惊艳的动图（Live Photo）。我们将提供一个详尽的使用方法教程，一步步教你如何利用谷歌最新的Gemini CLI工具，通过简单的Ruby编程（附带开源项目makelive指导），将Midjourney生成的MP4视频快速转换格式为可在小红书、微信等平台引爆流量的Live Photo。这篇全面的评测与实战指南，将彻底改变你对Midjourney视频功能的认知，让你掌握其正确用法，轻松制作出独一无二的动态作品，不再为视频一致性问题而烦恼。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。" width="900" height="506" src="https://www.youtube.com/embed/10qm1zM6PYs?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">大家期待已久的Midjourney video，为什么在发布之后很快就没有声音了？今天咱们来讲一讲。</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。我个人呢，也是下了很大的决心才录了今天这条节目，因为Midjourney video真的是万众瞩目。因为他作图做得非常非常好，在美学上、在各种细节上、在氛围渲染上，到目前为止，所有的图像生成模型里头，Midjourney是最好的。前面他说我要去做视频的时候，一大帮人就在等，很多人都非常期待。产品发布了，突然就没声音了，见光死。这个是什么样的一个情况？</p>



<p class="wp-block-paragraph">首先呢，跟大家一个结论，就是Midjourney video做出来的视频非常惊艳、非常炫酷、非常美。但是这个产品做出来的视频放在哪都不太合适，这个东西做出来没什么用处。可能呢，是大家没有正确的找到Midjourney video产出的视频的用途。我今天之所以敢跟大家录这个视频，是我觉得我好像找到这种视频的一个使用方法了。</p>



<p class="wp-block-paragraph">今天呢，讲几个部分：先做一个Midjourney video的简单介绍；为什么没有形成传播，这个我们要稍微分析一下；Midjourney video到底能拿来干嘛；以及我们要去实现Midjourney video的最终使用，可能还要稍微写点小程序。顺手呢，把最近很热的另外一个工具也给大家介绍了，这个叫Gemini Client（CRI吧，因为要用它编程嘛）。咱们用这个Gemini CLI编完成序以后，把生成的视频最后处理成大家可以用的样子。</p>



<span id="more-2342"></span>



<p class="wp-block-paragraph">首先，Midjourney video的一个简单介绍，演示一下吧，这个是必然的。这就是Midjourney video的网站，上面是<a href="https://midjourney.com" target="_blank" rel="noopener">Midjourney.com</a>。我们现在是到这个explore，就是我们去浏览一下。浏览的时候呢，这儿有这个图片，他觉得画得比较好的图，以及video都是允许我们去浏览的。这都是别人画的，我们可以看一下这个东西：猪戴着项链在这走秀，有人在水底下骑车，玩偶在这吃冰激凌，还是这种绿色的玩偶穿着毛衣。你看这个细节，这脸上这些线，各种的风格都可以动起来。这个是3D风的，然后这是真人风的，骨头的x光片呀，这个都可以动，没有什么东西是不可以动的。</p>



<p class="wp-block-paragraph">Labubu感觉还可以，你看这个国旗的质感，做得还是非常非常漂亮的。这个是Labubu，后边是金字塔，看来Labubu确实是很火了。</p>



<p class="wp-block-paragraph">不知道使用Labubu形象算不算侵权。要注意一点什么呢？就是在Midjourney生成video的过程中，对于版权对于形象的控制是要更严格的。这种完全是虚拟的点，做出来的这个动画也是非常漂亮的。像这个就完全是水彩风的，你看有小树叶飘下来，这就是他现在的Midjourney video。</p>



<p class="wp-block-paragraph">那么我们怎么去用这个玩意呢？我们只能通过Midjourney画的图去生成。而且我们知道Midjourney，你是可以在这create，直接在网页上去创建。你可以把提示词写在这儿：“给我画一个什么什么画，画横的宽的扁的，哪个版本的。”在这儿直接画，或者是在我们DISCORD里头画。但是呢，你要想生成视频，必须在这网站上，<a rel="noreferrer noopener" href="https://midjourney.com/" target="_blank">Midjourney.com</a>这个网站上。</p>



<p class="wp-block-paragraph">过程是这样的：先找到原来我们画好的，这是我以前画好的图。你点中其中一幅图以后拿这个图去画。你说我直接写一个文字，你给我生成行不行？不行，必须是用Midjourney的图生成。你说我上传一幅图生成视频行不行？也不行。所以就是用图来生成就好了。刚才让他给我画一个地下城的，还是挺有感觉的吧。</p>



<p class="wp-block-paragraph">右下角有一个叫auto，就自动的，就是相当于是自动的给你变成视频。有一个是low motion，就是比较小的动作；一个是high motion，就是带有很高的这种动态。手动呢，就是你可以再去写一个提示词给他，说你到底是怎么个动法，还是分高低两种。就是你看你有一个提示词：“创建一个视频，开始从一个图像和一个提示词来描述这个动作。”我们就是自动的吧，做一个low，做一个high，看看它在干什么。</p>



<p class="wp-block-paragraph">我们点击到这个create，它就开始干活了。已经做到30%了，上面那个在排队。我呢是每个月交10美金的账号，因为前面没有找到用这玩意干嘛使，所以呢，目前为止还够用。生成4个小视频，大概也就是一分多钟左右。底下是在这写着呢：motion low；上面那个是motion high。咱们可以比较一下。84%了，然后再等一等，92。上面那个还在排队。</p>



<p class="wp-block-paragraph">好，做出来了。让我们放大一点。你看他首先呢做了一个镜头的推镜。你看下面的人呢，就在这上面开始走动起来了。这个桥上面的人物呢也在发生变化。所有的细节，你看包括这后面的山，这个细节的透视关系。因为随着镜头的改变，透视关系都是正确的。这是第一个。然后第二个，虽然还是在轻轻的往前摇，但是呢侧面这些人，他走动的就会有一些小的差异。</p>



<p class="wp-block-paragraph">这边呢，推进的方式不一样。他这个镜头除了往前推之外呢，还在向上升。基本上都是在推进，但是呢是做了四组不同的推进。在推进的过程中，下边这个人物呢，会发生一点点小的变化。</p>



<p class="wp-block-paragraph">每一个视频下头呢还有两个按钮，一个叫“扩展自动”，一个叫“扩展手动”。比如说我现在打开了首帧提示词，你可以在在在这个基础上再去扩展。现在是5秒，再扩展呢就是10秒，它大概最高是可以扩到20秒。我们今天就不再扩展了。然后呢，我们就可以下载这个图片视频。</p>



<p class="wp-block-paragraph">好，让我们来看看上面这个高动态范围的做成什么样了。这个高动态范围，它动的要比刚才那快，直接就从底下推进，直接推到这个上面来了。低动态范围呢，就是它这个推进推的是很慢的。高动态范围这个明显感觉有差异了吧？</p>



<p class="wp-block-paragraph">这个镜头推的这个方向，就又不一样了。他是像穿越机似的从底下去推过去。刚才第一个视频是直接推到这个桥上面去了。这个呢基本上是推了一条直线，下面人也在慢慢的走动。这个应该也是没有往上抬这个镜头，还是在这个桥底下，让这个镜头再往前走。高动态范围跟低动态范围，大概就是这样的一个差距。</p>



<p class="wp-block-paragraph">我觉得这张是做的比较漂亮的。我这有一张，是当时说你给我画一个川普带一堆CEO出差的，他就给我画了一个图片。画图的时候没有提示任何错误，他就给我画出来了。我说来给我生成这个视频，直接报错了。因为呢生成视频的时候，它使用的规则要更严格一些。生成图片没问题，但是生成视频他会告诉你说裸露，或者是其他不允许的东西，都都给你去掉了。</p>



<p class="wp-block-paragraph">我再给大家找一些照片来去生成。这个是拿我自己照片生成的这个图片，说我要去拎着包去旅行，干活去了。上次反正是报错了，因为你拿真人做的好多也会报错，不一定每一次能不能干活这个事。比如说迪士尼这种侵犯版权的这些东西，你画图它给你画出来，但是你说你现在给我把它生成视频，它就给你扔出来，说我不给你生成视频。</p>



<p class="wp-block-paragraph">这是用的星球大战的风暴兵。我说你给我去生成视频，反正我是被拒绝过很多次。看看这一次星球大战的这个风暴兵，能不能给我们做出来。你看我就从明信片里就走出来了，也挺好玩的吧。这次也可以了，当时刚画出来的时候，他是不给我去做的。也许有川普的这个，过一段时间没准也可以愿意给我画了。反正他这个政策执行的比较奇怪，我这个都是被拒绝过的，这一次看来他就干活了。</p>



<p class="wp-block-paragraph">你看他这个风暴兵在食堂里头吃饭，围在这找东西吃呢。你看这个手什么都在动。下一件事我们要下载，比如说这张。好，把它下载下来。这张也很漂亮。</p>



<p class="wp-block-paragraph">下载下来。在这个右上角上，有点击下载的这个按钮，点一下它就下下来了。下的都是MP4文件。然后我们再把原来这个图下下来，把这个图下下来。待会我们要做动图嘛，动图就是要有一个起始图，要有一个这个视频。</p>



<p class="wp-block-paragraph">好，我们的蜗牛也画完了。看看这个蜗牛，先推了个镜，里头各种的零部件就开始转起来了，还是挺有感觉的吧。这就是我们展示的Midjourney的video。演示结束，大家看到了这个东西，操控起来其实并没有那么容易。</p>



<p class="wp-block-paragraph">第二个呢，就是生成的过程绝对简单，很多是傻瓜式的。那你拿来以后说，这个甭管是低运动的还是高运动的，你只要点，它就直接给你生成了。第三个呢，这东西不贵，生成一副图片的价格，其实大家还是可以接受的。至少到我目前为止并没有觉得说充值不够使的一个情况。你如果不想去买更贵的套餐，我们专门给大家了一些让你去充这个算力，充这个他们叫GPU时间的一个套餐进来，所以基本上还算比较便宜。</p>



<p class="wp-block-paragraph">生成的结果大家也看了，绝对惊艳。只是呢，现在有一个很大的问题，就是比较难拼起来。生成了一堆视频，你说最后我怎么把它拼成一个完整的故事，这个事呢稍微有点难度。最后就是没有声音，它是没有配音没有音乐，生成出来的就是完全没有声音的一个视频文件MP4的文件。</p>



<p class="wp-block-paragraph">那么为什么没有形成传播呢？为什么这样惊艳的一个产品见光死呢？这个是咱们真正需要分析的。就是他这个产品实在太难操控了，虽然你做出来的东西很漂亮，但是你说我要想做一个特别完整的电影，讲一个完整的故事的话，这个实在是非常非常困难。因为Midjourney本身绘画它的特点是什么？细节极其丰富。在你这么多丰富细节的情况下，我想把它做成视频，让它保持所有的细节的一致性的话，这是绝对地狱难度的。</p>



<p class="wp-block-paragraph">控制呢，就真的不是那么好控制的。大量不一致的视频片段，你要想把它分成镜头的话，拼成完整故事基本上不可能。其实很多人讲说5秒钟一个小片段，它生成就是5秒吧，你可以往后延5秒，延5秒这样生成。你说5秒钟片段本身这么惊艳的片段，为什么没有人有动力把它们拼成一个故事呢？</p>



<p class="wp-block-paragraph">像前头皮卡呀，sora呀，谷歌的VOE3、可灵和吉梦，大家都去拼。为什么Midjourney就没有人去拼这个东西呢？大家想一想，我们看到的电影是什么样的？电影的真正的玩法是3秒钟、5秒钟甚至更短的时间就是一个镜头。但是呢这个镜头是通过意识进行拼接的。比如说吧，一个人现在想起床了，先拍一个全景。</p>



<p class="wp-block-paragraph">现在他是躺在床上了。然后呢，要拍一个特写，拍在脸上。他现在开始有苏醒的感觉了，可能再拍几个特写。你的手要从被子里拿出来，要翻个身，胳膊开始使劲了，上身支起来了。然后再拍一个中景，你坐起来了。然后再拍一个全景，脚放地上了，包括整个房间，整个人都要在里头。这个时候呢，要再切一个窗口的远景。我现在抬眼了，我要看一看窗外的风景，等于又是一个镜头。然后这个人开始去找拖鞋，可能要这个特写，脚要在地上找到拖鞋。然后周围这种暖色调氛围渲染好，再通过一个什么样的视角，慢慢的走到窗边去。还要打一个哈欠，伸一个懒腰，再一个特写，伸手去开窗户看一看外边。比如说有这个小鸟在外边叽叽喳喳叫，再去拍一个这个小鸟的特写。咱们啰里八嗦说半天，可能也就是一两分钟。这是一个电影的玩法。</p>



<p class="wp-block-paragraph">甭管是用其他的这些模型，还是用Midjourney，你要想控制成这样的一个视频去拍出来太难了。比如说吧，我们现在可以说先画一个画，说这个人躺床上了，坐起来。你让这个Midjourney给他下一个命令，但是你说我现在想改一特写，那你就很难再去维持一致性了。你说我现在在什么地方，再要翻个身，再掀个被子，再找个拖鞋，这就比较难了。你说我再单独画一个小鸟，单独展示一个5秒钟，这个也是相对来说比较容易的。但是当多个镜头从不同的角度、不同的距离显示同一个场景的时候，你要想保持这个一致性，基本上不可能。其他的这些模型呢，虽然也很费劲，还是有可能，但Midjourney基本上是没法控制的。</p>



<p class="wp-block-paragraph">为什么？因为Midjourney的本身的图像里头，我觉得画的图片里头细节实在太多了。你没法在不同的视角、不同的距离，一会是中景，一会是远景，一会是全景，还能保证所有的细节都一致。所以导致大家说，拿到Midjourney这么一个惊艳的视频产品了以后，都没有去真正的传播起来，基本上算见光死了这样的一个产品。</p>



<p class="wp-block-paragraph">那么真正能够实现刚才我们讲的拍起床过程的这个视频模型，会是什么样的呢？现在这些视频模型应该都达不到，可能还要等李飞飞做的这个世界模型出来。但是不嫌麻烦的，像原来抖音上有一个视频博主叫张同学，他就一个人一部手机，他自己写好脚本以后，自己按照这个脚本，一点点把它都拍出来。但是正常的就是，真的是一堆的摄像头，你身边的所有摄像头都支好了，一次把动作做完，再通过不同的角度去拼。你有了世界模型以后，你才可以干这个事。</p>



<p class="wp-block-paragraph">那么我们通过Midjourney video到底得到的是什么？为什么？我前面讲说我们的用法错了。我们想拿Midjourney video做出来的视频片段拼出大的故事片来，拼出完整故事来，这事就错了。那它到底给我们的是什么？</p>



<p class="wp-block-paragraph">其实Midjourney video给出来的并不是一个视频，而是一个动图，就像类似于GIF或者是iPhone出来的这叫live photo。它呢，并不是一个完整的视频，而是一个会动的图片。它依然还是在画图，Midjourney画图画得最好，画动图依然画得最好，不接受反驳。就是这样的一个东西。</p>



<p class="wp-block-paragraph">那么好了，我们现在有Midjourney video了，怎么把它变成动图？变成live video？GIF虽然是可以动的，但是这个技术实在太旧了，不建议大家去玩。因为你比如说用同样的分辨率、同样的帧率，MP4的这个文件大概只有个六七兆或者是十兆，也就这种水平。live photo的大小可能跟它差不多，但是GIF的话，同样的分辨率和帧率的话，100多兆了，所以不建议大家玩。</p>



<p class="wp-block-paragraph">那我们就想办法把它改成live photo吧。就是我们现在有了一个起始的图片，有了一个用这张图片生成的MP4的一个5秒钟的视频，再长了也没用了，因为live photo本身是不支持更长的视频的。就是5秒钟的，挺好的。我们就拿这个live photo再出去分享，因为现在小红书、微信、Twitter什么的都是支持live photo分享的。live photo分享出来以后呢，整个的点击率、播放率，或者说叫做情感传递的这个能力还是很强的，要比大家上一个视频这个效果还好点。所以咱们干脆就转live photo。</p>



<p class="wp-block-paragraph">后边给大家看一个例子，就是如何用Gemini Client CRI这个产品把Midjourney video转成live photo。下面大家看演示。下面我们要来写程序，把我们的Midjourney video生成的视频以及下载的图片一起生成live video。这个live video就是一个片头一个视频，两个东西给你拼一块就完事了。</p>



<p class="wp-block-paragraph">一共呢，需要两样东西。第一个东西呢，程序肯定咱不能自己写嘛，所以呢，需要一个叫Gemini CLI的东西。这两天谷歌最新发布的官方的Gemini工具，它是个命令行工具，待会我们去跑一跑试试。另外一个呢。</p>



<p class="wp-block-paragraph">是 makelive，GitHub 上的一个开源项目。install makelive 就可以装上去。装的过程，如果你遇到了什么困难的话，请在 GPT 里头解决，我也是这么干的。</p>



<p class="wp-block-paragraph">Gemini 的安装呢，要稍微的麻烦一点。如果你本机没有 nodejs，你是装不上的。所以呢，你可能还需要到网站上去搜一个 nodejs 的安装包，安到本地来，然后才可以正常的去工作。这个装我其实已经装完了，就不跟大家重新演示这个装的过程了。</p>



<p class="wp-block-paragraph">我们现在呢到了一个命令行窗口。命令行窗口里头，我们也进入到了一个新的目录，这里头是空的。如果你要装 Gemini client，先去做这样的一个动作：NODE -v，要空格。NODE -v 之后，如果你后边出来的不是一个数字，不是一个 20 以上的数字，而是一堆的错误的话，就到网上去找个新的把它装上。然后是 npm -v，如果这后边不是数字，你或者报错了，你就在网上再去找一找怎么解决方法。这个解决的过程我就不跟大家去详细介绍了。</p>



<p class="wp-block-paragraph">然后执行命令，因为我装过了，我就不再执行了。就是把这个命令执行以后，如果报错了，到网上去找方法怎么解决；如果没报错，我们就可以正常开始工作了。Gemini n 回车，你看跟这个很像吧，就直接跑起来了。跑的过程呢首先要注意，是这样写个斜线。你呢可以写 help 写个帮助，他会告诉你说，如何去做事情，有哪些命令可以用。所有命令行都是这么干活的。谷歌这帮人呢，就是一帮直男工程师，他们就把这东西写成命令行了。</p>



<p class="wp-block-paragraph">最后看怎么退出：quit/，quit 是退出。这个很重要，就是你实在不会使，你还能退得出去才行。首先是要求你登录，因为你想 Gemini 进来以后，你只要用嘛，他就必须要有地儿给你出 TOKEN。那你不登录的话，知道出谁的 TOKEN？虽然谷歌说我免费给大家一大堆 TOKEN，免费给大家一大堆的调用次数，但是呢，你还是要有 TOKEN 出来。</p>



<p class="wp-block-paragraph">三种方式：一个是 login，直接用谷歌账号登录，你登录你的 Gmail 邮箱账号就可以了；第二个呢是在 AI&nbsp;<a rel="noreferrer noopener" href="https://studio.google.com/" target="_blank">studio.Google.com</a>&nbsp;里面是申请 Gmail API key，这个也是可以的；或者是用谷歌云的 AI 登录都可以。但是注意，最好不要用 Workspace 邮箱登录。什么意思？我有的时候是用自己的域名绑定的谷歌，这个也可以登录，但是相对来说要麻烦一点。你如果是 Gmail 直接结尾的这个邮箱去登录的话，是比较容易的。</p>



<p class="wp-block-paragraph">所以，建议大家用这个方式去登录。登录完了以后，你就可以去干活了。</p>



<p class="wp-block-paragraph">北京天气怎么样？因为里头有MCP，它可以搜索，可以做很多的本地动作，所以它就可以去搜索北京天气了。阴转雷阵雨，多少度？大概就是这样的一个情况。</p>



<p class="wp-block-paragraph">好，我们就开始向它提要求吧。首先，我们要写一个提示词给它：“给我生成一个可以执行的Ruby文件吧。”输入一个TNG文件，一个MP4文件。先将PNG文件转换成JPG，因为转live photo是必须要JPG的文件。但是，我们从Midjourney下载的这个图片都是PNG的，所以要先转换一次。然后再将JPG和MP4合成成PVT iPhone的live photo文件。</p>



<p class="wp-block-paragraph">转换live photo make live的这个网址，扔给他说：“你照这样给我读，读完了以后就给我转去。”他就去干活去了。允许吗？咱们就都允许呗。他现在要开始往我们的这个里边去写代码了。</p>



<p class="wp-block-paragraph">你看，我写了这样的一个代码出来。好，让我们去看一下这个代码吧。它是使用的Mini Magic做的第一轮转换：-J，-V，-O。这一看就是错的，因为它的这个输入的参数是不对的。但是写程序嘛，它写错也是很正常的，待会我们来再去改吧。</p>



<p class="wp-block-paragraph">我让我们来看一下，这个makelive是怎么调用的。makelive -m.a.JPG a.MP4 -p后会生成a.PVT。修改调用方法，分析一下命令行参数，然后重新构造命令行，去干活去了。如果不是谷歌给的免费的额度，我感觉这一会好多钱就出去了。写程序是非常非常费TOKEN的。</p>



<p class="wp-block-paragraph">它已经生成好了。下一件事的话，我们就要用这个东西了。用之前，先把刚才咱们下载的一大堆的文件给它拷下来。这个里头就是有MP4、PNG一一对应的。我们来执行一下试试：live photo1.PNG 1.MP4。这个还不行，应该是chmod加x。</p>



<p class="wp-block-paragraph">我们现在得到了一个1.pvt的文件。我们再来一次：photo create 2.png 2.mp4。你看，这个2.PVT也有了。让我们来看看这个PVT文件能不能使。</p>



<p class="wp-block-paragraph">代码，大家刚才看了一个字我都没敲，只是提了些要求。当然，我在中间还是看了一些这个代码的，我提了一些问题。你说我这个没有能力自己搞定？建议大家还是稍微看一点文档。这个不需要大家的编程能力，但是你稍微看一下文档，做一点点阅读理解的能力还是需要的。</p>



<p class="wp-block-paragraph">我们来看一下，这是我们的目录。这是刚才我们写的这个Ruby文件。一是我们的大蜗牛，这是图片。</p>



<p class="wp-block-paragraph">这是我们的MP4的视频，那这下头有一个小字叫“实况”。这是一个PVT照片了。然后，2这个是视频，这是图片。减肥成功的老范拎着箱子出去玩去了。然后PVT，这就是我们已经做好了。做好了以后，这个文件怎么办呢？如果你使用iPhone的话，把这俩文件呀复制到iCloud目录里。然后呢，拿出我们的iPhone，在这个iCloud里，你就可以找到这两个PVT文件。点中文件以后呢，说“保存到图片”，它就给你保存到相册里去了。我们再用小红书，再用微信，就可以分享这些PVT的动图了。这个就是形成了一个完整的闭环。</p>



<p class="wp-block-paragraph">好，演示结束。总结一下，Midjourney video呢，绝对是一个惊艳的产品。之所以见光死，是因为大家没有找到正确的使用方法。今天呢，跟大家介绍它正确的使用方法。Midjourney video给大家生成的从来不是视频，而是动图。我们把Midjourney video生成的MP4重新转换成live photo，然后把它分享到小红书，分享到各种支持live photo的平台上去，效果是很好的。大疆的手机软件就支持。我们把大疆上拍摄的各种视频都转live photo，这个还是帮大疆提升了很大一波的销售的。大家买了大疆设备以后，拍了一堆live photo，然后四处跑到小红书，跑到微信里边去分享，还是玩的很开心的一个事情。现在我们有Midjourney了，也可以很开心的玩耍起来。</p>



<p class="wp-block-paragraph">好，这个故事呢，就跟大家讲到这里。最后请大家一起去做一些有意思的动图，把我们的情感，把我们的情绪传递出去。大家一起来玩耍。好，这个故事就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径</title>
		<link>https://lukefan.com/2025/04/18/gpt-3%e4%b8%8eo4-mini%e4%b8%8d%e5%86%8d%e9%ab%98%e5%86%b7%ef%bc%9a%e8%9e%8d%e5%90%88%e5%b7%a5%e5%85%b7%e8%b0%83%e7%94%a8%e3%80%81%e8%ae%b0%e5%bf%86%e4%b8%8e%e8%b6%85%e5%bc%ba%e5%9b%be%e5%83%8f/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Fri, 18 Apr 2025 00:50:27 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI局限性]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI易用性]]></category>
		<category><![CDATA[AI普及]]></category>
		<category><![CDATA[AI未来]]></category>
		<category><![CDATA[AI模型发布]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[AI视觉]]></category>
		<category><![CDATA[AI记忆 (Memory)]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[API]]></category>
		<category><![CDATA[API代理 (Open Router)]]></category>
		<category><![CDATA[API定价]]></category>
		<category><![CDATA[ChatGPT Plus]]></category>
		<category><![CDATA[Function Calling]]></category>
		<category><![CDATA[Github Copilot]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[GPT-5展望]]></category>
		<category><![CDATA[Greg Brockman]]></category>
		<category><![CDATA[IDE集成]]></category>
		<category><![CDATA[Mark Chen]]></category>
		<category><![CDATA[Meta data分析]]></category>
		<category><![CDATA[O3]]></category>
		<category><![CDATA[O4 mini]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Sam Altman]]></category>
		<category><![CDATA[Scaling law]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[TikTok直播带货话题生成]]></category>
		<category><![CDATA[YouTube话题推荐]]></category>
		<category><![CDATA[一站式AI服务 (Total Solution)]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[内容创作]]></category>
		<category><![CDATA[图片推理 (Image Reasoning)]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[实时交互]]></category>
		<category><![CDATA[实用AI]]></category>
		<category><![CDATA[工具调用 (Tool Calling)]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[推理模型]]></category>
		<category><![CDATA[搜索集成]]></category>
		<category><![CDATA[模型对比 (OpenAI vs 竞品)]]></category>
		<category><![CDATA[潭柘寺图片识别]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[跨模态AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2110</guid>

					<description><![CDATA[家！人！们！炸！了！啊！🔥
今天手抖更新了ChatGPT Plus差点把手机摔了！原来被嘲"科学家玩具"的GPT-4O直接变身打工神器了！！

重点来了（拍桌）：
1️⃣ 工具调用直接封神！！！
现在让它写脚本会自己搜资料！上次问"TikTok带货新政策"，它当场扒出20+外网报道！最绝的是...
✨自动生成带数据+案例的完整提纲！！
✨还能记住我的写作风格！！！
（本博主当场失业预警😱）

2️⃣ 图片推理原地升天！！！
拿无人机拍的潭柘寺照片甩给它
直接识别出：
✅ 现代停车场
✅ 隐藏的通信塔
✅ 连台阶材质都分析！
（本路痴狂喜！以后旅游带AI就行）

3️⃣ 记忆功能太会了！！
现在每次对话都像老友重逢
上次说喜欢用"绝绝子"
这次生成文案自动带梗！！
（AI比男朋友记性还好怎么回事）

重点提醒‼️
免费用户用不了！Plus每周50次根本不够玩！
建议直接上200刀Pro版
（别问 问就是刚刷爆信用卡💸）

最后说句扎心的：
现在不用AI的博主真的会凉！！
赶紧去更新！晚1小时都是损失！！
（别等被卷死了来我评论区哭！）



GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。

OpenAI最新发布GPT-3与O4 mini，标志着AI不再仅仅是高深莫测的科研工具。本次更新核心亮点在于工具调用（Function Call）能力大幅提升，结合记忆功能，AI能更懂用户、调用外部数据完成复杂任务，告别空泛编造。另一大突破是强大的图像推理能力，实测分析潭柘寺照片展现惊人细节理解。老范详细解读了新模型的实用性，分析了免费用户、Plus用户（月付20美金，有限制）、Pro用户（月付200美金，无限量）及API（O3与O4 mini成本差异显著）的可访问性与价格。同时，GitHub Copilot用户可通过年费会员在IDE中便捷使用O4 mini。此次发布体现了OpenAI整合强化学习成果与各项功能的战略，未来GPT-5与Sora（世界模型）更值期待。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。" width="900" height="506" src="https://www.youtube.com/embed/ICUcxoOyJPo?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT-3和O4 mini发布了，这次绝不再仅仅是科学家们的玩具了。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">本来GPT-3和O4 mini发布呢，我并没有抱太大的期望。为什么呢？因为前面O1和O3 mini发布的时候呢，看得我头晕眼花的。我记得应该是在去年12天连续发布会的时候发布的O3 mini，实在是太不明觉厉了。各种的复杂科学问题，咔咔就给解决了，然后各种的排名都排得很高。但是呢，我自己其实并不怎么用。</p>



<p class="wp-block-paragraph">为什么呢？第一个，ChatGPT Plus用户里边呢，它是有用量限制的，并不是随便让你用的。所以在有用量限制的情况下，你就得省着用，而且你也感觉不出有太大差异来。你说你用它干嘛？据说编程很强，但是它没法跟IDE结合，基本上也就放弃了。你是可以出一大堆的代码，但是你还得向IDE里边去考来考去的，很麻烦。那你说我通过API调用吧，直接使用O1和O3 mini这些模型，实在是贵，所以就放弃了。</p>



<span id="more-2110"></span>



<p class="wp-block-paragraph">这一次呢，真的就不一样了。首先是Greg重新上线了。Greg其实好长时间不怎么出来了，他是在2023年11月份山姆·奥特曼宫变之后，就变得非常低调。2023年11月开始休假，后来是在微软的强烈要求下才回归的。到2024年又开始了长期休假，但是在大量高管离职之后，年底再次回归，还宣布：“我提前俩月回来了，我本来还想再多歇一歇的。”现在呢，主要负责机器人业务，不再担任董事会主席了，保留了总裁的职位。</p>



<p class="wp-block-paragraph">Greg上来开始显得有一些紧张，不知道该说什么。大家可以去看看那25分钟的发布会录像，后面逐渐放松了，也是长时间不露面、不说话的一个表现吧。这一次的话，全程C位，坐在最中间的位置上，主持O3和O4 mini的发布会，可见重视程度了。</p>



<p class="wp-block-paragraph">这一次的发布会呢，基本上是二对二的分配，就是两个老板配上两个做事情的。两个老板始终坐着不动，做事情的人呢，就是讲到不同的部分，然后来换。还有一个老板呢，叫Mark陈，首席研究官，亚洲脸，但不确定是不是华人。有传闻其父母是从台湾去的美国。现在呢，有一种ABC脸，看起来有点像华人，但是脸型又不像。这个据说呢，是长期英文发音和美式的饮食习惯，以及美国教育所形成的一种脸型，反正跟华人还是有一定区别的。有可能是个华人，当然也有可能是个越南人，这个不确定。</p>



<p class="wp-block-paragraph">另外两个呢，是根据演示的过程不同，不停地换工程师。国内引用的照片呢，肯定是有偏向性的。国内各媒体呢……</p>



<p class="wp-block-paragraph">通常引用的是讲到模型强化训练和各种跑分的这两位工程师。为什么呢？因为里头有一个叫周文达的，是一位华人。国内各个媒体引用照片的时候，一般会引用含华量比较高的照片。</p>



<p class="wp-block-paragraph">一开始呢，也是讲科学，什么量子力学。本来我也挺失望的。科学的部分呢，对于我这种普通人来说，已经没有那么大关系了——看不懂，没需求，也用不起。所以一看，还是这东西，好像没什么意思。</p>



<p class="wp-block-paragraph">但是讲到后边呢，越来越兴奋了。咱们讲几个好玩的特性，并不跟大家完整的去复述这个发布会了。有兴趣可以去看这个25分钟的发布会，各种数值绝对是遥遥领先。</p>



<p class="wp-block-paragraph">OpenAI呢，作为行业老大，他是有自觉的。什么叫自觉？从来不跟别人比数值，只跟自己比。就是他不会说我把Gemini 2.5拎出来比一比，Claude 3.7拎出来比一比，或者跟DeepSeek比一比。别人都是说我比OpenAI强在哪，或者我已经接近OpenAI了。OpenAI永远说我就跟自己比。</p>



<p class="wp-block-paragraph">所以我们现在可以看到的所有的数值比较，都是跟GPT O1、O1 mini、O3 mini跟这些模型进行比较的，没有跟其他模型比较的数据。</p>



<p class="wp-block-paragraph">咱们来讲三个有趣的功能点吧。</p>



<p class="wp-block-paragraph">第一个非常有趣的功能点，也是让我觉得GPT O3和O4mini真的能用了的一个最核心的点，就是它可以进行工具调用了。什么意思？我们正常情况下一个大模型，你让他去给你生成内容的时候，他其实都是在胡说八道的。就算他有的时候说的很像，但他依然是在胡说八道，是在编。他不能保证内容是可验证的，而且你每一次让他说同样的事情，他都给你编出不同的花样来。</p>



<p class="wp-block-paragraph">那么一定要带上搜索，带上知识库，带上其他的辅助工具，他才可以靠谱的干活。现在推理模型已经可以靠谱的干活了。所以O3跟O4mini是可以进行工具调用的。但是他们绝对不是第一个。在发布会上他们讲说，我们是第一个在推理里边进行工具调用的，这个真的不是。GROK3也是推理模型，也是可以做各种工具调用的。</p>



<p class="wp-block-paragraph">只是呢，GPT O3跟O4 mini呢，据说在工具调用上要有极大的提升，因为他们在这块专门做了训练。他可以进行几十次的这种工具调用。当你让他去做一个很复杂的事情的时候，他会反复的在他认为需要的时候去调用工具，获得外部数据，或者做一些相应的操作。这个很棒。</p>



<p class="wp-block-paragraph">O3跟O4mini呢，是在推理的过程中去调用工具，效果绝对是碾压原来不能使用工具的O1，效果好的一塌糊涂。推理模型如果不挂搜索引擎……</p>



<p class="wp-block-paragraph">不挂知识库，基本上就是胡说八道。他要比正常的生成模型还要再胡说八道一些，因为他想的多，越想就越错。知识越多越反动，这个幻觉是非常非常严重的。挂上搜索之后，基本上不再需要 deep research 这种东西了。现在你用 O3 去挂搜索，跟 deep research 的效果基本上是可以平齐的。</p>



<p class="wp-block-paragraph">现在呢，OpenAI 内部有很多的工具，包括 Python 执行、调用浏览器、搜索，有很多这样的工具，它都可以自动的去调用。当有这些功能之后，每一个普通人，不需要是科学家，也可以用 O3 跟 O4mini 完成很多任务了。只是目前呢，OpenAI 内部的这些工具，你通过外部你使不了。还有 function call 这个调用呢，现在在代理站上还没有接上，这个还要再等一等。什么意思？就是你直接挂 OpenAI 的 API，挂它原厂的，是可以进行 function call 的，可以把你自己的各种各样的工具放在里边让它去调用。原来我们演示过使用高德地图的工具，让他去找饭馆、规划路线什么的，这个都是可以去使用了。如果我们使用 API 来调用 O3 和 O4mini 的话，OpenAI 内部的什么搜索呀，这些工具我们是无法使用的，就差在这了。这是一个比较有趣的点，但是具体怎么用，待会我们来举一个案例。</p>



<p class="wp-block-paragraph">第二个有趣的点是什么呢？就是跟记忆相结合了。原来我们专门录了一期视频来讲 OpenAI 有了记忆功能，现在它也有记忆功能。于是我就向它提出了要求，我说：“根据你对我的了解，我是个 Youtuber，给我推荐一些适合我的 YouTube 话题，我要去写稿去了。”然后他就开始去搜索，调用搜索工具去搜索去了。搜索完了以后说：“我发现你是专门讲 AI、讲科技、讲流量、讲创投的博主，我发现有哪些哪些话题最近是最新的，适合你去讲。”其中有一个话题呢，叫 TikTok 降低了海外直播带货门槛。原来呢是要 1,000 个粉丝才可以带货，现在 200 粉丝就可以带货了，说这个你看怎么样？我说这个不错。我说：“你根据你对我的了解，给我去写个提纲吧。”然后他就按照我的习惯，给我夸夸把提纲列好了，说 TikTok 是哪天哪天发了一个什么样的文儿，为什么什么东西，写的还很好的一个提纲。在这个过程中引用了我的记忆，调用了搜索，聚集了大量的信息。我再说：“那你再给我补充点数据和观点吧。”一般我是会有一个自己的观点，我说：“我的观点是什么什么，你给我补充进去。”然后呢，我为了论证我的观点。</p>



<p class="wp-block-paragraph">我还需要哪些数据？然后，夸夸夸又去搜索，搜索完了给我补充进来。做了两次补充以后，这个提纲基本上就完成了，就完完全全可以用了。过几天咱们去讲这个“TikTok降低海外直播带货门槛”这个故事吧，这个还是很有趣的一个点。所以现在真的是每个人都能用上了。</p>



<p class="wp-block-paragraph">第三个比较好玩的点是什么呢？就是图片推理。这个图片推理是非常非常强的一个点，绝对不是识别图片，然后将文字作为提示词去推理。我们很多人一看图片推理这件事，都是想的说，我们把这个图片识别一下，变成一大堆文字。不是这样。</p>



<p class="wp-block-paragraph">跟大家举一个案例吧。我今天去潭柘寺了，玩我的无人机。拿我的无人机呢，在潭柘寺的外面，拍了一张俯瞰潭柘寺的全景照片。我就问O3，我说这是哪？这个建筑群的布局是什么样的呀？这个提示词就这样的。问完了以后呢，这个O3就去干活去了。他把这个图片先整个的分析一下，然后呢，放大每一块切割，说这一小块是什么，那一小块什么，把它切成一块一块的。然后对每一块进行识别，而且在切完了以后，还对每一块去调整方向，说这块好像你拍歪了，改一个方向，可能更能认出是什么来。通过这样的一个方式去推理，看那个推理过程，惊讶的我目瞪口呆，我告诉你。</p>



<figure class="wp-block-image size-large"><img decoding="async" src="https://yt3.ggpht.com/V8YuR81dkoI4c4XrT_1NNc3OC-nnED98ttqo20HUVhT0uffz8E-yZymr54jlkHtR8gnfCSkxbGOS7Q=s1600-rw-nd-v1" alt=""/></figure>



<p class="wp-block-paragraph">最后告诉我说什么？从这张航拍来看，这是一张典型的依山就势、三层台地式布局的北方佛寺，很像北京西山脚下的潭柘寺。我没有告诉O3这是航拍照片，他就全都认出来了，好聪明。但是注意不要被骗了，照片里面是有Meta data的，就是有一些基础信息的。这个信息包括什么？拍摄时间、分辨率、色彩、空间、光圈、快门、白平衡，都在里头。还有拍摄设备那个里头，写着你是用大疆的什么设备拍的，大疆air 3S。然后呢，这个照片里还写着经纬度，因为大疆的无人机里头是有GPS的，它拍完照片是会把经纬度直接写在照片里的。完完全全可以通过这些Meta data就编出来的。</p>



<p class="wp-block-paragraph">所以呢，这个到底是真聪明还是假聪明？还是说我把经纬度拎出来，把这个拍摄设备拎出来，就直接搜索一下，就给你出结果了？这个我们要往下看。他呢还给我接着讲，说这个图片是中轴对称的三进院。第一进呢叫山门到天王殿，第二进呢是天王殿到大雄宝殿，第三进呢是大雄宝殿到法华殿和藏经阁。中轴线两侧各有回廊和配殿，比如观音殿、药师殿、僧房、斋堂，左右分布对称，也有现代化的客房和管理用房。</p>



<p class="wp-block-paragraph">再往后还写了一个特别有趣的东西：底层的停车场与服务中心，通过台阶与甬道与寺内各层相连。右侧的通讯塔，现代建筑。</p>



<p class="wp-block-paragraph">为后期补建的配套设施，这是不是根据潭柘寺的信息搜索出来的呢？这就是我们要去问的。他到底是真聪明还是假聪明？</p>



<p class="wp-block-paragraph">潭柘寺最后的一进大殿不叫藏经阁，而是叫毗卢殿。应该是五方佛中间一个，然后后边是东方、西方、南方、北方，一共是五个佛在里面，所以不一样。但是中国寺庙的默认布局呢，最后一层是藏经阁。所以这个并不是直接搜索出来的。如果直接搜潭柘寺的话，他应该写最后一层是毗卢阁。</p>



<p class="wp-block-paragraph">至于底层的停车场、服务中心、现代通信塔，绝对是图片推理推出来的。因为不会有哪个介绍潭柘寺的网页去把这些东西都给你写在里头，所以还是非常棒的，可以进行图片推理。</p>



<p class="wp-block-paragraph">有了这些有趣的功能之后，咱们可以通过什么样的方式来使用它呢？现在免费用户无法使用。你说我不愿意交钱，那么O3跟O4mini你使不了。Plus用户，像我这样的一个月20美金的用户，是可以使用的，但是有限制。O3每周50次，我今天大概已经使了有五六次了。O4 mini呢是每天150次，这个应该足够使。如果是每个月200美金的Pro用户，无限量使用。</p>



<p class="wp-block-paragraph">API依然很昂贵。使用它的API，我可能还要稍微掂量掂量。O3每100万TOKEN的输入是10美金，输出是40美金。O4mini要快一些，也要小一些，它呢每100万TOKEN的输入是1.1美金，输出是4.4美金。应该比在美国部署的DeepSeek R1相差仿佛吧，就是基本上还是可以用的。</p>



<p class="wp-block-paragraph">这种推理模型呢都是话痨模型，价格还是挺贵的。特别是10美金100万TOKEN输入，40美金100万TOKEN输出，这个非常非常昂贵。再结合上工具调用，图片推理，这个价格就像坐在日本的出租车里，看着计价器跳的那叫一个心惊肉跳。</p>



<p class="wp-block-paragraph">其他的一些代理，就是这种API代理也已经开始工作了。Open Router或者其他的一些代理都可以使用，价格是相同的。只是呢，目前function call还没接上。为什么要专门强调这个？因为有些人在国内充值OpenAI的API是比较费劲的，像我就是这样。所以我使用OpenAI的API都是通过各种的代理去使用的。</p>



<p class="wp-block-paragraph">还有一些什么方式可以使用的呢？GitHub Copilot里头是有GPT4 O4 mini的，但是没有GPT O3。它只有这些mini模型，它有O1，但是没有O3上来。O4 mini的话，应该是可以大范围使用的，但是前提你还是付费的。</p>



<p class="wp-block-paragraph">像我是Github Copilot，99美元一年的会员。所以呢，我现在可以在IDE里边去使用它，Client和Roo Code也可以通过Github Copilot的会员直接去使用GPT-4 mini。那你说Client或者是Roo Code，我自己挂OpenAI的API或者是Open Router的API行不行？没毛病，都可以使，但是你得按TOKEN付费，那个很贵。挂Github Copilot下面的GPT-4 mini的模型的话，你有那个99刀一年的年费，就可以放心的玩耍了。</p>



<p class="wp-block-paragraph">总结一下，OpenAI现在前进的方向到底是什么样的？它呢正在将各种零散的功能点聚集在一起。其实记忆早就有了，function call早就有了，推理早就有了。他一方面呢，是在拼命的去做强化学习，然后告诉大家现在强化学习scaling law依然管用。你把更多的数据、更多的算力堆进去，强化学习的效果就能起来，没有任何问题，大家好好去买英伟达显卡。另外一方面，它就把各种其他的小功能给你凑起来了，包括记忆、function call、推理、搜索呀，把这些东西给你搁在一块，你看真的好用。</p>



<p class="wp-block-paragraph">其他各大模型厂商呢，在某些方面可以接近甚至赶超OpenAI，但是综合实力上，OpenAI绝对还是领先的。当OpenAI把各种新功能聚合在一起的时候，绝对是遥遥领先。它在每一个细节点上，可能都会比别人强很多。就像咱们前几天讲过GPT-4O的绘图功能，它虽然说在完整的绘图过程中，它表现力上、艺术感上没有Midjourney强，但是呢，它在文字理解上、文字渲染上，肯定是要比其他所有的这些绘图模型都要强很多的。</p>



<p class="wp-block-paragraph">GPT-5现在正在路上了，甭管是今年下半年能出来，还是什么时候能出来，我觉得都是值得期待的。到那个时候就不用再去选模型了，你上来以后，他就根据你的问题直接推荐，直接给你反馈了，说我这个应该推理还是不应该推理，应该使用更大的模型还是使用小一些的模型，我应该调用哪些工具，应不应该搜索。这个我觉得还是值得期待的，就像以前我们总讲的，叫total solution，一站式服务。你进来了以后，我给你服务好就完了，至于我到底给你上了几个工具、几个模型，你就甭问了，最后是包你满意。</p>



<p class="wp-block-paragraph">后边还有Sora，还是有念想。虽然Sora前面翻车了，现在大家都已经把它忘掉了，但是当它把这么多的功能聚集在一起的时候。</p>



<p class="wp-block-paragraph">什么搜索呀、工具呀、推理，把这些东西跟Sora聚集在一起的时候，可能又会变出一些新的、不一样的东西出来。</p>



<p class="wp-block-paragraph">Sora当年可是号称叫“世界模型”的。当它跟我们真实世界通过搜索引擎连接在一起的时候，那可能真的就要创造世界了。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？</title>
		<link>https://lukefan.com/2025/04/16/%e9%9c%87%e6%92%bc%e5%8f%91%e5%b8%83%ef%bc%81gpt-4-1%ef%bc%8c%e7%89%9b%e9%a9%ac%e7%9a%84%e6%96%b0%e5%b7%a5%e5%85%b7%e6%9d%a5%e4%ba%86%ef%bc%8c%e4%b8%93%e4%b8%ba%e7%a8%8b%e5%ba%8f%e5%91%98%e6%89%93/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 16 Apr 2025 00:52:31 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[100万Token上下文]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI agent开发]]></category>
		<category><![CDATA[AI工具更新]]></category>
		<category><![CDATA[AI市场竞争]]></category>
		<category><![CDATA[AI成本优化]]></category>
		<category><![CDATA[AI技术更新]]></category>
		<category><![CDATA[AI模型对比]]></category>
		<category><![CDATA[API发布]]></category>
		<category><![CDATA[API调用]]></category>
		<category><![CDATA[B端市场]]></category>
		<category><![CDATA[Claude 3.5]]></category>
		<category><![CDATA[Claude 3.7]]></category>
		<category><![CDATA[C端用户]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Deepseek V3]]></category>
		<category><![CDATA[Gemini 2.0]]></category>
		<category><![CDATA[Gemini Pro 2.5]]></category>
		<category><![CDATA[GPT-4.1]]></category>
		<category><![CDATA[GPT-4.1评测]]></category>
		<category><![CDATA[Grok 3 mini]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI战略]]></category>
		<category><![CDATA[RAG (检索增强生成)]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[价格便宜]]></category>
		<category><![CDATA[低成本AI]]></category>
		<category><![CDATA[可控性强]]></category>
		<category><![CDATA[多模态AI]]></category>
		<category><![CDATA[多版本 (Standard/Mini/Nano)]]></category>
		<category><![CDATA[大海捞针测试]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[实时AI (Realtime AI)]]></category>
		<category><![CDATA[工程应用]]></category>
		<category><![CDATA[工程需求]]></category>
		<category><![CDATA[开发者API]]></category>
		<category><![CDATA[开发者福音]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[技术发展趋势]]></category>
		<category><![CDATA[技术解读]]></category>
		<category><![CDATA[技术选型]]></category>
		<category><![CDATA[指令遵循度高]]></category>
		<category><![CDATA[推理能力]]></category>
		<category><![CDATA[模型评测]]></category>
		<category><![CDATA[牛马工具 (程序员自嘲)]]></category>
		<category><![CDATA[程序员工具]]></category>
		<category><![CDATA[稳定性好]]></category>
		<category><![CDATA[编程能力提升]]></category>
		<category><![CDATA[观点分享]]></category>
		<category><![CDATA[视频理解能力]]></category>
		<category><![CDATA[速度快]]></category>
		<category><![CDATA[长上下文处理]]></category>
		<category><![CDATA[高性价比]]></category>
		<category><![CDATA[高效AI模型]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2104</guid>

					<description><![CDATA[**不允许有人不知道！牛马程序员续命神器GPT4.1杀疯了！**

家人们谁懂啊！！OpenAI这次真的把程序员当亲爹宠了！！💥
新出的GPT4.1简直是把「便宜大碗+指哪打哪」刻进DNA！！程序员看完直接跪着喊爸爸！！

**🔥 炸裂亮点速看：**
1️⃣ **100万TOKEN白给价！！**
扔100万字文档进去才花7毛钱！！（输入0.1刀/百万token）
什么会议纪要合同小说直接无脑塞！！不用分段不用切！！
打工人的本地知识库直接下岗！！

2️⃣ **指令依存度拉满！！**
程序员狂喜！！终于不用和AI斗智斗勇了！！
「标号必须用#1#2#3」「输出给我JSON格式」...
以前GPT4o像叛逆期儿子，现在GPT4.1秒变听话小奶狗！！🐶

3️⃣ **速度卷死同行！！**
Nano版回车一按秒出结果！！（虽然跑不过GROK3 mini但够用！）
搞什么RAG什么向量库？？直接暴力塞文档问就完事！！

4️⃣ **价格屠夫实锤！！**
输出100万token才0.4刀！！（DeepSeek看了连夜改价）
程序员薅羊毛姿势+1！！甲方爸爸需求改100遍也不心疼预算！！

**🤯 普通人和程序员的区别：**
普通人：要AI写诗写歌风花雪月！
程序员：AI你给我老实当工具人！！
而GPT4.1！！就是程序员梦中的牛马！！拉磨快还不吃草！！

**🚨 紧急通知：**
搞副业的！做知识库的！玩Agent的！现在立刻马上调API！！
我已经玩了一上午！！会议纪要总结比实习生快10倍！！（实习生：？？）

⚠️注意：非程序员用不上网页版！！这是API玩家的狂欢！！
但！你们马上会用到基于4.1开发的超便宜APP！！（资本家狂喜）

**👉 最后说句大实话：**
OpenAI这次被Gemini/Claude逼疯了吧？？
但...卷死同行造福百姓的事儿请多来点！！程序员集体起立鼓掌！！👏👏

**#AI神器 #打工人自救 #程序员福音 #OpenAI杀疯了**

震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？

OpenAI突发**GPT-4.1**，这款并非面向普通用户的**大模型**更新，而是专为**程序员**和**开发者**通过**API**设计的强大工具。其核心亮点包括惊人的**100万TOKEN上下文窗口**，显著提升的**指令依存度**与**稳定性**，以及极具竞争力的**价格**——特别是**Nano版**和**Mini版**，成本极低且**速度**飞快，堪称“**牛马**”程序员的福音。**GPT-4.1**旨在满足**工程市场**对**可控性**和效率的需求，虽然**编程能力**相较于**Gemini**或**Claude 3.7**仍有提升空间，但在处理大规模文档（强大的“**大海捞针**”能力）和无字幕**多模态视频理解**方面表现突出。面对来自**DeepSeek**、**Grok**等对手在价格、速度、特定能力上的挑战，**OpenAI**此举意在稳固并夺回**API**市场份额，为**AIGC应用开发**和构建**AI Agent**提供了更具性价比和稳定性的新选择，预示着更高效、廉价的AI工具将加速落地。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="震撼发布！GPT-4.1，牛马的新工具来了，专为程序员打造百万Token上下文API利器，超低价与高指令遵从度能否颠覆Gemini与Claude主导的工程市场格局？" width="900" height="506" src="https://www.youtube.com/embed/xWY-HIosMsM?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT4.1发布了！牛马们的好工具终于上线了。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">GPT4.1突然发布，这是程序员们的工具。普通的用户你是用不上的。你用网页版，你用APP，甭管是手机端的还是电脑端的，你是付费用户还是免费用户，你都用不到GPT4.1。只有程序员可以通过API调用GPT4.1。</p>



<p class="wp-block-paragraph">但是这个事儿对于非程序员来说，也是有很大改变，很大帮助的。那么我们今天来讲一讲，GPT4.1到底是一个什么样的东西。</p>



<p class="wp-block-paragraph">首先，它有100万TOKEN的上下文，这个是非常吓人。100万单词吧，基本上你可以直接塞到GPT4.1里头去，它统一给你处理。而且大海捞针做的也很不错。</p>



<span id="more-2104"></span>



<p class="wp-block-paragraph">什么叫大海捞针？就是比如说你找一个100万字以内的小说，你直接扔进去，然后呢，在里面稍微插几句。比如说OpenAI干什么了，山姆奥特曼干什么了，甭管在文章的任何地方，你稍微插几句，然后你提相关的问题，它能给你找出来。这个玩意叫大海捞针。</p>



<p class="wp-block-paragraph">很多的模型都需要做类似这种测试。为什么呢？就是说我一次给了你一大堆上下文以后，你是不是通盘考虑了？不会说把其中的一部分扔掉了，或者说我看看开头看看结尾，就告诉你是怎么回事了，不会干这个事。所以GPT4.1的100万TOKEN还是非常强的，绝大部分场景直接可以应对了。</p>



<p class="wp-block-paragraph">但是现在还不是最强的。现在Gemini Pro 2.5是可以走200万TOKEN的，Gemini Pro 2.0也是可以有100万TOKEN的。但是在其他的模型就没有了，可能也就是64K（64,000 TOKEN），也有一些是128K（128,000 TOKEN）。但是到100万TOKEN的其实还是比较少的。</p>



<p class="wp-block-paragraph">指令依存度非常的高。什么叫指令依存度？就是你让它干嘛，它就给你干什么，不会说每一次出来的都是惊吓惊喜。你让他去找什么什么样的文章，找什么样的信息，做什么样的排序，按照什么格式输出，他都会非常非常认真的按照你的要求去把它做好。</p>



<p class="wp-block-paragraph">编程能力有了非常大的提升，但是依然比不过Gemini 2.5 Pro，也比不过Claude 3.7。它的编程能力只是在原来GPT4O的基础上有了很大的提升。</p>



<p class="wp-block-paragraph">标准版、mini版和Nano版，分了三个版本。为什么要分这么三个版本？速度飞快。当然现在速度最快的不是它，现在速度最快的是Grok 3 mini。这个版本是所有程序员能够使用到API里头速度最快的，原因也很简单。</p>



<p class="wp-block-paragraph">用的人不多，模型又小，而且后边是马首富。家里头穷的光剩卡了，所以那东西跑的飞快飞快的。我前面有一个项目拿这玩意做，一个回车下去，夸夸夸那个刷的那个字你都看不过来。</p>



<p class="wp-block-paragraph">价格非常便宜，GPT4.1，特别是这个Nano的版本，100万TOKEN的输入只需要0.1美金，换人民币7毛多钱，就可以输入100万TOKEN了。输出的话是0.4美金100万TOKEN输出，是目前大家能够用到的所有付费模型里头最便宜的一个，没有比它更便宜的了。就算是GROK3 mini，大概也要到0.3美金100万TOKEN的输入。</p>



<p class="wp-block-paragraph">那么牛马们工具终于更新了，要好好去干活了。程序员们对大模型的要求，其实跟普通人还是有一些差别的。普通人呢说我要跟他聊天，他要显得聪明一点，要给我写的不像AI，要给我有很好的创造力，这个是普通人的要求。</p>



<p class="wp-block-paragraph">但是程序员呢，通常要求的叫指令依存度、可控性，在这两方面要求是非常高的。因为既然是程序员，我们只是让大模型成为我们整个程序中的一个模块。我们要求的是输入，然后按照一个统一的逻辑，有一个可以预期的输出，这个是程序员想干的。就是真正那些才华横溢，不太听招呼的不是好牛马哈，所以一定是要让干嘛就干嘛的这种。</p>



<p class="wp-block-paragraph">工程方面呢对于大模型的要求，跟普通人也是有一定差异的。为什么呢？普通人说你这个模型越大越好，越聪明越好。但是对于工程上来说，在满足预期的情况下，尽可能的降低成本，提高效率，提升一致性跟稳定性。在可以接受的成本下，获得可预期的结果，我给了一分钱还是给了两分钱，我就要这个结果出来，这个是工程上的需要。</p>



<p class="wp-block-paragraph">GPT4.1呢，就像是牛马们突然得到了曲辕犁，这个也是中国古代的一个很著名的发明。有了这个农具以后，牛马犁地的这个效率就会极大提升。GBT4.1基本上就是这么个东西，价格便宜速度快。刚才我试了一下，至少Nano的版本，那个速度非常的快，虽然还没有GROK3 MINI那个快，但是已经很快了。</p>



<p class="wp-block-paragraph">MINI的版本效果也还是不错的。这三个版本里头，大家可以按照需求自己去选择和优化。你让他做很复杂的事情，你就是选用GPT4.1。稍微简单一些的事情，或者我不需要你去发挥创造力，我给你一堆的会议纪要，你给我总结归纳一下。或者说我去到本地知识库，检索完了东西以后，你给我总结一下，这种事情你用Nano版或者是用mini版足够了，这个效果非常非常的好。</p>



<p class="wp-block-paragraph">100万TOKEN的上下文。</p>



<p class="wp-block-paragraph">绝大部分场景都可以满足了。你都不需要去做本地知识库做RAG，你可以直接把文档啪一把都扔给他，说来给我看看怎么回事，不需要去做更复杂的分段了。指令依存度高，这件事是非常非常重要的。</p>



<p class="wp-block-paragraph">程序员最怕的是什么？叫指东打西，指南打北。像我原来使用GPT-4O的很多模型的时候，每一次输出的结果都不一样，这个让我很烦。我举一个例子吧，我让他给我的视频起标题，每一个标题后头有一个标号，但是呢，他每一次输出的都不一样。有的时候输出的是123，有的时候呢先要写一个引号，再写123，有的时候在前面给你写中文的123。这个就很烦，因为我到下一个环节去处理这个标题的时候，我需要去找到数字123打个点，然后后边是标题的这三行字，但我就找不到。经常是找着找着就出错了，因为我写程序的时候，必须是通过这个比较固定的格式去读取信息，经常会错。现在的话就不会出这种问题。</p>



<p class="wp-block-paragraph">程序员喜欢的是不需要太聪明，让往东绝不往西，让追狗绝不撵鸡。GPT-4.1就是这样的一个工具。OpenAI在这个时候呢，推出GPT-4.1也是无奈之举。这个老大真的很难当，为什么这么讲？因为AIGC呢是一个基础技术，OpenAI想把AIGC的整个的盘都占住，在里头当老大，这个是很难的。</p>



<p class="wp-block-paragraph">因为对于大模型的评判标准在快速的分裂。有的说我这个大模型创意最好，就像前面的GPT-4.5似的，我可以去生成各种各样的内容，而且你可以指定说给我按鲁迅那样说，他都可以做的很好。有些呢，是需要做可衡量的项目。什么叫可衡量的项目？就刚才那种创意项目是没法衡量的到底好不好，大家是要靠主观去评测的。可衡量的项目最简单的就是编程，你这个程序编的对不对，里头是不是有错误，是不是把上下文和所有的东西都考虑到了，这个叫可衡量项目。这块也是可以去评估的，谁的大模型编程最好，而且还有稳定性的要求，指令依存性的要求，这块也可以去评测。</p>



<p class="wp-block-paragraph">大模型还有推理能力的要求，这块你的推理能力够不够好，这也是一个新的维度了。包括速度和价格以及多模态，多模态包括理解和生成以及realtime。Realtime是什么？就是我实时的输入，实时的输出。现在谷歌也好，OpenAI也好，都可以去进行这种real time的回复。就是你拿着一个摄像头，对着人呢也好，对着外面也好，你说这是一什么东西，那是一什么东西，就像是一个真人一样跟他聊天，去打断他，它可以实时的根据摄像头拍到的东西。</p>



<p class="wp-block-paragraph">和听到的内容，给你进行回复。而且这个多模态还要去评估音频，还有是语音和音乐，还有图片，还有视频。我们要做这么多行业，这么多领域去进行评估。</p>



<p class="wp-block-paragraph">而这一次，GPT-4.1可以对没有字幕的视频进行理解和分析，而且它现在在这一块的得分是最高的。它比其他所有的这些Gemini也好，包括GPT自己早期的版本也好，都提升了非常多。</p>



<p class="wp-block-paragraph">GPT-4.5呢，算是一次失败的表演。就是前面先发了一个4.5出来，然后现在又发4.1。因为4.5这个东西其实是给这种Pro用户用的，就是你一个月交200美金以上可以用。后来呢，发现实在用的人很少，它又降低下来，一个月交20美金的人也可以用吧。</p>



<p class="wp-block-paragraph">现在我也可以用4.5，只是到目前为止我都没有用过。为什么呢？第一个，很贵。虽然我一个月交20美金，他让我用，但是这个效果对于我来说其实看不太出来。为什么呢？因为他的文学上，在他的很多这种创意上做的非常好，但是我是一个程序员，是个直男，他写的天花乱坠的东西，到我这看不出来，还真会有这样的问题。</p>



<p class="wp-block-paragraph">而且呢，4.5这东西还挺慢，这个也不是我喜欢的。所以到现在为止我没怎么用过，包括4.5的API我也没怎么调过，因为实在是贵。调API的话，你是要按TOKEN付钱的，不是说一个月交20美金就完事了。</p>



<p class="wp-block-paragraph">GPT-4.5在工程方面绝对是战五渣。为什么呢？就这个价格，就让工程师直接望而却步了，实在是玩不转。稳定性、指令依存度这一块的话，肯定也不怎么样。我看创意越好的东西，这个指令依存度和稳定性就越差。</p>



<p class="wp-block-paragraph">OpenAI现在在表演什么节目呢？叫“六大派围攻光明顶”。什么意思？就是在推理上被DeepSeek-R1摆了一道。并不是说OpenAI的推理做的不好，只是它原来呢，因为没有其他人竞争，所以它的推理是隐藏的，就整个的推理过程不给你看，只给你推理的结果。</p>



<p class="wp-block-paragraph">而DeepSeek-R1是上来我就把整个推理的结果原原本本拿出来给你看。很多人看了推理过程之后，我还受到了启发，我还发生了思维的碰撞，可以有一些新的想法出来。在这一块，真的是给OpenAI了一些教训。山姆·奥特曼现在自己出来也承认这件事，他说：“我们并不认为DeepSeek-R1真的有做的多好，但是呢，在这一点上，确实是我们原来没想到。”</p>



<p class="wp-block-paragraph">价格上呢，也被DeepSeek-R1和DeepSeek-V3摆了一道。这东西确实是便宜。这东西花多少钱训练的咱不管它，但是呢，因为它是完完全全开源免费，各个平台都在部署。</p>



<p class="wp-block-paragraph">所以呢，DeepSeek V3也好，DeepSeek R1也好，对于很多的第三方开放平台来说，它所提供的这个基本可用的功能是相当便宜的。但是现在，4.1的MINI和Nano的价格已经下来了，但是4.1标准版还是稍微有一些贵的，比4O要便宜。但是应对DeepSeek的V3和R1来说，还是稍微贵一些。</p>



<p class="wp-block-paragraph">在编程能力上呢，被Claude 3.5长期碾压。现在呢，还有Gemini 2.5 Pro和Claude 3.7。到目前为止，GPT 4.1在编程上的评分依然赶不上Gemini 2.5 Pro和Claude 3.7。在多模态生成这一块呢，视频，它的Sora基本上是废了，现在大家再也不想这事了。图片距离Midjourney还是有非常遥远的距离的，很难追赶。</p>



<p class="wp-block-paragraph">AI agent方向就是它的下一个大方向。现在面对Anthropic的MCP和Gemini，以及Grok给出的deep research或者deep search这些功能来说，现在还是需要去追赶的。因为它下一个GPT5的版本应该就是要追赶这一块了，所以真的是四面楚歌。</p>



<p class="wp-block-paragraph">除了这些之外，还有一大堆千问小模型在不停的跑冒滴漏，把各种各样零碎的用户需求都给实现掉了。为什么说一大堆呢？现在通过各种尺寸的千问模型微调出来的一个小模型，在Huggingface上大概有十几万种，所以这个是非常大批量的。</p>



<p class="wp-block-paragraph">现在的OpenAI呢，在个人用户这边那绝对是遥遥领先。从用户数量、使用时长，其他所有的AI助手加一块大概都赶不上它。但是在程序员和工程方面，已经被Claude、Gemini和DeepSeek给吃干抹净了。我自己应该已经有几个月没有再调用过OpenAI的API了，没必要。你效果又不好，价格还挺贵，还不快，我为什么要调你？</p>



<p class="wp-block-paragraph">所以我现在已经把自己的很多AI agent里头的大模型都换成Gemini，换成Grok，换成Claude和DeepSeek，都换成这些东西了。当然，我今天上午又把它很多换回4.1了，效果很好，好极了。</p>



<p class="wp-block-paragraph">现在GPT4.1呢，就是为了挽救工程市场，挽救API市场而诞生的。这个东西并不是给c端用户去用的。那你说4.1是不是牙膏呢？你看这数就知道了呀，人家不叫4.5，不叫4.6，不叫4.7，人家叫4.1，这个肯定还是一个小牙膏。它呢，在这个创意上，在模型更聪明这块做的一般，只是说这是一个比较老实的。</p>



<p class="wp-block-paragraph">指哪打哪的一个工程工具而已，这个还是很好用的。GPT5呢，估计后边还是要稍微难产一些。现在OpenAI也出来说了，我们低估了GPT5训练的困难，可能还需要再多等几个月，大家才可以看到GPT5。必须在这个时候先稳住局面，使用DeepSeek、Gemini、Claude以及MCP，其实已经可以做很多真正有用、有价值的商品了。</p>



<p class="wp-block-paragraph">如果OpenAI继续放任这个事情往前走的话，程序员们可能就会被这几种模型直接都抢走了，就不会再向OpenAI去迁移了。那么OpenAI就有可能会变成一个像苹果那样的纯C端公司，这个是OpenAI所不希望看到的。他作为AIGC行业的排头兵，他希望在所有的方方面面都领头，这是他现在会遇到的问题。</p>



<p class="wp-block-paragraph">OpenAI手里边的各种模型、技术和工程实践呢，肯定还是非常多的。我们现在看到的应该是冰山一角。OpenAI目前在做的事情是什么呢？如果没有人震动它，它可能还在那继续挤牙膏，继续在这晃荡。实际上2024年一整年，它就是这么个状态。但是到2025年，随着DeepSeek R1的出现，发现不行了，必须要冲出来，赶快把后院里头各种能跑能跳的东西都拎出来，稍微的包装一下，打扮打扮就直接上线了。</p>



<p class="wp-block-paragraph">所以现在我们看到，OpenAI的动作是非常多的。但是即使如此，每一次我们所看到的，依然是OpenAI内部技术的冰山一角。</p>



<p class="wp-block-paragraph">总结一下：如果不是程序员，GPT4.1跟大家呢，会有一些间接的关系，就是很多新的应用会出来。因为用GPT4.1做应用会更方便一些，而且这些应用呢，速度会更快，价格会更便宜，而且也会更稳定。如果是程序员，或者是说您虽然不是程序员，但是呢，想搞点Agent自己玩一下，那么4.1是一个非常非常有趣的小工具，赶快去玩起来。我已经玩了一上午了，非常非常有意思。</p>



<p class="wp-block-paragraph">好，这期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？</title>
		<link>https://lukefan.com/2024/12/25/openai%e7%94%a812%e5%a4%a9%e5%8f%91%e5%b8%83%e4%bc%9a%ef%bc%8c%e4%b8%ba%e4%b8%9a%e7%95%8c%e6%8c%87%e6%98%8e%e6%96%b9%e5%90%91%e3%80%82%e4%b8%a8%e4%bb%8eo1%e5%88%b0o3%ef%bc%8c%e8%bf%99%e4%ba%9b/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 25 Dec 2024 00:51:55 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AGI]]></category>
		<category><![CDATA[AI API调用]]></category>
		<category><![CDATA[AIGC未来]]></category>
		<category><![CDATA[AI与机器人]]></category>
		<category><![CDATA[AI互动演示]]></category>
		<category><![CDATA[AI人工智能发展]]></category>
		<category><![CDATA[AI创业]]></category>
		<category><![CDATA[AI创新应用]]></category>
		<category><![CDATA[AI发展方向]]></category>
		<category><![CDATA[AI工具进化]]></category>
		<category><![CDATA[AI开发]]></category>
		<category><![CDATA[AI慎重对齐]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI技术突破]]></category>
		<category><![CDATA[AI推理模型]]></category>
		<category><![CDATA[AI数学能力]]></category>
		<category><![CDATA[AI用户体验]]></category>
		<category><![CDATA[AI用户覆盖]]></category>
		<category><![CDATA[AI硬件控制]]></category>
		<category><![CDATA[AI编程比赛]]></category>
		<category><![CDATA[AI行业分析]]></category>
		<category><![CDATA[AI行业标准]]></category>
		<category><![CDATA[AI训练成本]]></category>
		<category><![CDATA[AI高端功能]]></category>
		<category><![CDATA[API增强]]></category>
		<category><![CDATA[API降价]]></category>
		<category><![CDATA[ARC AGI测试]]></category>
		<category><![CDATA[CANVAS项目]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[ChatGPT API]]></category>
		<category><![CDATA[ChatGPT Mac版]]></category>
		<category><![CDATA[ChatGPT实时语音]]></category>
		<category><![CDATA[GPT-5]]></category>
		<category><![CDATA[Notion AI]]></category>
		<category><![CDATA[O3 API特性]]></category>
		<category><![CDATA[O3mini]]></category>
		<category><![CDATA[O3性能]]></category>
		<category><![CDATA[O3模型]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI AGI]]></category>
		<category><![CDATA[OpenAI O1升级]]></category>
		<category><![CDATA[OpenAI 视觉输入]]></category>
		<category><![CDATA[OpenAI与开发者]]></category>
		<category><![CDATA[OpenAI使用技巧]]></category>
		<category><![CDATA[OpenAI具身智能]]></category>
		<category><![CDATA[OpenAI功能整合]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[OpenAI安全机制]]></category>
		<category><![CDATA[OpenAI高成本运算]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[WebRTC]]></category>
		<category><![CDATA[人工智能动态]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[函数调用]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[实时语音]]></category>
		<category><![CDATA[搜索与语音集成]]></category>
		<category><![CDATA[结构化输出]]></category>
		<category><![CDATA[视觉实时语音]]></category>
		<category><![CDATA[高端推理模型]]></category>
		<category><![CDATA[高级语音功能]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1795</guid>

					<description><![CDATA[啊啊啊啊啊！！！OpenAI的12天发布会真的是一场撼动人心的盛宴！🎉虽然我有点小失望，没见到期待中的Dalle和GPT-5，但后续的每一天都带来了不少惊喜和技术革新！✨

从第八天的实时语音与搜索合并功能，到第十天的直接电话通话功能，OpenAI正在不断打破传统界限，把AI带入我们生活的每一个角落！📞

想象一下，未来你只需拨个电话，就能与AI聊天，甚至还能通过WhatsApp与它沟通！这对于那些对科技理解不深的人，真的太友好啦！😍

而且，开发者日上，O1 API的增强功能让程序员们兴奋不已！功能调用、结构化输出……这些都在改变编程的游戏规则！💻

最后，令人期待的O3模型也在第十二天横空出世，超高的推理能力让人对未来AGI的希望再一次点燃！🔥

总的来说，OpenAI这12天的发布会，即使没带来革命性产品，但却为整个行业指明了方向！未来真的值得期待！🚀

家人们，快来评论区聊聊你们对这次发布会的看法吧！💬❤️

OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？

OpenAI连续12天的发布会让整个科技界目不暇接，发布从实时语音与搜索的结合到O3强推理模型的登场，展现了AI未来的无限可能。然而，缺乏GPT-5或4.5的升级，令许多人感到遗憾。开发者日带来的API增强、WebRTC实时功能和成本下降，为编程界注入新活力。而带视觉的高级语音、O3mini、以及谨慎对齐技术，为AGI和具身智能发展开辟了新路径。随着2025年的临近，AIGC行业方向已经非常明确，未来将迎来更多具突破性和人性化的AI产品。在这场革命性技术狂欢中，无论是用户体验、开发者生态，还是行业标准，OpenAI始终稳居引领者之位。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？" width="900" height="506" src="https://www.youtube.com/embed/exikA4YhwDw?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">OpenAI连续12天的发布会到底为世界指明了什么样的方向？大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">OpenAI的12天发布会已经结束了。首先，从我个人的感受上来说，稍微有一点点失望。没有带来新一代的Dalle，也就是绘图模型；也没有GPT-5，哪怕是GPT-4.5的升级都没有。Sora虽然发布了，但是他所发布出来的产品跟大家的预期是严重不符的。</p>



<p class="wp-block-paragraph">那么，这12天到底都发了些什么呢？前面7天其实已经录了一期节目进行总结了，咱们这里就不再重复。后边5天，第八天是搜索和实时语音进行了合并。我在前面7天总结最后的时候，讲了一下我说，现在OpenAI发布了大量的工具，是隔离的。语音是语音，搜索是搜索，canvas这种画板，还有其他的很多工具，是相互隔离的。就是你要选择其中一个功能，其他的功能就不能选了。未来的话，一定会逐渐把他们再合并起来。</p>



<span id="more-1795"></span>



<p class="wp-block-paragraph">第八天就给大家演示了通过带有搜索功能的实时语音，解决很多现实的问题。原来实时语音你跟他聊了半天，他是就给你瞎编的，就是截止到某一个时间点的知识，然后以此为基础来跟你去闲聊。现在的话，你就真的可以问他：“今天天气怎么样？哪个地方餐馆是不是定满座位了？”他可以用一些真实的信息来给你回答，这个就会变得非常有趣。甚至，他们还演示了一下去结合地图跟大家做一些回复，说哪个地方有什么什么东西。他可以把这个地图调出来，你附近有哪些好的餐厅，有哪些好玩的地方。</p>



<p class="wp-block-paragraph">到第九天，叫开发者日。这么多功能出来了以后，他给大家了一些API，也就是像我们这些程序员可以通过API把这些功能集成到我们自己的程序里边去。所以，先给大家看了O1的API进行升级。大家注意，O1原来我们是可以通过API去调用的，只是它很多东西都没有，包括函数调用、结构化输出、视觉输入，这些东西实际上都没有。这些是在4O上都有的东西，但O1上没有。稍微跟大家讲一下什么叫函数调用。</p>



<p class="wp-block-paragraph">就是我们在调用大模型的时候，按道理说应该是我们给他一个提示词，他就吭哧吭哧就干去了。但为了能够让他有一些更多的功能呢，OpenAI也好，或者很多其他的这种大模型也好，都有这种函数调用功能。就是你跟他描述一下，说这个函数是查天气的，以后遇到查天气，请调用这个函数，直接把这个天气查出来。等于你把一个实际天气预报的网站就可以封装成一个函数，告诉这个大模型，然后它就可以去做这样的工作，等于它就具备了查天气的功能。</p>



<p class="wp-block-paragraph">这个就叫做函数调用。而所谓结构化输出是什么呢？就是我们正常看到大模型输出的，都是乌七八糟的一大堆话。你想在里边找到真正有用的东西，然后再到下一个模型里去调用的话，有几种方式。第一种呢，就是你再给他一个大模型，说来把这个里头有用的信息总结总结，然后到下一个地方再去使用。但是这种方式呢，会有一个问题，过了大模型这个过程了以后的话，每一次的结果是不可预期的。有的时候找得着，有的时候未必找得着，这个会挺麻烦的。</p>



<p class="wp-block-paragraph">另外一种方式，就是我们常用的方式，是把它写程序，直接在这个输出的内容里边进行正则表达式的过滤。就是说我过滤一下，这个里头有没有谁的名字呀，有什么性别呀，还有什么这些东西，然后把这些数据拎出来，然后到下一个环节继续使用。以前我们是这么使，但后来OpenAI就发明了一个方式，说哎，我干脆结构化输出吧。我再输出出来的东西，就不是一个完整的文字了，而是把它拆成程序员比较习惯使用的JSON格式。他上来就告诉你，这个人的姓名是什么，性别是什么，然后有3个人形成数组，每一个的属性都按这个方式写好。那这样的话，我们在后边拿程序去接收这个数据的时候，就直接可以拿这个已经结构化好的数据去把相应的信息拎出来，往下一个环节去走。这块还是很棒的。</p>



<p class="wp-block-paragraph">至于视觉输入的话，他其实干的事情很简单，现在的O1的API可以直接往里塞图片了。原来都是你需要用文字去描述，它是不支持图片的，现在支持了。</p>



<p class="wp-block-paragraph">这就是O1的API增强的东西。然后呢，给大家演示了一个叫WebRTC。加上WebRTC以后呢，等于我们自己的程序里头就可以有这个实时语音功能了。原来我们没有办法做这个实时语音，是因为呢，我们需要通过像API的方式来去调用它。必须是我先得到了一段声音，然后把声音塞到这个后台的服务器上去，先给我识别说说文字，然后呢，它产生结果，再去给我念。原来是这样。现在的话，就是它可以做WebRTC了。</p>



<p class="wp-block-paragraph">RTC什么意思呢？叫Real Time Communication，叫实时通讯。所谓实时通讯就是说，你给了它这个音频流或者是视频流，给了它以后呢，它等于实时的去处理了。像我们使用的OpenAI的高级语音功能，就是它是说着说着你可以打断它，它会听到你的声音，然后接着跟你聊。这个东西就是WebRTC实现的。</p>



<p class="wp-block-paragraph">咱们日常生活中各种的会议软件，还有很多直播软件，实际上它背后用的技术都是WebRTC。那么现在都是我们给大家提供WebRTC的这种API，你也可以让你的应用或者网页呢，拥有这种可以被实时打断的高级语音功能。这个也是一个非常棒的技术，至少对于程序员来说，稍微有点激动人心哦。</p>



<p class="wp-block-paragraph">还有一个让程序员比较开心的事情，就是API降价。你调用了API，它是按TOKEN来收费的嘛，要每过一段时间都会降价，降一点点。那么又降价了，这个是让程序员开心的事情。</p>



<p class="wp-block-paragraph">这是第九天开发者日。到第十天呢，发布了一个特别有趣的功能，就是直接电话通话功能。他给ChatGPT申请了一个电话号码，大概是1-800-ChatGPT。大家可以直接给他打电话，而且呢，应该是每一个电话，每个月应该有十几分钟的免费时长，可以去跟他进行通讯。他发布了这么一个有趣的东西，就是你不需要安装APP，上网页登录账号都没有，随时抄起一部电话来，就可以去跟他聊天了。</p>



<p class="wp-block-paragraph">除了这种方式之外呢，还可以做WhatsApp。你把刚才那个1800……</p>



<p class="wp-block-paragraph">后边ChatGPT的这个电话号码呢，写在联系人里，以后就可以使用WhatsApp跟他进行通讯了。跟他聊天也是允许的，这样的话，他等于极大地去扩容他的用户层面。很多的老人小孩，原来从来没有接触过电脑，没有接触过网络，没有接触过手机的人，就开始可以成为他的用户了。这个也是很有趣的一个发布吧。</p>



<p class="wp-block-paragraph">我尝试了一下，我没法使，因为我的WhatsApp是用大陆手机号注册的。我使用大陆的手机号去给他打这个电话的话，肯定他也不会有任何回应，所以呢，就不用费劲了。</p>



<p class="wp-block-paragraph">这是第十天。到第十一天呢，做了一个Mac桌面版的升级，可以呢看到Notion以及其他笔记软件里边的信息，然后还做了一些高级语音功能的整合，也就是刚才我们讲的ChatGPT的Mac版。你连到本机的Notion以后，或者连到本机的各种应用上，今后你现在可以跟他说话，通过说话的方式来控制这些应用了。</p>



<p class="wp-block-paragraph">这是第11天。到第12天说终于到最后一天了。我记得到第11天的时候，就去讲说明天特别激动人心。在前边应该是发布apple intelligence那天呢，也在说说这个，以后有一天我们会发布这个AGI的，激动人心的AGI。所以呢，就是留足了悬念，大家就都等第十二天了。终于到第十二天了，坐在这看发什么了。</p>



<p class="wp-block-paragraph">他发了一个叫O3的模型，这个就实在是太厉害了，都不好意思叫O2，因为前面一个模型叫O1嘛。说O2我们跳过了，我们直接叫O3了。整了这么个东西，是一个非常强大的推理模型，然后也发布了O3 mini，还有一个叫谨慎对齐的技术。</p>



<p class="wp-block-paragraph">现在呢，这些O3模型呢都是期货，O3 mini是到明年1月底可以跟大家见面，而O3的话还要再往后推一些，据说是在O3 mini发布以后的一个时间跟大家见面。目前呢是开放了安全员申请，就是你可以申请成为安全员，进去呢帮他评测一下他们的安全机制是不是有效。因为这么厉害的模型出来以后的话，一旦是被坏人利用了，那等于坏人也如虎添翼吗。</p>



<p class="wp-block-paragraph">这个是他们不希望看到的。具体第12天的东西呢，咱们后边详细讲一下，这个还是有点意思的。然后到第十三天，对，连续发布12天嘛。第13天还有事。到第13天呢，山姆奥特曼发了条推特，说从今天开始，Sora一直到年底，免费给大家使用，就是不限额随便使。我估计呢，它Sora发布出来以后，发现完全没有什么热度，没有什么人愿意在上面折腾。因为呢，很多人试了以后发现效果并不好，特别是很多物理bug，比如说多个手指头，或者什么腿往外弯了，两条腿变三条腿了呀，什么这种事情稍微有一点点多。而且呢，他限制非常严，像我到现在在他的Sora上，不可以画有人的视频。所以呢，我就试了一次，以后就再也没登录过。虽然我作为plus用户，每月还是有一些绘画的，或者绘制视频的这个额度的，但是没兴趣。</p>



<p class="wp-block-paragraph">现在他又出来找补来了，说我们第13天还有东西，就是大家可以继续去使用Sora，作为圣诞庆祝，因为他觉得后边该过圣诞节了，大家都应该去画一些视频出来，然后去四处发发社交媒体，给人祝福祝福，这是一个很好的时间点。但是从现在来看呢，我并没有看到什么响动。怎么叫看到响动？别人画没画我怎么知道呢？也很简单，就是你到Twitter里边去，到YouTube里头去，如果你发现有大量由Sora渲染生成的这种视频在传播，在大家互相的转发点赞，那说明呢，这个策略是成功的。但是他发了这个推特以后呢，我并没有发现有任何变化，所以我觉得这个事情，应该他的目标没有达成。</p>



<p class="wp-block-paragraph">好，下面呢，咱们稍微详细的讲一下第12天的O3发布吧。O3模型呢，就是这种博士生模型，前面我们还专门录了一期视频，再去讲如果花2,000美元一个月，让你去雇佣一个达到博士级别的AI助手，你到底愿不愿意？那么现在看来，人家也不是无地放矢，实际上都是在为O3去打基础。O3模型呢，在编程比赛里头获得了2,700多分，当场做主持的那哥们大概是做了2,500分，然后旁边的山姆奥特曼就问他说：“你多少分？”</p>



<p class="wp-block-paragraph">他说2,500，当时那个脸就不是那么好看。但是他马上纠正说：“哎，我知道公司里头是有人得到3,000分的。”对于他们来说，我估计达到2,500就已经很强了。因为那个比赛我自己没有跑过，但是我估计以我的能力，应该是差得比较远。因为现在脑子已经比较木了，不是原来每天坐那写程序的那种脑子了。</p>



<p class="wp-block-paragraph">然后呢，他说：“哎，公司里有人是3,000分的。”然后山姆·奥特曼的反应特别逗，他说：“这个3,000分，这哥们也蹦跶不了几天了。”为什么呢？因为以AI的进化速度，他想去追上人类的这一点点分数差异是非常容易的。特别是在这种规则比较明确的挑战赛上，人类是不太可能很长时间保持优势的。</p>



<p class="wp-block-paragraph">第二个是参加数学竞赛，也得到了一个非常高的分数，就做错了一个题。山姆·奥特曼就想起来问说：“兄弟，你那个数学竞赛考了多少分？”那哥们赶快松了一口气，在老板面前保住面子了。他说：“我是满分，我一个题也没错。”后来又赶快找补，他说：“我是做出过满分答案的。”</p>



<p class="wp-block-paragraph">对于这个O3来说，对于这种大模型来说，你让他反复去做，他最后肯定也是能够做出满分答案的。甚至原来还有那种猴子理论，就是你让一堆猴子在这随机的点点点，或者随机的打字的话，都有可能能够形成有意义的长文本。所以你让O3反复叙事，他肯定也能够达到满分，这个不用担心。我估计这哥们也是压力挺大的，老板坐在旁边，随便出点什么数：“你多少分？”这个还是稍微有一点点吓人。</p>



<p class="wp-block-paragraph">而且他说他满分了以后，估计他也想明白了：“说不对，这个不是老板在面试我，不是在考教我，我们是在发布新产品，还是要说产品牛。”然后赶快又找补回来了这个东西，这个也是很厉害的。但这一点上呢，一定是O3体现出了极强的编程能力和数学能力。</p>



<p class="wp-block-paragraph">然后参加了一个叫ARC AGI的测试，这呢是一个全球可以开放的测试，所有做AI的人都可以去拿自己的模型上面去跑去。GPT-3在里面大概是0分，GPT-4是5分，4O可能比这个4稍微好那么一点点，O3的话是达到了87.5分。</p>



<p class="wp-block-paragraph">这是一个非常非常高的分数了。人类的平均水平是84分，所以它已经超过人类了。我们正式向AGI进发了。这个比赛呢，超过85分的就可以获得60万美金的奖励，还是一个非常棒的比赛。但是呢，它也展示了另外一个事情，就是O3模型的运行是需要超高的运行成本的。</p>



<p class="wp-block-paragraph">为了应对这个超高运行成本，他们还设计了一个很有趣的东西，就是在你每一次向O3问问题的时候，可以设置说，我到底是用这个高成本运算、中成本运算，还是用低成本运算，而不是像原来使用GPT式的，就是你只管问，它自己来根据你的问题决定使用多少算力、多少成本来算出结果来。</p>



<p class="wp-block-paragraph">他们参加这个ARC AGI的测试的时候，如果使用低成本运算的话，只能得到75.7分。虽然没有达到人类的平均水平，但已经很高了。然而，这样的75.7分的结果是用20美金算出来的，不是20美金一个月，而是20美金一次哦。这是非常非常恐怖的。</p>



<p class="wp-block-paragraph">他们刚才说的这个87.5的分数，超过人类平均智力水平，这个分数是用高成本算出来的。他算一次需要花几千美金，这是非常吓人的。所以前面录节目讲的这个2000美金一个月的，我觉得2000美金未必够他烧的。就是你按照运转一次就需要花几千美金的这种高成本运算来算的话，那这个收费的方式可能还需要重新思考一下。</p>



<p class="wp-block-paragraph">除了发布这个O3之外，还有O3mini。O3mini呢，是高中低三档算力开关，也是如此。效能呢做了很大的提升，低成本推理这一档呢，速度很快，基本上跟GPT4O的速度是一样的。现在我们使用O1 mini、O1这样的模型的话，它的速度是非常慢的，你需要等半天才能有结果出来。但是呢，使用O3mini基本上是可以达到4O水平的。</p>



<p class="wp-block-paragraph">然后使用中档推理的时候，可以达到O1的这个效果，但肯定它比O1要便宜嘛，因为它是叫迷你的一个版本嘛。但是呢，它的运算的结果跟O1是一样的，但是高档就没事没得比了嘛。</p>



<p class="wp-block-paragraph">而且呢，O3 mini呢，提供了丰富的API，就是结构化输出函数调用，这些都给了大家可以去写程序去使用了。但是O3的API到底长什么样，这个就不好说了。除了O3和O3 mini之外呢，还发布了一个东西叫谨慎对齐。你发了这么神奇的东西，万一有坏人用怎么办呢？所以这个事情一定要去讲一下。</p>



<p class="wp-block-paragraph">他们整了这样的一个谨慎对齐，实际上是什么？这是原来我们要去对齐的时候，或者说我们要去甄别用户提进来的提示词，是不是恶意或者隐藏恶意的时候呢，他们以前都是通过这种静态的关键词去进行过滤的。现在说不用了，我们训练了一个模型，然后这个模型呢，自己可以推理出一个标准来，灵活地去甄别每一次的提示词。但是这个呢，现在请大家报名去做测试，看看到底能不能突破它。因为我对于他们的这种数学和推理能力，其实是缺乏理解的。就是以我的这个理解状态来说，我觉得这个谨慎对齐的这些安全方式的话，应该突破不难。这个等他慢慢后面进化去吧。</p>



<p class="wp-block-paragraph">通过第三天的发布呢，我们看到了一个非常有趣的现象，也就是OpenAI的用人原则。他们其实就是通过各种的智力测验、各种的编程比赛、数学比赛，挑了一堆的这种天才儿童坐在这。但是我们去讲“天才儿童”这个词的时候，听到的朋友们，你觉得这是一个完全正面褒义的词吗？好像不是吧。</p>



<p class="wp-block-paragraph">现在这一群的天才儿童坐在一起，给我们带来的产品就是O3、O3 mini，一些普通人已经完全无法去理解和使用的一个强推理模型。没有给我们所期盼的普通人能够用的GPT-4.5或者GPT-5，而是给了我们一个O3。我们对天才儿童的这种认知，一般是什么样的？咱们从字面意思上去理解的话，大概是这样。这帮人在某一些特定的环境下，已经跑得非常远了，一骑绝尘跑出去了，让其他人完全无法望其项背了。但是呢，对于正常的生活，柴米油盐酱醋茶来说，基本上是弱智。反正至少我的对于天才儿童的理解是这样的。所以呢，现在GPT的O3以及他的谨慎对齐的话。</p>



<p class="wp-block-paragraph">我基本上是按照天才儿童的方式来理解他们的，这个事没有什么依据，这就是完全的感受。好，这就是第十二天发布的产品了。往后呢，我们来讲一下OpenAI的方向判断，通过12天的发布，他们到底想干什么，这个我们要去看一下。</p>



<p class="wp-block-paragraph">第一个，OpenAI现在一定是希望拉更多的用户进来，甭管是Apple Intelligence，还是直接可以给他打电话，直接可以用WhatsApp跟他联系。他还是希望拉更多的用户进来，而且呢，可以覆盖更大的应用范围，比如CANVAS Project或者其他一些新的功能。它希望可以覆盖很多原来，比如说Office或者是其他的一些软件所覆盖的这些功能。</p>



<p class="wp-block-paragraph">包括第11天所演示的ChatGPT麦克端的APP，可以直接跟大家的Notion、Notebook也可以跟这些产品一起工作的这个能力。他希望把AI带到所有的边边角角、方方面面里边去。我觉得这个Notion AI可以哭晕在厕所里边了。</p>



<p class="wp-block-paragraph">另外一块呢就是降价。OpenAI的降价其实一直都没有停下来，每过一段时间就会降价。但是对于普通用户来说，你一个月20美金也好，或者是200美金，或者其他这种版本也好，这个它不会降。但是什么东西在降价呢？就是API在降价。每过一段时间API就会降价，降价的原因呢，就是现在其实我们在程序员使用API调用的各种大模型里面，OpenAI的ChatGPT还算是最好用的之一。现在只能算之一了，因为呢，它跟这个Anthropic Claude 3.5 Sonnet比起来，算是不分伯仲吧。在这样的一个情况下，他只要是不断的降低API TOKEN的成本，那么我们这些人就会继续去使用他的API，那么他就可以很有效地去挤压他的竞争对手。这件事情一直在前进，然后瞄准高端狂奔，这就是这一次12天发布会里的实际最主要的东西。像第一天欧一完整版。</p>



<p class="wp-block-paragraph">第二天，什么是强化学习？然后到最后，上了一个O3。中间其实还有很多，是专门进行这种研究型应用的模型，已经完全脱离了普通人使用的这种模型。这个方向其实在O1的时候就已经指明了，我们要向这个方向前进，不再去做5了，或者再做什么这些东西了，我们就要去做强推理。</p>



<p class="wp-block-paragraph">在这样的方向指明了以后，现在谷歌、国内的像Moonshot、Deepseek、阿里这些都已经纷纷跟进，分别推出了自己的数学模型。谷歌推出的叫Gemini 2.0，Flash Thinking，Kimi的话应该也是推出了一个叫m系列的模型。Deepseek应该也有一个类似的模型，国内还有一些这种数学模型。阿里推出的叫QWQ，也就是通义千问QWQ模型。有一些我已经用过了，效果其实还可以。</p>



<p class="wp-block-paragraph">OpenAI已经成功地把整个行业的方向向着研究方向带过去了。再往下一步，OpenAI要做的事情，继续是各种工具之间的联通和统合，这里还有很多工作需要做。你比如说，现在你想用CANVAS的时候，还是不能用搜索。虽然可以在实时语音里头用搜索，但在CANVAS里用不了。CANVAS跟其他各种功能结合起来，或者绘图什么结合起来，这个还需要逐渐把它自己这些功能打通，这需要下功夫。</p>



<p class="wp-block-paragraph">然后，面向普通人的大模型进化，OpenAI还在探索。现在有传闻说，GPT-5训练了几次，效果不好，依然在训练。就是成本非常非常高，周期很长，训练一次几个月的时间，花5亿美金才能训练一次，但是训练了两次都没有出来结果。不过目前这些都是传闻，我自己也没有详细考证过，还是慢慢等进一步详细的消息出来吧。</p>



<p class="wp-block-paragraph">那么未来AICC行业的方向是什么？这刚才我们讲了OpenAI的方向。大家要注意，12天连续发布会，实际上对整个行业来说，有一个重大的利好。这个利好是什么呢？就是两大困扰创业者的问题。</p>



<p class="wp-block-paragraph">有一个暂时没有爆发。两个问题是什么？第一个是底层架构不稳定，第二个呢，是上层应用被覆盖。这个什么意思？咱们先想后边这个。就是你吭哧瘪肚坐半天，等OpenAI再去开发布会的时候，你发现你的功能被覆盖掉了，你的事情白干了。就是每一次OpenAI一开发布会，就说又有一大片的创业公司倒下了，就是功能被它覆盖了。这个问题依然没有解决。</p>



<p class="wp-block-paragraph">这一次这个OpenAI 12天发布会里头，依然是覆盖了一些东西，比如说ChatGPT的Mac客户端可以直接跟Notion结合了。那么Notion AI的一部分功能实际上是被它覆盖掉了。甚至呢，Mac端的ChatGPT的应用可以直接跟各种的IDE开发工具去结合去写程序了。为了应对这件事，微软说来GitHub Copilot免费了。所以现在你想写程序的话，可以直接使最好的那个，不用去跟其他的那些免费模型较劲了。这也是这个倒逼微软降价吧。所以这块依然没有解决。</p>



<p class="wp-block-paragraph">但是另外一个问题呢，基本解决了。什么呢？就是底层架构的不稳定。原来你要去做一个创业，说：“哎，我在GPT2的基础上做了一个东西。”等你这个东西吭哧瘪肚开发了一年，写出来了，人家说我GPT3出来了。那说咱们升级，GPT3上我吭哧瘪肚写了半年，又把它写出来了。我3.5了，那咱再升级，又吭哧瘪肚写了一年，说我这个现在是完全适应GPT3.5的了。我们要去开发布会了，正要出门了，我们这个GPT4出来了，然后4O出来了。这个就叫底层架构不稳定。</p>



<p class="wp-block-paragraph">现在一看说，哎，5依然遥遥无期，5的各种特性都不知道。因为我告诉你，不需要把5做出来。如果OpenAI能够做出来，说我5是按哪个方向做的，朝哪个方向发展的，这个事他如果敢出来说的话，那么整个行业就会奔着那个方向开始跑。就跟他2024年年初说我要做Sora，我放了一堆演示出来的过程是一样的。实际上他已经把整个行业带着跑了一年了。所以现在5到底是什么样，不知道。那么这件事就算稳定了。</p>



<p class="wp-block-paragraph">底层基本上稳定了。现在呢，甭管是LLama、通义千问、Gemini、Claude、OpenAI，还有其他的各种模型，都基本上停留在GPT-4的这样一个水平上，上上下下吧。然后呢，他们的调用方式，整个的反馈的这个结构基本上是跟OpenAI一致的。就OpenAI制定了一个标准，规定好了这个东西是怎么调用的，提示词大概怎么写，调用的时候是分几个命令进去，出来了以后可以有哪些功能。像刚才我们讲的什么函数调用、这个结构化输出，这些东西其他人都是照这个标准做的。</p>



<p class="wp-block-paragraph">所以呢，现在再去做什么应用，或者做AI Agent，大量的这种工作流都串起来，干这个事情的话，那中间的这些大模型就有极强的可替代性。我用OpenAI可以用，我用Gemini可以用，我用Claude可以用，我可以随便换。这个的话，其实是对于开发者来说，或者对于创业者来说，是一个巨大的好消息。就是底层暂时稳定了，大家赶快冲上去，把一些具体的应用做掉，这是很好的机会。</p>



<p class="wp-block-paragraph">OpenAI自己呢，还会继续去将各种分散的功能逐步整合起来。所以在这个时候，千万不要尝试去做拼接工具。什么意思呢？你比如说，哎，我现在是不是做一个带有搜索的CANVAS功能？这个你就别费劲了。你要相信我，OpenAI自己一定可以搞定这个事。而且他一旦搞定了以后，你做的那个产品一定会被覆盖掉，这个事不要去干，直接面向混合后的OpenAI功能就可以了。</p>



<p class="wp-block-paragraph">你比如说，我们认为带有搜索和这个项目功能的OpenAI的这种API未来会出来，那么我们就直接以此为目标进行开发就行了。等它一出来的时候，我们其他东西就开发完了，这也许是一个方向和玩法。那么用户交互方面呢，肯定还是会有很多可以值得探索的东西。这一次OpenAI给了我们两个提示，第一个提示就是如何让AI更好地跟现有的系统相结合，到底是通过Mac上面的ChatGPT APP。</p>



<p class="wp-block-paragraph">直接去跟各种APP进行结合，还是说我到这个网页里边，直接给你上canvas或上画板，这块呢是大家值得去探索的，也是呢这个OpenAI给大家做的一些演示或指明的方向吧。这块是值得去试试的。</p>



<p class="wp-block-paragraph">另外一块的话，就是如何将复杂的需求准确地表达给AI，这个是OpenAI这一次开发布会的时候给大家演示了。那说哪一个是做的这块的演示呢？Sora的故事版。我怎么能够把一个有持续的信息分成持续提进去？这个其实是OpenAI给大家做了一个创新，虽然这个创新很小，但呢非常有意义。</p>



<p class="wp-block-paragraph">以后我们不用再去想说，我如何可以在一个提示词里一次性把一个完整视频所需要的信息都扔进去。你可以在故事版上，在时间线上，这个地方要干什么，那个地方要扭个头，这个地方要变个颜色，这个时间点要起始，要画什么东西，然后到几分几秒的某一个时间点，这个主人公向哪个方向走，或者做什么动作，或者到几分几秒这个颜色发生什么变化，或者亮起什么样的灯光。他可以通过这样的方式呢，进行更精确的有持续性的信息输入。</p>



<p class="wp-block-paragraph">而且这些的话，应该会很快被像什么吉梦、可灵、Runway这些模型应用起来，这个我觉得可能一两个月就会看到变化了。现在呢是研究和推理领域，肯定会越来越小众。面向普通用户的方向的话，各种的APP，各种的这个用户交互方式，这块呢现在大家就可以去干了，2025年应该是这一块可以出成绩的时候。</p>



<p class="wp-block-paragraph">另外呢，就是具身智能必然会爆发。其实我们这一次看OpenAI 12天的连续发布会里头，真正让我感觉很震撼的东西是什么？就是带有视觉的高级语音。你可以开着摄像头对着自己跟他聊天了。这种东西你扔给了具身智能的机器人，再要求OpenAI直接输出代码，说来你给我输出代码，然后我用这个代码去控制机械手。技术变化了以后再给你进行一些反馈。</p>



<p class="wp-block-paragraph">现在的OpenAI大模型，其实已经距离控制机器人非常非常接近了。所以呢，这些机器人公司应该发力了。</p>



<p class="wp-block-paragraph">新的具身智能未必长得像人，只需要做好插件、传感器、动作执行以及反馈这一块就行了。下边就是怎么提高技能、提高准确度、降低成本。这就是2025年可能提给所有具身智能行业的一个要求了。后边大模型的部分不用管了，扔给OpenAI就完事了。</p>



<p class="wp-block-paragraph">带有视觉的实时语音，会改变每一个人的生活方式。这个智能的硬件产品包括一些新软件产品或者网页，在2025年的话，应该会有非常多的涌现。</p>



<p class="wp-block-paragraph">最终总结，2025年依然是AIGC的一年。虽然前面OpenAI连续12天的发布会让我感到稍微有些失望，但是他还是尽到了责任。不是说发布了什么让我特别感到眼前一亮的革命性产品或者什么iPhone时刻，没有。但是呢，他依然作为老大，执行使了他的义务，就是为整个行业指明了方向。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛、参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？</title>
		<link>https://lukefan.com/2024/12/16/openai%e8%bf%9e%e7%bb%ad12%e5%a4%a9%e5%8f%91%e5%b8%83%e4%bc%9a%e5%9b%9e%e9%a1%be%ef%bc%9a%e7%a7%91%e6%8a%80%e9%a2%86%e5%86%9b%e8%80%85%e7%9a%8412%e5%a4%a7%e8%b7%a8%e8%b6%8a%e5%bc%8f%e5%88%9b%e6%96%b0/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Mon, 16 Dec 2024 00:39:10 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AGI]]></category>
		<category><![CDATA[AIGC行业]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI硬件]]></category>
		<category><![CDATA[AI行业趋势]]></category>
		<category><![CDATA[Apple Intelligence]]></category>
		<category><![CDATA[Canvas]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[Dalle更新]]></category>
		<category><![CDATA[Gemini 2.0]]></category>
		<category><![CDATA[GPT4.5]]></category>
		<category><![CDATA[Her语音功能]]></category>
		<category><![CDATA[LLaMA 3.3]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[O1订阅]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Project功能]]></category>
		<category><![CDATA[Siri集成]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[产品发布]]></category>
		<category><![CDATA[产品总结]]></category>
		<category><![CDATA[创新产品]]></category>
		<category><![CDATA[创新科技]]></category>
		<category><![CDATA[强化微调]]></category>
		<category><![CDATA[技术革新]]></category>
		<category><![CDATA[新功能]]></category>
		<category><![CDATA[新科技产品]]></category>
		<category><![CDATA[智能体框架]]></category>
		<category><![CDATA[未来科技]]></category>
		<category><![CDATA[用户交互]]></category>
		<category><![CDATA[用户交互界面]]></category>
		<category><![CDATA[用户体验]]></category>
		<category><![CDATA[用户体验提升]]></category>
		<category><![CDATA[科学家工具]]></category>
		<category><![CDATA[科技产品]]></category>
		<category><![CDATA[科技产品创新]]></category>
		<category><![CDATA[科技产品创新趋势]]></category>
		<category><![CDATA[科技产品发展]]></category>
		<category><![CDATA[科技产品发布]]></category>
		<category><![CDATA[科技产品趋势]]></category>
		<category><![CDATA[科技公司]]></category>
		<category><![CDATA[科技公司产品]]></category>
		<category><![CDATA[科技公司产品创新]]></category>
		<category><![CDATA[科技公司产品创新趋势]]></category>
		<category><![CDATA[科技公司产品发展]]></category>
		<category><![CDATA[科技公司产品发布]]></category>
		<category><![CDATA[科技公司创新]]></category>
		<category><![CDATA[科技公司发展]]></category>
		<category><![CDATA[科技公司发展趋势]]></category>
		<category><![CDATA[科技公司发布]]></category>
		<category><![CDATA[科技公司发布会]]></category>
		<category><![CDATA[科技公司行业趋势]]></category>
		<category><![CDATA[科技公司趋势]]></category>
		<category><![CDATA[科技创新]]></category>
		<category><![CDATA[科技创新趋势]]></category>
		<category><![CDATA[科技发展方向]]></category>
		<category><![CDATA[科技发布]]></category>
		<category><![CDATA[科技发布会]]></category>
		<category><![CDATA[科技巨头]]></category>
		<category><![CDATA[科技行业发展]]></category>
		<category><![CDATA[科技行业趋势]]></category>
		<category><![CDATA[科技趋势]]></category>
		<category><![CDATA[行业领军]]></category>
		<category><![CDATA[视频交互]]></category>
		<category><![CDATA[视频模型]]></category>
		<category><![CDATA[视频生成]]></category>
		<category><![CDATA[视频生成模型]]></category>
		<category><![CDATA[语音功能]]></category>
		<category><![CDATA[语音识别]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[项目管理]]></category>
		<category><![CDATA[项目管理工具]]></category>
		<category><![CDATA[高级语音]]></category>
		<category><![CDATA[高级语音功能]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1770</guid>

					<description><![CDATA[啊啊啊啊！OpenAI的连续12天发布会真的太刺激了！🤯🤯🤯每天都有新惊喜！我已经迫不及待想看看最后会发布什么了！

先来给大家总结一下前7天都发布了啥：

**Day 1：**OpenAI说，我们要涨价了！😱😱😱O1和O1 Pro每月200美金！不过对于咱们普通人来说，4.0就够用了啦～

**Day 2：**发布了一个叫强化微调的科学家工具，普通人用不上，跳过跳过！

**Day 3：**期待已久的Sora终于来了！🎉🎉🎉我连夜爬上去体验了一把，效果确实比其他视频模型好一些，交互方式也更方便了！

**Day 4：**Canvas免费开放！🎉🎉🎉这个功能真的绝绝子！以后都不用Office了！

**Day 5：**Apple Intelligence和Siri接入ChatGPT，可惜国内用不了😭

**Day 6：**Her真的来了！🎉🎉🎉可以打开摄像头和GPT聊天了！我试了试，真的太好玩了！

**Day 7：**发布了Project功能，可以把文件上传给ChatGPT处理，效率提升1000%！

除了OpenAI，谷歌、Meta、Pica、Midjourney等公司也都发布了新产品，AIGC行业真的太卷了！😱😱😱

我已经搬好小板凳，坐等OpenAI接下来的发布会了！你们最期待什么功能呢？评论区告诉我！

OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？

在连续12天的发布会中，OpenAI已经发布了包括O1、强化微调、Sora、Canvas、Apple Intelligence、Her和Project在内的7款重磅产品，从科学家工具到通用用户应用，每款创新都指明了AI行业的未来发展方向。例如，Sora引领了视频生成领域新潮流，Canvas提升了文档与代码编辑效率，而增强语音和视频交互的Her则让人工智能更贴近人类。随着Project进一步探索工作流整合，OpenAI正在为未来取代传统操作系统铺路。这些发布在吸引全球关注的同时，也引发了行业巨头如谷歌、Meta、MidJourney等快速跟进，各大技术公司争相优化多模态生成和视频模型等领域。结合即将推出的Dalle改进版、智能体框架及可能的GPT4.5更新，这场发布盛宴将为未来的人工智能生态打开更多的可能性。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？" width="900" height="506" src="https://www.youtube.com/embed/760VNZv1O1k?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">OpenAI的连续12天发布会现在已经过半，发布了些什么东西呢？咱们来总结一下。</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。12天开12场发布会，算是前无古人了。人家以前的发布会都是在集中一两天的时间里，聚集尽可能多的人把它开掉。但是，OpenAI就是要不走寻常路，选择连续发布12天，每天发布一点新东西出来。而且他们的发布会是在网上开了个直播间，有时候山姆·奥特曼在，有时候他不在，大家就一起来讲讲这段时间又做了点什么新东西。这还是非常有趣的一种发布方式，算是把年底这一段时间所有人的注意力又都拉回了OpenAI以及AIGC这个赛道上。</p>



<p class="wp-block-paragraph">那么到年底了，大家都得卷，大伙有没有？有。但是，肯定没有12个。如果真的说年底有12个重磅级产品发布的话，他们也不会用这种方式。应该还是会有很多零七八碎的小功能在这12天发布出来，但也会有一些比较激动人心的东西。而且要卷，大家一起卷嘛。OpenAI作为AIGC行业的领军人物，既然开始卷了，其他人必然会跟进。</p>



<span id="more-1770"></span>



<p class="wp-block-paragraph">前段时间我们讲过，OpenAI的最主要的社会贡献是什么？就是为行业指明方向。他指明了方向，其他人就会跟。那么都发了些什么东西呢？</p>



<p class="wp-block-paragraph">第一天特别逗，首先涨价，上来先说我们做一个200美金一个月的订阅。如果你要去使用O1的完整版或者是O1 Pro，每个月的成本是200美金，这就是第一天发布的东西。而且，O1也好，O1 Pro也好，如果你不是科学家，不是那种真正需要进行推理的人，其实意义没有那么大。对于普通人来说，4O就已经足够了，O1完完全全就是很小众的一个产品。</p>



<p class="wp-block-paragraph">第二天发布的其实还是一个科学家工具，叫强化微调。意思是什么呢？就是大家现在都在讲炼丹，说明这个大模型不知道你到底是什么，不知道你具体要干嘛，所以他经常会所答非所问。</p>



<p class="wp-block-paragraph">我们对这个模型进行一定的微调之后，他就知道说：“哎，我今天是上岗来干什么什么事情呢。”就会做得好一些。OpenAI说来，我们发布一个强化微调的功能，你只需要提供比较少的数据，它就可以有一个非常好的微调的结果。这个呢也是一位科学家上来演示。像这种功能呢，跟前面我们讲的O1一样，就是普通人用不上，都是非常小众的科学家产品。</p>



<p class="wp-block-paragraph">等到第三天，终于有这个大活上来了，Sora千呼万唤始出来。我呢，基本上是等了接近一周的时间才爬上去。Sora出来以后，大家就都疯狂的往上去爬，想去尝试使用。但是呢，他一直是关闭注册的状态。就是你可以在第一个页面上看到演示的这个视频，但是你没有办法登录进去自己去创作。大概是等了，我忘了是几天了，四五天吧，然后才进去。</p>



<p class="wp-block-paragraph">Sora的模型呢，跟其他的一些视频模型比较起来，算是领先一点点。但是具体的感受，其实也没有那么大差异。对于像我这种一个月20美金的plus用户来说，我每个月应该可以生成50段动画。测试了感觉跟Runway、Pica，还有包括国内的可灵和集梦比起来，有差异，但是不是特别明显。从这个模型角度上说，更多的改进是什么呢？就是用户交互方式上改了。他给你了一些故事版，比如说你可以在一个时间线上写多段的这种提示词。这个呢，其实是给了大家很多的启示了。</p>



<p class="wp-block-paragraph">因为以前大家生成图片的时候，你给他一个提示词，他给你画出来没毛病。但是呢，生成视频的时候，再给他一个提示词，让他给你画出来，这个事就有点难了。因为视频是很多张图片凑在一起的嘛。所以说别费劲了，咱们就是在不同的时间点上使用不同的提示词，让这个大模型知道我们怎么在这个场景里边进行转换。我相信很快就会有其他的产品来跟进。</p>



<p class="wp-block-paragraph">到第四天呢，他们发了canvas。canvas其实原来就发过，只是现在告诉大家说，免费用户你也可以用了。现在canvas这个产品呢，基本上是垫进去隔office的命。什么意思呢？就是它等于是有一测试。</p>



<p class="wp-block-paragraph">你可以去跟他聊天了，但是最大的一个窗口实际上是个编辑器。你可以在一个编辑器里边说：“哎，给我去增加点什么内容，删除点什么内容。”然后哪一段呢，稍微的怎么去调整一下。然后你说：“你给我整个检查一下。”再检查一下说：“哎，这段怎么样，那段怎么样？”它有点像Word的使用方式。</p>



<p class="wp-block-paragraph">当然，你可以一边在这种对话框里跟他去聊天，另外一边什么呢？你可以直接在编辑器里改这个文件。改完了以后说：“哎，这样是不是好一点，那样是不是好一点？”就是人跟这个OpenAI的ChatGPT一起配合来去修改这个文件。如果这套东西大家使用习惯了以后，那么就不会再有Office什么事了。</p>



<p class="wp-block-paragraph">它现在呢，只是一个Word文档，大家可以在上面折腾，但是代码也可以，Canvas改代码的效果也是极好的。现在你说有没有像PPT这样的东西，或者像Excel这个表格这样的东西，可以让他在Canvas这边去干活的？我相信未来会有，这一定是奔着Office全家桶去的一个产品，这个产品还是非常非常好用的。现在免费也可以用嘛，这个功能上来以后，整个的效率会提升非常非常多的。</p>



<p class="wp-block-paragraph">然后到第五天，Apple Intelligence和Siri就上来了，其实就是给大家演示一下怎么可以在苹果设备上，甭管是电脑还是手机上，挂上ChatGPT，然后进行沟通、进行聊天，还可以做一些截屏，以及图片和视频方面的这种工作。这个呢确实是比较激动人心，但是对于中国来说其实没有用的。为什么？因为咱使不了。这个产品发布了以后，整个OpenAI的服务器，我觉得能有个五六个小时就直接宕机了。这个呢充分显示了苹果用户的威力，就是苹果的用户量还是非常非常大的，即使刨除掉中国，剩下的苹果用户也是非常给力的，直接把OpenAI的服务器干崩了。</p>



<p class="wp-block-paragraph">到第六天呢，是Her真的来了。原来我记得在发布GPT-4O的时候，当时大家看完了以后非常激动，实在是太震撼了。只是呢，在GPT-4O发布之后。</p>



<p class="wp-block-paragraph">它就又往回退了一点。它发布的是期货，并不是马上就能用的。刚才咱们讲的所有这些东西里头呢，有一个叫强化微调的功能，那也是个期货，现在使不了。其他的是马上就可以用下来了。OpenAI发布了GPT-4O之后呢，大概是过了也是几个月吧，才把高级语音功能拿出来，就是大家真的可以去跟GPT去聊天了。你可以打断它，它还可以去判断你的语气语调，这一块其实就已经强很多了。</p>



<p class="wp-block-paragraph">在这个之前呢，它还是通过说把语音识别出来，然后变成文字处理，处理完了以后，再把这个文字念出来，通过这样的方式来工作的。但是高级语音功能呢，等于语音进去，语音出来，端到端的中间并没有变成文字的这个过程。虽然你最后结束了以后，是可以去看到所有生成的文字的，但是它会流畅得非常非常多。</p>



<p class="wp-block-paragraph">但是呢，依然没有让我们看到完整的GPT-4O，或者叫Her，实际上是那个电影的名字，就是一个人工智能，像一个伴侣一样陪着你。这一次彻底出来了，加上什么呢？视频。我们可以打开摄像头，让GPT看着我们，跟我们去聊天。但是这个过程呢，GPT还是稍微有一点小滑头的。我让它看着我，我说你看我怎么样，它说你很精神。我说你看我年轻吗，它说你很有活力。后来我说，你能不能判断一下我的年龄，它说不行，我尽量不惹你生气。反正还是比较油滑的。</p>



<p class="wp-block-paragraph">我还跟我太太两个人一起上镜，我说来，我们俩谁好看，它说你们两个都很有活力。好吧，这个就当是它骂人吧，反而给我们带来了很多的欢乐。让它去拍各种场景，你家里边的各种家具，屏幕上的各种截图，你让它拍下来以后，它都可以实时地去做出反馈了。甚至呢，你比如说，你让它拍自己的视频的时候，你不跟他说话，朝它笑一笑，它都会马上这个回应你：“哎，笑一笑真好。”这个就显得非常非常智能了。</p>



<p class="wp-block-paragraph">这个功能极其好玩，如果你订阅了Plus，一定要去试一试，非常非常欢乐的一个产品。到第七天呢，发布了一个产品叫Project，Project的这个产品非常有意思，它等于是……</p>



<p class="wp-block-paragraph">在ChatGPT里边给大家开了一个目录。你可以把它打开了以后，然后说：“我现在需要处理这些文件。”然后你把这些文件都上传上去。然后呢，它根据这些文件去进行响应。</p>



<p class="wp-block-paragraph">原来呢，甭管是拆CPT也好，还有其他的所有这种聊天工具也好的，有一个很大的问题是什么？就是无状态。每一次去的时候，它都不认识你，需要从头去告诉它：“我今天有什么具体的事情。”如果你说：“哎，你把我的硬盘都搜索一下，在这个基础上跟我聊天呢？”它也很痛苦。为什么？因为你硬盘里的东西很多，它搞不清楚你到底要跟它聊具体什么事情。</p>



<p class="wp-block-paragraph">所以，让它在某一个具体的任务上聚焦起来，现在我们就来做一个旅游规划。我把旅游相关的所有信息都给你，你就在这个范围内给我回答。这件事情原来是比较难以做到的。很多人去做AI Agent，去做工作流，去做RAG，实际上都是为了解决这个问题。</p>



<p class="wp-block-paragraph">现在OpenAI说来了，咱们直接给你提供一个project的功能。你为了实现一个具体的功能，就把相应的文件都传上来，然后我就在你传上来的这批文件内给你去干活。这其实是OpenAI在向着自成操作系统的路上继续狂奔。他们认为以后不再需要操作系统了，什么Mac OS、Linux、Windows都不要这些玩意儿，我们自己干。我们自己把这些需要的东西找到了，以后就可以直接工作了。</p>



<p class="wp-block-paragraph">大家以后就慢慢地把各种各样的文件都存在OpenAI的服务器上。你每次就问它：“我这个项目里头都有什么事情？我应该如何继续往前走？”“我另外一个项目里都有什么事情？有什么文件？有什么信息？我应该如何往前走？”这以后就不再需要操作系统了。</p>



<p class="wp-block-paragraph">大家注意，前面谷歌出了一个产品，叫Workspace，其实已经部分实现了这件事情。Workspace就是你上去以后，实际上是个网盘，把各种文件都存上去。以后你就可以在网页端。</p>



<p class="wp-block-paragraph">直接去有所有的Office功能，不再需要说我在硬盘上存在什么地方，我在这个其他地方怎么去存，然后怎么去找到它，不用干这个事了。我们在全世界任何一台电脑上，只要你能登陆到自己的谷歌账户，我们就可以使用云端的这台电脑，它里面存着我们所有需要的文件，有完整的Office相应的功能。</p>



<p class="wp-block-paragraph">现在OpenAI说来，我们也照这个方式来。以后可能我们下一个产品，就是叫OpenAI网盘，大家以后就可以在那个上面干活了。那么以后你就问OpenAI说：“哎，某个目录里有些什么东西，或者是哪天放了一些什么东西上来呀？我最近有些什么样新的文件变化呀？”他就去工作去了。</p>



<p class="wp-block-paragraph">那么OpenAI可能就会有新的收费方式，按照这个网盘存储空间这样去收钱。这可能也是未来大家可以去前进的方向，因为我一直讲OpenAI对于社会的最大贡献，就是指明方向。其实现在你用谷歌的Gemini已经可以部分完成这种工作了。如果你给谷歌Gemini去付费，它也可以在你的Workspace里边去干活。</p>



<p class="wp-block-paragraph">但是Gemini目前为止呢，还没有那么聪明，虽然发了Gemini 2.0 Flash要稍微好一些，但是在各种的组件结合上，谷歌还有待提升。目前为止，12天里他已经过了7天了，大家注意，他礼拜六礼拜天是休息的，发布了7个新产品，后边呢还有5个新产品等待发布。其他公司呢，肯定也都没闲着，这个行业带头大哥已经冲了，其他人如果不跟着的话，肯定你的态度不够端正。</p>



<p class="wp-block-paragraph">第一个冲上来的是谷歌，谷歌的Gemini 2.0 Flash这个版本上来了，它的整个工作效果确实是要比原来的Gemini 1.5要强非常非常多。而且它是个Flash版本，速度非常快还免费。它比咱们在1.5以及他们中间出的各种各样的版本的这个模型都要快得多，效果也非常的好。只是呢，他演示的非常多的东西，其实你压根找不着在哪。为什么？这是个技术型的公司，大家不要对谷歌这种。</p>



<p class="wp-block-paragraph">技术型公司的产品能力抱有太高的期望，这个怎么讲呢？就是按他的说法，Gemini 2.0呢，完完全全可以像GPT-4那样，具备高级语音功能，像电影《Her》一样去工作。你可以与它对话，可以让它进行视频采集或图片采集。它生成的内容呢，甚至比PPT-4还要强。它可以生成混合内容，生成完文字后，再夹杂着图片一起生成出来。OpenAI现在只能生成图片或文字，无法将二者混合输出。</p>



<p class="wp-block-paragraph">现在的谷歌的Gemini 2.0，据说可以做到这些。只是呢，它把所有的多模态输入和输出功能，都放在了开发者工具里，或者是一些未来项目中，让大家去加入waitlist，等待使用。因此，我们现在唯一使用它的方式，就是像我这样去申请开发者账号，然后将Gemini 2.0 Flash的模型挂到自己的应用里，可以使用它的部分功能。完整功能，生成混合的文字和图片，目前还做不了。</p>



<p class="wp-block-paragraph">谷歌更新了之后，Meta肯定也不闲着。第一个呢，是把Llama 3.370币这个模型放出来了。现在Llama 3.370币的效能，比原来的Llama 3.1 405币高很多。其实在国内，我们一般不太尝试使用Llama，因为一旦Llama更新，可能过一个月左右，通义千问以及国内其他开源模型就会更新，补上这个窟窿。所以我觉得稍微等一等，可以期待下一步的产品。</p>



<p class="wp-block-paragraph">Meta也公布了自己的视频生成模型，OpenAI已经上来了，Sora也出来了。Meta也要有其他的，比如说腾讯混元纹身视频大模型，这两天也突然开放，大家可以去试用。我去试了试，还是有点一言难尽。做这种视频生成模型里，最难的其实不是视频生成，而是模型操控。它的用户交互界面稍微差了点。但是既然OpenAI已经指明了方向，大家就朝着这个方向努力就好了。</p>



<p class="wp-block-paragraph">Pica也更新了。Pica是华人团队做的一个美国的视频生成模型。他们呢，就很快地把OpenAI Sora的这些视频交互方式搁进去了。他怎么弄呢？就是你先上一副照片，说我要这个人，然后这个人呢，要去飞翔。他等于就可以很好地保持这个人的样子，然后去做后边这个动作。然后你再给他一幅图，说：“哎，现在要在这个环境下飞。”他这一块就可以编排得比较好了。现在已经可以做出一些非常有趣的小视频，在推特上面去传播了。</p>



<p class="wp-block-paragraph">Pica更新了，MidJourney也更新了。MidJourney更新的那个产品特别有意思，它叫故事版。什么意思呢？就是大家原来不都抱怨说这个东西的一致性差吗？说我想让它连续地输出一些内容，输出不出来。MidJourney你说来，我们这次更新一个有趣的功能。在一个故事版里头，你先定义角色，这叫张三，那叫李四，这叫王五，这叫赵六，定义了一堆角色。然后呢，再定义一堆场景，这是厨房，这是厕所，这是客厅，那是卧室，哪个地方是教室。定义完了以后呢，你再去定义，说张三在厕所里边碰到了李四，李四在厨房里边给王五做饭，王五在教室里边去做什么。当你把这些提示词写完了以后，他就用你前面定义的角色，在你前面定义的这个场景里边发生各种互动了。</p>



<p class="wp-block-paragraph">再往后，他家去做各种漫画，做各种的故事书，就非常非常方便了。你后边可以把这个故事写得很长，他在整个的生成过程中不会发生大的偏移。这个也是非常棒的。我觉得呢，也算是被Sora稍微提醒了一点吧，或者说大家可能殊途同归，都向这个方向走。只是呢，Sora发布了以后，MidJourney呢也再往前走一步。中国的各大模型公司呢，现在应该都在加班加点，Sora指明方向了以后，可灵还有像吉梦这样的视频模型，应该都会向这个方向前进，就是向故事版前进。视频生成过程中，某一些提示词在某几秒钟，或者某一些提示词在某个特定时间点里边起作用，这个大家应该都会跟上。</p>



<p class="wp-block-paragraph">CANVAS和Project的这样的功能的话，字节的豆包还有像Kimi，他们应该都会去学习一下。至于数学大模型的话，从O1 Preview出来之后，大家其实就都已经在追赶了。比如说像阿里出的QWQ，通义千问下面专门有一个模型叫QWQ，就是做这种推理模型的，32B在我本机就可以跑起来，推理效果还是相当不错的。Kimi呢，也专门做了一个叫K0MAS，专门的一个数学模型，都是进行推理使用的。</p>



<p class="wp-block-paragraph">搜索这一块的话，其实大家都已经做得还不错了。这就是前面七天给大家带来的这些变化。还有五天有可能发布什么呢？第一个很多人都在期待，Dalle是不是该出师了。Dalle3已经发布了很久很久了，没有什么更新。而且Dalle3现在明显的已经跟其他所有的图片生成模型比起来，落后非常多了。现在大家再去做视频生成的时候，都是用MidJourney生成的图片去做视频生成的地图。Dalle呢，是需要努力了，这个有可能会再往前走一步。</p>



<p class="wp-block-paragraph">他们发布会的时候，其实是有一些暗示的。这一次在发布的时候，OpenAI X7BT在网页端做了一个比较大的这种改变。什么呢？就是他在聊天窗底下加了一堆工具栏，然后这工具栏里头有一批呢，是搜索、Dalle，还有Canvas，这些东西是在一个栏里头。你要先选我要用哪个工具，然后再去跟它说话。大家想，这个里头为什么会有一个Dalle呢？肯定他是有事情了。他把这样的一个已经稍微有一点点小落后的产品，跟这次新出来的这种搜索呀、Canvas放在一起，那么它有可能会更新。</p>



<p class="wp-block-paragraph">然后新的智能体框架有可能也会出来。由于现在大家都在讲，说大模型就卷成这样可以了，后边呢，大家去搞一搞智能体。大家注意，现在的OpenAI呢，这么多新功能，其实是不能一起使的。什么意思呢？就是CANVAS、Search、语音功能，你每次必须选一个，你不能说我都选，说我一边语音功能，一边你去给我搜索。</p>



<p class="wp-block-paragraph">这事不行。你说我一边canvas一边去搜索，这事也不行。或者说，哎，我去推理一下，推理完了以后，你给我放到canvas里头，或者去做语音这个事，都是不允许的。每次只需选一个，这个还是非常不方便。未来可能会有一些方法把这些功能串起来，而这些功能串起来以后，OpenAI的ChatGPT的可用性会提高非常大的一大截。</p>



<p class="wp-block-paragraph">还有什么可以期待的呢？就还有人会去期待这个AI硬件。到年底了，折腾了这么长时间了，是不是也该拿出一个东西来？特别是前面，苹果当年iPhone的设计师，号称是在跟OpenAI一起合作做AI硬件。那么到年底了，是不是给大家瞅一瞅？这个有可能会出现，但这块呢，完全是咱们猜测，没有任何的依据。</p>



<p class="wp-block-paragraph">还有一个是什么呢？就是有可能会出GPT4.5，就是它有可能会在GPT4的基础上再往前走一点。你说一下到GPT5，这个呢稍微有一点点难度，但应该还是会继续往前走的。因为在发布Siri那一天，他呢也做了一个暗示。在发布Siri那天呢，他们拿这个是iPhone，上面呢只有一个日历的框，在这个屏幕上，那个日历上写着说，我们要去发布下一代的AGI或者什么这样的东西。大家就去猜测说，这有可能是GPT4.5。这就是未来五天里头，大家还是可以去期待一下的事情。</p>



<p class="wp-block-paragraph">等OpenAI把所有的12天、12个产品都发布齐了以后，我会再录视频跟大家进行总结。好，这一期就跟大家讲到这里，前面已经发布的产品，赶快去使用起来，非常好玩。好，感谢大家收听，帮忙点赞，点小铃铛，参加Discord讨论群，也欢迎有兴趣有能力的朋友加入我们，付费频道再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？</title>
		<link>https://lukefan.com/2024/11/19/%e7%99%be%e5%ba%a6%e4%b8%ba%e4%bb%80%e4%b9%88%e4%b8%8d%e5%81%9asora%ef%bc%9f%e6%8e%a2%e7%b4%a2%e7%99%be%e5%ba%a6%e7%9a%84%e7%8b%ac%e7%89%b9ai%e5%8f%91%e5%b1%95%e8%b7%af%e5%be%84%e4%b8%8e%e6%9c%aa/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Tue, 19 Nov 2024 00:52:17 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AIagent]]></category>
		<category><![CDATA[AI创新]]></category>
		<category><![CDATA[AI发展路径]]></category>
		<category><![CDATA[AI商业化]]></category>
		<category><![CDATA[AI商业探索]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[AI市场]]></category>
		<category><![CDATA[AI平台]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI方向]]></category>
		<category><![CDATA[AI模型调用]]></category>
		<category><![CDATA[AI生成]]></category>
		<category><![CDATA[AI竞争]]></category>
		<category><![CDATA[AI节目主持]]></category>
		<category><![CDATA[AI落地应用]]></category>
		<category><![CDATA[AI行业]]></category>
		<category><![CDATA[AI行业评论]]></category>
		<category><![CDATA[AI视觉生成]]></category>
		<category><![CDATA[AI革命]]></category>
		<category><![CDATA[AI项目]]></category>
		<category><![CDATA[IRAG]]></category>
		<category><![CDATA[IRAG系统]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Scaling law]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[Token计费]]></category>
		<category><![CDATA[YouTube频道]]></category>
		<category><![CDATA[中国AI]]></category>
		<category><![CDATA[中国式创新]]></category>
		<category><![CDATA[云计算]]></category>
		<category><![CDATA[产品发布]]></category>
		<category><![CDATA[创新保守]]></category>
		<category><![CDATA[创新挑战]]></category>
		<category><![CDATA[前沿科技]]></category>
		<category><![CDATA[发展趋势]]></category>
		<category><![CDATA[商业逻辑]]></category>
		<category><![CDATA[图像RAG]]></category>
		<category><![CDATA[图像技术]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大企业应用]]></category>
		<category><![CDATA[市场策略]]></category>
		<category><![CDATA[市场需求]]></category>
		<category><![CDATA[幻觉问题]]></category>
		<category><![CDATA[快手]]></category>
		<category><![CDATA[技术发展]]></category>
		<category><![CDATA[技术定向]]></category>
		<category><![CDATA[技术路线]]></category>
		<category><![CDATA[抖音]]></category>
		<category><![CDATA[搜索增强生成]]></category>
		<category><![CDATA[政府应用]]></category>
		<category><![CDATA[文心一言]]></category>
		<category><![CDATA[文心智能体]]></category>
		<category><![CDATA[文心研]]></category>
		<category><![CDATA[无代码工具]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[智能体平台]]></category>
		<category><![CDATA[智能技术]]></category>
		<category><![CDATA[智能生成]]></category>
		<category><![CDATA[未来展望]]></category>
		<category><![CDATA[未来技术]]></category>
		<category><![CDATA[李彦宏]]></category>
		<category><![CDATA[消除幻觉]]></category>
		<category><![CDATA[涌现]]></category>
		<category><![CDATA[爱奇艺]]></category>
		<category><![CDATA[现有需求]]></category>
		<category><![CDATA[百度]]></category>
		<category><![CDATA[百度AI战略]]></category>
		<category><![CDATA[百度AI技术路径]]></category>
		<category><![CDATA[百度世界大会]]></category>
		<category><![CDATA[百度发布会]]></category>
		<category><![CDATA[百度应用]]></category>
		<category><![CDATA[百度战略分析]]></category>
		<category><![CDATA[百度技术展示]]></category>
		<category><![CDATA[百度智能眼镜]]></category>
		<category><![CDATA[百度的未来]]></category>
		<category><![CDATA[百度视频平台]]></category>
		<category><![CDATA[确定性创新]]></category>
		<category><![CDATA[科学家质疑]]></category>
		<category><![CDATA[科技前沿]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[秒哒]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[规模法则]]></category>
		<category><![CDATA[视觉数据库]]></category>
		<category><![CDATA[视频模型]]></category>
		<category><![CDATA[超级APP]]></category>
		<category><![CDATA[超级智能体]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1706</guid>

					<description><![CDATA[大家好呀！今天我们来聊聊一个让人惊讶的话题——为什么百度选择不做Sora？啊啊啊！这个问题真的是激动人心，背后有没有什么内幕呢？

在11月12号的百度世界大会上，李彦宏亲口说出，百度从来没有想过要进入Sora这样的竞争。这让我不禁思考，难道真的是因为吃不到葡萄就说葡萄是酸的？🤔 百度到底在想什么？！

百度选择的道路是“消除幻觉”的方向，IRAG技术的发布就是他们的一大步！🤯 这个技术看似复杂，但其实是通过图像产生生成，然后来保证生成的准确性！说到这里，我忍不住想试试效果，结果测试后发现——画小米苏7完全失败，反而是画出了一辆问界M5！😂

不过，画郭德纲的效果简直让人震撼，逼真得以假乱真！但对比于谦却又变成了两个郭德纲，这让我一下子笑掉大牙！🤣 这是算法数据的不够精准造成的。看得出来，百度这条路走的还是有些吃力啊！

而且我们也要注意，百度的15亿调用量听上去很牛，但换算一下，实际收入却让人无奈，只能算个小打小闹🙄。李彦宏提出的方向，似乎更依赖的是产业应用和政府合作。这种中国式创新，真的能带来可持续的发展吗？🤨

所以，百度不做Sora，深思熟虑之后选择了踏实的IRAG，并不是因为他们没有能力，而是有着超凡的商业思维和稳定的操作方案。不管未来会如何发展，我期待能看到百度带来更多惊艳的产品和技术！💪

希望你们喜欢今天的话题，记得点赞关注我哦～我们下次再见！💖

百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？

在百度世界大会上，李彦宏揭示了百度不同于OpenAI的AI发展路径，即不开发Sora这样的视频模型，而是专注于多模态技术和消除AI幻觉。在大会上，百度发布了全新的IRAG技术，以图像为基准的搜索增强生成系统，以及无代码工具“秒哒”，引发了广泛的关注。然而，尽管有着15亿日均调用的文心一言，百度在AI领域的收益有限。百度不参与视频平台的竞争，背后的原因是其没有类似抖音或快手的平台支持。最终，百度选择了确定性更高的技术路线，但这一保守策略是否能使百度在未来AI竞争中占据领先地位，仍需时间验证。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="百度为什么不做Sora？探索百度的独特AI发展路径与未来方向，背后原因是吃不到葡萄说葡萄酸吗？" width="900" height="506" src="https://www.youtube.com/embed/Ep_ehhnY-Tc?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">百度为什么不做Sora？是不是吃不到葡萄就说葡萄是酸的呢？大家好，这里是老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">11月12号，百度世界大会上就透露出来说，百度从来就没有想去过做Sora这样的世界模型，或者叫视频模型，从来没想过。百度呢，是一直希望走自己的多模态道路，不希望去跟OpenAI这样的公司卷入世界模型的竞争。虽然到现在为止，Sora也没出来，但是跟在后面跑的人还是很多的，特别是抖音、快手，都推出了各自的视频模型，还有很多国际上的厂商也在视频模型上争先恐后地往前跑。</p>



<p class="wp-block-paragraph">但百度说，我不干这个事，我有更重要的事情在做。这是百度李彦宏亲口说的。那么，百度努力的方向到底是什么呢？百度努力的方向是消除幻觉。大模型都是有幻觉的，百度呢说，我们作为一个中国公司，你可以不说话，但是说错了是很麻烦的，所以我们不能产生幻觉，保证我们说的都是对的。而且这个是在各种角度上，所有的评判标准来看，都得是对的，不能有任何问题。因为有的时候，你说的你觉得对了，但别人觉得不开心，这也是不行的。</p>



<span id="more-1706"></span>



<p class="wp-block-paragraph">所以百度呢，作为一个有中国特色的AI领军公司，他们向着消除幻觉的方向前进了。他们准备怎么去消除呢？他们这一次在11月12号的百度世界大会上，推出了一个很有趣的东西，叫IRAG。大家要知道，RAG是我们在做AI agent，或者叫AI智能体里头，用得比较多的一个技术，叫搜索增强生成。就是我们先搜索，搜索完了以后，根据搜索的内容再去生成，这样的话，能够保证生成出来的东西没有什么幻觉，是在你给定的范围内去生成的。它倒不一定说保证生成出来的东西是对的，但呢，它保证说你给我的是什么，我生成出来的就是什么。</p>



<p class="wp-block-paragraph">那么，IRAG是一个什么样的东西呢？这个前面这个I到底是做了一个什么样的单词放进去了呢？I这个词呢，是图像（image），以图像为基准的RAG。什么叫以图像为基准的RAG呢？就是正常情况下，咱们RAG都是做的文本或者是表格。</p>



<p class="wp-block-paragraph">搜索完了以后，把这些文本和表格通通都做成矢量数据库里面的一个点。然后找到离他比较近的点拿出来，去生成跟问题相关的答案。这是RAG的标准过程。IRAG呢，就是百度说我有好多图片，我把所有这些图片，以及图片识别出来以后的各种信息，直接拿去做嵌入，然后形成史料数据库。在这个里边去搜索，搜索完了以后再去重新生成图片。这意思是什么呢？就是你去训练说这个人叫张三，张三长这个样子，张三坐着，张三站着，张三乐了，张三哭了，张三吃东西了。他把所有这些东西都训练好了，放到一个矢量数据库里边。等你下次要求他去生成图片的时候，说张三穿着什么什么样的衣服，站在哪里，在做一个什么动作，有什么样的表情，有什么样的风格，他就可以从矢量数据库里头把你要的这些信息都找出来。张三长这样，我有了；然后呢，穿什么衣服，我在数量数据库里再去查。查完了以后，哦，衣服长这样我也有了。做什么动作他可以画得很准。他做了这么一个很神奇的技术出来，但是我看到这个介绍以后说：“哎，这玩意好玩哈，我得去试试。”然后我就跑去试了一下。首先我跑到了百度文心一言的网站上，测试一下，发现文心一言3.5版本一如既往的拉胯，依然在那胡说八道，依然在那前言不搭后语，咱就对他没有什么预期了吧。然后闻心欲言4.0依然需要收费，算了不测试了。那么画图吧。画图的过程呢，稍微有些吓人。首先让他画车，你让他画各种型号的车，都非常的准。说我迈巴赫哪个款，在巴黎的凯旋门下，哎呀，那个做的非常的漂亮，一张照片绝对一下乱真。大众这个车呢，除了车牌子上看不太清楚之外，也是非常像的。比较遗憾的是，我要求他画小米苏7，他没画出来，估计是小米苏7他的素材不够多，或者训练这个模型的时候没有用很多的小米苏7的图片，或者说他的IREG的这个矢量库里头没有那么多的小米苏7的图片。每次要求他画小米苏7的时候，他画出来的呢，都是问界M5，这个就没办法了。然后画人吧，要求他画郭德纲。</p>



<p class="wp-block-paragraph">哎呀，我天呐，简直就是拿照片直接贴上来。你说郭德纲干什么？马上就给你做一个一模一样，绝对以假乱真。但是呢，你要求他画于谦，这个事就没法整了。画出来的也是郭德纲。大家想明白了没有？为什么会这样呢？</p>



<p class="wp-block-paragraph">说为什么我要求他画于谦，这个IRAG产生的结果是郭德纲呢？因为很简单，你所有在百度图片里头搜索于谦的照片，郭德纲都站旁边了。于谦、郭德纲，郭德纲、于谦，你郭德纲站的照片多一些，那么他就认为说是不是于谦应该也长这样。可是这样的一种运作方式，实际上呢，他向我们展示了用IRAG的这个技术，依然是没有办法避免幻觉的。你要求他画于谦，他画的是郭德纲。</p>



<p class="wp-block-paragraph">有一张照片，我告诉他说，来，给我画一个郭德纲跟于谦在德云社说相声的照片。画完了以后，就是两个郭德纲，都很像。就是你单独拆出任何一个来，都是以假乱真的。俩郭德纲站在台上说相声了，就变成这样了。要求画其他人，就没有那么像了，比如说郭麒麟、马斯克，这个就不太容易认出来了。其他的我就没有再敢去测试，再测试可能会被警告了。</p>



<p class="wp-block-paragraph">但是呢，他整个这套的IRAG的系统还是挺吓人的。如果你想让他去给你生成一些广告图片或者是一些假图，就是郭德纲出去做了一些丢人现眼的事情，绝对以假乱真，画的极像，已经是可以达到一定的商业用途了。特别是你，比如说我做一些店铺的装修或者是这种电商的图片生成，这个玩意还是可以的。</p>



<p class="wp-block-paragraph">除了这个IRAG之外，这一次的百度世界大会上呢，还发布了无代码工具“秒哒”。一秒、两秒的秒，哒呢是一个口一个到达的达。所谓的无代码工具“秒哒”呢，其实类似于字节跳动的codes，对吧？也是让大家把智能体拼起来，然后形成AI agent去干活了。只是呢，秒哒现在呢还不开放使用，依然是让企业去报名排队。据说已经有很多人排队了。这些企业不知道为什么想不开，Codes现在就可以免费使，你干嘛还要去使用秒哒呢？像我这种稍微有点动手能力的人，可以使用Defi。</p>



<p class="wp-block-paragraph">这个咱们就不说到这么远了。今年，除了前面我们讲的IRAG以及秒哒之外，还发布了什么呢？这个牛肯定还是要吹的嘛。现在吹的牛是什么？就是文心一言大模型，日均调用量15亿。我们已经数涨上来了，去年是5,000万，现在涨了30倍了。这个15亿呢，大家注意，没有单位，15亿次，15亿人，不可能15亿人，中国没有。15一次，这个也稍微有点不太好去评估，怎么算一次呢？那么我们就稍微保守一点评估吧，我们把这个单位写成TOKEN，就是每天可以生成15亿TOKEN。</p>



<p class="wp-block-paragraph">哎呀，很多人说这个数好大呀，百度文心一言好厉害，这么多人使用它，生成了这么多的内容。但是你要想想，15亿TOKEN按照百度的收费标准，能够挣多少钱呢？百度文心一言4.0 Turbo，按照每千TOKEN的价格乘上15亿的话，一天的收入大概不到10万块钱。那你以为像百度这样的一个公司，这样的一个项目，值得上来去讲吗？如果这就是他的AI未来的话，百度一年挣个3,000万、4,000万这种水平，这个够干嘛的呀？</p>



<p class="wp-block-paragraph">所以呢，这个数字基本上可以忽略不计，他只是跟大家玩了一个文字游戏，一天15亿，好大好大。你把它乘上钱数，你看看有多少。除了给自己吹牛之外，当然还要指明一下方向，说未来的AI发展是哪个方向呢？两个大方向，一个是智能体，应该也就是刚才我们讲的AI Agent这样的东西；另外一个呢叫产业应用，就是政府有钱或者是大的企业有钱，你们愿意为这个事情买单，你们就是未来方向了。这是李彦宏为AI中国指明的两个方向。</p>



<p class="wp-block-paragraph">而且呢，保证说百度自己不会去做超级APP，实际上他也没这个本事，所以干脆吃不到葡萄说葡萄是酸的，我不做这个事。然后呢，要去打造上百万个超级APP，也不知道李彦宏怎么想的。超级APP不可能有上百万，到上百万了，以后这东西就不叫超级APP了，你没有那么多用户，叫什么超级APP？但那意思呢，就是降维打击，这个是很多互联网人喜欢讲的一种说法。</p>



<p class="wp-block-paragraph">你是二维生物，我用三维的方式去干掉你；你是三维生物，我用四维的方式去干掉你。这是《三体》里边的一个词。这个所谓的降维打击是什么呢？就是你们都去卷超级APP去了，我要当你爹。在百度下边做的应用都是超级APP，我比你高一个层次。</p>



<p class="wp-block-paragraph">当然了，也展示了一些智能体，包括百度自己的文心智能体平台。这个上面呢，号称有15万家企业使用，有80万开发者，但是也没有看到砸出什么响动来。如果产生了超级APP的话，广大的民众应该是能够有感知的。咱们现在没有感知，别说上百万个了，一个都没看到。然后也展示了一些超级智能体，什么法律问答呀，基本上也就是说我们通过百度的文心研做的一些AI Agent，怎么能够解决一点点的实际问题，这个也给大家展示了一下。</p>



<p class="wp-block-paragraph">另外，时髦还是要赶的，赶什么时髦呢？百度智能眼镜，扎克伯格干成了，我们也得干去。这就是这一次的百度世界大会上发的东西。那咱们回过来说，百度为什么自己不做Sora呢？其实这个里头最本质的原因只有一个，就是百度自己是没有视频平台的。虽然百度有视频，百度有爱奇艺什么这些东西，但是百度自己没有像抖音、快手这样的平台。你像国内现在即梦跟可灵，卷的那叫死，天天俩人卷来卷去的。即梦后边是字节跳动是抖音，可灵后边是快手。生成完了视频，就放在我们的抖音、快手平台上，大家就可以宣传了，就可以直接用上了。百度自己没这东西，所以说那我就不跟你费这劲了。</p>



<p class="wp-block-paragraph">而百度跟Sora呢，实际上是两条完全不同的路径。Sora是什么路径？Sora的路径是scaling low，大力出奇迹。中间很多东西我们也不去研究了，我们就把料堆齐了，数据堆齐了，算法堆齐了，再加上足够的算力，烧钱等待它涌现。原来的这些传统的方式，我们就不去考虑了，think differently。我们不用再去想说要不要更快的马车，我们直接去造飞机去了，还不是汽车。这就是Sora干的事情，是一帮有理想的人去做的事情。</p>



<p class="wp-block-paragraph">而且呢，未必有结果。其实到现在为止，Sora都没有任何要做出来的迹象。而百度他们做的事是什么呢？是在现有的技术范畴下，满足现有的需求。这个呢，就属于典型的中国式创新了。要求的是什么？确定性高。我们要卷吗？卷的一定要确定性很高。哪方面要确定呢？第一，技术路线要确定。一帮老学究们，他们来去确定技术路线，不能让年轻人上。年轻人，你们没有经验，万一走错了路怎么办呢？这个你们不要去动。第二个呢，成本要确定。我投入多少钱以后，可以得到一个什么样的结果。成本确定了以后呢，收益也要确定。我做出来的东西得有人用，我得卖得掉，这个事才能去干。就比较现实。这个就是百度走的这条路。百度呢，要求是有市场能赚钱，所以呢，百度算是比传统的中国式创新更加保守一点的一个公司。</p>



<p class="wp-block-paragraph">那么现在有很多人去讲说，scaling low现在到底行不行？美国有很多大学、很多机构，甚至一些著名的科学家都出来讲，scaling low是不是玩不转了，这种规模法则是不是有问题了？再往前堆，是不是堆不出东西来了？这件事呢，只能这么说，从scaling low诞生的第一天开始，质疑就从来没有停止过。为什么呢？因为scaling low指望的那个东西，就是scaling low成功的最终结果叫涌现。这个词什么意思？就是你不确定他来不来，你不确定哪次行哪次不行，你也不确定说我到底是增加多少。以后有这么一次，因为涌现这个东西，它一定是不连续的。不是说我上了10块显卡，出了一个东西；上了11块显卡，又出了一个东西；上了12块显卡，又出了一个东西。这个是不连续的。你有可能10块显卡，你最后算出来一个数据可以用，然后呢，11、12、13都没用。结果你发现上到第100块显卡的时候，又跑出一个结果来，又有一个跳跃式的创新，又往前走了一步。那你说咱堆吧，堆到1,000块显卡，咱再做一次，发现哎，好像有那么点提升，但是又不是那么明显。哎呀，这个好像不对。</p>



<p class="wp-block-paragraph">但这个事情是不是就不行了？不一定，因为在下一个节点在哪，谁也不知道。这个才叫涌现呢。如果你知道下一个节点在什么地方，比如说有这么多数据堆在一起以后得到结果，那下一个节点，比如说我们说是乘10倍、乘20倍、乘30倍或者是1,000倍，这都不知道。这个才叫真正的 scaling law。就是我们就只管往前堆，未来是不可预期的，不确定的不连续的。</p>



<p class="wp-block-paragraph">这个东西从开始的那天大家就质疑它。这个过程呢，其实很像什么？就是咱们小时候都看过一个故事，叫小马过河。什么意思呢？这个小马背着一包货准备过河，人家就跟他讲说你这个过不去的，这个河很深，会淹死你的。这个不同的人就都跟他讲不同的话。就是每一个老的科学家或者是一些进行成本核算的会计师们，看到 scaling law 就会跟他讲：“小马过河，你是过不去的，你这个事有问题的。”那这个怎么办呢？必须要往前蹚，蹚完了以后去寻找下一个的节点，这个是没有什么办法的。</p>



<p class="wp-block-paragraph">百度这么想到底对不对？百度说我不去作死 Sora，我要去做 IRAG，我要去消除幻觉，做有中国特色的创新，这事对不对呢？其实百度这么想并不丢人，作为一家成熟的商业企业，这样思考算是一个正常的商业逻辑。但是呢，如果按照百度自取的那样，他是中国 AI 行业的领军企业，这么想问题的话，就有点可悲了。</p>



<p class="wp-block-paragraph">但好在是什么？就是中国做 AI 这一块，反正至少我测试的各种产品里头，我觉得百度基本上还是排不上号的。百度自称是中国 AI 行业的领军企业，这个事呢，让百度自己开心就好了，关起门来称大王就可以了，让我们每天看着百度是怎么思考问题的。我觉得他思考问题的很多的方式还是有借鉴意义和价值的。但是呢，作为一个国家的这种 AI 领军人物，最好还是有一点梦想，愿意努力的，跳一步往前走一走，有可能你就会走到一些不一样的地方。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里，感谢大家收听，请帮忙点赞，点小铃铛，参加 Discord 讨论群。</p>



<p class="wp-block-paragraph">也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
