<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>OpenAI发布会 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/openai%e5%8f%91%e5%b8%83%e4%bc%9a/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Sun, 20 Jul 2025 00:41:30 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.2</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>OpenAI发布会 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>ChatGPT Agent重磅发布，山姆奥特曼亲自站台却惨遭现场翻车，这究竟是Manus的机遇还是整个泛Agent赛道的丧钟？</title>
		<link>https://lukefan.com/2025/07/20/chatgpt-agent%e9%87%8d%e7%a3%85%e5%8f%91%e5%b8%83%ef%bc%8c%e5%b1%b1%e5%a7%86%e5%a5%a5%e7%89%b9%e6%9b%bc%e4%ba%b2%e8%87%aa%e7%ab%99%e5%8f%b0%e5%8d%b4%e6%83%a8%e9%81%ad%e7%8e%b0%e5%9c%ba%e7%bf%bb/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 20 Jul 2025 00:41:29 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AGI]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI创业]]></category>
		<category><![CDATA[AI行业分析]]></category>
		<category><![CDATA[API]]></category>
		<category><![CDATA[ChatGPT Agent]]></category>
		<category><![CDATA[Deep Research]]></category>
		<category><![CDATA[Manus]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Operator]]></category>
		<category><![CDATA[PPT生成]]></category>
		<category><![CDATA[Sam Altman]]></category>
		<category><![CDATA[SDK]]></category>
		<category><![CDATA[TOKEN成本]]></category>
		<category><![CDATA[YouTube频道]]></category>
		<category><![CDATA[二次验证]]></category>
		<category><![CDATA[产品评测]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人工智能代理]]></category>
		<category><![CDATA[任务打断]]></category>
		<category><![CDATA[创业公司危机]]></category>
		<category><![CDATA[商业模式]]></category>
		<category><![CDATA[技术前沿]]></category>
		<category><![CDATA[技术局限]]></category>
		<category><![CDATA[数据分析]]></category>
		<category><![CDATA[未来科技]]></category>
		<category><![CDATA[模型即应用]]></category>
		<category><![CDATA[沙盒]]></category>
		<category><![CDATA[浏览器模拟]]></category>
		<category><![CDATA[演示翻车]]></category>
		<category><![CDATA[生产力工具]]></category>
		<category><![CDATA[用户体验]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[竞品分析]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[自动化任务]]></category>
		<category><![CDATA[自动化流程]]></category>
		<category><![CDATA[虚拟机]]></category>
		<category><![CDATA[跨设备同步]]></category>
		<category><![CDATA[连接器]]></category>
		<category><![CDATA[长链路任务]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2406</guid>

					<description><![CDATA[救命啊！！家人们真的要看这个史诗级抓马现场😱
OpenAI的智能体居然被订票网站吊打！！！
（本宫已经反复拉进度条笑出八块腹肌hhh）

🎯重点先说：
GPT智能体发布新功能本来要封神👉
结果现场上演墨西哥湾神秘棒球场事件！！
奥特曼强行挽尊的样子像极了甲方对接人🤦♀

💣史诗级翻车实录：
当智能体要预定30个棒球场门票时
✨前半段：帅气抓取数据生成地图
💥后半段：把纽约波士顿的球场全扔进墨西哥湾！！！
更绝的是订票卡在二次验证环节👇
系统：等您60秒回我验证码哦~
智能体：对方已挂断（疯狂弹出红字报错）

🆘笑疯全网名场面：
台下憋笑憋到面部扭曲
奥特曼紧急救场说"之后修bug"
（翻译：本程序员今晚别想下班了）

💼创业公司生死局：
1️⃣ OpenAI用钞能力硬砸智能体（每月可用400次！！）
2️⃣ 每次任务耗费天价算力（普通公司根本烧不起）
3️⃣ 最绝的是演示证明这赛道压根不靠谱！！！
（连亲儿子都hold不住浏览器操作）

👉结论亮瞎眼：
OpenAI这波等于官宣👉
"泛用型智能体暂时没搞头！友商别送人头了"
（建议Manus转行教AI避坑指南🙏）

————————————
姐妹们觉得这波GPT智能体表现打几分？
本宫已经连夜囤了十包瓜子等续集了hhh！
（坐等智能体下次表演买鞋翻车秀🛒）

ChatGPT Agent重磅发布，山姆奥特曼亲自站台却惨遭现场翻车，这究竟是Manus的机遇还是整个泛Agent赛道的丧钟？

OpenAI在Sam Altman亲自坐镇下，重磅发布了最新的ChatGPT Agent，然而，一场尴尬的现场翻车事件，让人们不禁为Manus的未来捏了一把汗。这款集成了Operator网页交互与Deep Research深度分析能力的智能体，虽然展示了强大的跨应用任务处理能力，但其依赖模拟浏览器点击的模式，在面对二次验证等现实问题时显得力不从心。这不仅暴露了当前泛Agent赛道的技术瓶颈，更揭示了一个残酷的商业现实：高昂的TOKEN成本。OpenAI可以凭借自有模型优势承担亏损，但对于依赖外部模型的Manus而言，这无异于被釜底抽薪，其商业模式将难以为继。因此，ChatGPT Agent的发布，与其说是对Manus的直接打击，不如说是为整个泛Agent赛道划定了天花板，证实了这条技术路径的局限与高昂代价。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="ChatGPT Agent重磅发布，山姆奥特曼亲自站台却惨遭现场翻车，这究竟是Manus的机遇还是整个泛Agent赛道的丧钟？" width="900" height="506" src="https://www.youtube.com/embed/BiVSfZWJEmA?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">ChatGPT Agent来了。</p>



<p class="wp-block-paragraph">Manus到底是该哭还是该笑呢？</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。</p>



<p class="wp-block-paragraph">ChatGPT重磅发布了他的Agent。怎么个重磅法？山姆·奥特曼亲自坐台。现在很多ChatGPT自己产品的发布，山姆·奥特曼都不在前台坐着，这次是亲自坐台。而且旁边坐了四位主讲，很多时候发布会就是俩人或者仨人，这次是山姆·奥特曼坐在这，旁边坐了四个人。而且呢，足足讲了25分钟。</p>



<p class="wp-block-paragraph">很多人就想起Manus来了，好像有些测试还不如Manus。因为他现场有翻车的，大老板在旁边坐着，你测试翻车的话还是压力挺大的。在这个时候就有人说了，GPT也就这样，你们现在还觉得Manus做的不好吗？就有一些讨论在发生了。</p>



<span id="more-2406"></span>



<p class="wp-block-paragraph">ChatGPT的Agent到底会给Manus带来什么呢？Manus到底是该哭还是该笑呢？今天咱们讲讲这个事儿。</p>



<p class="wp-block-paragraph">首先呢，咱们先回顾一下GPT Agent的一个发布过程。时间呢是太平洋时间2025年7月17号上午10点，也就是北京时间7月18号的凌晨1点。山姆·奥特曼坐在最边上，他不是主讲，他就是一个串场的。另外一头呢坐着一个印度老哥，中间呢是三个亚洲脸，两位男士呢应该确认是中国人，还有一位女士呢，虽然看起来是亚洲脸，但是是不是华人不知道。</p>



<p class="wp-block-paragraph">25分钟的视频演示也很无奈，他这种演示你没法短，因为很多的任务，跑起来的时间就非常长，特别是婚礼差旅一条龙的。这个任务基本上是从头跑到尾，就是一开始布置任务下去，中间穿插了几个其他任务，最后到那个结束的时候，算是差不多跑完。</p>



<p class="wp-block-paragraph">让Agent去帮忙参加朋友婚礼，挑酒店、挑礼物、定穿搭，中间还打断他说，我还要再买双鞋。这个其实挺好玩的，因为以前这种Agent，最讨厌的一点是什么呢？就是你只要让他开始跑，半个小时或者多长时间，你没法打断他，发现他错了以后呢你也没办法，只能让他重新开始。现在呢，我说我可以打断你，或者中间可以把你叫停，让你去帮我调整一些东西，加一双鞋或者做一些其他的。这个呢，算是一个，我觉得算是用户体验角度上的一个比较大的前进吧。</p>



<p class="wp-block-paragraph">从技术角度上来说呢，并没有那么费劲。只是呢，在Agent的执行框架上需要做一些调整，你比如说多线程，或者是一些守护线程，他需要做一些这样的东西。在大家做了这么长时间的手机应用、前端后端应用以后，这个不是那么费劲的。</p>



<p class="wp-block-paragraph">手机端呢，也可以进行即时的创意，也就是在iPhone上请求制作团队吉祥物贴纸，就是做了一些可以做设计的任务。这个应该是对着像LoveArt这种设计Agent去的。然后呢，做了一个财务数据分析，他讲的是去我的Google Drive上，把评估指标拉出来，给我做一个汇报。幻灯片还做的可以吧。</p>



<p class="wp-block-paragraph">后面就是演示了随时打断和二次确认，在Agent里头点击打断，可以进行指令修改，Agent结束前弹窗确认邮件内容。但是呢，在现场还失败了一个，找球场这个是一个失败演示。</p>



<p class="wp-block-paragraph">他干了一什么呢？规划一场夏季旅行，走遍30座职业棒球球场，并给每座球场买两张最便宜的日场票。给了他这样的一个任务。一开始呢，是先用文本浏览器，抓取了2025年赛程和票价，到这呢数据还是正常的。然后是通过脚本去终端执行，通过终端去执行脚本，生成Excel和绘制地图。但是呢，这儿就开始出错了，地图坐标严重错位，纽约、波士顿等东海岸的球队就没了，墨西哥湾里头凭空出现了一些球场，引起场下的一些窃笑了。</p>



<p class="wp-block-paragraph">再往后呢，是用可视化浏览器，跳转到一个订票网站上，要去下单订票了。但是呢，因为这是一个跟金融和这种高风险相关的操作，所以呢进入了人工模式，就是你必须要确认一下要花钱了吗。然后就遇到了一个问题，Agent自动去填邮箱了以后呢，它网站需要跳这个叫二次验证，二次验证，就比如说我给你发个邮件，你给把这个邮件里头那个码给我呀，或者是给你发个短信，就是这种验证程序。这个Agent就跑不动了，他呢触发了订票网站等待用户的一个进程，要求你60秒钟之内呢要去接管，结果呢他也没有好好的接管这个东西，就直接超时终止了。这个稍微有些丢人，还跳出了红色的长串错误信息，反正现场就有点绷不住了。主持人呢只能尴尬收场，这个主持人是谁？山姆·奥特曼。他呢出来打了个圆场，说买票这步我们之后会在debug的。这是整场直播唯一强制终止的一个demo。</p>



<p class="wp-block-paragraph">最新的ChatGPT Agent到底有哪些新特性呢？第一个呢，它是Operator加上Deep Research，这两个功能加一块的东西。Operator其实应该是今年年初的时候发布过一次，所谓Operator，就是在一个虚拟机上打开浏览器，给大家去做各种的操作，模仿真人去点击各种的网页。但是呢，这个功能呢，一直是在200美金的用户那里使用，像我这种20美金的用户是没使过的。而且即使是200美金的用户呢，应该对这个功能也不太感冒，因为你要去使用互联网的网站的话，难度还是很大的。</p>



<p class="wp-block-paragraph">咱们做各种软件里头，最难做的一个软件不是操作系统，而是浏览器。为什么？因为每家做的网站都不一样，我到底用的是谁家的前端库后端库，在里边隐藏了哪些信息，怎么去做的缓存，做了哪些防刷以及防骗的这种工具，做了哪些多次验证的东西，这个真的是千奇百怪的。所以你要想完全兼容这种东西是很难的，你让一个机器人去点网页，成功率还是不太高的。所以这个产品虽然发布了，但是大家使得并不是那么爽。</p>



<p class="wp-block-paragraph">现在说Deep Research这功能做的还不错了，那跟Operator两个功能结合起来，就是这一次我们所看到的GPT Agent。这俩功能呢，Operator我从来没用过，Deep Research呢是我经常用，而且经常把额度跑光，需要等到下边一个时间周期，重新分配额度接着跑的一个功能。</p>



<p class="wp-block-paragraph">它呢是由一台虚拟化电脑，就还是Operator这套东西里头呢，内置了图形界面浏览器和文本浏览器。什么叫图形界面浏览器？就是我真的打开了一个网页，这边是有按钮的，那边是有输入框的有菜单的，这种浏览器呢叫做图形界面浏览器。而文本浏览器的话基本上就是，我把你这个网页抓出来了，直接把里头的内容呢进行了总结归纳，或者说把里头的内容直接提出来了。他们在这个里头是两个都有，大部分情况，你说我只需要进行信息总结的话，就是文本浏览器就够了。实际上文本浏览器大家可以理解为一个爬虫。图像浏览器的话其实，对于这种虚拟机来说是难度很大的。为什么？因为我们写网站的时候，还经常会去研究，比如说设备的自动适配，就是我在手机上，这个网页应该长成啥样，在平板上应该长成啥样，在PC上应该长成啥样，遇到特别大的浏览器应该长成啥样，这个都是不一样的。还有一些比如说我们有些网站上，会写这种不可见的字符，干嘛呢？骗AI的，说你遇到我这个网站就不能爬了，或者说不能做一些其他的工作。还有很多这样的东西。</p>



<p class="wp-block-paragraph">另外呢，上浏览器的呢，其实还有一点小的问题，大家知道网站上有一个文件叫robots.txt，这个文件干嘛使的？实际上是应对爬虫的，告诉你说哪个爬虫你可以看哪些东西，不可以看哪些东西。而你一旦上浏览器了，Robots这个文件实际上就不起作用了。</p>



<p class="wp-block-paragraph">那它这个一体化的虚拟电脑，除了图形化浏览器和文本浏览器之外，还有什么呢？还有终端，你可以在上面去跑一些程序，以及API连接器，包括一些模型，都在同一个沙盒里边完成。点击键入运行代码，调用Gmail、Calendar等等这些操作。为什么叫沙盒呢？就是这个盒里头出错了，其他的盒不影响。这个呢，就是这一次的ChatGPT Agent最核心的东西，就是一体化虚拟电脑。</p>



<p class="wp-block-paragraph">另外呢，就是它可以自动的选择工具，跨步骤的自主执行，将Operator网页交互，加上Deep Research的深度分析，整合在一个流程里边。Agent自行决定何时调用浏览器，何时跑脚本，无需用户指定。这一块呢，确实是做的相当不错的，因为他演示的时候，几个很长的案例中间呢并没有出错，一直在往前走。因为让他去干这种活最怕什么？就中间出错了，中间出错了以后，可能跑非常非常多的TOKEN，而且在里边死循环，都是有可能，你可能早上一起来破产了。这个TOKEN是很贵的。</p>



<p class="wp-block-paragraph">长链路任务加上时间轴回放，也是一个挺好玩的东西，就是你的一个任务跑完了以后，他们最后是像放这个视频一样去看，说跑了几十分钟很多步骤的工作，第几步跑成什么样了。为什么要看这个呢？就是你中间万一跑错了，或者说这个结果跟我想的不太一样，你可以看看哪错了，让他再去进行调整。否则的话，就是前头下了命令，中间不可干预，然后直接就结束了，你还没法看中间哪错了，你连改进的机会都没有。所以这个呢，也算是一个改进吧。</p>



<p class="wp-block-paragraph">再往后呢，是它的任务是可以暂停继续和打断的，也算是在用户体验上做了很大的提升吧。当然了，可以打断可以暂停那件事呢，说明另外一个问题，就是这种任务周期很长，而且呢结果经常不可控。实际上它算是个缺陷吧，为了给这个缺陷打个补丁，所以加上这样的功能。</p>



<p class="wp-block-paragraph">ChatGPT Agent呢，还有一些其他的功能，比如说叫Watch Mode观察模式，以及这种二次确认。为什么呢？就是涉及付款发信这种高后果或者叫高风险的行动，会自动的进入这种叫Watch Mode，用户呢需要保持焦点，并且手动确认，否则的话流程就会超时终止。这个还是不敢直接替你花钱买东西，还要看后边怎么去改进吧。</p>



<p class="wp-block-paragraph">端到端的成果交付，可以直接生成可编辑的PPT、Excel、PDF等文件。这个算是对标Manus，或者是对标其他人做的Agent，现在大家都是有这功能，所以这一次ChatGPT的Agent也把这功能给你做上来了。他做的PPT还没有Manus做的好看呢。</p>



<p class="wp-block-paragraph">那另外就是跨设备的无缝切换，专门给大家演示了iOS安卓设备上，你也可以看看，你这个项目跑到多少了，你这个项目跑到什么状态了。像我平时用Deep Research的时候也是这样，我在电脑上说我现在要Deep Research了，然后我的手机上就会弹出来说，你有一个Deep Research的工作开始跑了，跑到什么样状态有个进度条，跑完了以后，他会告诉你说你这个结束了，你去看看结果是不是OK。因为Deep Research一次的话，有的时候长的也要10分钟，快的可能是五六分钟，也能跑出来。你不可能说我这边打了回车以后一直坐这等，还是要去做其他事情的。</p>



<p class="wp-block-paragraph">这次呢，把ChatGPT的连接器和计划任务呢，也都整进来了。可以通过官方的ChatGPT的Connectors，叫连接器，直接呢连接Gmail、GitHub、Google Drive这些服务。也可以将一次性任务，保持为定期的自动执行任务，比如每周干一什么事，这个现在都是允许的。</p>



<p class="wp-block-paragraph">然后多层的安全站，它既然已经这么强大了，你可以干各种各样事情了，你要注意，你不要去做一些危害人类的事情，所以OpenAI还是有一点点小底线的吧。也面向开发者呢提供了Agent SDK和API，但是这一块呢，现在应该还是一个预览版吧，我反正没有看到谁去用这个东西。</p>



<p class="wp-block-paragraph">性能呢，全面的跃升，它去解决各种人类实际问题的评分这块是上升了。这个呢，就是ChatGPT Agent的一个基本特性。</p>



<p class="wp-block-paragraph">谁能用呢？我还没用上。Pro用户就是200美元的用户，现在已经可以用了，每个月呢可以用400次。这玩意肯定不能让你随便使，因为实在是太耗TOKEN了。Plus用户，就像我这样20美元用户呢，每个月可以使用40次，其实基本也够用。像我现在，用Deep Research我觉得一天用不了一次，但是还是经常把额度跑光。现在Plus用户呢，应该是未来三天进行灰度推送，但是还没轮到我，哈哈，再继续等待。</p>



<p class="wp-block-paragraph">我自己观看演示以后的感受是什么样的？第一个是产品确实非常强大，能把这么复杂的任务，自己把它分配好，顺序的执行下来中间不乱，这个已经非常非常难了。另外第二个是什么呢？大概率是不会去用的。为什么呢？前面刚夸完人家这个很强大，你咋就不用呢？因为它的结果依然是不太可控的。</p>



<p class="wp-block-paragraph">直接通过模拟浏览器去点击网站，我一直觉得这个方向有毛病。为什么呢？就是每个网站都不一样，而且这个网站上还有各种防刷防骗的东西。比如说吧，有些网站，你通过一个IP地址打开多少次以后，我就直接把你封掉了，把这个IP地址给你封黑了。那你遇到这样的网站你咋办？因为它这个虚拟机，它的IP地址都一样的，它是跑在微软的机房里头的，你通过统一的机房IP，你去访问人家的这个网站去，那你跑着跑着给你封了。</p>



<p class="wp-block-paragraph">有的时候你需要二次验证，像前面我们讲的一个翻车，需要做二次验证，你也搞不定这个事你咋办？而且像我们比如说注册了很多账号，像谷歌呀、Twitter什么，这些账号我们都是要去做二次验证的，你不做二次验证就很容易被偷嘛。那你一旦做了二次验证以后，虚拟机里边的这个产品，他怎么去做二次验证？他根本就没法搞。还有一些需要去遵循其他的这种约定俗成的东西，你其实也是没有办法去完全的实现的。而且还有时候呢，这些网站自己还会更新，他更新的时候也不通知你，而且更新了以后到底是不是有bug，其实谁也不知道，经常更新出来那个网站是有bug的嘛。</p>



<p class="wp-block-paragraph">所以呢，你通过这样的一种非常不确定的方式，去连接各种服务的话，到底未来行会变成什么样，到底能不能稳定的去执行任务，我是表示怀疑的。像他这种用仿真浏览器的方式，去执行任务的这种模式呢，更像什么呢？更像是马斯克的纯视觉自动驾驶，说人既然可以搞定，那我用纯视觉的方式车也可以搞定。其他人说我们不太相信这玩意，我们上激光雷达，它更准确。对于我来说，我可能觉得激光雷达会更好一点。</p>



<p class="wp-block-paragraph">所以呢，未来可能是很多的服务，比如说订球票这些东西，应该是一些经过验证以后的安全的API出来，或者是MCP这样的这种服务出来，然后再由这些AI Agent去调用，才有可能让大家很好的把各种的交易串联起来，而不是说像现在似的，我们在各种的防骗网站中间，去点击鼠标，模拟人类点击，这个还是太不靠谱了。</p>



<p class="wp-block-paragraph">那么ChatGPT Agent到底给Manus这种泛Agent的项目带来什么呢？最后我们来回答一下这个问题。首先呢，给结论，这个绝对不是好消息，应该算是又敲响了一次丧钟吧。OpenAI每一次发表新的功能呢，都会有很多的创业项目就直接死掉了。这一次呢应该不算直接枪毙，但是绝对不是一个好的声音。</p>



<p class="wp-block-paragraph">虽然ChatGPT的Agent演示的，跟这个Manus的演示呢，算是各有所长，有些做的好一点，有些做的其实都不怎么样。但其实的结果是什么？ChatGPT也证明了说，这条路最后大概也就能走成这样的一个半半拉拉的样子就完事了。在一个赛道里边，其实不怕老大强大，而怕老大倒下。如果ChatGPT也就只能做成这个样子，那你所有在这个赛道上前进的人，就都比较危险。这是第一个，证明这种范Agent的模式是有问题的。</p>



<p class="wp-block-paragraph">而且呢，这一次虽然OpenAI演示翻了一次车，但是它也验证了另外一个事情是什么？就是模型及应用，你跑这种Agent是非常非常消耗TOKEN的。OpenAI模型是我们自己家的，我自己可以优化，可以定价可以亏钱，但是对于Manus这样的公司来说，模型是别人家的，你对它进行底层优化的能力就没有，那你需用了这些模型以后，你就得老老实实去按TOKEN付钱，去跑这种Agent的项目，你要去按TOKEN付钱的话，那是会跑破产的。</p>



<p class="wp-block-paragraph">在结果不那么靠谱的情况下，无法对模型层面进行优化，完全依靠这个外部调用的话，Manus这种项目其实是没有什么机会的。而OpenAI就是另外一回事，反正没那么靠谱，大家就去用就完了。Plus用户一个月44，Pro用户一个月440，你们就用吧。对于OpenAI来说它又不怕亏钱，每年亏个几十亿上百亿，对于它来说都是正常的。但是你Manus你亏得起这个吗？你亏不起的。</p>



<p class="wp-block-paragraph">所以最终的结论就是，OpenAI的ChatGPT Agent证明了两件事情。第一件事就是，这种泛应用的Agent依然没那么靠谱，就算是OpenAI，也没有办法让这个东西更加靠谱，因为它需要靠模拟人类去点击浏览器的方式去做事情。原来双十一上的时候，也经常是淘宝网站崩了，或者是银行网站崩了，中间需要多做一次验证什么，这种事多去了。所以你现在想让机器去替代人去做点击的话，我觉得这个这条路是有问题的。</p>



<p class="wp-block-paragraph">第二个是什么？第二个就是从成本的角度来去分析，Manus在这个赛道上它也跑不远。这就是今天咱们讲这故事。感谢大家收听，请帮忙点赞点小铃铛，参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径</title>
		<link>https://lukefan.com/2025/04/18/gpt-3%e4%b8%8eo4-mini%e4%b8%8d%e5%86%8d%e9%ab%98%e5%86%b7%ef%bc%9a%e8%9e%8d%e5%90%88%e5%b7%a5%e5%85%b7%e8%b0%83%e7%94%a8%e3%80%81%e8%ae%b0%e5%bf%86%e4%b8%8e%e8%b6%85%e5%bc%ba%e5%9b%be%e5%83%8f/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Fri, 18 Apr 2025 00:50:27 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI局限性]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI易用性]]></category>
		<category><![CDATA[AI普及]]></category>
		<category><![CDATA[AI未来]]></category>
		<category><![CDATA[AI模型发布]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[AI视觉]]></category>
		<category><![CDATA[AI记忆 (Memory)]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[API]]></category>
		<category><![CDATA[API代理 (Open Router)]]></category>
		<category><![CDATA[API定价]]></category>
		<category><![CDATA[ChatGPT Plus]]></category>
		<category><![CDATA[Function Calling]]></category>
		<category><![CDATA[Github Copilot]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[GPT-5展望]]></category>
		<category><![CDATA[Greg Brockman]]></category>
		<category><![CDATA[IDE集成]]></category>
		<category><![CDATA[Mark Chen]]></category>
		<category><![CDATA[Meta data分析]]></category>
		<category><![CDATA[O3]]></category>
		<category><![CDATA[O4 mini]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Sam Altman]]></category>
		<category><![CDATA[Scaling law]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[TikTok直播带货话题生成]]></category>
		<category><![CDATA[YouTube话题推荐]]></category>
		<category><![CDATA[一站式AI服务 (Total Solution)]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[内容创作]]></category>
		<category><![CDATA[图片推理 (Image Reasoning)]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[实时交互]]></category>
		<category><![CDATA[实用AI]]></category>
		<category><![CDATA[工具调用 (Tool Calling)]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[推理模型]]></category>
		<category><![CDATA[搜索集成]]></category>
		<category><![CDATA[模型对比 (OpenAI vs 竞品)]]></category>
		<category><![CDATA[潭柘寺图片识别]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[跨模态AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2110</guid>

					<description><![CDATA[家！人！们！炸！了！啊！🔥
今天手抖更新了ChatGPT Plus差点把手机摔了！原来被嘲"科学家玩具"的GPT-4O直接变身打工神器了！！

重点来了（拍桌）：
1️⃣ 工具调用直接封神！！！
现在让它写脚本会自己搜资料！上次问"TikTok带货新政策"，它当场扒出20+外网报道！最绝的是...
✨自动生成带数据+案例的完整提纲！！
✨还能记住我的写作风格！！！
（本博主当场失业预警😱）

2️⃣ 图片推理原地升天！！！
拿无人机拍的潭柘寺照片甩给它
直接识别出：
✅ 现代停车场
✅ 隐藏的通信塔
✅ 连台阶材质都分析！
（本路痴狂喜！以后旅游带AI就行）

3️⃣ 记忆功能太会了！！
现在每次对话都像老友重逢
上次说喜欢用"绝绝子"
这次生成文案自动带梗！！
（AI比男朋友记性还好怎么回事）

重点提醒‼️
免费用户用不了！Plus每周50次根本不够玩！
建议直接上200刀Pro版
（别问 问就是刚刷爆信用卡💸）

最后说句扎心的：
现在不用AI的博主真的会凉！！
赶紧去更新！晚1小时都是损失！！
（别等被卷死了来我评论区哭！）



GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。

OpenAI最新发布GPT-3与O4 mini，标志着AI不再仅仅是高深莫测的科研工具。本次更新核心亮点在于工具调用（Function Call）能力大幅提升，结合记忆功能，AI能更懂用户、调用外部数据完成复杂任务，告别空泛编造。另一大突破是强大的图像推理能力，实测分析潭柘寺照片展现惊人细节理解。老范详细解读了新模型的实用性，分析了免费用户、Plus用户（月付20美金，有限制）、Pro用户（月付200美金，无限量）及API（O3与O4 mini成本差异显著）的可访问性与价格。同时，GitHub Copilot用户可通过年费会员在IDE中便捷使用O4 mini。此次发布体现了OpenAI整合强化学习成果与各项功能的战略，未来GPT-5与Sora（世界模型）更值期待。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。" width="900" height="506" src="https://www.youtube.com/embed/ICUcxoOyJPo?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT-3和O4 mini发布了，这次绝不再仅仅是科学家们的玩具了。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">本来GPT-3和O4 mini发布呢，我并没有抱太大的期望。为什么呢？因为前面O1和O3 mini发布的时候呢，看得我头晕眼花的。我记得应该是在去年12天连续发布会的时候发布的O3 mini，实在是太不明觉厉了。各种的复杂科学问题，咔咔就给解决了，然后各种的排名都排得很高。但是呢，我自己其实并不怎么用。</p>



<p class="wp-block-paragraph">为什么呢？第一个，ChatGPT Plus用户里边呢，它是有用量限制的，并不是随便让你用的。所以在有用量限制的情况下，你就得省着用，而且你也感觉不出有太大差异来。你说你用它干嘛？据说编程很强，但是它没法跟IDE结合，基本上也就放弃了。你是可以出一大堆的代码，但是你还得向IDE里边去考来考去的，很麻烦。那你说我通过API调用吧，直接使用O1和O3 mini这些模型，实在是贵，所以就放弃了。</p>



<span id="more-2110"></span>



<p class="wp-block-paragraph">这一次呢，真的就不一样了。首先是Greg重新上线了。Greg其实好长时间不怎么出来了，他是在2023年11月份山姆·奥特曼宫变之后，就变得非常低调。2023年11月开始休假，后来是在微软的强烈要求下才回归的。到2024年又开始了长期休假，但是在大量高管离职之后，年底再次回归，还宣布：“我提前俩月回来了，我本来还想再多歇一歇的。”现在呢，主要负责机器人业务，不再担任董事会主席了，保留了总裁的职位。</p>



<p class="wp-block-paragraph">Greg上来开始显得有一些紧张，不知道该说什么。大家可以去看看那25分钟的发布会录像，后面逐渐放松了，也是长时间不露面、不说话的一个表现吧。这一次的话，全程C位，坐在最中间的位置上，主持O3和O4 mini的发布会，可见重视程度了。</p>



<p class="wp-block-paragraph">这一次的发布会呢，基本上是二对二的分配，就是两个老板配上两个做事情的。两个老板始终坐着不动，做事情的人呢，就是讲到不同的部分，然后来换。还有一个老板呢，叫Mark陈，首席研究官，亚洲脸，但不确定是不是华人。有传闻其父母是从台湾去的美国。现在呢，有一种ABC脸，看起来有点像华人，但是脸型又不像。这个据说呢，是长期英文发音和美式的饮食习惯，以及美国教育所形成的一种脸型，反正跟华人还是有一定区别的。有可能是个华人，当然也有可能是个越南人，这个不确定。</p>



<p class="wp-block-paragraph">另外两个呢，是根据演示的过程不同，不停地换工程师。国内引用的照片呢，肯定是有偏向性的。国内各媒体呢……</p>



<p class="wp-block-paragraph">通常引用的是讲到模型强化训练和各种跑分的这两位工程师。为什么呢？因为里头有一个叫周文达的，是一位华人。国内各个媒体引用照片的时候，一般会引用含华量比较高的照片。</p>



<p class="wp-block-paragraph">一开始呢，也是讲科学，什么量子力学。本来我也挺失望的。科学的部分呢，对于我这种普通人来说，已经没有那么大关系了——看不懂，没需求，也用不起。所以一看，还是这东西，好像没什么意思。</p>



<p class="wp-block-paragraph">但是讲到后边呢，越来越兴奋了。咱们讲几个好玩的特性，并不跟大家完整的去复述这个发布会了。有兴趣可以去看这个25分钟的发布会，各种数值绝对是遥遥领先。</p>



<p class="wp-block-paragraph">OpenAI呢，作为行业老大，他是有自觉的。什么叫自觉？从来不跟别人比数值，只跟自己比。就是他不会说我把Gemini 2.5拎出来比一比，Claude 3.7拎出来比一比，或者跟DeepSeek比一比。别人都是说我比OpenAI强在哪，或者我已经接近OpenAI了。OpenAI永远说我就跟自己比。</p>



<p class="wp-block-paragraph">所以我们现在可以看到的所有的数值比较，都是跟GPT O1、O1 mini、O3 mini跟这些模型进行比较的，没有跟其他模型比较的数据。</p>



<p class="wp-block-paragraph">咱们来讲三个有趣的功能点吧。</p>



<p class="wp-block-paragraph">第一个非常有趣的功能点，也是让我觉得GPT O3和O4mini真的能用了的一个最核心的点，就是它可以进行工具调用了。什么意思？我们正常情况下一个大模型，你让他去给你生成内容的时候，他其实都是在胡说八道的。就算他有的时候说的很像，但他依然是在胡说八道，是在编。他不能保证内容是可验证的，而且你每一次让他说同样的事情，他都给你编出不同的花样来。</p>



<p class="wp-block-paragraph">那么一定要带上搜索，带上知识库，带上其他的辅助工具，他才可以靠谱的干活。现在推理模型已经可以靠谱的干活了。所以O3跟O4mini是可以进行工具调用的。但是他们绝对不是第一个。在发布会上他们讲说，我们是第一个在推理里边进行工具调用的，这个真的不是。GROK3也是推理模型，也是可以做各种工具调用的。</p>



<p class="wp-block-paragraph">只是呢，GPT O3跟O4 mini呢，据说在工具调用上要有极大的提升，因为他们在这块专门做了训练。他可以进行几十次的这种工具调用。当你让他去做一个很复杂的事情的时候，他会反复的在他认为需要的时候去调用工具，获得外部数据，或者做一些相应的操作。这个很棒。</p>



<p class="wp-block-paragraph">O3跟O4mini呢，是在推理的过程中去调用工具，效果绝对是碾压原来不能使用工具的O1，效果好的一塌糊涂。推理模型如果不挂搜索引擎……</p>



<p class="wp-block-paragraph">不挂知识库，基本上就是胡说八道。他要比正常的生成模型还要再胡说八道一些，因为他想的多，越想就越错。知识越多越反动，这个幻觉是非常非常严重的。挂上搜索之后，基本上不再需要 deep research 这种东西了。现在你用 O3 去挂搜索，跟 deep research 的效果基本上是可以平齐的。</p>



<p class="wp-block-paragraph">现在呢，OpenAI 内部有很多的工具，包括 Python 执行、调用浏览器、搜索，有很多这样的工具，它都可以自动的去调用。当有这些功能之后，每一个普通人，不需要是科学家，也可以用 O3 跟 O4mini 完成很多任务了。只是目前呢，OpenAI 内部的这些工具，你通过外部你使不了。还有 function call 这个调用呢，现在在代理站上还没有接上，这个还要再等一等。什么意思？就是你直接挂 OpenAI 的 API，挂它原厂的，是可以进行 function call 的，可以把你自己的各种各样的工具放在里边让它去调用。原来我们演示过使用高德地图的工具，让他去找饭馆、规划路线什么的，这个都是可以去使用了。如果我们使用 API 来调用 O3 和 O4mini 的话，OpenAI 内部的什么搜索呀，这些工具我们是无法使用的，就差在这了。这是一个比较有趣的点，但是具体怎么用，待会我们来举一个案例。</p>



<p class="wp-block-paragraph">第二个有趣的点是什么呢？就是跟记忆相结合了。原来我们专门录了一期视频来讲 OpenAI 有了记忆功能，现在它也有记忆功能。于是我就向它提出了要求，我说：“根据你对我的了解，我是个 Youtuber，给我推荐一些适合我的 YouTube 话题，我要去写稿去了。”然后他就开始去搜索，调用搜索工具去搜索去了。搜索完了以后说：“我发现你是专门讲 AI、讲科技、讲流量、讲创投的博主，我发现有哪些哪些话题最近是最新的，适合你去讲。”其中有一个话题呢，叫 TikTok 降低了海外直播带货门槛。原来呢是要 1,000 个粉丝才可以带货，现在 200 粉丝就可以带货了，说这个你看怎么样？我说这个不错。我说：“你根据你对我的了解，给我去写个提纲吧。”然后他就按照我的习惯，给我夸夸把提纲列好了，说 TikTok 是哪天哪天发了一个什么样的文儿，为什么什么东西，写的还很好的一个提纲。在这个过程中引用了我的记忆，调用了搜索，聚集了大量的信息。我再说：“那你再给我补充点数据和观点吧。”一般我是会有一个自己的观点，我说：“我的观点是什么什么，你给我补充进去。”然后呢，我为了论证我的观点。</p>



<p class="wp-block-paragraph">我还需要哪些数据？然后，夸夸夸又去搜索，搜索完了给我补充进来。做了两次补充以后，这个提纲基本上就完成了，就完完全全可以用了。过几天咱们去讲这个“TikTok降低海外直播带货门槛”这个故事吧，这个还是很有趣的一个点。所以现在真的是每个人都能用上了。</p>



<p class="wp-block-paragraph">第三个比较好玩的点是什么呢？就是图片推理。这个图片推理是非常非常强的一个点，绝对不是识别图片，然后将文字作为提示词去推理。我们很多人一看图片推理这件事，都是想的说，我们把这个图片识别一下，变成一大堆文字。不是这样。</p>



<p class="wp-block-paragraph">跟大家举一个案例吧。我今天去潭柘寺了，玩我的无人机。拿我的无人机呢，在潭柘寺的外面，拍了一张俯瞰潭柘寺的全景照片。我就问O3，我说这是哪？这个建筑群的布局是什么样的呀？这个提示词就这样的。问完了以后呢，这个O3就去干活去了。他把这个图片先整个的分析一下，然后呢，放大每一块切割，说这一小块是什么，那一小块什么，把它切成一块一块的。然后对每一块进行识别，而且在切完了以后，还对每一块去调整方向，说这块好像你拍歪了，改一个方向，可能更能认出是什么来。通过这样的一个方式去推理，看那个推理过程，惊讶的我目瞪口呆，我告诉你。</p>



<figure class="wp-block-image size-large"><img decoding="async" src="https://yt3.ggpht.com/V8YuR81dkoI4c4XrT_1NNc3OC-nnED98ttqo20HUVhT0uffz8E-yZymr54jlkHtR8gnfCSkxbGOS7Q=s1600-rw-nd-v1" alt=""/></figure>



<p class="wp-block-paragraph">最后告诉我说什么？从这张航拍来看，这是一张典型的依山就势、三层台地式布局的北方佛寺，很像北京西山脚下的潭柘寺。我没有告诉O3这是航拍照片，他就全都认出来了，好聪明。但是注意不要被骗了，照片里面是有Meta data的，就是有一些基础信息的。这个信息包括什么？拍摄时间、分辨率、色彩、空间、光圈、快门、白平衡，都在里头。还有拍摄设备那个里头，写着你是用大疆的什么设备拍的，大疆air 3S。然后呢，这个照片里还写着经纬度，因为大疆的无人机里头是有GPS的，它拍完照片是会把经纬度直接写在照片里的。完完全全可以通过这些Meta data就编出来的。</p>



<p class="wp-block-paragraph">所以呢，这个到底是真聪明还是假聪明？还是说我把经纬度拎出来，把这个拍摄设备拎出来，就直接搜索一下，就给你出结果了？这个我们要往下看。他呢还给我接着讲，说这个图片是中轴对称的三进院。第一进呢叫山门到天王殿，第二进呢是天王殿到大雄宝殿，第三进呢是大雄宝殿到法华殿和藏经阁。中轴线两侧各有回廊和配殿，比如观音殿、药师殿、僧房、斋堂，左右分布对称，也有现代化的客房和管理用房。</p>



<p class="wp-block-paragraph">再往后还写了一个特别有趣的东西：底层的停车场与服务中心，通过台阶与甬道与寺内各层相连。右侧的通讯塔，现代建筑。</p>



<p class="wp-block-paragraph">为后期补建的配套设施，这是不是根据潭柘寺的信息搜索出来的呢？这就是我们要去问的。他到底是真聪明还是假聪明？</p>



<p class="wp-block-paragraph">潭柘寺最后的一进大殿不叫藏经阁，而是叫毗卢殿。应该是五方佛中间一个，然后后边是东方、西方、南方、北方，一共是五个佛在里面，所以不一样。但是中国寺庙的默认布局呢，最后一层是藏经阁。所以这个并不是直接搜索出来的。如果直接搜潭柘寺的话，他应该写最后一层是毗卢阁。</p>



<p class="wp-block-paragraph">至于底层的停车场、服务中心、现代通信塔，绝对是图片推理推出来的。因为不会有哪个介绍潭柘寺的网页去把这些东西都给你写在里头，所以还是非常棒的，可以进行图片推理。</p>



<p class="wp-block-paragraph">有了这些有趣的功能之后，咱们可以通过什么样的方式来使用它呢？现在免费用户无法使用。你说我不愿意交钱，那么O3跟O4mini你使不了。Plus用户，像我这样的一个月20美金的用户，是可以使用的，但是有限制。O3每周50次，我今天大概已经使了有五六次了。O4 mini呢是每天150次，这个应该足够使。如果是每个月200美金的Pro用户，无限量使用。</p>



<p class="wp-block-paragraph">API依然很昂贵。使用它的API，我可能还要稍微掂量掂量。O3每100万TOKEN的输入是10美金，输出是40美金。O4mini要快一些，也要小一些，它呢每100万TOKEN的输入是1.1美金，输出是4.4美金。应该比在美国部署的DeepSeek R1相差仿佛吧，就是基本上还是可以用的。</p>



<p class="wp-block-paragraph">这种推理模型呢都是话痨模型，价格还是挺贵的。特别是10美金100万TOKEN输入，40美金100万TOKEN输出，这个非常非常昂贵。再结合上工具调用，图片推理，这个价格就像坐在日本的出租车里，看着计价器跳的那叫一个心惊肉跳。</p>



<p class="wp-block-paragraph">其他的一些代理，就是这种API代理也已经开始工作了。Open Router或者其他的一些代理都可以使用，价格是相同的。只是呢，目前function call还没接上。为什么要专门强调这个？因为有些人在国内充值OpenAI的API是比较费劲的，像我就是这样。所以我使用OpenAI的API都是通过各种的代理去使用的。</p>



<p class="wp-block-paragraph">还有一些什么方式可以使用的呢？GitHub Copilot里头是有GPT4 O4 mini的，但是没有GPT O3。它只有这些mini模型，它有O1，但是没有O3上来。O4 mini的话，应该是可以大范围使用的，但是前提你还是付费的。</p>



<p class="wp-block-paragraph">像我是Github Copilot，99美元一年的会员。所以呢，我现在可以在IDE里边去使用它，Client和Roo Code也可以通过Github Copilot的会员直接去使用GPT-4 mini。那你说Client或者是Roo Code，我自己挂OpenAI的API或者是Open Router的API行不行？没毛病，都可以使，但是你得按TOKEN付费，那个很贵。挂Github Copilot下面的GPT-4 mini的模型的话，你有那个99刀一年的年费，就可以放心的玩耍了。</p>



<p class="wp-block-paragraph">总结一下，OpenAI现在前进的方向到底是什么样的？它呢正在将各种零散的功能点聚集在一起。其实记忆早就有了，function call早就有了，推理早就有了。他一方面呢，是在拼命的去做强化学习，然后告诉大家现在强化学习scaling law依然管用。你把更多的数据、更多的算力堆进去，强化学习的效果就能起来，没有任何问题，大家好好去买英伟达显卡。另外一方面，它就把各种其他的小功能给你凑起来了，包括记忆、function call、推理、搜索呀，把这些东西给你搁在一块，你看真的好用。</p>



<p class="wp-block-paragraph">其他各大模型厂商呢，在某些方面可以接近甚至赶超OpenAI，但是综合实力上，OpenAI绝对还是领先的。当OpenAI把各种新功能聚合在一起的时候，绝对是遥遥领先。它在每一个细节点上，可能都会比别人强很多。就像咱们前几天讲过GPT-4O的绘图功能，它虽然说在完整的绘图过程中，它表现力上、艺术感上没有Midjourney强，但是呢，它在文字理解上、文字渲染上，肯定是要比其他所有的这些绘图模型都要强很多的。</p>



<p class="wp-block-paragraph">GPT-5现在正在路上了，甭管是今年下半年能出来，还是什么时候能出来，我觉得都是值得期待的。到那个时候就不用再去选模型了，你上来以后，他就根据你的问题直接推荐，直接给你反馈了，说我这个应该推理还是不应该推理，应该使用更大的模型还是使用小一些的模型，我应该调用哪些工具，应不应该搜索。这个我觉得还是值得期待的，就像以前我们总讲的，叫total solution，一站式服务。你进来了以后，我给你服务好就完了，至于我到底给你上了几个工具、几个模型，你就甭问了，最后是包你满意。</p>



<p class="wp-block-paragraph">后边还有Sora，还是有念想。虽然Sora前面翻车了，现在大家都已经把它忘掉了，但是当它把这么多的功能聚集在一起的时候。</p>



<p class="wp-block-paragraph">什么搜索呀、工具呀、推理，把这些东西跟Sora聚集在一起的时候，可能又会变出一些新的、不一样的东西出来。</p>



<p class="wp-block-paragraph">Sora当年可是号称叫“世界模型”的。当它跟我们真实世界通过搜索引擎连接在一起的时候，那可能真的就要创造世界了。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？</title>
		<link>https://lukefan.com/2024/12/25/openai%e7%94%a812%e5%a4%a9%e5%8f%91%e5%b8%83%e4%bc%9a%ef%bc%8c%e4%b8%ba%e4%b8%9a%e7%95%8c%e6%8c%87%e6%98%8e%e6%96%b9%e5%90%91%e3%80%82%e4%b8%a8%e4%bb%8eo1%e5%88%b0o3%ef%bc%8c%e8%bf%99%e4%ba%9b/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 25 Dec 2024 00:51:55 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AGI]]></category>
		<category><![CDATA[AI API调用]]></category>
		<category><![CDATA[AIGC未来]]></category>
		<category><![CDATA[AI与机器人]]></category>
		<category><![CDATA[AI互动演示]]></category>
		<category><![CDATA[AI人工智能发展]]></category>
		<category><![CDATA[AI创业]]></category>
		<category><![CDATA[AI创新应用]]></category>
		<category><![CDATA[AI发展方向]]></category>
		<category><![CDATA[AI工具进化]]></category>
		<category><![CDATA[AI开发]]></category>
		<category><![CDATA[AI慎重对齐]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI技术突破]]></category>
		<category><![CDATA[AI推理模型]]></category>
		<category><![CDATA[AI数学能力]]></category>
		<category><![CDATA[AI用户体验]]></category>
		<category><![CDATA[AI用户覆盖]]></category>
		<category><![CDATA[AI硬件控制]]></category>
		<category><![CDATA[AI编程比赛]]></category>
		<category><![CDATA[AI行业分析]]></category>
		<category><![CDATA[AI行业标准]]></category>
		<category><![CDATA[AI训练成本]]></category>
		<category><![CDATA[AI高端功能]]></category>
		<category><![CDATA[API增强]]></category>
		<category><![CDATA[API降价]]></category>
		<category><![CDATA[ARC AGI测试]]></category>
		<category><![CDATA[CANVAS项目]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[ChatGPT API]]></category>
		<category><![CDATA[ChatGPT Mac版]]></category>
		<category><![CDATA[ChatGPT实时语音]]></category>
		<category><![CDATA[GPT-5]]></category>
		<category><![CDATA[Notion AI]]></category>
		<category><![CDATA[O3 API特性]]></category>
		<category><![CDATA[O3mini]]></category>
		<category><![CDATA[O3性能]]></category>
		<category><![CDATA[O3模型]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI AGI]]></category>
		<category><![CDATA[OpenAI O1升级]]></category>
		<category><![CDATA[OpenAI 视觉输入]]></category>
		<category><![CDATA[OpenAI与开发者]]></category>
		<category><![CDATA[OpenAI使用技巧]]></category>
		<category><![CDATA[OpenAI具身智能]]></category>
		<category><![CDATA[OpenAI功能整合]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[OpenAI安全机制]]></category>
		<category><![CDATA[OpenAI高成本运算]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[WebRTC]]></category>
		<category><![CDATA[人工智能动态]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[函数调用]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[实时语音]]></category>
		<category><![CDATA[搜索与语音集成]]></category>
		<category><![CDATA[结构化输出]]></category>
		<category><![CDATA[视觉实时语音]]></category>
		<category><![CDATA[高端推理模型]]></category>
		<category><![CDATA[高级语音功能]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1795</guid>

					<description><![CDATA[啊啊啊啊啊！！！OpenAI的12天发布会真的是一场撼动人心的盛宴！🎉虽然我有点小失望，没见到期待中的Dalle和GPT-5，但后续的每一天都带来了不少惊喜和技术革新！✨

从第八天的实时语音与搜索合并功能，到第十天的直接电话通话功能，OpenAI正在不断打破传统界限，把AI带入我们生活的每一个角落！📞

想象一下，未来你只需拨个电话，就能与AI聊天，甚至还能通过WhatsApp与它沟通！这对于那些对科技理解不深的人，真的太友好啦！😍

而且，开发者日上，O1 API的增强功能让程序员们兴奋不已！功能调用、结构化输出……这些都在改变编程的游戏规则！💻

最后，令人期待的O3模型也在第十二天横空出世，超高的推理能力让人对未来AGI的希望再一次点燃！🔥

总的来说，OpenAI这12天的发布会，即使没带来革命性产品，但却为整个行业指明了方向！未来真的值得期待！🚀

家人们，快来评论区聊聊你们对这次发布会的看法吧！💬❤️

OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？

OpenAI连续12天的发布会让整个科技界目不暇接，发布从实时语音与搜索的结合到O3强推理模型的登场，展现了AI未来的无限可能。然而，缺乏GPT-5或4.5的升级，令许多人感到遗憾。开发者日带来的API增强、WebRTC实时功能和成本下降，为编程界注入新活力。而带视觉的高级语音、O3mini、以及谨慎对齐技术，为AGI和具身智能发展开辟了新路径。随着2025年的临近，AIGC行业方向已经非常明确，未来将迎来更多具突破性和人性化的AI产品。在这场革命性技术狂欢中，无论是用户体验、开发者生态，还是行业标准，OpenAI始终稳居引领者之位。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="OpenAI用12天发布会，为业界指明方向。丨从O1到O3，这些革命性进展将如何定义AI未来？" width="900" height="506" src="https://www.youtube.com/embed/exikA4YhwDw?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">OpenAI连续12天的发布会到底为世界指明了什么样的方向？大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">OpenAI的12天发布会已经结束了。首先，从我个人的感受上来说，稍微有一点点失望。没有带来新一代的Dalle，也就是绘图模型；也没有GPT-5，哪怕是GPT-4.5的升级都没有。Sora虽然发布了，但是他所发布出来的产品跟大家的预期是严重不符的。</p>



<p class="wp-block-paragraph">那么，这12天到底都发了些什么呢？前面7天其实已经录了一期节目进行总结了，咱们这里就不再重复。后边5天，第八天是搜索和实时语音进行了合并。我在前面7天总结最后的时候，讲了一下我说，现在OpenAI发布了大量的工具，是隔离的。语音是语音，搜索是搜索，canvas这种画板，还有其他的很多工具，是相互隔离的。就是你要选择其中一个功能，其他的功能就不能选了。未来的话，一定会逐渐把他们再合并起来。</p>



<span id="more-1795"></span>



<p class="wp-block-paragraph">第八天就给大家演示了通过带有搜索功能的实时语音，解决很多现实的问题。原来实时语音你跟他聊了半天，他是就给你瞎编的，就是截止到某一个时间点的知识，然后以此为基础来跟你去闲聊。现在的话，你就真的可以问他：“今天天气怎么样？哪个地方餐馆是不是定满座位了？”他可以用一些真实的信息来给你回答，这个就会变得非常有趣。甚至，他们还演示了一下去结合地图跟大家做一些回复，说哪个地方有什么什么东西。他可以把这个地图调出来，你附近有哪些好的餐厅，有哪些好玩的地方。</p>



<p class="wp-block-paragraph">到第九天，叫开发者日。这么多功能出来了以后，他给大家了一些API，也就是像我们这些程序员可以通过API把这些功能集成到我们自己的程序里边去。所以，先给大家看了O1的API进行升级。大家注意，O1原来我们是可以通过API去调用的，只是它很多东西都没有，包括函数调用、结构化输出、视觉输入，这些东西实际上都没有。这些是在4O上都有的东西，但O1上没有。稍微跟大家讲一下什么叫函数调用。</p>



<p class="wp-block-paragraph">就是我们在调用大模型的时候，按道理说应该是我们给他一个提示词，他就吭哧吭哧就干去了。但为了能够让他有一些更多的功能呢，OpenAI也好，或者很多其他的这种大模型也好，都有这种函数调用功能。就是你跟他描述一下，说这个函数是查天气的，以后遇到查天气，请调用这个函数，直接把这个天气查出来。等于你把一个实际天气预报的网站就可以封装成一个函数，告诉这个大模型，然后它就可以去做这样的工作，等于它就具备了查天气的功能。</p>



<p class="wp-block-paragraph">这个就叫做函数调用。而所谓结构化输出是什么呢？就是我们正常看到大模型输出的，都是乌七八糟的一大堆话。你想在里边找到真正有用的东西，然后再到下一个模型里去调用的话，有几种方式。第一种呢，就是你再给他一个大模型，说来把这个里头有用的信息总结总结，然后到下一个地方再去使用。但是这种方式呢，会有一个问题，过了大模型这个过程了以后的话，每一次的结果是不可预期的。有的时候找得着，有的时候未必找得着，这个会挺麻烦的。</p>



<p class="wp-block-paragraph">另外一种方式，就是我们常用的方式，是把它写程序，直接在这个输出的内容里边进行正则表达式的过滤。就是说我过滤一下，这个里头有没有谁的名字呀，有什么性别呀，还有什么这些东西，然后把这些数据拎出来，然后到下一个环节继续使用。以前我们是这么使，但后来OpenAI就发明了一个方式，说哎，我干脆结构化输出吧。我再输出出来的东西，就不是一个完整的文字了，而是把它拆成程序员比较习惯使用的JSON格式。他上来就告诉你，这个人的姓名是什么，性别是什么，然后有3个人形成数组，每一个的属性都按这个方式写好。那这样的话，我们在后边拿程序去接收这个数据的时候，就直接可以拿这个已经结构化好的数据去把相应的信息拎出来，往下一个环节去走。这块还是很棒的。</p>



<p class="wp-block-paragraph">至于视觉输入的话，他其实干的事情很简单，现在的O1的API可以直接往里塞图片了。原来都是你需要用文字去描述，它是不支持图片的，现在支持了。</p>



<p class="wp-block-paragraph">这就是O1的API增强的东西。然后呢，给大家演示了一个叫WebRTC。加上WebRTC以后呢，等于我们自己的程序里头就可以有这个实时语音功能了。原来我们没有办法做这个实时语音，是因为呢，我们需要通过像API的方式来去调用它。必须是我先得到了一段声音，然后把声音塞到这个后台的服务器上去，先给我识别说说文字，然后呢，它产生结果，再去给我念。原来是这样。现在的话，就是它可以做WebRTC了。</p>



<p class="wp-block-paragraph">RTC什么意思呢？叫Real Time Communication，叫实时通讯。所谓实时通讯就是说，你给了它这个音频流或者是视频流，给了它以后呢，它等于实时的去处理了。像我们使用的OpenAI的高级语音功能，就是它是说着说着你可以打断它，它会听到你的声音，然后接着跟你聊。这个东西就是WebRTC实现的。</p>



<p class="wp-block-paragraph">咱们日常生活中各种的会议软件，还有很多直播软件，实际上它背后用的技术都是WebRTC。那么现在都是我们给大家提供WebRTC的这种API，你也可以让你的应用或者网页呢，拥有这种可以被实时打断的高级语音功能。这个也是一个非常棒的技术，至少对于程序员来说，稍微有点激动人心哦。</p>



<p class="wp-block-paragraph">还有一个让程序员比较开心的事情，就是API降价。你调用了API，它是按TOKEN来收费的嘛，要每过一段时间都会降价，降一点点。那么又降价了，这个是让程序员开心的事情。</p>



<p class="wp-block-paragraph">这是第九天开发者日。到第十天呢，发布了一个特别有趣的功能，就是直接电话通话功能。他给ChatGPT申请了一个电话号码，大概是1-800-ChatGPT。大家可以直接给他打电话，而且呢，应该是每一个电话，每个月应该有十几分钟的免费时长，可以去跟他进行通讯。他发布了这么一个有趣的东西，就是你不需要安装APP，上网页登录账号都没有，随时抄起一部电话来，就可以去跟他聊天了。</p>



<p class="wp-block-paragraph">除了这种方式之外呢，还可以做WhatsApp。你把刚才那个1800……</p>



<p class="wp-block-paragraph">后边ChatGPT的这个电话号码呢，写在联系人里，以后就可以使用WhatsApp跟他进行通讯了。跟他聊天也是允许的，这样的话，他等于极大地去扩容他的用户层面。很多的老人小孩，原来从来没有接触过电脑，没有接触过网络，没有接触过手机的人，就开始可以成为他的用户了。这个也是很有趣的一个发布吧。</p>



<p class="wp-block-paragraph">我尝试了一下，我没法使，因为我的WhatsApp是用大陆手机号注册的。我使用大陆的手机号去给他打这个电话的话，肯定他也不会有任何回应，所以呢，就不用费劲了。</p>



<p class="wp-block-paragraph">这是第十天。到第十一天呢，做了一个Mac桌面版的升级，可以呢看到Notion以及其他笔记软件里边的信息，然后还做了一些高级语音功能的整合，也就是刚才我们讲的ChatGPT的Mac版。你连到本机的Notion以后，或者连到本机的各种应用上，今后你现在可以跟他说话，通过说话的方式来控制这些应用了。</p>



<p class="wp-block-paragraph">这是第11天。到第12天说终于到最后一天了。我记得到第11天的时候，就去讲说明天特别激动人心。在前边应该是发布apple intelligence那天呢，也在说说这个，以后有一天我们会发布这个AGI的，激动人心的AGI。所以呢，就是留足了悬念，大家就都等第十二天了。终于到第十二天了，坐在这看发什么了。</p>



<p class="wp-block-paragraph">他发了一个叫O3的模型，这个就实在是太厉害了，都不好意思叫O2，因为前面一个模型叫O1嘛。说O2我们跳过了，我们直接叫O3了。整了这么个东西，是一个非常强大的推理模型，然后也发布了O3 mini，还有一个叫谨慎对齐的技术。</p>



<p class="wp-block-paragraph">现在呢，这些O3模型呢都是期货，O3 mini是到明年1月底可以跟大家见面，而O3的话还要再往后推一些，据说是在O3 mini发布以后的一个时间跟大家见面。目前呢是开放了安全员申请，就是你可以申请成为安全员，进去呢帮他评测一下他们的安全机制是不是有效。因为这么厉害的模型出来以后的话，一旦是被坏人利用了，那等于坏人也如虎添翼吗。</p>



<p class="wp-block-paragraph">这个是他们不希望看到的。具体第12天的东西呢，咱们后边详细讲一下，这个还是有点意思的。然后到第十三天，对，连续发布12天嘛。第13天还有事。到第13天呢，山姆奥特曼发了条推特，说从今天开始，Sora一直到年底，免费给大家使用，就是不限额随便使。我估计呢，它Sora发布出来以后，发现完全没有什么热度，没有什么人愿意在上面折腾。因为呢，很多人试了以后发现效果并不好，特别是很多物理bug，比如说多个手指头，或者什么腿往外弯了，两条腿变三条腿了呀，什么这种事情稍微有一点点多。而且呢，他限制非常严，像我到现在在他的Sora上，不可以画有人的视频。所以呢，我就试了一次，以后就再也没登录过。虽然我作为plus用户，每月还是有一些绘画的，或者绘制视频的这个额度的，但是没兴趣。</p>



<p class="wp-block-paragraph">现在他又出来找补来了，说我们第13天还有东西，就是大家可以继续去使用Sora，作为圣诞庆祝，因为他觉得后边该过圣诞节了，大家都应该去画一些视频出来，然后去四处发发社交媒体，给人祝福祝福，这是一个很好的时间点。但是从现在来看呢，我并没有看到什么响动。怎么叫看到响动？别人画没画我怎么知道呢？也很简单，就是你到Twitter里边去，到YouTube里头去，如果你发现有大量由Sora渲染生成的这种视频在传播，在大家互相的转发点赞，那说明呢，这个策略是成功的。但是他发了这个推特以后呢，我并没有发现有任何变化，所以我觉得这个事情，应该他的目标没有达成。</p>



<p class="wp-block-paragraph">好，下面呢，咱们稍微详细的讲一下第12天的O3发布吧。O3模型呢，就是这种博士生模型，前面我们还专门录了一期视频，再去讲如果花2,000美元一个月，让你去雇佣一个达到博士级别的AI助手，你到底愿不愿意？那么现在看来，人家也不是无地放矢，实际上都是在为O3去打基础。O3模型呢，在编程比赛里头获得了2,700多分，当场做主持的那哥们大概是做了2,500分，然后旁边的山姆奥特曼就问他说：“你多少分？”</p>



<p class="wp-block-paragraph">他说2,500，当时那个脸就不是那么好看。但是他马上纠正说：“哎，我知道公司里头是有人得到3,000分的。”对于他们来说，我估计达到2,500就已经很强了。因为那个比赛我自己没有跑过，但是我估计以我的能力，应该是差得比较远。因为现在脑子已经比较木了，不是原来每天坐那写程序的那种脑子了。</p>



<p class="wp-block-paragraph">然后呢，他说：“哎，公司里有人是3,000分的。”然后山姆·奥特曼的反应特别逗，他说：“这个3,000分，这哥们也蹦跶不了几天了。”为什么呢？因为以AI的进化速度，他想去追上人类的这一点点分数差异是非常容易的。特别是在这种规则比较明确的挑战赛上，人类是不太可能很长时间保持优势的。</p>



<p class="wp-block-paragraph">第二个是参加数学竞赛，也得到了一个非常高的分数，就做错了一个题。山姆·奥特曼就想起来问说：“兄弟，你那个数学竞赛考了多少分？”那哥们赶快松了一口气，在老板面前保住面子了。他说：“我是满分，我一个题也没错。”后来又赶快找补，他说：“我是做出过满分答案的。”</p>



<p class="wp-block-paragraph">对于这个O3来说，对于这种大模型来说，你让他反复去做，他最后肯定也是能够做出满分答案的。甚至原来还有那种猴子理论，就是你让一堆猴子在这随机的点点点，或者随机的打字的话，都有可能能够形成有意义的长文本。所以你让O3反复叙事，他肯定也能够达到满分，这个不用担心。我估计这哥们也是压力挺大的，老板坐在旁边，随便出点什么数：“你多少分？”这个还是稍微有一点点吓人。</p>



<p class="wp-block-paragraph">而且他说他满分了以后，估计他也想明白了：“说不对，这个不是老板在面试我，不是在考教我，我们是在发布新产品，还是要说产品牛。”然后赶快又找补回来了这个东西，这个也是很厉害的。但这一点上呢，一定是O3体现出了极强的编程能力和数学能力。</p>



<p class="wp-block-paragraph">然后参加了一个叫ARC AGI的测试，这呢是一个全球可以开放的测试，所有做AI的人都可以去拿自己的模型上面去跑去。GPT-3在里面大概是0分，GPT-4是5分，4O可能比这个4稍微好那么一点点，O3的话是达到了87.5分。</p>



<p class="wp-block-paragraph">这是一个非常非常高的分数了。人类的平均水平是84分，所以它已经超过人类了。我们正式向AGI进发了。这个比赛呢，超过85分的就可以获得60万美金的奖励，还是一个非常棒的比赛。但是呢，它也展示了另外一个事情，就是O3模型的运行是需要超高的运行成本的。</p>



<p class="wp-block-paragraph">为了应对这个超高运行成本，他们还设计了一个很有趣的东西，就是在你每一次向O3问问题的时候，可以设置说，我到底是用这个高成本运算、中成本运算，还是用低成本运算，而不是像原来使用GPT式的，就是你只管问，它自己来根据你的问题决定使用多少算力、多少成本来算出结果来。</p>



<p class="wp-block-paragraph">他们参加这个ARC AGI的测试的时候，如果使用低成本运算的话，只能得到75.7分。虽然没有达到人类的平均水平，但已经很高了。然而，这样的75.7分的结果是用20美金算出来的，不是20美金一个月，而是20美金一次哦。这是非常非常恐怖的。</p>



<p class="wp-block-paragraph">他们刚才说的这个87.5的分数，超过人类平均智力水平，这个分数是用高成本算出来的。他算一次需要花几千美金，这是非常吓人的。所以前面录节目讲的这个2000美金一个月的，我觉得2000美金未必够他烧的。就是你按照运转一次就需要花几千美金的这种高成本运算来算的话，那这个收费的方式可能还需要重新思考一下。</p>



<p class="wp-block-paragraph">除了发布这个O3之外，还有O3mini。O3mini呢，是高中低三档算力开关，也是如此。效能呢做了很大的提升，低成本推理这一档呢，速度很快，基本上跟GPT4O的速度是一样的。现在我们使用O1 mini、O1这样的模型的话，它的速度是非常慢的，你需要等半天才能有结果出来。但是呢，使用O3mini基本上是可以达到4O水平的。</p>



<p class="wp-block-paragraph">然后使用中档推理的时候，可以达到O1的这个效果，但肯定它比O1要便宜嘛，因为它是叫迷你的一个版本嘛。但是呢，它的运算的结果跟O1是一样的，但是高档就没事没得比了嘛。</p>



<p class="wp-block-paragraph">而且呢，O3 mini呢，提供了丰富的API，就是结构化输出函数调用，这些都给了大家可以去写程序去使用了。但是O3的API到底长什么样，这个就不好说了。除了O3和O3 mini之外呢，还发布了一个东西叫谨慎对齐。你发了这么神奇的东西，万一有坏人用怎么办呢？所以这个事情一定要去讲一下。</p>



<p class="wp-block-paragraph">他们整了这样的一个谨慎对齐，实际上是什么？这是原来我们要去对齐的时候，或者说我们要去甄别用户提进来的提示词，是不是恶意或者隐藏恶意的时候呢，他们以前都是通过这种静态的关键词去进行过滤的。现在说不用了，我们训练了一个模型，然后这个模型呢，自己可以推理出一个标准来，灵活地去甄别每一次的提示词。但是这个呢，现在请大家报名去做测试，看看到底能不能突破它。因为我对于他们的这种数学和推理能力，其实是缺乏理解的。就是以我的这个理解状态来说，我觉得这个谨慎对齐的这些安全方式的话，应该突破不难。这个等他慢慢后面进化去吧。</p>



<p class="wp-block-paragraph">通过第三天的发布呢，我们看到了一个非常有趣的现象，也就是OpenAI的用人原则。他们其实就是通过各种的智力测验、各种的编程比赛、数学比赛，挑了一堆的这种天才儿童坐在这。但是我们去讲“天才儿童”这个词的时候，听到的朋友们，你觉得这是一个完全正面褒义的词吗？好像不是吧。</p>



<p class="wp-block-paragraph">现在这一群的天才儿童坐在一起，给我们带来的产品就是O3、O3 mini，一些普通人已经完全无法去理解和使用的一个强推理模型。没有给我们所期盼的普通人能够用的GPT-4.5或者GPT-5，而是给了我们一个O3。我们对天才儿童的这种认知，一般是什么样的？咱们从字面意思上去理解的话，大概是这样。这帮人在某一些特定的环境下，已经跑得非常远了，一骑绝尘跑出去了，让其他人完全无法望其项背了。但是呢，对于正常的生活，柴米油盐酱醋茶来说，基本上是弱智。反正至少我的对于天才儿童的理解是这样的。所以呢，现在GPT的O3以及他的谨慎对齐的话。</p>



<p class="wp-block-paragraph">我基本上是按照天才儿童的方式来理解他们的，这个事没有什么依据，这就是完全的感受。好，这就是第十二天发布的产品了。往后呢，我们来讲一下OpenAI的方向判断，通过12天的发布，他们到底想干什么，这个我们要去看一下。</p>



<p class="wp-block-paragraph">第一个，OpenAI现在一定是希望拉更多的用户进来，甭管是Apple Intelligence，还是直接可以给他打电话，直接可以用WhatsApp跟他联系。他还是希望拉更多的用户进来，而且呢，可以覆盖更大的应用范围，比如CANVAS Project或者其他一些新的功能。它希望可以覆盖很多原来，比如说Office或者是其他的一些软件所覆盖的这些功能。</p>



<p class="wp-block-paragraph">包括第11天所演示的ChatGPT麦克端的APP，可以直接跟大家的Notion、Notebook也可以跟这些产品一起工作的这个能力。他希望把AI带到所有的边边角角、方方面面里边去。我觉得这个Notion AI可以哭晕在厕所里边了。</p>



<p class="wp-block-paragraph">另外一块呢就是降价。OpenAI的降价其实一直都没有停下来，每过一段时间就会降价。但是对于普通用户来说，你一个月20美金也好，或者是200美金，或者其他这种版本也好，这个它不会降。但是什么东西在降价呢？就是API在降价。每过一段时间API就会降价，降价的原因呢，就是现在其实我们在程序员使用API调用的各种大模型里面，OpenAI的ChatGPT还算是最好用的之一。现在只能算之一了，因为呢，它跟这个Anthropic Claude 3.5 Sonnet比起来，算是不分伯仲吧。在这样的一个情况下，他只要是不断的降低API TOKEN的成本，那么我们这些人就会继续去使用他的API，那么他就可以很有效地去挤压他的竞争对手。这件事情一直在前进，然后瞄准高端狂奔，这就是这一次12天发布会里的实际最主要的东西。像第一天欧一完整版。</p>



<p class="wp-block-paragraph">第二天，什么是强化学习？然后到最后，上了一个O3。中间其实还有很多，是专门进行这种研究型应用的模型，已经完全脱离了普通人使用的这种模型。这个方向其实在O1的时候就已经指明了，我们要向这个方向前进，不再去做5了，或者再做什么这些东西了，我们就要去做强推理。</p>



<p class="wp-block-paragraph">在这样的方向指明了以后，现在谷歌、国内的像Moonshot、Deepseek、阿里这些都已经纷纷跟进，分别推出了自己的数学模型。谷歌推出的叫Gemini 2.0，Flash Thinking，Kimi的话应该也是推出了一个叫m系列的模型。Deepseek应该也有一个类似的模型，国内还有一些这种数学模型。阿里推出的叫QWQ，也就是通义千问QWQ模型。有一些我已经用过了，效果其实还可以。</p>



<p class="wp-block-paragraph">OpenAI已经成功地把整个行业的方向向着研究方向带过去了。再往下一步，OpenAI要做的事情，继续是各种工具之间的联通和统合，这里还有很多工作需要做。你比如说，现在你想用CANVAS的时候，还是不能用搜索。虽然可以在实时语音里头用搜索，但在CANVAS里用不了。CANVAS跟其他各种功能结合起来，或者绘图什么结合起来，这个还需要逐渐把它自己这些功能打通，这需要下功夫。</p>



<p class="wp-block-paragraph">然后，面向普通人的大模型进化，OpenAI还在探索。现在有传闻说，GPT-5训练了几次，效果不好，依然在训练。就是成本非常非常高，周期很长，训练一次几个月的时间，花5亿美金才能训练一次，但是训练了两次都没有出来结果。不过目前这些都是传闻，我自己也没有详细考证过，还是慢慢等进一步详细的消息出来吧。</p>



<p class="wp-block-paragraph">那么未来AICC行业的方向是什么？这刚才我们讲了OpenAI的方向。大家要注意，12天连续发布会，实际上对整个行业来说，有一个重大的利好。这个利好是什么呢？就是两大困扰创业者的问题。</p>



<p class="wp-block-paragraph">有一个暂时没有爆发。两个问题是什么？第一个是底层架构不稳定，第二个呢，是上层应用被覆盖。这个什么意思？咱们先想后边这个。就是你吭哧瘪肚坐半天，等OpenAI再去开发布会的时候，你发现你的功能被覆盖掉了，你的事情白干了。就是每一次OpenAI一开发布会，就说又有一大片的创业公司倒下了，就是功能被它覆盖了。这个问题依然没有解决。</p>



<p class="wp-block-paragraph">这一次这个OpenAI 12天发布会里头，依然是覆盖了一些东西，比如说ChatGPT的Mac客户端可以直接跟Notion结合了。那么Notion AI的一部分功能实际上是被它覆盖掉了。甚至呢，Mac端的ChatGPT的应用可以直接跟各种的IDE开发工具去结合去写程序了。为了应对这件事，微软说来GitHub Copilot免费了。所以现在你想写程序的话，可以直接使最好的那个，不用去跟其他的那些免费模型较劲了。这也是这个倒逼微软降价吧。所以这块依然没有解决。</p>



<p class="wp-block-paragraph">但是另外一个问题呢，基本解决了。什么呢？就是底层架构的不稳定。原来你要去做一个创业，说：“哎，我在GPT2的基础上做了一个东西。”等你这个东西吭哧瘪肚开发了一年，写出来了，人家说我GPT3出来了。那说咱们升级，GPT3上我吭哧瘪肚写了半年，又把它写出来了。我3.5了，那咱再升级，又吭哧瘪肚写了一年，说我这个现在是完全适应GPT3.5的了。我们要去开发布会了，正要出门了，我们这个GPT4出来了，然后4O出来了。这个就叫底层架构不稳定。</p>



<p class="wp-block-paragraph">现在一看说，哎，5依然遥遥无期，5的各种特性都不知道。因为我告诉你，不需要把5做出来。如果OpenAI能够做出来，说我5是按哪个方向做的，朝哪个方向发展的，这个事他如果敢出来说的话，那么整个行业就会奔着那个方向开始跑。就跟他2024年年初说我要做Sora，我放了一堆演示出来的过程是一样的。实际上他已经把整个行业带着跑了一年了。所以现在5到底是什么样，不知道。那么这件事就算稳定了。</p>



<p class="wp-block-paragraph">底层基本上稳定了。现在呢，甭管是LLama、通义千问、Gemini、Claude、OpenAI，还有其他的各种模型，都基本上停留在GPT-4的这样一个水平上，上上下下吧。然后呢，他们的调用方式，整个的反馈的这个结构基本上是跟OpenAI一致的。就OpenAI制定了一个标准，规定好了这个东西是怎么调用的，提示词大概怎么写，调用的时候是分几个命令进去，出来了以后可以有哪些功能。像刚才我们讲的什么函数调用、这个结构化输出，这些东西其他人都是照这个标准做的。</p>



<p class="wp-block-paragraph">所以呢，现在再去做什么应用，或者做AI Agent，大量的这种工作流都串起来，干这个事情的话，那中间的这些大模型就有极强的可替代性。我用OpenAI可以用，我用Gemini可以用，我用Claude可以用，我可以随便换。这个的话，其实是对于开发者来说，或者对于创业者来说，是一个巨大的好消息。就是底层暂时稳定了，大家赶快冲上去，把一些具体的应用做掉，这是很好的机会。</p>



<p class="wp-block-paragraph">OpenAI自己呢，还会继续去将各种分散的功能逐步整合起来。所以在这个时候，千万不要尝试去做拼接工具。什么意思呢？你比如说，哎，我现在是不是做一个带有搜索的CANVAS功能？这个你就别费劲了。你要相信我，OpenAI自己一定可以搞定这个事。而且他一旦搞定了以后，你做的那个产品一定会被覆盖掉，这个事不要去干，直接面向混合后的OpenAI功能就可以了。</p>



<p class="wp-block-paragraph">你比如说，我们认为带有搜索和这个项目功能的OpenAI的这种API未来会出来，那么我们就直接以此为目标进行开发就行了。等它一出来的时候，我们其他东西就开发完了，这也许是一个方向和玩法。那么用户交互方面呢，肯定还是会有很多可以值得探索的东西。这一次OpenAI给了我们两个提示，第一个提示就是如何让AI更好地跟现有的系统相结合，到底是通过Mac上面的ChatGPT APP。</p>



<p class="wp-block-paragraph">直接去跟各种APP进行结合，还是说我到这个网页里边，直接给你上canvas或上画板，这块呢是大家值得去探索的，也是呢这个OpenAI给大家做的一些演示或指明的方向吧。这块是值得去试试的。</p>



<p class="wp-block-paragraph">另外一块的话，就是如何将复杂的需求准确地表达给AI，这个是OpenAI这一次开发布会的时候给大家演示了。那说哪一个是做的这块的演示呢？Sora的故事版。我怎么能够把一个有持续的信息分成持续提进去？这个其实是OpenAI给大家做了一个创新，虽然这个创新很小，但呢非常有意义。</p>



<p class="wp-block-paragraph">以后我们不用再去想说，我如何可以在一个提示词里一次性把一个完整视频所需要的信息都扔进去。你可以在故事版上，在时间线上，这个地方要干什么，那个地方要扭个头，这个地方要变个颜色，这个时间点要起始，要画什么东西，然后到几分几秒的某一个时间点，这个主人公向哪个方向走，或者做什么动作，或者到几分几秒这个颜色发生什么变化，或者亮起什么样的灯光。他可以通过这样的方式呢，进行更精确的有持续性的信息输入。</p>



<p class="wp-block-paragraph">而且这些的话，应该会很快被像什么吉梦、可灵、Runway这些模型应用起来，这个我觉得可能一两个月就会看到变化了。现在呢是研究和推理领域，肯定会越来越小众。面向普通用户的方向的话，各种的APP，各种的这个用户交互方式，这块呢现在大家就可以去干了，2025年应该是这一块可以出成绩的时候。</p>



<p class="wp-block-paragraph">另外呢，就是具身智能必然会爆发。其实我们这一次看OpenAI 12天的连续发布会里头，真正让我感觉很震撼的东西是什么？就是带有视觉的高级语音。你可以开着摄像头对着自己跟他聊天了。这种东西你扔给了具身智能的机器人，再要求OpenAI直接输出代码，说来你给我输出代码，然后我用这个代码去控制机械手。技术变化了以后再给你进行一些反馈。</p>



<p class="wp-block-paragraph">现在的OpenAI大模型，其实已经距离控制机器人非常非常接近了。所以呢，这些机器人公司应该发力了。</p>



<p class="wp-block-paragraph">新的具身智能未必长得像人，只需要做好插件、传感器、动作执行以及反馈这一块就行了。下边就是怎么提高技能、提高准确度、降低成本。这就是2025年可能提给所有具身智能行业的一个要求了。后边大模型的部分不用管了，扔给OpenAI就完事了。</p>



<p class="wp-block-paragraph">带有视觉的实时语音，会改变每一个人的生活方式。这个智能的硬件产品包括一些新软件产品或者网页，在2025年的话，应该会有非常多的涌现。</p>



<p class="wp-block-paragraph">最终总结，2025年依然是AIGC的一年。虽然前面OpenAI连续12天的发布会让我感到稍微有些失望，但是他还是尽到了责任。不是说发布了什么让我特别感到眼前一亮的革命性产品或者什么iPhone时刻，没有。但是呢，他依然作为老大，执行使了他的义务，就是为整个行业指明了方向。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛、参加Discord讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？</title>
		<link>https://lukefan.com/2024/12/16/openai%e8%bf%9e%e7%bb%ad12%e5%a4%a9%e5%8f%91%e5%b8%83%e4%bc%9a%e5%9b%9e%e9%a1%be%ef%bc%9a%e7%a7%91%e6%8a%80%e9%a2%86%e5%86%9b%e8%80%85%e7%9a%8412%e5%a4%a7%e8%b7%a8%e8%b6%8a%e5%bc%8f%e5%88%9b%e6%96%b0/</link>
		
		<dc:creator><![CDATA[老范 讲故事]]></dc:creator>
		<pubDate>Mon, 16 Dec 2024 00:39:10 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AGI]]></category>
		<category><![CDATA[AIGC行业]]></category>
		<category><![CDATA[AI技术]]></category>
		<category><![CDATA[AI硬件]]></category>
		<category><![CDATA[AI行业趋势]]></category>
		<category><![CDATA[Apple Intelligence]]></category>
		<category><![CDATA[Canvas]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[Dalle更新]]></category>
		<category><![CDATA[Gemini 2.0]]></category>
		<category><![CDATA[GPT4.5]]></category>
		<category><![CDATA[Her语音功能]]></category>
		<category><![CDATA[LLaMA 3.3]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[O1订阅]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Project功能]]></category>
		<category><![CDATA[Siri集成]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[产品发布]]></category>
		<category><![CDATA[产品总结]]></category>
		<category><![CDATA[创新产品]]></category>
		<category><![CDATA[创新科技]]></category>
		<category><![CDATA[强化微调]]></category>
		<category><![CDATA[技术革新]]></category>
		<category><![CDATA[新功能]]></category>
		<category><![CDATA[新科技产品]]></category>
		<category><![CDATA[智能体框架]]></category>
		<category><![CDATA[未来科技]]></category>
		<category><![CDATA[用户交互]]></category>
		<category><![CDATA[用户交互界面]]></category>
		<category><![CDATA[用户体验]]></category>
		<category><![CDATA[用户体验提升]]></category>
		<category><![CDATA[科学家工具]]></category>
		<category><![CDATA[科技产品]]></category>
		<category><![CDATA[科技产品创新]]></category>
		<category><![CDATA[科技产品创新趋势]]></category>
		<category><![CDATA[科技产品发展]]></category>
		<category><![CDATA[科技产品发布]]></category>
		<category><![CDATA[科技产品趋势]]></category>
		<category><![CDATA[科技公司]]></category>
		<category><![CDATA[科技公司产品]]></category>
		<category><![CDATA[科技公司产品创新]]></category>
		<category><![CDATA[科技公司产品创新趋势]]></category>
		<category><![CDATA[科技公司产品发展]]></category>
		<category><![CDATA[科技公司产品发布]]></category>
		<category><![CDATA[科技公司创新]]></category>
		<category><![CDATA[科技公司发展]]></category>
		<category><![CDATA[科技公司发展趋势]]></category>
		<category><![CDATA[科技公司发布]]></category>
		<category><![CDATA[科技公司发布会]]></category>
		<category><![CDATA[科技公司行业趋势]]></category>
		<category><![CDATA[科技公司趋势]]></category>
		<category><![CDATA[科技创新]]></category>
		<category><![CDATA[科技创新趋势]]></category>
		<category><![CDATA[科技发展方向]]></category>
		<category><![CDATA[科技发布]]></category>
		<category><![CDATA[科技发布会]]></category>
		<category><![CDATA[科技巨头]]></category>
		<category><![CDATA[科技行业发展]]></category>
		<category><![CDATA[科技行业趋势]]></category>
		<category><![CDATA[科技趋势]]></category>
		<category><![CDATA[行业领军]]></category>
		<category><![CDATA[视频交互]]></category>
		<category><![CDATA[视频模型]]></category>
		<category><![CDATA[视频生成]]></category>
		<category><![CDATA[视频生成模型]]></category>
		<category><![CDATA[语音功能]]></category>
		<category><![CDATA[语音识别]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[项目管理]]></category>
		<category><![CDATA[项目管理工具]]></category>
		<category><![CDATA[高级语音]]></category>
		<category><![CDATA[高级语音功能]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1770</guid>

					<description><![CDATA[啊啊啊啊！OpenAI的连续12天发布会真的太刺激了！🤯🤯🤯每天都有新惊喜！我已经迫不及待想看看最后会发布什么了！

先来给大家总结一下前7天都发布了啥：

**Day 1：**OpenAI说，我们要涨价了！😱😱😱O1和O1 Pro每月200美金！不过对于咱们普通人来说，4.0就够用了啦～

**Day 2：**发布了一个叫强化微调的科学家工具，普通人用不上，跳过跳过！

**Day 3：**期待已久的Sora终于来了！🎉🎉🎉我连夜爬上去体验了一把，效果确实比其他视频模型好一些，交互方式也更方便了！

**Day 4：**Canvas免费开放！🎉🎉🎉这个功能真的绝绝子！以后都不用Office了！

**Day 5：**Apple Intelligence和Siri接入ChatGPT，可惜国内用不了😭

**Day 6：**Her真的来了！🎉🎉🎉可以打开摄像头和GPT聊天了！我试了试，真的太好玩了！

**Day 7：**发布了Project功能，可以把文件上传给ChatGPT处理，效率提升1000%！

除了OpenAI，谷歌、Meta、Pica、Midjourney等公司也都发布了新产品，AIGC行业真的太卷了！😱😱😱

我已经搬好小板凳，坐等OpenAI接下来的发布会了！你们最期待什么功能呢？评论区告诉我！

OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？

在连续12天的发布会中，OpenAI已经发布了包括O1、强化微调、Sora、Canvas、Apple Intelligence、Her和Project在内的7款重磅产品，从科学家工具到通用用户应用，每款创新都指明了AI行业的未来发展方向。例如，Sora引领了视频生成领域新潮流，Canvas提升了文档与代码编辑效率，而增强语音和视频交互的Her则让人工智能更贴近人类。随着Project进一步探索工作流整合，OpenAI正在为未来取代传统操作系统铺路。这些发布在吸引全球关注的同时，也引发了行业巨头如谷歌、Meta、MidJourney等快速跟进，各大技术公司争相优化多模态生成和视频模型等领域。结合即将推出的Dalle改进版、智能体框架及可能的GPT4.5更新，这场发布盛宴将为未来的人工智能生态打开更多的可能性。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="OpenAI连续12天发布会回顾：科技领军者的12大跨越式创新，Sora、Canvas与GPT-4O带来哪些启示？" width="900" height="506" src="https://www.youtube.com/embed/760VNZv1O1k?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">OpenAI的连续12天发布会现在已经过半，发布了些什么东西呢？咱们来总结一下。</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。12天开12场发布会，算是前无古人了。人家以前的发布会都是在集中一两天的时间里，聚集尽可能多的人把它开掉。但是，OpenAI就是要不走寻常路，选择连续发布12天，每天发布一点新东西出来。而且他们的发布会是在网上开了个直播间，有时候山姆·奥特曼在，有时候他不在，大家就一起来讲讲这段时间又做了点什么新东西。这还是非常有趣的一种发布方式，算是把年底这一段时间所有人的注意力又都拉回了OpenAI以及AIGC这个赛道上。</p>



<p class="wp-block-paragraph">那么到年底了，大家都得卷，大伙有没有？有。但是，肯定没有12个。如果真的说年底有12个重磅级产品发布的话，他们也不会用这种方式。应该还是会有很多零七八碎的小功能在这12天发布出来，但也会有一些比较激动人心的东西。而且要卷，大家一起卷嘛。OpenAI作为AIGC行业的领军人物，既然开始卷了，其他人必然会跟进。</p>



<span id="more-1770"></span>



<p class="wp-block-paragraph">前段时间我们讲过，OpenAI的最主要的社会贡献是什么？就是为行业指明方向。他指明了方向，其他人就会跟。那么都发了些什么东西呢？</p>



<p class="wp-block-paragraph">第一天特别逗，首先涨价，上来先说我们做一个200美金一个月的订阅。如果你要去使用O1的完整版或者是O1 Pro，每个月的成本是200美金，这就是第一天发布的东西。而且，O1也好，O1 Pro也好，如果你不是科学家，不是那种真正需要进行推理的人，其实意义没有那么大。对于普通人来说，4O就已经足够了，O1完完全全就是很小众的一个产品。</p>



<p class="wp-block-paragraph">第二天发布的其实还是一个科学家工具，叫强化微调。意思是什么呢？就是大家现在都在讲炼丹，说明这个大模型不知道你到底是什么，不知道你具体要干嘛，所以他经常会所答非所问。</p>



<p class="wp-block-paragraph">我们对这个模型进行一定的微调之后，他就知道说：“哎，我今天是上岗来干什么什么事情呢。”就会做得好一些。OpenAI说来，我们发布一个强化微调的功能，你只需要提供比较少的数据，它就可以有一个非常好的微调的结果。这个呢也是一位科学家上来演示。像这种功能呢，跟前面我们讲的O1一样，就是普通人用不上，都是非常小众的科学家产品。</p>



<p class="wp-block-paragraph">等到第三天，终于有这个大活上来了，Sora千呼万唤始出来。我呢，基本上是等了接近一周的时间才爬上去。Sora出来以后，大家就都疯狂的往上去爬，想去尝试使用。但是呢，他一直是关闭注册的状态。就是你可以在第一个页面上看到演示的这个视频，但是你没有办法登录进去自己去创作。大概是等了，我忘了是几天了，四五天吧，然后才进去。</p>



<p class="wp-block-paragraph">Sora的模型呢，跟其他的一些视频模型比较起来，算是领先一点点。但是具体的感受，其实也没有那么大差异。对于像我这种一个月20美金的plus用户来说，我每个月应该可以生成50段动画。测试了感觉跟Runway、Pica，还有包括国内的可灵和集梦比起来，有差异，但是不是特别明显。从这个模型角度上说，更多的改进是什么呢？就是用户交互方式上改了。他给你了一些故事版，比如说你可以在一个时间线上写多段的这种提示词。这个呢，其实是给了大家很多的启示了。</p>



<p class="wp-block-paragraph">因为以前大家生成图片的时候，你给他一个提示词，他给你画出来没毛病。但是呢，生成视频的时候，再给他一个提示词，让他给你画出来，这个事就有点难了。因为视频是很多张图片凑在一起的嘛。所以说别费劲了，咱们就是在不同的时间点上使用不同的提示词，让这个大模型知道我们怎么在这个场景里边进行转换。我相信很快就会有其他的产品来跟进。</p>



<p class="wp-block-paragraph">到第四天呢，他们发了canvas。canvas其实原来就发过，只是现在告诉大家说，免费用户你也可以用了。现在canvas这个产品呢，基本上是垫进去隔office的命。什么意思呢？就是它等于是有一测试。</p>



<p class="wp-block-paragraph">你可以去跟他聊天了，但是最大的一个窗口实际上是个编辑器。你可以在一个编辑器里边说：“哎，给我去增加点什么内容，删除点什么内容。”然后哪一段呢，稍微的怎么去调整一下。然后你说：“你给我整个检查一下。”再检查一下说：“哎，这段怎么样，那段怎么样？”它有点像Word的使用方式。</p>



<p class="wp-block-paragraph">当然，你可以一边在这种对话框里跟他去聊天，另外一边什么呢？你可以直接在编辑器里改这个文件。改完了以后说：“哎，这样是不是好一点，那样是不是好一点？”就是人跟这个OpenAI的ChatGPT一起配合来去修改这个文件。如果这套东西大家使用习惯了以后，那么就不会再有Office什么事了。</p>



<p class="wp-block-paragraph">它现在呢，只是一个Word文档，大家可以在上面折腾，但是代码也可以，Canvas改代码的效果也是极好的。现在你说有没有像PPT这样的东西，或者像Excel这个表格这样的东西，可以让他在Canvas这边去干活的？我相信未来会有，这一定是奔着Office全家桶去的一个产品，这个产品还是非常非常好用的。现在免费也可以用嘛，这个功能上来以后，整个的效率会提升非常非常多的。</p>



<p class="wp-block-paragraph">然后到第五天，Apple Intelligence和Siri就上来了，其实就是给大家演示一下怎么可以在苹果设备上，甭管是电脑还是手机上，挂上ChatGPT，然后进行沟通、进行聊天，还可以做一些截屏，以及图片和视频方面的这种工作。这个呢确实是比较激动人心，但是对于中国来说其实没有用的。为什么？因为咱使不了。这个产品发布了以后，整个OpenAI的服务器，我觉得能有个五六个小时就直接宕机了。这个呢充分显示了苹果用户的威力，就是苹果的用户量还是非常非常大的，即使刨除掉中国，剩下的苹果用户也是非常给力的，直接把OpenAI的服务器干崩了。</p>



<p class="wp-block-paragraph">到第六天呢，是Her真的来了。原来我记得在发布GPT-4O的时候，当时大家看完了以后非常激动，实在是太震撼了。只是呢，在GPT-4O发布之后。</p>



<p class="wp-block-paragraph">它就又往回退了一点。它发布的是期货，并不是马上就能用的。刚才咱们讲的所有这些东西里头呢，有一个叫强化微调的功能，那也是个期货，现在使不了。其他的是马上就可以用下来了。OpenAI发布了GPT-4O之后呢，大概是过了也是几个月吧，才把高级语音功能拿出来，就是大家真的可以去跟GPT去聊天了。你可以打断它，它还可以去判断你的语气语调，这一块其实就已经强很多了。</p>



<p class="wp-block-paragraph">在这个之前呢，它还是通过说把语音识别出来，然后变成文字处理，处理完了以后，再把这个文字念出来，通过这样的方式来工作的。但是高级语音功能呢，等于语音进去，语音出来，端到端的中间并没有变成文字的这个过程。虽然你最后结束了以后，是可以去看到所有生成的文字的，但是它会流畅得非常非常多。</p>



<p class="wp-block-paragraph">但是呢，依然没有让我们看到完整的GPT-4O，或者叫Her，实际上是那个电影的名字，就是一个人工智能，像一个伴侣一样陪着你。这一次彻底出来了，加上什么呢？视频。我们可以打开摄像头，让GPT看着我们，跟我们去聊天。但是这个过程呢，GPT还是稍微有一点小滑头的。我让它看着我，我说你看我怎么样，它说你很精神。我说你看我年轻吗，它说你很有活力。后来我说，你能不能判断一下我的年龄，它说不行，我尽量不惹你生气。反正还是比较油滑的。</p>



<p class="wp-block-paragraph">我还跟我太太两个人一起上镜，我说来，我们俩谁好看，它说你们两个都很有活力。好吧，这个就当是它骂人吧，反而给我们带来了很多的欢乐。让它去拍各种场景，你家里边的各种家具，屏幕上的各种截图，你让它拍下来以后，它都可以实时地去做出反馈了。甚至呢，你比如说，你让它拍自己的视频的时候，你不跟他说话，朝它笑一笑，它都会马上这个回应你：“哎，笑一笑真好。”这个就显得非常非常智能了。</p>



<p class="wp-block-paragraph">这个功能极其好玩，如果你订阅了Plus，一定要去试一试，非常非常欢乐的一个产品。到第七天呢，发布了一个产品叫Project，Project的这个产品非常有意思，它等于是……</p>



<p class="wp-block-paragraph">在ChatGPT里边给大家开了一个目录。你可以把它打开了以后，然后说：“我现在需要处理这些文件。”然后你把这些文件都上传上去。然后呢，它根据这些文件去进行响应。</p>



<p class="wp-block-paragraph">原来呢，甭管是拆CPT也好，还有其他的所有这种聊天工具也好的，有一个很大的问题是什么？就是无状态。每一次去的时候，它都不认识你，需要从头去告诉它：“我今天有什么具体的事情。”如果你说：“哎，你把我的硬盘都搜索一下，在这个基础上跟我聊天呢？”它也很痛苦。为什么？因为你硬盘里的东西很多，它搞不清楚你到底要跟它聊具体什么事情。</p>



<p class="wp-block-paragraph">所以，让它在某一个具体的任务上聚焦起来，现在我们就来做一个旅游规划。我把旅游相关的所有信息都给你，你就在这个范围内给我回答。这件事情原来是比较难以做到的。很多人去做AI Agent，去做工作流，去做RAG，实际上都是为了解决这个问题。</p>



<p class="wp-block-paragraph">现在OpenAI说来了，咱们直接给你提供一个project的功能。你为了实现一个具体的功能，就把相应的文件都传上来，然后我就在你传上来的这批文件内给你去干活。这其实是OpenAI在向着自成操作系统的路上继续狂奔。他们认为以后不再需要操作系统了，什么Mac OS、Linux、Windows都不要这些玩意儿，我们自己干。我们自己把这些需要的东西找到了，以后就可以直接工作了。</p>



<p class="wp-block-paragraph">大家以后就慢慢地把各种各样的文件都存在OpenAI的服务器上。你每次就问它：“我这个项目里头都有什么事情？我应该如何继续往前走？”“我另外一个项目里都有什么事情？有什么文件？有什么信息？我应该如何往前走？”这以后就不再需要操作系统了。</p>



<p class="wp-block-paragraph">大家注意，前面谷歌出了一个产品，叫Workspace，其实已经部分实现了这件事情。Workspace就是你上去以后，实际上是个网盘，把各种文件都存上去。以后你就可以在网页端。</p>



<p class="wp-block-paragraph">直接去有所有的Office功能，不再需要说我在硬盘上存在什么地方，我在这个其他地方怎么去存，然后怎么去找到它，不用干这个事了。我们在全世界任何一台电脑上，只要你能登陆到自己的谷歌账户，我们就可以使用云端的这台电脑，它里面存着我们所有需要的文件，有完整的Office相应的功能。</p>



<p class="wp-block-paragraph">现在OpenAI说来，我们也照这个方式来。以后可能我们下一个产品，就是叫OpenAI网盘，大家以后就可以在那个上面干活了。那么以后你就问OpenAI说：“哎，某个目录里有些什么东西，或者是哪天放了一些什么东西上来呀？我最近有些什么样新的文件变化呀？”他就去工作去了。</p>



<p class="wp-block-paragraph">那么OpenAI可能就会有新的收费方式，按照这个网盘存储空间这样去收钱。这可能也是未来大家可以去前进的方向，因为我一直讲OpenAI对于社会的最大贡献，就是指明方向。其实现在你用谷歌的Gemini已经可以部分完成这种工作了。如果你给谷歌Gemini去付费，它也可以在你的Workspace里边去干活。</p>



<p class="wp-block-paragraph">但是Gemini目前为止呢，还没有那么聪明，虽然发了Gemini 2.0 Flash要稍微好一些，但是在各种的组件结合上，谷歌还有待提升。目前为止，12天里他已经过了7天了，大家注意，他礼拜六礼拜天是休息的，发布了7个新产品，后边呢还有5个新产品等待发布。其他公司呢，肯定也都没闲着，这个行业带头大哥已经冲了，其他人如果不跟着的话，肯定你的态度不够端正。</p>



<p class="wp-block-paragraph">第一个冲上来的是谷歌，谷歌的Gemini 2.0 Flash这个版本上来了，它的整个工作效果确实是要比原来的Gemini 1.5要强非常非常多。而且它是个Flash版本，速度非常快还免费。它比咱们在1.5以及他们中间出的各种各样的版本的这个模型都要快得多，效果也非常的好。只是呢，他演示的非常多的东西，其实你压根找不着在哪。为什么？这是个技术型的公司，大家不要对谷歌这种。</p>



<p class="wp-block-paragraph">技术型公司的产品能力抱有太高的期望，这个怎么讲呢？就是按他的说法，Gemini 2.0呢，完完全全可以像GPT-4那样，具备高级语音功能，像电影《Her》一样去工作。你可以与它对话，可以让它进行视频采集或图片采集。它生成的内容呢，甚至比PPT-4还要强。它可以生成混合内容，生成完文字后，再夹杂着图片一起生成出来。OpenAI现在只能生成图片或文字，无法将二者混合输出。</p>



<p class="wp-block-paragraph">现在的谷歌的Gemini 2.0，据说可以做到这些。只是呢，它把所有的多模态输入和输出功能，都放在了开发者工具里，或者是一些未来项目中，让大家去加入waitlist，等待使用。因此，我们现在唯一使用它的方式，就是像我这样去申请开发者账号，然后将Gemini 2.0 Flash的模型挂到自己的应用里，可以使用它的部分功能。完整功能，生成混合的文字和图片，目前还做不了。</p>



<p class="wp-block-paragraph">谷歌更新了之后，Meta肯定也不闲着。第一个呢，是把Llama 3.370币这个模型放出来了。现在Llama 3.370币的效能，比原来的Llama 3.1 405币高很多。其实在国内，我们一般不太尝试使用Llama，因为一旦Llama更新，可能过一个月左右，通义千问以及国内其他开源模型就会更新，补上这个窟窿。所以我觉得稍微等一等，可以期待下一步的产品。</p>



<p class="wp-block-paragraph">Meta也公布了自己的视频生成模型，OpenAI已经上来了，Sora也出来了。Meta也要有其他的，比如说腾讯混元纹身视频大模型，这两天也突然开放，大家可以去试用。我去试了试，还是有点一言难尽。做这种视频生成模型里，最难的其实不是视频生成，而是模型操控。它的用户交互界面稍微差了点。但是既然OpenAI已经指明了方向，大家就朝着这个方向努力就好了。</p>



<p class="wp-block-paragraph">Pica也更新了。Pica是华人团队做的一个美国的视频生成模型。他们呢，就很快地把OpenAI Sora的这些视频交互方式搁进去了。他怎么弄呢？就是你先上一副照片，说我要这个人，然后这个人呢，要去飞翔。他等于就可以很好地保持这个人的样子，然后去做后边这个动作。然后你再给他一幅图，说：“哎，现在要在这个环境下飞。”他这一块就可以编排得比较好了。现在已经可以做出一些非常有趣的小视频，在推特上面去传播了。</p>



<p class="wp-block-paragraph">Pica更新了，MidJourney也更新了。MidJourney更新的那个产品特别有意思，它叫故事版。什么意思呢？就是大家原来不都抱怨说这个东西的一致性差吗？说我想让它连续地输出一些内容，输出不出来。MidJourney你说来，我们这次更新一个有趣的功能。在一个故事版里头，你先定义角色，这叫张三，那叫李四，这叫王五，这叫赵六，定义了一堆角色。然后呢，再定义一堆场景，这是厨房，这是厕所，这是客厅，那是卧室，哪个地方是教室。定义完了以后呢，你再去定义，说张三在厕所里边碰到了李四，李四在厨房里边给王五做饭，王五在教室里边去做什么。当你把这些提示词写完了以后，他就用你前面定义的角色，在你前面定义的这个场景里边发生各种互动了。</p>



<p class="wp-block-paragraph">再往后，他家去做各种漫画，做各种的故事书，就非常非常方便了。你后边可以把这个故事写得很长，他在整个的生成过程中不会发生大的偏移。这个也是非常棒的。我觉得呢，也算是被Sora稍微提醒了一点吧，或者说大家可能殊途同归，都向这个方向走。只是呢，Sora发布了以后，MidJourney呢也再往前走一步。中国的各大模型公司呢，现在应该都在加班加点，Sora指明方向了以后，可灵还有像吉梦这样的视频模型，应该都会向这个方向前进，就是向故事版前进。视频生成过程中，某一些提示词在某几秒钟，或者某一些提示词在某个特定时间点里边起作用，这个大家应该都会跟上。</p>



<p class="wp-block-paragraph">CANVAS和Project的这样的功能的话，字节的豆包还有像Kimi，他们应该都会去学习一下。至于数学大模型的话，从O1 Preview出来之后，大家其实就都已经在追赶了。比如说像阿里出的QWQ，通义千问下面专门有一个模型叫QWQ，就是做这种推理模型的，32B在我本机就可以跑起来，推理效果还是相当不错的。Kimi呢，也专门做了一个叫K0MAS，专门的一个数学模型，都是进行推理使用的。</p>



<p class="wp-block-paragraph">搜索这一块的话，其实大家都已经做得还不错了。这就是前面七天给大家带来的这些变化。还有五天有可能发布什么呢？第一个很多人都在期待，Dalle是不是该出师了。Dalle3已经发布了很久很久了，没有什么更新。而且Dalle3现在明显的已经跟其他所有的图片生成模型比起来，落后非常多了。现在大家再去做视频生成的时候，都是用MidJourney生成的图片去做视频生成的地图。Dalle呢，是需要努力了，这个有可能会再往前走一步。</p>



<p class="wp-block-paragraph">他们发布会的时候，其实是有一些暗示的。这一次在发布的时候，OpenAI X7BT在网页端做了一个比较大的这种改变。什么呢？就是他在聊天窗底下加了一堆工具栏，然后这工具栏里头有一批呢，是搜索、Dalle，还有Canvas，这些东西是在一个栏里头。你要先选我要用哪个工具，然后再去跟它说话。大家想，这个里头为什么会有一个Dalle呢？肯定他是有事情了。他把这样的一个已经稍微有一点点小落后的产品，跟这次新出来的这种搜索呀、Canvas放在一起，那么它有可能会更新。</p>



<p class="wp-block-paragraph">然后新的智能体框架有可能也会出来。由于现在大家都在讲，说大模型就卷成这样可以了，后边呢，大家去搞一搞智能体。大家注意，现在的OpenAI呢，这么多新功能，其实是不能一起使的。什么意思呢？就是CANVAS、Search、语音功能，你每次必须选一个，你不能说我都选，说我一边语音功能，一边你去给我搜索。</p>



<p class="wp-block-paragraph">这事不行。你说我一边canvas一边去搜索，这事也不行。或者说，哎，我去推理一下，推理完了以后，你给我放到canvas里头，或者去做语音这个事，都是不允许的。每次只需选一个，这个还是非常不方便。未来可能会有一些方法把这些功能串起来，而这些功能串起来以后，OpenAI的ChatGPT的可用性会提高非常大的一大截。</p>



<p class="wp-block-paragraph">还有什么可以期待的呢？就还有人会去期待这个AI硬件。到年底了，折腾了这么长时间了，是不是也该拿出一个东西来？特别是前面，苹果当年iPhone的设计师，号称是在跟OpenAI一起合作做AI硬件。那么到年底了，是不是给大家瞅一瞅？这个有可能会出现，但这块呢，完全是咱们猜测，没有任何的依据。</p>



<p class="wp-block-paragraph">还有一个是什么呢？就是有可能会出GPT4.5，就是它有可能会在GPT4的基础上再往前走一点。你说一下到GPT5，这个呢稍微有一点点难度，但应该还是会继续往前走的。因为在发布Siri那一天，他呢也做了一个暗示。在发布Siri那天呢，他们拿这个是iPhone，上面呢只有一个日历的框，在这个屏幕上，那个日历上写着说，我们要去发布下一代的AGI或者什么这样的东西。大家就去猜测说，这有可能是GPT4.5。这就是未来五天里头，大家还是可以去期待一下的事情。</p>



<p class="wp-block-paragraph">等OpenAI把所有的12天、12个产品都发布齐了以后，我会再录视频跟大家进行总结。好，这一期就跟大家讲到这里，前面已经发布的产品，赶快去使用起来，非常好玩。好，感谢大家收听，帮忙点赞，点小铃铛，参加Discord讨论群，也欢迎有兴趣有能力的朋友加入我们，付费频道再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
