<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>工具调用 (Tool Calling) &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/%e5%b7%a5%e5%85%b7%e8%b0%83%e7%94%a8-tool-calling/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Tue, 08 Jul 2025 00:58:37 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1.3</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>工具调用 (Tool Calling) &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>上下文工程（Context Engineering）爆火，是AI圈又一次造词狂欢还是真革命？拆解其核心理念，对比GPT、Gemini、豆包等主流模型在该框架下的表现与优劣，帮你选择最强工具。</title>
		<link>https://lukefan.com/2025/07/08/%e4%b8%8a%e4%b8%8b%e6%96%87%e5%b7%a5%e7%a8%8b%ef%bc%88context-engineering%ef%bc%89%e7%88%86%e7%81%ab%ef%bc%8c%e6%98%afai%e5%9c%88%e5%8f%88%e4%b8%80%e6%ac%a1%e9%80%a0%e8%af%8d%e7%8b%82%e6%ac%a2/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 08 Jul 2025 00:58:36 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI产业]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI应用开发]]></category>
		<category><![CDATA[AI趋势]]></category>
		<category><![CDATA[Claude 3]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Few-shot (少样例提示)]]></category>
		<category><![CDATA[Gemini 2.5 Pro]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[Grok]]></category>
		<category><![CDATA[JSON输出]]></category>
		<category><![CDATA[LangChain]]></category>
		<category><![CDATA[LLaMA]]></category>
		<category><![CDATA[LLMOS (大模型操作系统)]]></category>
		<category><![CDATA[MISTRAL]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[RAG (检索增强生成)]]></category>
		<category><![CDATA[Shopify]]></category>
		<category><![CDATA[Simon Wilkinson]]></category>
		<category><![CDATA[上下文工程 (Context Engineering)]]></category>
		<category><![CDATA[上下文窗口 (Context Window)]]></category>
		<category><![CDATA[上下文隔离]]></category>
		<category><![CDATA[信息压缩]]></category>
		<category><![CDATA[函数调用 (Function Calling)]]></category>
		<category><![CDATA[大语言模型 (LLM)]]></category>
		<category><![CDATA[安德烈·卡帕西 (Andrej Karpathy)]]></category>
		<category><![CDATA[工具调用 (Tool Calling)]]></category>
		<category><![CDATA[技术解读]]></category>
		<category><![CDATA[提示词工程 (Prompt Engineering)]]></category>
		<category><![CDATA[模型稳定性]]></category>
		<category><![CDATA[特斯拉]]></category>
		<category><![CDATA[程序员]]></category>
		<category><![CDATA[系统提示词]]></category>
		<category><![CDATA[英伟达 (Nvidia)]]></category>
		<category><![CDATA[豆包大模型]]></category>
		<category><![CDATA[软件2.0 (Software 2.0)]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[长期记忆]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2365</guid>

					<description><![CDATA[炸裂！！AI圈又出王炸新宠了家人们！上下文工程直接掀翻提示词工程老套路💥

刚被硅谷大佬集体点名的新风口到底多强？？
👉特斯拉前科学家卡帕西疯狂打call
👉OpenAI官方偷偷在用
👉Shopify创始人亲自下场认证

重点来了‼️
传统提示词工程早凉了❌
真正的搞钱密码是这6大模块组成的必杀技：
1️⃣系统角色+超强栗子库
2️⃣用户精准需求拿捏
3️⃣聊天记录追踪器
4️⃣长期记忆强化剂
5️⃣全网知识雷达
6️⃣格式输出稳定器

程序员亲测真实体验👇
用对工具直接起飞🛫
✔️GPT4o怒降50%成本！！！
✔️Gemini2.5告别幻觉输出
✔️Claude3推理速度×3倍
（但是！华为盘古直接拉黑名单❌）

现在入局就赚到💵
手慢真的会拍大腿！！
⚠️小白必看红黑榜：
红榜✅：GPT4o＞Deepseek＞豆包1.6
黑榜🚫：Llama4＞文心一言＞盘古

讲真，这波红利可能就三个月窗口期‼️
搞技术的不学上下文工程
分分钟被00后实习生卷死😭


上下文工程（Context Engineering）爆火，是AI圈又一次造词狂欢还是真革命？拆解其核心理念，对比GPT、Gemini、豆包等主流模型在该框架下的表现与优劣，帮你选择最强工具。

“提示词工程”的热度正在消退，取而代之的是由AI大神安德烈·卡帕西（Andrej Karpathy）点赞推崇的全新范式——“上下文工程”。这不仅是简单的概念炒作，而是解决当前AI应用输出不稳定、AI幻觉频发问题的关键钥匙。它通过指令层、RAG检索、工具约束等六大模块的精密协作，以及写、选、压、隔四步工作流，系统性地管理大语言模型的输入与输出。成功的上下文工程要求大语言模型具备长上下文、原生工具调用和稳定的JSON输出能力，最终目标是打造出结果可预测、真正有商业价值的AI应用，告别过去“垃圾进垃圾出”的困境。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="上下文工程（Context Engineering）爆火，是AI圈又一次造词狂欢还是真革命？拆解其核心理念，对比GPT、Gemini、豆包等主流模型在该框架下的表现与优劣，帮你选择最强工具。" width="900" height="506" src="https://www.youtube.com/embed/dLuhRk1LLhE?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">上下文工程又有新词了。AIGC不怎么赚钱，造词的速度还是非常非常快的。大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。</p>



<p class="wp-block-paragraph">提示词工程已经稍微有点过时了，现在的新词叫上下文工程。提示词工程长什么样，大家还记得吗？就是上来先说你是谁，谁先给大模型定一个位置。比如说你是一个资深翻译，你是个语文老师。然后呢，说我现在想要干一点什么事情了，给我出个题，给我做个翻译，再给他一个简单的例子，说你照这样给我把东西做出来。</p>



<p class="wp-block-paragraph">光有提示词呢，肯定是不够的。除了刚才我们讲的完整的、结构化的提示词之外，你还是需要很多相关的上下文，才能够让大模型稳定的输出结果。那你说我们继续把提示词写长不就行了吗？我还见过那种直接写出几百字或者是上千字小作文的提示词。这个是不是可以继续往前走呢？不行了。因为你如果继续叫提示词工程呢，会容易引起误解。大家觉得只要不断的把提示词写长，就可以把这事解决掉。但其实除了提示词之外，还有非常非常多的上下文数据需要一起写进去，才能够让大模型稳定的输出我们所预期的、有价值的结果出来。</p>



<p class="wp-block-paragraph">所以呢，就不能继续叫提示词工程了，一定要起个新词。而且呢，AI时代呢，起新词是非常重要的，因为可以吸引眼球。只有足够吸引眼球的东西，才有发展的前景。所以在这个时候，上下文工程就来了，一个新词诞生了。</p>



<span id="more-2365"></span>



<p class="wp-block-paragraph">这个造词的大师现在是谁呢？叫安德烈·卡帕西。这是一位造词专家，他呢是特斯拉跟OpenAI的AI科学家，已经离职了。现在呢主要的工作是投资人和顾问，他自己投一些项目，也帮助一些项目做顾问做孵化。这哥们呢在不停的造新词。2017年呢，他造的新词叫软件2.0。什么是软件2.0呢？把神经网络视作用数据而非代码编程的新规范。程序等于网络结构加训练数据加优化器，源代码缩到几百行，真正的逻辑写在权重里面。这是2017年提出来的，现在我们的大模型基本上就是长得这个模样。</p>



<p class="wp-block-paragraph">到2023年呢，提出来叫LLMOS，大模型操作系统。把大语言模型比作新的CPU加操作系统，人类用自然语言编程，大语言模型负责调度、记忆和推理。2025年，氛围编程，也是他编发明的一个新词。彻底投降给AI，对着IDE聊天，粘贴报错，让模型自动改，人只管感受对不对。</p>



<p class="wp-block-paragraph">现在上下文工程又来了。上下文工程呢叫context engineering，这个呢并不是卡帕西自己提出的。最早呢是2025年6月27号，一位开源作者叫Simon Wilkinson。</p>



<p class="wp-block-paragraph">写了一个文章，提到了&#8221;Context Engineering&#8221;这个概念。在7月份呢，一帮人就出来说，这个实在是太棒了，要向这个方向发展，包括Longchain的一些博客。Longchain应该也算是AI Agent的一个开山项目吧，比较早期的一个项目。Shopify（加拿大最大的电商平台）的创始人也出来点赞，说一定要使用Context Engineer才可以让大模型稳定的输出结果。</p>



<p class="wp-block-paragraph">在这个时候呢，卡帕西上去点了个赞。卡帕西说：&#8221;加一，我也赞同这件事情。&#8221;所以现在再去讲这个上下文工程的时候呢，都是说这是卡帕西点赞过的，或者说是卡帕西推崇的新的概念。因为他最有名，他最喜欢造词，所以现在都是把这个上下文工程这个事情跟卡帕西挂在一起。</p>



<p class="wp-block-paragraph">AI时代，讲故事能力、吸引眼球的能力是非常非常重要的。所以我们看到一帮做机器人的公司，或者像OpenAI这样的公司，不停的给大家录视频，让普通的民众能够感受到这个东西好厉害。其实他也没搞明白这个大模型或者这些机器人到底能干嘛，只是觉得好炫酷。但这就够了。当大家都觉得这个东西很炫酷的时候，你就可以拿到融资，可以往前走。所以造新词还是很重要的。</p>



<p class="wp-block-paragraph">那么上下文工程都包含什么东西呢？讲了半天在提示词工程基础上加什么了呢？上下文工程呢一共是6个模块：</p>



<p class="wp-block-paragraph">第一个叫指令层（系统角色+少样例提示）。这个什么意思呢？原来我们写在系统提示词里的东西。我们跟大模型聊天的时候，是有两个提示词：一个叫系统提示词，一个叫用户提示词。系统提示词就是先规定大模型你是干嘛的，你是什么什么角色，现在要具体做什么什么事情。少样例是什么呢？叫Few-shot，就是你要给他提几个例子。你说我直接告诉你你是干嘛的，我不给你举例子行不行？这个事是不好的。最好呢是给他两个到八个之间的这种少量的样本。那你说我给他100个例子行不行？那个你基本上去微调模型去了。所以呢，叫少量样本。这个是写系统提示词的一个要求。所以呢，他的第一块（6个模块里的第一块）就是系统提示词。</p>



<p class="wp-block-paragraph">第二块呢叫及时用户请求，也就是原来我们使用的用户提示词。</p>



<p class="wp-block-paragraph">第三块是什么呢？叫对话历史和短期记忆。我们在聊天的时候，你不能说我每句都是新的吧，你还是要有一个对话历史的。</p>



<p class="wp-block-paragraph">第四块叫长期记忆。长期记忆呢就是说，我们通过每一次聊天，把一些关键信息把它提取出来。因为现在甭管是OpenAI、Gemini，都在向长期记忆这一块发展。</p>



<p class="wp-block-paragraph">我们说，你记得我是干嘛的吗？你记得这个原来我跟你说过什么事吗？他能想的起来要把用户偏好和先前的一些摘要放到这个上下文里边去。</p>



<p class="wp-block-paragraph">第五个呢，是RAG检索到的文档、数据库条目以及实时API的一些结果，再加一些本地知识库，再加一些搜索结果呀，再加一些数据库里的信息。</p>



<p class="wp-block-paragraph">第六块呢，叫工具与格式约束。什么意思呢？就是你要告诉他说：“我现在可以调哪些工具？”比如说我这有高德地图、有百度地图、有天气，或者一些其他的工具，你可以调用。调用的方式是什么样的？以及呢，输出什么样的一个结果？通常这种信息都不是按照正常的文本格式输出的。这种上下文工程要求的输出格式都是JSON格式，有哈西结构的一些文档。</p>



<p class="wp-block-paragraph">整个的上下文工程包括这六个组成部分。它的工作方式是什么样的？我怎么能够让它用起来呢？分四步：</p>



<p class="wp-block-paragraph">第一步呢，是写。写的时候呢，要把随时会用到但是当前窗口装不下，或者不该暴露给大语言模型的内容呢，持久化到窗口之外去，可读可写的一些外部存储上。有一些信息我认为你可能有用，但是呢现在我又不是马上就要给你，我要把它先存起来。</p>



<p class="wp-block-paragraph">第二件事呢，叫选。选是什么呢？就是在庞杂的信息文档和工具描述里头，准确定义相关性，把最有用的多少条信息放到窗口里边去。在大模型里头，有一个东西叫上下文窗口。要把一时用不着的写在外面，随时可以调用；要把有用的选到窗口里头来。</p>



<p class="wp-block-paragraph">第三步呢，叫压缩。在不丢关键信息的情况下，把即将写回窗口的内容做摘要和裁剪，满足TOKEN预算。什么意思呢？比如说做了RAG的选择了，或者做了搜索的结果返回了，这些信息是相对比较啰嗦的比较多。那怎么办呢？在这个时候你要先去做一次总结，然后把总结过的东西再扔给大模型。所以呢，在这要做压缩。</p>



<p class="wp-block-paragraph">最后呢，第四步叫隔离。把彼此可能串味的信息拆分进独立的上下文窗口或者沙盒，减少干扰，并行提速。</p>



<p class="wp-block-paragraph">我原来在这块翻过车，稍微给大家讲一嘴。我有一次呢，想去问大模型，说这个人跟谁谁一块创业去开咖啡馆了，他有什么其他的在咖啡馆里边管理或者创业的经验没有？大模型呢，就把一大堆的搜索结果拿进去去总结归纳去了。结果呢，他就说这个人在瑞幸干过高管，在星巴克干过高管。我一看，这挺好，赶快就去写演讲稿去了吗？但是最后去校验的时候发现不对。那是怎么回事呢？就是他在搜索了以后，把一大堆说星巴克跟这种咖啡馆之间是如何去比对的，瑞幸跟这些咖啡馆之间是如何差异，他们对瑞幸做了什么评价，瑞星对他们做了什么评价。</p>



<p class="wp-block-paragraph">然后呢，再把我提问的这个人混到几个结果里边去了，就把一些信息上下文给混一块了。在这个里头就不要干这个事情。如果是说星巴克跟瑞幸对这个新的咖啡馆的形态有什么样的评价和比较，你单独的去让他干活。然后呢，你单独专门问，说这个人具体是做什么事情的，过去的履历是什么样的。这样的话，他等于是把上下文就分到不同的窗口里去了，他就不会说我给你搁一块，让你混成一锅粥以后再去给我输出了。这个也是很重要的。而且你分开了以后就可以并行处理嘛，可以快一点。这就是上下文工程6个部分和分四步走。</p>



<p class="wp-block-paragraph">那么如何判定我们上下文工程是不是成功的呢？一旦有工程这俩字，就是你一定是可以去调优的，一定可以判断成不成功的。上下文工程的成功标准是同样的一个任务，用更低的成本、更少的幻觉、更快的响应速度把它完成掉，这就是成功的。你要不断的去调优，按这个方向调。失败是什么呢？叫垃圾进垃圾出。你把一大堆不应该给他的信息都扔进去了，然后一大堆垃圾的结果给你吐出来，这个就是失败了。</p>



<p class="wp-block-paragraph">但是要注意，不是所有的大模型都能顶得住上下文工程的。你写了这么长的上下文扔进去，让他去干活，不是谁都行。那么什么样的大模型可以顶得住上下文工程的这种工作方式呢？它有三个要求：</p>



<p class="wp-block-paragraph">第一个要求是你要长上下文。刚才咱们啰里八嗦说有6个部分，分几步去写，但是你把那6个部分写进去，这个总的TOKEN量是不会少的。所以呢，要求你至少是有128K的输入，你才可以去干活。所以像早期的Deepseek版本是64K输入的，干不了这事，放不下。</p>



<p class="wp-block-paragraph">第二个是什么呢？就是原生工具调用的知识。有一些早期的模型是不支持原生工具调用的，包括比较新的像LLAMA4什么的，对原生工具调用的支持都不是很好。因为你要想让他把所有的事情做完，你就要让他可以去调用工具，调用搜索引擎、调用浏览器、调用刚才我们讲的比如天气预报、高德地图。你可以去调用这些东西，他才可以去干活。所以，你要支持原生工具调用。</p>



<p class="wp-block-paragraph">第三个呢，就是要能够做稳定的Json结构输出。你不能说我要求你输出了以后，最后你输出的格式不完整、不正确，这个事也是没有办法做上下文工程的。因为呢，你这边做完上下文工程了以后，他可能不是最后一步，你下一步你还要再去用这些内容，需要去解析这个东西，才可以去说下一步再如何去使用。</p>



<p class="wp-block-paragraph">现在我们所流行的这些大模型里头，谁行谁不行呢？咱们讲了三条标准。第一个，美国的御三家都是很好用的。</p>



<p class="wp-block-paragraph">御三家就是GPT、Gemini、Claude。其他的一些呢，就稍微差一点。比如说像法国的Mistral，它的一些大的模型呢是可以使用的，但是完整格式输出的准确率不高。</p>



<p class="wp-block-paragraph">咱们刚才讲的Gemini、Claude、GPT，完整Json格式输出的时候，也不能保证100%正确，但是呢可以保证到百分之九十几正确。Mistral呢，就是最后这一步的格式输出，有时候比如少个大括号，或者是多个引号什么这种事，他就有时候会出。或者说我少几项，比如说我应该要求是4个，结果他最后给你输出了3个，或者多输出了两个，有重复的。它的这块会稍微差一些。</p>



<p class="wp-block-paragraph">马斯克的GROK3，推理模式下呢基本上可用。但是呢，有的时候会把推理的过程写到json文件里边去，所以并不是完全可用。或者说，还是有待提升吧。马斯克说这几天出GROK4，希望他能够把这个问题解决掉。</p>



<p class="wp-block-paragraph">咱们自己的，比如Deepseek R1呢，早期的版本，就是1月份的那个版本呢，64K，这是没法跑，而且它对于工具的支持也不是很好。但是呢，到Deepseek R10528的时候呢，到128K了，够用吧，也不是特别够用。最好是256K或者是一兆以上的上下文，才会更好用一些。所以呢，它在这块呢稍微有些欠缺。然后到0528这个版本呢，它已经开始支持工具了，这块基本上可用。它的最大的问题还是上下文稍微不太够长。但是呢，DeepSeek R1输出的内容还是非常好的，输出的内容质量很高。它的Json的格式也是相对来说比较正确和完整的，就正确率很高。</p>



<p class="wp-block-paragraph">千问3呢基本上是可以用的。千问3唯一的问题是什么？就是它输出的结果上，这是文字的东西呢，比Deepseek要单薄一些。另外一个现在国内比较好用的模型呢，是豆包1.6。推理过程比较长的时候，容易跑偏前头。比如推理五六步了以后，直接出结果，他有时候就直接出英文结果，这个就是稍微跑偏了一点点。</p>



<p class="wp-block-paragraph">那你说我们现在有这么多模型：GPT4O、GPT4O Mini、Gemini 2.5 Pro、Gemini 2.5 Flash。这些版本之间，你去让它跑这个上下文工程，到底有什么区别呢？所有的这种大模型Pro版，或者是GPT4O这种完整版本，一定是效果最好的。但是呢，Flash版呢，它的速度会快一些，价格便宜一些。只是呢，你要给它复杂的上下文，或者要求它输出非常复杂上下文的时候呢，它有时候会丢东西，输出也不是很完整。</p>



<p class="wp-block-paragraph">或者，你给他一个复杂上下文进来的时候，他也会有一部分就不考虑了。这个是会时有发生的。</p>



<p class="wp-block-paragraph">如果你的工作相对来说比较简单，你输入的信息和输出的信息都没有那么复杂的话，可以尝试去使用 GPT-4o Mini 或者是 Gemini 2.5 Flash 这样的版本。</p>



<p class="wp-block-paragraph">那么，上下文工程产出的结果到底是什么呢？其实很简单，就是 AI 应用可以稳定的输出能够解决特定问题的、有价值的 AI 应用。这就是上下文工程能干的活。</p>



<p class="wp-block-paragraph">原来为什么很多 AI 应用下去不好使？因为每一次的输出非常不稳定，有时候灵，有时候不灵。那你在这种情况下就很麻烦，你不知道它哪次灵，哪次不灵。你输出的结果，你还得各种的校验，比如说容错呀什么的，这些东西都要去做。</p>



<p class="wp-block-paragraph">再往下一步，比如其他的模型里去送的时候呢，你要在上一个结果输出的内容里头，再去挑选你真正需要的东西。这块就很麻烦。</p>



<p class="wp-block-paragraph">现在的话，有了上下文工程之后，你可能没法要求说我输出的内容才华横溢，但是呢，基本上我是稳定的。我每一次都稳定的输出这样的一个东西。</p>



<p class="wp-block-paragraph">那你说上下文工程是不是未来方向？是不是这个万能解药呢？赶快出个教材出去圈一圈钱去，或者说赶快去报个班我学一下。这个怎么说呢？下一批新名词还在路上。</p>



<p class="wp-block-paragraph">在 AI 这个领域里头，日新月异，不停的有新名词出来。而且呢，模型及应用这件事呢，依然有效。</p>



<p class="wp-block-paragraph">AI 应用当前的定位呢，还是比较尴尬。虽然有了上下文工程之后，很多的 AI 应用就可以去干活了，它真正有价值了，有稳定的输出了。但是上下文工程，只要带“工程”俩字，那就不是给普通人使了。</p>



<p class="wp-block-paragraph">普通人就说我们看一看就行了。真的让你去写这种上下文工程，没有程序员的能力，基本上是搞不定的。</p>



<p class="wp-block-paragraph">大模型最终呢，会通过自己的升级，让普通人可以通过闲聊的方式，实现上下文工程的稳定输出。这个最后是可以实现的。不是说你没有上下文工程的能力，你最后就解决不了。</p>



<p class="wp-block-paragraph">但是现在的大模型还达不到这个能力。但是可能再过个一两年吧，这块应该是可以做到的。但是在这一两年里头，像我们这些程序员，就可以使用上下文工程做出一大堆的 AI 应用，把第一桶金挣回来。这就是上下文工程能够真正起的作用。</p>



<p class="wp-block-paragraph">那么，上下文工程对于当前的行业有什么样的影响呢？落后的大模型服务商要抓紧升级了，方向已经确定了。</p>



<p class="wp-block-paragraph">比如说扎克伯格，挖了这么多 OpenAI 的人，赶快干活，让你的 LLAMA 4 或者 LLAMA 4.5 吧，能够很好的在上下文工程里头干活。</p>



<p class="wp-block-paragraph">比如说华为的盘古大模型，别光抄千问 2.5 了，把千问 3 抄一抄吧。</p>



<p class="wp-block-paragraph">得把上下文工程跑通，否则的话，小粉红拿着你的这些模型也搭不出AI应用来。</p>



<p class="wp-block-paragraph">还有就是像Deepseek，可能要进一步的拉长这个上下文。现在Gemini 2.5已经可以达到100万TOKEN，或者到200万TOKEN。LLAMA4其实TOKEN也很长，LLAMA4大概是可以到1,000万TOKEN，但是它对于原生的工具支持的确实要稍微差一些。这可能是未来一些大模型要去努力的方向。</p>



<p class="wp-block-paragraph">第二个大批量的AI应用就会涌现出来了。一旦大家确定下来，上下文工程是未来做AI应用里的必经之路，这一块的话一定就会快速前进。而且这一次的AI应用做出来以后，它是真的能用的。原来很多人说：“我为什么做了半天最后不能用？”因为没有上下文工程，你的AI应用整个的输出过程是不可控的。或者你为了让它变得可控，让这整个的系统跑得非常慢、非常傻。</p>



<p class="wp-block-paragraph">最终的结果是什么呢？就是英伟达的显卡又不够用了。为啥呢？新模型的训练需要英伟达，大量有用的AI应用的涌现需要英伟达，很多日常任务向AI应用的迁移需要英伟达，长上下文的吞吐还是需要英伟达。这可能就是现在上下文工程可以给我们带来的变化。</p>



<p class="wp-block-paragraph">对于每一位听众来说，你说：“我是个程序员，我现在想去学点应用，赶快学起来，不学就落后了。”那你说：“我就是个普通人，你通过我今天讲这个故事，你也知道一下AI应用里头到底是咋干活的。如果产生的结果不对了，不是你所预期的结果了，可能是上面的6个部分和4步哪一步走错了。你稍微有一些逻辑，对于你去使用AI应用也会有很大帮助的。”</p>



<p class="wp-block-paragraph">好，这个故事今天就讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>。也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>，再见！</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径</title>
		<link>https://lukefan.com/2025/04/18/gpt-3%e4%b8%8eo4-mini%e4%b8%8d%e5%86%8d%e9%ab%98%e5%86%b7%ef%bc%9a%e8%9e%8d%e5%90%88%e5%b7%a5%e5%85%b7%e8%b0%83%e7%94%a8%e3%80%81%e8%ae%b0%e5%bf%86%e4%b8%8e%e8%b6%85%e5%bc%ba%e5%9b%be%e5%83%8f/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Fri, 18 Apr 2025 00:50:27 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI局限性]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI易用性]]></category>
		<category><![CDATA[AI普及]]></category>
		<category><![CDATA[AI未来]]></category>
		<category><![CDATA[AI模型发布]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[AI视觉]]></category>
		<category><![CDATA[AI记忆 (Memory)]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[API]]></category>
		<category><![CDATA[API代理 (Open Router)]]></category>
		<category><![CDATA[API定价]]></category>
		<category><![CDATA[ChatGPT Plus]]></category>
		<category><![CDATA[Function Calling]]></category>
		<category><![CDATA[Github Copilot]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[GPT-5展望]]></category>
		<category><![CDATA[Greg Brockman]]></category>
		<category><![CDATA[IDE集成]]></category>
		<category><![CDATA[Mark Chen]]></category>
		<category><![CDATA[Meta data分析]]></category>
		<category><![CDATA[O3]]></category>
		<category><![CDATA[O4 mini]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[OpenAI发布会]]></category>
		<category><![CDATA[Sam Altman]]></category>
		<category><![CDATA[Scaling law]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[TikTok直播带货话题生成]]></category>
		<category><![CDATA[YouTube话题推荐]]></category>
		<category><![CDATA[一站式AI服务 (Total Solution)]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[内容创作]]></category>
		<category><![CDATA[图片推理 (Image Reasoning)]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[实时交互]]></category>
		<category><![CDATA[实用AI]]></category>
		<category><![CDATA[工具调用 (Tool Calling)]]></category>
		<category><![CDATA[强化学习]]></category>
		<category><![CDATA[推理模型]]></category>
		<category><![CDATA[搜索集成]]></category>
		<category><![CDATA[模型对比 (OpenAI vs 竞品)]]></category>
		<category><![CDATA[潭柘寺图片识别]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[跨模态AI]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2110</guid>

					<description><![CDATA[家！人！们！炸！了！啊！🔥
今天手抖更新了ChatGPT Plus差点把手机摔了！原来被嘲"科学家玩具"的GPT-4O直接变身打工神器了！！

重点来了（拍桌）：
1️⃣ 工具调用直接封神！！！
现在让它写脚本会自己搜资料！上次问"TikTok带货新政策"，它当场扒出20+外网报道！最绝的是...
✨自动生成带数据+案例的完整提纲！！
✨还能记住我的写作风格！！！
（本博主当场失业预警😱）

2️⃣ 图片推理原地升天！！！
拿无人机拍的潭柘寺照片甩给它
直接识别出：
✅ 现代停车场
✅ 隐藏的通信塔
✅ 连台阶材质都分析！
（本路痴狂喜！以后旅游带AI就行）

3️⃣ 记忆功能太会了！！
现在每次对话都像老友重逢
上次说喜欢用"绝绝子"
这次生成文案自动带梗！！
（AI比男朋友记性还好怎么回事）

重点提醒‼️
免费用户用不了！Plus每周50次根本不够玩！
建议直接上200刀Pro版
（别问 问就是刚刷爆信用卡💸）

最后说句扎心的：
现在不用AI的博主真的会凉！！
赶紧去更新！晚1小时都是损失！！
（别等被卷死了来我评论区哭！）



GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。

OpenAI最新发布GPT-3与O4 mini，标志着AI不再仅仅是高深莫测的科研工具。本次更新核心亮点在于工具调用（Function Call）能力大幅提升，结合记忆功能，AI能更懂用户、调用外部数据完成复杂任务，告别空泛编造。另一大突破是强大的图像推理能力，实测分析潭柘寺照片展现惊人细节理解。老范详细解读了新模型的实用性，分析了免费用户、Plus用户（月付20美金，有限制）、Pro用户（月付200美金，无限量）及API（O3与O4 mini成本差异显著）的可访问性与价格。同时，GitHub Copilot用户可通过年费会员在IDE中便捷使用O4 mini。此次发布体现了OpenAI整合强化学习成果与各项功能的战略，未来GPT-5与Sora（世界模型）更值期待。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="GPT-3与O4 mini不再高冷：融合工具调用、记忆与超强图像推理，普通人也能高效应用AI，一文看懂成本、限制与Copilot捷径。" width="900" height="506" src="https://www.youtube.com/embed/ICUcxoOyJPo?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">GPT-3和O4 mini发布了，这次绝不再仅仅是科学家们的玩具了。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">本来GPT-3和O4 mini发布呢，我并没有抱太大的期望。为什么呢？因为前面O1和O3 mini发布的时候呢，看得我头晕眼花的。我记得应该是在去年12天连续发布会的时候发布的O3 mini，实在是太不明觉厉了。各种的复杂科学问题，咔咔就给解决了，然后各种的排名都排得很高。但是呢，我自己其实并不怎么用。</p>



<p class="wp-block-paragraph">为什么呢？第一个，ChatGPT Plus用户里边呢，它是有用量限制的，并不是随便让你用的。所以在有用量限制的情况下，你就得省着用，而且你也感觉不出有太大差异来。你说你用它干嘛？据说编程很强，但是它没法跟IDE结合，基本上也就放弃了。你是可以出一大堆的代码，但是你还得向IDE里边去考来考去的，很麻烦。那你说我通过API调用吧，直接使用O1和O3 mini这些模型，实在是贵，所以就放弃了。</p>



<span id="more-2110"></span>



<p class="wp-block-paragraph">这一次呢，真的就不一样了。首先是Greg重新上线了。Greg其实好长时间不怎么出来了，他是在2023年11月份山姆·奥特曼宫变之后，就变得非常低调。2023年11月开始休假，后来是在微软的强烈要求下才回归的。到2024年又开始了长期休假，但是在大量高管离职之后，年底再次回归，还宣布：“我提前俩月回来了，我本来还想再多歇一歇的。”现在呢，主要负责机器人业务，不再担任董事会主席了，保留了总裁的职位。</p>



<p class="wp-block-paragraph">Greg上来开始显得有一些紧张，不知道该说什么。大家可以去看看那25分钟的发布会录像，后面逐渐放松了，也是长时间不露面、不说话的一个表现吧。这一次的话，全程C位，坐在最中间的位置上，主持O3和O4 mini的发布会，可见重视程度了。</p>



<p class="wp-block-paragraph">这一次的发布会呢，基本上是二对二的分配，就是两个老板配上两个做事情的。两个老板始终坐着不动，做事情的人呢，就是讲到不同的部分，然后来换。还有一个老板呢，叫Mark陈，首席研究官，亚洲脸，但不确定是不是华人。有传闻其父母是从台湾去的美国。现在呢，有一种ABC脸，看起来有点像华人，但是脸型又不像。这个据说呢，是长期英文发音和美式的饮食习惯，以及美国教育所形成的一种脸型，反正跟华人还是有一定区别的。有可能是个华人，当然也有可能是个越南人，这个不确定。</p>



<p class="wp-block-paragraph">另外两个呢，是根据演示的过程不同，不停地换工程师。国内引用的照片呢，肯定是有偏向性的。国内各媒体呢……</p>



<p class="wp-block-paragraph">通常引用的是讲到模型强化训练和各种跑分的这两位工程师。为什么呢？因为里头有一个叫周文达的，是一位华人。国内各个媒体引用照片的时候，一般会引用含华量比较高的照片。</p>



<p class="wp-block-paragraph">一开始呢，也是讲科学，什么量子力学。本来我也挺失望的。科学的部分呢，对于我这种普通人来说，已经没有那么大关系了——看不懂，没需求，也用不起。所以一看，还是这东西，好像没什么意思。</p>



<p class="wp-block-paragraph">但是讲到后边呢，越来越兴奋了。咱们讲几个好玩的特性，并不跟大家完整的去复述这个发布会了。有兴趣可以去看这个25分钟的发布会，各种数值绝对是遥遥领先。</p>



<p class="wp-block-paragraph">OpenAI呢，作为行业老大，他是有自觉的。什么叫自觉？从来不跟别人比数值，只跟自己比。就是他不会说我把Gemini 2.5拎出来比一比，Claude 3.7拎出来比一比，或者跟DeepSeek比一比。别人都是说我比OpenAI强在哪，或者我已经接近OpenAI了。OpenAI永远说我就跟自己比。</p>



<p class="wp-block-paragraph">所以我们现在可以看到的所有的数值比较，都是跟GPT O1、O1 mini、O3 mini跟这些模型进行比较的，没有跟其他模型比较的数据。</p>



<p class="wp-block-paragraph">咱们来讲三个有趣的功能点吧。</p>



<p class="wp-block-paragraph">第一个非常有趣的功能点，也是让我觉得GPT O3和O4mini真的能用了的一个最核心的点，就是它可以进行工具调用了。什么意思？我们正常情况下一个大模型，你让他去给你生成内容的时候，他其实都是在胡说八道的。就算他有的时候说的很像，但他依然是在胡说八道，是在编。他不能保证内容是可验证的，而且你每一次让他说同样的事情，他都给你编出不同的花样来。</p>



<p class="wp-block-paragraph">那么一定要带上搜索，带上知识库，带上其他的辅助工具，他才可以靠谱的干活。现在推理模型已经可以靠谱的干活了。所以O3跟O4mini是可以进行工具调用的。但是他们绝对不是第一个。在发布会上他们讲说，我们是第一个在推理里边进行工具调用的，这个真的不是。GROK3也是推理模型，也是可以做各种工具调用的。</p>



<p class="wp-block-paragraph">只是呢，GPT O3跟O4 mini呢，据说在工具调用上要有极大的提升，因为他们在这块专门做了训练。他可以进行几十次的这种工具调用。当你让他去做一个很复杂的事情的时候，他会反复的在他认为需要的时候去调用工具，获得外部数据，或者做一些相应的操作。这个很棒。</p>



<p class="wp-block-paragraph">O3跟O4mini呢，是在推理的过程中去调用工具，效果绝对是碾压原来不能使用工具的O1，效果好的一塌糊涂。推理模型如果不挂搜索引擎……</p>



<p class="wp-block-paragraph">不挂知识库，基本上就是胡说八道。他要比正常的生成模型还要再胡说八道一些，因为他想的多，越想就越错。知识越多越反动，这个幻觉是非常非常严重的。挂上搜索之后，基本上不再需要 deep research 这种东西了。现在你用 O3 去挂搜索，跟 deep research 的效果基本上是可以平齐的。</p>



<p class="wp-block-paragraph">现在呢，OpenAI 内部有很多的工具，包括 Python 执行、调用浏览器、搜索，有很多这样的工具，它都可以自动的去调用。当有这些功能之后，每一个普通人，不需要是科学家，也可以用 O3 跟 O4mini 完成很多任务了。只是目前呢，OpenAI 内部的这些工具，你通过外部你使不了。还有 function call 这个调用呢，现在在代理站上还没有接上，这个还要再等一等。什么意思？就是你直接挂 OpenAI 的 API，挂它原厂的，是可以进行 function call 的，可以把你自己的各种各样的工具放在里边让它去调用。原来我们演示过使用高德地图的工具，让他去找饭馆、规划路线什么的，这个都是可以去使用了。如果我们使用 API 来调用 O3 和 O4mini 的话，OpenAI 内部的什么搜索呀，这些工具我们是无法使用的，就差在这了。这是一个比较有趣的点，但是具体怎么用，待会我们来举一个案例。</p>



<p class="wp-block-paragraph">第二个有趣的点是什么呢？就是跟记忆相结合了。原来我们专门录了一期视频来讲 OpenAI 有了记忆功能，现在它也有记忆功能。于是我就向它提出了要求，我说：“根据你对我的了解，我是个 Youtuber，给我推荐一些适合我的 YouTube 话题，我要去写稿去了。”然后他就开始去搜索，调用搜索工具去搜索去了。搜索完了以后说：“我发现你是专门讲 AI、讲科技、讲流量、讲创投的博主，我发现有哪些哪些话题最近是最新的，适合你去讲。”其中有一个话题呢，叫 TikTok 降低了海外直播带货门槛。原来呢是要 1,000 个粉丝才可以带货，现在 200 粉丝就可以带货了，说这个你看怎么样？我说这个不错。我说：“你根据你对我的了解，给我去写个提纲吧。”然后他就按照我的习惯，给我夸夸把提纲列好了，说 TikTok 是哪天哪天发了一个什么样的文儿，为什么什么东西，写的还很好的一个提纲。在这个过程中引用了我的记忆，调用了搜索，聚集了大量的信息。我再说：“那你再给我补充点数据和观点吧。”一般我是会有一个自己的观点，我说：“我的观点是什么什么，你给我补充进去。”然后呢，我为了论证我的观点。</p>



<p class="wp-block-paragraph">我还需要哪些数据？然后，夸夸夸又去搜索，搜索完了给我补充进来。做了两次补充以后，这个提纲基本上就完成了，就完完全全可以用了。过几天咱们去讲这个“TikTok降低海外直播带货门槛”这个故事吧，这个还是很有趣的一个点。所以现在真的是每个人都能用上了。</p>



<p class="wp-block-paragraph">第三个比较好玩的点是什么呢？就是图片推理。这个图片推理是非常非常强的一个点，绝对不是识别图片，然后将文字作为提示词去推理。我们很多人一看图片推理这件事，都是想的说，我们把这个图片识别一下，变成一大堆文字。不是这样。</p>



<p class="wp-block-paragraph">跟大家举一个案例吧。我今天去潭柘寺了，玩我的无人机。拿我的无人机呢，在潭柘寺的外面，拍了一张俯瞰潭柘寺的全景照片。我就问O3，我说这是哪？这个建筑群的布局是什么样的呀？这个提示词就这样的。问完了以后呢，这个O3就去干活去了。他把这个图片先整个的分析一下，然后呢，放大每一块切割，说这一小块是什么，那一小块什么，把它切成一块一块的。然后对每一块进行识别，而且在切完了以后，还对每一块去调整方向，说这块好像你拍歪了，改一个方向，可能更能认出是什么来。通过这样的一个方式去推理，看那个推理过程，惊讶的我目瞪口呆，我告诉你。</p>



<figure class="wp-block-image size-large"><img decoding="async" src="https://yt3.ggpht.com/V8YuR81dkoI4c4XrT_1NNc3OC-nnED98ttqo20HUVhT0uffz8E-yZymr54jlkHtR8gnfCSkxbGOS7Q=s1600-rw-nd-v1" alt=""/></figure>



<p class="wp-block-paragraph">最后告诉我说什么？从这张航拍来看，这是一张典型的依山就势、三层台地式布局的北方佛寺，很像北京西山脚下的潭柘寺。我没有告诉O3这是航拍照片，他就全都认出来了，好聪明。但是注意不要被骗了，照片里面是有Meta data的，就是有一些基础信息的。这个信息包括什么？拍摄时间、分辨率、色彩、空间、光圈、快门、白平衡，都在里头。还有拍摄设备那个里头，写着你是用大疆的什么设备拍的，大疆air 3S。然后呢，这个照片里还写着经纬度，因为大疆的无人机里头是有GPS的，它拍完照片是会把经纬度直接写在照片里的。完完全全可以通过这些Meta data就编出来的。</p>



<p class="wp-block-paragraph">所以呢，这个到底是真聪明还是假聪明？还是说我把经纬度拎出来，把这个拍摄设备拎出来，就直接搜索一下，就给你出结果了？这个我们要往下看。他呢还给我接着讲，说这个图片是中轴对称的三进院。第一进呢叫山门到天王殿，第二进呢是天王殿到大雄宝殿，第三进呢是大雄宝殿到法华殿和藏经阁。中轴线两侧各有回廊和配殿，比如观音殿、药师殿、僧房、斋堂，左右分布对称，也有现代化的客房和管理用房。</p>



<p class="wp-block-paragraph">再往后还写了一个特别有趣的东西：底层的停车场与服务中心，通过台阶与甬道与寺内各层相连。右侧的通讯塔，现代建筑。</p>



<p class="wp-block-paragraph">为后期补建的配套设施，这是不是根据潭柘寺的信息搜索出来的呢？这就是我们要去问的。他到底是真聪明还是假聪明？</p>



<p class="wp-block-paragraph">潭柘寺最后的一进大殿不叫藏经阁，而是叫毗卢殿。应该是五方佛中间一个，然后后边是东方、西方、南方、北方，一共是五个佛在里面，所以不一样。但是中国寺庙的默认布局呢，最后一层是藏经阁。所以这个并不是直接搜索出来的。如果直接搜潭柘寺的话，他应该写最后一层是毗卢阁。</p>



<p class="wp-block-paragraph">至于底层的停车场、服务中心、现代通信塔，绝对是图片推理推出来的。因为不会有哪个介绍潭柘寺的网页去把这些东西都给你写在里头，所以还是非常棒的，可以进行图片推理。</p>



<p class="wp-block-paragraph">有了这些有趣的功能之后，咱们可以通过什么样的方式来使用它呢？现在免费用户无法使用。你说我不愿意交钱，那么O3跟O4mini你使不了。Plus用户，像我这样的一个月20美金的用户，是可以使用的，但是有限制。O3每周50次，我今天大概已经使了有五六次了。O4 mini呢是每天150次，这个应该足够使。如果是每个月200美金的Pro用户，无限量使用。</p>



<p class="wp-block-paragraph">API依然很昂贵。使用它的API，我可能还要稍微掂量掂量。O3每100万TOKEN的输入是10美金，输出是40美金。O4mini要快一些，也要小一些，它呢每100万TOKEN的输入是1.1美金，输出是4.4美金。应该比在美国部署的DeepSeek R1相差仿佛吧，就是基本上还是可以用的。</p>



<p class="wp-block-paragraph">这种推理模型呢都是话痨模型，价格还是挺贵的。特别是10美金100万TOKEN输入，40美金100万TOKEN输出，这个非常非常昂贵。再结合上工具调用，图片推理，这个价格就像坐在日本的出租车里，看着计价器跳的那叫一个心惊肉跳。</p>



<p class="wp-block-paragraph">其他的一些代理，就是这种API代理也已经开始工作了。Open Router或者其他的一些代理都可以使用，价格是相同的。只是呢，目前function call还没接上。为什么要专门强调这个？因为有些人在国内充值OpenAI的API是比较费劲的，像我就是这样。所以我使用OpenAI的API都是通过各种的代理去使用的。</p>



<p class="wp-block-paragraph">还有一些什么方式可以使用的呢？GitHub Copilot里头是有GPT4 O4 mini的，但是没有GPT O3。它只有这些mini模型，它有O1，但是没有O3上来。O4 mini的话，应该是可以大范围使用的，但是前提你还是付费的。</p>



<p class="wp-block-paragraph">像我是Github Copilot，99美元一年的会员。所以呢，我现在可以在IDE里边去使用它，Client和Roo Code也可以通过Github Copilot的会员直接去使用GPT-4 mini。那你说Client或者是Roo Code，我自己挂OpenAI的API或者是Open Router的API行不行？没毛病，都可以使，但是你得按TOKEN付费，那个很贵。挂Github Copilot下面的GPT-4 mini的模型的话，你有那个99刀一年的年费，就可以放心的玩耍了。</p>



<p class="wp-block-paragraph">总结一下，OpenAI现在前进的方向到底是什么样的？它呢正在将各种零散的功能点聚集在一起。其实记忆早就有了，function call早就有了，推理早就有了。他一方面呢，是在拼命的去做强化学习，然后告诉大家现在强化学习scaling law依然管用。你把更多的数据、更多的算力堆进去，强化学习的效果就能起来，没有任何问题，大家好好去买英伟达显卡。另外一方面，它就把各种其他的小功能给你凑起来了，包括记忆、function call、推理、搜索呀，把这些东西给你搁在一块，你看真的好用。</p>



<p class="wp-block-paragraph">其他各大模型厂商呢，在某些方面可以接近甚至赶超OpenAI，但是综合实力上，OpenAI绝对还是领先的。当OpenAI把各种新功能聚合在一起的时候，绝对是遥遥领先。它在每一个细节点上，可能都会比别人强很多。就像咱们前几天讲过GPT-4O的绘图功能，它虽然说在完整的绘图过程中，它表现力上、艺术感上没有Midjourney强，但是呢，它在文字理解上、文字渲染上，肯定是要比其他所有的这些绘图模型都要强很多的。</p>



<p class="wp-block-paragraph">GPT-5现在正在路上了，甭管是今年下半年能出来，还是什么时候能出来，我觉得都是值得期待的。到那个时候就不用再去选模型了，你上来以后，他就根据你的问题直接推荐，直接给你反馈了，说我这个应该推理还是不应该推理，应该使用更大的模型还是使用小一些的模型，我应该调用哪些工具，应不应该搜索。这个我觉得还是值得期待的，就像以前我们总讲的，叫total solution，一站式服务。你进来了以后，我给你服务好就完了，至于我到底给你上了几个工具、几个模型，你就甭问了，最后是包你满意。</p>



<p class="wp-block-paragraph">后边还有Sora，还是有念想。虽然Sora前面翻车了，现在大家都已经把它忘掉了，但是当它把这么多的功能聚集在一起的时候。</p>



<p class="wp-block-paragraph">什么搜索呀、工具呀、推理，把这些东西跟Sora聚集在一起的时候，可能又会变出一些新的、不一样的东西出来。</p>



<p class="wp-block-paragraph">Sora当年可是号称叫“世界模型”的。当它跟我们真实世界通过搜索引擎连接在一起的时候，那可能真的就要创造世界了。</p>



<p class="wp-block-paragraph">好，这一期就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群。也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
