<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Gemini 2.0 Flash &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/gemini-2-0-flash/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Sun, 06 Apr 2025 00:42:31 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>Gemini 2.0 Flash &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Midjourney V7震撼发布：艺术巅峰细节狂魔强势回归，但面对GPT-4o的一致性与定价策略，它还是AI绘图的唯一真神吗？</title>
		<link>https://lukefan.com/2025/04/06/midjourney-v7%e9%9c%87%e6%92%bc%e5%8f%91%e5%b8%83%ef%bc%9a%e8%89%ba%e6%9c%af%e5%b7%85%e5%b3%b0%e7%bb%86%e8%8a%82%e7%8b%82%e9%ad%94%e5%bc%ba%e5%8a%bf%e5%9b%9e%e5%bd%92%ef%bc%8c%e4%bd%86%e9%9d%a2/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 06 Apr 2025 00:42:30 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[30美元)]]></category>
		<category><![CDATA[3D模型]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI大模型内卷]]></category>
		<category><![CDATA[AI绘图]]></category>
		<category><![CDATA[AI绘画工具]]></category>
		<category><![CDATA[Alpha版]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Gemini 2.0 Flash]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[Grok (XAI)]]></category>
		<category><![CDATA[MidJourney V6.1]]></category>
		<category><![CDATA[MidJourney V7]]></category>
		<category><![CDATA[MidJourney更新]]></category>
		<category><![CDATA[MidJourney评测]]></category>
		<category><![CDATA[Relax模式]]></category>
		<category><![CDATA[Turbo模式]]></category>
		<category><![CDATA[V7发布]]></category>
		<category><![CDATA[一致性问题]]></category>
		<category><![CDATA[个性化设置]]></category>
		<category><![CDATA[中文提示词]]></category>
		<category><![CDATA[书店]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人物绘画 (汉服新娘)]]></category>
		<category><![CDATA[优缺点分析]]></category>
		<category><![CDATA[厨房]]></category>
		<category><![CDATA[吉卜力风格]]></category>
		<category><![CDATA[图像生成]]></category>
		<category><![CDATA[图像质量]]></category>
		<category><![CDATA[场景绘画]]></category>
		<category><![CDATA[基础模型竞争]]></category>
		<category><![CDATA[定价策略]]></category>
		<category><![CDATA[戏精AI]]></category>
		<category><![CDATA[手绘风格]]></category>
		<category><![CDATA[指令理解]]></category>
		<category><![CDATA[文字生成能力]]></category>
		<category><![CDATA[横评对比]]></category>
		<category><![CDATA[照片真实感]]></category>
		<category><![CDATA[生产力工具潜力]]></category>
		<category><![CDATA[用嘴生图]]></category>
		<category><![CDATA[皮克斯3D风格]]></category>
		<category><![CDATA[细节狂魔]]></category>
		<category><![CDATA[艺术表现力]]></category>
		<category><![CDATA[草稿模式]]></category>
		<category><![CDATA[视频生成]]></category>
		<category><![CDATA[订阅费用 (10美元]]></category>
		<category><![CDATA[语音生成]]></category>
		<category><![CDATA[酒吧]]></category>
		<category><![CDATA[食物绘画 (拉面)]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2073</guid>

					<description><![CDATA[🔥 **AI绘图界の大地震来了！！**
家人们！！今天必须给你们安利这个核弹级更新！！Midjourney V7直接把行业标准拉到外太空！！！（破音）

💥 **先说结论：**
细节控给我跪着看！！艺术表现力吊打GPT-4o！！中文提示词真香警告！！就是钱包有点疼！！！（猛拍桌子）

👇🏻 **连夜测评10小时の暴风输出：**

1️⃣ **【细节狂魔の逆天操作】**
给你们看这个汉服新娘！！（图）发丝根根分明！！刺绣暗纹会呼吸！！连耳坠折射的光都像在跳舞！！GPT-4o直接被按在地上摩擦！！（疯狂截图）

2️⃣ **【中文提示词原地封神】**
终于不用查词典了！！"巴厘岛日落小酒馆"直接出大片！！（对比图）虽然文字排版还是鬼画符...但本丈育真的哭出声！！（抹眼泪）

3️⃣ **【戏精本精の加戏现场】**
说要日式拉面就给我摆满整碗料！！（图）叉烧纹路/溏心蛋流浆/蒸汽特效全拉满！！甲方爸爸看了连夜打钱！！（就是这碗面害我点了夜宵！！）

⚠️ **避坑指南划重点：**
✖️ 30刀套餐才能无限畅画！！学生党慎入！！
✖️ 一致性还是渣渣！画连载漫画会精分！！
✖️ 中文生成文字全是乱码！菜单设计还得靠PS！！

🎉 **未来王炸预测：**
听说要出自带3D建模！！视频生成也在路上！！本设计狗已经准备好转行当AI驯兽师了！！！（振臂高呼）

Midjourney V7震撼发布：艺术巅峰细节狂魔强势回归，但面对GPT-4o的一致性与定价策略，它还是AI绘图的唯一真神吗？

**Midjourney V7** Alpha版本携惊人**细节**与**艺术感**震撼登场，在**AI绘图**领域再掀波澜！本篇内容由“老潘讲故事”深度解析，全方位**横向评测** **Midjourney V7** 对比 V6.1、**GPT-4o**及**Grok**在**文生图**上的表现。我们探讨了其强大的图像生成能力，尤其是在处理复杂场景和特定风格（如皮克斯、吉卜力、手绘）时的优势，以及对**中文提示词**的良好支持。同时，体验了新颖的**草稿模式**和“**用嘴修图**”功能。然而，MJ V7在**一致性**方面仍落后于**GPT-4o**，文字生成能力有待提高，且**定价**策略调整（取消Relax模式）可能影响用户选择。这究竟是**AI艺术**的新标杆，还是距离高效**生产力工具**尚有差距？一起了解**Midjourney V7** **Alpha版本**的真实表现、未来潜力（如视频、3D）与当前挑战。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="Midjourney V7震撼发布：艺术巅峰细节狂魔强势回归，但面对GPT-4o的一致性与定价策略，它还是AI绘图的唯一真神吗？" width="900" height="506" src="https://www.youtube.com/embed/oBkeNHj5Ya0?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">MidJourney V7终于发布了，是不是王者归来了呢？</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。2025年，大模型进入了快速内卷期。从春节的时候，DeepSeek R1发布，打响了第一枪。前面DeepSeek V3大家还没觉得怎么样，R1一出来，第一枪打响了，大家开始卷推理、卷开源、卷免费、卷基础模型。</p>



<p class="wp-block-paragraph">基础模型是什么？GPT-4.5、Claude 3.7、Gemini 2.5 Pro以及DeepSeek V30324版，这是在卷基础模型。然后大家去卷AI agent，各种deep search、deeper search或者是deep research，Manus，各种的AI agent开始卷起来。最后卷绘图，绘图应该是从GROK3开始卷起。GROK3说：“我可以不设限的让大家去画图。”算是给了大家一点点小惊喜。</p>



<p class="wp-block-paragraph">Gemini 2.0 Flash直接说：“天塌了，这个以后做Photoshop的人要没饭吃了。”他对语言文字的理解和执行能力非常非常的强。你给他一个美女，给他一个包，说让美女拎着包，一致性很好。这个美女拎着这个包没有任何问题。当时大家就讲说Photoshop这帮人要失业，但是并没有引起特别大的风潮。为什么？因为Gemini 2.0 Flash画太复杂的东西是画不了的。</p>



<span id="more-2073"></span>



<p class="wp-block-paragraph">再往后，GPT-4o图形功能就出来了，这个就真的天塌了，又来了一次GPT3.5时刻。什么是GPT3.5时刻？就是当时他们把ChatGPT-3.5推出来的时候，整个社会都震惊了。现在你到x平台，到各种社交媒体平台上去看，大家都在疯狂的分享吉卜力风格的各种合影、各种图片。这确实是非常有感染力的一个产品，而且它的一致性极强，妥妥的生产力工具已经到手了。只是它也有不足的地方，就是太复杂的它还是表现能力有欠缺。</p>



<p class="wp-block-paragraph">在这样的一个时刻，Midjourney V7就露出了影子。在GPT-4o轰动整个社会的时候，MidJourney的CEO就跑出来表示不屑一顾，说：“你这算啥？艺术感、细节都不行，你们等着，下个礼拜我就发布MidJourney V7。”因为MidJourney到6.1以后，很长一段时间都没有更新啊。所以他说：“我们马上要发布了，而且时间确定了下个礼拜。”他所讲的下个礼拜，实际上就是我们刚刚过完这一周。从周一开始，先做了一轮rank。做rank干嘛？他给你一大堆图片，让你去打分。每一次有两张图片，这两张图片……</p>



<p class="wp-block-paragraph">你可以选择你感觉比较好的一张，或者能够触动你的一张。而且这两张图片可能画的是完全两个不同的东西，完全无关的东西。你只要是看哪个稍微好一点，去选就完了。你可以选择说我第一张好看一点，或者你可以选择回退：“上一次我选错了，两张我实在是半斤八两，分不出来。”你可以SKIP，要下一次，这个都是可以的。</p>



<p class="wp-block-paragraph">是周一干的事情。周二做了第二轮，第二轮我没去啊。到周三又做了第三轮的打分。第一轮的打分里面，还有很多图片的质量是很差的，就属于生成失败的。比如说跑焦了，或者是一些绘制一半的，这样的东西就都拿出来了。到第三天我又去打分去了，打了几千张图片，还是非常棒的。第三天给出来的图片，就完完全全是MidJourney V7生成的图片了，那个效果已经非常好了。</p>



<p class="wp-block-paragraph">到第四天周四没有什么动静，其实也做了一件事，什么就是把我的relax权限给取消了。什么意思？像我这种每个月交10美金的订阅用户，我本来是可以用fast方式去画图的。fast方式就是他给我200分钟，实际上基本上够我画200幅画，就可以做这个事情。那么如果是可以使用relax，就是这种放松模式，它是可以无限画，但是会慢一点点。在礼拜四，他就直接把所有像我们这样的10美金的叫基础用户的relax权限全取消掉了，这是干了这么个事情。</p>



<p class="wp-block-paragraph">到周五推出了第一个Alpha版本。所以现在我们虽然看到了MidJourney V7，也可以用V7去画画了，但是其实我们现在使用的是MidJourney V7的Alpha。第一版是最早期版本，现在这个版本极其精细。你让它画什么东西，各种细节拉满，艺术感表现力都非常的强。指令的理解和遵循能力也比原来MidJourney的6.1要强很多了。原来MidJourney 6.1，你如果提示词很长了，后半截它就给你忽略掉了。现在V7都可以去正常使用，而且现在支持中文提示词，你不需要再去写英文提示词了。</p>



<p class="wp-block-paragraph">当然，也有一些让我们不是那么满意的地方。第一个一致性并没有GPT-4o那么好。什么叫一致性？你告诉他我画的都是同样的一个东西，在不同的图片里，它应该长成一样的。在这块这个MidJourney V7还有待提升。另外一个就是太精细了，他很喜欢给自己加戏哈。待会我展示一下他的图片，你们自己去判断。很多功能现在还没有上来，第一个是cref还没回来。这个是干嘛？换脸的，就是原来在MidJourney 6.1里头。</p>



<p class="wp-block-paragraph">你可以给它一张照片，说：“我现在要用这张脸。”它是可以去工作的。但是现在V7里头还不支持这个功能，文字功能还很差。这个不比V6.1强多少，而且中文完完全全不支持，这是现在的一个情况。</p>



<p class="wp-block-paragraph">另外一个就是很贵。它只允许relax模式和Turbo模式来工作。刚才我讲了，我的relax模式被取消了，所以我不允许再去画relax了。只有一个月30美金以上的人，才可以使用relax无限的去画。我是可以使用Turbo模式的啊。Turbo模式什么意思？就是快速生图。那么快了挺好吗？但是它生成一张要收两张图的钱。所以我原来一个月有200分钟的生图时间，能够生200张图，现在我只能生100张图了。所以这一块还是要贵一些的。</p>



<p class="wp-block-paragraph">它还有一个比较有趣的功能，叫草稿模式，更快。而且草稿模式是完全支持用嘴生图的。下面我们来演示用嘴生图。</p>



<p class="wp-block-paragraph">这就是Midjourney的网站了。这个网站大家可以去浏览别人画好的画，去创造自己的图片，或者是去做编辑。这个编辑咱们就不再细讲了。这有一个很重要的点就是做个性化。V7是强制要求开个性化的，所以如果你原来没有开过个性化，那么你现在需要去对V7做个性化训练。</p>



<p class="wp-block-paragraph">什么叫个性化？就是说我喜欢哪张图，我不喜欢哪张图，你要去打一大堆分。打完了以后，它就会知道哪个是你喜欢的。大概是要打到几百张，它就会给你形成一个风格。那么每一次画出来的东西，都是跟你喜欢的比较相近。</p>



<p class="wp-block-paragraph">下面是我们自己画的一些图片。好，那么我们现在就来画。我们现在可以在DISCORD里头画，也可以在这里画。你在这写上提示词就可以，在这加图片也是可以。这个p我们要去做个性化，V7是强制个性化的，你不做个性化它不让你画。然后这是方的、圆的、扁的，是这个哪一个版本啊？我们现在都是使用V7来进行绘制。</p>



<p class="wp-block-paragraph">好了，大家注意，这里有一个很重要的东西，就是草稿模式。一旦点中了草稿模式以后，它会快速的给你生成一些比较简单的图画，也将就能看。一旦点了草稿模式之后，这后边就出了麦克风，我们就可以去跟它说话了。</p>



<p class="wp-block-paragraph">“赛博朋克都市程序员的卧室，改成皮克斯3D风格，色彩更加鲜艳一些。”<br>“以第三张为基础，加上一把人体工学椅。”<br>“以第三张为基础，加上两只猫。”<br>“我没有看到猫猫在哪里，放大第三章。”</p>



<p class="wp-block-paragraph">好，我把它这个录音关掉，我们就可以放心说话了。这个是会比较慢的。为什么？前面画的都相对来说要粗略一些，它是draft模式的。但是你在这样的图上让它去做放大，就会费点劲。</p>



<p class="wp-block-paragraph">正常的我们画完了以后放大是很快的，draft模式就会慢很多。现在是放大到16%。好，这就是我们的用嘴修图的过程。过程并没有那么顺滑，因为它的一致性还是有问题的。但是，我们已经完完全全可以用嘴修图了。</p>



<p class="wp-block-paragraph">下面我要展示一下用MidJourney V7生成的图片。当然，你说我只用MidJourney V7来生成，可能大家没有什么感觉，所以我们来进行一些对比：MidJourney V7生成图片的横评比较。大家注意，我后面这张图就是用MidJourney V7来去生成的。当时的提示词应该是吉卜力风格的日式烘焙店厨房，感觉还是很有趣的，画的非常的精美。</p>



<p class="wp-block-paragraph">那么怎么个横评法？首先我们要对中文提示词跟英文提示词进行比较，比较照片以及指定风格。皮克斯3D和吉卜力工作室风格我们都要去测试一下，手绘风格也要试验一下。画的东西是食物、人物和场景。我们比较是MidJourney V6.1、V7、GPT-4o和XAI的Grok，我们是对这四个版本进行比较。我后面这幅画也是MidJourney V7画出来的，非常的精美。材质上面，比如小帽子上面的这些材质都非常精细。</p>



<p class="wp-block-paragraph">好，我们开始正式的比较。首先是中文提示词：巴厘岛海边日落的小酒吧。因为MidJourney V6.1是不支持中文提示词的，所以没有它参赛。左上角的这个是GPT-4o的，大家看一下还是有一点点感觉：日落下面的小酒吧，而且巴厘岛它有一个草棚子的顶。右上角这个是Grok的，感觉也还可以，只是它里面画的东西要稍微少了一点点。左下角的就是MidJourney V7画出来的，我说它加戏，非常多的细节，有灯光有各种的细节都在这里，而且色彩非常的真实和柔和。这个就是MidJourney V7。</p>



<p class="wp-block-paragraph">同样的，我们去使用英文提示词。这个刚才我们使用的是中文提示词，如果是英文提示词，使用DeepSeek R1生成的英文超长提示词。在这个左下角，大家看到的就是超长提示词了，就是一个小的这种餐吧，在巴厘岛的海边上，在这个golden hour，就是金色阳光洒下的时候。写的非常完整，而且下头还要写我使用各种的配色，使用什么样的灯光，要有茅草的屋顶，这都写上了。右下角是MidJourney V6.1生成的，其实已经感觉非常精细了。但是跟左上角MidJourney V7生成的图片比较起来，它的色彩的真实度还原度，以及各种细节纹理，你看这个地板上的这些纹理。</p>



<p class="wp-block-paragraph">还是没有办法去比较的，所以这绝对是细节狂魔。那么，Grok和GPT-4o做成什么样了呢？一模一样的提示词扔进去，GPT-4o对于这种超长提示词是有问题的，所以它生成出来的东西，怎么说呢？你把它作为是绘本，这个是可以用的，但是跟前面MidJourney生成的，哪怕是6.1生成的都完全没法比。至于Grok的脸完全塌掉了，脸是一点都没有办法看的，但是整个的氛围还是正确的，细节就废掉了。</p>



<p class="wp-block-paragraph">再往后，我们来进行指定风格的绘制。先绘制皮克斯3D风格的美式汉堡店，还是使用DeepSeek R1超长提示词。我们看看右下角的，是6.1的。怎么说呢？很多细节是有问题的，包括这个人物，这些细节是错误的，但是它整个的氛围非常好，感觉是稍微有些不太真实。而左上角是V7的，非常非常细致，地板上都有反光。用游戏的说法，这玩意叫光追，这些都已经给你画出来了，而且各种的细节拉满，汉堡橱窗、各种的炊具、冰箱，每一个细节，每一个家具，都属于统一风格的。但是你说这个算不算皮克斯3D风格？算，也稍微有一点点小差距。它介于皮克斯3D风格与现实风格之间的一个状态，还是非常绚丽的一张图。</p>



<p class="wp-block-paragraph">再往后看这个GPT-4o，它对于皮克斯3D风格的理解要更加透彻一些，色彩也更好，但是细节和艺术感就不要太纠结了，没有了。至于Grok，我觉得基本上算失败了，没法看了。</p>



<p class="wp-block-paragraph">再往后，我们试试吉卜力风。提示词是“京都春季街头书店”，用DeepSeek R1超长提示词去做的。我都是把这一句话“吉卜力风格，京都春季街头书店”这句话扔给DeepSeek R1，说你给我去生成英文提示词。他画出来的，右下角V6.1的，感觉确实是一个日漫的风格，没有任何问题，但是它的色彩稍微有些明亮了。左上角V7的，大家仔细去看这个里面的细节，自行车、这个樱花树、各种房间里面的细节以及色彩，绝对是要比6.1的要强非常多了。但是你说这是不是一个吉卜力风？色彩和格调是啊，但是它还是更像一个吉卜力风格的现实场景，并不是一个纯手绘的吉卜力风，这个还是有些差距的。</p>



<p class="wp-block-paragraph">那么在吉卜力风这一块，GPT-4o一定是做的非常棒的。大家看到它这种色彩，这种乌突突的感觉，但是它的细节就不用想了，这就是GPT-4o的。至于Grok，它叫日漫风，你虽然用的是吉卜力风格给它的，但是它画出来的是日漫风，距离吉卜力风还是差的比较远。这是我们做的吉卜力风格的“京都春季街头书店”。</p>



<p class="wp-block-paragraph">再往后，我们指定手绘风。</p>



<p class="wp-block-paragraph">这个提示词是彩色钢笔手绘烘焙甜品店的菜单，右下角MidJourney V6.1画出来的有汉堡、冰激凌、咖啡、牛角包、蛋糕，这边应该是布朗尼，各种甜品。下头还有一些文字，这就是MidJourney V6.1的能力。至于MidJourney V7，大家想明白为什么我说这东西是戏精了吧？不停的给自己加戏。你说他是手绘风格吗？没有问题，是手绘风格。但是这个菜单他也做了排版，只是文字就不用再去纠结了，他文字是没法看的。总的来说，这个有点画的太满了，是不是？这就是给自己加戏的V7，但是真的是很漂亮。这张画画出来的细节绝对拉满，你看看这牛角包上面的这个糖浆，以及咖啡里面的拉花，实在是太棒了。在这种要求上，GPT-4o跟Grok基本上算完败吧，你们是不是同意这种观点？</p>



<p class="wp-block-paragraph">下面我们去画人物，身着汉服的美丽中国新娘，用6.1画出来的，人看着不太像真的，但是衣服和凤冠霞帔真的是非常的细致，但是没法跟v7比。这一件汉服大衣服绝对是太奢华了，以及后面整个虚化的庭院场景，实在是太棒了。但是人脸因为离得远，不是特别清晰，所以后边我们再去画一张特写。咱们来看一下特写的效果，很真实的一个人。大家仔细去看，因为她是新娘，她这边有各种的礼物，以及后面虚化的房屋场景。手感觉不是特别清晰，但是手应该没有画崩。这是她整个的一个绘画，你看她的头饰，以及每一根发丝，实在是太精细了。再看它的耳环，看它的挂饰，特别是我觉得让我很感动的，就是这件刺绣的大衣服，一针一线，你都可以感受到这个材质的变化。这就是MidJourney V7的力量。在这件事情上，这个GPT-4o跟Grok完败，大家同意吧？没有什么问题。</p>



<p class="wp-block-paragraph">好，我们再往后放食物。我要求的是一碗热气腾腾，配料丰富的日式拉面。V6上面要稍微差一些了，热气是有，但是感觉很不真实。叉烧已经完全做糊掉了，上面的这些葱、海带已经很不清晰了，后面是一块应该是紫菜，蛋画的还可以，面已经不是很像了。但是V7，大家仔细看看碗下面的花纹，叉烧肉上面的条纹，以及紫菜上面的纹理，这颗反光的蛋，还有它这些面。这个绝对是一碗热气腾腾的。大家再看这个蒸汽，你看V6.1上是有蒸汽的，但是不像真的。但是V7上面的蒸汽，就完全的以假乱真了，真的是一碗热气腾腾，配料丰富的日式拉面。这件事情上，GPT-4o跟Grok做的也还是不错的，它的肉包括grok上的肉都是有纹理的，蛋的也还可以了。</p>



<p class="wp-block-paragraph">只是它的配料没有MidJourney摆的好。</p>



<p class="wp-block-paragraph">在日式拉面这件事情上来说，我觉得Grok画的应该是味千拉面。GPT-4o要比Groker稍微好一点点，但是比起MidJourney V7来还是差很远的。</p>



<p class="wp-block-paragraph">所以为什么说GPT-4o是生产力工具？就是当你去画一个很明确的简单场景，特别是这种产品图的时候，GPT-4o是可以干活的，但是Grok就要稍微差一点点了。</p>



<p class="wp-block-paragraph">这就是我们去展示的MidJourney V7画的图，背景也是MidJourney V7的背景，应该是钢笔淡水彩风格，巴黎老钱风的厨房餐厅，使用莫兰迪配色。大概是用的这样的一个中文提示词，用DeepSeek R1进行了丰富以后，画出来的结果。大家看一看，是不是韵味都已经达到了MidJourney V7？</p>



<p class="wp-block-paragraph">现在我们所看到的仅仅是Alpha 1的版本。未来的60天里头，每两周都会进行更新。我们会每两周期待MidJourney V7下一步会给我们补充哪一块新的功能进来。</p>



<p class="wp-block-paragraph">未来的预期：现在文字，特别是中文还非常非常差，就算是英文的话也经常会拼写错误。在这点上比GPT-4o要差非常远。GPT-4o可以一句话生成完整的海报、完整的菜单，这个都是可以做的，但是现在MidJourney V7还不行，可能在未来一段时间会更新出来。</p>



<p class="wp-block-paragraph">一致性还有待提升。特别是你想要做连环画，想要做一些绘本，你还是需要一致性的。特别是生产力工具，在这块还是有要求的。另外不能太戏精。刚才你们也看到这些图片了，这个MidJourney V7生成的图片，真的有点太戏精了，这个让你有的时候哭笑不得，不停的给自己加戏。</p>



<p class="wp-block-paragraph">现在还有传闻他们在准备做3D模型，这块也还是值得期待的。视频方面，MidJourney征求过意见，说应该怎么收费，所以有可能会在V7版本的后期出视频。</p>



<p class="wp-block-paragraph">总结一下，MidJourney V7给我最核心的体验，就是再次成为了艺术表现力的王者，以及细节狂魔。当然，距离生产力工具还有些差距。</p>



<p class="wp-block-paragraph">最后一个感受：10刀的套餐好像不太够使了。我要稍微纠结两天，看看是不是去买30刀的套餐。</p>



<p class="wp-block-paragraph">好，今天就讲到这里，感谢大家收听。请帮忙点赞、点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>GPT-4o图片生成工具，真正的生产力工具发布了，GPT-4o图像生成全面碾压DALL-E 3？指令理解超神但艺术感仍是致命短板！</title>
		<link>https://lukefan.com/2025/03/27/gpt-4o%e5%9b%be%e7%89%87%e7%94%9f%e6%88%90%e5%b7%a5%e5%85%b7%ef%bc%8c%e7%9c%9f%e6%ad%a3%e7%9a%84%e7%94%9f%e4%ba%a7%e5%8a%9b%e5%b7%a5%e5%85%b7%e5%8f%91%e5%b8%83%e4%ba%86%ef%bc%8cgpt-4o%e5%9b%be/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 27 Mar 2025 00:40:17 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[3D建模辅助]]></category>
		<category><![CDATA[AI图像生成]]></category>
		<category><![CDATA[AI绘图工作流]]></category>
		<category><![CDATA[DALL-E 3升级]]></category>
		<category><![CDATA[Gemini 2.0 Flash]]></category>
		<category><![CDATA[GPT-4o评测]]></category>
		<category><![CDATA[GROK3图像编辑]]></category>
		<category><![CDATA[IP形象开发]]></category>
		<category><![CDATA[MidJourney对比]]></category>
		<category><![CDATA[OpenAI更新]]></category>
		<category><![CDATA[UI图标库生成]]></category>
		<category><![CDATA[个性化头像生成]]></category>
		<category><![CDATA[中文AI绘图]]></category>
		<category><![CDATA[中文提示词优化]]></category>
		<category><![CDATA[中文艺术字生成]]></category>
		<category><![CDATA[产品包装设计]]></category>
		<category><![CDATA[企业级API接入]]></category>
		<category><![CDATA[创意内容商业化]]></category>
		<category><![CDATA[动态分镜制作]]></category>
		<category><![CDATA[商业logo设计]]></category>
		<category><![CDATA[商业应用场景]]></category>
		<category><![CDATA[团队协作绘图]]></category>
		<category><![CDATA[图像生成API]]></category>
		<category><![CDATA[图像生成速度对比]]></category>
		<category><![CDATA[图像生成限制放宽]]></category>
		<category><![CDATA[复杂指令解析]]></category>
		<category><![CDATA[多模态AI]]></category>
		<category><![CDATA[多模态输入输出]]></category>
		<category><![CDATA[多轮对话绘图]]></category>
		<category><![CDATA[多风格控制测试]]></category>
		<category><![CDATA[实时绘图优化]]></category>
		<category><![CDATA[宫崎骏风格头像]]></category>
		<category><![CDATA[广告素材生成]]></category>
		<category><![CDATA[庆丰包子铺乐高]]></category>
		<category><![CDATA[影视分镜制作]]></category>
		<category><![CDATA[影视概念设计]]></category>
		<category><![CDATA[指令理解模型]]></category>
		<category><![CDATA[教育培训禁用]]></category>
		<category><![CDATA[数字水印技术]]></category>
		<category><![CDATA[数字水印溯源]]></category>
		<category><![CDATA[数字资产创作]]></category>
		<category><![CDATA[智能修图革命]]></category>
		<category><![CDATA[模型迭代路径]]></category>
		<category><![CDATA[泡泡玛特风格]]></category>
		<category><![CDATA[游戏角色建模]]></category>
		<category><![CDATA[版权内容生成]]></category>
		<category><![CDATA[版权合规生成]]></category>
		<category><![CDATA[生产力工具革新]]></category>
		<category><![CDATA[生成式AI进化]]></category>
		<category><![CDATA[电商主图优化]]></category>
		<category><![CDATA[电商图标设计]]></category>
		<category><![CDATA[电子书插图]]></category>
		<category><![CDATA[皮克斯风格绘图]]></category>
		<category><![CDATA[社交媒体配图]]></category>
		<category><![CDATA[聊天式图像编辑]]></category>
		<category><![CDATA[艺术性与实用性平衡]]></category>
		<category><![CDATA[虚拟偶像创作]]></category>
		<category><![CDATA[角色一致性生成]]></category>
		<category><![CDATA[语义依存度测试]]></category>
		<category><![CDATA[语义精准控制]]></category>
		<category><![CDATA[跨平台图像生成]]></category>
		<category><![CDATA[透明图标设计]]></category>
		<category><![CDATA[靠嘴修图]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2037</guid>

					<description><![CDATA[《不允许还有人不知道！！GPT-4O画图杀疯了！！！！》

救命！打工人狂喜！！！
AI修图不用PS的时代真的来了啊啊啊啊啊！！！
OpenAI昨晚放大招直接炸场！！！
GPT-4O画图功能杀疯全网！！！

✨三大王炸亮点✨
✅中文指令精准到哭！！
说「乐高风庆丰包子铺」直接出图！！
连LOGO字体都能换啊啊啊！！
✅多图一致性封神！！
漫画分镜说画就画！！
同个主角连换18套皮肤都不崩！！
✅限制解除爽翻天！！
指名道姓画马斯克！！
泡泡玛特风头像直接拿捏！！！

💥对比实测💥
👉🏻Midjourney：艺术感强但抽卡像开盲盒
👉🏻Gemini2.0：速度快但画质像马赛克
👉🏻GPT-4O：精准度直接开挂！！！

家人们快冲！！！
现在免费用户也能玩！！！
评论区扣【666】甩你50条王炸指令！！！

PS：附上我实测的庆丰包子铺设计图！！！
这质感这字体！！说值5W不过分吧？！！！
#AI绘画 #打工人神器 #小红书隐藏功能

GPT-4o图片生成工具，真正的生产力工具发布了，GPT-4o图像生成全面碾压DALL-E 3？指令理解超神但艺术感仍是致命短板！

OpenAI最新推出的GPT-4o图像生成模型引发AI绘图领域大地震！本次升级突破DALL-E 3的严苛限制，支持中文指令生成宫崎骏风格头像、SpaceX泡泡玛特手办、庆丰包子铺乐高模型等创意内容。实测显示其指令理解能力碾压MidJourney，可精准实现多模态输入、角色一致性生成、商业logo设计等生产力需求，甚至能通过聊天修图实现"靠嘴捏脸"。尽管在艺术感染力和字体控制上稍逊一筹，但支持生成带数字水印的版权内容、企业级API接入等特性，已让谷歌Gemini 2.0 Flash、马斯克GROK3等竞争对手倍感压力。本文深度解析GPT-4o在漫画书制作、电商图标设计、影视分镜创作等20+场景的实战表现，揭秘其如何重新定义AI图像生成赛道！]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="GPT-4o图片生成工具，真正的生产力工具发布了，GPT-4o图像生成全面碾压DALL-E 3？指令理解超神但艺术感仍是致命短板！" width="900" height="506" src="https://www.youtube.com/embed/NjJzzgNs-S0?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">OpenAI更新了他们的图像生成模型。看来20美金一个月的套餐，还要继续续下去啊。大家好，欢迎收听老范讲故事的YouTube频道。OpenAI最近也开始卷起来了，对吧？前面开始出O1、O3，出GPT4.5，现在好了，把这个图像生成模型也更新了。最近其实大家都在卷图像，卷了一整波的图像。最早开始卷图像的是国内的这些应用，像豆包、千问，他们最早开始卷。这个模型没更新，卷的是客户端和手机端的应用，希望说你出去照完相以后，说给我去换个衣服，换个背景，去做这样的事情。但是这个因为模型本身的能力有限，所以效果并不是特别好。我试过比如说，我把自己的一张照片发上去以后，说来，给我把这个背景换成海滩。背景确实换成海滩了，但是他把前面这个人物也重绘了，不像我了。这就是国内卷了一波。</p>



<p class="wp-block-paragraph">真正拉开序幕的是谁？是谷歌的Gemini 2.0 Flash。他们出了一个可以同时输出文字和图像的模型。这个模型出来以后，很多人惊呼，以后Photoshop修图就没你们什么事了啊。为什么？你可以上传一个杯子的图片，再上传一个美女的图片给它，提示词说请让美女举着杯子。那个图片出来了以后，是非常逻辑自洽的，不会看着有任何别扭的地方。或者你给她个包，说想让这个美女拎着包，这个效果好极了。甚至我拿了一些MidJourney画的图片上去，说再给我把某个公司的logo贴上，效果极好，特别的逻辑自洽，而且支持中文输出。这个其实挺难的。目前为止，支持中文输出的图像生成模型，原来就是国内的极梦，也是字节下边有一个版本是支持的。现在Gemini也是支持中文输出的，而且它支持多模态输入。你可以跟它说话，你可以给它输入图片，说你把这张图片跟那张图片合在一起，它效果都很好，完全可以实现聊天修图像。</p>



<span id="more-2037"></span>



<p class="wp-block-paragraph">原来为什么大家不愿意用修图这个功能？你需要选择，这个是特别讨厌的。我们做各种修图，最讨厌的地方就是选择，说我到底要改哪一块。抠图虽然可以抠，但是有时候抠的没有那么准。现在来了说，我们直接告诉他把这个背景换了，给我戴个眼镜，拿个杯子，要拿哪张图片上的杯子，这个效果都很好。只是它的模型很小。你想Gemini 2.0后边这个是叫Flash，而不是叫Pro，所以它是个小型模型。它生成的图片整个的质量不是很高，但是速度很快啊。所有叫Flash的一般速度都比较快。这边出完了以后，马斯克肯定是不甘人后，他的GROK3就上来了，叫图片编辑功能。</p>



<p class="wp-block-paragraph">现在，我们去X平台上点击这个Grok，上面就专门有一个选项叫“图片编辑”。你可以上传图片让它编辑，但是效果稍微弱了一点点，这里就不再介绍了。GROK3生成的图片，它的艺术性跟质量要比Gemini要好一些，但是它的指令依存度要差一些。你命令它做很多事情，它有时候没有办法特别精确地去执行。</p>



<p class="wp-block-paragraph">像我最常用的MidJourney，目前还在纠结到底后边要做什么。这应该是个小公司了，后边更新是比较慢的。最近还发了问卷，问视频生成应该如何收费的问题。所以，MidJourney可能下一个版本会出视频。</p>



<p class="wp-block-paragraph">那么，OpenAI现在终于放出大招来了，我们也要卷一下这件事情。OpenAI在昨天晚上放了一个视频，说我们图片生成功能终于出来了。这个功能其实已经被吐槽好久了，因为原来他们使用的叫DALL.E-3这样的一个模块来进行图像生成。DALL.E-3有他的优点，指令理解能力非常好。你给他一个很长的指令，里边说的很详细的各种信息，他都可以给你理解得很清楚，都给你画上。其他的一些生成模型，如果你提示词长了以后，可能前面的一部分还给你画了，越往后的部分，就基本上都给你忽略掉了。</p>



<p class="wp-block-paragraph">大家注意，写画图指令的时候，特别重要的东西写前头。越往前写的东西越重要，越往后写的东西越有可能被忽略掉。但是，DALL.E-3的艺术感极差。你说这个东西画出来以后好不好看，这个就别想了。精细度也不是很高，这个相对来说，图片比较粗糙。最被人吐槽的地方是什么？就是DALL.E-3的各种限制极其严苛。你说你给我画一个谁谁谁的头像，对不起，侵犯肖像权了啊。你给我按照宫崎骏的风格，给我画一个什么东西，对不起，侵犯人家著作权了。这个要求特别严苛了，以后基本上不怎么用了。</p>



<p class="wp-block-paragraph">现在给出的并不是DALL.E-4，而是GPT-4o。他说我们现在在GPT-4o里边，直接可以绘图了，你们不用再去选DALL.E-3了。那么，现在GPT-4o绘图的效果到底怎么样呢？第一个，指令理解跟依存这件事情，绝对遥遥领先。在语言模型上，GPT还是做的最好的。你跟它说很复杂的指令，它都可以给你画出来，这个是最棒的。艺术感这一块，距离MidJourney还是有一些差距的。精细度有明显的提升，现在画出来的图，要比原来DALL.E-3的那个提高非常多了。而且也支持中文，你要求他给你画中文的内容，到这个图片上去没有任何问题。字体的理解上还稍微差那么一点点，待会咱们看这个图片。</p>



<p class="wp-block-paragraph">你们就能知道为什么说差一点点了。说你给我换个字体，他呢确实给你换，但是换完了，那个字体并不是你要求的字体。这个我觉得各种中文字体，对于这些美国人做的视频生成模型来说，还是稍微有一些差距的。对于不同风格的理解和输出，相对来说是比较准确的。但是它的理解，有时候跟MidJourney不是特别一致。你跟他说我要画一个什么什么东西，MidJourney可能画的是一个风格，他画的是另外一个风格。这个是各自的理解，但是你只要说同样的提示词，说你给我画什么风格，他始终会稳定的按照同一个风格给你输出。而MidJourney的话，你跟他说啊，你给我画一个什么什么风格东西出来，他会经常发生一些跳跃和浮动。</p>



<p class="wp-block-paragraph">画图这个东西呢，你一边需要艺术感啊，需要感染力，另外一边很重要的是一致性。现在在一致性这件事情上，GPT-4o的图像生成非常强。这次也把限制去掉了很多。Sam Altman也说了，说我们是愿意输出一些让人感到不适的图片了，我们也不再做那么严格的限制了。出来以后，大家自己去选择到底是不是应该使用这个图片出去。但是特别过分的我们还是会拦截的，而且在这个图片上是有数字水纹的。你虽然看不到这个水纹在什么地方，但是程序是可以读出来的。你是某年某月某日，用什么样的提示词去生成出来的，这个是可以看到的。现在你再要求指定艺术风格，已经没有什么问题了。你说你给我按皮克斯的风格画，按照乐高的风格画，按照宫崎骏的风格画，这个都是没有任何问题，都可以直接出图了。你说指名道姓给我按照谁的脸画，这个也可以出。比如说我让他给我画埃隆马斯克，也画出来了。待会咱们看看画的像不像。</p>



<p class="wp-block-paragraph">直接给照片，他还是会拒绝换脸的。我给了他一个照片，给我把我的脸换上去，他拒绝了。后来我告诉他，我说这是我的照片，我自己有肖像权，我愿意干。他说那好吧，我给你干去。指定了一个电影的剧照，我说你给我按照这个剧照画，他又拒绝干活了。这个我当时用的是皮克斯的《飞屋环游记》的一个照片，说我拒绝干活。这个过程到底哪些拒绝，哪些通过，还比较玄学，大家需要去测试。它的输入也是多模态输入，你可以输入图片、语音、文字，甚至可以输入视频。输入完了以后都可以非常精准的理解，按照你的要求去把图画出来，而且一致性极高。你告诉他说，我现在要求按照这个角色，给我去做哪些动作，不会说发现换人了，不会干这样的事情。他们都是一致性很好的，所以你说我想拿GPT-4o去生成漫画书。</p>



<p class="wp-block-paragraph">效果很好。唯一的缺点是什么？就不是很快，这个稍微的有些慢。我估计应该也是因为功能刚推出来，一帮人都在玩耍，都在测试，所以速度要稍微慢一些。现在能够使用的范围有哪些？就是像我们这种Plus用户、Pro用户，那200美金肯定让人用吧。Team用户好像是40美金一个月的，这个也是可以用的。免费用户也可以使用，你说我没交钱，应该没问题。所以如果你现在使用的是iPhone啊，你在国外，用了这个Apple Intelligence这些功能，应该就都可以去工作了。那么有两种用户现在还不能用，一个是企业用户（Enterprise用户），还有一种是教育用户（edu用户），这些还不能使用。这个原因也很简单了，你该好好上班的，好好上班去；该好好学习的，好好学习去。你们现在没有那么多时间去画画、去玩，所以这个可能还要稍微再等一等。过几周以后，把这些功能会加到API里边去，我们可以通过API使用这些功能了，应该会变得非常有趣。</p>



<p class="wp-block-paragraph">那么好，下面我们来看看生成的图片。这是我用昨天录CoreWeave上市那期的相关提示词生成的图片，在这个GPT-4o里面生成的。大家看哈，GPT、GPU、Nvidia、CoreWeave都给我写得非常清楚。所以对于指令的理解和执行上，GPT-4o要比MidJourney强非常多。好看不好看咱们先不管，说对吧？它的艺术性可能要稍微差一些，但是它在理解你要让它干什么这件事情上，以及老老实实干活这件事上，这个是非常强的啊。后面我说，我想让这个数据中心是一个俯视角，从上往下看的，可以显得更大一些。看看变得更大一些，整个的氛围还是对的。而且大家看到了第一张图跟第二张图，他是没有什么特别大的这种风格上，或者说他这一些细节上都没有失真。你说这是同样一张图，两个不同的视角，没有任何毛病。这个事干的，再往后咱们来看一看，它的限制是不是给你取消掉了啊。左边这张图的提示词是，用泡泡玛特风格，给我画一个埃隆马斯克在SpaceX里面拧螺丝。它首先泡泡玛特风格没有任何问题，它给你画了头很大，身子比较小，3D的，而且SpaceX的LOGO画得非常好，不是随随便便的就给你写了个字上去，还真的是SpaceX的LOGO，特别是这个X画得很棒。这说明什么？你告诉他使用什么样的艺术风格，他可以给你搞定了。后边我说不行，我说长得不像马斯克，你得给我让他像马斯克才行。看指名道姓要求像马斯克，像吧。</p>



<p class="wp-block-paragraph">直接通过语言就可以让他进行输出了。再往后，这张图首先底下这个背景图是让MidJourney画的红丝绒蛋糕。大家看的是什么？是这个前景图，这个是我要求给我画的透明图标啊。说你给我用这个图标的方式画出来：咖啡蛋糕、饼干、奶茶、猫、狗、小男孩、小女孩和书。大家看到的是什么？第一个他给你画的是透明图标，你只管切下来用就完了。第二个什么？他的风格是统一的，你把这一套东西放到任何一个应用或者网页里边去用，就可以直接用了。所以好看不好看咱们单说，但是能用这是非常重要的。</p>



<p class="wp-block-paragraph">再往后咱们来看看写中文的事情。我说：“给我画一个乐高风格的庆丰包子铺。”你看庆丰包子写得很漂亮，没有任何问题，而且这个字也是跟我们的乐高风格是一致的，写中文没有任何问题。然后我说：“给我换一个字体。”后来我好像说让他换隶书，但是字体肯定是换了，我觉得这个有点像楷书啊，应该不是隶书。他知道这是两个不同的字体，他会给你进行一些更换，我觉得做成这样已经很不错了。</p>



<p class="wp-block-paragraph">再往后咱们是做每一次都干的事情，是什么画？给自己画头像、画金币、这个画logo啊。最右下角这个是我自己的头像，这个是照片，这个不是画出来的啊，应该是呃，经过一点点美颜，这个我们还是要承认的。这个是金币，你给我画一个写着“Storyteller fan”的一个金币。怎么说，整个的质感还是要稍微差一些，比Midjourney生成出来的要差一些，但是这个人我觉得还是要像一点点的。</p>



<p class="wp-block-paragraph">中间，我说：“你给我画一个‘storyteller fan’的一个圆形的logo。”你看我这是单手托腮，这边也是单手托腮，脸型、眼镜、眉毛都是没有任何问题的。我说：“我是一个科技博主，你给我画上电脑、手机和云计算。”也给我画在上面了，这个就可以拿来用了。这真的是生产力工具，这个创意有时候稍微差那么一点点，但是生产力没有任何毛病。</p>



<p class="wp-block-paragraph">再往后我们来做一个比较难的任务，这个是干嘛？我说：“你给我用第一张图的人脸，按照第二张图的风格去给我画一个。”你看给画出来了，还把我这个韦德，这有一个韦德在这边也给你画出来了。韦德他自己就完全去理解，他说这是一个什么样的风格？这是一个大理石，还有反光，或者是瓷器的上面还有烟雾，后边还有这种火焰。他就直接的从左边这个人，套上中间这个风格，给你生成右边这个图片了。这个，我觉得是非常难能可贵的一个事情。</p>



<p class="wp-block-paragraph">再往后我们来看看它的一致性。好，这是他的一个一致性，我拿到了一个老爷爷的头像，老爷爷其实是我用自己的头像。</p>



<p class="wp-block-paragraph">说你给我按照《飞屋环游记》的风格，给我画一下。我大概跟他进行了六七轮对话，最后给我画成这样了。他说：“第一，你这个头像有肖像权，我们不能直接把人家有肖像权的东西给你画出来。”我说：“没事，这是我自己的头像，我可以处理肖像权。”他说：“那行，我给你干。”他说：“不行，我不能侵犯《飞屋环游记》的这个版权。”我说：“你给我能画什么画什么，差不太多就可以了。”最后，反正还是这不行那不行。我说：“你给我按照皮克斯3D风格，给我按照我的头像画出来。”他就给我画出了一个这样的老大爷，其实还是很像《飞屋环游记》的。折腾来折腾去还是很像的。这个我们不是要展示的重点。这次展示重点是什么？从这里到这里，我说：“以左面这个人为主角，给我画一组漫画。”这个老大爷在散步、吃蛋糕、遛狗、喝咖啡、骑自行车，以及去做这个购物。被我头像挡住了，没关系，大家能看出是同一个人。而且这里面的每一个人，他都很精确地按照我的要求去做：散步、吃蛋糕、遛狗、喝咖啡、骑车。右边是购物，购物车看不到了，没关系，然后这个人明显是同一个人。我就可以用一个头像去讲整套的故事了，这个是非常棒的。往后咱们再做一个，还是左面是原图。我说：“给我生成一个泡泡玛特3D风格的。”头像生成出来了，居然还有痦子，各种模型都没有办法来实现，这边实现了。而且我这个图上是有手表的，他把我的手表也画出来了。我说：“以我这个头像为主角，给我画一个骑着凯旋Bobber的。”这个图片出来，戴上手套了，还带着我的手表，给了个牛仔裤。这个确实是一辆凯旋Bobber，还把凯旋的logo画在这了，这个非常的棒。最后，生产力工具，今天晚上要读评论。我说：“来，给我画一个泡泡玛特3D风格的，老范读评，3月26号读评的一个图片，我要用它去做一个封面。”直接生成一句话搞定，这个多爽。你看我的表还戴在这里，礼拜三晚上读屏的封面就是这么来的。当然我还要求是马卡龙配色，窗外是春天的街道，这多棒，非常精确地给你画出来了。好不好看咱们先不管，但是真的是按照你的要求，一丝不苟地画出来的啊。这个我们得到了一个非常强力的生产力工具，这就是它生成的这一大堆图片。那么，未来用嘴修图的时代已经到来了。记得咱们去看很多的电影，去认这个罪犯的时候，说这个眉毛要稍微长一点，眉毛要翘一点，眼睛要大一点、小一点，就可以修出图来，叫靠嘴捏脸。那么这个应该很快到来了。而且现在不光可以捏脸，你还可以换风格，还可以要求他们做各种各样的动作，做各种各样的场景，现在都可以做了。</p>



<p class="wp-block-paragraph">所以，我们完完全全可以靠嘴。你可以说，因为GPT-4o是支持说的，你也可以打字。完全可以靠这种方式，得到我们想要的很多的图片。这块现在已经可以做了，希望大家可以玩得开心一些。从天马行空的惊喜到精准可控的生成，这就是这一次GPT-4o图像模型的最主要升级。原来都是很天马行空的，你没有办法控制他，说连续地出什么样的内容，现在可以了。艺术性跟感染力还要稍微差一些，但是能用了。希望大家开开心心地玩耍起来。好，这一期就跟大家讲到这里，感谢大家收听。请帮忙点赞、点小铃铛，参加Discord讨论群，也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
