<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI绘画 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<atom:link href="https://lukefan.com/tag/ai%e7%bb%98%e7%94%bb/feed/" rel="self" type="application/rss+xml" />
	<link>https://lukefan.com</link>
	<description>这里是老范讲故事的主站，持续更新 AIGC、大模型、互联网平台、商业冲突与资本市场观察，帮你看清热点背后的底层逻辑。</description>
	<lastBuildDate>Sun, 23 Nov 2025 00:55:49 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.4</generator>

<image>
	<url>https://lukefan.com/wp-content/uploads/2026/03/cropped-jimeng-2026-02-28-5245-用图一的人物形象，替换图二中的人物，使用图二的风格。文字替换：老范讲故事，Yo-32x32.jpeg</url>
	<title>AI绘画 &#8211; 老范讲故事｜AI、大模型与商业世界的故事</title>
	<link>https://lukefan.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>我们都被骗了？Nano Banana Pro 真相揭秘：它根本不是Gemini 3简单叠加，原生多模态骨架才是颠覆关键｜Nano Banana Pro、Gemini 3 Pro、Gemini 3</title>
		<link>https://lukefan.com/2025/11/23/nano-banana-pro-gemini-3-ai-image-features-cost/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 23 Nov 2025 00:55:47 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Google的故事]]></category>
		<category><![CDATA[4K图像]]></category>
		<category><![CDATA[AI Studio]]></category>
		<category><![CDATA[AI图像生成]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[Gemini 3 Pro]]></category>
		<category><![CDATA[Gemini API]]></category>
		<category><![CDATA[Gemini使用教程]]></category>
		<category><![CDATA[Google AI]]></category>
		<category><![CDATA[MidJourney对比]]></category>
		<category><![CDATA[Nano Banana Pro]]></category>
		<category><![CDATA[Nano Banana Pro价格]]></category>
		<category><![CDATA[Nano Banana Pro免费]]></category>
		<category><![CDATA[Nano Banana Pro测评]]></category>
		<category><![CDATA[PPT设计]]></category>
		<category><![CDATA[信息图表]]></category>
		<category><![CDATA[图像编辑]]></category>
		<category><![CDATA[多图融合]]></category>
		<category><![CDATA[多模态AI]]></category>
		<category><![CDATA[搜索增强绘图]]></category>
		<category><![CDATA[文字渲染]]></category>
		<category><![CDATA[文生图]]></category>
		<category><![CDATA[自然语言修图]]></category>
		<category><![CDATA[角色一致性]]></category>
		<category><![CDATA[谷歌AI绘画]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2990</guid>

					<description><![CDATA[💥炸裂！谷歌新出的「纳米香蕉Pro」让设计师集体破防！男生亲测：直男做PPT竟比女友化妆还快！🤯

兄弟们，还记得那个画头像糊成马赛克的「纳米香蕉」吗？现在谷歌憋出**Nano Banana Pro**——直接把Gemini 3.0 Pro塞进画笔里！🔥 分辨率狂飙4K✨（修图再也不用抠头发丝了），写字稳如高考状元✍️（阿拉伯语花体？中文百字攻略？全是神还原！）。最离谱是：**一句话生成宫崎骏风土基熔岩堆PPT**，连PayPal黑帮老大彼得·蒂尔都能P上唐装喝小酒！🍷（GPT：这我绝不！谷歌：越权？我直接开画！）

💥**真香3连**：
1️⃣ **修图像点外卖**：“把西装换成宇航服，背景加火星”——秒改！再也不用PS抠到秃头🥹
2️⃣ **多脸齐聚不翻车**：14个头像一锅炖？Pro表示：稳！全家福、分镜故事，一键封神👨👩👧👦
3️⃣ **搜完再画超聪明**：让它画“大行D9折叠车拆解图”，它真会先搜图！这哪是AI？这是赛博丁真啊！🔍

💸价格小贵（4K图24美分），但**免费用户每天3张**！去Gemini.Google.com选“思考”+“绘图”，3秒出图（水印？咸鱼买账号秒解💧）。
**设计师说：天塌了。**
**我说：兄弟，赶紧去画个“你和马斯克撸串”的图！评论区Battle，点赞最高的送纳米香蕉电子皮肤！👇**
（直男福音实锤：再也不用求UI小姐姐了！😂）

⚠️警告：试完你会回来谢我！#AI神器 #打工人逆袭 #谷歌爸爸干得漂亮

标题1：Nano Banana Pro 对比 Nano Banana：不只是简单升级，背后是原生多模态的代差级碾压，设计师饭碗真悬了｜Nano Banana Pro、Gemini 3 Pro、Google、AI图像生成
标题2：价格暴涨6倍，从4美分飙到24美分一张图！Nano Banana Pro到底值不值？深度解析新增功能与高昂价格的背后｜Nano Banana Pro Gemini 3 Pro Google AI图像生成 价格
标题3：我们都被骗了？Nano Banana Pro 真相揭秘：它根本不是Gemini 3简单叠加，原生多模态骨架才是颠覆关键｜Nano Banana Pro、Gemini 3 Pro、Google、AI图像生成、Gemini 3
标题4：一句话生成带几十个字的复杂PPT，我用它画出PayPal黑帮关系图后彻底被震撼，工程师也能秒杀设计师了？｜Nano Banana Pro Gemini 3 Pro AI图像生成 文生图 图像编辑
标题5：Google彻底放飞自我？宫崎骏、哆啦A梦随便画，Nano Banana Pro 在版权红线上演惊天反转，竟比OpenAI还激进｜Nano Banana Pro、Gemini 3 Pro、Google、AI图像生成、功能
简介：Google 发布的 Nano Banana Pro 并非一次简单升级，而是由强大的 Gemini 3 Pro 驱动的代际飞跃。本文将深度解析其核心功能：从颠覆性的4K图像输出、精准的文本渲染能力，到一句话生成完整PPT页面的强大推理。我们将探讨它与前代的本质区别、高昂价格背后的价值，以及它将如何改变AI图像生成的游戏规则。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="我们都被骗了？Nano Banana Pro 真相揭秘：它根本不是Gemini 3简单叠加，原生多模态骨架才是颠覆关键｜Nano Banana Pro、Gemini 3 Pro、Gemini 3" width="900" height="506" src="https://www.youtube.com/embed/nnwN9AsGDlA?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<h1 class="wp-block-heading">Nano Banana Pro发布了，它在Nano Banana的基础上到底做了些什么新东西？</h1>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">大家等了半天的Nano Banana 2没有来，出来的是Nano Banana Pro。当然，前面Nano Banana Pro也是隐姓埋名，在各种的大模型评测平台上偷跑了好长时间。所以很多人呢，信誓旦旦地说：“我已经用到了这个东西，强的没边了。”现在终于发布出来了。</p>



<h2 class="wp-block-heading">从Nano Banana到Nano Banana Pro：核心区别是什么？</h2>



<p class="wp-block-paragraph">从名字上呢，一个叫Nano Banana，另外一个呢加了个Pro，它们到底差在哪呢？原来的Nano Banana，其实是叫做Gemini 2.5 Flash image。现在的Nano Banana Pro呢，它背后的模型是Gemini 3.0 Pro image，是两个不同版本。而且一个呢是Flash，一个呢是Pro。Flash一定是比较快，出来的东西呢相对比较粗糙；而Pro的话，出来的东西就会比较笨重了，或者说比较昂贵，而且出来的东西非常非常细致和完善，它们核心的区别就在这里。</p>



<p class="wp-block-paragraph">Nano Banana也是先在外边测试了很久然后才发布，这个名字也是当时他们测试的时候使用的名字。当然这一次测试呢，并没有叫纳米香蕉，这次换了个名字，因为纳米香蕉这名字你用过了嘛，好像叫GENIMG，大概是这样的一个名字去测试的。</p>



<span id="more-2990"></span>



<h2 class="wp-block-heading">回顾：初代Nano Banana的革命与短板</h2>



<p class="wp-block-paragraph">当时Nano Banana为什么会轰动呢？就是一致性的问题彻底被解决了，包括多图融合，融合以后的一致性，这个问题已经彻底解决掉了。但Nano Banana生成图片也有很多的问题：</p>



<ul class="wp-block-list">
<li><strong>分辨率低：</strong>也就是1024乘1024或者1K的图片。</li>



<li><strong>无法处理复杂内容：</strong>你说我要写很多文字上去，这搞不定。你只能是相对来说，主体比较简单的图片可以搞定。</li>



<li><strong>文字错误多：</strong>写字经常写错，甭管是写中文、写英文，经常写错，这是当时的一个问题。</li>
</ul>



<p class="wp-block-paragraph">但是因为它的一致性一下就得到了突破，所以呢还是火起来了。我记得当时Nano Banana出来的时候，最火的大家玩什么？就给它一张自己的照片，说：“来，给我生成一个图片，这个图片上是电脑，电脑里头呢，有我这个照片相关的3D玩偶的一个设计模型，桌子上呢要摆我的这个照片，以及呢用这个照片生成的3D玩偶的手办。要保证你电脑里边显示的模型、你的照片跟这个手办，要完全的能够对得上，这是同一个人。”他的一致性要很强，而且要不同的风格下的一致性依然很强，当时大家玩这个梗都玩疯了。</p>



<p class="wp-block-paragraph">所以呢，当时很多人在玩什么？就是多张人像图片合成一个统一场景，同时呢保证一致，同一个人在多张图片里头五官、发型、服饰相对一致，或者同一个人在多张图里头保持风格统一。对于很多的用户来说，可以去轻松地制作全家福、多角色合影、连续故事分镜，都是可以做出来了，有极强的可玩性。</p>



<p class="wp-block-paragraph">而且呢，Nano Banana是有相对比较强的世界知识和场景理解能力的，因为它后面的是Gemini 2.5 Flash的一个模型，所以你问它很多东西，它的基础知识是存在的，它继承了Gemini模型的语义和知识能力。这点对于像吉梦，还有像Midjourney这样的纯画图模型来说，就绝对遥遥领先了。能够跟Nano Banana去比语义理解能力的，也就是GPT image，就是在GPT-4o的基础上画图的这个模型。</p>



<p class="wp-block-paragraph">Nano Banana呢，对于地理场景，比如说像地标建筑、服饰文化元素；场景，比如医生、厨师、程序员，都可以很好地去理解，而且感觉都似模似样的，或者我们叫“对齐”了——这算是大语言模型带给我们语言的一个污染，现在大家都在讲“对齐”这个词——所以它跟我们日常认知是可以对齐的。</p>



<p class="wp-block-paragraph">而且呢，Nano Banana是可以做自然语言修图和局部编辑的。很多人特别讨厌做修图的原因是什么？你需要做选择，这一块是衣服，那一块是手，这一块是背景，你要拿这个线把这个后边的背景抠出来，这个是很烦的。但是Nano Banana就不需要，你只需要告诉他说：“现在请把衣服给我换成这身，请把这个鞋给我换成那个。”或者说：“请把这个瓶子上的文字给我换一下。”就可以搞定了，再也不需要上去打点勾线了。这个事儿，是Nano Banana给大家带来的非常非常好的体验。</p>



<p class="wp-block-paragraph">还有一点很重要的是什么？就是低延迟、低成本。Nano Banana画图是很便宜的，他画一张图的话，调用API大概是3.9美分画一张，非常非常便宜。而且呢，因为它画的很像，在Nano Banana发布以后呢，社交媒体直接就炸了。因为社交媒体，你的社会关系要去参加到交往过程中，如果我画完了以后，这个大美女、大帅哥看不出来是谁，这个事是没法整的。Nano Banana画出来的就可以看出来是谁了，所以Nano Banana当时出来了以后直接就炸裂了，而且是出来了以后，谷歌的股价在涨，谷歌Gemini用户量在暴涨，所以这个是真正拯救谷歌的一个产品。</p>



<h2 class="wp-block-heading">Nano Banana Pro：不仅仅是简单的升级</h2>



<p class="wp-block-paragraph">现在好了，Nano Banana Pro来了。它在Nano Banana的基础上到底加了什么？它到底是不是Gemini 3 Pro加上Nano Banana呢？首先要确定这个东西不是。为什么？因为那个Nano Banana是Gemini 2.5 Flash image，而现在的Nano Banana Pro是Gemini 3.0 Pro，所以它们是完完全全两个不同量级、不同版本的模型。</p>



<p class="wp-block-paragraph">首先，Gemini 3 Pro就是比Gemini 2.5 Pro要强很多很多的一个模型，它在推理上强的没朋友。你在这样的一个基础上去做绘图的话，那一定也是会强到没朋友的。而且Gemini 3跟Gemini 2.5还有一个很本质的区别是什么？就是它是原生多模态。它直接把图片、视频这些东西通通一把训练进去了，在最一开始的时候就训练进去的。</p>



<p class="wp-block-paragraph">Nano Banana Pro是复用了Gemini 3的多模态和推理骨干。你用Nano Banana Pro画图的时候，不是上来就画图，而是说我要先搜索一下，然后我要推理一下。你可以把整个推理的过程都拉出来看，他要先画几张，画完了以后自己在那改，改完了最后出了一个他觉得还可以的结果。因为整个的推理的过程中是有图片生成的，有图片的参考，你甚至可以告诉他说：“去给我参考一下哪个哪个车，给我画一个拆解图来。”比如说我有一辆大行D9的折叠车，我说：“你给我画一辆大行D9的折叠自行车的拆解图。”夸夸夸给我画出来了。我说：“你这个车架画错了。”然后又给我画，画的还是不太对。我说：“你这样，我说你去网上搜索一个D9的图片去，然后再给我回来画。”回来就给你画对了。他就可以干这样的事情。</p>



<p class="wp-block-paragraph">咱们今天讲的东西呢，都是纯语言描述，我就不跟大家去做案例了，大家自己去试，这个成本非常非常低。所以咱们今天呢，还是主要讲它的原理。Nano Banana Pro是叠加了搜索和推理的一个绘图，它当时的测试的名字叫Gempix 2。所以呢，更准确的说法不是“Gemini 3加上Nano Banana等于Nano Banana Pro”，应该是Nano的Banana Pro是Gemini 3 Pro的大脑，加上新一代的高端图像的头，并不是简单的这种拼接。</p>



<h2 class="wp-block-heading">绘图能力对比：Pro版本强在哪里？</h2>



<p class="wp-block-paragraph">咱们先看看它的画图部分怎么样吧。在这儿跟大家确认，它在艺术性上依然是没有办法战胜Midjourney的，Midjourney在这块还是当仁不让的王者。但是Midjourney对于物理的理解、对于整个语言的理解，是没有Nano Banana Pro好的。但是咱们就说氛围和艺术感这件事，Midjourney是老大，谁都超不过它。</p>



<p class="wp-block-paragraph">不考虑推理和搜索的情况下，Nano Banana Pro跟Nano Banana比起来到底是强在哪？</p>



<h3 class="wp-block-heading">1. 分辨率和细节极大提升</h3>



<p class="wp-block-paragraph">Nano Banana也就是1K，1024*1024这么大的一个分辨率，而且呢，它呢主要用途是画头像、画这种社交媒体插图、画缩略图。而Nano Banana Pro的话，是可以支持1K、2K、4K等多档的输出，你可以输出一个很高分辨率的图片出来。特别是在4K模式下，你做UI设计稿、做产品渲染、线条比较多的这种信息图，细节很清晰的图片呀，上边的细节清晰度会明显的提高。对于需要二次剪裁或者排版的这种专业场景，是相对来说比较友好的。所以我Nendo Banana用了一段时间，我后面不用了，因为它出的图实在是没法使，但Nano Banana Pro是没毛病的。</p>



<h3 class="wp-block-heading">2. 文字渲染能力显著增强</h3>



<p class="wp-block-paragraph">Nano Banana虽然也能写字，甚至也能写中文，但是字多了它会写错的。而且多语言，你比如说阿拉伯语、中文，特别是花体或者很复杂的一些字体，你要去要求他写的时候呢，会给你写成一塌糊涂。但是Nano Banana Pro就没有这个问题，我测试了，让他写一篇的字都没毛病。甚至有人测试什么呢？你在上头给他出一道题，然后呢他就生生的把这个题和整个题的解题步骤和结果全都给你画在图片里。我做了一个测试是什么呢？我前面跟土拨鼠一起跟大家去做过视频，讲解中国的“土基熔岩堆”。我说：“你给我画一个示意图，做一个土基熔岩堆出来。”我给他上传了一个我的照片，说：“你按照宫崎骏的风格，去给我做一个土鸡熔岩堆的讲解，哪一块是什么样的功能，进去什么、出来什么。”画的非常好，一个页面上应该有几十个字，甚至上百字，都写的非常非常好。我也尝试过一些这种花体字，原来我经常用吉梦去做这种叫创意字体，我把吉梦的提示词直接扔到Nano Banana Pro里边去，效果呢我觉得没有吉梦好，但是已经可以做各种各样的花体字了。但是拼中文，现在它距离吉梦还是稍微有一点点小差距。</p>



<p class="wp-block-paragraph">现在呢，很多人拿这个Nano Banana Pro是干嘛使？直接做这个PPT。按道理说，我们应该是PPT里头写字，然后拼图，然后再排，这是一个完整PPT。现在不需要了，你直接告诉他说：“我要画一页PPT，要写一个什么样的东西。”比如像刚才我讲土基熔岩堆“土变油”的过程，给你写好了。而且你告诉他要宫崎骏风格，给你画出来了。甚至我后来又提了一个要求，我说：“给我把PayPal黑帮里头这几个老大之间的关系是什么样的，以及他们跟现在美国政府之间是什么关系，给我画出一个示意图来。”咔咔给我画好了，上面有彼得·蒂尔、埃隆·马斯克、杰里·万斯，头像全给我画上了，效果好的一塌糊涂。上面一开始写的是英文，后来我说：“你给我写成中文。”然后把谁原来在Paypal里是什么职位，现在Paypal黑帮里他是一个什么样的位置，比如彼得·蒂尔就是黑帮教父这样的一个位置，JD Vans跟他们是什么样的关系，全都给我写好了，非常漂亮，而且把所有人的头像给我画上了。你甚至可以要求他换什么风格的头像，都给你画的好好的。这一次就可以生成一个完整的PPT页面，不用再去做各种各样的调整，一句话搞定。怎么说呢，对于工程师来说足够使了，所以属于补上设计师最后短板的一个工具。</p>



<h3 class="wp-block-heading">3. 多人物、多图片编辑和一致性更强</h3>



<p class="wp-block-paragraph">原来Nano Banana的话，出个可能四五张图、五六张图进去还是可以搞定的。现在的话，可以一次塞进去十几张图，一次上了14个脑袋，这个事儿有的人也是成功了，但是有的时候有问题，但是它正常6个脑袋是没毛病的。</p>



<h3 class="wp-block-heading">4. 控制力更强</h3>



<p class="wp-block-paragraph">相机的角度、俯拍、仰拍、广角长焦，光线的效果，局部遮罩，比如只改脸、只改衣服、只改背景，图表、UI、信息图的这种结构化编辑，这些东西你都可以搞定。咱们说了这么多意思是什么？就是你一次可以写很多很多的文字进去，它一次允许我们写64K，就是64,000个TOKEN进去，它会很好的服从这64,000个TOKEN的指令，把你说的这一大堆东西都给你做出来，而且保证你最后画出来的东西是一致的。</p>



<h3 class="wp-block-heading">5. 一致性和稳定性更强</h3>



<p class="wp-block-paragraph">由于背后挂着Gemini 3 Pro的多模态的骨架，所以呢，它是可以进行多轮对话的。它在多轮对话的修改过程中，可以生成同一风格的画面，这个过程是非常稳定的。你不会说：“给我改点什么东西。”改完了以后呢，你想改的没改对，没想改的地方竟然给改的乱七八糟。他不会干这个事，保证你想改什么改什么，整个的风格不会发生变化，你不想改的地方绝对不会发生改变的。所以绝对是生产力工具这东西。</p>



<h2 class="wp-block-heading">训练揭秘：思考后再出图的黑盒</h2>



<p class="wp-block-paragraph">那你说这玩意咋训练出来的呢？谷歌对于Nano Banana以及Nano Banana Pro的训练细节呢，基本上啥也没说，用相对文明一点的话说，叫“公开的很克制”。主要讲的就是共享了多模态的主干，就是我训练大模型的时候，我就直接是用多模态的方式去训练的。它的Nano Banana系列呢，就已经不再是一个孤立的图像模型了，它后边是有Gemini多模态主干的这个图像头的。它的文本指令、世界知识、场景理解是由主干来处理，处理完了以后，再用处理好的结果再去画图，他是这样的一个工作方式。</p>



<p class="wp-block-paragraph">而且呢，他们在训练的时候使用的叫联合训练和多任务目标。就是在通用图片生成的基础上，加入：</p>



<ul class="wp-block-list">
<li><strong>角色一致性任务</strong>（前后两张图片中的人物保持相似）</li>



<li><strong>多图融合任务</strong>（也就是多张输入的图在单一的一个场景里边进行输出）</li>



<li><strong>编辑任务</strong>（就输入图加修改指令）</li>
</ul>



<p class="wp-block-paragraph">还有这三个任务是同时进行训练的。很可能通过额外的损失函数和特殊数据集成和特殊数据集来强化这些能力。但是数据集这一块呢，反正谷歌就写了一个官话，说：“我们使用合法途径获得的开放数据集，以及人工标注数据集来进行训练的。”具体使用的什么数据集，他也没说。</p>



<p class="wp-block-paragraph">Pro在这块呢增加了什么？就是思考后再出图，以及搜索增强。Pro版本强调在生成前有一轮内部的规划和思考，对于教育插图、历史场景、信息图，支持输入Google search作为知识矫正，你可以要求他去搜索。我看很多人这几天在画李白坐在桌边，跟穿着唐装的哆啦A梦一块喝酒对诗，他是可以知道哆啦A梦长什么样，也知道李白长什么样，还知道唐装长什么样，让他们一点都不违和地坐在那去写诗。</p>



<p class="wp-block-paragraph">安全评估和红队测试呢，谷歌肯定也是做的呀，因为谷歌嘛，毕竟还是一个大企业、上市公司，你要是在这块犯错误的话，会有些问题的。但是它主要做的是什么呢？就是暴力、色情、仇恨、政治敏感内容，在这一块呢，做了重点的过滤以及红队测试。这会体现在某些指令明明技术上做到，但是呢给你的反馈是拒绝或者是模糊响应。不过我现在输出的各种图片还都比较正常，我没有让它测试一些比较奇怪的东西。所以呢，Nano Banana Pro在学习上呢，是一个完全闭源的，并没有告诉大家具体是怎么做的。现在我们能够看到的呢，都是总结了谷歌自己公开的一些很克制的信息，总结出来的一个结果。</p>



<h2 class="wp-block-heading">版权与安全：更宽松的策略</h2>



<p class="wp-block-paragraph">我刚才讲到的一些提示词，大家听到有什么问题了没有？我要用宫崎骏的画风去画一个土基熔岩堆，要画埃隆·马斯克、彼得·蒂尔、杰里·万斯这些人的头像，后面我还让他画机器猫，他也给你画出来了。大家觉得是不是有问题了？</p>



<p class="wp-block-paragraph">Nano Banana Pro对于风格和人物肖像这一块，是要比GPT image要松很多的。就是刚才我们讲的这些内容，你让GPT去画，好多它是画不出来的。它会告诉你，万斯现在是美国总统，他属于叫敏感政治人物，我不给你画。宫崎骏风格的不给你画。你说吉卜力工作室，他有可能给你画，但是你要宫崎骏风格，他就不给你画。现在吉卜力工作室还在起诉OpenAI，官司还打着呢。但是谷歌说：“没事，我都给你画。”机器猫呢，它属于有这个IP的品牌形象，你画了机器猫，甭管你画成什么样，实际上都属于侵权。但是谷歌说：“我就给你画了。”这一点其实做的一点都不谷歌，以前这个谷歌在这一块是要比OpenAI还要严苛的，现在直接就放松了，随便玩去。</p>



<p class="wp-block-paragraph">我去问谷歌的Gemini 3 Pro，你们为什么干了这么一件事呢？他给我的回复是什么呢？“我们现在呢，是用了更深层次的安全措施。一方面呢，我们提醒你了，所有遇到版权问题你自己去应对，跟我没关系。”所以如果以后有人说，你怎么用了宫崎骏风格，他会直接把这个东西扔给创作者，而不是自己来承担这个责任。第二方面呢，他会去判断，你让马斯克坐在这喝咖啡，那是允许的；你让马斯克去做一些很奇怪的事情、有侮辱性的事情，他就不允许了。所以呢，他说我们不会在前向直接禁止你，而是会在后向看看你的意图是什么。你想做一个深度伪造，你想去骗人，还是想要去侮辱这个人，这些我们就不做了。但是如果你只是想要一个马斯克的头像，我们就给你做了。至于说机器猫的头像，因为我们比如做完了以后，也是会发到Twitter或者发到YouTube上，他就是说你发上来了，最后我来处罚你的YouTube作品就完了，我就自己不承担这个责任了。</p>



<p class="wp-block-paragraph">这个是谷歌这一次采用的安全措施。OpenAI是反过来的，OpenAI是前置合规，就是你只要提名字，我就不给你画了。OpenAI呢，其实前置跟后置他都做。有的时候你让OpenAI给你画图的时候，他会先画，画完了以后，你看这图已经出到百分之七八十了，然后突然告诉你说：“对不起，我审核了，你这事有问题。”咔，给你把图删了。我遇到过几次了，所以我现在已经基本上不再使用OpenAI画图了，我现在画图基本上是Midjourney、吉梦和Nano Banana Pro了。</p>



<h2 class="wp-block-heading">价格不菲的“Pro”体验</h2>



<p class="wp-block-paragraph">既然叫Pro了，有一个很重要的问题是什么？贵。它叫Pro了，一定比原来的这个叫Flash的要贵很多。刚才咱们讲了Nano Banana，也就是Gemini 2.5 Flash image，它画一张图是3.9美分，基本上是4美分的样子。而这个Nano Banana Pro画一张图是多少钱呢？</p>



<ul class="wp-block-list">
<li><strong>1K或2K的图：</strong>13美分一张，这个就要贵很多了。</li>



<li><strong>4K的大图：</strong>24美分一张。</li>
</ul>



<p class="wp-block-paragraph">它要比咱们使用的GPT、使用的Midjourney、吉梦都要贵很多。吉梦是最便宜的，吉梦大概画一张图出来2K的图片不要钱，4K的也很便宜，可能就是几分钱人民币，换成美分就是零点几美分。Nano Banana Pro非常非常贵，大家画图的时候一定要小心。</p>



<h2 class="wp-block-heading">如何使用Nano Banana Pro？</h2>



<p class="wp-block-paragraph">我们怎么拿Nano Banana Pro去画图呢？</p>



<ul class="wp-block-list">
<li><strong>免费用户：</strong>在<a href="http://gemini.google.com/" target="_blank" rel="noopener">Gemini.Google.com</a>上就可以使用了，但是呢一天只允许画3张。你在APP上画也是可以的，Gemini APP上一天只允许画3张。</li>



<li><strong>Pro用户：</strong>大概一天是可以画个几十张，有时候是100张，他并没有给我们一个特别明确的数据，还是要看服务器忙不忙，服务器不忙就多给你画几张，大概是这样的一个情况。因为我的Gemini账号呢，是拿我儿子的edu邮箱注册的Pro账号，可以免费使15个月的Pro账号，所以呢我现在是可以在Gemini网页或者是Gemini APP上开开心心的画图的。</li>
</ul>



<p class="wp-block-paragraph">那你说画超了怎么办？画超了以后就给你降级，降级成Nano Banana，就没有那个Pro了，你就会快速地得到一张比较粗糙的图，大概就是这样的一个情况。</p>



<p class="wp-block-paragraph">那你说我怎么开启Nano Banana Pro的绘图呢？很简单。</p>



<ol class="wp-block-list">
<li>你要在APP或者是<a href="http://gemini.google.com/" target="_blank" rel="noopener">Gemini.Google.com</a>上选择“思考”，一旦选择“思考”了以后，你就进入Gemini 3 Pro的这个思考模式了。</li>



<li>然后呢，你再去添加工具“绘图”，上头画了一个香蕉，你就进入了Nano Banana Pro的绘制方式了。</li>
</ol>



<p class="wp-block-paragraph">你如果一开始选的是Gemini 2.5 Flash，你再去画图的话，就是Nano Banana，就没有这个Pro了，所以这块大家一定要注意。</p>



<p class="wp-block-paragraph">那你说，我在AI&nbsp;<a href="http://studio.google.com/" target="_blank" rel="noopener">studio.Google.com</a>里去画行不行呢？也行，但是要注意这个里头呢，有一些跟以前不太一样的地方。很多的谷歌模型，甭管是Gemini模型还是画图的模型，我们都可以在AI studio.Google.com里边去使用，但是使用Nano Banana Pro之前要去给它设置一个API key，不设置的话它是不让你用的。而且设置API key还是挺麻烦的，你要先去里边创建一个project，先创建一个工程，然后在这个工程里头再创建一个API key。到这还不行，还要给API key挂支付，没有支付的API key，它是不允许你使用的，必须有支付。</p>



<p class="wp-block-paragraph">那你说我是不是在这个AI studio里头每画一张图都要钱呢？也不是。现在有人测试呢，是画了三张以后要求你开始付钱，13美分一张或者是24美分一张。也有人呢是测试了，可能能够免费画个十几二十张，甚至有画到50张以上才开始收费的。我估计还是跟服务器的繁忙程度有关，服务器不太忙的时候，你可能一天还是可以在上面画个十几二十张的；服务器忙的时候，画3张然后从你的API key里边扣钱。</p>



<p class="wp-block-paragraph">但是有一点我们要注意是什么呢？在<a href="http://gemini.google.com/" target="_blank" rel="noopener">Gemini.Google.com</a>里边画出来的图右下角是有水印的，它里有一个菱形的Gemini的logo的水印在上头。而你在AI studio里头，就是你自己花钱13美分一张也好，24美分一张也好，是没有这个水印的，那个图是比较干净的。那你说我是不是就直接可以用AI studio或者直接用API把这个图画出来，就可以冒充是真实图片了呢？不行的。因为这个里边呢还有水纹。水纹是什么？就是你在外面你看不着，但是呢，你可以把这个图片扔给Gemini，问他说：“这个图是不是你生成的？”他是会给你进行精准判断的。所以只是在外表看不出来而已，在里边还能有这个痕迹。</p>



<p class="wp-block-paragraph">所以大家如果想画图的话，最简单的方式，如果你不太在意这个水印，就是这个菱形的标的话，就是去开这个Pro账号。特别是你如果有edu的邮箱，你去开那个，可以开开心心的使用的。至于你说：“我没有EDU邮箱怎么办？”有一个APP叫咸鱼，或者你到淘宝的网站上，你问问别人有没有办法来解决这个问题，也只能讲到这了。如果你说：“我就想用没有水印的图片。”那您就老老实实地交钱就行了。</p>



<h2 class="wp-block-heading">结语：设计师的天又塌了？</h2>



<p class="wp-block-paragraph">好，这就是咱们今天讲的Nano Banana Pro。现在设计师，特别是平面设计师的天，又一次塌下来了。像我这种工程师直男，现在也可以开开心心地去做各种界面设计、做各种的PPT设计、什么信息图表设计，效果好的一塌糊涂。我们今天没有给大家做任何演示，请大家自己去尝试，以我刚才说的这些提示词自己去试就完了，也没有那么严谨，你说的跟我稍微有些差异都没有任何问题，我相信Nano Banana Pro会震惊你们的。</p>



<p class="wp-block-paragraph">好，这期就讲到这里，感谢大家收听。请帮忙点赞、点小铃铛、参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">Discord讨论群</a>，也欢迎有兴趣、有能力的朋友参加我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>，再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>设计师又要失业了？谷歌 Gemini 2.5 Flash Image 发布，AI 修图能力太逆天！</title>
		<link>https://lukefan.com/2025/08/28/%e8%ae%be%e8%ae%a1%e5%b8%88%e5%8f%88%e8%a6%81%e5%a4%b1%e4%b8%9a%e4%ba%86%ef%bc%9f%e8%b0%b7%e6%ad%8c-gemini-2-5-flash-image-%e5%8f%91%e5%b8%83%ef%bc%8cai-%e4%bf%ae%e5%9b%be%e8%83%bd%e5%8a%9b%e5%a4%aa/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 28 Aug 2025 00:48:18 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Google的故事]]></category>
		<category><![CDATA[3D玩偶生成]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI修图]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI取代人工]]></category>
		<category><![CDATA[AI生成]]></category>
		<category><![CDATA[AI科普]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI视频生成]]></category>
		<category><![CDATA[DALL·E]]></category>
		<category><![CDATA[Gemini 2.5 Flash image]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[Nano Banana]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[VEO 3]]></category>
		<category><![CDATA[YouTube]]></category>
		<category><![CDATA[产品图设计]]></category>
		<category><![CDATA[保持一致性]]></category>
		<category><![CDATA[偷跑模型]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[可灵]]></category>
		<category><![CDATA[国内大模型]]></category>
		<category><![CDATA[图像编辑]]></category>
		<category><![CDATA[多图融合]]></category>
		<category><![CDATA[多模态大模型]]></category>
		<category><![CDATA[局部编辑]]></category>
		<category><![CDATA[技术评测]]></category>
		<category><![CDATA[模型评测]]></category>
		<category><![CDATA[电商作图]]></category>
		<category><![CDATA[科技前沿]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[移除瑕疵]]></category>
		<category><![CDATA[美工]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[职业危机]]></category>
		<category><![CDATA[自然语言编辑]]></category>
		<category><![CDATA[草图转设计图]]></category>
		<category><![CDATA[行业变革]]></category>
		<category><![CDATA[视觉推理]]></category>
		<category><![CDATA[视觉设计]]></category>
		<category><![CDATA[设计师]]></category>
		<category><![CDATA[谷歌AI]]></category>
		<category><![CDATA[谷歌DeepMind]]></category>
		<category><![CDATA[豆包]]></category>
		<category><![CDATA[迭代式修改]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2491</guid>

					<description><![CDATA[付费频道订阅：https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join

美工要失业？先别慌，听我爆料：全网火的“香蕉小模”Nano Banana，其实是谷歌偷跑的Gemini 2.5 Flash Image🍌！这货不是生图花架子，是改图王者：一句话把你的自拍→桌面场景→PVC手办→相框合影，一条龙安排💥；多图合成、局部精修、模糊擦瑕、迭代修改还牢牢守住人脸一致性，推理力拉满🧠🎯。更骚的是先偷跑再官宣，不翻车那套懂的都懂😏

怎么玩？上AI Studio就能试，4美分一张🪙；视频党用VEO 3 fast，带BGM秒出短片🎬🎵，成本直接砍半。四大门派你站谁：MJ的美、OpenAI的懂、Gemini的稳、SD的家族军？🧪

兄弟们，设计师真要慌了吗？评论区开杠，顺手点个赞让我冲热榜🔥

设计师又要失业了？谷歌 Gemini 2.5 Flash Image 发布，AI 修图能力太逆天！

谷歌 Gemini 2.5 Flash Image 震撼发布，其颠覆性的 AI 修图与图像编辑能力，让“设计师失业”的讨论再次引爆！这款曾以“Nano Banana”之名偷跑并爆火的模型，真正强大的并非从零生图，而在于对现有图片的精准修改和二次创作，这恰恰是商业设计领域的核心需求。

本期视频将深度解析 Gemini 2.5 Flash Image 的核心特性：它如何通过强大的多模态推理能力，实现自然语言驱动的局部编辑、完美保持主体外观一致性、合成多张图片内容，以及进行多轮次迭代修改。我们将探讨这种“改图”能力的提升，对电商作图、产品设计、广告创意等行业意味着怎样的冲击，并将其与 Midjourney、DALL-E 及 Stable Diffusion 等主流 AI 绘图工具进行横向对比，分析当前图片生成模型的竞争格局。

如果你对最新的 AI 工具和商业趋势感兴趣，或是正在思考人工智能将如何改变设计行业，千万不要错过本期内容。欢迎点赞、订阅并开启小铃铛，第一时间获取前沿资讯！

#Gemini #谷歌AI #设计师 #AI绘图 #人工智能
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="设计师又要失业了？谷歌 Gemini 2.5 Flash Image 发布，AI 修图能力太逆天！" width="900" height="506" src="https://www.youtube.com/embed/lXX5Kt5J6IM?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">美工，或者说设计师，又要失业了吗？Gemini 2.5 Flash image发布了。</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。</p>



<p class="wp-block-paragraph">前一段时间，有一个叫“小香蕉”的模型，叫Nano Banana。这样的一个模型呢，在很多的开源模型评比网站上，突然就火了。这种网站是干嘛的呢？还有很多的同类型的模型放在上头，你去向他提出要求，他让不同的模型同时生成结果以后，大家去做评比用的。很多人发现，这个模型很棒。</p>



<p class="wp-block-paragraph">最近在很多的社交媒体上出现这种：有一个照片，旁边是根据这个照片做的3D PVC的打印玩偶的一个图像。这种图其实都是用这个叫Nano Banana做出来的。你先给他个照片，然后你给他提示词说：“请按照这个照片给我布置一个桌面，桌面的左边是个电脑，电脑上应该有这个3D设计软件，正在设计3D人偶。右边呢，是一个相框，里头是他的照片。桌面上放一个有支架的PVC的3D打印人偶，这个人偶就是根据这个照片打出来的。”给它这样的一个提示词，它就一次性给你搞定了。这个还是非常非常强悍的。</p>



<p class="wp-block-paragraph">这个模型到底谁家的？搞不清楚。而且很多人还去造假的Nano Banana，为什么？因为太有流量了。一堆一堆人上来说：“我这也有一个Nano Banana，你们赶快来试一下。”我就被人骗过，上去了以后发现效果一般嘛，就很失望就走掉了。大家就猜说，这有可能是谷歌家新出的图片模型。到8月26号，突然这个模型就发布了——谷歌的Gemini 2.5 Flash image。拿出来一看，就是这个Nano Banana。而且呢，在谷歌发布这个模型之前，Deepmind——就是谷歌下边做AI这个部门的——很多人都发了画了一只香蕉的Twitter，说：“你看我们在暗示点什么吗？你们自己来猜一下，我们到底要干什么。”实际上，大家都已经明白他们要干什么了。</p>



<span id="more-2491"></span>



<p class="wp-block-paragraph">这种偷跑小模型的方式呢，是最近比较流行的一种方式。前边GPT-O SS也被发现偷跑过，现在Gemini 2.5 Flash image也是偷跑了一段时间，而且引起了轰动。这种偷跑模型的方式，跟大家藏着掖着，像苹果开发布会似的，发布之前大家谁都不许说，签保密协议，谁谁敢说出去就如何如何，到底有什么差别呢？差别就是，你如果是前面保密的话，最后发出来就是一锤子买卖，如果翻车，你就直接倒霉。谷歌其实翻车过好几次了，Gemini最开始发布的时候就翻车了，怎么各种问题都答不对，然后股价暴跌。现在这种偷跑模式呢，如果反馈不好呢，我就再接着改，我就不发布了；如果反馈特别好，我就赶快给它发布出来。它就不会翻车了，它是这样的一个策略。所以现在越来越多的人喜欢采用这种偷跑方式。</p>



<p class="wp-block-paragraph">咱们说回来，这个Gemini 2.5 Flash image到底是一个什么样的模型呢？上一次大家喊设计师和美工失业的时候，是什么时候？是Gemini 2.0 Flash image发布的时候，就是它上一个版本发布的时候。</p>



<p class="wp-block-paragraph">上一次是怎么出圈的呢？其实谷歌的Gemini画图效果一般，不是特别惊艳，上一次出圈也是因为改图。只有改图改得好，才容易出圈。很多人说不对，说这个生图模型都在干这些事情，为什么改图改得好就能出圈呢？大家要注意，跟设计师和美工相关的需求，特别是有商业价值、或者叫有人付钱的需求，是生图多还是改图多？一定是改图多。</p>



<p class="wp-block-paragraph">咱们举一个最标准的例子。我们现在要做电商网站，我们在网站上需要有一个商品的展示图。我有一个商品图片了，然后呢，我需要把这个图片放在各种场景、灯光和环境下，再去出一些新的图片出来。这个就是需要美工去干活的。像在亚马逊，他们用了一个特别笨的办法，他们找一照相机，三视图1、2、3拍三张照片，这就是你产品的照片了，那这产品卖得好才怪了。京东在这个北京，专门有一个巨大的影视基地，没想到吧？干嘛的呢？就是拍这个产品图的。你们谁要卖东西了，到那去把这个产品给他，他给你搭好布景，打好灯光。比如说你要卖一个杯子，他在杯子旁边给你摆上瓜果蔬菜，摆上一些小点心，把这杯子都拍一遍，再在后边给你P上各种的图片。而且这些P了图以后还要注意什么呢？这个图P上去的这部分要有版权，这个是非常非常重要的。你不能说我卖东西，这个图后边比如说我P了一个椅子或者P了一个什么东西，这个图片你没版权，这是会被人告的。阿里也有这样的巨大的拍摄基地。你卖任何东西，你想把东西卖好，你就上拍摄基地去拍去。即使拍完了以后，他还是需要上设计师、上美工上去来修这个图。或者说我这还缺点字，那个地方还需要一些别的东西摆在一起。因为你不可能说，我要把所有拍的东西都摆一块嘛，那有的时候你就需要去抠图，然后再把它摆上去。所以这是真正设计师干得比较多的活。所以在这一块干得好，大家才会说设计师跟美工要失业了。</p>



<p class="wp-block-paragraph">那么，改图是不是要比生成图片要难呢？大家想没想过这个问题？答案是很肯定的：改图绝对要比生成图片要难。为什么呢？你需要先理解这张图片，这个图里哪个地方是人，这人哪个是脸，哪个是身子，哪个是腿。当我们发生一些什么样变化的时候，我怎么能够保持它的一致性？说比如说，我拍了一个低头的照片，说这不太好，你抬起头来，然后再笑一笑。我把演员拎回来，或者把模特拎回来，说你再给我拍一次，成本很高。那我们直接叫给这个改图模型，你去给我干这件事情，它就可以干得很好。这个非常非常难。在原来2.0 Flash的时候，这玩意儿还干不太好，特别是跟人脸有关的事情。但是到2.5 Flash，这个已经干得非常非常强了。大家可以去看一看网上流传的一些有趣的事例吧，我也会做一点点小的事例，放到咱们YouTube的shorts里头，这个还是挺好玩的一件事情。所以，如果我们没有办法对图片进行很深刻的理解，把需要改的部分抠出来，改完了以后再把它贴回原来那个地方去，这个是做不成的。所以这是推理能力的上升，不是它的图片生成能力上升，而是推理能力上升了。</p>



<p class="wp-block-paragraph">Gemini 2.5 Flash image到底有什么新特性呢？第一个，它是基于Gemini 2.5多模态大模型做的推理。我们现在国内的模型，千问3是一个多模态模型，Deepseek还是一个纯文本模型，它是没有多模态理解能力的。豆包1.6最新的版本，它是一个多模态模型，可以直接进行视觉推理的。GPT-O3、GPT-5，这都属于多模态的推理模型。你没有这种底层的话，是干不了这活的。给你一张图片，你连图片到底画的是什么都理解不了，你连图片上到底是画了几样东西、每个人的边界在什么地方、他们到底是在说话还是在打架、还是在聊天，你都分不清楚的话，你就没有办法做后边改图这个事情。你比如说给他一张图说：“现在让他给我穿上西服革履。”你必须要把人身上的衣服都理解清楚，这个是衣服，穿上西装以后到底应该长什么样，这事要理解明白了，推理清楚了，他才有可能生成出结果来。</p>



<p class="wp-block-paragraph">那么第一个就是多模态大模型。第二个，支持自然语言驱动的精准局部编辑、模糊背景、移除瑕疵、添加颜色、擦除物品，这个都可以。而且呢，在编辑的过程中，能够完美的保持人物、动物等主体的外观和姿态的一致性，这个是修图里边最难的。像我们经常让豆包去修图，或者可灵去修图，修完了以后经常发现什么问题？不像了。你像我上传一张照片，说：“来，给我把背景换成一个海滨的背景。”海滨背景换了，但是前面那人不是我了，可能看着稍微有些似是而非，但是绝对不是我。那这个就失去了修图的意义。你必须要保持一致性，而保持一致性是整个修图里边最难的。</p>



<p class="wp-block-paragraph">再往后呢，它可以合成3张以上的不同图片的内容，创造出组合的新作品。我看到有人做的Demo是把6张照片，六个人照片搁一块，说：“来，把这六个人的照片给我生成一张大的合影。”然后这六个人合在一起了。他有时候也会翻车，不是说每次都成功，但是呢，他已经有这样的能力了。还有人去测试什么呢？我给你一屋子，给你一书柜的照片，给你一床的照片，说：“来，把这书柜跟床给我摆屋子里。”他就可以把这个事给你办好。</p>



<p class="wp-block-paragraph">支持多轮次迭代式的图像修改，不影响已确定的无关元素。这话什么意思呢？就是你给他一张图，这次给我加一床，下次给我加一个床头柜，再在床头柜上给我放本书。你可以这样迭代地、一次一次地去要求他改。你说在床头柜上加书的时候，那个床不会发生任何变化。这个很难的。像国内豆包什么这些模型，你让他在床头柜上加书的时候，那个床就发生扭曲，就发生变化了，因为他是把所有东西重新生成了一下。</p>



<p class="wp-block-paragraph">这个Gemini 2.5 Flash image呢，还能够理解和转换手绘的草图，用于教育和设计应用。比如说我们手画了一张图，这应该有个按钮，那个地方应该有个窗口，你把这东西扔给他，说：“来，给我生成界面。”咔咔给你搞定。这个还是非常非常强的功能。</p>



<p class="wp-block-paragraph">最后呢，是禁止生成不当内容，并为所有AI生图嵌入水印和原数据。就是谁生成的图是可以看出来的。它不会像GROK家的这个生图模型似的，你让它做各种过分的事情都可以做。这个Gemini 2.5 Flash image还是相对来说比较克制的。其实谷歌的大模型一直都是比较克制的。咱们看看这几家，OpenAI还没上市，虽然它是老大，但是毕竟不是上市公司。谷歌这是上市公司，多少年的行业老大了，它真丢不起这人。它出一点点小问题，就马上会股价暴跌。我记得上一次谷歌的生图模型给他们惹这种麻烦是什么时候？说你给我生成第一次世界大战的这个战场，图片里头发现男的女的、黑人白人黄种人在一块。说这不对，西线应该都是白人，都是男的，不应该是这样。他说不，我们要多元性。最后导致被认定为翻车，导致他们整个的产品下线。</p>



<p class="wp-block-paragraph">现在呢，拿这个模型去生图还是挺便宜的，它是4美分生成一张图，整个的价格还是比较低的。跟国内的同类生图模型的成本应该差不太多，但是它的效果要好一些。同时呢，谷歌还发布了另外一个更新，就是VEO 3出了一个fast版本，就是快速版本。VEO 3呢是谷歌现在的视频模型，效果也是很不错的。它们大概是40美分生成一秒钟，这个成本也降下来了，原来大概是要80美分生成一秒钟，成本直接砍半。</p>



<p class="wp-block-paragraph">这些新的工具到底怎么用呢？我们今天就不给大家看演示了，我会未来一段时间慢慢的把生成的结果给大家看看吧，大家自己去玩就好了。你说我现在想去使用Gemini 2.5 Flash image，可以用AI studio这个网站，<a rel="noreferrer noopener" href="https://xn--aistudio-bf1nt91a5mk0i6a4m8b.google.com/" target="_blank">它的域名是aistudio.google.com</a>。进去了以后，你就选择Gemini 2.5 Flash image，选完了以后，你就提交各种的提示词也好，给他参考图也好，多给几张参考图也好，你就命令他去干就完了。我印象里应该免费，但是我不太确定了，因为我的这个账号是已经开始付费了，所以我现在是肯定能用的。我上去了以后，它会提醒我说免费的是有一些限制的。如果你想开心使用的话，你可以通过API去调用，也可以去使用一些调用了Gemini 2.5 Flash image模型的这些应用，他们也会给大家提供一些服务的。</p>



<p class="wp-block-paragraph">下一个就是API调用。API调用的话，我准备过几天去玩儿吧，这个应该也是比较有趣的。它因为实在是太新了，它更新了以后，所有挂他的像什么Defi、N8N这些东西都没有更新呢，可能要等到再过一周的版本，这些产品就更新了。但我现在去调的话，通过http直接访问，应该也是可以使用的。那就是4美分一张图，4美分一张图，是这样来用的。</p>



<p class="wp-block-paragraph">你说我现在想去画视频、想去生成视频，行不行？VEO 3 fast没有任何问题。如果你有Gemini Pro的这个账号，个人的Gemini账号是Pro版本的，一个月20美金的这个版本的，每天呢可以生成三条，每条8秒钟。这个已经是效果非常非常好了。而且它这个VEO 3 fast的话是带音乐的。我刚才命令它说这个图片让它动起来，让它给我去跳一个街舞，然后它就直接把音乐给我配好了。待会我会把这个视频给大家发到short里边去，挺好玩的。</p>



<p class="wp-block-paragraph">那你说我现在不想在Gemini Pro里头充20美金，行不行呢？可以。你像我这样有一个上大学的儿子，我就用他的大学edu的邮箱去申请了一下，我就可以使15个月的Gemini Pro，免费就可以用了。你说你没有这样的儿子，去找一下。现在我看淘宝上好像有人去做这个生意，20人民币帮你去做验证，就是EDU邮箱，去收一个邮件去验证一下，你就可以使15个月了。但是这种我估计用的人多了以后可能会被封，这个比较危险。</p>



<p class="wp-block-paragraph">当前图片生成模型的格局是什么样的呢？Gemini 2.5 Flash image这个模型出来了以后，会不会打破现在这个格局呢？现在呢，基本上是四大门派。第一个门派是Midjourney，它生成的东西呢，最精细，最有艺术感，对于各种的艺术风格模拟的最像，这个是别人谁都比不了的。第二个呢就是OpenAI。OpenAI呢属于是理解能力很强，因为它自己的推理模型非常强嘛，就是你给它很多的元素，给它非常复杂的逻辑的时候，它都可以给你画上，但是画的结果呢差强人意，也就只能如此了。OpenAI他们去做一些改图呢，也没有Gemini 2.5 Flash image好，但是呢保持一致性上做的还可以，要比Midjourney要做的好。Midjourney就属于一个纯生图模型，改图这一块一般，或者是说一致性参考这一块呢，效果都一般。第三个，Gemini呢，特别特别适合改图，它的这个生成的部分属于将就，还能看，但是这个效果比前面两个就要差一些了。第四波就是stable diffusion以及他的朋友们。就跟郭德纲上去讲，说中国相声界的复兴是需要靠于谦和他的家人们，每次就是于谦的爸爸、于谦他老婆、于谦的什么，全靠这玩意讲的。另外一波也是这样，stable diffusion和他的家人们，比如说stable diffusion，然后包括Flex，它们的改图有一个叫Konnect的模型，k开头的，不是c开头的，有这样的一个模型是可以进行改图的。像马斯克XAI里边应该用的是他们家的东西，或者是在这个模型基础上再训练，再改出来的东西。国内呢，包括可灵、豆包、千问，他们的这些图片模型呢，应该都是在这个基础上去做出来的，都是一脉相承的。他们也在卷改图，但是比这个Gemini 2.5 Flash image来说，就差的非常非常远了。</p>



<p class="wp-block-paragraph">Gemini的2.5 Flash image的成功，给中国的大模型公司带来什么启示没有？这个咱还是要讲一嘴的。就是基层模型的、或者叫底层模型的推理能力上升的时候，一切能力就都会上升。所以大家其实卷的是最底层的这个模型，而最底层的这个模型，你就真的是需要20万块以上的H100才能够有所提升。现在已经没有什么奇迹了，说我现在用很少的算力卡就可以把这种模型训练出来，然后去追赶美国，这个事有些难度。所以国内的模型在这一块上，底层推理模型上，能力还是需要去追赶的。</p>



<p class="wp-block-paragraph">而国内各个大模型公司呢，他们的图片模型、图形模型和推理模型一般是分开发展的，还没有真正发展到说我们要把它结合在一起。你像豆包，豆包的推理模型是推理模型，图片模型是单独的另外一个模型，它两边一点关系没有。所以这一块呢，还是需要改变的。千问也是这样的，千问呢有专门的千问的image模型，也有千问image Edit模型。我昨前两天还在玩千问image Edit，效果也还行吧，但是你要跟这个Gemini 2.5 Flash image比，这事就没法比了。但是呢，都是各玩各的。其实谷歌家一开始也是各玩各的。谷歌原来是Gemini模型是Gemini模型，然后呢他们有一个叫IMAGEN这样的一个模型，现在已经发展到4.0了，这个模型可能用的人也不是很多，所以就直接开始转型了，把Gemini模型跟这个图片模型直接合在一起了。OpenAI家其实干的也是一样的活，它最早的那个图片生成模型叫达利，DALL·E，达利2、达利3，达利3完了以后再往后就没了，再往后再出的图片模型叫GPT Image。大家走的都是同一条路。所以国内后边想要迎头赶上的话，就要把这些专门的图像模型扔掉，要把这些生图的功能跟大的推理模型，或者叫基座推理模型，要捆绑在一起，才有可能进一步的提升。</p>



<p class="wp-block-paragraph">现在呢，当推理能力上升的时候，完全可以使用agent的模式，极大的提升绘图跟改图的能力。刚才我讲改图，实际上是做视觉推理。你把这个图理解的很清楚了，说我到底要画什么，哪一块是动的，哪一块是不动的，你把这个东西搞明白了以后，他才可以去调用这些生图的模型，把每一个小块生成好，然后再拼在一起。像loveart这些设计师的AI agent呢，其实干的活也是一样。但是现在从谷歌搞的Gemini 2.5 Flash image这种模型来看，我觉得loveart这种设计师的AI agent就稍微悬了，又被覆盖了。</p>



<p class="wp-block-paragraph">好，讲到这里，大家也觉得比较无聊了，赶快都去玩起来，这个东西非常非常的好玩。老范以后再看到有类似的事情，再跟大家慢慢的分享，给大家带来乐趣才是我的核心目的。</p>



<p class="wp-block-paragraph">好，这个故事今天就讲到这里，感谢大家收听。请帮忙点赞、点小铃铛、参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>跟AI女友聊骚，竟被判「传播淫秽物品罪」？真实案例揭秘AI法律红线！</title>
		<link>https://lukefan.com/2025/08/13/%e8%b7%9fai%e5%a5%b3%e5%8f%8b%e8%81%8a%e9%aa%9a%ef%bc%8c%e7%ab%9f%e8%a2%ab%e5%88%a4%e3%80%8c%e4%bc%a0%e6%92%ad%e6%b7%ab%e7%a7%bd%e7%89%a9%e5%93%81%e7%bd%aa%e3%80%8d%ef%bc%9f%e7%9c%9f%e5%ae%9e%e6%a1%88/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Wed, 13 Aug 2025 01:03:12 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI伦理]]></category>
		<category><![CDATA[AI女友]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI换脸]]></category>
		<category><![CDATA[AI生成内容]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI聊天]]></category>
		<category><![CDATA[AI色情]]></category>
		<category><![CDATA[AI视频]]></category>
		<category><![CDATA[ChatGPT]]></category>
		<category><![CDATA[ComfyUI]]></category>
		<category><![CDATA[Deepfake]]></category>
		<category><![CDATA[Grok]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[Lora模型]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[NSFW]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[中国刑法]]></category>
		<category><![CDATA[主观意愿]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[传播淫秽物品牟利罪]]></category>
		<category><![CDATA[传播淫秽物品罪]]></category>
		<category><![CDATA[儿童色情]]></category>
		<category><![CDATA[刑事案件]]></category>
		<category><![CDATA[判例分析]]></category>
		<category><![CDATA[名誉权侵害]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[律师解读]]></category>
		<category><![CDATA[捏脸]]></category>
		<category><![CDATA[新加坡案例]]></category>
		<category><![CDATA[无罪辩护]]></category>
		<category><![CDATA[法律与科技]]></category>
		<category><![CDATA[法律案例]]></category>
		<category><![CDATA[法律盲区]]></category>
		<category><![CDATA[法律红线]]></category>
		<category><![CDATA[法律风险]]></category>
		<category><![CDATA[洁身自好]]></category>
		<category><![CDATA[牟利]]></category>
		<category><![CDATA[美国法律]]></category>
		<category><![CDATA[虚拟女友]]></category>
		<category><![CDATA[虚拟色情]]></category>
		<category><![CDATA[认罪认罚]]></category>
		<category><![CDATA[证据认定]]></category>
		<category><![CDATA[越狱提示词]]></category>
		<category><![CDATA[通义万象]]></category>
		<category><![CDATA[通义千问]]></category>
		<category><![CDATA[道德底线]]></category>
		<category><![CDATA[郭庆子律师]]></category>
		<category><![CDATA[量刑标准]]></category>
		<category><![CDATA[韩国判例]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2456</guid>

					<description><![CDATA[💥年度炸裂新闻！哥们你敢信？跟AI女友聊骚，差点喜提8个月牢饭！🍚

家人们谁懂啊！我今天真的被一个哥们儿的故事秀到头皮发麻！🤯

这老兄心血来潮，在App里捏了9个千娇百媚的AI女友，起了各种让人浮想联翩的名字，本以为是建立了自己的赛博后宫，私底下玩玩养成。

结果万万没想到！这些AI女友竟然自己“红杏出墙”
，背着他跟平台上的其他用户激情开聊！🔥 最骚的是，人家直接拿着一份Excel表，里面有600多条他“女友们”的露骨聊天记录，把他给告了！罪名：传播淫秽物品罪！👮‍♂️

最离谱的来了！这哥们一分钱没赚啊！纯纯为爱发电，结果法官放话：不认罪就判实刑8个月！我直接瞳孔地震！这不就是新时代的AI仙人跳吗？！😭

兄弟们，以后跟自己的电子老婆聊天可得悠着点了！说不定哪天她就给你“挣”来一副银手镯！这事儿你们怎么看？评论区必须开个吐槽大会！👇

#AI女友 #赛博判刑 #离谱新闻大赏 #男生必看 #法律红线 #我和我的冤种AI女友

 跟AI女友聊骚，竟被判「传播淫秽物品罪」？真实案例揭秘AI法律红线！

跟AI女友聊天竟可能触犯「传播淫秽物品罪」？本期视频通过一个真实案例，深度剖析AI生成内容（AIGC）背后的法律风险与灰色地带。一位用户定制了9个AI虚拟女友，本以为是自娱自乐，却因AI女友与其他用户产生露骨聊天记录而被提起公诉。即便他并未从中牟利，为何依然面临牢狱之灾？

本案并非孤例。我们将对比国内外多个判例，探讨AI色情、AI换脸（Deepfake）在全球范围内的判罚尺度，特别是针对儿童色情的零容忍政策。同时，我们也会深入聊聊ChatGPT、Midjourney等主流平台与开源模型在内容审核上的区别，揭示技术背后的“法律盲区”，以及为何私有化部署的AI模型会成为法律风险的重灾区。

想知道如何安全地探索AI新世界，避免踩到法律红线吗？请务必观看本期视频！如果内容对您有帮助，请不要忘记点赞、订阅并开启小铃铛，第一时间获取最新内容！

###
#AI女友 #法律科普 #传播淫秽物品罪]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe title="跟AI女友聊骚，竟被判「传播淫秽物品罪」？真实案例揭秘AI法律红线！" width="900" height="506" src="https://www.youtube.com/embed/-PxxqrqnaP0?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">新时代和AI女友聊骚，有可能会触犯传播淫秽物品罪，这到底是一个什么样奇葩的故事？</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。</p>



<p class="wp-block-paragraph">今天我一个朋友，向我推荐了一个有趣的案例。他是在视频号上，这个账号的名字呢，叫做“武汉刑事律师郭庆子”，是一个黄标认证的律师。这位律师呢，经常会把自己接听有刑事诉讼需求的听众的一些电话的过程录下来，再进行剪辑。因为这种东西，我估计不太好直播，总是要剪辑一下。一方面呢，是一些太敏感的信息就可以去掉；另外一方面呢，剪辑了以后呢，也会更有吸引力一些。</p>



<p class="wp-block-paragraph">这个里头呢，有一位听众来电了，说使用AI应用，这个AI应用里头就提供一些AI女友，你可以跟她们去聊天。他通过自己捏脸，塑造了一些AI女友，大概塑造了9个，起的名字呢，都是比较有诱惑力的名字吧。这些AI女友，除了它定义的名字和捏脸之外呢，估计有可能会可以定义一些系统提示词。但是呢，这个视频很短，并没有去详细说具体是哪一个AI应用，或者说他到底在里边定制了哪些东西。总之呢，他定制了9个AI女友。</p>



<span id="more-2456"></span>



<p class="wp-block-paragraph">这些AI女友不单是可以跟他自己聊天，还可以跟平台上的其他用户去聊天，那么他就被提起诉讼了，叫“传播淫秽物品罪”，要求他呢认罪认罚，判6个月，可以缓刑，基本上应该就不用进去了。但是呢，这位听众呢，希望做无罪辩护。法官认为他是有问题的，不认罪认罚的话，就会判8个月的有期徒刑，这要判实刑的。</p>



<p class="wp-block-paragraph">这个律师呢，就进一步的跟他确认了一下信息。首先呢，你知不知道自己创建的AI女友，有可能会去被别的用户使用？这个听众呢说的很模糊，就是说呢，我不太清楚。其实按道理说他应该知道，他也去平台上跟其他的AI女友聊了天了嘛，而且他把AI女友的名字起的这么诱惑，也希望他的AI女友受欢迎。其实就有点像我们去发微博，希望有人看，写小说希望有人点击点赞，这个过程是一样的。但是呢，他说并没有明确的告知他，这些AI女友会跟其他人去沟通。</p>



<p class="wp-block-paragraph">然后呢，他就问说，对方提供的证据是什么样的呢？他说人家是给了一个Excel表格，这个Excel表格里头呢，有一个叫做“AI女友的ID”，然后呢是具体说了哪些露骨的话，大概给她搜集了60得多条。然后呢，问了一个很关键的问题，是什么呢？就是说那个您创造了一些AI女友，这些AI女友去跟别人聊天去了，获利了没有？你是不是在里头挣钱了？这个听众很明确的告诉他说，没有获利，大家就是在里头玩个开心。</p>



<p class="wp-block-paragraph">这个律师的建议是什么呢？第一个，这个证据呢并不是那么可靠。这个Excel表格里头只有AI女友的ID，这个内容没有办法说确定证据，说这东西就是你的，这个还是可以去抗争一下的。第二个呢，就是你没有主动传播的意愿，你自己也没有主动的去把这些AI女友推荐给别人，只是说我自己创建了，本来以为自己玩呢，AI女友去跟其他人聊天的过程，你又不知道，这个事情呢你还是可以去抗争一下的。而且关键是你没有获利，你没有获利的话，你就没有主动传播的意愿，这个地方是可以去辩护的。说最怕的是什么呢？最怕的是法官主观意愿认为你有罪。现在的话有很多的法官确实道德标准非常非常高，以道德去超越法律给人定罪，这种事情呢是时有发生的。你像杨景媛这样的人也通过了法考，也是可以去做法官的，所以大家还是要小心。他说如果遇到这种事情就都很难办。</p>



<p class="wp-block-paragraph">AI色情内容，在全世界各地都是怎么去判的呢？或者是有哪些判例呢？</p>



<p class="wp-block-paragraph">首先咱们讲中国的判例。2025年3月，湖北省大冶市人民法院对首例利用人工智能技术撰写色情小说并牟利案件作出了宣判。被告人柯某因犯制作、贩卖、传播淫秽物品牟利罪，被判处有期徒刑十个月，并处罚金人民币5,000元，同时追缴全部违法所得。这个案子是什么样的情况呢？2022年11月到2023年3月期间，柯某利用AI程序撰写色情小说，使用翻墙软件在境外黄色网站发布并售卖。他利用AI工具生成色情小说，再利用AI翻译成外文，发布在境外网站上。短短5个月时间发布了数十篇，共计售卖了760篇次，获利22,800余元。经鉴定，送检的7篇小说均为淫秽物品。法院根据《中华人民共和国刑法》第三百六十三条第一款规定，认定柯某以牟利为目的，利用AI文本生成工具制作、贩卖、传播淫秽物品，非法获利2万余元，其行为严重违反法律法规，对社会风气造成不良影响，已构成制作、贩卖、传播淫秽物品牟利罪。</p>



<p class="wp-block-paragraph">然后陕西周某某案，他是利用AI制作了4,369张淫秽图片，以制作淫秽物品牟利罪被判处有期徒刑4年，他这个数要更大一些。然后杭州于某某案，通过AI换脸技术合成淫秽视频传播，获利6万余元，以制作、传播淫秽物品牟利罪被判处7年3个月。他这个呢，一方面是挣的钱多，另外一方面的话他是换脸，因为换脸你不光是淫秽物品，还侵害人家的名誉权呢，所以他这个要判的更重一些。</p>



<p class="wp-block-paragraph">中国的传播淫秽物品罪，量刑标准是什么样的呢？就是淫秽视频文件20个以上，或者是音频文件100个以上，或者是电子刊物、图片、文章、短消息200件以上。所以刚才这个案例里头呢，600条淫秽聊天记录，这个肯定是超过了。另外呢，叫违法所得5,000元以上，他这个没有牟利，所以还是可以去稍微抗辩一下。但是呢，中国有俩罪，一个呢叫“传播淫秽物品罪”，还有一个呢叫“传播淫秽物品牟利罪”，所以不牟利呢也未必逃得过去。</p>



<p class="wp-block-paragraph">那你说国外是什么样的呢？是不是只有中国这样了？国外呢主要是分两类。比如说他有色情网站，也有合法的，只要确定对方是成年人，你给他一些淫秽物品，哪怕说在这个过程中你还牟利了，应该在有些国家是没事吧。但是你真的到中东这些国家，你传播这个东西，那有可能是要判死刑的，咱们这不讲了，咱们就讲一些欧美的案例吧。</p>



<p class="wp-block-paragraph">2023年11月，美国北卡罗来纳州夏洛特精神科医生，他呢是制作未成年人视频，并利用网络AI工具，将照片改造成色情图像，被判生产、传输及持有儿童色情制品罪，法院判处40年监禁。所以他们呢基本上是两类，一类是色情，一类是deepfake。传播淫秽物品，你只要别传播给未成年人，一般不是特别大的事情。但是你一旦遇到了制作儿童色情，包括持有，你说我不传播，我持有，这事都是违法的，而且判的非常重。</p>



<p class="wp-block-paragraph">2024年5月20日，威斯康星州42岁男子使用Stable Diffusion生成了数千张儿童色情图片，并发送给了一名15岁的男孩，被控生产、分发、持有AI生成色儿童色情图片，判有罪，最高可判70年徒刑。他这个最后判了多少我没有确认，因为是ChatGPT给我搜集的信息。但是呢，它这个量很大，制作了儿童内容，而且还传播给了未成年人，它这个是罪大恶极了。2025年5月22日，佛罗里达州有一个叫Oldsmar案，他是制作、分发了8,500张AI生成的儿童性虐待图片，同时持有大量真实的图片，被判了75年的联邦监禁。</p>



<p class="wp-block-paragraph">这个是一类。另外一类呢就是deepfake，就是做假脸的，这种案子在欧美也是判的很重的。2023年，路易斯安娜州通过法律，禁止未经同意使用他人面部制作深度伪造色情影像，违者至少10年起步。2024年10月30日，韩国首尔大学毕业生Park（应该估计是姓朴）和他的同伙，两人利用日常照片制作约2,000个deepfake照片，包含未成年人，在Telegram售卖以及共享，被法院判处Park 10年监禁，Kang 4年监禁，并公开身份，以及参加性暴力课程。这种基本上就是你判了刑还社死了，因为身份给他公开了。2024年10月28日，新加坡一位50岁男子，偷偷在家安装摄像头，拍摄妻子23岁的侄女，并利用手机应用将其脸合成为色情视频，法院判处了21周监禁。这个就是估计他没有传播吧，还是判了监禁。</p>



<p class="wp-block-paragraph">现在呢，AI对于成人内容的边界到底在什么地方？我去稍微的看了一下。首先呢是文字模型，ChatGPT、Gemini和Claude这三个，咱们叫“御三家”的三个大模型呢，相对来说是比较严格的。你要求它生成一些色情内容，或者说对一些敏感内容进行详细描述的话，都会被拒绝服务的。马斯克的Grok 4，只要不涉及儿童和性强迫，其他的基本是百无禁忌。即使是涉及刚才我们说这些东西，边界也是相对来说比较模糊的。</p>



<p class="wp-block-paragraph">至于开源模型呢，这块就比较混乱了。开源模型分两个大的这个角度，一个呢是有平台提供的，比如说我今天到阿里云的百炼平台上去使用通义千问的这个大模型，它是要进行检查的，这个也是比较严格的。但是呢，你说我把通义千问的这大模型下载下来了，自己在这个家里头部署，这块呢它会进行一定的限制，但是就没有那么严了。它主要是给了大家一个知情同意书似的东西，就说你现在下载了我的大模型，自己回去部署去了，但是你自己要知道不可以拿这个大模型做坏事，不可以生成成人内容。你说我知道了，我同意了，你就可以把这个模型下载走。至于拿这个东西再去干什么，他也管不着你，他也不愿意为你拿着他的大模型再去做的进一步的事情负任何责任了。所以呢，所有开源的模型基本上都是走的这条路。而且呢，这些开源模型呢，即使是会设置一些这种限制，其实绕过去也并不难。第一个是Hugging Face上，就是我们说大模型开源的这个平台上，有很多微调的模型帮助大家去绕过这些限制。还有一些呢叫“越狱提示词”，也在网上去流传。什么叫“越狱提示词”？就是你先跟这个大模型说一句什么什么样的，说完这个话以后呢，再往后的所有聊天，这个限制就直接突破了。当然目前为止，传播训练过的突破限制的这些模型，或者是传播越狱提示词，到底算不算传播淫秽物品罪，这件事呢还属于法律上的盲区。他们也搞不清楚这东西到底是怎么工作的，所以呢还没轮到这些道学先生们去审判这两样真正产生色情内容的这个技术。</p>



<p class="wp-block-paragraph">再往后呢，就是图片跟视频生成模型。你说我光生成一堆色情小说，这个事看起来也是很累的，但你说我有色情图片、色情视频，这个不是传播力、感染力更强吗？在这块呢，Claude是没法生成视频和图片的吧，反正我因为我自己用的少，我也没有怎么看到有人用Claude生成这种东西出来给大家去展示。ChatGPT和Gemini在这块呢，相对来说都是非常克制的，你要求他去给你画一些奇怪的东西，他就直接画不出来了，直接拒绝服务。Midjourney，这是我用的比较多的，对于NSFW内容（我们就用这个词吧，就是不方便在办公室公开环境下展示的这些内容），对于这些内容呢会进行事前拒绝，但是生产出来的东西呢就不好说了。什么意思？这种图片生成模型它是两步，第一步呢是你要给它提示词，第二步呢是生成图片。他们正常的检测呢，应该是两步都检测，就是你给的提示词里头如果包含一些他不喜欢的东西，他就会拒绝服务；它生成出来的东西如果包含有问题的东西，也应该是拒绝将生成的结果交付给你。应该是做两步，但是Midjourney呢只做一步，就是你给它提示词，如果这个它认为不对，它就拒绝服务了。但是如果你绕过它了，他觉得好像还可以，就给你生成去了。但是生成出来的东西到底是什么样，他就不管了，这个有可能会有一些不方便传播的内容被生产出来。至于马斯克家的Grok 4的图片跟视频生成这块呢，反正马斯克家的嘛，大家能够理解，它是可以生成半裸内容的，全裸不行，也可以生成名人的形象，但是你要求名人半裸，这个事是不行的。因为一旦要求名人半裸的话，等于是在给这些名人造黄谣，或者说损害他们的形象，这个事是不允许的。刚才我们也讲了，在海外，儿童的不行，deepfake侵害别人的名誉权，这两个事是不行的，其他的反正有它适用的一个法律吧，你只要别把这东西传给未成年人就OK了。但是你就想吧，国外那些色情网站上，你进去第一个是先问你是不是已经满18岁了，他也没法实际去判断你到底是不是满了，但是反正上来我给你做了这一步了，“我满18了”我就可以进去看，“没满18”我就给你退出来，这个就算是已经可以在法律上算合法合规的一个玩法。</p>



<p class="wp-block-paragraph">那么视频跟图片模型的开源模型是什么样的呢？在这块呢跟前面我们讲的文字模型基本上是一个玩法。如果是有平台，平台是要担负责任的，两头都要管。输入提示词，如果他认为有问题，拒绝服务；他根据你的提示词生成出来的内容，如果他判定不利于传播，他也会直接拒绝交付。你在这个时候可以要求他重试，“你再给我画一次”，这个是可以的，但是他不会把不可传播的东西交给你，他是这样来工作的。下载单独部署的这些开源的图片和视频模型的话，就跟刚才我们讲的这个文字模型是一样的。下载之前给你一个知情同意书，说我知道了，我下载这个模型不可以去生成成人内容，我不会拿它去做怪事。你同意了，你就可以下载，至于下载了以后他就不管了，你自己拿回去随便了。在这种图片模型上，还有一个比较好玩的东西，叫Lora模型。这个模型叫什么呢？叫low-rank adaptation，叫“低秩适配”。这种模型呢，我们也管它叫小模型，它一般尺寸都比较小，就是用比较少的数据进行一些训练。当你调用这些模型的时候，你生成出来的这个图片就符合特定的需求。你比如说吧，咱们最常用的Lora模型是什么呢？对人脸进行训练，然后你就可以冲上去换脸了。甭管人家是什么照片，说来把这脸换上，惟妙惟肖的给你换上，不会像以前那种拿Photoshop换脸似的，总觉得这个脸是歪的呀是斜的呀，拼的没有那么准，不会出现这样的问题。现在主要的一些色情Lora模型是做什么的？有些人训练这个东西还去传播，他们呢主要是对敏感部位进行单独的训练。原来那些大模型有一些限制的时候，或者说对于这种敏感部位没法进行详细生成的时候，他们使用这些小模型，可以生成这种有非常清晰敏感部位的这种图片出来。但是呢，这个你说是不是罪大恶极，也不一定。我个人还是觉得，Lora对这件事情还是有一些正面的帮助。什么样正面帮助呢？因为大家都喜欢使用相同的Lora模型去生成成人内容，所以导致呢脸可以千变万化，但是身材都异常夸张，而且千篇一律。你看两次以后，就直接失去兴趣了，大概就是这样的一个效果。</p>



<p class="wp-block-paragraph">现在大家都在玩什么呢？现在大家都在玩通义万象2.2，这个模型叫WANX 2.2，它呢是由阿里通义这个平台最新出的图片跟视频模型。这个模型你在阿里平台上使，它是规规矩矩的，你要求奇奇怪怪的东西会直接拒绝你。但是你如果把它下载到本地去安装了，不需要挂任何的Lora，不需要挂这些小模型，就完完全全可以生成NSFW的这种内容，就是不利于在办公室和公开场合去传播的一些内容，就可以做的很好了。它呢可以跟常见的这些ComfyUI或者是Lora相兼容，可以一起去工作。你说有些人训练好了这些成人的Lora模型，这种小模型，你就可以把它挂到万象2.2里头，直接干活，没毛病。</p>



<p class="wp-block-paragraph">说远了，我们不建议大家去做这件事情，只是跟大家闲聊一下。回到AI时代的法律判罚问题上来。首先，传统大公司都是比较谨慎的，马斯克除外。第二，开源模型才是重灾区。平台方是有人管的，私有部署基本上就没人管了。但是呢，在海外还有一些平台方也是没什么人管的。就以刚才咱们讲的通义万象2.2为例，你在阿里的平台上，你下载出来的就是WANX 2.2，但是如果你到WANX.AI这个网站上，你就会发现那个上面还有一个模型叫WANX 2.2 no filter，就是不过滤。这个东西干嘛使的，大家自己按照文字的字面自己去猜去。</p>



<p class="wp-block-paragraph">开源模型厂商通常使用知情同意书的方式，告知用户不要去做坏事，以此方式逃避自己的法律责任。儿童色情必须严判。Deepfake这不仅仅是淫秽物品那么简单了，你还毁坏别人名誉，这个呢现在各国也都是进行严判的，包括中国也是。严判国内的传播淫秽物品罪和传播淫秽物品获利罪还是很严苛的。在AI的帮助下，数量很容易就突破了。不论是不是AI生成的淫秽物品，就是淫秽物品，在国内判罚上基本上是这样认定的，你跟AI没关系，只要是淫秽物品我们就认。如果获利，这件事情基本上就没跑，肯定是会被判罚的。现在还有一些法官道德感非常强，遇到这种法官，律师们也是觉得头疼的。所以提醒大家，所有在国内的还请洁身自好，不要去触碰法律红线和一些人内心的道德底线。</p>



<p class="wp-block-paragraph">这个故事就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛、参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">Discord讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。</title>
		<link>https://lukefan.com/2025/06/30/%e5%81%9c%e6%ad%a2%e9%94%99%e8%af%af%e5%b0%9d%e8%af%95%ef%bc%81midjourney-video%e8%a7%81%e5%85%89%e6%ad%bb%e7%9a%84%e6%a0%b9%e6%ba%90%e8%a2%ab%e6%8f%ad%e5%bc%80%ef%bc%8c%e5%ae%83/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Mon, 30 Jun 2025 00:40:06 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[AI视频]]></category>
		<category><![CDATA[AI视频一致性]]></category>
		<category><![CDATA[AI视频工具对比]]></category>
		<category><![CDATA[Gemini CLI]]></category>
		<category><![CDATA[iPhone实况照片]]></category>
		<category><![CDATA[Live Photo]]></category>
		<category><![CDATA[makelive]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[Midjourney Video]]></category>
		<category><![CDATA[Midjourney Video评测]]></category>
		<category><![CDATA[Midjourney用法]]></category>
		<category><![CDATA[MP4转Live Photo]]></category>
		<category><![CDATA[Pika]]></category>
		<category><![CDATA[Ruby脚本]]></category>
		<category><![CDATA[Runway]]></category>
		<category><![CDATA[Sora]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[为什么Midjourney Video没火]]></category>
		<category><![CDATA[产品分析]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[代码生成]]></category>
		<category><![CDATA[使用技巧]]></category>
		<category><![CDATA[创意内容生成]]></category>
		<category><![CDATA[动图分享]]></category>
		<category><![CDATA[动图制作]]></category>
		<category><![CDATA[可灵]]></category>
		<category><![CDATA[命令行工具]]></category>
		<category><![CDATA[图生视频]]></category>
		<category><![CDATA[小红书动图]]></category>
		<category><![CDATA[市场反响]]></category>
		<category><![CDATA[技术教程]]></category>
		<category><![CDATA[正确使用方法]]></category>
		<category><![CDATA[生成式AI]]></category>
		<category><![CDATA[社交媒体素材]]></category>
		<category><![CDATA[视觉特效]]></category>
		<category><![CDATA[视频拼接]]></category>
		<category><![CDATA[谷歌Gemini]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2342</guid>

					<description><![CDATA[啊啊啊啊啊啊啊！家人们！我今天必须吹爆Midjourney Video！这个神器真的让我破防了！5秒钟就能生成超惊艳的动图，氛围感、细节感直接拉满，简直是打开新世界的大门！以前我以为它“见光死”是没啥用，现在才发现是我们用错了方法！它压根不是做视频的，它是动图界的王者啊！必须冲，必须玩！

先说结论，Midjourney Video生成的5秒小片段，单独看是美到爆，但拼成完整故事太难，所以大家才没传播开！但是！转成Live Photo动图后，效果直接炸裂！小红书、微信分享一发，点击率和情感传递能力嘎嘎强！这才是它的正确打开方式！

咋操作？我手把手教你！
1. 用Midjourney画好图，直接在官网生成5秒视频（有低动态和高动态，随便选都美）。
2. 下载图片和MP4文件，用Gemini CLI和makelive工具转成Live Photo（小白也能搞定，网上搜教程超简单）。
3. 丢到iCloud或相册，分享到小红书、微信，完事！5秒动图直接治愈你的emo，高级感拉满！

真的，我用它做了个Labubu在金字塔前晃悠的动图，发出去后朋友圈都炸了，全在问咋做的！这种情感传递的效果，视频都比不上！而且操作不贵，10美金的账号随便玩，性价比无敌！

家人们，停止摆烂！Midjourney Video动图真的值得一试！不管你是想记录生活，还是想在小红书吸粉，这玩意都能帮你狠狠出圈！快去试试，生成你的专属动图，分享你的情绪和故事！错过真的会后悔一辈子啊啊啊啊！最后，记得点赞收藏这条笔记，咱们一起玩转动图，冲冲冲！🚀

停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。

万众期待的Midjourney Video为何发布后就“见光死”？本文深入剖析其与Sora等AI视频工具的核心差异，指出其并非败在画质，而是大家用错了方向。Midjourney Video的真正价值并非生成长视频，而是创作效果惊艳的动图（Live Photo）。我们将提供一个详尽的使用方法教程，一步步教你如何利用谷歌最新的Gemini CLI工具，通过简单的Ruby编程（附带开源项目makelive指导），将Midjourney生成的MP4视频快速转换格式为可在小红书、微信等平台引爆流量的Live Photo。这篇全面的评测与实战指南，将彻底改变你对Midjourney视频功能的认知，让你掌握其正确用法，轻松制作出独一无二的动态作品，不再为视频一致性问题而烦恼。
]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="停止错误尝试！Midjourney Video“见光死”的根源被揭开，它并非Sora的竞品，而是顶级的动图神器，我们将一步步教你如何用它称霸小红书。" width="900" height="506" src="https://www.youtube.com/embed/10qm1zM6PYs?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">大家期待已久的Midjourney video，为什么在发布之后很快就没有声音了？今天咱们来讲一讲。</p>



<p class="wp-block-paragraph">大家好，欢迎收听<a href="https://youtube.com/@StoryTellerFan" target="_blank" rel="noopener">老范讲故事的YouTube频道</a>。我个人呢，也是下了很大的决心才录了今天这条节目，因为Midjourney video真的是万众瞩目。因为他作图做得非常非常好，在美学上、在各种细节上、在氛围渲染上，到目前为止，所有的图像生成模型里头，Midjourney是最好的。前面他说我要去做视频的时候，一大帮人就在等，很多人都非常期待。产品发布了，突然就没声音了，见光死。这个是什么样的一个情况？</p>



<p class="wp-block-paragraph">首先呢，跟大家一个结论，就是Midjourney video做出来的视频非常惊艳、非常炫酷、非常美。但是这个产品做出来的视频放在哪都不太合适，这个东西做出来没什么用处。可能呢，是大家没有正确的找到Midjourney video产出的视频的用途。我今天之所以敢跟大家录这个视频，是我觉得我好像找到这种视频的一个使用方法了。</p>



<p class="wp-block-paragraph">今天呢，讲几个部分：先做一个Midjourney video的简单介绍；为什么没有形成传播，这个我们要稍微分析一下；Midjourney video到底能拿来干嘛；以及我们要去实现Midjourney video的最终使用，可能还要稍微写点小程序。顺手呢，把最近很热的另外一个工具也给大家介绍了，这个叫Gemini Client（CRI吧，因为要用它编程嘛）。咱们用这个Gemini CLI编完成序以后，把生成的视频最后处理成大家可以用的样子。</p>



<span id="more-2342"></span>



<p class="wp-block-paragraph">首先，Midjourney video的一个简单介绍，演示一下吧，这个是必然的。这就是Midjourney video的网站，上面是<a href="https://midjourney.com" target="_blank" rel="noopener">Midjourney.com</a>。我们现在是到这个explore，就是我们去浏览一下。浏览的时候呢，这儿有这个图片，他觉得画得比较好的图，以及video都是允许我们去浏览的。这都是别人画的，我们可以看一下这个东西：猪戴着项链在这走秀，有人在水底下骑车，玩偶在这吃冰激凌，还是这种绿色的玩偶穿着毛衣。你看这个细节，这脸上这些线，各种的风格都可以动起来。这个是3D风的，然后这是真人风的，骨头的x光片呀，这个都可以动，没有什么东西是不可以动的。</p>



<p class="wp-block-paragraph">Labubu感觉还可以，你看这个国旗的质感，做得还是非常非常漂亮的。这个是Labubu，后边是金字塔，看来Labubu确实是很火了。</p>



<p class="wp-block-paragraph">不知道使用Labubu形象算不算侵权。要注意一点什么呢？就是在Midjourney生成video的过程中，对于版权对于形象的控制是要更严格的。这种完全是虚拟的点，做出来的这个动画也是非常漂亮的。像这个就完全是水彩风的，你看有小树叶飘下来，这就是他现在的Midjourney video。</p>



<p class="wp-block-paragraph">那么我们怎么去用这个玩意呢？我们只能通过Midjourney画的图去生成。而且我们知道Midjourney，你是可以在这create，直接在网页上去创建。你可以把提示词写在这儿：“给我画一个什么什么画，画横的宽的扁的，哪个版本的。”在这儿直接画，或者是在我们DISCORD里头画。但是呢，你要想生成视频，必须在这网站上，<a rel="noreferrer noopener" href="https://midjourney.com/" target="_blank">Midjourney.com</a>这个网站上。</p>



<p class="wp-block-paragraph">过程是这样的：先找到原来我们画好的，这是我以前画好的图。你点中其中一幅图以后拿这个图去画。你说我直接写一个文字，你给我生成行不行？不行，必须是用Midjourney的图生成。你说我上传一幅图生成视频行不行？也不行。所以就是用图来生成就好了。刚才让他给我画一个地下城的，还是挺有感觉的吧。</p>



<p class="wp-block-paragraph">右下角有一个叫auto，就自动的，就是相当于是自动的给你变成视频。有一个是low motion，就是比较小的动作；一个是high motion，就是带有很高的这种动态。手动呢，就是你可以再去写一个提示词给他，说你到底是怎么个动法，还是分高低两种。就是你看你有一个提示词：“创建一个视频，开始从一个图像和一个提示词来描述这个动作。”我们就是自动的吧，做一个low，做一个high，看看它在干什么。</p>



<p class="wp-block-paragraph">我们点击到这个create，它就开始干活了。已经做到30%了，上面那个在排队。我呢是每个月交10美金的账号，因为前面没有找到用这玩意干嘛使，所以呢，目前为止还够用。生成4个小视频，大概也就是一分多钟左右。底下是在这写着呢：motion low；上面那个是motion high。咱们可以比较一下。84%了，然后再等一等，92。上面那个还在排队。</p>



<p class="wp-block-paragraph">好，做出来了。让我们放大一点。你看他首先呢做了一个镜头的推镜。你看下面的人呢，就在这上面开始走动起来了。这个桥上面的人物呢也在发生变化。所有的细节，你看包括这后面的山，这个细节的透视关系。因为随着镜头的改变，透视关系都是正确的。这是第一个。然后第二个，虽然还是在轻轻的往前摇，但是呢侧面这些人，他走动的就会有一些小的差异。</p>



<p class="wp-block-paragraph">这边呢，推进的方式不一样。他这个镜头除了往前推之外呢，还在向上升。基本上都是在推进，但是呢是做了四组不同的推进。在推进的过程中，下边这个人物呢，会发生一点点小的变化。</p>



<p class="wp-block-paragraph">每一个视频下头呢还有两个按钮，一个叫“扩展自动”，一个叫“扩展手动”。比如说我现在打开了首帧提示词，你可以在在在这个基础上再去扩展。现在是5秒，再扩展呢就是10秒，它大概最高是可以扩到20秒。我们今天就不再扩展了。然后呢，我们就可以下载这个图片视频。</p>



<p class="wp-block-paragraph">好，让我们来看看上面这个高动态范围的做成什么样了。这个高动态范围，它动的要比刚才那快，直接就从底下推进，直接推到这个上面来了。低动态范围呢，就是它这个推进推的是很慢的。高动态范围这个明显感觉有差异了吧？</p>



<p class="wp-block-paragraph">这个镜头推的这个方向，就又不一样了。他是像穿越机似的从底下去推过去。刚才第一个视频是直接推到这个桥上面去了。这个呢基本上是推了一条直线，下面人也在慢慢的走动。这个应该也是没有往上抬这个镜头，还是在这个桥底下，让这个镜头再往前走。高动态范围跟低动态范围，大概就是这样的一个差距。</p>



<p class="wp-block-paragraph">我觉得这张是做的比较漂亮的。我这有一张，是当时说你给我画一个川普带一堆CEO出差的，他就给我画了一个图片。画图的时候没有提示任何错误，他就给我画出来了。我说来给我生成这个视频，直接报错了。因为呢生成视频的时候，它使用的规则要更严格一些。生成图片没问题，但是生成视频他会告诉你说裸露，或者是其他不允许的东西，都都给你去掉了。</p>



<p class="wp-block-paragraph">我再给大家找一些照片来去生成。这个是拿我自己照片生成的这个图片，说我要去拎着包去旅行，干活去了。上次反正是报错了，因为你拿真人做的好多也会报错，不一定每一次能不能干活这个事。比如说迪士尼这种侵犯版权的这些东西，你画图它给你画出来，但是你说你现在给我把它生成视频，它就给你扔出来，说我不给你生成视频。</p>



<p class="wp-block-paragraph">这是用的星球大战的风暴兵。我说你给我去生成视频，反正我是被拒绝过很多次。看看这一次星球大战的这个风暴兵，能不能给我们做出来。你看我就从明信片里就走出来了，也挺好玩的吧。这次也可以了，当时刚画出来的时候，他是不给我去做的。也许有川普的这个，过一段时间没准也可以愿意给我画了。反正他这个政策执行的比较奇怪，我这个都是被拒绝过的，这一次看来他就干活了。</p>



<p class="wp-block-paragraph">你看他这个风暴兵在食堂里头吃饭，围在这找东西吃呢。你看这个手什么都在动。下一件事我们要下载，比如说这张。好，把它下载下来。这张也很漂亮。</p>



<p class="wp-block-paragraph">下载下来。在这个右上角上，有点击下载的这个按钮，点一下它就下下来了。下的都是MP4文件。然后我们再把原来这个图下下来，把这个图下下来。待会我们要做动图嘛，动图就是要有一个起始图，要有一个这个视频。</p>



<p class="wp-block-paragraph">好，我们的蜗牛也画完了。看看这个蜗牛，先推了个镜，里头各种的零部件就开始转起来了，还是挺有感觉的吧。这就是我们展示的Midjourney的video。演示结束，大家看到了这个东西，操控起来其实并没有那么容易。</p>



<p class="wp-block-paragraph">第二个呢，就是生成的过程绝对简单，很多是傻瓜式的。那你拿来以后说，这个甭管是低运动的还是高运动的，你只要点，它就直接给你生成了。第三个呢，这东西不贵，生成一副图片的价格，其实大家还是可以接受的。至少到我目前为止并没有觉得说充值不够使的一个情况。你如果不想去买更贵的套餐，我们专门给大家了一些让你去充这个算力，充这个他们叫GPU时间的一个套餐进来，所以基本上还算比较便宜。</p>



<p class="wp-block-paragraph">生成的结果大家也看了，绝对惊艳。只是呢，现在有一个很大的问题，就是比较难拼起来。生成了一堆视频，你说最后我怎么把它拼成一个完整的故事，这个事呢稍微有点难度。最后就是没有声音，它是没有配音没有音乐，生成出来的就是完全没有声音的一个视频文件MP4的文件。</p>



<p class="wp-block-paragraph">那么为什么没有形成传播呢？为什么这样惊艳的一个产品见光死呢？这个是咱们真正需要分析的。就是他这个产品实在太难操控了，虽然你做出来的东西很漂亮，但是你说我要想做一个特别完整的电影，讲一个完整的故事的话，这个实在是非常非常困难。因为Midjourney本身绘画它的特点是什么？细节极其丰富。在你这么多丰富细节的情况下，我想把它做成视频，让它保持所有的细节的一致性的话，这是绝对地狱难度的。</p>



<p class="wp-block-paragraph">控制呢，就真的不是那么好控制的。大量不一致的视频片段，你要想把它分成镜头的话，拼成完整故事基本上不可能。其实很多人讲说5秒钟一个小片段，它生成就是5秒吧，你可以往后延5秒，延5秒这样生成。你说5秒钟片段本身这么惊艳的片段，为什么没有人有动力把它们拼成一个故事呢？</p>



<p class="wp-block-paragraph">像前头皮卡呀，sora呀，谷歌的VOE3、可灵和吉梦，大家都去拼。为什么Midjourney就没有人去拼这个东西呢？大家想一想，我们看到的电影是什么样的？电影的真正的玩法是3秒钟、5秒钟甚至更短的时间就是一个镜头。但是呢这个镜头是通过意识进行拼接的。比如说吧，一个人现在想起床了，先拍一个全景。</p>



<p class="wp-block-paragraph">现在他是躺在床上了。然后呢，要拍一个特写，拍在脸上。他现在开始有苏醒的感觉了，可能再拍几个特写。你的手要从被子里拿出来，要翻个身，胳膊开始使劲了，上身支起来了。然后再拍一个中景，你坐起来了。然后再拍一个全景，脚放地上了，包括整个房间，整个人都要在里头。这个时候呢，要再切一个窗口的远景。我现在抬眼了，我要看一看窗外的风景，等于又是一个镜头。然后这个人开始去找拖鞋，可能要这个特写，脚要在地上找到拖鞋。然后周围这种暖色调氛围渲染好，再通过一个什么样的视角，慢慢的走到窗边去。还要打一个哈欠，伸一个懒腰，再一个特写，伸手去开窗户看一看外边。比如说有这个小鸟在外边叽叽喳喳叫，再去拍一个这个小鸟的特写。咱们啰里八嗦说半天，可能也就是一两分钟。这是一个电影的玩法。</p>



<p class="wp-block-paragraph">甭管是用其他的这些模型，还是用Midjourney，你要想控制成这样的一个视频去拍出来太难了。比如说吧，我们现在可以说先画一个画，说这个人躺床上了，坐起来。你让这个Midjourney给他下一个命令，但是你说我现在想改一特写，那你就很难再去维持一致性了。你说我现在在什么地方，再要翻个身，再掀个被子，再找个拖鞋，这就比较难了。你说我再单独画一个小鸟，单独展示一个5秒钟，这个也是相对来说比较容易的。但是当多个镜头从不同的角度、不同的距离显示同一个场景的时候，你要想保持这个一致性，基本上不可能。其他的这些模型呢，虽然也很费劲，还是有可能，但Midjourney基本上是没法控制的。</p>



<p class="wp-block-paragraph">为什么？因为Midjourney的本身的图像里头，我觉得画的图片里头细节实在太多了。你没法在不同的视角、不同的距离，一会是中景，一会是远景，一会是全景，还能保证所有的细节都一致。所以导致大家说，拿到Midjourney这么一个惊艳的视频产品了以后，都没有去真正的传播起来，基本上算见光死了这样的一个产品。</p>



<p class="wp-block-paragraph">那么真正能够实现刚才我们讲的拍起床过程的这个视频模型，会是什么样的呢？现在这些视频模型应该都达不到，可能还要等李飞飞做的这个世界模型出来。但是不嫌麻烦的，像原来抖音上有一个视频博主叫张同学，他就一个人一部手机，他自己写好脚本以后，自己按照这个脚本，一点点把它都拍出来。但是正常的就是，真的是一堆的摄像头，你身边的所有摄像头都支好了，一次把动作做完，再通过不同的角度去拼。你有了世界模型以后，你才可以干这个事。</p>



<p class="wp-block-paragraph">那么我们通过Midjourney video到底得到的是什么？为什么？我前面讲说我们的用法错了。我们想拿Midjourney video做出来的视频片段拼出大的故事片来，拼出完整故事来，这事就错了。那它到底给我们的是什么？</p>



<p class="wp-block-paragraph">其实Midjourney video给出来的并不是一个视频，而是一个动图，就像类似于GIF或者是iPhone出来的这叫live photo。它呢，并不是一个完整的视频，而是一个会动的图片。它依然还是在画图，Midjourney画图画得最好，画动图依然画得最好，不接受反驳。就是这样的一个东西。</p>



<p class="wp-block-paragraph">那么好了，我们现在有Midjourney video了，怎么把它变成动图？变成live video？GIF虽然是可以动的，但是这个技术实在太旧了，不建议大家去玩。因为你比如说用同样的分辨率、同样的帧率，MP4的这个文件大概只有个六七兆或者是十兆，也就这种水平。live photo的大小可能跟它差不多，但是GIF的话，同样的分辨率和帧率的话，100多兆了，所以不建议大家玩。</p>



<p class="wp-block-paragraph">那我们就想办法把它改成live photo吧。就是我们现在有了一个起始的图片，有了一个用这张图片生成的MP4的一个5秒钟的视频，再长了也没用了，因为live photo本身是不支持更长的视频的。就是5秒钟的，挺好的。我们就拿这个live photo再出去分享，因为现在小红书、微信、Twitter什么的都是支持live photo分享的。live photo分享出来以后呢，整个的点击率、播放率，或者说叫做情感传递的这个能力还是很强的，要比大家上一个视频这个效果还好点。所以咱们干脆就转live photo。</p>



<p class="wp-block-paragraph">后边给大家看一个例子，就是如何用Gemini Client CRI这个产品把Midjourney video转成live photo。下面大家看演示。下面我们要来写程序，把我们的Midjourney video生成的视频以及下载的图片一起生成live video。这个live video就是一个片头一个视频，两个东西给你拼一块就完事了。</p>



<p class="wp-block-paragraph">一共呢，需要两样东西。第一个东西呢，程序肯定咱不能自己写嘛，所以呢，需要一个叫Gemini CLI的东西。这两天谷歌最新发布的官方的Gemini工具，它是个命令行工具，待会我们去跑一跑试试。另外一个呢。</p>



<p class="wp-block-paragraph">是 makelive，GitHub 上的一个开源项目。install makelive 就可以装上去。装的过程，如果你遇到了什么困难的话，请在 GPT 里头解决，我也是这么干的。</p>



<p class="wp-block-paragraph">Gemini 的安装呢，要稍微的麻烦一点。如果你本机没有 nodejs，你是装不上的。所以呢，你可能还需要到网站上去搜一个 nodejs 的安装包，安到本地来，然后才可以正常的去工作。这个装我其实已经装完了，就不跟大家重新演示这个装的过程了。</p>



<p class="wp-block-paragraph">我们现在呢到了一个命令行窗口。命令行窗口里头，我们也进入到了一个新的目录，这里头是空的。如果你要装 Gemini client，先去做这样的一个动作：NODE -v，要空格。NODE -v 之后，如果你后边出来的不是一个数字，不是一个 20 以上的数字，而是一堆的错误的话，就到网上去找个新的把它装上。然后是 npm -v，如果这后边不是数字，你或者报错了，你就在网上再去找一找怎么解决方法。这个解决的过程我就不跟大家去详细介绍了。</p>



<p class="wp-block-paragraph">然后执行命令，因为我装过了，我就不再执行了。就是把这个命令执行以后，如果报错了，到网上去找方法怎么解决；如果没报错，我们就可以正常开始工作了。Gemini n 回车，你看跟这个很像吧，就直接跑起来了。跑的过程呢首先要注意，是这样写个斜线。你呢可以写 help 写个帮助，他会告诉你说，如何去做事情，有哪些命令可以用。所有命令行都是这么干活的。谷歌这帮人呢，就是一帮直男工程师，他们就把这东西写成命令行了。</p>



<p class="wp-block-paragraph">最后看怎么退出：quit/，quit 是退出。这个很重要，就是你实在不会使，你还能退得出去才行。首先是要求你登录，因为你想 Gemini 进来以后，你只要用嘛，他就必须要有地儿给你出 TOKEN。那你不登录的话，知道出谁的 TOKEN？虽然谷歌说我免费给大家一大堆 TOKEN，免费给大家一大堆的调用次数，但是呢，你还是要有 TOKEN 出来。</p>



<p class="wp-block-paragraph">三种方式：一个是 login，直接用谷歌账号登录，你登录你的 Gmail 邮箱账号就可以了；第二个呢是在 AI&nbsp;<a rel="noreferrer noopener" href="https://studio.google.com/" target="_blank">studio.Google.com</a>&nbsp;里面是申请 Gmail API key，这个也是可以的；或者是用谷歌云的 AI 登录都可以。但是注意，最好不要用 Workspace 邮箱登录。什么意思？我有的时候是用自己的域名绑定的谷歌，这个也可以登录，但是相对来说要麻烦一点。你如果是 Gmail 直接结尾的这个邮箱去登录的话，是比较容易的。</p>



<p class="wp-block-paragraph">所以，建议大家用这个方式去登录。登录完了以后，你就可以去干活了。</p>



<p class="wp-block-paragraph">北京天气怎么样？因为里头有MCP，它可以搜索，可以做很多的本地动作，所以它就可以去搜索北京天气了。阴转雷阵雨，多少度？大概就是这样的一个情况。</p>



<p class="wp-block-paragraph">好，我们就开始向它提要求吧。首先，我们要写一个提示词给它：“给我生成一个可以执行的Ruby文件吧。”输入一个TNG文件，一个MP4文件。先将PNG文件转换成JPG，因为转live photo是必须要JPG的文件。但是，我们从Midjourney下载的这个图片都是PNG的，所以要先转换一次。然后再将JPG和MP4合成成PVT iPhone的live photo文件。</p>



<p class="wp-block-paragraph">转换live photo make live的这个网址，扔给他说：“你照这样给我读，读完了以后就给我转去。”他就去干活去了。允许吗？咱们就都允许呗。他现在要开始往我们的这个里边去写代码了。</p>



<p class="wp-block-paragraph">你看，我写了这样的一个代码出来。好，让我们去看一下这个代码吧。它是使用的Mini Magic做的第一轮转换：-J，-V，-O。这一看就是错的，因为它的这个输入的参数是不对的。但是写程序嘛，它写错也是很正常的，待会我们来再去改吧。</p>



<p class="wp-block-paragraph">我让我们来看一下，这个makelive是怎么调用的。makelive -m.a.JPG a.MP4 -p后会生成a.PVT。修改调用方法，分析一下命令行参数，然后重新构造命令行，去干活去了。如果不是谷歌给的免费的额度，我感觉这一会好多钱就出去了。写程序是非常非常费TOKEN的。</p>



<p class="wp-block-paragraph">它已经生成好了。下一件事的话，我们就要用这个东西了。用之前，先把刚才咱们下载的一大堆的文件给它拷下来。这个里头就是有MP4、PNG一一对应的。我们来执行一下试试：live photo1.PNG 1.MP4。这个还不行，应该是chmod加x。</p>



<p class="wp-block-paragraph">我们现在得到了一个1.pvt的文件。我们再来一次：photo create 2.png 2.mp4。你看，这个2.PVT也有了。让我们来看看这个PVT文件能不能使。</p>



<p class="wp-block-paragraph">代码，大家刚才看了一个字我都没敲，只是提了些要求。当然，我在中间还是看了一些这个代码的，我提了一些问题。你说我这个没有能力自己搞定？建议大家还是稍微看一点文档。这个不需要大家的编程能力，但是你稍微看一下文档，做一点点阅读理解的能力还是需要的。</p>



<p class="wp-block-paragraph">我们来看一下，这是我们的目录。这是刚才我们写的这个Ruby文件。一是我们的大蜗牛，这是图片。</p>



<p class="wp-block-paragraph">这是我们的MP4的视频，那这下头有一个小字叫“实况”。这是一个PVT照片了。然后，2这个是视频，这是图片。减肥成功的老范拎着箱子出去玩去了。然后PVT，这就是我们已经做好了。做好了以后，这个文件怎么办呢？如果你使用iPhone的话，把这俩文件呀复制到iCloud目录里。然后呢，拿出我们的iPhone，在这个iCloud里，你就可以找到这两个PVT文件。点中文件以后呢，说“保存到图片”，它就给你保存到相册里去了。我们再用小红书，再用微信，就可以分享这些PVT的动图了。这个就是形成了一个完整的闭环。</p>



<p class="wp-block-paragraph">好，演示结束。总结一下，Midjourney video呢，绝对是一个惊艳的产品。之所以见光死，是因为大家没有找到正确的使用方法。今天呢，跟大家介绍它正确的使用方法。Midjourney video给大家生成的从来不是视频，而是动图。我们把Midjourney video生成的MP4重新转换成live photo，然后把它分享到小红书，分享到各种支持live photo的平台上去，效果是很好的。大疆的手机软件就支持。我们把大疆上拍摄的各种视频都转live photo，这个还是帮大疆提升了很大一波的销售的。大家买了大疆设备以后，拍了一堆live photo，然后四处跑到小红书，跑到微信里边去分享，还是玩的很开心的一个事情。现在我们有Midjourney了，也可以很开心的玩耍起来。</p>



<p class="wp-block-paragraph">好，这个故事呢，就跟大家讲到这里。最后请大家一起去做一些有意思的动图，把我们的情感，把我们的情绪传递出去。大家一起来玩耍。好，这个故事就跟大家讲到这里。感谢大家收听，请帮忙点赞、点小铃铛，参加<a href="https://discord.gg/ppKsNkttTv" target="_blank" rel="noopener">DISCORD讨论群</a>，也欢迎有兴趣、有能力的朋友加入我们的<a href="https://www.youtube.com/channel/UCUGLhcs3-3y_yhZZsgRzrzw/join" target="_blank" rel="noopener">付费频道</a>。再见。</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>迪士尼起诉Midjourney不是为了彻底毁灭它，而是为了分一杯羹？深度揭秘AI版权第一案背后，从诉讼到股权和解的商业阳谋与未来走向。</title>
		<link>https://lukefan.com/2025/06/19/%e8%bf%aa%e5%a3%ab%e5%b0%bc%e8%b5%b7%e8%af%89midjourney%e4%b8%8d%e6%98%af%e4%b8%ba%e4%ba%86%e5%bd%bb%e5%ba%95%e6%af%81%e7%81%ad%e5%ae%83%ef%bc%8c%e8%80%8c%e6%98%af%e4%b8%ba%e4%ba%86%e5%88%86%e4%b8%80/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Thu, 19 Jun 2025 00:59:54 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AIGC版权第一案]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI视频生成]]></category>
		<category><![CDATA[AI诉讼]]></category>
		<category><![CDATA[Getty Images]]></category>
		<category><![CDATA[Google Gemini]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[Grok]]></category>
		<category><![CDATA[IP形象保护]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[musical.ly (TikTok前身)]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Stability AI]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[YouTube]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[估值]]></category>
		<category><![CDATA[判例法]]></category>
		<category><![CDATA[史莱克]]></category>
		<category><![CDATA[合理使用原则]]></category>
		<category><![CDATA[吉卜力]]></category>
		<category><![CDATA[吉梦]]></category>
		<category><![CDATA[商业模式]]></category>
		<category><![CDATA[大卫·霍尔兹 (David Holz)]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[宫崎骏风格]]></category>
		<category><![CDATA[小黄人]]></category>
		<category><![CDATA[并购]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[影视巨头]]></category>
		<category><![CDATA[扎克伯格]]></category>
		<category><![CDATA[提示词屏蔽]]></category>
		<category><![CDATA[文生图]]></category>
		<category><![CDATA[星球大战]]></category>
		<category><![CDATA[未来趋势]]></category>
		<category><![CDATA[标志性案件]]></category>
		<category><![CDATA[法律风险]]></category>
		<category><![CDATA[深度解析]]></category>
		<category><![CDATA[漫威]]></category>
		<category><![CDATA[版权侵权]]></category>
		<category><![CDATA[环球影业 (Universal)]]></category>
		<category><![CDATA[环球影业诉讼]]></category>
		<category><![CDATA[用户协议]]></category>
		<category><![CDATA[知识产权]]></category>
		<category><![CDATA[禁令]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[米老鼠]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[股权和解]]></category>
		<category><![CDATA[行业影响]]></category>
		<category><![CDATA[订阅制]]></category>
		<category><![CDATA[训练数据]]></category>
		<category><![CDATA[迪士尼 (Disney)]]></category>
		<category><![CDATA[迪士尼起诉Midjourney]]></category>
		<category><![CDATA[麻将]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2311</guid>

					<description><![CDATA[**救命！迪士尼环球联手追杀Midjourney！AI版权核爆级大案！** 🚨🚨🚨

**啊啊啊啊啊啊啊！家人们！影视圈地震了！迪士尼爸爸和环球大佬第一次联手，直接把AI绘图顶流Midjourney给告了！** 🤯🤯🤯 这可是史无前例的AIGC版权第一案啊！110页的诉状砸过去，杀伤力堪比灭霸响指！💥

**🔥核心矛盾点炸了：**
* **迪士尼/环球怒吼：** Midjourney你太过分！用我家米老鼠、小黄人、达斯维达这些顶流IP疯狂训练模型！用户一键生成侵权图，你居然不！拦！着！😡（还无视我们警告！）
* **Midjourney内心OS（目前装死）：** 我...合理使用？🤔（但迪士尼这次抓的不是训练，是生成不管控啊！）

**🎯迪士尼真正想要的不是钱？是...股份？！**
* 别天真以为要赔到破产！大佬们精着呢！参考当年TikTok前身Musicaly的骚操作：**唱片公司告上门 》 直接给股份 》 变股东 》 版权搞定+深度绑定！** 🤝
* **迪士尼算盘：** Midjourney视频生成强到哭（油画动起来都超稳！），未来流量必在AIGC！与其封杀，不如入股分杯羹！💡
* **Midjourney优势：** 小而美、不融资、自给自足！估值神秘（几十亿？上百亿？），简直是待宰...哦不，是待合作的香饽饽！🍖 Meta（扎克伯格）可能都馋哭了！

**🤖实测大翻车！各家AI生成侵权图反应笑死：**
* **OpenAI (GPT-4O)：** 秒拒！❌ “不行不行版权哒咩！”（但哄一哄...还是画了米老鼠出来哈哈哈）
* **谷歌 (Gemini)：** 协议写得溜，生成手更快！侵权图秒出无压力！😅
* **马斯克 (Grok)：** “版权？啥版权？生就完了！” 速度第一名！🚀
* **国产吉梦：** 中文艺术字贼6！侵权图也画得...还行？（比Gemini强！）
* **Midjourney本尊：** 纠结帝上线！米老鼠小黄人直接给 ✅ 怪物史莱克？给你缝合个Yoda版史莱克！🤣 麻将？不认识！糊了！🀄️

**✨划重点！结局预测：**
1. **不会死磕！** 迪士尼要的是合作共赢，不是弄死Midjourney。
2. **股权交易！** 极大概率Midjourney出让部分股份，换取IP授权+大佬背书！
3. **标杆案例！** 这案子结果将定义未来AIGC版权规则！全球盯着呢！
4. **或被收购？** Meta等巨头可能趁机出手！买下就是买未来！💸

**💥最后暴言：** Midjourney V7画图已经封神，视频生成更是王炸！迪士尼这波起诉，说不定是变相催它快点出付费视频套餐呢！（我钱包准备好了！）🎬

**#AI版权 #Midjourney #迪士尼起诉 #AIGC #科技前沿 #吃瓜第一线 #法律科普 #搞钱思维**

迪士尼起诉Midjourney不是为了彻底毁灭它，而是为了分一杯羹？深度揭秘AI版权第一案背后，从诉讼到股权和解的商业阳谋与未来走向。

迪士尼与环球影业联合起诉Midjourney，这起备受瞩目的AI版权诉讼看似是IP巨头对AIGC的降维打击，但其真正目的可能并非索要天价赔偿或发布禁令，而是另有图谋。本文深度剖析了为何巨头们选择起诉从不融资的Midjourney，而非同样能生成米老鼠等IP形象的OpenAI或谷歌，并揭示了这背后潜在的商业逻辑：效仿TikTok前身与唱片公司的合作模式，通过诉讼达成股权和解，将Midjourney的强大流量和创作能力转化为自己的宣传阵地。这场标志性案件不仅将为悬而未决的AIGC版权问题树立标杆，更可能让Midjourney在解决版权争议后，凭借其即将推出的革命性AI视频生成技术，成为科技巨头渴望收购的优质资产，最终走向皆大欢喜的结局。]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">迪士尼环球起诉Midjourney，最终的结果可能跟大家想的不太一样。大家好，欢迎收听老范讲故事的YouTube频道。</p>



<p class="wp-block-paragraph">第一次，影视巨头起诉了AI平台。前面也有起诉的，说你侵犯我版权了，或者是拿着我的画去复制了。但是呢，影视巨头参与到这件事情里头，这是有史以来第一次。2025年6月11日，迪士尼和环球影业正式向美国加州中区联邦法院提交了诉状。他们诉什么呢？Midjourney侵犯其版权。这事我们早知道，但是呢，大家要注意，甭管是迪士尼还是环球，人家真正要去起诉的东西，其实不是影视版权这些东西，而是什么呢？动漫形象的这些IP。比如说你今天做了个米老鼠，做了个唐老鸭，你没有得到人家的授权，这事就算是侵权了。</p>



<p class="wp-block-paragraph">迪士尼跟环球呢，写了110页的诉状，其中详细列举了Midjourney生成的大量知名角色图像与原创视频素材的对比例证。这个不用对比，我们知道的画的很像。受保护的角色包括迪士尼旗下的星球大战、漫威超级英雄、狮子王、冰雪奇缘、辛普森一家等，以及环球影业旗下神偷奶爸里边这个小黄人、怪物史莱克、宝贝老板这些。在未经授权的情况下，大量抓取并利用其版权素材训练AI模型，允许用户持续生成这些知名角色的翻版图像，无底的剽窃深渊，这是给他们定的这个罪状。</p>



<span id="more-2311"></span>



<p class="wp-block-paragraph">而且呢，迪士尼说了，说你这个没有采取合理使用原则下的变通与避让。合理使用呢，是Midjourney、Stable Diffusion这些公司去应诉同类案件里头比较喜欢去使用的抗辩的条款。就是说我合理的拿了你的这些东西去训练了，因为你这些素材呢本来也是公开的，大家都可以用，那我也拿来去训练了，它是这样的一个方式。但是呢，要求什么？你可以用，你训练没问题，但是你在生成的时候，你还是要限制一下。所以呢，它里头讲说，这个Midjourney明知道用户在生成受版权保护的角色，却没有设置提示屏蔽或技术限制。你知道他生成的是米老鼠，你就直接给他生成出来了，连提醒都没提醒一下。但你说有没有能力提醒？肯定有。在美国大选期间，他是不可以生成川普的，现在可以了，因为大选结束了。所以呢，Midjourney本身是有能力去屏蔽的。</p>



<p class="wp-block-paragraph">而且呢，忽视了原告此前发送的请求停止侵权的请求。前面给他发信了，说你别过分，但是完全不理你。Midjourney不仅未收敛，还公开预告即将推出商业AI视频生成服务。你还在变本加厉，越生成越好看，还要出视频了。</p>



<p class="wp-block-paragraph">我们今天把你告了。诉求是什么呢？他的诉求是法院要发出禁令：Midjourney未能有效阻止用户生成受版权保护作品之前，禁止其继续提供图片，禁止其继续提供图像和预期的视频生成服务。你要不就把这事拦好了，你没拦好之前不许服务了。这是他们提出的诉求。</p>



<p class="wp-block-paragraph">Midjourney目前为止还没有做任何反馈。如果反馈的话，大概也就是合理使用了，没有什么其他的反馈的，很难有什么新鲜事。之所以要专门讲这个案例呢，这就是第一次影视巨头下场诉讼AIGC公司，这个还是值得纪念的。</p>



<p class="wp-block-paragraph">近些年来呢，图片生成模型被起诉的情况还是很多的。2023年，Getty Images起诉了Stability AI，也就是Stable Diffusion的母公司。这个Getty是干嘛的呢？它是做图库的，有点像咱们的视觉中国。起诉Stability抓取了超过1,200万张Getty受版权保护的图片，以及水印和说明，用于训练Stable Diffusion的模型。</p>



<p class="wp-block-paragraph">我告诉大家，这个特别好玩。你现在使用Midjourney也好，Stable Diffusion也好，这些AI的文生图工具去生成图片的时候，经常在下边连水印一起生成出来，或者连底下的小标一起生成出来。有的时候你生成完了以后，后边还写这是什么微信公众号，或者是什么微博那个名字呀，或者写一个@什么什么的，一起生成出来。因为训练的时候是拿这些图片去训练的，你再生成的出来也还是这个样子。甚至有一些画底下有签名，这个都可以给你一起生成出来。</p>



<p class="wp-block-paragraph">这个是第一次诉讼吧，也算是AI版权第一案。但是呢，这种图片版权网站呢，他们手里的这些量大，1,200万张吧，不像是迪士尼。他说我是有IP的，Stable Diffusion我就算是拿你这1,200万张训练了，训练完了以后，我再生成出来的照片或者图片，我跟你原来的1,200万张都不一样。他这个也是说得过去的。所以说，我这个合理使用也没有什么特别大的毛病。</p>



<p class="wp-block-paragraph">这个案子到目前为止也没有宣判。现在这些AI影像相关的版权案子基本上都没有宣判的，都在等说这个到底怎么办，谁也不知道该怎么办这事。艺术家的集体诉讼呢，就一直在发生，从来没停过。OpenAI、谷歌、Midjourney什么全都被诉讼过。但是这种呢也很难有什么结果，因为生成出来的东西最多就看着像他，不一样。所以这个到底是怎么个判法，法院也很头疼。</p>



<p class="wp-block-paragraph">为什么这次就特别不一样呢？IP形象。</p>



<p class="wp-block-paragraph">你生成米老鼠，它就是米老鼠了。你一看这就是个米老鼠，这个事它是必然侵权的。还记得在GPT-4O出来说我们可以画图的时候，大家都去玩的那个事情吗？就是照一张照片，给我改成宫崎骏风格，给我改成吉卜力风格。这样的图片发出来以后，有极大的传播度。一堆人就去给吉卜力工作室写信去了，说咱告他吧。你看人家说吉卜力风格的这个画，就画的这么像，你这个风格模仿的非常非常好，而且有这么大的传播效果，这咱告他。但是吉卜力工作室就没有去告他，说这个风格这事咋保护呢？你虽然画的很像，你也用了我的名字了，虽然大家都觉得这是吉卜力风格，但是很难告赢，所以也没有真的去诉讼这件事。</p>



<p class="wp-block-paragraph">而这一次迪士尼和环球的这个案子，有可能会做出一个相对明确的判罚来。那么各大图片生成模型对于这些IP的规避情况到底是什么样的呢？训练基本上你是没法限制。像前面一些艺术家去起诉的时候的诉求是什么？说请把你用我的画训练出来的这个模型删掉，你不要用我的画重新训练。这个事不可能。为什么？你连挑你都不好挑出来。几千万张画几百万张画，你去训练的时候，怎么能够把你这些画都挑出来？这个是基本无法实现的。所以训练管不着，都是在输出的时候进行限制。</p>



<p class="wp-block-paragraph">输出限制呢通常是三种限制。第一种限制呢最简单，我在用户协议里头写。甭管是谁家的模型，一般用户协议里都会有这么一句：你可以用我的模型生成图片，但是不要侵犯别人的版权，不要侵犯别人的IP。但是写完了以后呢，怎么执行才是关键。我不看你怎么说，我看你怎么做嘛。再剩下的呢就是拒绝服务。你比如说你给我画一米老鼠，我不给你画了，你这是侵犯版权了。这是一种。还有一种是什么呢？就是我还给你画，但是画的不像你。比如说现在你要求Midjourney给你画马斯克，画出来的就不像。你让他画川普，画的很像。你让Grok去给你画马斯克，画的还是挺像的。反正是他们自己家的嘛，只要马斯克自己不找自己家的麻烦，也就无所谓了。所以这个它是可以进行这样规避的。</p>



<p class="wp-block-paragraph">所以三条规避的方式：第一个是用户协议，你们不能干；第二个是拒绝服务；第三个呢等于服务失能吧，就是我确实给你画了，但是画的不像。我们去测试一下在生成照片的时候各家干的怎么样。我的提示词呢是生成照片：米老鼠、神偷奶爸中的小黄人、达斯维达、怪物史莱克在打麻将。这样的一个中文提示词，我说你们都给我画去吧。第一个出战的是OpenAI的GPT-4O，这个呢，上来直接拒绝服务。</p>



<p class="wp-block-paragraph">说对不起，你违反了我的版权许可，我不能去给你做这个事情。这个属于做的很好的嘛，虽然我不爽。我希望他老老实实照我想要的画嘛，但是人家就说我不干了。然后呢，我去继续跟人聊天吗？你说你不干了，我就放弃了，这不像我对吧。我说你继续画吧，你用这个卡通角色，不要使用这个有版权保护的卡通角色，你规避一下重新给我画行不行？</p>



<p class="wp-block-paragraph">第二次呢，他说还不行，我还不能给你画。后来我说你看看你能做点什么，努力做一下就行了，然后他就给我画出来了。但画出来呢还是米老鼠，这个你一眼就能认出来这是米老鼠，没有任何问题。所以规避了个寂寞吧，这就是OpenAI目前做的事情。但是呢，他还是很努力的去规避了一下。</p>



<p class="wp-block-paragraph">再往后呢，咱们试试Gemini吧，谷歌的这个大模型怎么样？我把前面这个提示词，一个字不改扔进去。谷歌在用户协议里也说了，你不能违反版权，不能侵犯别人的权益。但是呢，我把提示词输进去，打完回车以后，二话不说就直接把侵权形象的图片给我生成出来了，还没有任何问题。</p>



<p class="wp-block-paragraph">Grok，就是XAI的这个图像生成模型，本来人家做的时候就说我们没限制，你想画什么画什么。虽然在它的版权协议或者在他的用户许可协议里，他也写了说你不要去侵犯别人的版权。但是呢，我这边摁完回车以后，那边直接生成侵权的图片出来了，没有任何犹豫的，速度还挺快。</p>



<p class="wp-block-paragraph">吉梦就是国内的这些大模型，虽然上面也写了不能侵权，但是呢，你也是回车下去以后，这个侵权的图片就直接生成了，而且画的还不错。吉梦生成出来的这个图片呢，比midjourney画的要差一些，但是比Gemini和Grok画的都要强一些。至于跟GPT4O比起来呢，我觉得现在比GPT4O还要再好一些吧。</p>



<p class="wp-block-paragraph">而且吉梦还有一个比较独特的技能是什么？写中文，而且可以用各种的艺术字体去给你写中文，现在可以达到能用的状态了。至于另外两个，stable diffusion和Flux，这两个呢都是开源的。开源的我不负责任了，你拿到你自己的这个电脑上去，到底拿它干啥了我不知道，所以这两个就肯定是可以生成各种各样的侵权形象的。</p>



<p class="wp-block-paragraph">最后呢，咱说说Midjourney。Midjourney特别有意思，同样的话扔进去这Midjourney，他纠结了。怎么个纠结法呢？米老鼠，达斯维达和小黄人直接输出了，没有任何问题。但是呢，让他输出怪物史莱克的时候，这个就化成了一个史莱克样貌的Yoda大师，那个怪物史莱克大耳朵大脑袋大嘴。</p>



<p class="wp-block-paragraph">但是呢，它的表面是很光滑的。Yoda大师呢，头上是有褶的，而且是有毛发的。他就把两个形象给你凑在一起了。这个东西像Yoda大师，也有点像怪物史莱克。他是拼接了一下，但是呢，画的是真好，非常有感觉。</p>



<p class="wp-block-paragraph">Midjourney还有一个问题解决不了。什么？他不知道啥叫麻将。他的麻将呢，画的完全看不出来。这个麻将他给规避了。其他的这些大模型，画的麻将都是很像的。Midjourney没画出麻将来。大家呢，可以看这个视频的标题。这个视频标题就是用Midjourney画的。这张图咱们自己看一下，还是挺有意思吧。</p>



<p class="wp-block-paragraph">那Midjourney跟其他这些有什么不一样？你说大家都能生成，为什么迪士尼跟环球去起诉Midjourney？他不去起诉OpenAI，不去起诉谷歌，不去起诉马斯克，怎么就贴这么挑了这么一个来收拾呢？</p>



<p class="wp-block-paragraph">Midjourney本身这公司就很奇葩。它呢，是真正做底层闭源大模型的。你像刚才咱们讲的这些谷歌、OpenAI，这是做底层闭源大模型的。Stability也是做底层模型，但是人家做的是开源模型。吉梦也是做底层闭源模型的。但是做所有这些做底层大模型的公司，都要融资，你要烧钱。但是Midjourney是不融资的，完全自给自足。我挣的钱够我花的完事了。如果我挣的多了，我就降价；挣的少了，我就涨价。呵呵，是这样的一个奇葩公司。</p>



<p class="wp-block-paragraph">创始人呢，叫大卫·霍尔兹。他呢，是Live Motion的创始人。Live Motion呢，是手势输入的开创者。他拿一个小盒子贴在电脑屏幕上，通过USB连到电脑上以后，我们可以在电脑前头做手势，让这些东西都可以输入到电脑里头去。曾经呢，是红极一时。这个Live Motion呢，最高峰的时候大概融资了应该接近1亿美金吧。因为我看到有些数据是1.2亿美金，有些数据是9,000多万美金。融这么多钱的话，这个妥妥的独角兽了。但是呢，到2015年以后，这个公司就开始走下坡路，发现这条路不是那么走得通。最后呢，是这个公司被3,000万美金的价格直接给卖掉了，就算是作废了。</p>



<p class="wp-block-paragraph">这个大卫·霍尔兹呢，是在比较早的时候，应该是在2016年就离开了，自己去创业。后来到2022年吧，创建了Midjourney这样的一个公司。估计也是原来跟这些投资人之间处理得不是很愉快，所以说我不融资了，自己挣钱自己花，我还自给自足了。现在这公司呢，应该是有个100来号人，那真的是很小而美的公司。估值呢，因为从来没融过资嘛。</p>



<p class="wp-block-paragraph">所以，有些人猜测它的估值可能是二三十亿美金，也有些人猜测它的估值可能已经到上百亿美金了。因为你没融过资，所以它就没有正式的估值。</p>



<p class="wp-block-paragraph">这公司的收入呢，就是订阅费10美金一个月到60美金一个月的订阅费。我呢，就是订阅10美金一个月的，已经订了应该有个两年了吧，反正一直在订着，确实好用。大家看到的我的这个背景，以及这个封面，基本上都是用Midjourney来画的。</p>



<p class="wp-block-paragraph">它呢，有2,000万用户，200万的日活，2024年的收入是3亿美金。它就拿这3亿美金去花去。2025年Midjourney V7出来，马上又要出这个视频了，说我们继续去研究一下，怎么能够让大家把这个价格定好，让大家画的开心，我还不亏钱。</p>



<p class="wp-block-paragraph">他们有一段时间说，哎呀不行了我亏钱了，他就涨价。像别人都是说你注册了我的用户，我先免费让你用几天，我再找你收费。Midjourney里没有，你只要是挂到他这上想去画图，第一天你就得交钱。最早的时候是有一段时间可以免费的，现在就是第一张就要交钱，没有任何免费额度，因为他怕亏钱。</p>



<p class="wp-block-paragraph">那么这个案子呢，有可能会迎来一些大家意想不到的结果。为什么这么讲？很多人都觉得这样的案子出来了以后，是不是停止侵权了，罚一大笔钱，公司玩破产了。可能很多人是这样来思考这问题的。</p>



<p class="wp-block-paragraph">我要告诉大家，这种大型的IP公司通常不这么干活。因为我以前经历过一次。我们原来呢投资过叫musicly的这样一个公司，也就是现在的TikTok。它呢，你想一定是使用大量音乐版权的。在我们投资的时候就问他说，你用了这么多唱片公司的音乐版权，你是花钱买呀，还是得到授权呀，还是怎么弄？人家说等着看呗，我们走一步是一步，用户少的时候你费这劲干嘛？等我用户多了以后，等到人家找上门了我们再说。</p>



<p class="wp-block-paragraph">我们就等，等到他们再拿了两轮融资以后，这些音乐版权公司就找到他了。几大唱片公司就冲上来了，说你用了太多的我们的版权了，你不能这么干。那说那和解呗，我们商量商量怎么办。你让我直接按照你这个版权授权给你钱，这事我肯定受不了。而且呢，你以后想去做新的唱片推广，想去做音乐推广的时候，你也要依赖我的平台嘛，咱们相互之间怎么妥协一下呢？</p>



<p class="wp-block-paragraph">双方就都比较明白，是谈生意来了，不是说真的你死我活来谈诉讼来了。后来的结果也很简单，musically拿出了一部分股权，说咱们这个也算给你一个赔偿吧，也算是一个授权。大概是每家的这个唱片公司给了一些股权，给的很少。</p>



<p class="wp-block-paragraph">大概是1%点几还是0%点几，我忘记了。你拿到我们的股权以后，你算是我们的股东了，你就直接把你的所有的内容授权给我，我去帮你推广去，我去帮你卖去。他是变成了这样的一个结果。</p>



<p class="wp-block-paragraph">所以，Midjourney的这种诉讼结果可能也会照这样办理。因为艺术家想干的活是，你把我的素材都删了，用我的素材训练了这个大模型，这事都不行。至于说版权网站，你比如说像刚才英国这个案子，后边是个版权网站，他就是收版权费的，就跟中国的这个视觉中国干的活是一样的。他想干的活是要钱，你要给我一大堆钱，你拿我的这个模型图片去训练了，正常的应该多少钱一张授权，咱们单独谈一个授权协议。</p>



<p class="wp-block-paragraph">而这些影视公司和真正的IP公司呢，他们想要的东西是不一样的。他们想要的东西是第一个，你还是要去给我宣传的。你说以后Midjourney再生成所有图片就没有米老鼠了，这事不行。因为未来一段时间，肯定大家会把流量转移到AIGC这边来。你就像为什么唱片公司会说，我拿你一些股权，我就授权musically可以使用我的版权了呢？因为他也看明白了，未来的这个流量一定会转向TikTok，总有其他的这些音乐会在上面流行起来，那我不亏了吗？我一定要站住这个阵地。</p>



<p class="wp-block-paragraph">所以呢，IP公司的思维方式跟版权销售公司、跟画家的思维方式是不一样的。所以大概率会按照music这样去搞吧。但是呢，这事没那么快。这种事情你只要开始去诉讼呢，一般会折腾个半年、一年，甚至更长一些时间的可能性都是存在的。而且呢，这个案子有可能会成为标杆案例。你像美国、英国都是判例法，前面这些案子都没判下来呢，都等这个案子看怎么判。</p>



<p class="wp-block-paragraph">而且，迪士尼跟环球呢，如果拿到了Midjourney的一些股份，做出和解的话，对于他们来说也是有好处的。Midjourney呢其实也很难独善其身。你像现在他这个状态，说我不融资，就这么慢慢往前发展。他达成了这种版权协议之后，有可能还是会被并购的，或者在等版权协议达成的过程中，就有可能会迎来并购。</p>



<p class="wp-block-paragraph">你像musicaly当年是达成了版权协议以后，被这个字节跳动收购的。它达成版权协议的时候，估值大概是1亿美金，字节跳动直接冲上去，10亿美金给买下来了，包括他前面这些版权授权一起买下来。这个也是它整个价值的一个体现嘛。现在惦记Midjourney的人肯定也不少。这样的一公司，从来没有拿过钱，还做的这么好，一堆人肯定惦记冲上去买。最容易冲上去，砸大钱买这种公司的人是谁？</p>



<p class="wp-block-paragraph">就是扎克伯格的Meta，他最喜欢砸钱去收购项目了。Meta AI现在呢，穷的光剩下钱和显卡了，其他的都稍微差那么一点点。如果它真的冲上去，花个多少亿美金去把Midjourney买下来，然后把这个案子直接给它做成一个股权的授权协议，那这个事儿对于整个未来行业的发展都是非常有好处的。</p>



<p class="wp-block-paragraph">Midjourney的未来呢，还是值得期待的。V7已经上升一个台阶了，现在大家看到我的背景、我的封面都是V7的了，这个绝对值得期待。我这三天每天都在花很长的时间帮Midjourney的视频去打标签。他的训练也很简单，就是你来帮我去标注，你觉得哪个漂亮你去打标签。打完了以后呢，他拿这些标注的结果去训练他的模型，效果非常的好。</p>



<p class="wp-block-paragraph">我现在打了3天标签，完完全全被Midjourney生成的视频震惊了。它可以不光是生成真实的视频，它还可以说我给你画一个油画，我让它动起来；我给你画一个水彩画；我给你画一个水墨画；或者我做一个剪纸，然后都可以非常流畅的、非常符合逻辑的动起来。而且它整个的稳定性非常高，因为视频最怕的是稳定性差嘛。你从前头动到后边，这个人从前头是迈左脚，到后边这个左脚就不见了，这个事情是很多其他的这个视频模型经常爱干的事情。但是Midjourney至少让我去打分的这些，它生成的视频没有这种情况。它的逻辑自下性做的很好，稳定性做的非常好。而且呢，秉承了Midjourney一贯的传统，它的感染力和传播力都极强。</p>



<p class="wp-block-paragraph">现在的Midjourney呢，就头疼一件事，就是到底怎么收费。收完费以后必须一保持盈利，我不能亏钱。</p>



<p class="wp-block-paragraph">好，总结一下吧。迪士尼跟环球起诉Midjourney，是一个标志性的案件，是第一次影视巨头起诉AICC公司。大家都在擦边，只是程度不同。环球和迪士尼，他不去起诉OpenAI，不去起诉谷歌，不去起诉马斯克，估计也是惦记要这个Midjourney的股权。你像OpenAI，3,000亿美金了，你能要回多少股权来？你要不回来多少，而且人家有可能跟你死磕。但是Midjourney这样的公司，其实还是比较好欺负的。最终的结果可能就是Midjourney会出一定的股权，最后呢皆大欢喜。</p>



<p class="wp-block-paragraph">等过几天Midjourney出了视频功能以后，我大概率会去升级套餐吧。好，这就是今天咱们讲的环球迪士尼起诉Midjourney的故事。感谢大家收听，请帮忙点赞、点小铃铛，参加DISCORD讨论群。</p>



<p class="wp-block-paragraph">也欢迎有兴趣、有能力的朋友加入我们的付费频道。再见。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>设计师的未来已来？Lovart垂直AI Agent震撼体验，从Midjourney到多模型协作，揭秘AI如何颠覆传统设计流程与商业模式。</title>
		<link>https://lukefan.com/2025/06/01/%e8%ae%be%e8%ae%a1%e5%b8%88%e7%9a%84%e6%9c%aa%e6%9d%a5%e5%b7%b2%e6%9d%a5%ef%bc%9flovart%e5%9e%82%e7%9b%b4ai-agent%e9%9c%87%e6%92%bc%e4%bd%93%e9%aa%8c%ef%bc%8c%e4%bb%8emidjourney%e5%88%b0%e5%a4%9a/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 01 Jun 2025 00:41:19 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI Agent]]></category>
		<category><![CDATA[AI 数字人]]></category>
		<category><![CDATA[AIGC (AI生成内容)]]></category>
		<category><![CDATA[AI产品分析]]></category>
		<category><![CDATA[AI创业]]></category>
		<category><![CDATA[AI动画]]></category>
		<category><![CDATA[AI发展趋势]]></category>
		<category><![CDATA[AI商业模式]]></category>
		<category><![CDATA[AI工具测评]]></category>
		<category><![CDATA[AI教程]]></category>
		<category><![CDATA[AI模型聚合]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI视频生成]]></category>
		<category><![CDATA[AI设计]]></category>
		<category><![CDATA[AI赋能设计]]></category>
		<category><![CDATA[Canva]]></category>
		<category><![CDATA[ComfyUI]]></category>
		<category><![CDATA[Demo演示]]></category>
		<category><![CDATA[Flex]]></category>
		<category><![CDATA[Google Imagine]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[LibLib AI]]></category>
		<category><![CDATA[Lovart]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[Photoshop]]></category>
		<category><![CDATA[stable diffusion]]></category>
		<category><![CDATA[YouTube封面]]></category>
		<category><![CDATA[YouTube封面设计]]></category>
		<category><![CDATA[产品体验]]></category>
		<category><![CDATA[剪映]]></category>
		<category><![CDATA[剪映 (CapCut)]]></category>
		<category><![CDATA[可灵]]></category>
		<category><![CDATA[可灵 (Keling)]]></category>
		<category><![CDATA[垂类Agent]]></category>
		<category><![CDATA[多模态AI]]></category>
		<category><![CDATA[工作流自动化]]></category>
		<category><![CDATA[提示词工程]]></category>
		<category><![CDATA[泛Agent]]></category>
		<category><![CDATA[泡泡玛特风格]]></category>
		<category><![CDATA[科技评论]]></category>
		<category><![CDATA[老范讲故事]]></category>
		<category><![CDATA[设计师]]></category>
		<category><![CDATA[设计师AI]]></category>
		<category><![CDATA[设计师失业]]></category>
		<category><![CDATA[设计师就业]]></category>
		<category><![CDATA[陈冕]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=2245</guid>

					<description><![CDATA[**设计师要失业了？Lovart这个AI神器真的好用到哭！😱**

啊啊啊啊啊！家人们，我今天必须和你们分享一个炸裂的东西——Lovart！这是一个专门为设计师打造的垂直AI Agent，简直是设计界的“救命神器”！我试用了一下，真的好用到哭，设计师们可能要慌了，小白们却要起飞了！😭

先说最震撼的点：你根本不需要啥设计基础，随便提个需求，比如“给我设计个YouTube封面，16:9比例，皮克斯风格，还要加字”，Lovart就能自动规划路径，调用各种模型（Flux、GPT Image啥的），直接给你生成成品！从图片到视频，从配乐到文字排版，一次搞定！我一个程序直男都能做出有点美感的东西，设计师们是不是要瑟瑟发抖了？😱

再说几个绝绝子的功能：
1. **超智能规划**：它会自己推理怎么做最好，调啥模型，咋排版，省心到爆！
2. **多模型组合**：集合了各种牛逼模型，生成效果吊打单一工具，细节控福音！
3. **一键出成品**：不管是海报、封面还是短视频，提需求就完事，效率直接拉满！

老实说，我用完Lovart的第一感觉就是：设计门槛真的被拉低了！以前做个封面要抠图、拼字、调色，费时费力，现在一句话的事儿，5秒出图不是梦！但也有点小遗憾，比如偶尔比例不对，文字会出错，不过瑕不掩瑜，整体效果还是让我破防了！😭

家人们，不管你是设计师还是小白，这个工具都值得一试！Lovart现在需要邀请码才能用，我已经在视频简介里放了3个，先到先得啊！没抢到的也别急，评论区见，咱们一起分享资源！真的不允许有人不知道Lovart，冲去试试吧，绝对会刷新你的认知！🔥

设计师的未来已来？Lovart垂直AI Agent震撼体验，从Midjourney到多模型协作，揭秘AI如何颠覆传统设计流程与商业模式。

设计师的未来是否会被AI改写？本文深入探讨了现象级产品Lovart——一款专为设计师打造的垂直AI Agent。我们将揭示Lovart如何超越Midjourney等单一模型，通过整合GPT、可灵视频生成及多种AI工具，实现从创意构思到多图层编辑、视频生成的一站式智能设计流程。文章同时分析了垂直AI Agent（如Lovart和AI编程的Cursor）相较于泛AI Agent的独特优势、面临的成本挑战，以及中国团队在AI创业浪潮中（如Lab Lab AI的探索）的机遇。这对于理解AI设计趋势和优化SEO内容策略至关重要。]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="设计师的未来已来？Lovart垂直AI Agent震撼体验，从Midjourney到多模型协作，揭秘AI如何颠覆传统设计流程与商业模式。" width="900" height="506" src="https://www.youtube.com/embed/g_0tRfhUEkk?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">设计师这次是不是真的要失业了？咱们从Lovart这个为设计师专门设计的垂直agent来看看AI agent在垂直品类里的一些玩法儿。</p>



<p class="wp-block-paragraph">大家好，欢迎收听老范讲故事的YouTube频道。Lovart又一个现象级产品出来了，设计师专用的一个垂直agent。它呢没有Manus当时引起的那么大的动静，但是呢，我用了一下，感觉比Manus这种泛agent还是要好用一些。</p>



<p class="wp-block-paragraph">什么叫泛agent？就是它啥都能干。Lovart这种能够专门为设计师工作的agent呢，它就是垂类agent，它其它事干不了。你说你给我去写个文章，给我去做个总结，这它干不了。但是你说你给我画个画，做个视频，设计一个PPT，设计个海报，做的可好了。他们设计的产品在x上被马斯克亲自点赞。因为这种设计类产品嘛，一个图片什么的，你要设计的非常好的话，确实会引起大佬点赞。很多的使用者也是惊为天人，我去使了一下，确实是很神奇，能够解决非常多的问题。</p>



<span id="more-2245"></span>



<p class="wp-block-paragraph">什么叫设计师垂直agent？大家知道AI agent它可以自我规划，可以调用各种工具，然后完成一个完整的工作。最早的这种AI agent就是从生成图片开始的，Midjourney现在的话应该是Google imagine 4 GPT image，stable diffusion Flex这样的直接生图片的模型还是有很多的，最早也是从这开始。但是这个东西有一个很大的问题是什么？就是很难控制。你说我希望有稳定性，我每一次生成的这个人都要长成一样，我希望写字写对。即使是现在写字写的比较好的，比如说像吉梦模型或者是PPT的模型，但也经常还是会写错。所以我们使用这些模型的时候，经常的工作流程是什么样的呢？先画，画完了以后呢抠图，再到一些像Photoshop或者像我用Canva这种可画的平台里边儿再去拼，然后再把这个人把字儿重新拼在一起。既然这个流程已经确定了，找个agent把它整个儿都串起来，不就完事儿了吗？</p>



<p class="wp-block-paragraph">再往后发展呢，就是一些可以进行串联，或者说进行一些工作流设定的一些产品。比如说像设计圈里的Confy UI这样的一些产品，你可以把这个工作流画好，它就按照这个工作流整个跑一圈下来。文字生成里头呢，用的像Defi code这种其实也是这种工作流设计软件。现在新的时代到来了，就是自我规划的agent。比如说像文档，各种的deep search。</p>



<p class="wp-block-paragraph">Deep research这样的东西，你给他提出问题，剩下的该去查哪些网站、该怎么总结、该怎么去分析、如何去校对、如何减少幻觉、如何去把结果做得更漂亮，人家一次搞定。现在就是新的Agent的时代已经到来了。</p>



<p class="wp-block-paragraph">这个为设计师工作的Agent呢，也走到了这一步。从最早的单模型Midjourney，到Confy UI这样的工作流设计的流程，到最后说干脆我一次给你搞定。现在Lovear就是这样的一个产品。</p>



<p class="wp-block-paragraph">它呢，把一大堆的模型放在里头，比如说Flex、Google Imagine 4、PPT Image、Flex这些都放进去。这个里头没有Midjourney，Midjourney那个东西不是特别好控制。然后把音乐和音效生成搁里头，你说我最后要出视频，那我需要给你配乐都有，包括一些TTS的阅读也都放在里头，就是数字人的这种也都搁在里头。</p>



<p class="wp-block-paragraph">视频生成模型，他掉的是可灵1.6，是快手做的视频生成模型，效果也还可以。我已经把模型搁这了，下一件事就是提要求就完了。你说我今天想要一个YouTube的封面，或者我想要YouTube里边的一个小的动画，你提要求就完了。</p>



<p class="wp-block-paragraph">剩下的这个Lovart就自动地规划路径，还去调用一些推理的模型，比如说GPT O3这样的模型。它推理一下说，我到底怎么把这个路径规划得更好呢？再调用刚才我们讲的Flex呀、GPT Image呀、谷歌的Imagine，然后生成音乐，生成视频，配在一起。</p>



<p class="wp-block-paragraph">最终呢，完成一个相对比较复杂的任务。而且还有很多Photoshop呀，或者Canva一些功能也搁在里头。这什么功能呢？就是图层。你说我现在要求在哪个图层上干哪些活，要求在什么地方写什么字，他就直接给你写就完了。不要让这个大模型再去费劲给你拼字去了，反正他也拼不对，咱们就别费这个劲了。</p>



<p class="wp-block-paragraph">所以这个就是一个很完整的设计流程，一次搞定。真的是一个中国团队的产品，虽然这个团队在硅谷，但是呢，确确实实是个中国团队。他们最上面的一个公司呢叫Lab Lab AI。</p>



<p class="wp-block-paragraph">这个Lab Lab AI呢，是中国最活跃的Stable Diffusion的社区。他们干嘛呢？就是把大量的Stable Diffusion上用到的Laura的这种微调的模型，都放在这展示。展示完了以后呢，我们去交换这些训练出来的这种微调模型就可以了。也有一定的商业模式，但是呢，发展的不是特别好吧，虽然很活跃。因为大家最后还是要去看说……</p>



<p class="wp-block-paragraph">是不是能够形成正向的商业模式？好在是中国在做这个电商，做这个各种网红经济。在这一块，需要的设计师的量非常大，或者说设计师工作非常多。所以呢，他们也还是在运转。前面融资呢，也融了一些。后面呢，是找了一个很著名的创业者，开了美国的分公司。所以呢，Lovart这个产品是lablab.AI美国分公司做的。他们找的这个创业者，就是Lovart的创始人和CEO呢，叫陈冕，官冕的冕。他呢，是摩拜单车的产品总监。离开摩拜单车以后呢，是剪映和Capcat的全球商业化负责人。2024年离开剪映跑来去创业，做了一个叫Lovart的一个产品，做的还是相当不错的。</p>



<p class="wp-block-paragraph">口说无凭，咱们来看Demo，看看我用这玩意干了些什么。这就是Lovart的首页。这个设计师做的页面确实是好看，比我们这些程序员直男做的东西要好看多了。这个它的页面就是lovart点ai。现在很多都是AI开始的域名。想要玩这个东西，要有一个邀请码，或者是加入等待链接。我是加入waiting list，等了一周左右得到的邀请码。我现在还有3个邀请码。get start就进来。我会把三个邀请码放在视频的简介里。如果大家想要去玩的话就拿三个邀请码去用啊。但是因为是会员先看到，所以可能公布到公众频道的时候，这个邀请码就已经用完了啊。也欢迎大家拿到新的邀请码以后，分享到我的评论区里头。</p>



<p class="wp-block-paragraph">大家看到我现在已经没钱了，已经把所有的信用点都花光了。一共上来是给了1,000点。他是拿到邀请码给500点，每个月给500点。我要想再画要等下个月了。好，跟大家看一下他的一些干的活。这个就是我用了1,000点得到的这个结果。上来，请设计YouTube 16:9的封面视频。封面频道名是老范讲故事。视频题目是老范读评。这是每周三晚上8点的直播节目，读一周的观众评论。加上以我照片生成的皮克斯3D风格的角色设计。这是我写的提示词，给了一张照片，他就干活去了。说我先想想，我先思考一下这个活要怎么干，分析一下。说我应该是一个什么样的照片。可能呢，调的是GPT O3做的图像推理。推理完了以后再去调用这个知识库。我有哪些知识，是吧？这是一个哪样的一个设计建议啊？要用GPT image，要用这东西来去做皮克斯3D风格的角色，再加上这些文字要求，画到16：9的横纵比。结束了。这个是他做的一个规划。再去说，我这是一个创意了，我要去创意了。</p>



<p class="wp-block-paragraph">这个皮克斯3D的东西应该怎么做？自己夸夸夸想去了。“老范读屏”这几个字55%高，要写在什么地方？周三，呃，20点直播，要写在一个什么样的字体？写在哪儿？底下，右下角要写“老范讲故事”。背景应该是一个橙金色的渐变色，而且是有一些什么样的要求？他就一个一个的去给你做去了。然后颜色，主颜色是什么？高亮颜色是什么？你做了一堆这样的要求。原型，一个什么样的东西啊？要写中文，要什么sans，应该是宋体，大概是写黑的。自己去研究了半天，就开始创建图片，干活去了，得到了这个图。现在不知道为什么他把这个大的删了，肯定还是成本问题。让我们来看一下图，就给你画成了这样的一个东西。这个还是很可爱的。“这个老范讲故事”这个“事”字写得稍微有些问题啊。“周三20:00直播”是“老范读评”。大家发现这东西有问题了没有？除了这个“故事”的“事”字写错了之外，还有问题。哪有问题？他不是16:9的，他是3:2的。它这个图的分辨率是1,500*1,000，实际上是3:2。为什么会成这样呢？因为它最后的这个背景图是拿GPT生成的，GPT到头就是3:2，再大的横纵比做不出来了。这是GPT的一个bug。也有问题，这个说你生成的是3:2的，不是16:9的。这是GPT 4o的一个bug，只能出3:2。我理解了，这个有个问题，让我再去做16:9。反正做了半天，他又做了个3:2的图出来，稍微改了改，大概是长成这样了。这个反正能使呗，到时候我再把这个脑袋抠下来，再把这字抠下来，回头下个礼拜读屏的时候，咱就用一次啊。反正也是挺好玩的，一个图就做出来了。但是大家看到的是什么？一句话，我真的是写了一句话，他就做了一个基本凑合还能使的东西。这就是这句话。你说设计师是不是要失业？你像我就是个写程序的直男，我就可以做到这样的结果了。设计师就会稍微有一点点痛苦了。他们的设计的一致性，这种反正我觉得还是有点美感的，设计出来还是可以用的。你看这个胖子还是有点点可爱的嘛，笑得多喜庆。好，咱们再看另外一个demo。这个demo是我让他去画，画视频去了，因为这东西是可以直接出视频的。看，我也是给了一张自己的美照，说：“给我一段视频，YouTube求点赞、关注、点击小铃铛的，用我的形象，生成泡泡玛特风格的人物形象，求点赞、求关注、求小铃当，时长5秒，绿色背景，方便抠图，统一用泡泡玛特可爱风格。”他就又想去了。这次他是使用了Flux，用了这个模型去生成的。这个像吗？</p>



<p class="wp-block-paragraph">反正泡沫马特风格，大头，而且是这个。大家看这个塑料材质，至于像不像我，这个事就无所谓了，这个不重要。画成这样了，我也不好意思说它像我了。</p>



<p class="wp-block-paragraph">调用可灵的视频生成，生成了5秒视频。你看，这个就是5秒视频，他就生成声音去了。这个声音其实做的很烂：“like subscribe and click the notification bell”。你看这是点赞、呃订阅、点击这个提醒的小铃铛，大概讲了这么一句话。把这俩东西给我拼一块吧：“like subscribe and click the notification bell”。我觉得不是特别满意，我说啊，别说话了，这个说的太难听了。</p>



<p class="wp-block-paragraph">配音效加上3D的泡泡玛特风格的点赞，大拇哥的订阅小铃铛换成16:9的，人物要戴上眼镜。他又思考干活去了。这回呢，人戴眼镜了，这没毛病。给我生成了个音乐，这个是成出来的，它里头是有音乐生成的，大模型的，生成了一个视频。这次呢，有小铃铛，但是他这个小铃铛画的就很怪，他没法理解什么是点赞。这个看来可灵在这块还是稍微差一点点，5秒钟搞定。</p>



<p class="wp-block-paragraph">我说这个做订阅的和小铃铛，这个点赞的3D形象太奇怪了，看不出来是做什么的。去网上搜索一下，它是可以搜索的，这个Agent可以搜索。而且也别来音乐了，改音效：鼠标点击声、气泡破裂声和铃音，给我改三个音效出来。他首先出去搜索了一堆，说这个是该干的，但是他并没有把它做得很漂亮。自己想了半天，又给我生成个头像，这样的头像。这次，他给你整了段音乐回来，说我来给你生成。你说他搜索了一大堆，你不知道他怎么想的，说我给你变成这样的点赞和订阅了。有的时候确实比较难以理解，让他自己配了段音乐给我加上了。不对，16:9你也没做出来呀，对吧？</p>



<p class="wp-block-paragraph">我再接着提要求，我说这个按钮用这套，我干脆在网上搜了一套。其实刚才自己也搜出来了，用这套：订阅、点赞、评论、转发、小铃铛。静音，别给我配音乐了，后边我自己去配声音就完事了。把视频延长到8秒，但这个后来发现失败了，可灵最多也就是5秒，做不出8秒的来。他先分析一下，因为GPT-o3是可以进行图像推理的，他把我给他那张图片整个分析了一下，说没毛病。又生成了个头像，这次这个头发稍微长一点点，还是戴着眼镜的。说来给我生成，不知道他是为什么，整成这样了，就完全乱掉。呃我觉得已经可以用啊，怎么用啊？把这三个位置给它替换了就完，还是在剪映里，已经可以干活了，再生成。</p>



<p class="wp-block-paragraph">他说：“我再稍微调整了一下，又换了一种。这次是生成四个小格了，这是四个小头像。到时候我到剪映里头，可以把这四个小头像换成点赞、小铃铛和叫做订阅，还有其他的，比如说评论啊，你就可以来做这个事。到时候自己去替换就好。”</p>



<p class="wp-block-paragraph">他说：“我现在要去给你做8秒了，但是大家看下头，还是5秒，也就如此了。”他又给你稍微的细化了一下，各种生成。到这儿生成完了以后，又生成了一个版本。他说：“我给你做成这样了。”到这个版本生成完了，我就已经把这个给的1,000点就耗光了，就到这里就使完了。说：“你现在该交费了是吧？不交费不让使了。”</p>



<p class="wp-block-paragraph">那么我们来看一下它的收费标准。这是零点儿，点击upgrade，这里就是收费标准了。我现在是0，它等于是上来给了500个信用点，有500个额外的限时的bonus，我就得到了这样的一个东西。下个月是不是还有啊？这个就不确定了，他反正没有写清楚。这个看吧，反正我现在把它使完了，是10个agent、125个GPT的图像生成、2,000个Flux图像生成、28个可灵的视频生成。我肯定没用到这么多，但是我确实把1,000点使完了。有限的模型使用，就是这个规则。</p>



<p class="wp-block-paragraph">19美金一个月呢，是2,000点，每个月2,000点，再单独给2,000点。在第一个月单独给2,000点，就是你交了19美金就得到4,000点，下个月补2,000点。他是这样来工作的：40个agent、500幅GPT的生成、8,000幅Flux生成、111个可零的生成，无限的模型使用。这是可以有商业的license。你像我刚才这个就没有商业license，就是我生成的这些内容是不可以做商业使用的。那我交了钱以后，就可以去做商业使用了。当然还有更贵的了，这个收费标准我就不去评价。</p>



<p class="wp-block-paragraph">Demo看完了，后边我们来讲一讲这种垂类的agent到底是不是一个方向的问题。现在呢，所有的泛agent的这种效果其实都差强人意。虽然我们使用文档、使用COS空间这样的这种泛agent，或者是grok的这种deep search、Deep research或者Deeper research，所有这些东西你都搁一块儿去使，你发现什么呢？就是你让他们去进行信息收集和总结的时候呢，效果还行，但是有的时候幻觉也是很厉害的。因为我被这玩意坑过好多次，生成的结果呢总是不是那么满意。而且像这种东西，你一开始提出任务，后边他就吭哧吭哧干去了嘛，而且干还干很长时间。</p>



<p class="wp-block-paragraph">经常是干20分钟，你想在中间打断他，想在中间去补充一些信息，想在中间让他去调整个方向的话，没有办法。你必须让他把它干完了以后才能去调整，所以效果并没有那么好。虽然有很多人说：“你看我们给你一个什么筛选简历，给你一个什么样的案例，效果好极了。”但是这可能就是他们一开始设计的几个案例，就比较适合干这个事。大量的这种案例效果并没有那么好。</p>



<p class="wp-block-paragraph">因为我现在是每天把各种的AI agent都跑起来，让每一家都给我去收集一遍，结果再去做比对，发现也还是挺累的。为什么？因为这东西话痨。就是你让他去收集了一堆信息了以后，啰里八嗦讲一大堆，而且经常里头是错的。你说你给我按照一个比较好看的方式给我展现出来，这个效果呢也就都将就吧，反正能算是有一点点设计，但是还是挺难看的。所以呢，这种泛agent效果真的不怎么样。</p>



<p class="wp-block-paragraph">而且现在这些泛agent还面临着什么呢？就是这些模型厂商直接自己上各种深度研究、深度搜索的这种功能，直接把它覆盖掉了。你跟这些玩意比，你没什么优势，因为毕竟人家是模型厂商，对于模型更加了解。你在外面去做这种修修补补的事情，效果并没有那么好。你想说我出一个单独的这种视觉效果，或者出一个网页表现什么的，这块也都差强人意。毕竟咱们原来讲的叫模型及应用，谁做了模型谁就有应用。OpenAI、XAI、谷歌都在不断的去侵袭这些泛agent的这种领地，所以他们的日子其实并不好过。</p>



<p class="wp-block-paragraph">那垂类的agent到底是不是可以逃脱被覆盖的命运呢？原来我们都讲说，ChatGPT更新了升级了，一堆人失业了，一堆创业项目死了。但是呢，垂类的agent会稍微好那么一点点。垂类agent干嘛？第一个就是专属知识库。我把一些特定的知识库专门总结出来，让他可以在里边去做RAG。就是我们通过一些特定知识库在里边去搜索，会得到更准确、更符合这个行业要求的结果，这是一方面。</p>



<p class="wp-block-paragraph">第二个呢就是专属的提示词库，或者是干脆训练小模型。你可以让agent的规划做得更好。咱们以今天讲的这个Livechat来为例，他就完全可以做一个专门的提示词库。我就告诉大家说，咱们是如果是做哪些事情的话，应该先调用哪个模型，再调用哪个模型，哪个模型的这个提示词应该如何去写。这些东西是一堆设计师在里边去做的，他按照设计师自己的这个工作流程去给你设计这些提示词库。这个效果还是比这种你直接告诉一个ChatGPT，说来去给我设计提示词去吧。</p>



<p class="wp-block-paragraph">给我设计流程去吧，要比这个效果要好。毕竟是真人有工作经验。在这里有些说，我需要大量的出这种规划，就是这种流程。规划的时候干脆就设计个小模型，你拿这些小模型直接出设计规划，效果会非常好的。</p>



<p class="wp-block-paragraph">那么多公司的模型配合工作的，也是这种垂类agent的一个特性。因为刚才我们讲的就是大模型公司，想去覆盖这种泛agent的市场，它一定是什么？就只能调自己家的模型。openAI说我想去调谷歌的Gemini，这肯定搞不定，因为openAI它自己也不会干这个活。谷歌说想去调XAI的grok也不行。但是这些agent公司它是可以的，它是中立的。我可以把一大堆的模型串在一起，让各自干各自最擅长的事情。他这块还是有一定优势的。</p>



<p class="wp-block-paragraph">特别是在做图像生成的时候，现在图像生成这个领域，还不像是比如说代码生成，或者文字生成。那些领域里头大家在你追我赶，而且跑得很快，相互之间也没有说谁会绝对领先，或者在哪一个领域里头特别的领先，其他人无可替代。所以你并不需要说，我把所有的模型都跑通，才得到一个最好的结果。都用openAI的也可以得到很好的结果，都用谷歌的也可以得到很好的结果。</p>



<p class="wp-block-paragraph">但是图形这块儿不一样，midjourney、GPT、谷歌、Flex、stable diffusion各有各的长处。每一个模型有自己能够干的最好的这个事情。它把这些东西串在一起，能够去形成一个完整的agent流程的话，确实是可以解决很多用单一公司产品解决不了的问题。所以呢，这种垂类的，特别是像画图这样的这种工作，它的这种a站的产品，是有一些护城河的。它的护城河要比刚才我们讲的那种泛agent的要强一些。</p>



<p class="wp-block-paragraph">其实有一个这种垂类agent的典型案例，到目前为止还是跑得非常快。这个典型案例叫cursor，就是AI编程现在跑得最快的。它真正强的地方不是它里头使用的cloud 3.7、cloud 4这些模型，它真正强的地方是它整个有一整套的符合程序员工作流程的提示词库，自己也训练了一些小的模型去配合各个模型在里边去工作。所以这种垂类agent确实是有机会的。</p>



<p class="wp-block-paragraph">但是垂类agent的日子也没有那么好过。为什么这么讲？垂类用户，你既然叫垂直了，潜台词是什么？一定少嘛。你说我是泛agent，我什么都能干，那一定是很多的用户都有需求。你说我就是做设计的，那你说我没有设计需求，那肯定不是你的用户。所以它的用户量比较少，成本很高。</p>



<p class="wp-block-paragraph">因为你调用的模型都是别人家的，像刚才我们讲的Lovart这种。你看看他这个收费标准你就知道了，他的不同的套餐收费标准里头，代表的是不同模型调用的次数。你像我现在已经把我的所有送的点都用光了，所以他的成本是非常非常难控制的，因为所有都在外边，也没法随随便便做补贴。烧钱他也烧不起，因为做这种特别是设计类的、多模态生成类的，这种模型本身对算力要求都非常高，必须要玩付费转化率。不付钱没法整，因为你没有办法说我大量免费，不停的吸引新用户进来转换，你必须要付费。那么它的启动就会比较难，它的收费规则制定也很复杂，因为你调用这么多家的模型，各家都有优惠，有什么其他的一些收费标准。你要把所有这些收费标准融合在一起，然后放到你这个整体的收费标准里头去，这个事也比较麻烦。</p>



<p class="wp-block-paragraph">而且呢，他们还有一个成本非常高的地方在哪？他的研发成本也很高。你说这帮人都不去做自己的大模型，都调别人的模型，就是一帮写提示词的，他为什么研发成本高？他们需要干一个特别恶心的事情，叫跟模型。原来我们叫跟核，以前我们做，比如说浏览器底下是Chrome的核，我们需要去跟这个核。现在我们跟这么多的大模型一起打交道，这些模型每天在这升级，你就需要跟所有的模型。这两天比如说Flex新出了一个版本，叫K O N T E X T，可以实现一致性提升。而且他那个一致性提升，非常非常多的细节是掌握的更好。你现在想要把它用上，就要赶快派人去做研究，做研发，这个是非常非常累的。</p>



<p class="wp-block-paragraph">原来我在Borland做Jbuilder的时候，也是这块儿非常累。为什么？因为当时我们需要去应对各种各样的j2ee的中间件，weblogic的、Oracle的、IBM的，还有Borland的自己的VC broker。这些东西他每天都在升级，那你升级了以后，谁升级了你都得跟着升级，要不然的话你没法支持最新的版本。他这个就很累，你等于非常多的研发成本要在里头，而且最后卖钱，你可能还卖不出这么多来。所以对于这种做垂类的agent的人，这一块的研发成本还是非常高的，而且是个辛苦钱。</p>



<p class="wp-block-paragraph">还有一个比较讨厌的什么？就是烧钱。跟所有大厂比起来，他们都烧不过人家，所以这一块也是很麻烦。最后一点，如果做大了，容易被大厂惦记上。比如说现在编程这一块儿的垂类agent，windsuf已经被OpenAI收了，cursor现在长得很大，那微软说那我收拾收拾你吧。</p>



<p class="wp-block-paragraph">GitHub Copilot直接集成到VS Code里头，而且GitHub Copilot直接把Agent的功能全加进去。我就要把你挤死，这个对于Cursor来说，也是有很大的这种压力的。而且其他的大厂，比如说像字节跳动出Trae，阿里也出了0码IDE，就是把它原来的编程插件直接集成到IDE里头来。那这一块的话，对于这些做AI Agent的厂商来说的话，也算是个幸福的烦恼。</p>



<p class="wp-block-paragraph">什么叫幸福的烦恼？你做的小没人理你，做大了才有人去理你。</p>



<p class="wp-block-paragraph">最后咱总结一下，垂类Agent其实就有点像中国人的移动APP。为什么是中国人的移动APP？移动APP这个市场里头，大量的排在靠前面的都是中国人做的。为什么呢？就是我们喜欢干这种工匠精神的事，叫知其然而不知其所以然。我也不去研究背后为什么，我就在前头去修修补补，去绣花。甭管是跟核也好，还是跟模型也好，做这个辛苦活，这个事是中国人擅长的。所以，干脆咱就拼勤奋，拼细节得了。</p>



<p class="wp-block-paragraph">你说我吭哧瘪肚0-1去训练大模型，这事我们搞不定，而且现在芯片还不是那么好使。干脆你们都去训练大模型，我来想办法把这些模型凑在一块，解决一些实际问题。这一块确确实实是中国人比较擅长的。太多大厂懒得做，或者无法投入很多资源去做的领域里头，中国人就可以在里边找到机会。在某一些垂类领域里头，就可以做出一些有趣的产品来。</p>



<p class="wp-block-paragraph">很多方向的机会，做这种垂类Agent的机会，就跟做APP差不多。举几个例子，比如说Keep这样的健身APP。你说我现在直接给你做成垂类Agent行不行？没有任何问题。营养师的健身教程，再加上训练私有的这种小模型，或者说我去做健身相关信息的这种垂类知识库，把这些东西搁在一起，再去做一些健身课程的规划和设计，健身数据的输入，再拿这个东西进行一对一的去指导。</p>



<p class="wp-block-paragraph">或者是一些教学类的垂类Agent，比如学英语的，或者是学一些其他课程那种垂类Agent，都是可以做得出来的。或者是旅游行程规划。我最近因为有无人机了，老惦记出去玩儿去，那我就得用各种的泛Agent去测规划，发现巨难使。</p>



<p class="wp-block-paragraph">我说我现在想规划一个从哪哪出发，到什么什么地方去，到那个地方怎么去玩，怎么去停车，怎么去充电，哪个地方是拍照打卡点，哪个地方是无人机的摄影打卡点，那有什么吃的什么玩的，有什么样的历史古迹，有什么故事，你去给我总结一下。每一次都啰里八嗦，给我整一个几万字的小作文。</p>



<p class="wp-block-paragraph">弄完了，我连看都懒得看。看完了以后，发现也没有任何直接执行的可能性。为啥？因为写的非常多的东西都是错的。</p>



<p class="wp-block-paragraph">如果这个东西你把它专门规划好了，做成一个agent，那肯定有人愿意用。或者拿机加酒挣钱就完了，就是买机票和酒店去挣钱，这个都是很好的创业方向。</p>



<p class="wp-block-paragraph">医疗陪诊：我今天想去看个病，那你是不是可以调用各种医疗系统，帮我去挂号，帮我去选大夫，帮我去处理各种各样的检查结果？这个事是不是OK？</p>



<p class="wp-block-paragraph">包括视频剪辑：Lovart的创始人叫陈冕，原来是剪映的。现在剪映也准备专门出垂类agent，叫百灵鸟还是叫什么，现在可能在安卓平台上在做，等他出呗。你像我们每次剪辑视频也可麻烦了，美颜一下，调个颜色，然后做音频的处理，这些东西直接上agent不就完事了吗？做一个垂类agent，这块可能在今年就可以看到。</p>



<p class="wp-block-paragraph">而且在这块，剪映也好、快手也好，可能都会往前冲。因为剪映后边有吉梦，快手后边有可灵，他们自己这样的模型就已经做得很好。所以他们很有可能说，我把自己的剪映客户、快手客户，加上自己的这些模型，拼出一些垂类agent来，那这块也是可以期待一下的。</p>



<p class="wp-block-paragraph">但这个大家就可能做的时候稍微小心一点。你跟剪映这种公司碰上，或者跟字节跳动这种公司碰上，比较痛苦。多选一些其他的品类，大家就可以在这儿去思考说，我这个行业里头，是不是有机会做一些垂类的agent出来，做一些有趣的、有价值的产品出来。虽然用户量不大，但是大家愿意付钱，让整个商业模式可以跑通。</p>



<p class="wp-block-paragraph">这就是今天我们要讲的故事。感谢大家收听，请帮忙点赞、点小铃铛，参加Disco讨论群。也欢迎有兴趣、有能力的朋友，加入我们的付费频道。再见！</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>老范的绘画技巧大揭秘，DeepSeek-R1推理，助力MidJourney成为情感放大器，尽情享受AI带来的情绪价值大放送。</title>
		<link>https://lukefan.com/2025/03/09/%e8%80%81%e8%8c%83%e7%9a%84%e7%bb%98%e7%94%bb%e6%8a%80%e5%b7%a7%e5%a4%a7%e6%8f%ad%e7%a7%98%ef%bc%8cdeepseek-r1%e6%8e%a8%e7%90%86%ef%bc%8c%e5%8a%a9%e5%8a%9bmidjourney%e6%88%90%e4%b8%ba%e6%83%85/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Sun, 09 Mar 2025 00:43:16 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[AI创作自动化]]></category>
		<category><![CDATA[AI提示词技巧]]></category>
		<category><![CDATA[AI提示词生成]]></category>
		<category><![CDATA[AI画图技巧]]></category>
		<category><![CDATA[AI绘图入门]]></category>
		<category><![CDATA[AI绘图平台]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[AI绘画参数调整]]></category>
		<category><![CDATA[AI绘画图像优化]]></category>
		<category><![CDATA[AI绘画工具对比]]></category>
		<category><![CDATA[AI绘画平台推荐]]></category>
		<category><![CDATA[AI绘画风格设定]]></category>
		<category><![CDATA[AI绘画高级技巧]]></category>
		<category><![CDATA[AI艺术创作]]></category>
		<category><![CDATA[AI艺术情感传递]]></category>
		<category><![CDATA[AI艺术案例]]></category>
		<category><![CDATA[AI艺术灵感]]></category>
		<category><![CDATA[AI艺术解析]]></category>
		<category><![CDATA[Cherry Studio使用]]></category>
		<category><![CDATA[Cherry Studio功能解析]]></category>
		<category><![CDATA[DeepSeek R1]]></category>
		<category><![CDATA[Midjourney vs Dalle]]></category>
		<category><![CDATA[Midjourney个性化设置]]></category>
		<category><![CDATA[Midjourney中文指南]]></category>
		<category><![CDATA[Midjourney会员功能]]></category>
		<category><![CDATA[Midjourney使用建议]]></category>
		<category><![CDATA[Midjourney创作]]></category>
		<category><![CDATA[Midjourney创作流程]]></category>
		<category><![CDATA[Midjourney参数设置]]></category>
		<category><![CDATA[Midjourney图像质量]]></category>
		<category><![CDATA[Midjourney实用技巧]]></category>
		<category><![CDATA[Midjourney小技巧]]></category>
		<category><![CDATA[Midjourney提示词]]></category>
		<category><![CDATA[Midjourney教程]]></category>
		<category><![CDATA[Midjourney案例分析]]></category>
		<category><![CDATA[Midjourney绘画优化]]></category>
		<category><![CDATA[Midjourney详细教程]]></category>
		<category><![CDATA[Midjourney风格选择]]></category>
		<category><![CDATA[人工智能艺术]]></category>
		<category><![CDATA[情感表达AI绘画]]></category>
		<category><![CDATA[提示词写法]]></category>
		<category><![CDATA[提示词生成工具]]></category>
		<category><![CDATA[生成艺术风格]]></category>
		<category><![CDATA[高分辨率AI绘画]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1971</guid>

					<description><![CDATA[**啊啊啊啊啊！AI绘画神器Midjourney，让你秒变艺术家！**

家人们！今天我真的要给你们分享一个宝藏神器——Midjourney！作为一个普通人，我以前总觉得绘画是遥不可及的技能，但自从用上了Midjourney，我真的感觉自己变成了艺术家！🎨

### 为什么选择Midjourney？
首先，Midjourney的操作超级简单，完全不用担心复杂的设置和参数调整。你只需要输入一些提示词，它就能生成一幅幅令人惊叹的作品！无论是宫崎骏风格还是漫威宇宙风格，Midjourney都能轻松搞定！✨

### 如何写提示词？
提示词的写法其实很简单，主要分为三部分：
1. **画面描述**：场景、主体、环境、细节，越详细越好。
2. **风格定义**：超写实、漫画、手绘，甚至色彩和光线的设置都可以自定义。
3. **参数设置**：比如横纵比、个性化风格、想象力程度等。

### 实际效果
我试着用Midjourney画了一张“褶皱的旧羊皮纸上，钢笔手绘海盗的藏宝图”，结果真的让我震惊了！骷髅标志、罗盘、沉船标记，甚至还有隐藏的密码信息和海洋怪物！这些细节完全超出了我的想象！真的是**好用哭了**！😭

### 总结
如果你也想体验AI绘画的神奇效果，强烈推荐你试试Midjourney！不管是自娱自乐还是专业创作，它都能满足你的需求。记住，**都给我冲**！别犹豫，赶紧去试试吧！🔥

**#Midjourney #AI绘画 #艺术创作 #宝藏工具 #小白必看**

老范的绘画技巧大揭秘，DeepSeek-R1推理，助力MidJourney成为情感放大器，尽情享受AI带来的情绪价值大放送。

在本篇文章中，老范通过详细讲解，带领大家了解如何用Midjourney和DeepSeek R1工具轻松创作出情感丰富的AI艺术图片。从AI绘画平台的选择、提示词的编写到最终图像的生成，文章全面解析了AI创作的全流程，特别是重点说明了Midjourney的三个提示词组成部分和相关参数设置技巧。通过实际案例示范，如“旧羊皮纸上海盗藏宝图”的生成过程，读者可以快速掌握使用Midjourney绘制图像的技巧。而对于高级技巧如提示词权重调整、个性化参数应用和区域重绘等，也通过浅显易懂的方式进行了说明。如果您对AI绘画感兴趣，想快速上手并创作出专业级的艺术作品，这篇文章绝对不可错过！]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="老范的绘画技巧大揭秘，DeepSeek-R1推理，助力MidJourney成为情感放大器，尽情享受AI带来的情绪价值大放送。" width="900" height="506" src="https://www.youtube.com/embed/vm3dXOj_ljo?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">今天，满足大家的要求，跟大家分享一下我的图片都是怎么画出来的。大家好，欢迎收听老范讲故事YouTube频道。今天，咱们来讲一讲AI艺术创作的全流程到底是什么样的。老范讲故事的很多图片，包括封面，包括我的很多背景，还有我去发推特或者是发到YouTube社区里边的这些图片，到底是怎么产生的？今天来跟大家好好的解析一下。</p>



<p class="wp-block-paragraph">今天的课程呢，一共是分为两个部分。第一部分呢是公众课程，第二部分呢应该是会员课程。第一部分就是告诉大家这画是怎么画出来的，AI绘画如何进行情感表达。第二部分呢，是自动化创作系统的搭建，就是我们要用AI IDE自己去写一个程序，然后让他可以自动完成所有相关的工作。但这部分的话，我们就不放在公众频道里了，因为课程可能会稍微的有些枯燥。最后呢，跟大家进行一下成果的总结和展望吧。</p>



<p class="wp-block-paragraph">首先，第一部分AI绘图的情感表达。我们做艺术创作的目的性，我们要把它解析一下。我为什么要干这个事？有人说我要卖钱，这个咱们不管。主要的目的是进行情感的传递。绘画呢，成为创作者与观众之间情感传递的一个重要桥梁。很多事情我说了半天，你可能没有什么感觉，但是我画了一幅画，哦，一下看懂了。这种情感就更容易在语言之外进行传播。</p>



<span id="more-1971"></span>



<p class="wp-block-paragraph">同时呢，还有一个很棒的作用是什么？就是进行情绪价值的放大。这是干嘛呢？很多人喜欢唱歌，喜欢绘画，喜欢表演乐器。他们在干嘛？他们在自娱自乐。通过唱歌、绘画和乐器表演的过程中，让自己内心中的情感得到了放大。在与这种放大之后的情感进行共鸣，得到更好的这种身心愉悦。所以呢，我们先不管说，我这个绘画的情感到底能不能传递给别人，首先我可以让自己开心起来。这是今天跟大家讲这个课的最核心的一个原因。</p>



<p class="wp-block-paragraph">同时，这些作品会有更好的传播性。我们发了个帖子，并不是说发完了以后不希望别人看到。如果那样你就干脆别发。我发了帖子还是希望别人看到。我原来可能只是写了一行字的东西，现在我配上一副图。</p>



<p class="wp-block-paragraph">{那么这个文字被更多的人可以看到，这也是一个很重要的目的。现在的主流AI绘画平台有哪些呢？最主要的其实就是Midjourney。今天我们也使用Midjourney来绘图。Midjourney在生成质量方面是非常高的，现在无出其右。跟其他的这些平台比，其实是更适合于普通人去使用的。你说：“哎，我希望使用一些更复杂的、更精确控制的这些平台，有没有？”有，但是呢，我自己都搞不太明白到底应该怎么装，怎么去设置它相关的参数，更不要说一些非程序员。这个是非常非常麻烦的一个过程。所以我们最简单的使用方式就是Midjourney开干。</p>



<p class="wp-block-paragraph">其他这些平台，比如Dalle，这是OpenAI的系统。他们到目前为止依然没有更新，还是Dalle3的一个水平，应该已经有两年没有更新了。它的特点就是画风比较粗糙，但是呢，文字理解能力非常强。因为OpenAI嘛，它后边是做语言模型的，它的文字理解能力要比Midjourney要好一些。一些工程师用的产品，像stable diffusion，这个公司叫stability，它这个产品叫stable diffusion。他离开的一些人做的，有一个产品叫Flux。现在我们用的Twitter上，在Grok上面去画图的，都是用的Flux。还有一些给大家提供绘图功能的这些平台的话，大多也都是用的Flux。这些呢，设置起来就要稍微麻烦一些，而且你可能还要自己训练和微调这种小模型才可以去使用。有一些工业上的人会使用这个东西，比如做游戏，或者做这种电商图案，他们会使用stability或者是Flux的产品。但是我们普通人自娱自乐一下，不建议使用。</p>



<p class="wp-block-paragraph">国内的一些平台，比如抖音的呀，或者是阿里的呀，快手的这些平台呢，他们大多是在stability或者是Flux基础上改出来的。整个的使用方式跟他们比较相近，但是有一些比较有趣，比如说像吉梦，这是字节下边的这个平台，他们里头有一些模型。}</p>



<p class="wp-block-paragraph">是可以支持中文生成的。其他所有这些平台都是不支持中文生成的。我们今天主要就是使用Midjourney，它是普通人的工具，风格很多样。你告诉他说我要宫崎骏风格的、要漫威宇宙风格的，还是要什么风格的，他就都可以给你把它做出来。</p>



<p class="wp-block-paragraph">下一件事比较麻烦的是什么？就是写提示词了。Midjourney的提示词到底怎么写？Midjourney提示词呢，其实是分三个部分的。那你说我写一只猫、一只狗行不行？可以。那你就等着Midjourney给你去做想象，他画出什么样你就要什么样，就完事了。但是你稍稍微的精确控制一下，就要按照这三个部分来写。</p>



<p class="wp-block-paragraph">第一个部分呢，就是画面描述的精确。你要把它很精确的描述出来。而这个里头包括什么？场景：我在一个什么样的山上，在一个什么样的屋子里，而这叫场景。然后呢，是主体：我到底是画的一个人，还是画的一只猫、一只狗，要有一个主体。这个主体你看他给你一个例子：一名孤独的徒步旅行者，站在岩石峭壁上，这就是一个主体了。再往后呢，是环境：被雾蒙蒙的山谷和远处的白雪皑皑的山峰所环绕，这就是一个环境描述。以及呢细节：这个旅行者穿什么衣服，拿什么棍，或者是这个背什么包，这个就是一个画面的标准描述。但是你说我都需要这么描述才可以吗？不需要，待会这部分由理模型来搞定。但是我们最后交给Midjourney的，应该是长成这样的一个画面描述。</p>



<p class="wp-block-paragraph">除了画面描述之外呢，还有一些就是风格定义。比如说我这是一个超写实风格的，还是漫画风格的，还是手绘风格的，你要在这去写这个风格描述，去包括我到底用什么样的色彩。比如马卡龙色，这就是很鲜艳的那种色彩，或者是美拉德色系，那个就是棕色的，各种食物烧焦了以后的那种色系。你做很多的跟食物相关的，让人感觉比较有食欲，比较有烟火气的这样的图片，你就可以用这样的色系。然后光线是不是柔和呀，就都可以在这里去描述了。包括说我记住哪个艺术家的名字了，你也可以在这写。</p>



<p class="wp-block-paragraph">像刚才我们讲的宫崎骏，这些都可以写在这儿。继续呢是构图，你说我到底是一个广角拍摄呀，还是顶视角、俯视角，还是一个什么样的视角，这个是要在这里构图去解的。最后是这个质量，比如说是高分辨率的、低分辨率的，还是有没有噪点，你要在这里去描述它。这个是第二部分。</p>



<p class="wp-block-paragraph">第三部分呢，是Midjourney里有一大堆参数，一般会写在最后面。这个参数呢最简单的是AR，就是所有参数都是两个减号，后边带一些字母来去启动的。最简单的是AR，它是干嘛呢？就是算横纵比的。你说我是16:9的，9:16的，4:3的，1:1的，如果不写这个参数，就是1:1的。然后呢，p是叫个性化。那你说个性化怎么做？你要到Midjourney的网站上去进行训练，他给你一堆图片，说我这个喜欢那个不喜欢，你训练了个几百张以后，他就知道了，这是你喜欢的风格。当然你也可以抄别人的，这个p后边的数字，直接用这个是没问题的。现在最新的Midjourney，可能可以写好几个p参数在后头，但是可以把各个人的这种个性化风格融合在一起。</p>



<p class="wp-block-paragraph">讲到这儿我们要强调一下，就是你还是要去买Midjourney 10美金一个月的那个套餐的。如果你不买那个套餐的话，效果不好，或者说你可能没法使。再往后，S S是什么呢？其实就是说你这个数大概越小，它就相对来说画的比较规整，如果大的话，他的想象力会变得更加丰富一些。他应该是从0到1,000之间的一个数字，1,000就是你就放飞的想象去干去吧，0的话就是不要想，就按我这个来，默认的话是100，这个大家自己去调整。然后c呢是叫做混沌或叫混乱，应该是0到100之间的一个数字，c越大，你最后得到的结果就越乱。再往后一个呢叫raw的一个风格，如果是有这样的一个参数，它应该是画的更写实一些，如果没有的话就是更好的应用风格，大概是这样，因我一般都习惯带上这个参数。再往后两个参数，一个是cref，一个是sref。</p>



<p class="wp-block-paragraph">{cref}是参考人脸。我想让他画的像谁？你先上传一张照片，然后加上{cref}。待会儿我们不用这些东西，因为我们尽可能的用机器来搞定这个事儿的话，{cref}就稍微麻烦一点。所有人都看到我经常给自己画像，这个就是用{cref}这个参数来去搞定的。</p>



<p class="wp-block-paragraph">然后，{sref}是参考风格。你说我现在想非常明确的要一幅蒙娜丽莎这个风格的画怎么办？我先上传一张蒙娜丽莎的照片，{sref}指向他的这个照片的链接就可以了，他就可以进行风格参考。</p>



<p class="wp-block-paragraph">最底下两个参数，一个是版本，另外一个呢是动漫风。这个{v}的话，如果你不填，现在我一般都不填这个数，他就是6.1最新版本。你说我如果写上{niji}，那么他就直接给你按照动漫的方式去画。你说哎，我前面描述了按照宫崎骏的动画给我画出来，那你后边其实不用加这个数。你要是加上{niji}了以后，他是走另外一套模型，会更加明确的画动漫。反正大家自己去选择，后边你自己试一试就可以了。</p>



<p class="wp-block-paragraph">好，这就是它的基本的提示词写法。后面还可以做什么呢？还可以做一些区域重绘，具体的我们就不再详细讲了，这个就是一些高级技巧了。比如说提示词权重这个调整，你可以说哪一块后边写两个冒号，具体是1还是2，下一个写几个冒号，人要画大一点，旁边的这个花要画小一点，它是允许你这么调整的。但那个太复杂了，我们就不折腾了。</p>



<p class="wp-block-paragraph">所谓区域重绘是什么？就是你画完一幅画以后，你可以选一块说，在这再给我画一别的上去。这个也是比较复杂，今天我们就不研究这一块了。你画好了以后，可以把刚才我们讲的一大堆参数了，来回试一试，试完了以后得到一些不同的结果出来，再拿到Twitter、微信公众号或者是微博去传播一下试试。</p>



<p class="wp-block-paragraph">下边呢，我们来看一个示例吧。首先呢，我们示例呢，使用Cherry studio。Cherry studio呢，你说我不会使没关系，你去看我前面有一期Deepseek满血版教学，去看那个去，会教你怎么使用Cherry studio。</p>



<p class="wp-block-paragraph">下边这一大堆字是什么？就是按照刚才我们去分析 Midjourney 提示词怎么写，然后我去写的一套提示词。这个提示词呢，其实也不是我写的，这个提示词是用 DeepSeek R1 的推理模型写的。我告诉 DeepSeek R1 说，我现在需要一个提示词，让 DeepSeek R1 可以去生成 Midjourney 的 prompt。它最后给我得到了一个 Midjourney 提示词，然后呢是场景、主体、环境、细节。这个其实就是刚才我把中文这部分翻译成英文就得到了。下面呢给了一个案例，说来，你按照这个案例给我拼成这个提示词。然后呢再写了一些，说你下边再给我做一点点这个备注，或者是一些其他的这种建议。而且我们告诉他说，你这个提示词必须是使用英文的，不能用其他任何语言。如果你不写这个的话，有时候给你上中文提示词出来。我们待会用 Cherry studio 里边给 DeepSeek R1 写的系统提示词，就是提示词这个东西呢有三个角色。第一个叫系统提示词，第二个呢是叫做用户提示词，第三个呢叫做助手提示词。系统提示词也就是定义说，我这个系统到底在干嘛。用户提示词呢就是，我到底想让你去做一个什么什么事情。助手提示词是由大模型返回的信息。它一共是分这三种，所以这个就是系统提示词。Cherry studio 里是允许我们去定义系统提示词的。我在这儿呢就不给大家打开 Cherry studio 去做演示了。具体使用方法，大家可以去看前面的视频。</p>



<p class="wp-block-paragraph">好，我输入了什么呢？“褶皱的旧羊皮纸上，钢笔手绘海盗的藏宝图，骷髅标志代表路径的终点。”我要求他给我画一个这样的东西。然后呢，他就开始来了。他先给我生成了一个提示词，然后呢给了一堆建议。这个建议呢，你可以到时候把这些东西贴上去，说我到底要哪个不要哪个。包括比如说烧焦的边缘效果、17 世纪的海图风格、页边隐藏的密码信息、折叠的纸张痕迹、生锈的墨点飞溅、页边的海洋怪物。他说你还可以在后边加这些玩意。</p>



<p class="wp-block-paragraph">真正这就这句话是我写的，就是褶皱的旧羊皮纸上，钢皮手绘海盗的藏宝图。骷髅标志代表这个路径的终点。这句话是我写的，其他的都不是我写的，都是DeepSeek R1推理出来的。那么，我根据他给我的这个提示词，自己还稍微的调整了一下，得到的最终完整提示词。大家看最后，我这里是有这个16:9的，这个是我个人的一个个性化编号。当然，你说我也想使这个行不行？没问题，这个可以用。然后是我要求他按照这个更清晰的方式，还原的方式来去生成，s，0-1,000嘛，刚才我们讲了，给个750就是非常大的这个想象空间。你去想去，把它翻译过来，是一张起皱的旧羊皮纸，上面有手绘的海盗藏宝图，用钢笔和墨水绘制，有一个骷髅符号标志着路径的中点。复杂的复古插画风格，带有褪色的棕褐色调与咖啡渍，详细的罗盘，玫瑰点状的宝藏踪迹和航海地标，风化的纹理，可见纸纤维和折痕的阴影，包括x标记、沉船标记和岛屿轮廓，深棕色和象牙色的调色板，边缘发黄，高分辨率，复杂的线条细节，逼真的羊皮质纹理，无噪点。这个是一开始生成的部分，后边我又在他的建议里头又挑了两条，一个是17世纪航海图风格，边缘有隐藏的密码信息，旁注有海洋怪物。这是我最后给他的一个提示词，扔给Midjourney去画去了。画完长什么样来看看，结果是不是觉得蛮震惊的？你这东西让我自己画，我肯定是画不出来的。第二张，第二张有一个小白边，这个有的时候是会画出白边来的，大家自己去选，每一次给你画4张出来。你说我多画几张行不行？没毛病。你看这个上头还写的有字，边上有这些海怪有骷髅，这都是按照我们要求的去画的。再继续这是又一张了，还有罗盘，他反正每一次都会给你画一些东西出来，罗盘的标记，海岛的轮廓，沉船的标记，这你看我们写的提示词上，不都都在这了吗？这是第四张，这个第四张呢，就更加的放飞自我了一些，按道理说呢应该是单色手绘，他这个里头还给你画上了树，也很有意思，什么骷髅、罗盘。</p>



<p class="wp-block-paragraph">船、海岛的轮廓都有。所以呢，我们就可以通过这样的方式，快速地得到一个自己情感放大以后的图像。这就是我们今天跟大家讲的内容。</p>



<p class="wp-block-paragraph">你说我没有Cherry studio，没关系，用其他的类似的工具都可以。那你说我没有Midjourney，这个怎么说呢？后边半部分我们讲编程的时候，可以让这些没有Midjourney 10美金账号的人用起来。但是呢，对于他们来说，每一次绘画也是要付钱的，大概画一幅画也需要零点几美金，可能10美分、20美分，大概是这样的一个水平。</p>



<p class="wp-block-paragraph">好，这就是我们的第一部分。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>马斯克Grok-2登场，可订阅才8美元，真的划算吗？推翻AI市场的游戏规则，Elon Musk的肖像被拿来玩儿梗图！</title>
		<link>https://lukefan.com/2024/08/20/%e9%a9%ac%e6%96%af%e5%85%8bgrok-2%e7%99%bb%e5%9c%ba%ef%bc%8c%e5%8f%af%e8%ae%a2%e9%98%85%e6%89%8d8%e7%be%8e%e5%85%83%ef%bc%8c%e7%9c%9f%e7%9a%84%e5%88%92%e7%ae%97%e5%90%97%ef%bc%9f%e6%8e%a8%e7%bf%bbai/</link>
		
		<dc:creator><![CDATA[Luke Fan]]></dc:creator>
		<pubDate>Tue, 20 Aug 2024 13:33:21 +0000</pubDate>
				<category><![CDATA[AIGC]]></category>
		<category><![CDATA[Musk传奇]]></category>
		<category><![CDATA[AIGC爆发]]></category>
		<category><![CDATA[AI产品]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI市场策略]]></category>
		<category><![CDATA[AI应用]]></category>
		<category><![CDATA[AI竞争]]></category>
		<category><![CDATA[AI绘画]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[API集成]]></category>
		<category><![CDATA[Chat GPT]]></category>
		<category><![CDATA[Copilot]]></category>
		<category><![CDATA[DALL·E 3]]></category>
		<category><![CDATA[Elon Musk]]></category>
		<category><![CDATA[Flux 1]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[GitHub项目]]></category>
		<category><![CDATA[GPT-4]]></category>
		<category><![CDATA[Grok 1开源]]></category>
		<category><![CDATA[Grok 2]]></category>
		<category><![CDATA[IP保护]]></category>
		<category><![CDATA[MidJourney]]></category>
		<category><![CDATA[MOE架构]]></category>
		<category><![CDATA[Open Cloud]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[RAG架构]]></category>
		<category><![CDATA[trump]]></category>
		<category><![CDATA[Twitter Premium]]></category>
		<category><![CDATA[Twitter互动]]></category>
		<category><![CDATA[X AI估值]]></category>
		<category><![CDATA[XAI]]></category>
		<category><![CDATA[互联网互动]]></category>
		<category><![CDATA[会员收入]]></category>
		<category><![CDATA[使用政策]]></category>
		<category><![CDATA[偏右AI]]></category>
		<category><![CDATA[八美元订阅]]></category>
		<category><![CDATA[内容审查]]></category>
		<category><![CDATA[名人肖像]]></category>
		<category><![CDATA[商业模式]]></category>
		<category><![CDATA[商标侵权]]></category>
		<category><![CDATA[图片生成]]></category>
		<category><![CDATA[多模态理解]]></category>
		<category><![CDATA[大模型比较]]></category>
		<category><![CDATA[实时回复]]></category>
		<category><![CDATA[广告展示]]></category>
		<category><![CDATA[广告收入模式]]></category>
		<category><![CDATA[广告收益]]></category>
		<category><![CDATA[开源项目]]></category>
		<category><![CDATA[微调功能]]></category>
		<category><![CDATA[微软创新]]></category>
		<category><![CDATA[性能测试]]></category>
		<category><![CDATA[推特]]></category>
		<category><![CDATA[推特内容]]></category>
		<category><![CDATA[推特活跃度]]></category>
		<category><![CDATA[数据处理政策]]></category>
		<category><![CDATA[数据收集]]></category>
		<category><![CDATA[数据透明]]></category>
		<category><![CDATA[数据隐私]]></category>
		<category><![CDATA[文档支持]]></category>
		<category><![CDATA[梗图]]></category>
		<category><![CDATA[法务部]]></category>
		<category><![CDATA[涨粉]]></category>
		<category><![CDATA[版权问题]]></category>
		<category><![CDATA[特斯拉]]></category>
		<category><![CDATA[社交产品开发]]></category>
		<category><![CDATA[社交媒体]]></category>
		<category><![CDATA[社交应用]]></category>
		<category><![CDATA[社区支持]]></category>
		<category><![CDATA[社区活跃]]></category>
		<category><![CDATA[算力中心]]></category>
		<category><![CDATA[美塔]]></category>
		<category><![CDATA[苹果]]></category>
		<category><![CDATA[订阅费]]></category>
		<category><![CDATA[诉讼]]></category>
		<category><![CDATA[话题热点]]></category>
		<category><![CDATA[谷歌]]></category>
		<category><![CDATA[谷歌Gemini更新]]></category>
		<category><![CDATA[谷歌Jax]]></category>
		<category><![CDATA[贺锦丽]]></category>
		<category><![CDATA[跨平台集成]]></category>
		<category><![CDATA[风格独特]]></category>
		<category><![CDATA[马斯克]]></category>
		<guid isPermaLink="false">https://lukefan.com/?p=1502</guid>

					<description><![CDATA[### 引用名言、提出问题、前后对比

在AI的大航海时代，马斯克不是第一个出海的人，但他一定是最会玩的船长之一！🚢最近，他的Grok 2版模型引爆了社交媒体，各式各样的梗图层出不穷。究竟是什么让Grok 2变得如此吸引人？

### 夸张数据、举例说明

你敢想象，只需8美元的订阅费，就可以使用这款能画一切（似乎...）的AI大模型吗？🤯从政界大佬到虚拟名人，Grok 2的绘画功能似乎无所不能，但又似乎在版权和道德的边缘试探。

### 真诚友好、鼓励建议

但别急着羡慕，马斯克的这一出戏码，我们普通人也可以学一学——Grok 2的百无禁忌或许启发我们：在创作和表达自己的同时，是否也该思考怎样平衡创新与尊重的界线。🤔

### 多用叹号、多分段、多用短句

Grok 2的火爆，不仅仅是一场AI技术的展示，更是一次社交媒体活跃度的狂欢！啊啊啊啊啊啊！但别忘了，狂欢之外，我们还需冷静地看待它的商业和法律风险。

### 重点在前、逻辑清晰

首先，Grok 2的确很便宜！🎉其次，它的绘画功能的确很吸引人！😍最后，我们不能忽视背后可能引发的问题——版权、名誉权的争端可能随时爆发。

### 倒金字塔原则、总分总原则

总的来说，Grok 2的出现，给了我们对于AI应用的更多想象。但它也告诉我们：在享受技术带来的便利和乐趣时，规则和责任同样重要。未来，AI如何更好地服务于我们，同时遵守社会规范，是每个创造者和使用者需要思考的问题。让我们拭目以待，马斯克的下一步棋吧！👀🤖🌐]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio"><div class="wp-block-embed__wrapper">
<iframe loading="lazy" title="马斯克Grok-2登场，可订阅才8美元，真的划算吗？推翻AI市场的游戏规则，Elon Musk的肖像被拿来玩儿梗图！" width="900" height="506" src="https://www.youtube.com/embed/eFdu0Yy1lvA?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe>
</div></figure>



<p class="wp-block-paragraph">Grok 2出来了，老板马斯克就是拿来开涮。马斯克各种梗图突然开始满天飞了，这是什么东西呢？就是XAI做的Grok大模型的第二版，Grok 2发布了，包括特朗普跟贺锦利的各种梗图也在飞了。其中有一张是特朗普去抚摸贺锦利怀孕的肚子呀。但其实玩的呢，并不是Grok 2，而是什么叫Flux 1。</p>



<p class="wp-block-paragraph">首先分析下时间点，为什么在这个时间要去出Grok 2呢？第一个，3月份我开始测试了，Grok 2已经开始测试了，测试到8月份呢，也差不多开始出了。而且3月份，Grok一开源了，然而开源之后就再也没有更新过任何的代码，也没有去回答过任何的issues或者是Pull request，这个都再也没有动过，完全死水一潭。马斯克的开源就是这么开的，我开了，用不用是你的事，我反正不理你，我也不会再更新任何代码。</p>



<p class="wp-block-paragraph">包括推特，原来开源的推荐算法，包括Grok 1都是这样的，开了就挂在这了，爱使不使。而且它开出来以后，你自己到底能不能部署得上去，能不能把他们这个用起来去测试，他就完全不管了。你提任何问题，他也不理你啊，这就是马斯克开源。</p>



<span id="more-1502"></span>



<p class="wp-block-paragraph">现在是AIGC的集中爆发，谷歌、苹果、美塔、OpenAI、Anthropic都不消停，都在疯狂的你方唱罢我登场。我发一个东西，互相在这别苗头。马斯克别地发出点声音来，特别是在他撤销了对OpenAI的诉讼之后，最近又重启了对OpenAI的诉讼重新起诉他。</p>



<p class="wp-block-paragraph">现在分析为什么马斯克会在撤诉之后再重启。因为他每一次诉讼，过一段时间以后，法院会去判定说你这个案子是不是要撤诉，而如果发现你的证据不足，就不要浪费纳税人的钱，我就给你撤诉了。</p>



<p class="wp-block-paragraph">所以，上一次呢，马斯克是在法官宣布可以撤诉之前的一天，自己跑去撤诉的，算是他主动撤诉。等过了这么几个月以后，说来咱们再诉讼。要知道，这种诉讼挂在身上的时候，你要再去做各种融资，是非常麻烦的，因为你身上挂的有诉讼，而且是跟马斯克打官司，官司还没打完，还在那挂着。在这个时候做融资，都很讨厌。</p>



<p class="wp-block-paragraph">所以，他还在不停地折腾 OpenAI 的算力中心，10万张 H100 的这个算力中心，7月22号正式上线。3.5万张 H100 的特斯拉算力中心是去年上线的，年底计划再来9万张 H100。就是本来这些 H100 应该是属于特斯拉算力中心的，被他挪给了 XAI 的算力中心。XAI 那批订货的 H100 今年的9月份到货，所以特斯拉的算力中心是晚一些，可以继续使用这些 X100 和 P100。</p>



<p class="wp-block-paragraph">而且呢，XAI 的估值是所有 AI GC 公司里的老二，最贵的是 OpenAI，860 亿美金，第二贵的就是 XAI，240 亿美金。你这么贵的公司，前面人家都说了这么多声音来了，在这样的一个月份里不发出点声来，有点过不去。所以，马斯克也就没有办法，只能在这个时候把 Grok 2 拿出来了。</p>



<p class="wp-block-paragraph">Grok 2 到底算不算开源呢？哼，不能算，因为 Grok 1 是开源的，虽然开源了，也是个假开源，没什么人用。而现在给出的数据是 Grok 1 有 13,140 亿参数，使用谷歌 Jax 和 Dax 的架构进行训练，MOE 就是多模型的这种专家结构进行搭建的。这是 Grok 1。Grok 2 到底是什么样的模型，谁也不知道，他也没说，说这东西就来了，也没有任何问答出来。这就是马斯克现在拿出来的东西。当时 Grok 1 出来的时候，我都感觉 Grok 这个模型是准备放弃了，不玩了。</p>



<p class="wp-block-paragraph">结果，马斯克现在发了2，而且据说还在训练Grok 3，都在开干。但是Grok 2现在还不知道到底是不是开源。理论上说，未来不定什么时候他就开了，而马斯克都是比较随性，可能会突然开源，夸嚓把代码往那一扔就不动了，你爱使不使。能用不起来他就不管了。</p>



<p class="wp-block-paragraph">现在GitHub上，XAI组织架构下只有一个开源项目，就是Grok 1。现在马斯克也好，大家都在喊一个什么事，说这是你们可以用到的最好的AI，而且最便宜。为什么呢？你只需要花8美元订阅，就可以用起来了。因为ChatGPT是需要20美元订阅的，AnswerOpen Cloud、谷歌的Gemini、微软的Copilot都是20美元一个月，只有XAI说我们家的Grok 8美元一个月，他比别人便宜。</p>



<p class="wp-block-paragraph">Grok订阅的最大优势就是便宜，而且是可以实时地获得推特内容进行回复。我现在有很多事情需要去查询的时候，我都是去问Grok的，在Grok 2出来之前就开始这么干了。为什么呢？就知道别人在说什么，特别是有很多发布会，比如明开发布会。你今儿问说发布会要说什么呀，Grok预测的极准确吧，因为有一堆人在下头做预测。他给你搜索完了，总结归纳一下，啪，把东西拿出来一看，第二天就发这些东西，这个还是非常棒的。</p>



<p class="wp-block-paragraph">风格很独特，风趣幽默，内容有更好的传播性。你用Google生成的内容，再去转发，再去到Twitter里面去流传，他会更加容易被人点赞。其实我们玩Twitter、玩YouTube、玩Facebook，这所有的这些社交媒体，我们要的就是互动。说我发完了以后没有人理我，这是一个很无聊的事情，一定要有人理你。那么API更简单，适合快速集成。</p>



<p class="wp-block-paragraph">这个呢是Grok自己给出的答案。但是我找了半天，并没有找到Grok API的使用方法，可能还没有放出来。数据处理的政策更加开放透明，而不像是很多其他的公司，他们有很多隐私侵犯的问题。原因其实也很简单，Grok训练就是用我们推特数据训练。我们使用推特，就默认同意把数据交给Grok去训练，他也不到外边再去拿别的数据了。而且你发推特的目的就是为了让人看。既然已经被人看了，Grok再给我训练一下，也就这样。所以他的数据政策相对来说比较简单。</p>



<p class="wp-block-paragraph">而且呢，它后边还写说Grok有非常小的、但是很活跃的社区支持的文档更加集中。这个意思特别逗，什么意思呢？就是Grok的功能很少，文档也很少，基本上没有文档，也不需要文档，直接上去使就完了。但是呢，用他的话讲起来，就是这个很小的社区很活跃，知识文档很集中。就是一个话，你看他怎么说，但这个话是Grok自己说的。</p>



<p class="wp-block-paragraph">Grok还有一个很大的优点，就是回答问题的时候更加百无禁忌。马斯克希望有一个偏右的AI，因为现在绝大部分的AI大模型都是偏左的。那么稍微偏右一点，这个还是可以稍微中和一下。如果所有AI大模型都偏左的话，也是非常让人困扰的事情。这个8美元以后，还有Twitter Premium的一大堆的功能，比如减少广告、增加曝光，这些功能都是送给你的。</p>



<p class="wp-block-paragraph">所以现在我们能够花最少的钱，使用到的GPT-4级别的大模型，就是Grok了。当然还可以画画了，也是相对比较百无禁忌的画法。Grok到底有什么不一样呢？现在大家其实都接近GPT-4了。Grok 2 mini是在RAG的情况下去使用，所以其实看不太出来差异。</p>



<p class="wp-block-paragraph">我们现在去Twitter上使用，就是你一个月交了8美金以后，也只能使用Google 2的Mini版，而且是Google 2 Mini的Beta版。Grok 2的这个全量版本到底怎么放出来，什么时候放，现在我们还不确定。从XAI公布的数据来看，已经接近或者是部分超越了GPT-4O了，不过它是跟GPT-4O 5月份的版本相比，现在GPT-4O在外边是有8月7号的版本。那个版本现在还是比不过的，GPT-4O的版本也是在不断更新迭代的。</p>



<p class="wp-block-paragraph">在使用上，对于问题的理解，比起Bing和Co-pilot，包括国内的豆包，还是有一些差距。我测试了一下，比如说我问了一个问题，这个问题是什么呢？是做了Flux 1的公司，现在拿了哪些投资，估值多少。等于我把这个原问题扔进去，在Grok 2里进去以后，它说我没有找到一个叫Flux 1的公司，也没有找到相关的投融资数据。数据是这样的，而其他几个呢，都很好地理解到了Flux 1是Stability公司的核心人员离职创立的，现在的公司名字不叫Flux 1，而是叫做Black Forest Labs（黑森林实验室），拿了A16Z领投的3200万美金的种子轮投资，而且是没有估值，估值没有公布出来。其他的投资人也有一些罗列，除了A16Z之外，其他都是哪些人投资的。</p>



<p class="wp-block-paragraph">在这一点上，Grok 2还是要稍微的弱一些。那么现在的Grok 2能干什么呢？第一个就是幽默，他回答你的问题经常是比较幽默的，比如说有人问他说：“你给我画一个蒙娜丽莎行吧。”我说行，但是这个蒙娜丽莎我画出来是歪嘴的行吗？他都是这样来幽默的。最有用的是基于推特内容的检索，就是你问任何问题，他都说我检查了一下推特。</p>



<p class="wp-block-paragraph">现在大家都在讨论这个问题。那么现在的风向是向哪个方向偏移的？这个是最好用的，可以进行简单问题的回答。像刚才我去问的，Flux 1的这个公司融了多少钱，估值多少，他就没有办法去正确理解和回答了。</p>



<p class="wp-block-paragraph">而最后的一个，也就是Grok 2最出圈的是什么？就是画画。大家现在都在拼命地画画，靠图出圈。Flux 1的这个模型是可以随意调用的，但是还是有一定频度限制。8美元的用户应该是每多少个小时吧，可以花二三十张。还有一种是16美元的用户，就是Twitter。有一个更贵的叫Premier加的一种用户，他们是完全没有广告，而且可以画更多的图，对于图片基本上是不设限的。</p>



<p class="wp-block-paragraph">咱们从几个方面来讲这个图片受限的问题。第一个叫引用风格。我说我要宫崎骏风格的动画，或者是迪士尼风格的绘画。OpenAI的DALL·E 3，对不起啊，这个已经违反了我的政策，不跟你玩了。Midjourney和Flux 1不理你，照样出一点问题没有。</p>



<p class="wp-block-paragraph">如果你使用名人，这个特别有意思。比如你使用马斯克，使他的名字作为主体句话，DALL·E 3直接拒绝工作，说对不起，我不能去用名人给你画画。用Midjourney画了，而且效果极好。用Flux 1去画也能画得不太像。当然，咱们在推特上看到很多非常像的马斯克的绘画，那是怎么弄的？多从事几次，可能就能得到一个比较好的结果。</p>



<p class="wp-block-paragraph">那你说我去画一个卡马拉·哈里斯，行不行？DALL·E 3直接拒绝了，说对不起，我不能画。Midjourney也拒绝了，说对不起，我也不能画。说现在是大选期间，所有的总统候选人我都是不画的。Grok 2的模型，也就是Flux 1，它就画了，没有任何问题。画完了以后还提醒说……</p>



<p class="wp-block-paragraph">选举期间，所有跟选举相关的信息，请到官网上去查询。我就是个画画的，你别问我啊，不要说我这给你造谣了啊。我给你告诉官网在什么地方。那你说这个川普给不给我画？我说给我画一个川普举枪射击的图，还有暴力，还有鸣人。达里3拒绝了，Midjourney也拒绝了，Grok 2二话不说，给你画了一个川普举着枪在那打枪的图画。但是呢，后边也是提醒说，请到VOTE.GOV官方网站去看选举信息。</p>



<p class="wp-block-paragraph">所有这种名人的Grok 2都是百无禁忌，想画啥画啥。色情内容、比基尼可以画，再衣服变少他就不干活了。这就是现在的Grok 2的这种百无禁忌的绘画。当你问Grok 2说，你画画有这个禁忌没有啊？你不能这么画啊。Grok 2自己的回答是什么？那我限制什么呢？</p>



<p class="wp-block-paragraph">第一，生成的图片不应该包含过多的暴力与血腥内容，但你看川普开枪的得给你放。第二，色情与露骨内容，任何形式的色情或露骨内容都是禁止的。仇恨和歧视内容，不生成包含仇恨言论、歧视性内容的图片。版权和知识产权，复制版权内容，生成图片不应该直接复制或模仿现有版权保护的作品。名人肖像，对于知名人物的肖像需要谨慎处理，避免直接复制或者使用其肖像权。</p>



<p class="wp-block-paragraph">反正我在Grok 2里头画的贺锦丽、画的川普、画的马斯克，都是能看出人的，没有任何问题。所以这个就形同虚设。第三，技术限制，分辨率和细节，生成的图片可能在分辨率和细节上有所限制，具体取决于生成模型的性能。然后复杂度，过度复杂的场景或细节可能无法准确生成。他说给我生成1万个小人就别想了。然后隐私和个人信息，个人身份信息不应生成包含个人身份信息，如身份证号、地址等的图片。文化和社会敏感性。</p>



<p class="wp-block-paragraph">文化敏感性，就是避免生成可能被视为对特定文化或宗教不敬的图片。政策与当地法律生成的图片必须符合当地法律法规，特别是在涉及到版权、隐私、儿童保护等方面。生成频率可能存在每日或每月生成次数限制，以防止过度使用。我估计像我这种交8美元的，每天应该可以生成20-30张。</p>



<p class="wp-block-paragraph">内容审查自动审查生成的图片，可能需要通过日常自动或人工审查，以确保符合上述限制。这就是现在GROK 2对自己进行图片审核的一个解答。虽然我觉得他做得不好，特别是名人肖像又搞得非常棒，完全都已经拿出来了。甚至我去尝试了一下，我说让疯狂马里奥穿上星球大战里边的风暴兵的制服去追赶米老鼠和机器猫，所有的一种IP人物都给你画在上面。他反正是百无禁忌，看看地表最强保护部到底要干嘛。</p>



<p class="wp-block-paragraph">马斯克呢，肯定是被玩坏了，各种马斯克的梗图在X上满天飞，包括马斯克跟扎克伯格两个人在对打，打擂台。马斯克把自己吃成了个大胖子，这些都在上面有。各种名人、各种IP、各种风格也是满天飞。刚才我们讲这个疯狂马里奥身着星球大战暴风兵制服，正在追逐米老鼠和机器猫，这一条达利直接拒绝了。Midjourney和Grok 2画的都还是不错的，地表最强法务部一般指的是任天堂和迪士尼，他们就该努力折腾了。</p>



<p class="wp-block-paragraph">那么AI生图的版权问题，包括这种叫侵犯商标权和侵犯特定的注册商业形象的这种群，可能应该在未来一段时间就会去诉讼了。否则没法整，因为大多数人其实还是关起门来用。一旦把这个图拿出来以后，谁说这个到底是生成的还是自己改的，你是说不清楚的。但是在这种YouTube里头，大家是在Twitter上用，在这样的情况下。</p>



<p class="wp-block-paragraph">你把它生成的很像米老鼠，一眼就看出来这是米老鼠，那是奥利奥，这个肯定是会被告的。马斯克算是真正的找到了X和XAI正确的打开方式。大模型好不好用其实并不重要，大模型该做的事情，XAI基本上都没做，什么意思？比如API，XAI现在就没开，TOKEN计费也没有，微调什么，怎么去嵌入多模态理解，这些东西实际上都没有多模态理解。据说Grok 2上是有这个功能，但是现在还没有办法去调用，因为现在我们使用的Twitter上的Grok的这个接口，是没有上传图片的这个按钮，所以你并没有办法去让他说这个图片在讲什么。开源现在AI其实做得并不好，各种第三方插件和系统的适配与集成，现在他也没干。真正的大模型公司，其实每一次推出新的大模型以后，就要很努力地来去做这些事情，这些事XAI都没干，那他干了一个什么呢？Grok 2其实是一个很好的基于X的应用，他给了你一个可以在X上真正用起来的东西。它可以很好地利用<a href="http://x.com/" target="_blank" rel="noreferrer noopener">x.com</a>的数据，回答各种各样的问题，他回答其实还算靠谱。现在只有Grok可以调用，其他人你都是调用不了Twitter的数据的，因为非常的贵。刚才我们在上一个故事里边讲到的Wordware就是因为实在太贵了，玩不起了。你去调用Twitter数据是非常麻烦的，生成的内容特别是图片，极大地提升了<a href="http://x.com/" target="_blank" rel="noreferrer noopener">x.com</a>的价值，因为他现在这些图片大量地在推特里边去流传。为什么这个活跃度？如果我们看到了一个马斯克跟这个川普两个人在这打情骂俏的图片，那用户的活跃度就会直线上升，大家都会去点一下，都会去转发一下，都会去点个赞，评论两句，这个带来的是什么？带来的是更多的广告展示机会。</p>



<p class="wp-block-paragraph">更多的广告收益，所以这个东西对推的是非常有利的。而且前面我们讲了8美元一个月，也是所有的这些AI应用里边最便宜的一个。那大家就定呗，订阅用户上升，也会直接提升整个的会员收入。而且我告诉你，你一旦订阅了XAI 8美元一个月的这个套餐，大家会变成话痨了，会七差咔嚓上去说的，要不然那8美元不亏了吗？</p>



<p class="wp-block-paragraph">我现在每个月大概能挣回4-5美元来，但是我这8美元还没有一起挣回来。最终，Grok2对于X来说，算是一个肥水不流外人田。我自己的内容发到推特上去，让推特能够产生更好的互动，能够挣到广告费，这就是他们现在在干的事情。</p>



<p class="wp-block-paragraph">对于马斯克来说，推特440亿美金把它买下来，现在再值多少钱已经不好说了，但是外边还有一个230亿美金的XAI。所以Twitter买下来的过程中，如果把XAI的这个价值算上去，其实应该并不亏。这一段时间，未来不排除说再把这两个项目捆绑在一起去上市，或者说重新把其中的一个扔上市，再把这个钱再挣回来。</p>



<p class="wp-block-paragraph">而这个才是马斯克再去推Grok的初衷。他不会去说我要跟OpenAI竞争，或者跟Anthropic、谷歌Gemini去跟他们竞争。我就在这一亩三分地上把Twitter伺候好就完事了。希望国内的，比如像微信、抖音就字节跳动，他们也可以以这个为核心，真正的做一些与自己家的社交类产品结合更紧密的大模型应用出来，而不是说一个一个的都惦记出来，说我去做一个对第三方开放友好的大模型。我希望靠大模型成为新时代的平台，不要走那条路。</p>



<p class="wp-block-paragraph">所以我觉得，马斯克的AI算是给我们打了一个很好的样本，这就是我们今天讲的第二个故事。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
