首页 / AI资讯 / 正文
AI资讯

AI绘画从入门到变现:工具推荐、提示词技巧与商业应用全攻略

chuanbook chuanbook
发布于 2026 年 10 月 05 日
阅读 约43分钟
浏览 1
评论 0

1.1 AI绘画是什么:从生成模型到图像创作

我第一次接触AI绘画的时候,脑子里蹦出来的问题特别朴素——它到底是个什么东西?是不是像搜索引擎一样,我输入“一只猫”,它就从网上找一张猫的图片给我?后来我才搞明白,完全不是这么回事。AI绘画的本质是让计算机“学会”人类画画的规律,然后自己“画”出一张全新的图。它不是从数据库里检索拼贴,而是通过海量图片的训练,理解了什么形状像猫、什么纹理像毛发、什么光影看起来真实。当你输入一句话,它从一团随机噪点开始,一步步“去噪”,慢慢把画面“雕刻”出来。这个过程听起来很玄,但效果摆在那里——你给它一句话,它给你一张世界上从未存在过的图。

从技术角度说,这类系统叫“生成模型”。生成模型的核心能力是学习数据的分布,然后从分布中采样出新样本。放在图像领域,就是学习“什么样的像素组合看起来像一张合理的图片”,然后生成新的像素组合。早期的生成模型做出来的图模糊、扭曲、没法看。2014年GAN出现之后,画面开始变得清晰。2020年前后扩散模型崛起,图像质量和多样性直接上了一个大台阶。到了今天,你甚至不需要懂任何代码,打开网页输入几个词,几十秒就能拿到一张可用的插画、概念图或者产品图。

我自己的感受是,AI绘画真正改变的不是“画画”这件事本身,而是“谁可以画画”。以前你需要学素描、学色彩、学透视,练好几年才能画出像样的东西。现在你需要的是一定的审美判断、清晰的表达能力,以及跟AI“沟通”的技巧。这扇门打开之后,很多从来没碰过画笔的人,开始产出视觉内容。这既是机会,也是争议的起点。

1.2 核心技术脉络:扩散模型、GAN与多模态控制

聊AI绘画的原理,绕不开几条技术路线。我在学习过程中慢慢理清了一个大致脉络,分享出来可能对你有帮助。

GAN(生成对抗网络)是最早让AI生成图像“能看”的技术。它的思路很有意思——两个网络互相对抗,一个负责造假图,一个负责鉴别真假。造假的想骗过鉴别的,鉴别的想识破造假的。两边不断进化,最终生成的图越来越逼真。GAN在2018年前后产出了很多惊艳的人脸图像,但它有个明显的问题:训练不稳定,容易模式坍塌,生成多样性不够。你想让它画猫,它可能翻来覆去就那几种猫。

扩散模型是现在主流AI绘画工具的底层技术,Midjourney、Stable Diffusion、DALL·E都基于它。扩散模型的核心思想分两步:前向过程把一张清晰图片逐步加噪,直到变成纯噪声;反向过程训练一个网络,从纯噪声逐步去噪,恢复出清晰图片。训练完成之后,你从随机噪声出发,让网络一步步去噪,就能“生成”一张全新图片。这个方法的优势是训练稳定、生成质量高、多样性好。缺点是生成速度偏慢,因为要迭代几十步。不过随着蒸馏技术和采样器的优化,速度问题正在被逐步解决。

多模态控制是另一个关键拼图。早期的文生图只能靠文字提示词控制,你写“一个女孩站在窗边”,生成出来的构图、姿态、表情基本靠运气。现在有了ControlNet、IP-Adapter、参考图等功能,你可以用线稿控制轮廓、用深度图控制空间关系、用姿态图控制人物动作、用参考图控制风格。文字不再是唯一的输入通道。这种“多模态”的控制方式,让AI绘画从抽卡游戏变成了可控的创作工具。我自己的体验是,有了ControlNet之后,出图的可用率至少翻了一倍。

1.3 AI绘画与传统绘画、摄影、设计的差异

很多人会拿AI绘画跟传统绘画比,跟摄影比,跟设计比。我觉得这些比较有意义,但前提是搞清楚它们各自的逻辑。

传统绘画的核心是“手”和“眼”的配合。画家观察世界,理解结构、光影、色彩,然后用笔触把理解转化为画面。每一笔都带着画家的判断和情绪。AI绘画的核心是“语言”和“选择”。你用文字描述你想要的画面,AI生成一批候选,你从中挑选、调整、再生成。你的角色从“执行者”变成了“导演”和“编辑”。这两种模式产出的作品,气质上确实不一样。传统绘画有手工的痕迹和物质性,AI绘画有算法的不确定性和数字感。

摄影和AI绘画的关系更微妙。摄影是“从现实中截取”,AI绘画是“从想象中生成”。摄影受物理世界限制,光线、焦距、快门速度决定你能拍到什么。AI绘画没有这些物理限制,你可以让太阳从西边升起,可以让鱼在空气中游动,可以让一千年前的场景重现。但摄影的“真实性”和“见证感”是AI绘画很难替代的。你看到一张战地摄影,你知道那是真实发生过的。你看到一张AI生成的战地图像,你知道那是合成的。这种信任差异是本质性的。

设计跟AI绘画的交集在于“功能性”。设计要解决问题——传达信息、引导行为、塑造品牌。AI绘画目前更擅长提供素材和灵感,还不具备完整的设计思维能力。你可以用AI生成一百个Logo方案,但哪个方案适合这个品牌、符合这个行业的调性、能跟其他视觉元素协调,仍然需要设计师来判断。我倾向于把AI绘画看作设计流程中的一个强大工具,而不是设计师的替代品。工具越强,使用工具的人的判断力就越重要。

1.4 学习AI绘画的常见路径与误区

我观察身边学AI绘画的人,大致有这么几条路径。

一条是“工具派”——先找一个工具用起来,Midjourney也好,Stable Diffusion也好,边用边学。遇到问题再查资料、问社区。这条路的好处是上手快、反馈直接,坏处是容易停留在“会按按钮”的层面,遇到复杂需求就卡住了。另一条是“理论派”——先把扩散模型的数学原理、注意力机制、采样算法搞明白,再动手实践。这条路走得慢,但走得深,后期调参、排查问题、搭建工作流的时候优势明显。还有一条是“项目派”——带着具体目标学,比如要做一个绘本、一套电商图、一个游戏概念集。目标驱动学习效率最高,但知识体系可能不够完整。

我走过不少弯路,这里说几个常见的误区。第一个误区是“提示词越长越好”。刚开始我恨不得写两百个词,把能想到的形容词全堆上去,结果生成出来的图反而混乱。后来才明白,提示词的关键是精准和有序,不是长度。第二个误区是“盲目追新模型”。新模型确实有提升,但如果你连基础参数都没搞懂,换模型解决不了根本问题。第三个误区是“忽略后期”。很多人觉得AI生成的图直接就能用,实际上大部分图都需要经过修复、调色、放大才能达到可用标准。第四个误区是“只学工具不学审美”。工具更新换代太快了,今天学的操作明天可能就变了。审美判断和视觉素养才是长期竞争力。

我的建议是,先从一个小项目开始,比如做一张自己用的头像、一套社交媒体配图、一个简单的产品展示图。在做的过程中遇到问题再针对性学习。不要想着“等我学完了再开始”,AI绘画这个领域变化太快,你永远等不到“学完”的那一天。

2.1 在线工具推荐:Midjourney、DALL·E、Stable Diffusion WebUI等

我第一个付费的AI绘画工具是Midjourney。那时候它还在Discord里跑,整个操作就是在聊天框里敲“/imagine”然后输入提示词。第一次看到四宫格图片刷出来的瞬间,我愣了好几秒——这玩意真的能听懂人话?Midjourney的强项是艺术感和氛围感,它生成的画面往往自带一种“高级感”,色彩和构图都很讨喜。缺点是可控性一般,你很难精确指定某个姿势或者某个细节。它没有免费额度,想玩就得开会员。

DALL·E我用的时间不长,主要是在ChatGPT里面顺手调用。它的优势是跟对话结合得很自然,你说“画一只穿宇航服的柴犬在月球上吃披萨”,它就能给你画出来,理解能力相当不错。DALL·E的写实风格不如Midjourney惊艳,但它对文字的理解更准确,适合那种“脑子里有个具体画面但不知道怎么描述”的场景。Stable Diffusion WebUI是另一个世界,我第一次在本地装好它的时候,看到满屏的参数和选项,头都大了。用熟了之后,它给我的自由度和控制力是其他工具没法比的。你可以换模型、加LoRA、接ControlNet,玩出各种花样。它需要一块像样的显卡,安装配置对新手不太友好。

现在很多国产在线工具也做得不错,比如文心一格、通义万相、触站AI这些。它们的中文提示词支持更好,注册即用,适合刚入门的朋友。我有时候也会用这些工具快速出个草图,再丢到Stable Diffusion里细化。每个工具都有它的脾气,看你怎么搭配。

2.2 本地部署与云端方案对比

本地部署和云端方案,我两个都折腾过。本地部署最大的好处是“一切都在自己手里”。模型文件在硬盘里,生成记录在本地,不用联网也能跑,隐私性拉满。你可以随便改代码、加插件、训练自己的模型,那种掌控感是云端给不了的。代价也很直接——显卡。我用的是一张RTX 3060 12G,跑512x512的图还行,想跑高清或者批量生成就得等。要是用4090,体验当然好,成本摆在那里。环境配置、版本冲突、驱动更新这些破事,足够让新手崩溃好几次。

云端方案就省心多了。租一张云GPU,按小时计费,想用多好的卡就租多好的卡。Google Colab、AutoDL、阿里云这些平台都提供现成的Stable Diffusion镜像,点几下就能跑。在线生成平台像LiblibAI、吐司Tiamat、SeaArt,连部署都省了,打开网页就能用,模型和LoRA都是现成的。我出差的时候经常用云端,笔记本没显卡也能出图。云端的问题是:一是有持续的成本,二是数据在别人服务器上,三是有些平台会限制生成内容或者排队。如果你只是偶尔玩玩,云端完全够用。如果你想深入定制、批量生产、训练模型,本地部署更合适。我现在的做法是本地为主,云端为辅,两边互补。

2.3 垂直场景工具:二次元、写实、电商、设计辅助

二次元这个方向,工具分化特别明显。NovelAI和Nijijourney是专门针对动漫风格优化的,生成出来的线稿、上色、角色设计都很对味。Nijijourney是Midjourney的二次元特化版,画风更干净,适合做插画和角色设定。Stable Diffusion里也有大量二次元模型,比如Anything系列、Counterfeit、MeinaMix,配合LoRA能做出很精细的效果。我认识几个画师朋友,他们现在用AI做前期概念和草图,自己再手动细化,效率提升了不少。

写实方向,Midjourney v6和Stable Diffusion的写实模型(比如Realistic Vision、ChilloutMix)是主流。电商场景比较特殊,需要的是商品图、模特图、场景图,对细节和一致性要求很高。现在有一些专门的电商AI工具,像美图设计室、阿里堆友、京东的AI设计平台,它们内置了商品背景替换、模特换装、场景生成这些功能,操作更傻瓜化。设计辅助方面,Adobe Firefly融入了Photoshop,可以用文字生成填充、扩展画布、替换元素,对设计师来说很顺手。Canva也加了AI绘图功能,适合做社交媒体图。这些垂直工具的共同点是:降低使用门槛,解决特定问题。你不需要成为AI专家,也能快速拿到可用的结果。

2.4 如何根据需求选择AI绘画工具

选工具这件事,我踩过坑。一开始看别人说Midjourney好,就充了会员,发现自己更需要的是可控性,又转头去折腾Stable Diffusion。后来我总结了一个简单的判断框架:先问自己三个问题——你愿意花多少钱?你的电脑显卡怎么样?你要画什么?如果预算有限、显卡一般、只想快速出图发朋友圈,那在线工具像通义万相、文心一格、DALL·E就够了。如果你追求艺术感和氛围感,愿意付月费,Midjourney是好选择。如果你需要精确控制、想玩模型和插件、有不错的显卡,Stable Diffusion WebUI或者ComfyUI更适合你。如果你做二次元插画,Nijijourney或者NovelAI更对口。

还有一个维度是学习成本。Midjourney学起来最快,Discord里敲命令就行。DALL·E更简单,聊天框里说话就行。Stable Diffusion WebUI的学习曲线最陡,参数多、插件多、模型多,学会了之后天花板也最高。ComfyUI是节点式工作流,更灵活也更复杂,适合喜欢折腾的人。我建议新手从在线工具开始,找到感觉之后再考虑本地部署。不要一上来就挑战最高难度,容易劝退。

2.5 工具生态与模型社区资源

AI绘画的生态里,模型社区是特别重要的存在。Civitai(C站)是我最常用的模型网站,上面有海量的Checkpoint、LoRA、Embedding,每个模型都有示例图和参数,你可以直接下载或者在线生成。Hugging Face是另一个宝库,很多前沿模型和论文代码都放在上面。国内的LiblibAI(哩布哩布)和吐司Tiamat也有丰富的模型资源,中文界面,下载速度快。我经常在C站上找LoRA,比如某个画师风格、某个角色、某种光影效果,下载下来放到本地模型文件夹里,出图效果立刻不一样。

除了模型,插件和工作流也是生态的一部分。Stable Diffusion WebUI有大量的扩展,比如ControlNet、ADetailer、Regional Prompter,每个都能解决特定问题。ComfyUI的节点工作流可以在网上找到别人分享的JSON文件,导入就能用。还有一些工具站,比如OpenArt、PromptHero,可以搜提示词、看别人的作品和参数。社区方面,Reddit的r/StableDiffusion、Discord的各种频道、国内的AI绘画交流群,都是学习和求助的好地方。我很多问题的答案都是在社区里翻出来的。

模型社区有一个好处是“站在别人的肩膀上”。你不需要从零训练一个模型,别人已经帮你调好了。你只需要找到合适的模型,搭配正确的提示词和参数,就能出好图。坏处是信息过载,模型太多、更新太快,容易陷入“下载模型—测试—不满意—再下载”的循环。我的经验是:选定一两个基础模型,深入研究它的脾气,再搭配几个常用的LoRA,比盲目收集模型有效得多。

3.1 注册、界面与核心功能认识

我第一次注册Midjourney是在Discord里完成的。打开Midjourney官网,点“Join the Beta”,跳转到Discord邀请页面,授权后进入一个满是频道和消息的服务器。找到“newbies”频道,在输入框敲“/imagine”,弹出提示词框,输入英文描述,回车。等几十秒,四张缩略图就出现在聊天记录里。那个界面说不上友好,消息刷得飞快,自己的图很容易被淹没。我花了半天才搞明白怎么放大单张、怎么保存、怎么用“/settings”调模式。

DALL·E的注册更简单。有OpenAI账号就能用,ChatGPT侧边栏点开DALL·E,直接打字描述画面。界面就是一个聊天窗口,没有复杂参数,适合零基础的人找感觉。Stable Diffusion WebUI的界面完全是另一个画风。我第一次打开本地部署的WebUI,顶部一排模型选择、VAE、CLIP跳过层,中间两个大文本框,一个正向提示词,一个负向提示词。下面挤着采样器、步数、CFG、种子、分辨率、批量数量。右侧是生成按钮和图片预览区。我盯着那些英文标签,心里只有一个念头:这玩意真的能出图吗?

用了一周之后,我慢慢把界面分成了几个功能区。提示词区决定画什么,参数区决定怎么画,模型区决定用什么风格画。核心功能就四个:文生图、图生图、局部重绘、放大。在线平台像LiblibAI、吐司Tiamat把这些功能包装得更直观,上传图片、涂抹区域、点生成,流程跟手机修图App差不多。我的建议是,新手不用一上来就啃透所有按钮,先认识“提示词、模型、生成”这三个东西,就能开始玩了。

3.2 文生图、图生图、局部重绘的基础流程

文生图是我用得最多的模式。打开WebUI,选好模型,在正向提示词里写“1girl, white dress, forest, sunlight, detailed face, masterpiece”,负向提示词里写“lowres, bad anatomy, bad hands, extra fingers, blurry”。参数保持默认,采样器选DPM++ 2M Karras,步数25,CFG 7,分辨率512x768。点生成,等十几秒,第一张图就出来了。这个流程看起来简单,实际需要反复试。提示词里多一个词少一个词,画面差很远。我习惯一次只改一两个词,方便判断哪个词起了作用。

图生图适合在已有画面上做变化。上传一张草图或者上一轮生成的图,调整“重绘幅度”。幅度0.3左右会保留大部分结构,只改细节。幅度0.7以上会大改,可能完全变个样子。我常用图生图把低分辨率草图变成精细插画,或者把照片转成二次元风格。操作时要注意,重绘幅度和提示词要配合。提示词写“oil painting”,幅度太低,油画感出不来;幅度太高,原图结构就丢了。

局部重绘是修图的利器。把图放进局部重绘面板,用画笔涂出想改的区域,比如人物的手、衣服、背景。提示词只描述涂掉的部分,比如“perfect hand, five fingers”。蒙版边缘要稍微羽化,不然接缝会很生硬。我经常用它改发色、换表情、加配饰。有一次生成了一张很满意的半身像,右手手指多了两根。我涂掉右手,负向提示词加上“extra fingers”,重绘幅度0.5,跑了几次就修好了。局部重绘不能解决所有问题,遇到结构大崩,还是重新生成更省事。

3.3 参数理解:采样器、步数、CFG、种子、分辨率

采样器决定AI用什么算法去噪。Euler a出图快,画面柔和,适合二次元。DPM++ 2M Karras细节更扎实,我写实和插画都用它。DDIM、LMS、Heun各有脾气,换采样器就像换画笔,同一组提示词出来的是不同质感。我一开始只用一个采样器,后来为了对比,固定种子跑了一遍所有选项。差别没有想象中那么大,但细微的风格变化确实存在。新手不用纠结,选DPM++ 2M Karras或者Euler a就能应付大多数场景。

步数控制去噪迭代次数。20到30步是甜点区,画面已经稳定。50步以上提升有限,时间翻倍。CFG是提示词引导强度,7到10比较听话,画面也自然。CFG拉到15,颜色容易过饱和,边缘出现焦糊感。CFG低于4,AI像在梦游,根本不理会提示词。种子是画面的身份证,固定种子能复现同一张图。想微调构图,固定种子改提示词;想探索新画面,随机种子。分辨率直接影响显存和构图。512x512适合测试,768x768细节更多,1024x1024显存吃得厉害。高分辨率需要开高清修复,不然容易画出双头、多肢。

我踩过一个大坑:把CFG设成20,步数拉到80,分辨率1024x1024,结果显存爆了,出来的图颜色像烧焦一样。后来我把参数记在笔记本上,每次只改一个变量,慢慢摸清了它们的关系。参数没有绝对最优,不同模型、不同提示词、不同画面需求,适合的参数都不一样。我的习惯是:测试阶段用低步数、低分辨率,确定构图后再开高清修复细化。

3.4 常见失败案例与排查方法

新手最常见的失败是人物手指和脸崩。画面里出现六根手指、三只眼睛、扭曲的肢体,原因是模型在低分辨率下对局部结构理解不够。排查方法:负向提示词加上“bad hands, extra fingers, missing fingers, bad anatomy, deformed”。开启ADetailer插件,专门修脸和手。分辨率拉到768以上,给模型更多像素去画细节。我有一张图,脸一直崩,后来发现是VAE没选对。换了一个适合该模型的VAE,皮肤质感立刻正常了。

画面模糊、颜色发灰、细节糊成一团,通常是步数太低、CFG太低、或者模型本身偏软。检查采样器是不是用了Euler a配低步数,换成DPM++ 2M Karras加25步试试。提示词里加上“sharp focus, high detail, 8k”这类画质词。另一种情况是提示词冲突,比如同时写了“day”和“night”,AI不知道听谁的,画面就会混乱。排查时把提示词精简,一次只留核心词。生成出奇怪物体,比如多出来的手臂、漂浮的杯子,负向提示词不一定能解决。局部重绘涂掉,或者用ControlNet重新约束姿势。

我遇到过提示词完全不起作用的情况。写了“red dress”,出来的是蓝裙子。检查发现模型是二次元模型,对颜色词不敏感,换写实模型就正常了。还有一次,所有图都带一层灰蒙蒙的滤镜,查了半天,是VAE文件放错了位置。常见失败案例的排查思路可以梳理成一句话:先查模型和VAE,再查提示词和负面词,之后调参数。每次只改一个地方,才能找到真正的原因。社区里有人分享排查清单,我照着做了一版贴在显示器旁边,省了很多瞎试的时间。

3.5 建立个人素材库与作品管理习惯

我刚开始玩AI绘画时,图片随便丢在桌面,文件名是“00001.png”“00002.png”。一个月后想找一张满意的图,翻了半小时没找到。后来我建立了一套文件夹体系。根目录叫“AI绘画”,下面按年份分“2024”“2025”,再按月份分“01”“02”。每张图生成时,WebUI会自动存到当天文件夹。我每周整理一次,把废图删掉,好图移到“精选”文件夹。精选文件夹里再按风格分:二次元、写实、场景、角色。

命名规范也很重要。我习惯用“日期_模型简称_种子_提示词摘要”来重命名。比如“20250315_realisticVision_123456_white_dress_forest.png”。这样看一眼文件名就知道用了什么模型、什么种子、画了什么。参数记录我用Notion表格,列包括:图片缩略图、模型、LoRA、采样器、步数、CFG、种子、提示词、负面提示词、备注。有时候一张好图是试了二十次才出来的,没有记录,下次想复现就难了。我把提示词也单独建了一个库,按主题分类:人物、场景、光影、材质、风格。写新提示词时直接复制组合,效率高很多。

素材库不只是图片。我收集了常用的LoRA、Embedding、参考图、配色方案。参考图放在Eagle里,打上标签,找的时候一搜就出来。云端备份用百度网盘和移动硬盘各一份,防止硬盘坏掉。作品管理还有一个作用:复盘。每个月我会翻一遍这个月生成的所有图,看看哪些提示词有效,哪些参数组合出片率高。整理的过程也是学习的过程。现在我的素材库像一个小型图书馆,想画什么风格,先翻翻之前的记录,心里就有底了。

4.1 提示词结构:主体、环境、风格、光线、镜头、画质

我刚开始写提示词时,习惯把所有想到的词都堆上去。结果AI给我一张元素齐全但杂乱无章的图。后来我逼自己按顺序来:主体、环境、风格、光线、镜头、画质。主体是画面的核心,比如“一个穿白裙的女孩”。环境交代她在哪,比如“站在森林里,周围有萤火虫”。风格决定整体调性,“吉卜力风格”和“赛博朋克风格”出来的东西完全不同。光线是很多新手忽略的一环,“柔和的晨光”和“戏剧性的侧光”能让同一场景产生两种情绪。镜头词控制视角,“全身照”和“特写”差别巨大。画质词收尾,“8k、细节丰富、锐利对焦”把画面推向精细。

我试过只写主体和环境,图画得像半成品。加上风格和光线后,画面立刻有了氛围。镜头词需要和构图一起考虑。写“低角度仰拍”容易出气势,写“俯视全景”适合交代空间关系。画质词不能乱加,有时“高清”写太多,皮肤会变得塑料感。我的习惯是画质词只留两三个,比如“masterpiece, best quality, highly detailed”。不同模型对画质词的敏感度不一样。二次元模型吃“masterpiece”这一套,写实模型更认“shot on Canon EOS R5, 85mm f/1.2”。

给朋友改图时,我发现他们的问题往往出在结构混乱。所有词挤在一起,AI分不清主次。我教他们把提示词拆成短句,用逗号隔开,按重要性排前面。主体放在最前,环境紧随其后。风格和光线可以穿插,镜头词靠后,画质词最后。这样写出来的提示词像一份清晰的指令清单。我常用这个模板:[主体描述], [动作或表情], [环境], [风格], [光线], [镜头], [画质]。多练几次,写提示词的速度会快很多。

4.2 权重、否定提示词与语法控制

权重语法是我从社区里学来的。在词后面加括号和数字,比如(red dress:1.3),AI就会更重视这个词。数字低于1是减弱,高于1是增强。我一般只给关键元素加权重,比如角色的发色、服装特征。加太多权重会让画面失衡。有一次我把“blue eyes”设成1.8,结果整张图满屏都是蓝色,连背景都蓝了。后来我把权重控制在1.1到1.4之间,效果自然很多。括号可以叠加,((word))等于1.1倍,(((word)))等于1.33倍。我更喜欢直接写数字,方便调整。

否定提示词是另一个维度的控制。我在负向框里常写“lowres, bad anatomy, bad hands, extra fingers, blurry, watermark”。这些词像过滤器,把常见的瑕疵挡在外面。不同模型需要不同的否定词。二次元模型怕“extra limbs”,写实模型怕“plastic skin, over-smooth”。语法控制还有连字符和交替语法。red hair, blue hair会让AI随机选一个。[red|blue] hair会每步交替,出来的颜色可能混在一起。我试过用交替语法做渐变效果,有时成功,有时翻车。社区里有人用BREAK做分段,让不同区域的提示词独立生效。这个技巧我还没完全掌握,用了几次,画面分割感太强,后来就放弃了。

否定提示词不是越多越好。我把网上找来的长串负面词全塞进去,结果画面变得死板,细节也少了。后来我精简到七八个核心词,只在遇到具体问题时添加。比如手崩了就加“extra fingers”,脸崩了就加“deformed face”。权重和否定词都遵循一个原则:少而精。改一个词,跑一张图,看变化。我习惯在笔记本上记下每次调整,比如“20250320,权重1.2,手指正常”。这样积累下来,我对自己常用模型的脾气摸得越来越准。

4.3 风格关键词与艺术家、流派参考的合理使用

风格关键词是提示词里最有趣的部分。写“水彩风格”和“油画风格”,出来的质感天差地别。写“浮世绘”会带出扁平的色块和线条,写“巴洛克”会有强烈的明暗对比和繁复装饰。我有一段时间沉迷于加艺术家名字,比如“梵高风格”、“莫奈风格”。效果确实明显,笔触和色彩立刻靠拢。后来我发现,有些模型对艺术家名字的理解很表面,只是套一层滤镜。真正要模仿某个流派,最好同时写风格描述词,比如“印象派,笔触松散,色彩明亮,户外光影”。

艺术家名字的版权和伦理问题值得注意。我现在的做法是少用具体艺术家的名字,多用流派和视觉特征。比如想要梵高的感觉,我写“后印象派,厚涂笔触,漩涡状星空,高饱和度黄色和蓝色”。这样出来的图有相似的气质,又不直接复制某个人的签名风格。写商业项目时,我会避开还在世的艺术家名字,改用“概念艺术风格”、“电影概念设计”这类安全词。社区里有人整理过风格参考表,把艺术家名字对应到视觉特征,比如“Greg Rutkowski”对应“奇幻插画,戏剧性光影,细腻笔触”。我照着表试了几次,发现写特征词比写名字更稳定。

流派参考还能用来混合风格。写“赛博朋克加浮世绘”,AI会尝试融合霓虹灯和扁平线条。这种混搭有时出奇迹,有时出怪图。我的经验是,混搭风格不超过两种,而且最好有一个主风格。比如“主风格是赛博朋克,辅以浮世绘的线条感”。写清楚主次,AI才不容易乱。我有一张满意的作品,是“蒸汽朋克加新艺术运动”,金属齿轮和藤蔓曲线结合得很自然。那张图的提示词里,我把风格词放在主体和环境之后,光线和镜头之前。顺序对了,风格就不会盖过内容。

4.4 角色一致性、构图控制与参考图技巧

角色一致性是系列创作的核心难题。我想画同一个角色在不同场景里的样子,一开始每次生成的脸都不一样。后来我用了三种方法。固定种子是最简单的,同一个种子加微调提示词,脸的变化会小很多。但种子固定后,姿势和构图也容易被锁死。LoRA是更专业的方案,训练一个角色LoRA需要几十张图,训练完后写触发词就能稳定出脸。我试过训练自己的角色,花了两个小时标注和训练,效果比固定种子好得多。ControlNet的Reference模式也能锁脸,上传一张角色参考图,AI会尽量保持面部特征。

构图控制靠镜头词和视角词。写“全身照,正面视角”和“半身照,侧面视角”出来的构图完全不同。我常用“close-up portrait”做头像,“full body shot”做角色设定图,“wide shot”做场景概念图。视角词里,“from above”是俯视,“from below”是仰视,“eye level”是平视。景深词也有用,“shallow depth of field”让背景虚化,“deep focus”让前后都清晰。我有一段时间总画不出想要的角度,后来发现是镜头词写得太模糊。改成“85mm lens, low angle, looking up”之后,构图立刻听话了。

参考图技巧分两种。图生图适合整体风格迁移,上传一张参考图,调低重绘幅度,AI会保留大结构,替换细节。ControlNet适合精确控制,OpenPose控制姿势,Canny控制边缘,Depth控制空间关系。我常用OpenPose把模特照片的姿势搬到二次元角色上。操作时,先提取骨骼图,再配合角色提示词生成。参考图不要选太复杂的,背景干净、主体突出的图效果最好。我试过用一张人群照片做参考,结果AI把每个人都画了一遍,画面乱成一锅粥。后来我只用单人或双人参考图,成功率就上去了。

4.5 提示词迭代方法:小步测试与变量对照

我刚开始生成图时,一次改五六个词,出来一张好图也不知道是哪个词起了作用。后来我强迫自己用变量对照法。固定种子、固定参数、固定模型,一次只改一个词。比如我想调整光线,就把“soft light”换成“dramatic light”,其他不动。跑两张图对比,差异一目了然。这个方法很笨,但很有效。我花了一个下午测试了十种光线词,现在写光线时心里有数。“golden hour”偏暖,“blue hour”偏冷,“rim light”勾边,“volumetric light”有光束感。

小步测试还适用于权重调整。我把某个词的权重从1.0慢慢加到1.5,每次加0.1,跑五张图。观察画面从“几乎没变化”到“明显增强”再到“过火”的临界点。这个过程让我对权重的感觉越来越准。测试阶段我用低分辨率、低步数,一张图十几秒,快速迭代。确定好提示词后,再拉高分辨率和高清修复。我习惯把测试图拼成一张对比图,标注参数,存在素材库里。下次遇到类似需求,直接翻记录,省去重新试错的时间。

变量对照不限于提示词。模型、采样器、CFG都可以作为变量。我做过一个实验,固定提示词和种子,换五种采样器,生成五张图。DPM++ 2M Karras细节最稳,Euler a最柔和,DDIM偏平。这个结论只针对我用的那个模型,换模型可能就变了。我把实验记录分享到社区,有人评论说他的结果不一样。这让我意识到,AI绘画没有万能公式。每个人的模型、软件版本、甚至显卡驱动都可能影响结果。小步测试的意义在于建立自己的经验库,而不是照搬别人的参数。

4.6 常见提示词模板与场景示例

我整理了几个常用模板,放在笔记软件里,需要时直接复制修改。人物肖像模板:[角色描述], [表情动作], [服装], [背景], [风格], [光线], [镜头], [画质]。比如“一个银发少女,微笑,穿着白色连衣裙,站在海边,吉卜力风格,柔和的夕阳,半身特写,8k,细节丰富”。场景概念模板:[场景类型], [时间天气], [关键元素], [氛围], [风格], [视角], [画质]。比如“废弃的蒸汽朋克城市,黄昏,下着细雨,霓虹灯和齿轮,孤独氛围,电影概念艺术,广角镜头,高细节”。

二次元角色模板:[角色特征], [姿势], [服装], [背景], [风格], [画质]。我常用“1girl, long black hair, red eyes, school uniform, sitting on windowsill, cherry blossoms, anime style, masterpiece, best quality”。产品图模板:[产品], [材质], [背景], [光线], [镜头], [画质]。比如“一瓶香水,玻璃材质,放在白色大理石台面上,柔和的影棚灯光,微距镜头,商业摄影,8k”。电商图需要干净背景和清晰细节,我一般会加“white background, studio lighting, product photography”。

这些模板不是死的。我会根据具体需求调整顺序和增删词。给客户做插画时,我会在模板里加入品牌色和特定风格参考。给自己画着玩时,我会故意打乱顺序,看看AI会给出什么惊喜。有一次我把画质词放到最前面,出来的图锐化过度,像被锐化滤镜处理过。那个教训让我明白,提示词的顺序本身就是一种控制。现在我把模板当成起点,每次生成都是一次新的组合实验。社区里有人分享过“提示词随机生成器”,我试了试,出来的词太杂,还是自己手写更靠谱。

5.1 ControlNet、LoRA、Embedding等控制与微调方式

我最初接触ControlNet时,觉得它像给AI装了一副骨架。以前写提示词描述姿势,AI经常理解偏。现在上传一张骨骼图,选OpenPose,角色立刻摆出我要的动作。Canny和Lineart用来锁定边缘,适合把线稿转成上色图。Depth控制空间关系,做场景概念图时特别有用。我常用OpenPose加Depth组合,一个管人物姿势,一个管前后景层次。ControlNet的权重和引导时机需要调。权重太高,画面会僵硬,像描图。权重低一点,AI有发挥空间,细节更自然。我一般从0.7开始试,根据效果增减。

LoRA是我解决角色一致性的主力工具。训练一个角色LoRA,需要准备二十到五十张同一角色的图,背景尽量干净,角度多样。打标时我会把角色特征写成触发词,比如“mycharacter”。训练参数里,学习率设在1e-4左右,步数一千到两千。训练完后,写触发词加提示词,角色的脸和服装就稳定了。风格LoRA更好玩,拿几十张同一画风的作品训练,出来的图会带那种笔触和色彩。我试过训练一个水彩风格LoRA,用在我的风景图上,效果比单纯写风格词更统一。Embedding是更轻量的方案,文本反转,训练几十步就能用。我常用Embedding做负面提示,比如“badhand”这个Embedding,比手写负面词更精准。正面的风格Embedding也能用,但效果不如LoRA明显。

这些工具可以叠着用。ControlNet管构图,LoRA管角色或风格,Embedding管细节修正。叠太多会互相打架,我一般最多同时用两个。权重分配要小心,LoRA权重0.8,ControlNet权重0.6,Embedding权重0.5,这是我常用的起始值。每次调整一个,跑图看变化。我有个笔记本,记着每个LoRA的触发词和推荐权重。社区里有人分享LoRA组合,我试过几个,效果不稳定,还是自己调出来的最顺手。

5.2 工作流搭建:草图、上色、细化、放大、修复

我的工作流从草图开始。手绘一张线稿,或者用文生图生成基础构图。草图阶段用ControlNet的Scribble或Lineart模式,把线稿喂给AI,配合提示词生成上色版。重绘幅度设0.5到0.7,太低会保留线稿的粗糙感,太高会丢失构图。上色完成后,我会用图生图做细化。降低重绘幅度到0.3,加一点细节提示词,比如“detailed eyes, fabric texture”。细化时开高清修复,放大1.5倍,用DPM++ 2M Karras采样器,步数25左右。这个阶段出来的图已经能看了,但手和脸可能还有瑕疵。

修复环节用局部重绘。把崩坏的区域涂上蒙版,写针对性的提示词。手崩了,蒙版涂手,提示词写“perfect hands, five fingers”。脸崩了,蒙版涂脸,提示词写“detailed face, symmetric eyes”。重绘幅度设0.4到0.6,太高会换脸,太低修不动。我习惯用Inpaint的“only masked”模式,这样只重绘蒙版区域,周围不变。修复完成后,进入放大阶段。Ultimate SD Upscale是我的首选,分块放大,每块单独重绘,能增加细节。放大倍率两倍,重绘幅度0.2,配合ControlNet Tile,出来的图锐度很高。放大后如果还有小瑕疵,再用Photoshop修。

整个工作流不是线性的。有时细化后不满意,我会回到上色阶段重新调提示词。有时放大后出现新瑕疵,再局部重绘。我一般把每个阶段的图都存成单独文件,命名带日期和版本号。这样回头比较方便。草图、上色、细化、放大、修复,每个阶段对应不同的参数组合。我整理成一份自己的流程表,每次按表操作,效率高很多。遇到新问题,就在流程表里加一条备注。比如“放大后手部模糊,需在放大前先修复手”。这个流程表越来越厚,我的出图质量也越来越稳。

5.3 批量生成与自动化:脚本、API与工作流工具

批量生成能省下大量重复劳动。我常用Automatic1111的XYZ plot脚本,把采样器、CFG、步数做成三个轴,一次跑几十张对比图。做参数测试时特别有用,一张图看一个变量组合。动态提示词脚本也能批量,把提示词里的关键词替换成列表,比如把“red, blue, green”做成颜色列表,一次生成三张不同颜色的图。批量生成时,分辨率调低,步数调低,先跑草稿,选中满意的再单独放大。我的显卡不算强,批量跑图一般放在晚上,早上收结果。

API是更灵活的自动化方式。Stable Diffusion WebUI有API模式,我用Python写脚本,调用txt2img接口。脚本里定义提示词列表、参数列表,循环发送请求。生成结果自动保存到指定文件夹,文件名按提示词关键词命名。我写过一个小脚本,每天定时生成十张不同主题的图,当作灵感库。ComfyUI的节点工作流更适合复杂自动化。把加载模型、提示词编码、采样、放大、保存连成一条线,点一次运行整个流程。ComfyUI还能批处理,把输入图片文件夹和输出文件夹设好,自动跑完所有图。我试过用ComfyUI做批量风格迁移,把一百张照片转成油画风格,花了半小时跑完,效果统一。

工作流工具还有InvokeAI和Fooocus。InvokeAI的界面更直观,适合管理大型项目。Fooocus简化了参数,适合快速出图。我主要用Automatic1111和ComfyUI,前者做精细控制,后者做批量自动化。自动化不是万能的。批量生成的图,质量参差不齐,还是需要人工筛选。我的做法是批量出小图,快速浏览,挑出有潜力的,再单独精修。自动化省的是重复操作的时间,创意和判断还得自己来。

5.4 后期处理:修图、合成、超分与色彩管理

AI生成的图直接用的机会不多。我几乎每张图都要进Photoshop。修图先看整体,有没有明显的结构错误。手指多了,用液化工具推掉。眼睛不对称,用仿制图章修。皮肤塑料感太重,加一点噪点纹理。修图时我习惯放大到200%,一点一点抠。AI画的头发经常糊成一片,我会用画笔手动补几根发丝。衣服褶皱不自然,用涂抹工具顺一下。这些操作花时间,但能让图从“AI感”变成“完成度高的作品”。

合成是把多张图拼在一起。用AI生成背景和角色,分别导出,在Photoshop里图层叠加。蒙版擦除不需要的部分,调整边缘羽化。光影要统一,背景的光从左边来,角色也要加左边的轮廓光。我常用“叠加”图层模式加光效,用“柔光”模式调色调。超分放在合成之后。Real-ESRGAN适合快速放大,Topaz Gigapixel细节更好但慢。Ultimate SD Upscale能在放大时增加AI细节,适合插画。我一般先用Real-ESRGAN放大两倍,再用Topaz微调。色彩管理是最后一步。用曲线调对比,色彩平衡调冷暖,可选颜色调特定色调。我习惯把整张图的色调统一成一种氛围,比如暖黄或冷蓝。输出前锐化一下,用“USM锐化”参数设50%,半径1.0。

后期处理没有固定流程。有时修图占八成时间,有时合成占大头。我有个原则:AI负责生成,人负责判断和修正。AI出的图是素材,不是成品。我见过有人直接发AI原图,细节经不起看。花时间做后期,作品才能拿得出手。我的素材库里有个“后期参考”文件夹,存着各种光影和色调的参考图。修图时打开对照,避免调色跑偏。

5.5 建立可复用的个人风格系统

风格系统不是一天建成的。我从整理提示词开始。把常用的主体、环境、风格、光线、镜头词分类存进表格。比如“光线”类里有“golden hour, blue hour, rim light, volumetric light”。写提示词时直接从表格里挑,不用现想。然后整理LoRA和Embedding。每个LoRA建一个文件夹,放触发词、推荐权重、示例图。Embedding也分类,正面风格和负面修正分开。ControlNet的预设也存下来,OpenPose常用参数、Depth常用参数,一键调用。这些资源放在云端,换电脑也能用。

风格指南是更抽象的一层。我总结自己的视觉偏好:色彩偏暖,光线偏柔,构图喜欢中心对称,笔触偏厚涂。把这些写成几条规则,每次生成前看一眼。比如“主色不超过三种”,“光源方向明确”,“背景虚化但保留环境信息”。这些规则让我的图有辨识度。有人问我为什么你的图一看就知道是你画的,我说因为我一直在做减法。风格不是加很多东西,是去掉不属于自己的东西。我早期什么都试,赛博朋克、浮世绘、写实摄影。后来发现我最喜欢的是复古插画感。现在所有工具都围绕这个方向调。

风格系统需要迭代。每隔一个月,我会回顾这段时间的图,挑出最满意的十张。分析它们的共同点:用了什么LoRA,什么提示词结构,什么后期步骤。把这些共同点固化到系统里。不满意的图也分析,是提示词问题还是参数问题。系统越来越厚,但用起来越来越快。新项目来了,打开风格系统,选模板,调参数,出图。省下的时间用在创意上。我还把风格系统分享给朋友,他们拿去改一改,变成自己的。风格系统不是秘密,是工具。工具越用越顺手,作品越做越像自己。

6.1 商业应用:插画、广告、游戏、电商、出版与自媒体

我接的第一个AI绘画商单是给一家小咖啡馆画墙面插画。老板预算有限,找真人画师报价太高。我用Midjourney生成了六张复古咖啡主题的图,选了两张,在Photoshop里调整细节,输出成大幅喷绘。老板很满意,成本只有传统方案的零头。这次经历让我意识到,AI绘画在商业场景里的渗透比想象中快。插画领域,独立游戏开发者用AI做概念图和道具图标。广告公司拿AI出创意草图,再让设计师深化。电商团队批量生成产品场景图,把白底商品放进各种生活氛围里。出版行业用AI做封面初稿,编辑挑中方向后再请画师精修。自媒体创作者更是把AI当成了日更配图的生产线。

不同场景对AI绘画的要求差别很大。游戏原画需要风格统一,角色三视图不能崩。我用LoRA锁定角色特征,用ControlNet锁定姿势,再批量生成几十张备选。广告图讲究构图干净、产品突出。我习惯先拍一张真实产品照,用图生图加ControlNet Depth,把产品放进虚拟场景,合成后几乎没有违和感。电商主图的要求更直接:背景好看,主体清晰,颜色不偏。我做过一个测试,同一款杯子,用AI生成十种不同背景的主图,上架后点击率比纯白底图高了四成。出版和自媒体的节奏快,对精度要求相对宽松,AI出图加简单后期就能用。

商业应用里有个隐藏成本:沟通和修改。客户说不清想要什么,只给一句“要高级感”。我得先出一批风格差异大的小图,让客户选方向。选定后再细化,每次修改都要重新生成或局部重绘。这个过程比纯创作累,但能锻炼对需求的理解力。我现在接单前会问三个问题:用在哪里,给谁看,要传达什么情绪。答案越具体,出图越准。商业应用不是把图生成出来就完事,是把图放进实际场景里解决问题。我见过设计师用AI做品牌视觉探索,一天出上百个方案,客户选完再手工打磨。效率提升了几十倍,但最后那层手工打磨,AI暂时替不了。

6.2 版权、原创性与道德使用边界

版权问题是我每次接单都要面对的。客户常问:这张图版权归谁?我目前的回答分两种情况。如果我用的是Midjourney,付费订阅用户拥有生成图的商业使用权,但平台不保证图不侵犯第三方权利。如果用Stable Diffusion本地跑,模型许可证决定了能不能商用。有些模型写着“仅限研究”,拿来接单就违规。我现在的做法是,商用项目只用明确允许商用的模型,并且保留生成参数和过程文件,万一有争议能证明创作轨迹。客户如果特别在意,我会建议他们买断,把风险写进合同。

原创性的边界更模糊。有人觉得AI画图就是拼贴,没有原创。我的看法是,提示词的设计、参数的调整、后期的修改,这些都是人的决策。我做过一个实验,同一个提示词跑十次,每次结果都不一样。选哪张、怎么修、用在哪里,全是人的选择。但我也承认,如果直接拿AI图当自己的原创绘画去卖,不说明来源,那是在欺骗。我在社交媒体发AI作品时,会标注“AI辅助创作”。有人因此取关,也有人因此更信任我。道德使用还包括不模仿活着的艺术家的独特风格,不用AI生成侵权角色,不拿AI图去参加禁止AI的比赛。这些规则没有法律强制,但行业口碑会记住。

我参与过一个线上讨论,有人用AI生成了一批“梵高风格”的向日葵,印成明信片卖。梵高已经去世,版权过期,法律上没问题。但讨论里有人觉得不舒服,因为这是在消费一个逝去艺术家的遗产。另一个例子是用AI生成某位在世插画师的标志性画风,然后接商单。这位插画师公开抗议,平台后来下架了相关模型。我的底线是:不碰在世艺术家的独特风格,不生成真实人物的虚假照片,不用AI做误导性内容。这些边界会随着法律和社区共识慢慢清晰。作为创作者,主动遵守比被动合规更重要。

6.3 人机协作中的创作者定位与技能升级

刚用AI绘画时,我焦虑过一阵。觉得AI什么都能画,我还有什么用。后来想通了:AI是画笔,不是画家。画笔再好,也得有人决定画什么、为什么画、给谁看。我的角色从“执行者”变成了“导演”。以前花三天画一张插画,现在花三小时生成一百张,再用一天筛选和精修。省下的时间用来想创意、研究客户需求、学习新工具。我认识的一位原画师,现在用AI做草图,自己专注在角色设计和世界观构建上。他的产出速度翻了五倍,收入也涨了。人机协作不是人被机器替代,是人的能力被机器放大。

技能升级的方向变了。以前练线条、练色彩、练透视。这些基本功依然重要,因为你要能判断AI出的图哪里不对。我现在花更多时间学提示词工程、ControlNet参数、LoRA训练。还学了点Python,写脚本批量处理图片。摄影知识也补了不少,因为AI图的光影和构图直接借鉴摄影语言。有个做电商设计的朋友,以前只会PS。现在他学会了用ComfyUI搭工作流,用API对接商品数据库,自动生成上千张场景图。他的岗位从“设计师”变成了“设计系统搭建者”。这种转变不是个例。AI把重复劳动吃掉,留下的是判断力、审美和系统化思维。

我现在的日常工作流里,AI负责生成和初筛,我负责定方向、调参数、做后期、跟客户沟通。有时候AI出的图比我预想的好,我会顺着它的方向调整创意。有时候它怎么都出不来我要的效果,我就手绘草图再喂给它。这种来回对话的感觉,像和一个很听话但有点笨的助手合作。它不会累,不会抱怨,但需要我把需求说清楚。我发现自己越来越擅长“翻译”——把模糊的感觉翻译成具体的提示词和参数。这个能力,可能是AI时代创作者最值钱的技能之一。

6.4 AI绘画发展趋势:视频生成、实时交互与个性化模型

视频生成是我最近最关注的方向。Runway、Pika、Sora这些工具能把文字或图片变成几秒到几十秒的视频。我试过用一张AI插画生成动态壁纸,花瓣飘落、云层移动,效果挺自然。做自媒体的朋友已经开始用AI视频做片头,成本几乎为零。游戏开发者用AI生成角色待机动画,省了绑定骨骼的功夫。现在的视频生成还有局限,时长短,动作连贯性不够,复杂场景容易崩。但迭代速度太快了。半年前生成的视频像幻灯片,现在已经有电影感了。我估计一年内,AI视频会像AI绘画一样普及。

实时交互是另一个方向。NVIDIA和几家公司在做实时AI绘画,你一边画草图,AI一边在旁边生成上色版。我试过一个demo,画笔在数位板上移动,屏幕上的图实时变化。这种交互方式改变了创作流程,从“生成-等待-调整”变成“边画边看”。做直播的时候特别有用,观众能看到图一点点成形。个性化模型也在发展。以前训练LoRA要几十张图,现在有工具用三五张就能微调。未来可能每个人都有一个专属模型,学了你的画风、你的偏好、你常用的构图。你打开软件,AI已经知道你要什么。这种个性化会降低使用门槛,也会让创作更私密。

这些趋势叠加起来,会改变整个内容生产链。视频生成让动态内容平民化。实时交互让创作过程可视化。个性化模型让风格不再稀缺。我有时候会想,五年后我们怎么画画。可能戴个VR头显,手在空中比划,AI实时生成三维场景。也可能对着麦克风说一段描述,AI直接输出分镜和动画。技术会变,但核心没变:你想表达什么,你为谁表达。工具越强,这个问题越重要。我现在花在思考“画什么”上的时间,比花在“怎么画”上的多。这个比例会继续拉大。

6.5 从兴趣到变现:作品集、接单与个人品牌

把AI绘画变成收入,我走了不少弯路。最开始在社交平台发图,有人点赞没人下单。后来发现,光发图不够,得让人知道你能解决什么问题。我重新整理了作品集,按用途分类:电商主图、游戏概念、自媒体配图、个人插画。每个类别放三到五张最拿得出手的,附上生成思路和后期步骤。客户看作品集时,能直接对应到自己的需求。作品集不要放太多图,十到二十张足够。质量比数量重要,风格统一比花样繁多重要。我现在每隔一个月更新一次作品集,把新接的商单加进去,把过时的删掉。

接单渠道分线上和线下。线上我主要用几个平台:特赞、猪八戒、Upwork,还有小红书和抖音的私信。线下靠朋友介绍和行业活动。第一单通常最难。我的第一单来自一个做播客的朋友,他要一张封面图,预算两百。我认真做了三版,他选了一版,后来又介绍了两个客户。口碑是滚雪球,前十个客户服务好,后面会越来越顺。报价的时候,我按用途和授权范围定价。个人使用便宜,商业使用贵,独家买断最贵。AI绘画的效率高,但报价不能太低,否则会拉低整个市场的价格预期。我现在的报价参考传统插画师的三到五折,再根据修改次数和交付时间调整。

个人品牌是长期积累。我在小红书发AI绘画教程,在B站发工作流拆解,在知乎回答版权问题。这些内容不直接赚钱,但会带来信任。有人看了我的教程,找我做企业培训。有人看了我的作品集,找我做长期外包。个人品牌的核心是“你代表什么”。我给自己贴的标签是“复古插画风AI创作者”。所有内容围绕这个标签展开。发图、写教程、接商单,都在强化这个印象。时间长了,有人想找复古插画风,第一个想到我。变现不是终点,是验证。市场愿意为你的判断和审美付费,说明你的方向对了。

6.6 持续学习资源与社区参与

AI绘画的更新速度太快,学习不能停。我每天早上花半小时刷几个固定信息源:Reddit的r/StableDiffusion、Civitai的首页、Hugging Face的每日论文。看到新工具或新模型,先收藏,周末集中测试。测试的时候建一个专门的文件夹,记录工具名称、用途、优缺点。有些工具火一阵就消失了,有些会沉淀下来。我现在的工具箱里,核心工具就五六个,其他都是备选。学习资源不在多,在持续用。看一百个教程不如动手跑十张图。我习惯学一个新功能,马上找一个实际需求来练。比如学ControlNet OpenPose,就给自己拍张照,生成不同姿势的版本。

社区参与是学习最快的方式。我在Discord的几个AI绘画频道里潜水,看别人怎么调参数、怎么解决问题。遇到自己搞不定的,发图求助,通常十分钟内有人回复。我也分享自己的经验,比如某个LoRA的触发词、某个采样器的对比。分享越多,收获越大。有次我发了一个工作流截图,有人指出参数设置的问题,我改完后效果提升明显。社区里还有合作机会。我参与的几个人物设定项目,都是社群里认识的。有人擅长写提示词,有人擅长后期,有人擅长训练模型。组队干活比单打独斗快得多。

长期来看,我需要建立自己的知识库。我用Notion做了一个页面,分几块:提示词库、LoRA索引、参数笔记、商单复盘。每次学到新东西,随手记进去。每隔几个月回顾一次,把过时的删掉,把常用的置顶。这个知识库是我的第二大脑,换电脑、换工具都不怕。我还订阅了几个付费课程和Newsletter,花钱买别人的整理成果,省自己的时间。学习资源永远不缺,缺的是筛选和坚持。我给自己定的规矩是:每周至少跑三次图,每月至少学一个新工具,每季度至少复盘一次作品。做到这些,就不会被落下。

版权声明
文章版权声明:除非注明,否则均为ZBLOG原创文章,转载或复制请以超链接形式并注明出处。
分享到
chuanbook

评论

发表评论

请文明发言,共同维护良好交流氛围。
链接已复制到剪贴板