1.1 什么是 Prompt:从简单指令到上下文协作
我第一次打开 ChatGPT 的时候,心里想的是"这不就是个搜索框吗"。我在里面敲了一句"帮我写个产品文案",回车,等它吐出来一段话。读完之后我的反应是:能用,但很平庸。像是一个不认识你的人,硬挤出来的一段恭维话。
后来我换了个问法。我告诉它我的产品是给谁用的,客户最在意什么,语气要偏冷静还是偏热情,字数控制在多少以内,甚至说了句"不要用感叹号"。同一个模型,出来的东西完全是两个档次。那一刻我才明白,Prompt 不是一个命令,它更像是一次交接。你把脑子里的上下文,尽可能完整地搬到对面去,对面才有机会给你想要的结果。
我现在跟朋友解释 Prompt 的时候,喜欢用"带新人"来打比方。你带一个刚入职的实习生,你说"去把那个弄一下",他大概率会懵。你说"把上个月的销售表整理一下,按区域分类,做成 Excel,下班前给我",他就能动起来。模型比实习生懂得多,但它对你的处境一无所知。Prompt 的作用,就是把你的处境说给它听。
简单指令能解决简单问题,这没什么不好。我平时查个概念、改个错别字,一行字就够了。真正需要花心思的,是那些有背景、有约束、有交付标准的任务。这类任务里,Prompt 的形态会变成一段结构化的文字,里面有角色、有目标、有边界。写这种 Prompt 的过程,其实是逼自己把需求想清楚的过程。很多时候我写到一半才发现,我自己都没想明白要什么。
1.2 Prompt 教程适合谁:新手、职场人、创作者、开发者
经常有人问我,学 Prompt 是不是得有技术背景。我的回答是:不用,但不同的人学的重点不一样。
我表妹是小学老师,她学 Prompt 是为了出练习题和备课。她关心的东西很具体:怎么让模型按照她的教学进度出题,怎么控制难度梯度,怎么避免答案出错。她连"参数"两个字都没听过,但这不影响她用得很顺。她的路径是场景驱动,遇到什么问题就学什么。
我身边做运营和行政的朋友,诉求又不一样。他们要的是效率。一封邮件、一份会议纪要、一个活动方案,过去要憋一个小时,现在十分钟能出初稿。他们学 Prompt 的关键词是"模板"和"复用"。把常用的几类任务固化下来,改改变量就能用,这比研究什么高深技巧实在得多。
至于开发者和创作者,玩法就更野了。我认识一个做独立开发的朋友,他把 Prompt 直接嵌进了产品里,做成工作流的一部分。还有一个做短视频的编导,用 Prompt 批量生成选题和分镜草稿,一天能跑几十个方向。这两类人对 Prompt 的要求是稳定和可编程,容不得随机性太大。
我自己是内容出身,所以我最想跟同类人说的一句话是:别把 Prompt 当成一个新技能去供着,把它当成你现有工作的一个放大镜。你本来就会写东西、会想选题、会判断好坏,这些都还在。Prompt 只是帮你把这些能力输出得更快。
1.3 学习 Prompt 的核心能力:表达、拆解、迭代与评估
我摸索了大半年,越来越觉得 Prompt 这东西,技巧是表,能力是里。表面的那些句式、符号、参数,看两天教程就能学会。真正拉开差距的,是底下四样东西。
表达。说白了就是你能不能把心里那个模糊的感觉,翻译成对方能听懂的话。我见过太多人抱怨模型笨,仔细一问,他自己也说不清想要什么。我的办法是先写一版,读一遍,问自己"如果我是对面,我能不能照着做"。读不通就改,改到通顺为止。
拆解。一个大任务丢过去,模型容易顾此失彼。我现在的习惯是切块。写一篇长文,我先让它列大纲,再逐段展开,再统一润色。做数据分析,我先让它理清字段含义,再算指标,再解释结论。每一块都小到能一眼看出对错。
迭代和评估,我更愿意放在一起讲。很多人写完一个 Prompt,用一次就扔了。我的做法是留着,用不同输入多跑几次,看它什么时候翻车。翻车的地方,就是下一版要补的地方。评估的标准也很朴素:准不准、全不全、有没有废话、我要花多少时间改。改得越少,这个 Prompt 就越值钱。
这四样能力,其实跟写 Prompt 没什么直接关系。它们更像是一种通用的做事方式。我在写周报、开会、跟客户沟通的时候,用的也是同一套逻辑。
1.4 常用工具与平台概览:ChatGPT、Claude、Midjourney、Stable Diffusion
工具这块,我不太喜欢做排行榜。每个模型都有自己的脾气,用顺手了就是好工具。
文本类里,ChatGPT 是我用得最多的。它的综合能力强,插件和生态也最全,遇到没见过的任务我一般先拿它试。Claude 给我的感觉是文字更细腻,长文本处理更稳。我有一次把一份几万字的材料丢给它,让它梳理逻辑,它没有丢细节,这点让我挺意外。写偏正式的文案时,我会优先问 Claude。
图像类里,Midjourney 出图的审美一直在线。它的默认风格就很讨喜,适合做概念图、氛围图、封面。缺点是控制精度不如 Stable Diffusion。SD 我折腾过一阵,学习曲线陡,插件一堆,但你想精确控制构图、姿势、光线的时候,它是真能听话。DALL·E 我主要用来做简单的示意图,胜在跟对话结合得自然,你说"改一下这里",它真能改。文心一格我在做中文语境的内容时用过,理解中文提示词比国外模型顺一些。
我的建议是别一上来就全都装一遍。选一个主力工具,用到你觉得它不够用了,再去加第二个。工具太多,反而会分散你对 Prompt 本身的注意力。我自己就是从 ChatGPT 一个开始,用了三个月才去碰别的。
1.5 如何制定个人 Prompt 学习路线与练习计划
网上 Prompt 教程一抓一大把,看多了容易焦虑。我自己的经验是,别按教程的顺序学,按你自己的需求学。
我给自己的安排很简单。每天早上花十五分钟,拿一个真实的小任务练手。可能是一封回复邮件,可能是一段产品描述,可能是一个 Excel 公式。用 Prompt 做一遍,再手动改一遍,对比一下差在哪。这个习惯我坚持了几个月,攒下来的笔记比任何课程都管用。
另一个我强烈推荐的动作,是建自己的提示词库。我用 Notion 建了一个表,字段不多:场景、Prompt 正文、效果评价、改进方向。每次调出一个好用的版本,就存进去。半年下来,我发现自己常用的场景其实就那么十几个。把它们打磨好,比收藏一百个别人的模板有用得多。
练习计划不用排得太满。我见过有人给自己定每天练二十个 Prompt,三天就放弃了。我的节奏是每周挑一个主题深挖。这周专门练写作类,下周专门练数据类,再下周玩玩图像。深挖一个主题的时候,我会故意做对比实验:同一个任务,换三种不同的 Prompt,看结果差多少。这种实验做多了,你对手感的理解会比看教程深一层。
学习路线上,我踩过最大的坑是贪多。一开始什么都想学,提示词工程、思维链、Agent、微调,全塞进收藏夹,结果一个都没深入。后来我砍到只剩两件事:把手头的工作用 Prompt 做得更好,把做得好的过程记录下来。就这么两件事,反而让我走得比之前快。
如果你刚开始,我的建议是先别管什么框架和技巧。找一个你每天都在做的任务,用 Prompt 试着做一次,做不好就改,改到满意为止。这个过程中你会自然遇到问题,带着问题去查资料,学得比系统教程快得多。等你有十几个这样的实战案例了,再回头看那些方法论,会发现它们说的你都懂。
2.1 ChatGPT Prompt 基础结构:角色、任务、背景、约束、输出格式
我最开始写 Prompt 的样子,现在回想起来挺可笑的。一整段话糊过去,想到哪写到哪,中间还夹着"麻烦你""帮我一下""尽量好一点"这种自己都没想清楚的词。模型给我的东西也就那样,平平的,没什么错,也没什么劲。
随着练的次数多起来,我慢慢发现好用的 Prompt 有一个共同的样子。它一般包含五块东西:角色、任务、背景、约束、输出格式。你把这五块想清楚,哪怕写得朴实一点,效果都比那种花里胡哨的长段落稳。
角色是最容易被忽视的一块。很多人觉得"你是一位资深文案"这种开场白是废话。我的感受是,角色不改变模型的能力,它改变的是模型调用哪种语感。你要一段活泼的社交媒体文案,和你要一份严谨的法律说明,应该走的是两条不同的路。我把角色写清楚之后,最直观的变化是模型的语气不再飘,不会一会儿像客服一会儿像教授。
任务是这份 Prompt 的主心骨。我一般用一个动词开头:写、总结、改写、对比、提取、分类。动词模糊,出来的东西就模糊。我踩过一个坑,一开始写"帮我看看这段文字",模型就真的只是看了看,给我一堆感受。后来我改成"找出这段文字里前后矛盾的三处地方,并说明理由",它立刻就正经起来了。
背景这块,我要多说两句。背景就是告诉模型这件事发生的情境。我的读者是谁,现在是什么阶段,过去发生过什么,客户在意哪些点。我写过一篇产品介绍,第一版没给背景,出来的文字像说明书。补了一句"读者是刚工作两三年的职场新人,他们最怕的是买错东西",整篇文件的语气就亲了很多。
约束是最考验自己的一块。字数、风格、不要出现什么、必须包含什么、不能编造什么。有人觉得约束让模型变笨,我的体验是正相反。约束越清晰,模型越不容易跑偏。我常用的几个约束是:"不要使用感叹号""不要用行业黑话""所有数字必须来自我提供的材料""如果信息不足就直接说不知道"。
输出格式看着像小事,其实省的是后面的时间。表格、列表、分点、JSON、Markdown,每种都有自己的用场。我让模型出会议纪要的时候,会明确要求它按"讨论要点 / 待办事项 / 责任人 / 截止时间"四列输出,这样我几乎不用改就能直接发出去。格式这件事,你不指定,模型就会按自己的习惯给你。
这五块写下来其实不长。我现在的习惯是心里过一遍:我在跟谁说话,我要它做什么,它需要知道什么,我不要它做什么,交回来的东西长什么样。想通这五个问题,Prompt 基本就成型了。
2.2 高效提问技巧:分步引导、少样本示例、追问与改写
有一段时间我很执着于"一击命中"。我想一句话就把模型问到位,出来就能用。折腾了几个月,我承认这条路走不通。好的结果很少是一次对话掉下来的,它更像是聊出来的。
分步引导是我最常用的方式。一个复杂的任务丢过去,模型容易在前面几块上使足力气,后面几块草草了事。我现在的做法是切段。写一篇稿子,我先让它给我三个切入角度,我从中挑一个;再让它列大纲,我改完再让它写第一版。这样每一步的成果我都能看一眼,不用等到最后才发现方向偏了。
分步还有个附加好处:我不容易偷懒。当模型一次性给我一份完整的稿子,我常常凑合就用了。当我一步步参与进去,至少在每个节点上都得做个判断。这个判断的过程,其实是我在把自己的标准一点点传导给它。
少样本示例,说的是给模型看几个你想要的样板。这个技巧我自己用得很顺手。我让模型帮我写产品卖点的时候,会先贴两三个我过去写得比较满意的例子,再让它照着这个调子写新的。它很快就能抓住那种语感,比我用形容词描述半天都准。
举个例子。我要写一段活动预告,用"活泼一点""亲和一点"去描述,模型会给我一种很"AI 式活泼",满屏的"嗨,小伙伴们"。我换一种做法,贴两段我以前的推文,说"照这个节奏来"。它出来的东西就接近我本来的风格了。语言这种东西,示范比描述有效。
追问这个动作,我觉得是被严重低估的。很多人得到一个不太满意的答案,就关掉重开,重新问一遍。我的做法是先追问。哪句不对,哪段废话多,哪个方向不是我想要的,直接说出来。模型在一个已有的上下文里修改,比从零开始更容易贴近你的意图。
改写也是我经常玩的动作。同一段内容,我会让它用三种不同的语气各说一遍。有时候第一种最平,第二种最油,第三种反而让我眼前一亮。看到第三种我才会意识到,原来我一直想要的是这种感觉。人的审美很多时候是被"看见"之后才明确的。
我现在的对话窗口,经常是一次任务开一个。前面聊到一半走偏了,我不会硬撑,直接开新的。上下文里积累的乱七八糟的东西越多,模型越容易被带歪。这不是模型的毛病,这是我没有及时收手的毛病。
2.3 常见场景模板:写作、编程、办公、学习、数据分析
场景化是我给自己做模板的起点。每个人真正会反复用到的场景,其实没几个。我摸了大半年,常用的就那么五六类,每一类我都养了自己的一套模板。
写作这块,我用得最多。公众号长文、小红书笔记、短视频脚本、SEO 文章,每一类的结构都不一样。公众号我一般会让模型先出三个标题,再定大纲,再逐节展开。小红书我会要求它开头 30 个字必须抓住人,然后给三到四个加粗的分点,再配一段自然的收尾。脚本类我会明确要求它写出"几秒到几秒"的时间轴。同一段内容,交给不同类型的模板,出来完全是两个东西。
办公效率这块,说实话是我用得最舒服的。会议纪要、邮件、周报、PPT 大纲、Excel 公式,这些都特别适合交给模型。我用得最多的是会议纪要。我把自己随手记的乱七八糟的笔记丢过去,让它按"决议 / 待办 / 风险"三块整理,再补一句"任何没提到责任人的待办都标记为'待认领'"。模型回来的时候整整齐齐,我直接复制就能发。
邮件我也有一套自己的套路。让模型先判断这封邮件是"回复、汇报、还是说服",每种语气的落点不一样。回复类要短,汇报类要有结构,说服类要有铺垫。过去我写一封比较认真的邮件要二十分钟,现在十分钟能定稿。省下来的时间我可以去想邮件之外的事。
编程是我用得比较晚的一块。我身边做开发的朋友用得比我野多了。他们会让模型写代码、写测试、写文档,还会让它当"审查员",把刚写的代码再挑一遍毛病。我自己的用法更浅一点,主要是看正则、改报错、理解一段陌生代码。这块让我印象最深的是模型在被要求"指出这段代码可能出问题的三个地方"时,比我让它"写一段代码"表现得好很多。
学习场景我在第 1 章提过。我现在的用法主要有三种。让它用大白话解释一个概念,让它出几道由浅入深的练习题,让它扮演一个跟你对练的角色。第三种我用得最多,尤其是学语言的时候。我设定自己是初学者,它是耐心的对话伙伴,说错它会纠正,说对了它会继续下一步。
数据分析是我最近才开始认真玩的。我的用法是分三段。先让它把我给的原始数据字段含义理一遍,再让它算几个关键指标,最后让它用人话把结论讲出来,并指出它不确定的地方。第三段很重要,模型在讲故事这件事上很有天赋,不讲清楚边界,它可能就顺着漂亮的结论一路讲下去了。
我给自己定了一个规矩:每建一个模板,都要经过至少五个真实任务的使用。用得顺就留着,用得别扭就改。模板不是写完摆在那里好看的,它得跟着我的使用习惯一起长。
2.4 进阶方法:思维链、结构化输出、函数调用与工作流
我刚听说"思维链"这个词的时候,以为是某种很玄的东西。后来试了几次才发现,它说的是一件挺朴素的事:让模型把想的过程说出来。
我最初的问题在于,我总希望模型一步到位。题一上来就是答案,错在哪我都看不出来。后来我加了一句"请一步一步推理,再给结论",它的回答就完全不一样了。中间步骤摆在那里,我能看到它在哪里拐弯了。哪怕最后答案错了,我也知道错在哪个环节。
思维链有一个我很喜欢的变体,我叫做"先当反方,再当正方"。我让模型先站在反对我的立场上把话说完,再切回支持我的立场。两种视角一对照,我经常能发现自己原方案里的盲区。这个方法做决策的时候特别有用。
结构化输出是我认为投入产出比最高的一项技能。我早期从模型那里拿回来的东西,经常是一大段文字,我得手动整理半天。后来我开始要求它以 JSON、表格、或者固定字段的格式给回来,整理这一步几乎消失了。
举个我实际用过的例子。我让模型从一堆客户反馈里提取信息,最开始它给我的是十几条总结段落,我得自己归类。后来我把 Prompt 改成"请以 JSON 数组返回,每条包含:问题类型、严重程度、原文片段、建议动作",回来的东西我直接丢进表格,几分钟就能做分析。同一份材料,处理时间从一小时缩到了十分钟。
函数调用我会诚实地讲,这块我用得不算多,但身边做产品的朋友用得很多。简单说,就是让模型不只是跟你聊天,还能去"做点什么"。查天气、读文件、发邮件、调接口,这些动作模型自己做不到,但它可以判断"这件事应该交给哪个工具去做",然后输出相应的指令。用户感觉是在跟模型说话,后面其实跑了一整套流程。
工作流是我最近最上心的一块。一个人的任务,很少一步就能做完。写一篇 SEO 文章,前面要选题、要查关键词、要列大纲,中间要写正文,后面要审稿、要配图、要发出去。每一步我都养了一小段 Prompt,把它们串起来。串起来之后,我要做的动作就变成了"启动—检查—修改—放行"。
我把自己的工作流画在纸上过一次,画完发现有些环节其实不该交给模型。有些事情我认为必须自己判断,比如选题的价值、内容的立场、最终是不是要发。模型在这些环节上替我加快了速度,但做决定的还是我。这个分工我想清楚之后,整条流程才真正顺起来。
2.5 避坑指南:幻觉、歧义、提示注入、隐私与事实核查
我踩过的坑里面,幻觉是第一号。模型答得越流畅,我越容易放下戒心。有一次它给我引了一段"某位专家的原话",语气、姓名、时间地点都像模像样。我随手一搜,查无此人。从那之后,凡是涉及具体人物、数字、时间和 citations 的内容,我要么自己核,要么让模型明确标注"这段是常识还是可能有误"。
我现在有一条自己的小规则:让模型给结论,也让它给信心。我会附一句"如果你对某个细节不确定,请明确说出来,不要补充没有依据的信息"。加了这句之后,它输出的内容会变短,但可核查的比例高了很多。我宁愿要一段短而实的文字,也不要一段长而飘的。
歧义是另一个坑。我写过一句"帮我总结一下这个季度的情况",模型给我的东西五花八门,它自己也拿不准我到底要什么。同样的任务,我改写成"总结这个季度的三项主要成绩和两项主要问题,每项不超过五十个字",出来就清晰多了。歧义不是我表达能力的问题,是我自己也没想清楚要什么。
提示注入这个词,我做产品之前没怎么在意,后来发现它在日常使用里就会出现。你从网上复制一段文字贴进去让模型处理,里面可能藏着句"忽略前面的所有指令"之类的东西,整段对话就跟着跑了。我的习惯是遇到不熟悉的材料,先自己读一遍,把可能干扰的句子删掉再喂进去。花的功夫不多,稳当很多。
隐私这块,我现在的做法很简单。客户姓名、真实手机号、订单号、未公开的合同内容,这些我一概不进模型的对话窗口。要做分析的时候,我会先脱敏,或者干脆换成示例数据。这件事我给自己立了个死规矩。省下来的几分钟,换来的是不用半夜担心数据流出去。
事实核查这件事,我自己走过两个极端。一开始我完全信任模型,后来被坑了几次就不信了,什么事都自己再查一遍。那段时间效率低得可怕。现在的做法是分档:常识性的内容直接信,涉及我专业领域的内容用我的判断兜底,涉及外部数据的内容一定去查原始来源。把这三档分开之后,我既没以前那么容易被骗,也没那么累。
我还有一个习惯,偶尔会让模型反过来当审查员。我把自己写的一段内容发过去,让它挑毛病:事实有没有问题,逻辑有没有跳,语气有没有过。它挑得不一定都对,但经常能挑出我漏掉的地方。用模型来审模型,这个用法我觉得挺巧妙的。
坑是踩不完的。我现在的态度是,坑我照踩,但踩过的都记下来。记在笔记本上,下次看到类似的场景,就先把那几条规矩贴进去。Prompt 这东西没有毕业那天。用得越多,越知道自己哪块还嫩。
3.1 AI绘画 Prompt 的基本组成:主体、风格、构图、光影、画质
我第一次接触 AI 绘画,写下的第一句 Prompt 是"一只猫"。出来的图确实是一只猫,一只在任何图库里都能找到的、毫无记忆点的橘猫,坐在一块看不出哪里来的草地上。我盯着那张图看了很久,心里冒出来的问题是:我到底想让它画什么?这个问题我居然答不上来。
后来我在一个论坛上看到有人把 Prompt 拆成五块,我才算真正入门。主体、风格、构图、光影、画质。主体是你真正想画的东西,越具体越好。猫不行,一只蜷在旧书堆顶上的黑色短毛猫,左耳缺了一块,这个才有画面。风格是这张图的气味,是写实、是油画、是赛博朋克、是宫崎骏式的柔光。构图讲的是镜头站在哪,是俯拍、是特写、是仰视、还是视角稍微偏一点的不对称。光影是画面的空气,是清晨的冷蓝、还是黄昏的暖橙。画质这块最容易被忽略,但它决定了这张图是随手一拍还是精修大片。
我现在的习惯是这五块每块都写一点,不追求每一块都长,追求的是它们之间不打架。我曾经写过一张图,主体是"未来都市",风格写"超现实",构图写"鸟瞰",光影写"正午强光",结果出来的东西冷得像张建筑效果图。后来我把光影改成"雨后的黄昏,地面有反光",整张图忽然就有了呼吸。风格和光影这两块,是决定氛围的关键。
主体描述这件事我吃过一次教训。我写过"一位穿着漂亮裙子的女孩",出来的是一个摄影棚模特。后来我把"漂亮"删掉,换成"浅灰棉麻长裙,站在晒着被单的旧阳台上,回头看了一眼"。同一个主体,第二版的情绪就全部涌上来了。形容词是很虚的东西,AI 不太吃这一套,具体的物件、动作和场景它反而更懂。
构图这块我想多说几句。我发现很多人包括我自己刚开始时会忽略它,结果模型默认给你一个中规中矩的正中构图。加一句"低角度仰拍",画面立刻有了力量感。加一句"画面左侧留白",就有了海报的呼吸。加一句"浅景深,背景虚化",主体就被推到了眼前。构图是情绪的位置,你把这个位置定下来,一张图的气质就定了。
3.2 主流工具差异:Midjourney、Stable Diffusion、DALL·E、文心一格
这四个工具我都用过一段时间,感受完全不一样。用一句话讲我对它们的印象:Midjourney 是一位有审美脾气的美术指导,Stable Diffusion 是一位什么都能修但需要你懂点技术的老工匠,DALL·E 是一位听话的执行者,文心一格是一位中文语境下比较顺手的朋友。
Midjourney 我第一次用的时候有点惊讶。我写的 Prompt 挺潦草的,它给我的东西依然好看。它的审美倾向很强,出来的图往往有种"被艺术处理过"的味道。代价是它不太愿意老老实实听你每一个细节。你想要某一个特定的构图,它可能给你一个更漂亮的构图,但跟你说的不是一回事。它的 Prompt 更吃感觉,长句子的堆叠不一定比几个精准的词更有效。
Stable Diffusion 的体验是另一套。它给我最大的感觉是可控。你能调的参数多,能装模型,能装 LoRA,能接 ControlNet 把一张图的骨架直接搬过来。代价是你要学的东西也多。我第一次装它,光是把环境跑通就花了一个晚上。装好之后写第一段 Prompt,出来的东西又慢又奇怪,我才意识到我忘了选模型。它的学习曲线是这几个里最陡的,但你想精修、想量产、想有一致性,绕不开它。
DALL·E 我用得最多的是它的听话。我说"图里有一只穿红毛衣的柴犬坐在打字机旁边",它基本就给我这个。位置关系、数量、颜色,这些 Midjourney 容易自由发挥的地方,DALL·E 反而靠谱。它的问题是审美偏保守,出来的图有点"太干净",少了点意外的好看。我一般的做法是让 DALL·E 先出初稿,测试构图和内容,再拿去别的工具做风格化。
文心一格我用得比较晚,主要是为了处理中文元素的场景。写中文 Prompt 或者让画面里出现汉字的场景,它明显比国外几个工具顺。它对国风、水墨、工笔这类东方审美也有一些现成的理解,我写"江南小巷,烟雨,青瓦白墙"的时候,出来的东西比在 Midjourney 里写同样句子更贴近我脑子里的画面。
这四个工具我现在的分工是这样的:Midjourney 用来找灵感和出风格图,DALL·E 用来做内容验证和插图初稿,Stable Diffusion 用来做精修和批量产出,文心一格用在中文本土味特别重的项目上。没有哪一个能覆盖所有需求。知道它们各自的脾气,比死守一个工具重要得多。
3.3 权重、参数与语法:::、--ar、--style、CFG、Steps、Seed
我一开始对参数这个东西有点抗拒。Prompt 都还没写顺,就要背这么多符号,我觉得挺烦的。后来有一次我死活出不来我要的竖构图,一直默认给我方形,朋友看了一眼说,你加个 --ar 9:16 不就完了。那一刻我才意识到,参数不是炫技,它是让你少走冤枉路。
:: 这个符号我第一次见到的时候完全没看懂。后来明白它是用来调权重的,在 Midjourney 里,写 猫::2 月亮::1,意思就是猫的分量比月亮重一倍。我以前调权重全靠一遍遍换词序,换了十几次都调不到位。有了这个符号之后,调整就变成了加法减法,直观多了。权重的意义在于,它让你能跟模型"谈比例",而不是碰运气。
--ar 是长宽比。这个参数我用得最频繁。竖构图 9:16 用来做手机壁纸和短视频封面,16:9 用来做 PPT 和电脑壁纸,1:1 用在头像和电商主图上。 --style 是风格倾向,不同版本里它的选项不一样,常用的有 --style raw,出来的东西更接近原始相机感,少了点 Midjourney 自带的滤镜味。做写实稿子的时候我很喜欢这个。
Stable Diffusion 那边的参数体系又是另一套。CFG 是我理解最久的一个。它管的是模型"多听你的话"。CFG 太低,画面自由得像梦游;CFG 太高,颜色容易炸,画面对比变得不自然。我常用的区间是 7 到 11 之间。Steps 是迭代次数,不是越高越好。我试过 60 步和 30 步的对比,很多图几乎看不出差别,时间却多了一倍。日常用 20 到 30 步就够。Seed 这个参数我很喜欢,它相当于这张图的身份证。我把一张图满意的 Seed 记下来,用同一个 Seed 稍微改几个词,出来的图会带着同一个基因。这个用来做系列图太合适了。
参数这件事我踩过一个坑:我以为写得越多越专业。有一张图我塞了七八个参数进去,结果画面乱七八糟,我自己都不知道哪个参数在打架。后来我学会了只留必要的两三个。参数是佐料,不是主菜。加太多,主菜的味就尝不出来了。
3.4 风格控制与参考图:艺术家、流派、镜头、材质、渲染器
风格控制是我在这条路上花的功夫最多的一块。刚开始我只会写"油画""水彩"这种大类的词,出来的东西挺像那么回事,但总觉得少了点什么。后来我才发现,风格是可以拆得细的。艺术家、流派、镜头、材质、渲染器,这几个维度每一个都能拉出一大片空间。
提到具体艺术家名字这件事,我心情有点复杂。直接写某位艺术家的名字,模型确实能抓住那种质感,出来的东西又快又准。后来我看了一些讨论,开始意识到这对还在世的创作者是一种不太公平的借用。我现在的做法是写风格特征,而不是写名字。比如我会写"厚重的笔触、克制的暖色、边缘模糊的人像",而不去直接点名。效果可能没那么一秒到位,但我会写得安心一些。
流派这个词我开始的时候只认识"印象派""超现实主义"这种。用得多了才发现流派的颗粒度很细。装饰艺术、包豪斯、黑色电影、蒸汽波、粗野主义、Y2K 美学,每一个都是独立的视觉世界。我做过一张复古科技感的封面图,用了"蒸汽波 + 80 年代广告字体",出来一整个年代的味道。流派的好处是它自带很多约定俗成的视觉元素,你写一个词,模型给你拨动一串画面。
镜头是很多新手忽视的一块,但它对写实感的影响巨大。35mm 是街拍的视角,85mm 是人像的视角,24mm 是广角的张力,微距可以拍出细节的震撼。"浅景深""大光圈""长焦压缩"这些摄影术语模型都懂。我做过一组美食图,加了"俯拍、微距、浅景深"之后,出来的图立刻有了杂志感。把 AI 当成一位摄影师来对话,很多问题就通了。
材质和渲染器是风格的最后一层。材质讲的是表面的质感,玻璃、陶瓷、金属、织物、毛皮、混凝土,每一种都能改变画面的温度。渲染器是个挺专业的词,Octane、Unreal Engine、Redshift、Blender,这些是三维渲染软件的名字,写进 Prompt 里能让画面有那种高级的 CG 质感。我用"Unreal Engine 渲染"做过一张未来场景图,出来的光比我自己描述一堆光照参数都要真实。
参考图这个功能我最近才开始认真用。Midjourney 里的 --sref 可以把一张图的风格直接搬过来,Stable Diffusion 里的 ControlNet 可以把一张图的骨架、姿势、深度信息搬过来,各司其职。我做过一个系列头像项目,就是先定了一张风格参照图,后面所有图都用同一个风格代码,出来的一套图风格是统一的。这件事纯靠写 Prompt 是做不到的。
3.5 负面提示词与迭代优化:修图、局部重绘、批量生成
负面提示词,我第一次听说的时候觉得这个想法挺妙。正向提示词是告诉模型"我要什么",负面提示词是告诉它"我不要什么"。我刚开始用的时候写了一长串,什么 ugly、bad anatomy、low quality 全堆上去,反而把画面搞得拘束。后来我才明白,负面提示词不是越多越好,它对症。
我常用的一组负面词是有限的。多人场景我会加 extra fingers 和 extra limbs,做写实人物我会加 plastic skin 和 over-smoothed,做风景我会加 oversaturated 和 HDR look。每个领域的坑不太一样,我在哪个领域踩过坑,就往负面提示词里加那一类。这个列表我是慢慢养起来的,不是一次写成的。
迭代优化这块,我要认真讲。我刚开始做 AI 绘画的时候,一张图出一版就换 Prompt,来回折腾十几版。后来我才意识到,改图和重画是两件不同的事。一张图 80% 是对的,我其实不需要重画,我只需要改那 20%。局部重绘就是干这个的。Stable Diffusion 里的 inpainting,Midjourney 里的 Vary (Region),都是拿一块区域单独处理。我做过一张海报,主体都好,就是右下角花瓶比例不对。我用局部重绘框住花瓶修了一次,整张图就稳了。过去我会因为一个细节丢掉一张本来很好的图。
批量生成是我做商业项目之后才真正用起来的。做一套 9 张的电商图,如果你一张一张手动调 Prompt,节奏会崩。我现在的做法是先用一张图把风格、构图、光影调到位,然后固定住 Seed 和风格参数,只替换主体描述,让模型批量跑十几张。我再从里面挑。这个过程有点像冲胶片,一卷下来有几张能用的,但效率完全不是一个级别。
修图这件事我还想说一句。AI 出来的图不是永远有问题的,有时候只是"差一口气"。我常用的动作是重新跑一遍,把 Seed 换一下,其他不动。同一段 Prompt 换几个 Seed,输出的东西往往差很远,有时候某一个 Seed 就是能给你那种感觉。这是一件挺省事的操作,比大改 Prompt 划得来。
我做了大半年 AI 绘画,最大的体会是它跟写文字 Prompt 是两套思维。文字 Prompt 更看重逻辑和结构,绘画 Prompt 更看重感官和具体。你要把脑子里的画面翻译成模型能懂的语言,这本身就是一种表达练习。我经常自己看着一段 Prompt 想,这要是给一位画师讲,他能不能画出我要的东西。如果我自己都讲不清,模型当然也画不出来。
坑我在这里也踩了很多。写过互相冲突的风格词,写过一个画面里塞了三个主体,写过一堆玄乎乎的形容词,出来的东西跟我想要的一点都不沾边。我现在越来越相信一件事,绘画 Prompt 的进步不来自背词表,而来自一次次看图时问自己:我到底想表达什么。这个问题想清楚之后,写什么,怎么调,都会变得清楚。图像不是文字的附属品,它有自己的一套表达方式。我得先学会看,才能学会说。
4.1 经典框架:角色-目标-上下文-约束-输出格式
我写过大概两千多条 Prompt,真正让我水平上一个台阶的不是某个技巧,而是一个框架。角色、目标、上下文、约束、输出格式,这五块我第一次见是在一篇英文博客里,当时觉得有点教条,像公司里那种填表式的流程。用了一段时间之后,我改主意了。它不是我写 Prompt 的模板,它是我写 Prompt 之前的思考清单。
先说角色。我早期写 Prompt 从来不给角色,直接就是"帮我写一段文案"。出来的东西平庸得像会议室里的白开水。后来我加了一句"你是一位有十年经验、做过消费品牌的文案"。同一件事,输出的语气、用词、案例密度全部变了。角色这个词起的作用,是把模型从"什么都知道一点"拉到"某个领域的专业人士"那个位置上。我经常用的角色有:资深编辑、临床医生、Python 工程师、投资分析师、小学语文老师。给角色的过程,其实也是我在问自己:这件事该由谁来做。
目标这一块,很多人写得含糊。我自己也含糊过。我写"帮我分析这份报告",模型分析了,但分析出来的东西跟我想要的方向差了十万八千里。这个问题出在我没说目标。目标是"找出这份报告里对未来三年的增长预测有哪些隐含假设",还是"用小学生能听懂的话讲一遍",这是两份完全不同的输出。我现在的习惯是写完 Prompt 之后回头看一眼:我看完这段,能不能知道它最后要交付什么?不能就补上。
上下文我一开始觉得是废话。模型又不认识我,给它讲背景有什么用。后来我做一个职场报告的时候被打了脸。我让它写"关于裁员的沟通方案",出来的方案特别冷。我补了一段上下文:这家公司是一家创业公司,团队成员平均共事三年,老板跟员工私交都还不错。整个方案的调子立刻就软下来了。上下文是你给模型的那个"现场"。没有现场,模型只能按平均值来,平均值就是没有性格的中国平均值。
约束是很多人漏掉的一块。我早期写 Prompt 也不太爱加约束。"字数控制在 800 字以内"、"不要用行业术语"、"只给三个选项,不要展开"、"不要用比喻"。这些看起来是限制,其实是让输出真正可用的那一层。我做过一段时间的公众号排期,一整天的稿子全靠自己改格式,后来学乖了,Prompt 里加了一句"输出为可直接复制到公众号编辑器的 Markdown,二级标题用 ## ,不要用一级标题"。每天省下来的时间很可观。
输出格式往往是最省事但收益最高的一块。我见过太多人抱怨模型输出的东西一坨。你让它给一个表格,它给你一段话;你让它给 JSON,它给你一个语法坏掉的 JSON。只要你明确写出输出格式,情况会好很多。"用一个三列的表格"、"输出 JSON,字段是 title、summary、tags"、"用编号列表,每条不超过二十字"。格式定下来,后面的自动化、二次处理、复用才有可能。我写 Prompt 写到后面越来越觉得,框架这五块不是给你照抄的,是给你自查的。写完一段 Prompt,拿这五块对一遍,哪块缺了补哪块,输出质量就稳了。
4.2 从模糊到具体:任务拆解、变量替换与示例设计
我最开始用 AI 干活效率很低,原因不是 Prompt 写得不好,是任务本身就没想清楚。我拿到一个"帮我写一份年度总结",扔给模型,它给我一份面面俱到又什么都不是的东西。我那时候有点烦,觉得这工具不行。我朋友看了看我的 Prompt 说,你自己都不知道你要写什么,它凭什么知道。这句话挺扎人,但确实是实话。
任务拆解这件事,是我从写代码的人那里学来的。一个大任务直接丢给模型,它只能给你一个平均水平的东西。把它拆成几个小任务,每个任务专注做一件事,质量会猛地上一个台阶。我现在的做法是,写年度总结分四步:先让模型列出这一年我可能涉及的六个方向,我挑两到三个;再让它针对每个方向列三个关键事件;再把这些事件扩写成段落;最后把段落拼起来并且调语气。这四步每一步我都能干预,每一步的输出我都能看。整体质量比一步到位强太多。拆解的好处不在模型,在你自己。拆解逼着你把脑子里的模糊需求变成一个清晰结构。
变量替换是另一个让我效率翻倍的思路。我开始的时候是同一个 Prompt 复制粘贴,每次改里面的业务名字。后来我意识到,那些来回改的地方就是变量。我把 Prompt 写成一份带占位符的模板,比如"请为【公司名】写一份面向【目标读者】的【文案类型】,重点突出【核心卖点】"。我只要替换这几个方括号里的词,一份新 Prompt 十秒就好了。变量这个思路可以用在很多场景:行业、平台、语气、长度、受众。一份模板,几十个变体,成本几乎不变。
示例设计是我花时间最多的一块。给模型一两个例子,它抓规律的能力会明显变强。但这事有个坑。我一开始给的例子太长、太复杂,模型反而学乱了。后来我发现例子的关键不是完美,是结构清晰。我一般给两组对照:「好例子」和「坏例子」,然后告诉模型好在哪里、坏在哪里。做文案分类任务的时候,我给三条正面样本、三条负面样本,让模型先总结规律再执行。它做出来的准确率比只给正面样本高一大截。
少样本这件事我最近还有一个体会。如果你的任务有隐含的"格式味",两三个例子比文字描述管用得多。我想让模型输出的方案格式统一,与其写一堆"注意编号、注意层级、注意不要用冒号",不如直接给两份已经排好版的方案。模型读的是模式,不是说明。给模式比给说明效率高。
从模糊到具体,本质上是把你自己脑子里的东西一件一件拎清楚。写 Prompt 写到后面我发现,真正花时间的从来不是打字,是把这个任务想明白。想明白之后,写 Prompt 就快了。那些卡了很久的 Prompt,几乎都是因为我自己没有想清楚要什么。
4.3 提示词模板库与版本管理:命名、分类、复用
我在头几个月写过很多好用的 Prompt,问题是过了一段时间之后就找不到了。我那时候把它们散在备忘录、微信收藏、各种聊天记录里。等到要复用的时候,靠翻聊天记录捞回来,一半都捞不到了。这件事让我特别烦,但也逼着我开始做自己的 Prompt 库。
命名这块我踩过很多坑。我最早的命名是"文案1""文案2""文案 3 修改版",两个月以后我自己完全看不懂哪个是哪个。现在的命名是我的习惯:用【场景】-【核心动作】-【版本号】的格式。比如「公众号-开篇爆点-v3」、「周报-技术团队-数据段-v2」。名字本身不用长,但要能让你在看不打开文件的情况下知道里面是什么。名字是给未来的自己用的,不是给现在的自己用的。
分类这件事我也是折腾了几次。我试过按工具分(ChatGPT、Claude、绘画),也试过按字数分,都不好用。最后我用了三个维度:按用途分(写作、编程、办公、学习、分析)、按场景分(工作、生活、创作)、按强度分(快速稿、精修稿、深度稿)。这三个维度看起来有点重复,但实际用起来刚好对得上我找 Prompt 时的思路。我找 Prompt 的顺序一般就是"我要写什么 → 用在什么场合 → 需要多认真"。这三个维度搭起来就很顺。
复用这件事我想认真讲。很多人以为做 Prompt 库就是把好的存下来,然后到处粘贴。这样用其实是没用的。复用真正的价值,是让你在每一个新任务上不重复做基础决策。你知道最好的开篇方式有哪几种,你知道什么样的收尾最有效,你知道哪些约束是普适的。这些知识沉淀下来,你写 Prompt 的起点就一直在抬升。我现在的模板库大概有一百多条,常用的其实只有二三十条。剩下的那些是为了让我在遇到不常见场景时还能翻出来用。库不在于大,在于你信它、用它。
版本管理这块,我吃过血的教训。有一次我改了一份特别顺手的 Prompt,改成另一个版本,觉得更好,就把原来的删了。一周后我发现新版本在某些场景下不灵,想回退到旧版本,回不去了。我现在所有的 Prompt 都留版本号,新的和旧的同时存在。我用一个非常土的办法管理:每一条 Prompt 底下的注释里写清楚「v3 相对 v2 改了什么、为什么改」。一段话就够,但过一个月回头看,这些注释比 Prompt 本身还值钱。我踩过的坑就是我的收获,留下来的注释让我不会踩第二次。
做库这件事我还想补充一句。不要追求一步到位。库是养的,不是建的。你每做一次任务,把它里面用得上的东西挑一点出来,加进库。慢慢它就厚起来了。我第一版库只有七条,现在一百多条,都是这么长出来的。
4.4 评估与调优:准确率、相关性、创造性、成本与速度
评估这件事是我最难坚持的。写 Prompt 最爽的时候是它出来一个特别满意的结果,最难熬的时候是要坐下来一条一条比较哪份更好。我早期完全靠感觉,觉得这个好就用这个。后来做商业项目我才被迫开始做评估。项目的场景是客户要一套产品文案,我要从十版里挑一版。我那时候才发现,凭感觉挑出来的,往往是我自己最偏爱的,不是最合适的。
我现在的评估一般看四个维度。准确率是最基础的一个。它是不是答对了我问的东西,有没有胡说八道。做事实型任务的时候,这个维度权重最高。相关性是它有没有答在我真正关心的问题上。这个维度经常和准确率打架,一个回答可以全对,但没回答我真正想问的。我做过几次信息查询任务,模型的回答每一条都正确,但都浮在表面。那就是不相关。
创造性这个维度比较特殊,它不是越高越好。写概念稿、做头脑风暴的时候,我需要模型给出跳脱的答案,创造性权重就高。写合同、写报销政策、做数据分析的时候,我需要模型安安分分待在常识里,创造性太高反而是噪音。我现在的做法是给每个任务定一个"创造性档位"。高、中、低,三档。写 Prompt 的时候就按这个档位调语气和指令。
成本和速度这两个维度在我日常工作里越来越重要。做得多了以后我发现,并不是每一次任务都需要最强模型出最精致的答案。批量处理一些简单的分类、格式化、改写任务,用便宜快速的模型完全够。复杂的推理、需要长上下文、需要多步规划的任务才用强的模型。我做的排版稿子、数据标注稿子这类工作,用的都是小模型,一天能省下不少钱。这不是抠门,是让资源花在刀刃上。
调优我的方法是通过对照。同一份 Prompt 改一个点,其他不变,跑两到三遍,看差异在哪。有一次我调一个 SEO 文章的 Prompt,改的是"约束"那一块,从"1500 字左右"改成"1600 到 1800 字,分三个部分,每部分不超过 600 字"。文章质量立刻稳下来了。字数约束看起来小,其实是在逼模型做结构决策。改一个变量看效果,是调优唯一靠谱的方法。同时改三个地方,你连哪个起了作用都不知道。
评估和调优这件事说起来有点反直觉。它费时间,又没有立竿见影的快感。我见过很多人写 Prompt 从不做评估,靠感觉改,结果一直在原地打转。想做得比别人好一点,就得接受这种看起来低效的重复。
4.5 多轮对话与工作流编排:让 Prompt 融入真实流程
我早几年用 AI 有个毛病,喜欢一段 Prompt 解决所有问题。写一篇文章,我想在一段话里把选题、结构、语气、字数全说清楚,让它一次给我一个成品。这样做当然也能出东西,但出来的东西总隔着一层。我后来才慢慢接受一件事,真实的活都是一轮一轮聊出来的。
多轮对话的关键,是让每一轮都承担一个明确的角色。我写一篇文章,第一轮聊选题,第二轮聊大纲,第三轮把大纲展开成要点,第四轮才正式写。每一轮我都只看那一轮的结果,不满意就重来,满意了就推进。这样做比一段 Prompt 写到底慢一点,但可干预、可重来、可复用。我做过一篇很满意的深度稿,从对话记录里把每一轮最好的那版摘出来,直接存成模板。下次同类型的稿子,我从这个模板开始,省下大半时间。
多轮对话还有一个坑,我踩了很多次。模型会遗忘。聊得时间长了它开始前言不搭后语,前面定的规则后面就违反了。我现在的做法是不断给一个"当前状态包",简短地把已经确定的结论、约束、风格重复一遍。这个动作有点烦,但省下来的返工比这个烦要多得多。我会在每一轮开头加一句"接下来请遵守以下已确认的规则:一...二...三...",把它当作每次开会前的议程复习。
工作流编排是我最近才开始认真做的一件事。它跟多轮对话不太一样。多轮对话是我和模型来回聊,工作流是我把一段段 Prompt 串成一条流水线,让中间环节自动跑。我做过一个内容生产的工作流:输入一个关键词,第一步让它生成五个选题,第二步按评分挑一个,第三步生成大纲,第四步生成初稿,第五步做 SEO 修改,第六步生成标题。这六个 Prompt 我都固定好了,中间加了一点筛选规则。跑出来一条内容只需要我最后审一遍。
有些工作流我是用现成工具搭的。Zapier、Make、n8n 都能把大模型的 API 串起来用,还能接表格、邮件、Notion。我用 n8n 搭过一个每周自动收集行业资讯、生成周报草稿、发到邮箱的工作流。每周三早上我打开邮箱就有草稿,我改一遍就发出去。省下来的时间不多,一天可能就一小时,但省下来的那点心力特别舒服。你不用再每周想着这件事。
工作流这件事我还有一个更朴素的观察。它逼着我把每个环节的标准写清楚。以前我靠手感判断一段稿子好不好,现在我要写出"好"的定义,才能把它写成 Prompt 里的判断条件。这个过程很难,但做完一次,你对这个任务的理解就上了一个台阶。Prompt 写得越久我越觉得,真正在打磨的不是 Prompt,是我对这件事本身的理解。
把 Prompt 融进真实工作流程这件事,还有一个我最近想明白的点。不要为了自动化而自动化。有些环节手工做反而更好,判断、取舍、拍板,这些事不适合交给流水线。我让模型做的是收集、起草、改名、格式化、生成变体这些重复动作。决定方向的部分我全都留给自己。这样的分工我用了一两年,暂时没打算改。流水线负责跑量,人负责把关,各干各擅长的事,出来的东西质量才稳。
四章写到这里,我回头看,这五节讲的东西其实可以归结成一句话:把写 Prompt 从碰运气变成一套方法。框架让你想清楚,拆解让你做得细,库让你不用重来,评估让你看得清,工作流让你跑得远。这些方法本身不炫,甚至有点笨,但用过一段时间之后你回头看,你和那些还在碰运气的人,已经不在同一条路上了。
5.1 内容创作:公众号、短视频脚本、SEO 文章与标题
我在内容这一块用 AI 用得最久,踩的坑也最多。公众号、短视频脚本、SEO 文章、标题,看着都是"写字"这一件事,可它们对 Prompt 的要求差别大得惊人。我一开始不懂,用同一套 Prompt 打天下,结果公众号的稿子读起来干巴巴,短视频脚本又太像书面报告。后来我把它们拆成四条不同的线路,每条线路单独养一套 Prompt,事情才顺过来。
公众号这块我最在意的不是文笔,是开篇那三秒。我给模型的第一条指令永远是「先写三个开篇方案,不要展开正文」。开篇出来之后我挑一个,再让它续写。这个顺序我试过很多次,先出正文最后配开篇的做法,出来的东西头重脚轻。正文部分我一般加一句「每段不超过四句话,不要用小标题,用口语,不要用排比」。我这人写稿讨厌套路,模型天生爱用套路,约束得写死。结尾我让它给一个「可被引用的一句话总结」,方便读者转发。
短视频脚本是另一套玩法。它的 Prompt 里我会写清楚:时长、平台、目标人群、口播还是剧情、要不要钩子、几点几秒出转折。我做过一条很受欢迎的带货脚本,Prompt 里我硬性规定了「前 3 秒必须有数字或者冲突,第 8 秒切入产品,第 20 秒给优惠,最后 5 秒引导评论」。这些时间点本身不是玄学,是我拆解了几十条爆款之后提炼出来的节奏。模型只要按这个节奏填内容,出来的东西就八九不离十。
SEO 文章我最看重的是结构和关键词密度。我一般让它先给关键词簇,再按主关键词生成大纲,每级标题里都埋进去。正文我会给一个字数区间,怕它写飘。有段时间我忽视字数约束,它给我写了 4000 字,读到一半我自己都累了。点击率高的 SEO 文章不靠长,靠信息密度,这是 Prompt 里得直接讲的道理。标题我会让它一次给二十个,按 CTR 预估排序,然后我自己挑。
5.2 办公效率:会议纪要、邮件、PPT 大纲、Excel 公式
办公场景里我用得最狠的是会议纪要。以前我开完会要花四十分钟整理,现在录音转成文字扔给模型,五分钟出结果。我的 Prompt 大致是这样的:你是一位资深项目经理,请把以下会议记录整理成结构化纪要,包含参会人、核心结论、待办事项、责任人和截止时间,输出 Markdown 表格。有了这段话,出来的东西能直接粘到飞书文档里。缺了责任人和截止时间这两项,纪要就是一堆废话。
邮件这块我有个习惯,每次都要在 Prompt 里写清楚「收件人是谁、跟我的关系、这封邮件的目的是什么」。同一件事写给老板、写给客户、写给同事,用词和气场完全不一样。我写的 Prompt 一般是:帮我写一封给【客户】,目的是【催付款】,语气【礼貌但坚决】,不要超过 150 字。这么短的一段话出来的邮件,比我手写还准。我后来把这套 Prompt 做成模板,常用的七八种邮件我全存下来了,每次只替换方括号里的东西。
PPT 大纲我的用法有点特别。我不直接让它写大纲,我先让它「列一份 12 页汇报该覆盖的问题清单」,然后把清单里我认可的问题挑出来,再让它按顺序组织成大纲。这样出来的大纲逻辑顺,不会漏关键点。Excel 公式我用的方式更简单,直接把需求讲清楚,把列名告诉它,让它输出公式然后解释一遍每一段在做什么。我用这套方法学会了 XLOOKUP 和几个嵌套 IF,之前看书看不进去。
5.3 编程开发:代码生成、调试、单元测试与技术文档
写代码是我用 AI 最频繁的地方。我一般是先讲清楚技术栈、目录结构、要做什么、输入输出,再让它给一版代码。我有一次让模型写一个 Python 脚本处理 CSV,光说"处理一下这个 CSV",出来的东西根本不能用。后来我把列名、字段类型、目标输出格式全写进去,一次就对了。写代码这件事,模型不怕要求多,怕要求糊。给得越具体,出来的代码越像人写的。
调试是我觉得收益最大的场景。我把报错信息、相关代码、我已经试过的方案一起扔给模型,让它先分析原因再改。这一段 Prompt 我会写得比较长,因为我发现它喜欢跳步。我一般这么写:请先不要直接给我修改后的代码,先列出三个可能的原因,按可能性排序,每个原因配上验证方法。它按这个顺序走,我就不容易拿到一堆"看着对"其实没治好病的改法。挑准原因之后再让它改代码,成功率高得多。
单元测试是我最近才开始用 AI 大量做的。我给的 Prompt 里会明确写上覆盖率目标、测试框架、要不要 mock、要不要边界情况。写了一套支付相关的测试之后我发现,它给的边界情况比我脑子里能想到的全。技术文档我一般是让它读代码再写,Prompt 里加一句「假设读者是刚入职的工程师,不要用行业黑话,每一段先讲这个模块解决什么问题」。出来的文档我看过几份,比我们团队之前手写的清楚。
5.4 AI 绘画实战:头像、海报、电商图、概念设计
AI 绘画这块我玩的时间不算长,但头像和海报这两类我摸得比较熟。头像的 Prompt 我一般会写:主体、风格、色调、背景、构图、镜头,六块全写出来。我给自己做过一版头像,Prompt 大概是:亚洲男性,30 岁,商务休闲,柔光,浅灰背景,半身构图,85mm 镜头,胶片质感。这一句话出来四个版本,我挑了一个。头像这件事最忌讳含糊,你写"好看"它给你一张网红脸,你写"商务休闲"它才给你一个具体的人。
海报就复杂一些。海报属于有明确用途的图,得留文字位、留视觉重心、得符合品牌调性。我做一张活动海报的 Prompt 里会写:留出左上角排版区,主视觉在右下,色调和品牌主色一致,风格参考某类设计流派。参数上我常用 --ar 3:4 控制比例,用 --style raw 减少它自带的美化。海报这个场景我一般不指望一次出图,先出 8 张看方向,挑一张出来做参考图,再用 --sref 或者垫图继续修。
电商图和概念设计的思路差得远。电商图讲究真实、干净、把产品拍好看,Prompt 里我强调材质、打光、干净背景、不要多余的装饰。概念设计反而要放开一点,我一般会写「不要参考现实」或者不给风格参考,让它自由发挥,出来一些奇奇怪怪但有意思的东西。我做过一组未来城市的图,Prompt 里我写了"废土、赛博、塔楼、黄昏、电影感",出来的东西给了我做副业项目的灵感。这两类图不能说哪个 Prompt 更好,看你是要精确还是要惊喜。
5.5 教育与学习:知识讲解、题库生成、语言学习与陪练
我拿 AI 给自己讲过很多知识。学一个陌生领域,我用得最多的 Prompt 是:请用费曼学习法给我讲【主题】,先讲核心概念,再讲一个类比,然后给一个反例,最后出三个自测题。这段我用了两三年,从区块链讲到博弈论,都能听明白。它讲概念的时候有时候太抽象,我就在后面加一句「请假装我是高中生,不要用专业术语,如果必须用,先解释」。加了这句之后,讲解质量提升特别明显。
题库生成我是给孩子和同事用的。我给的 Prompt 会明确考核点、难度分级、题型比例,还有"干扰项要合理但错误"。以前我自己出题,干扰项写得没意思,选不出真的不会的人。让它出完之后,我会让它把每一道题的错误选项对应哪个常见误解标出来。这么一份题做下来,比一般的练习册还针对性强。做老师的朋友拿我这套 Prompt 出了一学期的周测卷。
语言陪练是我最近玩得最开心的一类。我练英语口语,用的 Prompt 是:请你扮演一位耐心但严格的英语陪练,我们每次对话你只纠正三个最重要的问题,先继续对话,一轮结束再一次性给我纠错。这个结构很关键,不然它每次都打断你,谈话根本进行不下去。练了大概三个月,我敢跟外国同事在视频会上直接开口了。语言这件事我以前靠背单词和看剧,进步特别慢,有了陪练之后节奏完全不同。
这五个场景走下来,我越来越体会到一件事。Prompt 写得好的标准不在于长,而在于你有没有把这个场景里真正难的地方写进约束里。内容创作难在节奏,办公难在格式,编程难在细节,绘画难在控制,教育难在适配。把这些难点抓准,你的 Prompt 就比别人的有用。场景会变,抓难点这件事本身不变。
6.1 学习资源:课程、社区、提示词库、论文与案例集
我刚开始学 Prompt 那阵子,最抓狂的不是不会写,是不知道去哪儿找靠谱的东西。网上搜出来的文章一大半是「10 个神级提示词」,点进去看完,收获就是几条别人写好的句子,换个场景就废了。我走了差不多半年弯路,才慢慢摸出几类真正能喂饱自己的资源。这半年时间不算浪费,我至少学会了怎么分辨一份资源值不值得读。
课程这一块,我买过五六门,真正看完的只有两门。一门是讲基础结构的,把角色、任务、上下文、约束、输出格式拆开讲,每节课配练习,逼着你动手改。另一门是讲评估的,教你怎么用一批固定测试用例去比较不同 Prompt 的效果。前一门帮我搭骨架,后一门帮我长肌肉。那些语速飞快、案例一堆、听完不知道该怎么落地的课,我基本半路就弃了。我现在挑课有个笨办法:先看它的作业是什么,作业比讲课更能说明这门课想让你学会什么。
社区是我花时间最多的地方。Reddit 的 r/PromptEngineering、Discord 上几个活跃的 Prompt 群、还有国内的几个知识星球,我每天会刷半小时。社区的价值不在干货,在于你能看到别人踩的坑。我上次在群里看到有人吐槽 Midjourney 出的图总是多一只手,底下一堆人接话,我才意识到这是一个高频问题,回头专门去研究负面提示词。有段时间我状态不好,写不出东西,也是靠刷社区重新找回手感。
提示词库我建议把它当字典用,不当答案用。我收藏了四五个库,加起来几万条 Prompt,常用的就那几条。真正有用的是库的结构。一个分好类的库能告诉你「原来这个场景也有人写 Prompt」,帮你打开思路。论文和案例集更值得细读的是那些对比实验,同一句话换一个动词,输出质量就能差一截,这种细节光靠感觉悟不出来。我在 arXiv 上看过一篇讲提示词敏感度的论文,看完之后写 Prompt 谨慎了很多,每一个词都要想一下它会不会带偏模型。
6.2 提示词工程师的能力模型与职业路径
我第一次听到「提示词工程师」这个词的时候,心里其实有点发虚。一个看起来像打字员的工作,真有职业门槛吗。做了两年我改口了。这个岗位门槛不低,只不过门槛不在打字速度上,在四件事上:能不能把模糊需求变成清晰任务,能不能判断模型的输出好在哪差在哪,能不能把一条 Prompt 变成可复用的工程资产,能不能跟业务方把话说清楚。
这四件事怎么理解。把模糊需求变成清晰任务,说的是你听到「帮我写个产品文案」这种话的时候,能追问出目标人群、渠道、篇幅、语气、禁用词。判断输出好坏,说的是你能给出一套自己的评分维度,而不是靠「感觉不太行」。变成工程资产,说的是你写的不是一次性 Prompt,是一份能被人复用、能版本管理、能接进流程的东西。跟业务方沟通,说的是你能把技术语言翻译成人话,让非技术同事知道你这个方案能省多少时间。
职业路径这块,我看到的几条分岔挺清晰。一条是往产品方向走,做 AI 产品的需求定义和体验设计。一条是往工程方向走,做 Agent、RAG、工作流编排这种偏技术的事。还有一条是往行业方向走,做某个垂直领域的 AI 应用,比如法律、医疗、教育。我自己走的是第三条。行业内的人优势是什么,是你知道这个行业内行话怎么说、坑在哪里、甲方真正在意什么。模型不难学,行业经验很难补,这是我选这条路的原因。
我给想入行的朋友的建议一直是一句话:别急着考证书,先做一个能拿出手的项目。做一个自动整理客户反馈的 Prompt 工作流,做一个帮团队写周报的小工具,做一个垂直领域的问答助手。项目做出来之后你自然会知道缺什么,然后再去补。招聘方看的也不是你背了多少框架,是你能不能拿一个具体的例子说清楚,你解决了什么问题,中间试过什么,最后为什么那么写。
6.3 安全、伦理与版权:偏见、隐私、商用风险与合规
这块我吃过一次不小的教训,从那之后我对所有涉密内容都格外小心。几年前我图省事,把一个客户的内部资料整段复制进了 AI 对话框里,让它帮我整理。当时完全没想那么多。后来公司合规培训提到这件事,我背后一凉。客户资料、员工信息、未公开的财务数据,这些东西一旦进了公网模型的对话,你就没法把它收回来。我现在处理这类内容要么用公司自建的内网模型,要么先把敏感字段全部替换成占位符。
偏见这件事我是从生成内容里慢慢发现的。让模型描述「一个护士」,出来大多是女性;写「一个 CEO」,出来大多是中年男性;描述某些国家的场景,配图总带着刻板印象。这不是模型有恶意,是训练数据里本来是这么分布的。我现在的做法是在 Prompt 里主动打破,比如写「随机性别、多种族背景」,或者干脆自己给具体设定。做面向大众的内容时这一步不能省。我做过一组人物素材,一开始全是同一种审美,被同事提醒之后重做了一版,感觉清爽多了。
版权和商用风险是另一件容易忽视的事。AI 生图能不能商用、生成的文字有没有可能撞上别人的作品、用了某个艺术家的名字做风格参考合不合适,这些问题没有一刀切的答案。我的习惯是:商用项目尽量用官方明确授权的工具,风格参考尽量用流派和媒介而不是在世艺术家的名字,重要稿件一定人工过一遍再发布。有些公司会要求保留 Prompt 和生成记录备查,这个要求我觉得挺合理,出了争议至少能证明你是怎么做的。合规这件事麻烦,但放着不管,麻烦会自己找上门。
6.4 多模态与 Agent 时代的 Prompt 趋势
我做第一个 Agent 项目的时候,心态跟做普通 Prompt 完全不同。普通 Prompt 是「我问它答」,Agent 是「它自己决定下一步做什么」。这件事带来的变化很大。你不再需要把每一步都写得那么细,但你需要把工具描述写清楚、把终止条件写清楚、把失败之后怎么办写清楚。我第一个 Agent 经常卡在循环里,绕来绕去不给我结果,查了半天发现是我没写「如果连续两次没找到就直接告诉我,不要继续试」。
多模态铺开之后,Prompt 的形态也变了。以前是纯文字对纯文字,现在是文字、图片、语音、视频混着来。我最近在做一个产品图的批量处理流程,用到的就是文字指令加参考图加局部重绘。写这种 Prompt 的时候,我不能只说「把这张图改得高级一点」,我得指出改哪里、改什么、参考哪张图的光线。多模态时代写 Prompt 有点像做导演,你要同时管台词、画面、灯光、节奏,光会码字远远不够。
我观察到的趋势是,Prompt 正在从一个「输入框里的句子」变成一层「意图说明书」。同样的意图,未来可能由模型自己拆成多个步骤、调用多个工具去完成。那我们写的 Prompt 会越来越像需求文档,而不是像命令。这个转变听着玄,落到实处就是一件事:把意图讲清楚,把边界划清楚,把验收标准写清楚。剩下的交给模型。我这半年写 Prompt 越来越短了,但每条都比以前想得久。
6.5 建立个人 Prompt 教程知识体系与持续更新机制
我的 Prompt 知识库是从一堆散乱的笔记开始的。有一段时间我用哪条 Prompt 就去翻聊天记录,翻不到就重写一遍,特别浪费时间。后来我下决心整理,用一个文档工具把常用的收进去,按场景分文件夹:写作、办公、编程、绘画、学习,每个文件夹下面是一堆带名字的 Prompt 文件。命名我有一套自己的规则,把场景、用途、版本号串在一起,一眼就能看出这条是什么。
光整理不更新,两个月就成一堆废纸。我给自己定的机制是每个月抽一个晚上,把当月新写的 Prompt 过一遍,好的收进去,差的删掉。收进去的时候我会顺手写下一条备注:这条是为什么写、用在什么场景、效果怎么样、失败的时候长什么样。这条备注比 Prompt 本身还值钱。半年之后回看,我能顺着备注看出自己做事的思路在怎么变。有时候我会去翻三个月前的版本,跟现在的比一比,进步或者退步都看得出来。
知识体系最后会变成你自己的东西,别人的模板只能给你起个头。我现在写 Prompt 用的框架,跟一开始学的那套已经不太一样了。它是在几百次失败里被一点点磨出来的。持续更新这件事没那么复杂,就是保持好奇,保持动手,把每一次踩坑都写下来。做久了你会发现,你手里攒的不只是 Prompt,是你对做事的理解。模型几个月换一版,你对事情的理解没那么容易过时。
写到这一章结束,刚好这是我梳理 Prompt 这套东西的最后一篇。从最开始不知道怎么问,到现在能把一件事拆成结构化的指令,中间花了几年时间。这几年的体会就一句话:Prompt 是门手艺,手艺人靠练,不靠听。愿你写得比我好,也愿你写得比我快。
评论
发表评论