最近总有朋友拿着自己用AI跑的图来找我,开口第一句就是:我明明写了“情侣街拍”,为什么出来的两个人像商量好了一样各走各的?这问题我太懂了。人像摄影做到情侣和街拍两个词叠加,提示词就不再是堆形容词,而是一场小型导演工作。今天这篇,我就用自己反复调过的案例,把情侣街拍这一类提示词怎么拆、怎么写、怎么避坑,一次讲透。
我不会给你甩一套“全网最强咒语”就完事,而是把每个词的用途说清楚。不管你是用Midjourney、Stable Diffusion,还是其他支持文生图的工具,理解背后的思路,永远比复制粘贴重要。这篇更适合刚入门但想认真出图的人,也适合想提升现场拍摄灵感的朋友——提示词本质上也是摄影策划的另一种写法。
1. 情侣街拍提示词,到底在提示什么
1.1 为什么双人街拍比单人写真更容易翻车
先看一个最典型的翻车现场:你输入“一对情侣走在街上”,出来的图经常是两个人面无表情、平行前进、距离远得像刚刚拼桌的路人。更麻烦的是,AI有时会把两张脸融合成一张“四不像”,或者手部直接变成抽象艺术。
原因并不复杂。单人写真时,AI只需要集中精力处理一个人物的五官、动作、光影;到了双人场景,模型要同时管理两个独立主体,还要处理好他们之间的关系。可很多训练数据里的“情侣街拍”标签本身就拍得不够好,模型学到的大多是站在一起微笑的摆姿,少有真实抓拍中的那种松弛感。所以指望一个简单词组出神图,基本靠运气。
这也是我坚持用模块化写法的原因。你可以把提示词理解成一份拍摄方案:先确定画面里的人是谁,再确定他们在做什么,然后才是环境、光线、镜头、画质。每多写清楚一句话,AI就少猜一次,翻车概率自然就降下来。
1.2 先定关系,再写动作和光影
我调提示词有个习惯:先想清楚两个人是什么关系,处于什么情绪,再写画面。同样是情侣,刚在一起和在一起三年的状态完全不同。前者可能是小心翼翼的试探,后者是毫不掩饰的熟络。这种关系感如果不在提示词里点明,出来的图就会很“假熟”。
举例来说,“couple walking on street”和“young couple walking home together, girl leaning slightly toward boy, sharing an umbrella”完全是两种信息量。后面这句给了AI一个明确的关系脚本:他们是一起回家、关系亲密、女孩靠向男孩。动作、光影和构图都会因为这个脚本变得有方向。
打个比方,提示词就像你在给一个很能干的摄影师下需求。你只说“去街上拍一对情侣”,他可能给你一堆游客照;但你说“拍一对下班顺路去买菜的小情侣,女孩看到路边小猫突然蹲下,男孩站在旁边等她”,摄影师立刻就知道要抓什么瞬间了。AI出图也是这个逻辑,你给的信息越接近“真实拍摄需求”,它越容易交出有故事感的画面。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 新手必看:情侣街拍提示词的5个模块与关键参数
2.1 主体与衣着的描述技巧
写双人提示词,最容易犯的错是过度描述五官。尤其用Stable Diffusion这类工具,你越是写“蓝色眼睛、高鼻梁、精致脸庞”,两个人物越容易互相污染,最后生成一张拼拼凑凑的脸。我的做法是先写关系,再写大体外观,脸部尽量交给“natural face”和“detailed skin texture”这种通用词,让模型自由发挥。
衣着反而是区分两个人物的重要手段。比如“a young man in a mustard sweater”和“a young woman in a grey trench coat”,颜色和材质分开写,模型就更好把两个人当成不同对象。注意不要堆太多颜色,一个主要色加一个辅助色就够,否则画面会花,街拍尤其忌讳两个人穿得像彩虹。你要想让画面干净统一,就在两个人的服装里保留一个共同色系,比如男生穿深蓝外套,女生穿浅蓝牛仔裤,整体看起来既有区分又有呼应。
2.2 互动姿势的高级表达
互动姿势是情侣街拍的核心,也是最容易写僵的部分。单纯写“hugging”或“kissing”,模型经常输出非常样板化的动作,看起来像摆拍。我更推荐描述一个正在发生的瞬间:walking side by side, laughing at something, stopping to look at a shop window, adjusting her scarf, holding hands while crossing the road。这些描述让AI知道你不是在拍“两个模特摆好姿势”,而是在拍“两个正在生活的人”。
有几个词在减少僵硬方面非常有效:candid、spontaneous、mid-motion、between poses。它们会提醒模型这不是静态摆姿,而是自然抓拍。还有个技巧:写动作时给一个理由。比如不是“he fixes her hair”,而是“he gently brushes a leaf off her shoulder”。有具体的动作逻辑,AI就有更多信息确定手部位置和互动方向,肢体扭曲的概率也会小很多。
2.3 街景与环境的层次安排
街拍不等于随便一条路。好的背景会给人像摄影里“前景、中景、背景”的层次感,AI提示词里也需要这么安排。前景可以是虚化的路牌、树叶、行人;中景是两位主角;背景是街道纵深、店铺灯光、远处建筑。比如“a boulevard with plane trees, bokeh street lights, distant traffic light trails”就把三个层次都说全了,画面一下就立体了。
环境词要克制。信息量太大,背景就会抢戏。我一般只给一个明确场景加一个氛围辅助,例如“old town street at dusk”是主场景,“warm window light”是氛围,剩下的交给模型去发挥。记住,AI很擅长补充细节,但不太会主动分层。你写满十个环境名词,它可能全塞进一个平面里,最后变成一张没有主体的混乱贴图。所谓环境氛围,是给画面定情绪用的,不是用来开清单的。
2.4 光线、镜头与画质的摄影级参数
想让街拍有摄影感,光线和镜头词一定不能省。黄金时刻(golden hour)是效率最高的选择,逆光会让两个人发丝边缘镀一层光,氛围感直接拉满。雨天可以写“wet asphalt with neon reflections”,傍晚可以写“blue hour with soft city lights”。但记住一个原则:一个画面只给一个主光源。别把夕阳、霓虹、路灯全塞进去,光线一多,肤色就容易发灰发脏。
镜头方面,我个人偏爱35mm和85mm。35mm能容纳街景纵深,适合拍环境人像;85mm压缩感强,能让背景变成奶油一样的虚化。对应提示词就是“35mm lens, environmental portrait”或“85mm, f/1.8, shallow depth of field”。画质词可以放在最后:8k, highly detailed, sharp focus, film grain。其中film grain很值得加,它能让数码味降下来,多一层胶片颗粒反而比磨皮过度的画面更耐看,也更贴近真实街拍的质感。
2.5 常用生成参数与负面提示词建议
提示词写好了,生成参数也别随便用默认。我常用的配置是步数30到50,CFG scale 5到7,采样器DPM++ 2M Karras,分辨率在竖构图下用832x1216附近。这里特别提醒:双人场景CFG不要调太高,超过9很容易出现两个人五官互相影响,背景也跟着变形。原因是CFG过高会强制模型过度解读你的提示词,两个主体的特征就直接打架了。
负面提示词也是标配。除了常见的bad anatomy, extra fingers, deformed hands, watermark, blurry,双人场景还要加上merged faces, duplicate character, three people, extra limbs。有朋友问负面词要不要写很多,我的建议是抓大放小,写最严重、最高频的10到15个,而不是把所有见过的问题都填进去,否则可能误伤正常的画面。负面提示词不是越全越好,关键是精准。
3. 三套可直接复制的完整提示词模板
3.1 黄昏逆光街口偶遇
直接给模板。第一套我经常用来做朋友圈封面,关键词是“逆光+过马路+动态感”:
text复制two young lovers walking across a crosswalk at golden hour, backlit by warm sunset, he is slightly ahead holding her hand, she laughs, mid-motion, candid street photography, 35mm lens, f/1.8, shallow depth of field, film grain, soft warm tones, highly detailed
Negative prompt: merged faces, extra fingers, deformed hands, blurry face, oversaturated, cluttered background, watermark
注意这里用了“slightly ahead holding her hand”而不是简单的“holding hands”。一前一后有位置差,画面就有层次;“mid-motion”能避免站桩式摆拍。出图之后如果发现背景太亮,可以把golden hour换成sunset backlight,或者把CFG降到5。如果你觉得两个人的位置不够亲密,还可以把“he is slightly ahead”改成“he slows down to wait for her”,出来的动作会有一种“停下来等人”的瞬间感。
3.2 雨夜霓虹下的依偎
第二套适合想拍情绪氛围的朋友,主关键词是“雨天+霓虹倒影+依偎”:
text复制a young couple under a translucent umbrella in a rainy old street at night, neon signs reflecting on wet pavement, her head resting on his shoulder, both looking forward softly, cinematic blue and magenta lighting, 50mm lens, f/2.0, dreamy bokeh, wet reflections, moody atmosphere, film grain
Negative prompt: two umbrellas, extra people, deformed hands, washed-out highlights, plastic skin, text on screen, watermark
这里有个小坑:如果你希望共撑一把伞,一定要在负面提示词里写“two umbrellas”。不然AI经常凭空生成两把伞,浪漫感直接碎掉。雨夜的光线偏冷,所以肤色容易发青,可以补一个“warm skin tones”拉回来,或者把主光源改成暖色招牌灯。我实际跑下来的经验是,把“blue and magenta”改成“warm neon light on the left”会更稳定,至少不会让两个人看起来像被蓝光灯怼了脸。
3.3 晴天公园长椅上的日常
第三套走生活感路线,主关键词是“自然光+长椅+看书”:
text复制a relaxed couple sitting on a wooden bench in a small city park, morning sunlight through trees, she is reading a book, he leans close to look at the page, genuine smiles, candid everyday moment, 85mm lens, f/2.2, creamy bokeh background, light green and white color palette, sharp focus
Negative prompt: stiff pose, fake smile, extra fingers, oversharpened skin, busy background, ugly bench, watermark
这套提示词的亮点是“给两个人一个具体行为”。很多人写情侣日常只会写“坐着聊天”,模型给出来的互动往往很空。写清“看书”“喂公园鸽子”“分享耳机”这种具体行为,两个人就有了共同聚焦点,画面关系才立得住。我试过把“reading a book”换成“sharing a pair of earphones”,效果也不错,但在Stable Diffusion里出图速度会慢一些,因为手部和耳机的交互容易出错,所以保守一点还是看书更稳妥。
3.4 模板微调思路:换场景、换衣着、换情绪
三套模板用顺手之后,其实只需要替换几个词就能无限延伸。我整理了一个简单的替换表:
| 维度 | 初始可选词 | 高级变化 |
|---|---|---|
| 场景地点 | crosswalk, park bench, old street | bookstore, bakery, tram stop, riverside path |
| 天气 | golden hour, rain, morning sunlight | fog, snow, sunset after storm, summer shower |
| 情绪 | laughing, cozy, gentle | playful, serious, shy, quiet joy |
| 衣着 | beige coat, white sweater | linen shirt, denim jacket, oversized hoodie |
| 动态 | walking, sitting, leaning | dancing, running, stopping to look |
换词的时候注意一个原则:同一个维度里只换一个,别一次换三个以上,不然模型可能又找不准重点。比如把场景从“crosswalk”换成“tram stop”,那光线和动作最好保持原样,方便你判断到底哪个变量起了作用。做实验要讲控制变量,写提示词也是这样,你如果一次性把所有词都换了,出了好图都不知道该感谢谁。
4. 双人街拍最容易翻车的4个细节及修复方案
4.1 面部崩坏与五官混淆
双人街拍里最常被吐槽的就是脸。崩不一定是模糊,更多是两人五官互相抄作业——你中有我,我中有你,或者干脆多出一只眼睛。出现这种问题,我一般先检查CFG是不是太高,接着看提示词里是不是给了太多脸部细节,再不行就用局部重绘把脸单独修一遍。
如果你用的是Stable Diffusion这类支持ControlNet的工具,低成本方案是先出一张构图还不错的图,再用inpaint单独重画脸部区域。想要更稳一点,可以提前给两个人分别用不同颜色的衣服、发型做区隔。模型只要分得清两个人,脸就不会随便混在一起。实际操作中,我会把两个人的发型也写清楚,比如“short curly hair”和“long straight hair”,两个人物在模型心里的“抽屉”就不一样了。
4.2 互动姿势僵硬不自然
姿势僵是第二高频问题。很多人写“couple hugging”出来的图,两个人像被胶水粘住一样。我的经验是少用静态动名词,多用进行时和瞬间动作。“hugging”能改成“he pulls her into a quick hug from behind”就不要只写“hug”;语法上越具体,模型越容易理解这是一个抓拍瞬间。
还有个很实用的土办法:提示词里加上“between poses”或者“candid”之后,多抽几张图,挑中间状态最模糊但肢体最自然的一张。不要总想一次出图,AI出图本质上是概率采样,多试多选比死磕参数靠谱。你甚至可以借着“mid-motion”故意让动作虚一点,那种“刚好回头”的瞬间感,比一清二楚的摆拍更打动人。
4.3 光影发灰或肤色不均
跑情侣街拍时,阴影部分最容易出现一块脏灰色,尤其雨天和夜景。这种现象通常是因为画面里的光源太杂,或者负面词里写了“dark”但没定义主光源。我的建议是每张图只保留一个方向感明确的主光,比如“neon sign on the left”或者“low evening sun from behind”,再配合“soft fill light”补充暗部。
肤色不均是另一个老大难。两个人物一个偏黄一个偏红,说明模型在分配不同人物的色彩特征时出了问题。一个有效解法是在提示词里统一写“same warm skin tone”,然后减少描述色温的词。别在同一个画面里既写cool tones又写warm tones,皮肤区域会因为两个光源对抗而变得又灰又脏。如果要走冷暖对比,那就让冷暖分别出现在背景和主体上,而不是同时怼在两个人的脸上。
4.4 背景杂乱抢走主体
第三套模板如果加太多环境细节,结果往往是背景比人物还抢戏。解决方法也很简单,给背景做减法。提示词里最多给一到两个有辨识度的背景元素,比如“red brick wall”或“neon bakery sign”,剩下全靠浅景深和虚化的镜头语言。负面提示词写上cluttered background、busy street、extra people,让模型不敢乱加人。
如果你确实想要热闹街景,那就别把主体放中间,构图让两人站在画面一侧,背景留白给街道纵深。提示词可以写“subjects on the left side, composition with negative space”,这种构图反而比硬怼紧身特写更有街拍味道。记住,背景是给主角垫戏的,不是来抢戏的。
4.5 一份用于快速排查的速查表
把上面这些问题整理成一张表,跑图出问题时直接对着查:
| 现象 | 可能原因 | 快速调整方向 |
|---|---|---|
| 两张脸长得像、五官混合 | CFG过高、脸部描述过多 | 降低CFG到5-6,精简脸部词 |
| 手部多指、动作扭曲 | 缺少肢体描述、步数太少 | 写清动作方向,步数提升到40+ |
| 两人距离很远、像路人 | 缺少关系词 | 加入leaning, holding, laughing together等关系词 |
| 背景杂物太多 | 环境词过多 | 保留1-2个背景元素,加shallow DOF |
| 画面发灰、肤色脏 | 多光源冲突 | 确定单一主光,加warm skin tones |
| 氛围老是偏棚拍 | 姿势词太正式 | 换用candid, between poses, mid-motion |
这张表我没写得很长,因为问题太多的时候,往往不是单点故障,而是提示词整体思路乱了。先把关系、环境、光线这三个骨架搭稳,很多瑕疵会自然消失。比起一个个救火,不如重新整理一遍自己的提示词结构。
5. 写提示词前,先学会想画面
5.1 我自己的提示词检查清单
文章最后,分享一个我每张图都会过一遍的检查清单:屏幕里的两个人是不是真的在同一个空间?他们的关系通过动作体现了吗?光线是从一个方向来的吗?背景有没有抢掉主角?这四个问题如果都能给出肯定回答,提示词基本不会跑偏。
我见过很多朋友很喜欢堆词,觉得词越多越专业。实际上提示词的精华不在数量,而在关系。把“一对情侣”换成“下班后顺路买花的情侣”,把“街上”换成“刚下过雨、有橱窗倒影的老街”,画面感立刻不一样。写提示词就像写小说,重要的不是形容词多,而是人物和场景之间发生了真实可感的互动。
5.2 一个特别有用的小习惯
最后再分享一个我自己的习惯:写提示词之前,先闭眼想十秒,想象这张照片如果印成杂志内页,读者第一眼会看哪里。可能是一束逆光照亮的发丝,可能是两只十指相扣的手,也可能是女孩笑起来时男孩的目光。把这个“第一眼”想清楚了,提示词里的每一个词都会自动往那个方向靠。
这招听起来玄,实际是很多人忽略的画面编辑能力。AI提示词不是拿来炫技的,它更像把你脑子里的画面翻译成模型听得懂的语言。你越清楚自己想表达什么,翻译到后面的准确率就越高。希望这篇能帮你少走点弯路,下回再跑情侣街拍,不再是碰运气出图。
