前阵子接了一个挺有意思的项目:做一批“2026年高冷男神”动漫头像。名义上是社交平台换头像用的,实际要求不低——不能是那种千篇一律的AI帅哥脸,得有“故事感”,得有“距离感”,还得经得起放大看细节。做头像这个需求,很多人觉得简单,AI随便跑几张不就行了?真自己跑一遍就明白了:AI出图只是前面最爽的一小步,从初稿到能交付,中间隔着几十次修图、筛选和重绘。
这篇文章就把我从AI初稿到成品交付的完整修订流程整个拆开讲,包括提示词怎么设计、初稿怎么筛、四轮精修每一轮到底在改什么、常见的翻车问题又怎么处理。不管你是刚接触AI绘画,还是已经能跑图但总觉得“差一口气”的创作者,这篇应该都能给到一些能直接拿去用的方法。
1. 项目需求拆解与风格定位
1.1 “高冷男神”这个词,AI根本听不懂
很多人第一步就栽在提示词上,噼里啪啦输入一堆“handsome boy, cool guy, anime style”,出来的图不是太油腻就是太路人。问题出在“高冷男神”是个高度抽象的描述,不同人脑子里浮现的画面完全不一样。有人想的是银发禁欲系,有人想的是黑发西装霸总,还有人想的是带点阴郁气质的少年。AI没有审美偏好,它只会按关键词组合来“猜”,你给的信息越模糊,它猜得越跑偏。
所以我拿到这个项目的第一个动作,不是开软件跑图,而是把“高冷男神”拆成一个个能被AI理解的视觉符号。拆下来大概是这几组:
- 脸型与骨骼:瘦削脸、清晰下颌线、颧骨不能太突出
- 眉眼:眼睛细长、轻微上挑或平直、眼神疏离、眉毛不浓不淡、略带压眼感
- 嘴唇与肤色:薄唇、唇色低饱和、肤色偏冷白或中性色
- 发型:优先冷色调,银白、灰蓝、墨黑,发质偏直或微卷,不能是暖棕
- 服装:高领毛衣、西装、长风衣、军装风,整体偏正式、包裹感强
- 气质关键词:indifferent, aloof, calm, reserved
这一套拆解完成后,“高冷男神”就从一句口号变成了十几条可执行的视觉约束。后面所有提示词和精修操作,都围绕这套约束展开。你如果也想做类似风格的头像,建议先花半小时把自己脑海里的“感觉”拆成具体特征,这比反复试提示词高效得多。
1.2 头像场景的特殊性:不是所有好图都适合做头像
这个项目跟画插画不一样,头像有极其明确的场景限制。第一,尺寸小,大多数平台的头像撑死了几百像素,构图太复杂、背景太花哨,缩到小图之后人都是糊的,等于白做。第二,面部必须居中或偏上,留给裁切的空间要足够。第三,视线方向很关键,头像默认是在个人主页和评论区出现,人物的视线如果是看向侧面,会让人觉得“没在看你”,互动感弱;如果是直视镜头,又容易显得太有攻击性。
我当时的交付红线定得很死:面部占比不低于画面的60%,头顶至少留出10%的安全空间,背景色以低饱和冷色为主,不能有明显抢镜的元素。所有进入终审的图,都必须满足这条基础标准。
还有一条容易被忽略的是气质一致性。如果一个系列头像里有五张图,五张看起来像五个不同的人,哪怕单张都很帅,交付出去也是一堆散件,不是一个作品。所以从项目一开始就要定好“这组头像共用同一张基准脸”的策略,后面修订时也严格围绕这个基准执行。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 工具选型与提示词工程
2.1 选模型:要的是可控性,不是一次性惊喜
做这种批量头像项目,我对工具的要求非常明确:可控性优先,惊喜感靠边。所以我用的主工具是Stable Diffusion,搭配动漫风格的混合模型,再用一个自己调的“冷色调人物LoRA”来锁定风格倾向。Midjourney出图质感确实好,但它的随机性和不可控性对批量交付是灾难——同一个提示词跑五次,出来五个完全不同的人,后续根本无法统一修订。
Stable Diffusion这边,ControlNet的加入是关键变量。它可以把人物的姿态、线稿结构锁定住,重绘的时候不会突然“换头换人”。我这里的标准组合是:Stable Diffusion WebUI + 动漫混合模型 + 自训练冷色LoRA + ControlNet的lineart模式。
如果你不想折腾本地部署,现在国内一些在线AI绘画平台也能做到类似效果,只是参数可调范围会窄一些,局部重绘的精细度也会差一点。我的建议是:项目规模小、只做一两张,在线工具够用;项目一超过十张,直接上本地部署,省下来的时间和情绪都值回票价。
2.2 提示词这么写,出图才不会离谱
提示词不是写小作文,它是给AI的一串限定词。核心原则是:每个词都有存在意义,同类词不超过三个,整体控制在十五个以内。太多冗余词只会分散注意力,让主体特征变模糊。
举个例子,我实际用的基础提示词长这样:
text复制1boy, adult male, cold expression, indifferent eyes, slight frown,
sharp jawline, narrow eyes, thin lips,
silver white medium hair, swept back hairstyle,
black high-collar suit, long coat,
dark grey background, soft lighting, film grain,
high detail, masterpiece, best quality
这套提示词的结构是:主体(1boy, adult male)→ 表情(cold expression, indifferent eyes)→ 五官细节(sharp jawline, narrow eyes)→ 发型 → 服装 → 环境与光影 → 画质标签。按这个顺序写,AI对特征的注意力会自然地从前向后分配,前面几组词对画面走向的影响最大。
负面提示词同样重要,甚至更重要。我的负面提示词固定这一串:
text复制lowres, bad anatomy, bad hands, extra fingers, missing fingers,
deformed face, blurred, watermark, text, logo, worst quality,
low quality, jpeg artifacts, realistic, photo, 3d render
最后那两个realistic和3d render一定要加,否则模型很容易画着画着就滑向写实风或3D质感,跟动漫风格严重割裂。
2.3 参数设置:别迷信别人的“最佳参数”
参数这块网上教程很多,但我要提醒一句:没有通吃的绝对最佳,只有适合你当前模型和风格的一组稳定值。我这边跑头的常用参数是:采样器Euler a或DPM++ 2M Karras,步数28,CFG Scale 7,分辨率768×1024。
为什么不用1024×1024?因为头像最终是竖构图,正方形的图要么裁掉太多内容,要么人物占比不够。分辨率先用768×1024出图,后面再做超分放大,这是效率和质量平衡下来的选择。
CFG Scale这个参数值得多说两句。它控制的是提示词对画面的约束强度,太高(比如12以上)会导致画面发灰、色彩过于死板,太低(比如4以下)又会让AI自由发挥过度、特征跑偏。我实测下来7这个值是大多数动漫模型的安全区间,既能让提示词中的特征稳定体现,又不会把画面锁死。
还有一个很容易被忽略的参数是seed。第一次跑出一张气质很对、但有轻微瑕疵的图,千万不要直接点“重新生成”,而是固定seed,微调提示词或局部重绘。seed是你在修订环节最大的帮手,它能保证人物脸型结构不变,只改你想改的部分。
3. AI初稿批量生成与初筛
3.1 批量跑图的分寸感
批量出图听起来简单,就是不停点生成按钮,但实操有讲究。我项目启动的第一天,用同一套提示词跑了一百张图,但并不是毫无策略地乱跑。每次跑四张,固定主提示词不变,只改采样器和seed的排列组合,这样能测试出哪个参数组合下人物气质最稳定。
另一个技巧是分角度出图。头像虽然是正面为主,但我后来还是保留了两张半侧脸的变体,因为实际使用中,半侧脸会比正脸显得更有立体感,也更适合做社交平台的大图封面。先大量出正脸图,锁定气质方向,再用参考图的方式生成半侧脸变体,这样能避免角度变了人物结构就崩。
批量生成时还要记得控制变量。一次只改一个参数,比如从步数28改成32,看效果差异;而不是同时改采样器又改CFG又改提示词,那样出了问题你根本不知道是谁的锅。这个习惯对后续排错特别重要。
3.2 初筛不是看脸,是看“毛病”
一百张图出来,真正进入精修池的只有三十张左右。初筛我分了三个步骤,每一步筛掉一批:
第一步,删掉硬性问题图。手部崩坏、面部畸变、发型穿模、服装结构错误——这些属于硬伤,直接淘汰。很多人舍不得删,觉得“局部修修就好”,但AI修图有一个铁律:结构错误比风格偏差难修十倍,与其花半小时修一张骨架都歪的图,不如直接重跑。
第二步,删掉气质不符的图。有的图技术层面没问题,五官也精致,但笑容太暖、眼神太温柔,跟“高冷”完全沾不上边,直接删除。这一轮操作最需要审美判断,也是考验你对项目理解深度的时刻。
第三步,按气质聚类。留下来的图分成三组:清冷禁欲系(浅色发、表情内敛)、霸总西装系(深色发、气场强)、银发少年系(偏年轻、带一丝脆弱感)。每类选四张进入精修。这样最终交付的时候,产品是有层次感的,不是三十张长得差不多的脸。
4. 从初稿到定稿:四轮修订流程
4.1 第一轮:构图与视角修正
初稿选定后,第一轮修订我基本不动五官,先解决构图问题。头像的构图要求很苛刻:头顶留白要够、面部比例要足、视线方向要合理。这个过程有一套固定的操作流程。
先把选中的初稿放到Photoshop里,拉出辅助线检查构图。头顶留白低于10%的直接标记;面部不在画面中心区域的标记;视线方向不开阔的也要标记。然后在Stable Diffusion里用图生图方式修正,denoising strength控制在0.4到0.55之间,低于0.4画面基本不变,高于0.55脸型结构就容易飘。同时启用ControlNet的lineart模式,把原图的线条结构锁住,防止重绘过程中人物骨架变形。
构图这轮一定要忍住,不要顺手去改表情和五官。一次修订只解决一个维度的问题,否则多个变量叠加,最后出问题根本定位不到原因。
4.2 第二轮:面部特征与表情管理
构图稳定了,第二轮才进入面部精修。这一步是整条流程里最考验耐心的。
先说眼睛。高冷男神的眼睛不是简单地“画成细长”,而是要表现出“无表情但眼睛里有关注点”的状态。直接用inpaint局部重绘,只框选眼部区域,提示词换成“sharp eyes, slightly narrowed eyes, calm gaze, indifferent look”,denoising strength给到0.6到0.7。这个范围内眼睛形状和神采会明显变化,又不至于把整个脸部结构带乱。
然后是眉毛和嘴型。眉毛的压眼感很重要,眉骨到眼睛的距离决定了面部的压迫感。局部重绘时提示词用“slightly furrowed brows, low eyebrow position”,把眉毛往下压一点点,眼神立刻就不一样。嘴型方面,高冷系的嘴唇关键不是“抿着嘴”,而是“嘴唇放松闭合、嘴角不发力”,这个微妙差别用提示词“relaxed lips, natural closed mouth”来表达。
这一轮修订的过程中要反复放大到200%检查面部元素的比例关系。眼睛、眉毛、鼻梁、嘴唇这些元素单独看都好看并不算完,它们之间的间距、比例、角度关系才是“高级感”的来源。有些图单看眼睛好看,整体组合起来就是不对,这时候需要微调局部重绘的范围,把眉毛和眼睛一起框进去重新生成,而不是只改眼睛。
4.3 第三轮:服装细节与质感
表情和面部处理完,第三轮是服装和配饰。AI画服装的大问题是纹理模糊,尤其是西装翻领、高领毛衣的针织纹理、风衣的衣褶这些结构,远看没问题,放大一看全是糊的。
针对这个,还是用局部重绘,把服装区域框选出来,根据不同的材质用不同的提示词。西装用“sharp suit lapels, crisp shirt collar, formal suit, tailored fit”,高领毛衣用“turtleneck sweater, fine knit texture, close-fitting collar”,风衣用“long trench coat, clean lines, flowing fabric”。重绘幅度控制在0.5到0.6,让材质清晰度有明显提升,但又不会让衣服款式跟底图完全不一致。
还有一个容易忽略的点是扣子和拉链。AI经常会画出五个扣子的西装或方向反了的拉链,这种细节就是纯硬伤。用局部重绘把局部区域框出来,降低denoising strength到0.4,手动把结构理顺。如果三次都修不干净,果断换一张图重来,别跟AI铆这口气。
4.4 第四轮:光影与氛围统一
最后一轮是光影和整体氛围的调整,这也是整个流程里最能拉开专业与非专业差距的一环。
AI生成的图通常在单张层面没问题,但放到一组图里就会暴露问题——这张图的光源在左边,那张在正前方,那张是顶光,色调有的偏冷有的偏暖。统一光影的最终目的,是让一个系列的头像看起来像是同一位画师在同一个场景里画的。
我这里的统一方案是:全部采用左前侧柔和主光,辅助光从右后方补一个冷色的轮廓光,背景统一为深灰或灰蓝色调的低饱和渐变。这个布光方案的优点是人物面部立体感足够,又没有强烈的戏剧性阴影,适合大多数社交平台的头像场景。
具体操作用Photoshop的Camera Raw滤镜统一色温,高光往冷色调微调,阴影部分稍许提亮避免死黑。然后单独对皮肤层做色彩校正,让肤色保持在“冷白但不惨白”的区间。背景层和人物层分开调,避免肤色调整把背景也带跑偏。
5. 后期精修与成品交付
5.1 放大画质:这一步决定了成品上限
精修完成后,图像分辨率还停留在768×1024,这个分辨率直接交付其实够用,但考虑到有些平台会强制压缩,以及未来可能用到大图场景,我还是统一做了超分放大。用超分模型把分辨率提升到1536×2048,再针对放大的副作用做补救。
AI放大最常见的副作用是头发丝糊成一团、边缘出现不自然的锯齿。我的处理流程是:超分后用高反差保留滤镜做边缘锐化,再把锐化层的透明度降到50%左右,让画面既清楚又不至于过分生硬。最后人像皮肤部分叠加一点噪点纹理,模拟手绘感,让画面脱离“AI磨皮”的滑腻感。
锐化这个环节要特别克制。头像在手机屏幕上显示的时候非常小,过度锐化会让边缘发白发亮,反而显得脏。我的原则是:在大图上看着略偏柔,缩到小图尺寸之后刚刚好,这是唯一正确的调校标准。
5.2 交付文件怎么组织才专业
交付不只是把图片发过去就行。三组十二张图,如果直接用“最终版1、最终版2”这种命名,对方用起来会非常痛苦。我这边定了一套命名规范:角色风格_编号_尺寸,比如“SilverCold_01_1536x2048.png”。同时给每个风格建一个txt说明文档,写明这组图的基础提示词、采样参数、seed值和主要修订记录。
更核心的是一个“修订记录表”,记录每张图从初稿到成品的修改历史,哪一轮改了哪些地方、效果如何。这个习惯在单个项目里看着像是多余动作,但一旦客户后续说“这个表情再冷一点”,你就能快速定位到那张图的每个修改节点,直接调整对应的重绘环节,而不是从头再跑一遍。
6. 常见问题与排查实录
6.1 手部崩坏:AI的老大难问题
头像场景里手出现的频率不高,但只要出现,翻车率极高。六根手指、手指粘连、关节反折,各种“手部恐怖故事”我都见过。我的处理方案很直接:局部重绘跑三次,每次微调提示词中的hand描述,如果三次之后依然结构不对,直接换图重跑,不恋战。
比如有一次我为了做一张手托下巴的头像变体,手部区域崩了八次,试了所有手部提示词组合都救不回来。最后换了策略:先用ControlNet的openpose把手的姿态骨架固定住,再配合局部重绘,终于成功出图。这个经验是:与其反复抽卡,不如锁定姿态骨架后再修。
6.2 风格漂移:做着做着人物就变了
风格漂移是批量项目里最让人崩溃的问题。第一张图还是个冷脸银发帅哥,修到第五张的时候,鼻子变高了、脸变圆了、眼神也带了点笑意。出现这种情况,多半是修图过程中提示词被反复修改,人物特征在一次次重绘中逐渐偏离。
我的对策是:每一次局部重绘都只修改目标区域,其他区域保持原样;同时每次重绘时,锁定原始seed号作为参考基准。如果你发现漂移已经发生,不要试图一点点修回来,直接把这张图恢复到上一个稳定版本,再从那个节点重新开始修。
6.3 男性气质不足:AI的“奶油化”倾向
很多AI动漫模型对男性角色的处理容易滑向中性化或“奶油化”——皮肤光滑到反光、面容柔美、整体气质偏甜。这在其他风格里不是问题,但在“高冷男神”这个项目里是致命的,因为我们要的就是刀锋一样的冷峻感。
解决思路有三层。第一层在提示词层面:加入“sharp facial features, strong jawline, masculine bone structure”这类关键词。第二层靠参数:把CFG Scale从7微调到7.5,稍微加强提示词对画面结构的约束力。第三层在后期:用Photoshop给下颌线、眉骨增加阴影层次,给皮肤加细节纹理,打破大面积光滑的塑料感。实测下来,后期手动加阴影这步效果最明显,AI在骨骼感表现上确实不如手动调整来得精准。
6.4 不要贪多:单张图的“完工”判断标准
这个项目做得越久,我越意识到一个道理:AI修图不一定越多越好。修到后面,每一轮重绘都是在原有基础上叠变化,越叠越容易出现不可控的偏移。我给自己定了一个“完工”标准:构图合格、五官协调、表情贴题、服装细节清晰、光影统一,这五条全部满足,就立刻停止修改。与其死磕最后2%的完美,不如把时间留给下一个批次。
单张图的合理制作周期,我实测下来是20到40分钟。如果超过40分钟还在反复修改同一张图,大概率是这张图的基础不够好,理性的选择是回到初稿池,换一张底子更好的图重新开始。这听起来像是止损思维,但实际上效率最高的方案——好的初稿胜过一切后期抢救。
做这个项目最大的感受就是:AI绘图项目里,真正值钱的不是跑图的提示词,不是参数,而是你对“好看”和“合适”的判断力,以及把这种判断翻译成修改指令的能力。每一次重绘、每一轮局部修复,本质上都是在用自己的审美给AI的产出做定向调节。工具会越来越顺手,模型会越来越聪明,但这套“从大量初稿里筛出方向、再逐轮精修推向成品”的工作方法,我觉得在很长一段时间里都不会过时。
最后再分享一个小技巧:每次修图结束,把这一轮修改前后的对比图拼在一起,攒成一个“修订案例库”。这个库不只是给客户看工作量的,更是你自己审美和技术迭代的对照样本——过三个月回头翻一翻,你会有很多“当初怎么会那么修”的新想法。项目做完不是终点,经验沉淀下来才是下一次能更快的起点。
