ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI审美不稳定?用“审美判官+审美编译”双Skill组合解决

AI审美不稳定?用“审美判官+审美编译”双Skill组合解决 AI这东西技术上是真强审美上是真迷。我让AI给我出一张活动宣传图出来的东西像楼下打印店十几年前的模板我让AI帮我评两张图哪个好看它来一句两张各有千秋都很优秀——等于没说。这种体验估计每个玩AI的人都经历过。模型预训练的时候没少看美术史、设计原则构图、色彩、光影这些知识明明都存在参数里为什么一到实际应用就掉链子我后来想明白了问题不在模型在交互方式。AI不缺审美知识缺的是一套能稳定调动这些知识的工作方法。于是折腾了一段时间我总结出两个Skill的组合打法一个管看一个管做配合起来用AI的审美水平基本稳定在线不再靠抽卡。这篇文章就把这两个Skill的设计思路、完整指令、实测数据和踩坑过程完整分享出来。适合三类人看天天被AI丑图逼疯的绘画玩家用AI做设计但说不出哪里不对的从业者以及在搭建Agent技能包时想知道Skill到底该怎么设计的开发者。1. AI审美失灵的真实原因知识都在只是没人让它用在讲Skill之前得先把病灶找清楚。审美不是玄学它是可以被结构化的知识但大多数人跟AI交互的方式恰好绕开了这部分知识。1.1 模型的默认人格是随和助手不是毒舌总监大模型在海量图文数据里训练过伦勃朗的布光、莫兰迪的配色、康定斯基的构图这些信息通通在它的参数空间里。但你直接用默认对话模式问这张图怎么样它给你的回复往往遵循一个隐藏逻辑让用户开心。于是它倾向于输出安全、通用、讨喜的结论——构图不错色彩很舒服很有氛围感。这不是模型蠢而是语言模型的默认人格是一个随和的助手不是一个挑剔的艺术总监。如果你不显式地告诉它现在切换到专业评审模式它就会一直按着人畜无害的路线走。Skill的本质作用就是把设计总监这个专业副人格显式地加载进来让AI绕开默认回复模式。1.2 大多数提示词土的四个根源我复盘过自己早期的提示词也看过周围同事写的发现出图土基本逃不出这几个原因堆砌空洞形容词绝美、震撼、高清、唯美这类词在模型看来信息量极低。你要的是画面里具体的光影关系、色彩区间、主体占比而不是情绪感叹。混淆清晰度和美很多人以为加了8K、细节丰富、超高分辨率画面就高级了。清晰度解决的是看不看得清审美解决的是看了舒不舒服完全是两件事。锐化过度的图往往又脏又累。风格词汇混杂国风、赛博朋克、油画质感一股脑全塞进去风格混搭不是不能做但需要明确主次和比例。没有统一的美学准则AI只能按训练数据里的概率分布给你拼一个大杂烩。从不描述构图AI对构图的理解完全依赖你的提示词。你不说三分法、不引导视线、不设留白模型就按最常见的分布走——主体居中背景铺满结果就是千篇一律的大头照风。这三个问题指向同一个解决方案审美知识必须显式化。1.3 Skill的底层逻辑把隐性审美知识变成可调用的显式程序Skill说穿了就是一段结构化的指令加示例库它的作用是让模型在特定任务里采用特定的认知框架。审美这东西看似主观但落到画面分析上无非是构图、色彩、光影、层级、质感几个维度。你把审美知识组织成维度规则评分标准后交给AI它就不再靠感觉瞎蒙而是像一个受过训练的设计师那样按专业路径去分析。我最终定型的是两个模块审美判官负责看给画面做结构化诊断输出可执行的修改建议。审美编译负责做把抽象的审美名词翻译成模型能执行的画面配方。判官负责诊断编译负责开药方。两者配合AI的审美输出就从碰运气变成了流水线这是整套方法的核心。2. 第一个Skill「审美判官」让AI从夸夸党变成设计评审先做看的能力。因为如果AI连哪里不好都说不清楚后续怎么做好的就更无从谈起。2.1 为什么AI的好看等于什么都没说直接问AI这张海报好不好看它给你的是情绪判断但你需要的是事实判断。一个设计师拿到一张图脑子里转的是主体够不够突出、色彩有没有冲突、光线引导眼睛往哪看、信息层级是否清晰。AI也可以做到这个程度前提是你得告诉它从哪几个维度看、按什么标准打分、输出用什么格式。好看是一个模糊的情绪词不是可执行的信息。评委价值的高低取决于它能不能给出下一步怎么改的具体指令。2.2 「审美判官」的完整指令下面是我目前一直在用的版本你可以直接复制到你的AI工具里作为System Prompt或在Agent平台里建成一个固定技能。注意每个平台称呼不一样有的叫人设、有的叫技能、有的叫自定义指令本质都是同一个东西。# 角色 你是拥有20年经验的艺术指导与视觉评审精通构图学、色彩理论、光影设计、版式原理。你的任务不是夸人而是通过结构化维度对图像/设计提出可执行的诊断意见。 # 评审维度按权重排序 1. 构图画面主体位置、引导线、留白比例、三分法/对称/对角线利用情况 2. 色彩色彩和谐度相邻色/互补色/分裂互补、饱和度控制、色彩情绪是否匹配主题 3. 光影主光方向与预期情绪是否一致、明暗层次是否分明、有没有光污染或死黑区域 4. 视觉层级第一眼落到哪里、信息主次是否清楚、视线是否有清晰动线 5. 质感与细节材质表现、纹理是否自然、有没有明显塑料感或AI痕迹 6. 风格统一性整体美学范式是否一致有没有出现混风/乱入元素 # 评分标准 - 90-100可直接投放市场无需修改 - 80-89优秀有1-2处小瑕疵微调即可 - 70-79合格有明显短板但不伤主体 - 60-69及格线需要结构性调整 - 60以下重大缺陷建议重新出图 # 输出格式 1. 先给总分百分制一句话概括主体印象 2. 用按优先级排序的问题列表给诊断意见最严重的问题放最前面 3. 最后给出最多3条修改建议每一条必须能直接执行 # 禁令 禁止使用高级感氛围感整体不错等无信息量词汇。 所有形容词必须落实到具体的画面元素比如背景饱和度偏高导致前景文字对比度下降这类级别。有几个设计细节值得说一下。评分锚点必须明确否则AI给你乱打分会让你失去对质量的判断输出格式限定先诊断后建议是为了防止它把问题和方案混在一团禁令是重点高级感这个词是最典型的空转词汇AI说了等于没说你得逼它把高级感翻译成具体的色彩区间或材质表现。2.3 挂载步骤与使用方式以支持多模态输入的AI助手为例操作路径如下把上面的指令粘贴到技能区/人设区/System Prompt保存使用的时候直接上传图片然后附上一句请求请按评审标准打分并给出诊断如果你用的是文生图工具不直接支持多模态对话就把生成参数、种子号、采样器和参考图贴回去让判官结合后端信息来分析这里有个小技巧同一张图你可以让判官用debug模式只挑毛病和访谈模式先讲优点再讲缺点各看一遍。做项目评审时用debug模式快速定位问题跟同事对齐审美时用访谈模式从优点切入沟通阻力会小很多。2.4 实测效果赞美词与诊断书的差距为了展示对比我拿一张AI生成的科技峰会主视觉海报做过一次测试。画面描述是蓝色调背景星空主体是一个发光的晶体居中构图下方有活动文案。普通问法得到的评价海报整体大气充满科技感视觉冲击力强蓝色营造出冷静专业的氛围。这段话有错吗没错。有用吗基本没用。它没有告诉你任何可以改进的操作。换成「审美判官」Skill后输出总分68。构图主体居中左右两侧信息密度不均右下角光斑严重分散注意力视线没有明确动线色彩单一蓝色系趋于安全但层次不足主背景饱和度偏高导致前景白字对比度下降光影晶体光晕与背景星点亮度接近缺少主光与辅光的主次关系。修改建议1. 晶体向左移动至三分线位置右侧用斜向流线填补空白2. 背景饱和度降低8-10%为前景文字留出明度差3. 增加单一主光源方向让星点退到次要亮度层次。看到区别了吗前者是赞美后者是诊断书。68分这个数字本身也在告诉你这图现在不能直接用。我并没有额外投入什么只是在交互方式上加了用专业框架审视这一层AI的输出质量就有了质变。3. 第二个Skill「审美编译」把美学词汇翻译成模型能执行的语言判官解决了看不看得出接下来要解决做不做得出。这一步很关键因为能鉴赏和能创作是两种完全不同的能力。3.1 你让AI画高级感它真的不知道你在说什么如果你只给AI一个词高级感它能帮你评价一张图是不是高级但你要它画一张高级感的图它就抓瞎了。原因是高级感这类抽象词在生成模型那里没有明确的落点——模型不知道你说的高级是指低饱和、多留白、材质哑光还是指极简构图、单一光源、大面纯色。你需要的是一套翻译规则把风格描述转换成模型能理解的画面参数。这就是「审美编译」的定位它是风格翻译引擎不是美术词典。3.2 「审美编译」的完整指令我还是直接给出可复制的版本# 角色 你是视觉翻译引擎负责将抽象的风格/情绪描述翻译成具体、可执行的画面配方。你的输出必须包含5个模块构图建议、色彩配方、光影方案、材质与细节、情绪锚点。 # 工作方式 用户给一个风格词或一段情绪描述你按以下格式输出画面配方不接受氛围感高级感这类空泛表述所有元素必须落实到数值区间或具体指令。 # 输出模板 【构图建议】主体位置、占比、留白区域、引导线安排 【色彩配方】主色/辅色/点缀色的色相名称饱和度区间明度区间必要时给出HEX参考 【光影方案】光源方向、光比大小、阴影硬度、是否逆光/轮廓光 【材质与细节】表面质感、纹理特征、边缘处理 【情绪锚点】画面中哪一个元素承担情绪表达为什么选它然后你要给它一些配方词典作为参考否则它还是不知道该怎么落地。我最初给的是几个常用风格的核心配方你可以按需扩展风格/情绪构图核心色彩核心光影核心情绪锚点日系清新留白为主主体占比30%高明度低饱和色温偏冷软光无硬阴影风吹动的窗帘或衣角莫兰迪/高级灰静物组合疏密有致灰调色板明度50-70%少量土褐点缀均匀柔光材质哑光桌上的书与陶罐赛博朋克对称或大透视建筑线条霓虹紫与青双色互补大面硬黑大光比逆光轮廓雨雾反射霓虹招牌下的人物剪影新中式不对称平衡留白≥40%水墨灰度朱砂点缀柔和散射光窗棂落在地面的影子这份词典的价值在于它把风格从形容词变成了可执行的参数组合。你完全可以根据自己偏好往里加条目。3.3 编译输出示例一段可以直接用的提示词配方问「审美编译」帮我做一个新中式的茶品牌海报需要安静感。它会输出类似这样的配方【构图建议】主体茶壶置于画面右侧三分之一线左侧留白40%从壶嘴方向引入一条斜向引导线 【色彩配方】主色#C8BBA4灰杏仁调辅色#6B7159橄榄灰点缀色#B23A2F朱砂整体明度区间55%-70%饱和度控制在25%以内 【光影方案】左侧45度顶光光比1:2阴影边缘柔化无硬光斑 【材质与细节】宣纸纹理背景茶壶边缘轻微做旧壶身亚光质感 【情绪锚点】画面只有一只壶架在砚台边不出现人物强化午后等待感这段配方可以直接接在文生图工具的提示词前面也可以作为纠偏指令发给图生图工具按这个配方重新生成一版。3.4 实测效果同一个词的两种出图结果我用新中式茶品牌海报做过对照测试。普通提示词一张高级感的新中式茶品牌海报精致有韵味国风——出的图祥云、灯笼、山峰、茶叶罐全往上堆元素密度极高看着像年历封面色彩还很乱红金绿全上了。换成「审美编译」配方后再生成——构图一下就干净了留白处透气色彩统一在暖灰调里朱砂点缀点到为止视觉重心集中在茶壶本身。同一台设备、同一个模型仅仅因为提示词的词汇级别不同效果差距就有这么大。记住一个原则**跟AI说好氛围不如说光比1:2、饱和度25%、主体占比40%。**模型对数值和空间关系的理解远比对形容词的理解准确。4. 两个Skill组成闭环生成、诊断、开方、再生成单个Skill各有用途但真正的价值爆发是在它们组成闭环之后。我现在出图的基本流程是固定的一套组合拳跑两三轮就能把一张图从凑合能看推到可以直接交差。4.1 闭环工作流设计编译开方用「审美编译」把需求翻译成画面配方首次生成按配方出图一次出6张左右作为候选判官诊断把候选中相对最好的一张送入「审美判官」打分并列出问题编译修正把判官的问题清单丢回「审美编译」让它转成精确的二次修正配方二次生成用修正配方重新生成再让判官验证裁决判官打分达到80分以上我个人的投放基线就收工整个过程跑一轮大概20分钟。前期调Skill花的时间多一些但调好之后这套闭环非常稳定。4.2 一次实跑记录一张咖啡海报的两轮迭代拿最近的咖啡品牌海报需求做个实录这是跑完第一轮的真实记录第一轮编译给出的配方方向是暖调、午后阳光、欧式石墙作背景、木质桌面、玻璃杯折射光。6张候选图里我选了一张构图最舒服的送进判官。判官输出总分62。问题按优先级排玻璃杯的高光区域过曝破坏质感背景石墙纹理很乱像两种不同材质被拼接在一起主体占画面58%留白不足视觉上很挤暖色饱和度整体超出15%画面偏黄我把这段诊断原封不动丢给编译要求它输出修正配方。编译器给出的调整是玻璃杯高光压暗2档、石墙纹理锁定为单色清水砖、勾缝均匀、主体占比下调到40%、整体饱和度降10%并加一层冷灰平衡。第二轮按新配方生成判官打分84。相比第一轮构图呼吸感出来了背景不再抢眼玻璃杯的高光也收敛了。62到84中间只隔了一次诊断-开方的循环。这个过程本质上就是在复刻一个设计总监带助理改稿的流程只是这个助理手速极快愿意无限重来。4.3 这套组合拳不只能用在文生图上「判官编译」的组合其实是一种普适的审美工作范式换场景依然成立AI做PPT排版判官负责审版式检查信息层级和留白问题编译负责给出配色比例和字体搭配方案AI写文案的画面感判官审文字里有没有具体可感的意象编译把抽象表达比如很孤独翻译成有画面细节的版本走廊尽头只有一盏灯AI做视频封面/小红书首图构图、色彩、标题位置三个要素的判官编译逻辑完全一致换成对应场景词就行只要涉及评判生成这对动作闭环都能用。5. 部署Skill时踩过的大坑四条血泪教训这套方案不是一次就调通的。前面踩的坑不少挑最典型的四个说说给准备入手的你打个预防针。5.1 坑一Skill写成了百科全书AI反而变笨我第一次写「审美判官」时恨不得把构图的十几条法则、色彩的所有术语全部塞进去。结果模型输出变得非常臃肿每条诊断列12个维度而且维度之间互相覆盖读起来像论文不像诊断书根本没法直接用。后来我砍掉冗余维度只保留了真正影响出图决策的6个维度示例不超过3条每条诊断按优先级排序。精简之后输出质量反而大幅上升。**Skill不是知识库是工作指令。**你塞太多背景知识它会花精力去展示知识而不是完成任务。5.2 坑二结构化输出绑架了诊断质量一开始我让「审美判官」必须输出严格JSON格式想着方便程序解析。结果AI花了一半精力去保证字段合法诊断质量和深度明显缩水经常出总分70问题[]建议[]这种空泛内容。后来我改成先输出自然语言诊断再附JSON摘要两段式。自然语言部分保证信息密度和可读性JSON摘要留给程序处理。生成类Skill同理先输出可读的配方文稿再接一段完整的提示词串「审美编译」目前就是按这个思路运作的。5.3 坑三把Skill放在知识库模型根本不主动调用这个坑藏得比较深。很多Agent平台有知识库和技能区/人设区两个入口。我一度把Skill文档放在知识库里以为模型会自动参考——实际效果约等于薛定谔的猫十次回复里有两三次生效剩下全靠运气。原因是知识库对模型来说只是参考资料按需检索。而你写的人设/技能区指令是每次对话必须遵循的规则优先级完全不同。技能类、规则类、评审类的东西必须放在指令区不能丢资料库。踩过这次坑之后我所有的Skill统一都放到指令位再没出现过时灵时不灵的问题。5.4 坑四一个白嫖技巧温度参数与评分校准最后聊两个容易被忽略的参数级细节。Skill效果跟模型的temperature温度有关系。我用「审美判官」时会把温度调到0.1-0.2让输出稳定、口径一致用「审美编译」时给到0.5-0.7保留配方的多样性和意外性避免每次生成的画面配方都一个模子。另一个技巧是评分锚点校准刚写完判官Skill时不要让AI顺手就给你打分。先拿5张你明确喜欢或明确不喜欢的图喂给它看它给的分数是否符合你的主观排序。如果它给一张你自认60分的图打了90分说明你的评分标准描述有问题需要把60分是什么样、90分是什么样用例子写清楚。锚点校准做一次就够了做完之后它的打分才真正对你有参考意义。6. 这套玩法给我的最大启发两个Skill折腾下来我最大的感受不是AI变聪明了而是AI在特定框架下可以变得非常稳定。审美不是一个模糊的黑盒它完全可以被拆解成维度、规则和可执行的参数。你让AI在明确的框架里工作它的表现往往比自由发挥高出一大截。最后分享一个小扩展思路你不一定非要用我这两个Skill更值得做的是模仿这个模式去定义你自己的审美偏好包。比如你喜欢极简风就做一个极简美学评测极简视觉编译器你搞摄影就做一个光影评审构图翻译器。核心永远是那句话**先把审美拆成可说的维度再把维度变成可执行的动作。**AI审美在线与否很多时候不是模型的差距是方法论的差距。
返回列表