Skip to main content
All posts
作者:Sagasu

# 当我们要求模型画出“宋式审美”时,它究竟还做不到什么

摘要

这是一轮关于“宋式审美能否被生图模型稳定转译”的测试记录,而不是一组生成作品的展示。我们关心的并非模型能否产出带有青绿、细线、绢纹或花鸟的“国风感”图像,而是当这些元素要同时服务于一篇文章、一项产品价值或一个当代叙事时,模型能否持续做出正确的取舍。

测试从最初的材质、设色和线条试验,逐步推进到线框约束、人物叙事、知识封面与产品海报。过程中,我们先后尝试了通用色卡、材质卡、方向样张、结构线框、内容路由、负向约束,并制定了真实文章的 A/B 对照协议。部分尝试有效,部分被明确停用。最终结论并不是“模型不会画国画”,而是:它能够命中许多局部特征,却还不能稳定地完成一项复合的视觉判断——让线条服从物象、让颜色附着形体、让留白构成空间、让主景回应内容,并在系列中保持同源而不重复的变化

对一个新的生图技能而言,最可借鉴的不是一套“宋风提示词”,而是这轮测试形成的方法:先把审美要求拆成可判断的任务;将内容命题、结构、色彩、气质和反例分开管理;每次只改变一个变量;用真实使用场景而非孤立美图来检验;把失败沉淀为资产边界和规则,而不是不断把提示词写得更长。

1. 为什么要做这轮测试

“宋式审美”在内容生成里很容易被压缩成几个可见符号:青绿、金线、花鸟、古书、留白,或者一层仿绢纹理。这些元素单独出现时往往足以让人迅速识别“传统感”,却无法保证画面真正具有宋代绘画中更关键的关系:物象被怎样观察,近景如何切入,色彩怎样收住,空处如何与实体共同形成空间,文字又怎样进入画面。

项目最初希望建立的是一种可用于当代内容的视觉语言。它既要保留细线骨架、沿形体推进的天青与灰青、局部石绿和浅赭、绢地留白、近景自然局部等特征,又不能退回满版山水、旅游海报、古装戏感或泛中式商业装饰。更难的是,画面还要能承接不同内容:一篇随笔、一篇技术文章、一个空间观察、一个人物叙事和一张产品海报,不应只是同一片青绿背景换标题。

所以,这轮测试提出的问题是:当“宋式”不再是一组风格标签,而是一套需要服务内容的视觉判断,模型在哪些环节会失效?

2. 先说明判断标准:我们不评“像不像宋画”

这不是对古画真伪、历史复原或艺术史风格的评测。所有色卡和样张都是面向现代内容封面的转译工具,不等同于宋画颜料复原,也不允许复制具体馆藏、艺术家笔触、题字、印章或原作构图。

我们以五个可观察维度评价图像:

判断维度需要成立的关系常见失效方式
物象与线条线条说明石、枝、岸、纸页或人物的结构、受力与生长方向细线变成均质装饰纹理
设色与材质颜色随形体、光线、浓淡和局部露底推进青绿变成覆盖全图的情绪滤镜
空间与留白近景、远处与空域共同形成距离和观看路径空白变成无意义的白底,或画面变成无中心纹理
主题与主景画面对象能够解释文章或产品的命题用古书、飞檐、圆月等高频符号替代内容理解
系列化可用性同一方向能在不同题材中保持原则一致且不重复要么所有图像同一模板,要么为变化而失去方向

这五项标准决定了本文的读法:图像不是“好看 / 不好看”的样品,而是每次尝试在某项关系上成立或失配的证据。

3. 测试是如何被组织起来的

3.1 从“提示词试错”到最小生产系统

早期生成暴露了四个重复出现的问题:深色背景与金线反复出现;标题常被固定在右上角;传统意象和文章主题之间没有解释关系;画面容易进入色彩过满、符号堆叠的商业古风。下面三张图不是原始测试结果,而是把这四种现象拆开后的阅读示意:它们帮助第一次接触项目的读者理解,为什么“看起来有国风”并不等于画面已经完成了内容表达。

示意图 1:当深色背景、金线和右上标题区被反复复用时,主题虽变,画面逻辑却没有变化;系列视觉会沦为同一模板的换标题版本。

示意图 2:技术—古书、城市—飞檐、情绪—孤舟圆月、商业—青绿金色,都是模型最容易调用的高频映射;它们能迅速提示传统感,却未必解释内容真正要说什么。

示意图 3:商业古风的典型问题不是元素不够,而是元素彼此竞争。修正动作不是再增加“宋式”符号,而是先删到只剩一个能回应命题的主景和一个清楚的阅读空域。

问题并不靠增加更多描述词解决,因为模型会把“宋风、国画、留白、高级、青绿”等高频词混合成一个平均结果。

因此,测试逐步建立了一套最小生产系统:先读内容,再确定视觉命题;从内容路由中选择一个方向;使用线框锁定阅读结构;用一张样张或研究参考收敛气质;以数值化色卡控制颜色边界;最后以负向约束排除已知反例。它的原则是让不同资产各司其职,而不是用一堆参考图共同“祈祷”模型理解。

层级使用的资产它负责解决什么它不能替代什么
内容层内容路由、视觉命题为什么是花鸟、材料页、器物、窗影或日常人物不能直接决定画面结构
结构层线框标题区、主景区、留白、安全区、阅读动线不能自动生成有效物象或叙事
色彩层生产色卡、关系摘要色相、明度、面积比例和禁用色不能脱离对象成为通用“宋色”
气质层方向样张、研究参考近景与空域比例、图文密度、完成度、材质关系不应被逐像素复制,也不能替代内容理解
规则层负向约束、评分表排除满版山水、亮金、网页 UI、无关符号等错误路径不能替代最后的编辑判断

一次生成的图像参考也被严格控制为两张以内:通常是一张线框 + 一张同方向样张或研究参考。色卡的 HEX、面积比例和禁用项写入文字,不额外占用参考图位置。原因是参考图越多不必然越可控;当线框、色卡、材质和样张彼此存在微小冲突时,模型常会把它们折中成一个既不鲜明也不克制的结果。

3.2 线框究竟在约束什么

线框不是“画面长相”的草图,而是把不可违背的主次关系提前画出来:哪里是信息安全区,主景最多占多大,哪里必须保持低信息密度,视线从何处进入、向何处收束。它只锁定阅读结构,不能规定具体物象的姿态,也不能把构图变成唯一模板。

图 1|北宋“万象归类”线框:让材料形成秩序

标题区约占左上四分之一;核心编联区承担材料被归类、压边和比照的关系;成篇页缘只占小面积。这个线框不要求摆出“文房案头”,而是要求画面解释“收集、整理、沉淀”。

图 2|南宋“一角成篇”线框:让边角打开空间

右下角是一组材料页构成的唯一近景主景,左侧标题区与空域保留距离。它要测试的是“从一角收束为一页表达”,而不是把画面简单做成白底和一本古书。

这两张图后来成为产品海报测试的结构基线。它们也提前说明了一个重要边界:即使模型严格遵守主景区和留白区,也不代表它已经理解了北宋的归类关系或南宋的截景关系。线框只能防止画面失序,不能代替观看。

3.3 色卡与材质为什么经历了一次停用

早期曾制作 ST-C01 色卡与 ST-M01 熟绢晨光材质,试图把“宋院春庭”压缩成矿物色、绢地和轻暖空气感的组合。它们有明确用途:快速测试天青、石绿、浅赭和绢纹是否能收敛模型输出。但测试很快发现,这条路径本身有问题——当颜色与材质脱离花木、禽鸟、季节、光线和物象结构后,它们很容易变成抽象拼贴或泛国风底纹。

图 3|被停用的 ST-C01:颜色印象不能代替画面关系

色粉、绢地和局部暖色能够迅速提示“矿物设色”,却把具体院体花鸟压缩为可被任意调用的青绿印象。

图 4|被停用的 ST-M01:表面触感不能代替物象

轻淡绢纹与晨光感能改善表面,但一旦被当作独立背景,模型会优先放大“旧、淡、柔”的质感,而非枝叶、花鸟、庭石与空域的关系。

因此,ST-C01ST-M01 不再进入后续生产。修正后的做法是双轨并行:研究阶段先观察可追溯作品参考中的物象、浓淡与空间;生产阶段才把其中可迁移的关系转译为色卡。以 ST-P01|秋芙蓉与锦羽 为例,它只服务秋日文化随笔、生命感和品牌人文等特定任务:绢帛暖白约占 35–50%,灰橄榄绿占 15–25%,温墨褐承担结构暗部,拒霜粉与锦羽赭金只作局部生命点,并明确禁止翠绿、正红、镜面亮金和大面积纯黑。关键不在颜色名称,而在颜色重新被放回“芙蓉、锦羽、枝叶、空域”的画面关系里。

4. 第一阶段:从材质和笔触出发,为什么总会失去物象

测试最先从材质、线条和自然局部开始。这个阶段的假设是:如果先把绢地、积染、细线和矿物设色控制住,模型也许能够接近一种可用于情绪叙事的当代国画语言。

4.1 线条测试:模型会“画细”,却不一定会“用线”

同一轮天青设色盲测中,三个模型都调用了细线、淡色、纸绢底和青灰色,但它们对线条的处理明显不同。

Seedream 5.0 Pro:细线密集缠绕,带来很强的手绘完成度,但线条没有稳定说明物象骨架。

GPT Image 2:块面和细线构成了轻淡气氛,形体却趋向柔化的抽象地貌。

Nano Banana Pro:褶皱式线条被推至前景,画面完成度高,但结果更接近设计化线描插画。

这里的结论不是“细线无效”。真正的问题在于,国画里的线不是附加在画面上的风格效果。它要解决石头怎样转折、草木怎样生长、水岸怎样收住、纸页怎样叠压。模型能够拟合线的密度、曲率和旧感,却难以稳定判断每一笔为什么必须出现于此。因此,单靠“工笔、细线描、宋画质感”会得到漂亮的综合色调,但不一定得到一个被准确观看的对象。

4.2 材质与自然局部:一次尝试只解决一个条件

下列测试按“积染—截景—枝节—水岸”的顺序推进。每张图都解决了一部分问题,同时暴露另一部分尚未成立的关系。

覆染后透出:积染和材质感成立,但画面尚没有可辨认的物象和空间。

页缘松开:截景与留白明显,但它更接近纸张拼贴的抽象设计,而非由物象带出的空间。

枝节微生:枝节提供了具体对象,但背景设色仍主要承担氛围,而未完全随枝、芽与空域组织。

折枝见新芽:新芽与“重新开始”的语义关系清楚,但画面明显滑向摄影化自然景观。

679098fc9164c8?width=4000&height=4000&fit=scale-down)

水气未定:天青、绢地和水岸都出现了,但整体仍更像被统一气氛覆盖,而不是由水、石、岸和空域共同建立的关系。

这一阶段带来的修正是:不再从“先有一张好看的材质底图”开始,而是先确定一个可被观察的局部对象,再让线、色和材质分别回答它的结构、体积和空气。也就是说,设色不再被看作配色;它必须说明颜色附着在哪里、为什么在这里变浓、为什么在那里露出绢地。

4.3 设色测试:颜色能被生成,颜色关系还不能被自动判断

结构—设色方向样张:左侧先建立岸、石与水的线性骨架;右侧的青、灰青、石绿与浅赭分别沿坡面、水边、草木和暗部推进。

这张样张成为之后判断“设色是否成立”的参照。它的关键不是使用蓝绿,而是控制蓝绿出现的理由:青色可压在暗部,也可被绢地吞回去;石绿只在极小的草木处出现;浅赭不是一个随意的暖色点,而是让石面、岸边和空气产生温度差。模型输出中的蓝绿往往更像全局气氛——先生成一个可识别的青绿世界,再把细节塞进去。修正策略因此从“提示模型使用某种颜色”变成“说明每种颜色的形体位置、面积上限与禁止越界”。

5. 第二阶段:线框能稳定结构,却不能自动生成观看

在自然局部测试之后,项目开始引入线稿和结构线框,希望将前景、标题和空域关系固定下来,再把这套语言带进人物和当代叙事。假设是:如果模型不再自行决定主景位置,就有更多空间保留给细线、设色和情绪。

关系转向:纸页、桌面边缘和大面积空域的比例被预先固定。线稿有效地限定了“什么可以出现”,但不决定模型如何理解这个关系。

回身之后:人物、蓝色围挡与远处关系已经清楚,但图像主要依靠当代手绘场景的叙事语法成立。

风把布向两边托起:近景布幕确实打开了空间,但人物、材料与叙事细节增加后,画面容易离开原有的设色约束。

暂时停在半空的东西:多人物、建筑内部与悬挂布料带来了更强的事件性,同时增加了画面保持克制、单一主景和稳定材质语言的难度。

这组结果修正了一个误解:留白不是在线框上划出一块空区域。这里所说的“南宋式的空“,是本项目借用南宋院画重视简洁构图与空灵画面的工作性描述,而不是对南宋绘画的完整艺术史概括。它来自近景与远处之间的距离,来自一截坡岸、一段页缘、一块布或一个人物动作如何压住画面,才让空处有气流和视线。线框可以禁止主体居中、禁止装饰进入标题区,却不能替模型作出“何处该收住”的判断。故宫博物院对“院体”的说明指出,南宋院画在继承北宋宫廷绘画“状物精微”“写实之极”的基础上,更讲求构图简洁与画面空灵;其馆藏《果熟来禽图页》的解读也以折枝取景、删繁就简与蕴藉空灵说明这一类画面关系。citation citation

6. 第三阶段:进入真实内容后,最难的是语义转译

一张抽象情绪图可以不解释自己;一张文章封面或产品海报不行。它必须让标题、主景和内容价值彼此支撑。于是测试进入“认识 YouMind”系列:尝试用宋刊秩序、材料页、编联关系和北宋 / 南宋两种视觉命题,转译“收集、整理、关联、沉淀、表达”这些产品价值。

6.1 从“宋刊感”到“知识对象”

宋刊知见封面测试:最初尝试以版心、页边和阅读感承接知识主题。风险是它容易被模型理解为仿古书页、杂志内页或信息面板。

宋刊知见重做测试:修正方向不是增加更多书页,而是减少信息,保留一个可被阅读的概念对象和清楚标题区。

这里形成了一个明确规则:知识类封面不应把“古书”当作知识的默认图标,更不能用网页 UI、流程节点、密集表格或仿古正文来证明“信息量”。宋刊知见真正借用的是版心比例、页边秩序和单一概念关系;图像承担的是建立阅读秩序,而不是复刻书页。

6.2 从宋式符号到可解释的产品主景

宋式视觉叙事封面:当“宋式”只作为视觉气氛,图像仍可能好看,却难以说明产品究竟在做什么。

散页成册:把“知识沉淀”转译为材料页从散到成册的关系,开始使主景与产品命题发生可解释的连接。

宋式编联海报:继续测试材料之间的编联关系。重点不在“纸页很多”,而在画面能否读出它们正在被组织。

宋式品牌封面:进入品牌表达后,传统符号、信息阅读与价值主张的取舍会被放大。没有明确主景关系,图像仍会退回风格包装。

这组测试把“一个主景或一个概念图示”的规则从审美偏好变成了必要条件。模型很擅长将“技术—古书”“城市—飞檐”“情绪—孤舟圆月”“商业—青绿金色”这样的高频对应物放进画面;但这些只是统计上常见的符号,不必然是内容需要的对象。对新技能而言,必须先要求它用一句话说清楚:**画面中的什么关系,正在替这篇内容表达什么?**说不清时,宁可回到光影、材质或留白,也不要硬塞传统元素。

7. 第四阶段:北宋与南宋不是两套可替换的滤镜

产品海报进一步要求我们区分两条路径。北宋“万象归类”服务收集、整理、比照与沉淀:重点是不同材料被精确归类、压边和比较,形成可继续创作的秩序。南宋“一角成篇”服务关联、收束与表达:重点是一组材料从精确边角斜入,近景带出远处空间,最终形成正在展开的一页表达。

早期尝试与修正版本之间的差异,显示了模型最容易走的捷径。

早期南宋边角截景海报:边角和空白已经出现,但“南宋”仍可能被简化为一种安静的生活方式画面。

早期北宋院体案头海报:物象密度提高,却有滑向案头陈设、文房摆拍和古籍文创的风险。

南宋一角成篇 v2:修正后将主景收回到一组从边角斜入的材料页与页缘,以近景和远处空间共同承担“成篇”。

北宋万象归类 v2:修正后强调被编联、压边和比照的材料关系,而不是简单增加古典器物。

这里的修正逻辑很重要:并不是用“北宋色”替代“南宋色”,或用“满”替代“空”。真正要改变的是视觉命题。只要命题依然含糊,模型就会以最熟悉的商业样式补全空白;当“材料如何被归类”或“一个边角如何收束成篇”被说清,模型才有机会围绕一种可判断的关系生成。

8. 如何讨论这些结果:不是模型不行,而是复合判断尚不稳定

这轮测试中,没有一张图能够被简单归为“成功”或“失败”。早期材质图让我们看见了绢地与积染的风险;线稿让我们获得了可控的空域和标题区;人物叙事证明模型能提供当代事件性;产品图则迫使我们把风格转回内容命题。它们的价值恰恰在于:每一张都让一个此前藏在黑盒里的问题变得可见。

综合来看,模型的能力边界可以这样描述:

  • 它能生成细线,却不能稳定让线条承担形体判断;

  • 它能生成低饱和青绿,却不能稳定让设色随物象的体积、暗部和露底推进;

  • 它能生成空白,却不能自动让空白成为被近景激活的空间;

  • 它能调用传统符号,却不能可靠地把文本命题转译为不可替换的主景;

  • 它能复现单张风格,却难以在不复制的前提下维持系列中的同源变化。

这不是通过“加更多提示词”就能解决的问题。提示词、色卡、线框和样张所提供的是不同类型的约束,但它们之间仍需要排序:什么是硬约束,什么可以让步,什么一旦出现就要删掉。当前模型无法稳定完成这次排序,因此人的作用并没有消失,而是从“手工制作每一笔”转为“建立判断系统、选择变量、解释结果和作出删改”。

9. 新技能可以借鉴的工作方法

如果把这轮测试沉淀成一个新的生图技能,最不该复制的是一段冗长、万能的“宋风提示词”;最该保留的是下面这套可迁移的方法论。

9.1 先问内容,不先问画风

技能的第一个任务应是读取文章类型、平台、标题长度、信息密度和情绪,再给出一句视觉命题。例如:

  • “把分散资料整理为可继续创作的秩序”对应材料页编联;

  • “从一个边角把思考收束为成篇表达”对应近景页缘与远处空间;

  • “重新开始”可对应一枝新芽与极小生命点,而不是默认山水和圆月。

只有命题成立,主景才有选择依据。若没有可解释的主景,技能应允许使用光影、材质或局部空间,而不是强行加传统符号。

9.2 将资产拆成角色,而不是堆成灵感图库

新技能应维护内容路由、线框、研究参考 / 样张、生产色卡、负向约束五类资产,并明确每类资产的职责。线框只负责结构;色卡只负责色彩关系;研究参考只负责理解真实画面;样张只负责气质;负向约束只负责排除反例。任何资产都不能越权替代其他资产。

最小调用应保持节制:一个方向、一种画幅、一个主景、一张线框、一张样张或研究参考。色彩数值写入文字。这样既能减少模型在多参考之间的折中,也让失败时可以定位是哪一层出了问题。

9.3 把反例写成可执行的边界

新技能不应只说“避免俗气”,而要把已经验证的错误转写为检查项:不做满版山水、居中对称、无关传统符号堆叠;不使用亮金、高饱和节庆配色、古装影视剧人物;知识和产品封面不使用网页 UI、仪表盘、流程节点或仿古正文;画面拥挤时优先删除元素,而不是补充装饰。

这些不是审美禁令,而是从失败结果中提取出的风险控制。它们让模型的候选范围更小,也让人工评审有明确的否决理由。

9.4 一次只改一个变量,用真实任务评估

新技能应避免同时更换线框、样张、色卡和主景。若一轮结果不理想,先判断问题主要发生在结构、色彩、气质、语义转译还是文字可读,再只修改其中一个变量复测。评估则应使用真实文章或真实产品命题,而非无标题的孤立美图,并至少检查:内容匹配、结构执行、色彩控制、方向辨识和直接可用性。

资产的扩展也应有闸门:只有当同一方向连续多次无法覆盖某类真实主题,或既有色卡被迫违反适用边界时,才新增资产。否则,扩库只会把不确定性伪装成“选择更多”。

9.5 把模型定位为候选生成器,而不是审美裁判

技能最终输出的不应只是图片,还应包含简短的生成决策:选择了什么方向,为什么选这个主景,线框约束了什么,色卡禁止了什么,结果需要检查哪些风险。这样,人可以快速判断模型是否仍在内容命题和结构边界内工作。

10. 结论

这轮测试最终没有得到一套可以一键生成“宋式审美”的公式,反而得到了一条更可靠的结论:所谓宋式审美的难点,不是让画面看起来传统,而是让每个局部都服从一次具体的观看与取舍。线为什么在这里出现,颜色为什么在这里停顿,空处为什么不是空白,主景为什么只能是它而不是另一个符号——这些问题共同构成了画面的判断力。

现阶段的生图模型很适合承担受约束的探索:试材质、试色彩、试构图开口,或在清楚边界内生成候选。但它尚不能独立承担这套连续判断。一个成熟的新技能需要做的,不是把这种判断藏进更长的提示词,而是把它拆开、显性化、可检验化:先建立观看,再让模型在观看的边界内工作。