An image to describe post

摘要

这是一轮关于“宋式审美能否被生图模型稳定转译”的测试记录,而不是一组生成作品的展示。我们关心的并非模型能否产出带有青绿、细线、绢纹或花鸟的“国风感”图像,而是当这些元素要同时服务于一篇文章、一项产品价值或一个当代叙事时,模型能否持续做出正确的取舍。

测试从最初的材质、设色和线条试验,逐步推进到线框约束、人物叙事、知识封面与产品海报。过程中,我们先后尝试了通用色卡、材质卡、方向样张、结构线框、内容路由、负向约束,并制定了真实文章的 A/B 对照协议。部分尝试有效,部分被明确停用。最终结论并不是“模型不会画国画”,而是:它能够命中许多局部特征,却还不能稳定地完成一项复合的视觉判断——让线条服从物象、让颜色附着形体、让留白构成空间、让主景回应内容,并在系列中保持同源而不重复的变化

对一个新的生图技能而言,最可借鉴的不是一套“宋风提示词”,而是这轮测试形成的方法:先把审美要求拆成可判断的任务;将内容命题、结构、色彩、气质和反例分开管理;每次只改变一个变量;用真实使用场景而非孤立美图来检验;把失败沉淀为资产边界和规则,而不是不断把提示词写得更长。

1. 为什么要做这轮测试

“宋式审美”在内容生成里很容易被压缩成几个可见符号:青绿、金线、花鸟、古书、留白,或者一层仿绢纹理。这些元素单独出现时往往足以让人迅速识别“传统感”,却无法保证画面真正具有宋代绘画中更关键的关系:物象被怎样观察,近景如何切入,色彩怎样收住,空处如何与实体共同形成空间,文字又怎样进入画面。

项目最初希望建立的是一种可用于当代内容的视觉语言。它既要保留细线骨架、沿形体推进的天青与灰青、局部石绿和浅赭、绢地留白、近景自然局部等特征,又不能退回满版山水、旅游海报、古装戏感或泛中式商业装饰。更难的是,画面还要能承接不同内容:一篇随笔、一篇技术文章、一个空间观察、一个人物叙事和一张产品海报,不应只是同一片青绿背景换标题。

所以,这轮测试提出的问题是:当“宋式”不再是一组风格标签,而是一套需要服务内容的视觉判断,模型在哪些环节会失效?

2. 先说明判断标准:我们不评“像不像宋画”

这不是对古画真伪、历史复原或艺术史风格的评测。所有色卡和样张都是面向现代内容封面的转译工具,不等同于宋画颜料复原,也不允许复制具体馆藏、艺术家笔触、题字、印章或原作构图。

我们以五个可观察维度评价图像:

判断维度 需要成立的关系 常见失效方式
物象与线条 线条说明石、枝、岸、纸页或人物的结构、受力与生长方向 细线变成均质装饰纹理
设色与材质 颜色随形体、光线、浓淡和局部露底推进 青绿变成覆盖全图的情绪滤镜
空间与留白 近景、远处与空域共同形成距离和观看路径 空白变成无意义的白底,或画面变成无中心纹理
主题与主景 画面对象能够解释文章或产品的命题 用古书、飞檐、圆月等高频符号替代内容理解
系列化可用性 同一方向能在不同题材中保持原则一致且不重复 要么所有图像同一模板,要么为变化而失去方向

这五项标准决定了本文的读法:图像不是“好看 / 不好看”的样品,而是每次尝试在某项关系上成立或失配的证据。

3. 测试是如何被组织起来的

3.1 从“提示词试错”到最小生产系统

早期生成暴露了四个重复出现的问题:深色背景与金线反复出现;标题常被固定在右上角;传统意象和文章主题之间没有解释关系;画面容易进入色彩过满、符号堆叠的商业古风。下面三张图不是原始测试结果,而是把这四种现象拆开后的阅读示意:它们帮助第一次接触项目的读者理解,为什么“看起来有国风”并不等于画面已经完成了内容表达。

An image to describe post

示意图 1:当深色背景、金线和右上标题区被反复复用时,主题虽变,画面逻辑却没有变化;系列视觉会沦为同一模板的换标题版本。

An image to describe post

示意图 2:技术—古书、城市—飞檐、情绪—孤舟圆月、商业—青绿金色,都是模型最容易调用的高频映射;它们能迅速提示传统感,却未必解释内容真正要说什么。

An image to describe post

示意图 3:商业古风的典型问题不是元素不够,而是元素彼此竞争。修正动作不是再增加“宋式”符号,而是先删到只剩一个能回应命题的主景和一个清楚的阅读空域。

问题并不靠增加更多描述词解决,因为模型会把“宋风、国画、留白、高级、青绿”等高频词混合成一个平均结果。

因此,测试逐步建立了一套最小生产系统:先读内容,再确定视觉命题;从内容路由中选择一个方向;使用线框锁定阅读结构;用一张样张或研究参考收敛气质;以数值化色卡控制颜色边界;最后以负向约束排除已知反例。它的原则是让不同资产各司其职,而不是用一堆参考图共同“祈祷”模型理解。

层级 使用的资产 它负责解决什么 它不能替代什么
内容层 内容路由、视觉命题 为什么是花鸟、材料页、器物、窗影或日常人物 不能直接决定画面结构
结构层 线框 标题区、主景区、留白、安全区、阅读动线 不能自动生成有效物象或叙事
色彩层 生产色卡、关系摘要 色相、明度、面积比例和禁用色 不能脱离对象成为通用“宋色”
气质层 方向样张、研究参考 近景与空域比例、图文密度、完成度、材质关系 不应被逐像素复制,也不能替代内容理解
规则层 负向约束、评分表 排除满版山水、亮金、网页 UI、无关符号等错误路径 不能替代最后的编辑判断

一次生成的图像参考也被严格控制为两张以内:通常是一张线框 + 一张同方向样张或研究参考。色卡的 HEX、面积比例和禁用项写入文字,不额外占用参考图位置。原因是参考图越多不必然越可控;当线框、色卡、材质和样张彼此存在微小冲突时,模型常会把它们折中成一个既不鲜明也不克制的结果。

3.2 线框究竟在约束什么

线框不是“画面长相”的草图,而是把不可违背的主次关系提前画出来:哪里是信息安全区,主景最多占多大,哪里必须保持低信息密度,视线从何处进入、向何处收束。它只锁定阅读结构,不能规定具体物象的姿态,也不能把构图变成唯一模板。

图 1|北宋“万象归类”线框:让材料形成秩序