视觉资产设计
本 skill 提供把角色/场景/道具的创意设定编译为可执行图片生成 Prompt 的领域
知识。它不替代 Project Schema、模型能力限制或用户要求;冲突时遵循:用户
明确要求 > 当前图片模型要求 > 本 skill 默认值。成本合同(一图一 Variant、
生成前去重、required_variant_ids 计划合同)以主 Agent 系统提示中的结构
合同为准,本 skill 只负责"画什么、怎么写"。
1. 参考图布局规范
核心原则
-
类型驱动:角色身份优先使用艺术化身份板;场景使用无角色空间锚点;道具使用英雄视图与多角度细节;动作状态才使用时间序列关键帧。信息密度必须服从身份可读性,不能为了塞满宫格而重复或重叠。
-
用户优先:用户明确要求单图、指定宫格数、指定视角或布局时,按用户要求执行。
角色身份参考图:电影感艺术身份板
角色首次建立视觉身份时,默认生成一张具有高端动画工作室角色研究与艺术书布局感的身份板,而不是标准网格、蓝图、目录或重复 turnaround:
- 画幅使用 Project
settings.aspect_ratio(用户明确指定时以用户为准),不要默认横屏,纯白或柔和米白背景,大面积留白;无环境叙事、无无关道具、无水印。身份性服装与随身装备必须完整保留。
- 版式不对称、优雅且有意失衡,使用多样化图像比例。一个大型、略偏离中心的英雄全身视角作为视觉锚点,周围以干净间距放置较小的独立研究。
- 辅助研究按身份信息价值选择:中性全身、正/侧/背面、坐姿、倾斜、蹲姿、俯视、仰视、富有表现力的肖像;避免多个近似的正面站姿。
- 所有全身、肖像、轮廓和细节研究严格分离:不得重叠、融合、堆叠;不得裁切脸部、隐藏肢体或截断尾巴/身份装备。
- 包含小型轮廓研究区(2–3 个简化黑色轮廓)、小型表情研究区(细微可观察的情绪变化)、小型细节研究区(脸部、发型/毛发、服装结构与关键装备)。
- 文字只保留简约角色 ID 块:名称、角色、核心情绪、视觉标志。手写标签与编辑箭头只在确有帮助时少量使用,不生成长段说明。
- 全部视角必须是同一个角色:相同脸部与比例、发型/毛发、身体比例、服装、装备、固有配色、姿态语言和视觉个性。拟人动物明确双足/四足形态,禁止物种、年龄、体型或服装漂移。
用户明确要求标准设定表、单图或指定宫格时服从用户;仍保持视图独立、信息不重复和身份锁定。
序列关键帧参考图
一张多宫格图,按时间顺序展示主体在一段内容中的关键瞬间:
- 从左到右、从上到下,每格对应一个关键节点或动作瞬间。
- 若该图用于分镜或视频生成参考,每个格子的内部画框必须与目标视频
settings.aspect_ratio 完全一致,且必须使用正方形网格(N 列×N 行):把画布按 列×行 切分会让单格比例乘上 行/列,只有列数等于行数时单格才等于目标画幅。格数不是完全平方数时补到下一个完全平方数(2–4 格→2×2,5–9 格→3×3),多余格作为无边框外侧留白,不得拉伸、裁边或用重复内容填空。
- 宫格数量优先取完全平方数:4 格用于简短状态,9 格用于动作密集或完整场景;关键瞬间数量介于两者之间时用 3×3 并接受留白,不要为了填满而增删瞬间。超过 9 格时优先简化背景与单格细节,保持动作轮廓可读。
- 每格应包含:主体动作/状态、环境背景、镜头景别。
- Prompt 中逐格描述。
- 用户要求单图时:单图展示最关键瞬间。
适用场景(不限于剧情):
-
叙事类:情节推进(角色奔跑 → 回头 → 惊讶)。
-
展示类:使用流程(开箱 → 手持 → 使用 → 效果)。
-
动作类:动作序列(准备 → 起跳 → 落地 → 庆祝)。
-
宠物类:行为链(嗅闻 → 追扑 → 进食 → 休息)。
-
旅行类:地点序列(到达 → 探索 → 发现 → 离开)。
-
访谈类:关键瞬间(陈述 → 手势强调 → 反应表情)。
场景/环境参考图
展示空间/场景的视觉锚点,支持两种形式:
-
多宫格(默认):展示场景不同角度(正面/侧面/鸟瞰/局部细节),适用于复杂场景或多区域环境。
-
单图全景:无角色或仅有角色剪影,包含光影基调、色调、标志性环境元素。
- 用户要求时按用户指定的视角或细节重点生成。
-
场景锚点是环境空镜:两种形式的画面中都不得出现任何具体角色或路人(剪影除外),在 Prompt 中显式声明“空镜、无人物”;角色一致性由角色锚点图负责,场景图里的人物会污染下游分镜的参考输入。
选择规则
| 用途 |
默认布局 |
用户可调整 |
| 角色首次建立身份 |
电影感艺术身份板(不对称层级) |
用户可要求标准设定表、单图或指定视角 |
| 道具首次建立身份 |
英雄视图 + 多角度/尺度/材质细节 |
用户可要求单图或指定视角 |
| 场景/环境建立 |
场景参考图(多宫格多角度 或 单图全景) |
用户可指定视角或细节重点 |
| 主体在一段内容中的关键瞬间 |
序列关键帧参考图(多宫格时间线) |
用户可要求单图或指定宫格数 |
优先级:用户明确要求 > 默认推荐。
2. 视觉实体 Prompt 结构
为 VisualEntity 生成参考图时,Prompt 按以下维度组织;不要只写“主体/姿态/环境/风格”四句概括:
-
生成目标与格式:资产类型、画幅、背景、用途,以及是艺术身份板、场景锚点、道具研究还是序列关键帧。
-
主体定义与身份锁定:基于 grounding context、参考图和用户描述,先列最有判别力的剪影/比例/脸部/毛发或发型,再列服装、装备、固有配色、品牌标志和不允许变化的内容;明确参考图具体提供什么。
-
版式与视觉层级:主视觉锚点的位置与尺度、辅助研究类型、留白、阅读路径、元素间距,以及不重叠、不融合、不裁脸、不藏肢体的约束。
-
视角/区域清单:逐区域写每个独立研究提供的唯一信息;序列关键帧逐格写动作相位、表情、景别和结束状态;场景写空间方向与地标关系。
-
背景与内容边界:角色板使用纯白/米白且无环境;场景锚点显式空镜、无具体角色;道具图使用中性背景。身份性服装与随身装备不属于“无关道具”,必须保留。
-
媒介、光线与质感:项目整体风格、渲染媒介、光线方向/质感、色彩、画幅和与媒介一致的质量目标;不要用通用画质词推翻有意的草图、颗粒或手工线条。
-
最小排除项:只写会造成身份漂移、版式污染、裁切、重复视图、额外人物、乱码文字或风格偏离的禁止项。
角色首次建立身份时默认使用电影感艺术身份板;角色在内容中的关键瞬间使用序列关键帧;场景锚点使用多角度空镜或单图全景;道具使用英雄视图与多角度细节。用户有明确要求时按用户要求执行。
写作要求
- 每个提示应详细但不冗长,聚焦关键视觉元素。
- 使用构图与镜头语言中的具体术语描述视角和构图。
- 遵循提示写作规则中的核心原则和画面质感建议。
- 用户有明确要求时按用户要求执行。
3. 构图与镜头语言
生成参考图时,根据主体类型和叙事需求选择合适的构图方式:
常用镜头视角
-
低角度仰拍:强调主体高度、权威感或压迫感。
-
高角度俯拍:展示空间布局或主体的渺小感。
-
俯视顶视图:展示整体空间关系或平面布局。
-
肩后视角:营造代入感或窥视感。
-
前景遮挡:通过前景元素增加层次和深度。
-
反射镜头:通过反射表面展示主体,增加视觉趣味。
-
剪影镜头:逆光下主体轮廓,强调形态和氛围。
-
框中框:通过框架结构框住主体,引导视线。
-
深远消失点:利用透视线引导视线,创造纵深感。
-
宽阔负空间:主体占据画面小部分,强调环境尺度或孤独感。
-
压缩长焦:压缩前后景距离,突出主体或制造拥挤感。
-
手持近景:模拟手持拍摄的不完美构图,增加真实感。
-
对角线运动:主体或镜头沿对角线移动,创造动态张力。
-
对称布景:对称构图,营造仪式感或超现实感。
-
不对称平衡:通过视觉重量平衡非对称构图。
-
主体部分隐藏:主体被环境或其他元素部分遮挡,增加神秘感。
-
环境尺度:主体在广阔环境中显得渺小,强调空间感。
-
主观视角:从主体视角拍摄,让观众代入角色。
-
分层前景/中景/背景:明确区分三个层次,增加画面深度。
构图选择规则
-
角色首次建立身份:使用一个偏心英雄全身视角建立主次,再用 3–8 种真正不同的信息视角、轮廓、表情和细节研究辅助;不做平均权重网格。
-
角色在内容中:根据情绪选择构图(紧张时用低角度/前景遮挡,孤独时用负空间,动作时用对角线运动)。
-
场景建立:使用深远消失点或宽阔负空间展示环境尺度。
-
道具展示:使用对称布景或框中框突出主体。
优先级:用户明确要求 > 默认推荐。
4. 提示写作规则
规避图片审核误判(硬性)
图片模型的输出审核(如 DashScope 的 green-net)拒绝是确定性的:同样的 prompt 每次都会被拒,且依赖该资产的全部分镜与视频节点都会被卡住。所以写 prompt 时就要避开常见误判词族,而不是等失败后再改。
-
制服类角色不要写警徽/军徽式细节:现场案例 2026-08-26,一张公交司机身份板仅因写了"藏蓝制服 + 肩章 + 大檐帽带银色帽徽"就被输出审核拒绝——这套描述会被判为警察/军队制式。民用制服角色(司机、售票员、保安、门卫、维修工)用职业线索表达身份:工服颜色与材质、工牌绳、反光条、随身工具、袖口磨损、坐姿与手部动作;不要写帽徽、警徽、肩章军衔、臂章、编号胸牌。
- 同样容易误判的写法:伤口/血迹/淤青、未成年人特写、裸露或贴身描写、明显痛苦或病态的神情、真实公众人物姓名或"像某某明星"、武器与管制器具特写、宗教或政治符号。需要表达疲惫、受伤或冲突时,改用环境与动作侧写(雨水、汗湿的衣领、扶着栏杆、垂下的手),不直接描写身体损伤。
- 一旦收到输出审核拒绝:不要原样重试。定位最可能被判定的那一处措辞并改写,保留镜头意图;改完后 prompt 指纹变化,节点才会重新派发。
核心原则
-
具体化描述:避免通用词语如"史诗般的"、"美丽"或"酷",除非由具体的视觉细节支持。
-
分层描述:明确前景、中景、背景的元素和关系。
-
光线与氛围:描述光线方向、类型、色温、氛围。
-
叙事感:场景应暗示故事、紧张、运动或情感,而不是纯静态展示。
-
有意为之:每个构图选择都应有明确的视觉目的。
画面质感建议
根据项目风格选择合适的质感表现:
-
自然纹理:优先使用自然材质和环境纹理,避免过度平滑或塑料感。
-
环境细节:适当加入空气中的微粒、雾气、尘埃、反射、阴影等增加深度。
-
真实感:优先选择动作中或情感充沛的瞬间,而不是静态姿势(除非用户要求)。
-
不完美真实:根据风格需要,可使用轻微的运动模糊、柔焦、颗粒等增加真实感。
禁用建议(除非用户明确要求)
- 避免过度锐化或过度处理的外观。
- 避免无环境上下文的居中肖像式构图。
- 避免完全对称、无视觉张力的摆拍式构图。
- 避免塑料感、合成感过强的外观。
5. 实体 VisualEntity 定义规范
continuity 字段
- 角色 continuity 描述:体型、脸型、肤色、发色、瞳色、身高范围、标志性特征(疤痕/纹身/饰品)。
- 场景 continuity 描述:核心色调、光照基调(日景/夜景/室内/室外)、标志性环境元素。
- 道具 continuity 描述:主要材质、颜色、比例、功能可见标识。
name 与 description
- name 在整个 Project 中唯一,使用可检索的角色/场景/道具名称。
- description 聚焦于将该实体与其他同类区分的关键特征,不重复 continuity 中已覆盖的基线属性。
变体一致规则
同一实体下的多个 Variant 必须:
- 核心身份特征(体型、脸型、肤色、发色、瞳色等不变体属性)不随 Variant 改变。
- 风格基线一致:全部 Variant 使用相同的渲染风格和画质基线。
- 跨 Variant 的参考优先级:已生成的 artifact 版本优先于外部 source 版本。
- 合并参考图中的环境元素应与角色的核心身份保持一致,不因 Variant 改变而引入矛盾的环境特征。
参考图绑定规范
- Variant 的
reference_asset_version_ids 优先使用 grounding 返回的 source_asset_version_id。
- 优先使用一张参考图覆盖主体的多角度/多瞬间信息;仅在主体需要出现在多个差异显著的环境时才绑定多张参考图。
- 不同实体的参考图不互相矛盾:同一角色的不同 Variant 不应出现不同的肤色或体型。
角色身份稳定性
- 同一角色在全部 Element 和 Variant 中保持稳定的视觉锚点:体型轮廓、面部比例、肤色/发色/瞳色。
- 角色在不同环境光照下的变化只影响光影表现,不改变固有颜色和比例。
- 跨 Element 的角色引用通过
visual.entities 中的稳定 ID 维护,不在 Element 中重复声明角色视觉细节。
场景与道具一致性
- 关键场景建立独立 VisualEntity(kind=scene),包含环境全景描述、色调参考和主要区域布局。
- 关键道具建立独立 VisualEntity(kind=prop),包含外观描述、材质参考和与角色的比例关系。
- 场景和道具的 Variant 只在此实体范围内有效,不与其他实体的视觉设定冲突。
- 当角色、场景、道具作为整体出现时,优先通过合并参考图维护一致性,减少跨实体引用冲突。
类型适配
不同实体类型在 Prompt 中的侧重点:
-
角色(character):首次建立身份时使用电影感艺术身份板,以大型英雄全身像、独立多角度、轮廓/表情/细节研究建立身份;在内容中的关键瞬间使用序列关键帧展示动作和表情变化。用户要求标准网格或单图时按用户要求执行。
-
场景(scene):默认使用多宫格多角度展示不同角度和细节;用户要求时使用单张全景图,展示光影基调和可识别的地标/区域边界。
- 场景连续性图集必须明确选择一种拓扑表达:供图片/视频模型继续消费时默认使用无文字视觉拓扑(一致的消失点、地标重复、路径方向和少量无文字箭头),不得同时要求
clear spatial labels 与 no text;只有用户明确需要导演审阅图时才允许短标签,并把这些标签列为文字排除项的显式例外。无文字模式也不得用字母 A/B/C、地名或图例文字暗中代替标签。
-
道具(prop):使用英雄视图 + 独立多角度/比例/材质与功能细节,不套用角色表情或姿态布局。用户要求单图时按用户要求执行。
6. 创作品味准则
以下创作品味准则源自 vendored review_rubrics(Qwen-MM-Plugins video-edit skill),应当遵循(建议性准则,不是门禁):
- 构图安全:Nothing covers faces/UI/focal action ([no-occlusion]); overlay anchor differs from the previous scene's; every overlay has a full life-cycle — entrance, idle micro-motion if held >1.5s, choreographed exit with a hard kill (no element leaking past the scene's time box).
- 一致性:角色/场景设计图之间保持造型、配色与光线的一致性;文字元素不得乱码或使用占位字形。