spec-image · v1.0.0 · 2026-09-10 · sha256 52b4ad21ec3ab4c7

spec-image v1.0.0A

Immutable. This exact content is served forever at /api/v1/blob/52b4ad21ec3ab4c7.

---
name: spec-image
description: "工程化出图 skill:基于 Spec-driven Prompting 方法论(源自 OpenAI GPT Image 2.5 官方提示词指南),将出图需求解析为结构化规格说明(Scene/Subject/Details/Constraints),系统参数与语义提示词解耦,覆盖文生图、精准文字排版、透明底素材、UI 原型、信息图表、图像编辑、多图合成、角色一致性等 12 类工作流。用法:/spec-image <需求描述> [--ratio=1:1|3:2|2:3|16:9] [--quality=auto|low|medium|high] [--transparent] [--edit=<原图路径>] [--ref=<图1,图2,...>] [--count=N]"
user_invocable: true
version: "1.0.0"
---

# spec-image: 工程化出图

核心思想:**出图不是抽卡,是写工程规格书。** 能用参数控制的属性绝不堆进 Prompt;Prompt 只聚焦视觉语义;编辑任务必须明确"改什么"与"绝对不改什么"。

## 用法

```
/spec-image <需求描述> [--ratio=1:1|3:2|2:3|16:9] [--quality=auto|low|medium|high]
            [--transparent] [--edit=<原图路径>] [--ref=<图1,图2,...>] [--count=N]
```

## 执行流程(六步,不可跳步)

### Step 1: 任务分类(决定走哪条流水线)

| 任务类型 | 判定条件 | 走法 |
|---------|---------|------|
| GEN 文生图 | 只有文字需求 | 加载 `references/workflows.md` 匹配最接近的场景模板 |
| EDIT 局部编辑 | 提供 `--edit` 原图 + 修改指令 | 套用"改动与约束分离"契约(见 Step 4) |
| MULTI-REF 多图合成 | 提供 >=2 张 `--ref` | 为每张图编号并指定角色分工(见 Step 4) |
| EXTRACT 透明抠图 | 提供 `--edit` + 要求透明底 | 参数 transparent + 反棋盘格/反阴影负向约束 |
| SERIES 一致性系列 | 需要多张图保持主体一致 | 两阶段法:先生成角色卡,再逐场景延续 |

### Step 2: 参数决策(参数管物理,Prompt 管语义)

将需求映射到当前环境可用的图像生成/编辑工具的实际参数。若工具不支持某参数,则将等价指令折进 Prompt(如横竖版写明 "wide horizontal composition")。

| 属性 | 决策规则 |
|------|---------|
| 画幅 ratio | 电商主图/UI 原型/人像竖版 2:3;海报横版 3:2 或 16:9;头像/图标 1:1 |
| 质量 quality | 默认 medium;含精确文字/信息图/图表/多步骤流程一律 high;草稿初筛可 low |
| 透明通道 | 需要 PNG/WebP 透明底时显式开启,且 Prompt 必须同时声明"无实体底色、无棋盘格、边缘干净" |
| 数量 count | 探索阶段 2-4 张;定稿迭代阶段 1 张 |

**禁止**:把"4K、超高清、杰作、史诗感"写进 Prompt —— 分辨率归参数管,抽象修饰词只会引入噪声。

### Step 3: 构建 Spec 结构化 Prompt

复杂需求必须四段式,简单需求至少含主体 + 约束:

```
[Scene]      场景与环境:地点、时间、光线(具体的:午后 45 度柔和侧光,而非"好的光照")
[Subject]    主体定义:外观特征 + 三个关键维度(身体构图 / 视线朝向 / 与环境的真实交互)
[Details]    可见细节:材质(风化皮革、拉丝不锈钢)、色彩体系、拍摄介质(35mm 胶片、50mm 镜头)
[Constraints] 正向约束 + 负向约束(No extra text, no watermarks, no ...)
```

具体化三原则:
1. **具体可见的细节取代情绪空话**:写"可见毛孔皱纹、胶片颗粒、轻微暗角",不写"超真实、大师级"。
2. **人物必锁三维度**:全身构图是否含双脚、视线看哪里、双手在做什么 —— 缺一会出现肢体僵硬/假人感。
3. **文字渲染铁律**:所有要出现在画面里的文字用双引号包裹 + 显式频次("Render the tagline exactly once")+ 字体特征与位置 + "No extra text"兜底。生僻词逐字母拼写。

### Step 4: 编辑与多图契约

EDIT 模式核心公式(受保护属性必须逐条列出):

```
仅修改 [X]。
严格保持:[人物身份特征 / 五官 / 姿态 / 光照 / 机位 / 背景 / 画面质量] 不变。
```

MULTI-REF 模式:每张图编号 + 明确分工。例:"图 1 作为背景与光影基准;将图 2 中的主体提取置入图 1 的人物身旁,保持透视与投影一致。Do not change anything else."

SERIES 一致性两阶段:
- 阶段一:生成角色卡(Character: 服装/特征/气质逐项锁定;Style: 画风;Constraints: no text)
- 阶段二:每张新图重申 "Same [服装/五官/配色/气质],Do not redesign the character"

### Step 5: 调用出图工具并自检

调用当前环境的图像生成工具执行生成/编辑。交付前对照清单:

- [ ] 所有画面内文字是否已加双引号 + 频次约束?
- [ ] 负向约束是否覆盖了该场景的高频翻车点(多余文字/水印/logo/棋盘格/假人感)?
- [ ] 编辑任务是否逐条列出了受保护属性?
- [ ] 参数与 Prompt 是否解耦(没有把分辨率/画质堆进 Prompt)?
- [ ] 人物是否锁定了构图/视线/交互三维度?

未通过则回到 Step 3 修订,不要带病交付。

### Step 6: 迭代协议(单变量渐进)

- 上一轮满意输出作为下一轮输入,**每次只调一个变量**。
- 先调参数(如 medium -> high)再改 Prompt。
- 细节漂移时,在 Prompt 中重申受保护约束,而非推倒重来。

## 参考文件

- `references/workflows.md`:12 类商业级工作流模板(胶片人像 / 广告排版 / 透明 logo / 四格条漫 / UI 原型 / 教学图表 / 路演单页 / 换装 / 多图合成 / 透明抠图 / 草图转写实 / 单物替换)。匹配到任务类型后必须加载对应模板再写 Prompt。