---
name: spec-image
description: "工程化出图 skill：基于 Spec-driven Prompting 方法论（源自 OpenAI GPT Image 2.5 官方提示词指南），将出图需求解析为结构化规格说明（Scene/Subject/Details/Constraints），系统参数与语义提示词解耦，覆盖文生图、精准文字排版、透明底素材、UI 原型、信息图表、图像编辑、多图合成、角色一致性等 12 类工作流。用法：/spec-image <需求描述> [--ratio=1:1|3:2|2:3|16:9] [--quality=auto|low|medium|high] [--transparent] [--edit=<原图路径>] [--ref=<图1,图2,...>] [--count=N]"
user_invocable: true
version: "1.0.0"
---

# spec-image: 工程化出图

核心思想：**出图不是抽卡，是写工程规格书。** 能用参数控制的属性绝不堆进 Prompt；Prompt 只聚焦视觉语义；编辑任务必须明确"改什么"与"绝对不改什么"。

## 用法

```
/spec-image <需求描述> [--ratio=1:1|3:2|2:3|16:9] [--quality=auto|low|medium|high]
            [--transparent] [--edit=<原图路径>] [--ref=<图1,图2,...>] [--count=N]
```

## 执行流程（六步，不可跳步）

### Step 1: 任务分类（决定走哪条流水线）

| 任务类型 | 判定条件 | 走法 |
|---------|---------|------|
| GEN 文生图 | 只有文字需求 | 加载 `references/workflows.md` 匹配最接近的场景模板 |
| EDIT 局部编辑 | 提供 `--edit` 原图 + 修改指令 | 套用"改动与约束分离"契约（见 Step 4） |
| MULTI-REF 多图合成 | 提供 >=2 张 `--ref` | 为每张图编号并指定角色分工（见 Step 4） |
| EXTRACT 透明抠图 | 提供 `--edit` + 要求透明底 | 参数 transparent + 反棋盘格/反阴影负向约束 |
| SERIES 一致性系列 | 需要多张图保持主体一致 | 两阶段法：先生成角色卡，再逐场景延续 |

### Step 2: 参数决策（参数管物理，Prompt 管语义）

将需求映射到当前环境可用的图像生成/编辑工具的实际参数。若工具不支持某参数，则将等价指令折进 Prompt（如横竖版写明 "wide horizontal composition"）。

| 属性 | 决策规则 |
|------|---------|
| 画幅 ratio | 电商主图/UI 原型/人像竖版 2:3；海报横版 3:2 或 16:9；头像/图标 1:1 |
| 质量 quality | 默认 medium；含精确文字/信息图/图表/多步骤流程一律 high；草稿初筛可 low |
| 透明通道 | 需要 PNG/WebP 透明底时显式开启，且 Prompt 必须同时声明"无实体底色、无棋盘格、边缘干净" |
| 数量 count | 探索阶段 2-4 张；定稿迭代阶段 1 张 |

**禁止**：把"4K、超高清、杰作、史诗感"写进 Prompt —— 分辨率归参数管，抽象修饰词只会引入噪声。

### Step 3: 构建 Spec 结构化 Prompt

复杂需求必须四段式，简单需求至少含主体 + 约束：

```
[Scene]      场景与环境：地点、时间、光线（具体的：午后 45 度柔和侧光，而非"好的光照"）
[Subject]    主体定义：外观特征 + 三个关键维度（身体构图 / 视线朝向 / 与环境的真实交互）
[Details]    可见细节：材质（风化皮革、拉丝不锈钢）、色彩体系、拍摄介质（35mm 胶片、50mm 镜头）
[Constraints] 正向约束 + 负向约束（No extra text, no watermarks, no ...）
```

具体化三原则：
1. **具体可见的细节取代情绪空话**：写"可见毛孔皱纹、胶片颗粒、轻微暗角"，不写"超真实、大师级"。
2. **人物必锁三维度**：全身构图是否含双脚、视线看哪里、双手在做什么 —— 缺一会出现肢体僵硬/假人感。
3. **文字渲染铁律**：所有要出现在画面里的文字用双引号包裹 + 显式频次（"Render the tagline exactly once"）+ 字体特征与位置 + "No extra text"兜底。生僻词逐字母拼写。

### Step 4: 编辑与多图契约

EDIT 模式核心公式（受保护属性必须逐条列出）：

```
仅修改 [X]。
严格保持：[人物身份特征 / 五官 / 姿态 / 光照 / 机位 / 背景 / 画面质量] 不变。
```

MULTI-REF 模式：每张图编号 + 明确分工。例："图 1 作为背景与光影基准；将图 2 中的主体提取置入图 1 的人物身旁，保持透视与投影一致。Do not change anything else."

SERIES 一致性两阶段：
- 阶段一：生成角色卡（Character: 服装/特征/气质逐项锁定；Style: 画风；Constraints: no text）
- 阶段二：每张新图重申 "Same [服装/五官/配色/气质]，Do not redesign the character"

### Step 5: 调用出图工具并自检

调用当前环境的图像生成工具执行生成/编辑。交付前对照清单：

- [ ] 所有画面内文字是否已加双引号 + 频次约束？
- [ ] 负向约束是否覆盖了该场景的高频翻车点（多余文字/水印/logo/棋盘格/假人感）？
- [ ] 编辑任务是否逐条列出了受保护属性？
- [ ] 参数与 Prompt 是否解耦（没有把分辨率/画质堆进 Prompt）？
- [ ] 人物是否锁定了构图/视线/交互三维度？

未通过则回到 Step 3 修订，不要带病交付。

### Step 6: 迭代协议（单变量渐进）

- 上一轮满意输出作为下一轮输入，**每次只调一个变量**。
- 先调参数（如 medium -> high）再改 Prompt。
- 细节漂移时，在 Prompt 中重申受保护约束，而非推倒重来。

## 参考文件

- `references/workflows.md`：12 类商业级工作流模板（胶片人像 / 广告排版 / 透明 logo / 四格条漫 / UI 原型 / 教学图表 / 路演单页 / 换装 / 多图合成 / 透明抠图 / 草图转写实 / 单物替换）。匹配到任务类型后必须加载对应模板再写 Prompt。
