v1 to v1.2

102 added, 23 removed. Audit A to A.

---
name: aigc-video-cover-gpt
- version: 1.0
- description: 用 GPT Image 2 一步生成「商单/科普视频」高质量横版封面的工作流。输入一张人物参考图 + 一份视频脚本,自动发散标题钩子、套用商单封面公式、写出含锁脸与中文大字策略的 GPT Image 2 提示词(中间产物),并一次出若干张可发布的 16:9 封面。当用户说"给这个视频做封面""根据脚本出封面""用 GPT Image 2 做视频封面""把人物参考图做成封面"时触发。
+ version: 1.2
+ description: 用 GPT Image 2 一步生成「商单/科普视频」高质量横版封面的工作流。输入一张人物参考图 + 一份视频脚本,自动发散标题钩子、套用商单封面公式(构图不固定·暗 / 亮双影调随机)、写出含锁脸与中文大字策略的 GPT Image 2 提示词(中间产物),并一次出若干张可发布的 16:9 封面。当用户说"给这个视频做封面""根据脚本出封面""用 GPT Image 2 做视频封面""把人物参考图做成封面"时触发。
---
# AIGC Video Cover (GPT Image 2)
## 适用场景
把「一张人物参考图 + 一份视频脚本」直接变成若干张可发布的 **16:9 横版视频封面**,由 **GPT Image 2 一步出含中文大标题的整张图**。面向商单视频、知识科普、揭秘解说这类需要「缩略图秒懂 + 有点击欲」的封面。
典型触发语:
- "给这个视频做封面 / 出 3 张封面"
- "根据脚本出封面,人物用这张参考图"
- "用 GPT Image 2 把人物参考图做成封面"
- "这条片子要发 B 站,封面帮我搞一下"
**与相邻 skill 的区别**:
- `aigc-poster-layout` 是**保护已定稿原图**做手工排版海报,不重绘主体;本 skill 是**从零生成**封面、接受 GPT Image 2 重画人物。
- `aigc-prompt-optimizer` 是通用 prompt 优化;本 skill 专做「脚本 → 封面」这一条龙,内置商单封面公式与锁脸打法。
## 核心约定(本 skill 的硬设定)
1. **一步出整图**:GPT Image 2 直接生成含中文大标题的完整封面,不做「底图 + 后期排版」两段式。
2. **接受 ~92% AI 近似**:人物用参考图重画,靠「禁美化 + 点名锚点」把身份拽回到工具上限,不做抠图换脸。详见 [[GPTImage2锁脸的脸占比上限_v1]]。
3. **只出 16:9 横版**:用自然语言 `Wide 16:9 horizontal video thumbnail`,GPT Image 2 不吃 `--ar`。
4. **若干张 = 多个标题钩子**:默认从脚本发散 **3 个**不同钩子,各出 1 张,而非同一张改比例。
- 5. **prompt 是中间产物**:先把 prompt 写清楚给用户过目(尤其文字内容与锚点),再调用出图。
+ 5. **构图不固定**:人物**不锁死在右侧**。从「构图库」(见第三步)随机选位——左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏 等都可;一批 3 张默认**构图各不相同**,让封面有变化、不千篇一律。唯一不变的是「文字与主体不互相糊住、主标题缩略图可读」。
+ 6. **暗版 / 亮版双影调随机**:每张封面随机走「暗版」或「亮版」影调(见第三步);一批 3 张默认**两种影调都出现**(如 2 暗 1 亮 / 1 暗 2 亮,随机),让用户在明暗两种风格里挑。
+ 7. **prompt 是中间产物**:先把 prompt 写清楚给用户过目(尤其文字内容、锚点、构图、影调),再调用出图。
---
## 第一步:拆参考图 + 拆脚本
### 1A. 从参考图抽「身份锚点」
找出参考图**最强的单一特征**(眼睛颜色/形状、脸型、发型、肤色、标志性配饰其一),作为锁脸成败的判据。
> 锁脸先看锚点有没有还原,不必逐项比对五官。**锚点丢 = 锁脸失败**([[GPTImage2锁脸的脸占比上限_v1]])。
记录:性别、年龄段、锚点特征、是否戴眼镜、气质(温婉/硬朗/书卷/喜剧)。
### 1B. 从脚本抽「封面要素」
读完脚本,提炼:
- **核心冲突 / 卖点**:这条片子最戏剧的一句话是什么。
- **题材情绪**:科技商单 / 揭秘暗黑 / 活泼梗 / 教学正经 —— 决定配色模板(见第三步)。
- **可上封面的钩子词**:能做成 2–4 字大标题的核心动词或名词(如「折解」「揭秘」「魔改」「过于先进」)。
- **品牌/栏目信息**:记下来但**不上封面**——IP 名、栏目名、英文 slogan 一律写进视频标题 / 简介,不进画面(见第三步要点 3)。
---
## 第二步:发散标题钩子矩阵(默认 3 个)
不要只想一个标题。从脚本发散 3 个不同角度的钩子,每个包含:
| 字段 | 说明 |
|---|---|
| 主标题 | 2–4 字核心词,缩略图主角 |
| 高亮字 | 标题里最戏剧的 1–2 字,用对比色单独跳出 |
| 副钩子 | 一句吊人的短句,常带「!」或「?」(如「建议低调使用!」「今天你哈了吗?」) |
| 英文幽灵层 | 全大写英文,做低透明度背景字(如 `DISASSEMBLE` `WAR` `MUSK`) |
| 角度 | 这个钩子打的是悬念 / 利益 / 冲突 / 反差 哪一种 |
三个钩子尽量打不同情绪(如:① 悬念式 ② 利益式 ③ 冲突式),让用户有得挑。
---
## 第三步:商单封面公式(从高质量模板提炼,核心资产)
这是这套「高质量封面」的统一骨架,每张图都按它搭:
- ### 版式骨架(16:9 横版)
+ ### 版式骨架(16:9 横版)= 一套元素 + 一种构图
+ 封面恒定由这套**元素**搭成,但它们在画面里**怎么摆是变量**(见下「构图库」):
+
+ - 超大主标题(2–4 字,必加厚描边/外发光)
+ - 关键词高亮字(对比色单独跳出)
+ - 英文幽灵层(半透明大字压在标题后当肌理)
+ - 主体(人物 / 产品 / IP;没素材时用纯黑剪影 + 高饱和底)
+ - 副钩子短句(带 !/ ?)
+ - 顶角留空 + 按「影调」走暗版或亮版背景
+
+ 下面是**最常见的一种**摆法(主标左、主体右),但**只是构图库里的一个**,不是唯一解:
+
```
┌─────────────────────────────────────────────┐
│ (顶角留空,不挂品牌条 / 栏目名 / 英文 slogan) │
- │ 超大主标题(左/中) 主体(人物/产品/IP) │
- │ ▓▓▓▓ 高亮字 ▓▓▓▓ 右侧 3/4 侧身/指向 │
- │ 英文幽灵层(半透明压在标题后) 或纯黑剪影 │
+ │ 超大主标题(左) 主体(人物/产品/IP) │
+ │ ▓▓▓▓ 高亮字 ▓▓▓▓ 3/4 侧身 / 指向标题 │
+ │ 英文幽灵层(半透明压在标题后) │
│ ── 副钩子短句 ! ── │
└─────────────────────────────────────────────┘
- ↑ 深色科技底 + 暗角 + 危险/电光氛围
+ ↑ 这只是「主标左·主体右」一种,换构图见下表
```
+ 这套元素 + 任一构图 **暗版亮版通用**,差别只在「背景影调 + 主体光照 + 文字撑读方式 + 氛围元素」。
+
要点:
- 1. **主标题占画面 40–55% 宽**,放左侧或中部;主体(人物/产品)放右侧,3/4 侧身、看镜头或指向标题。人物没素材时可用**纯黑剪影 + 高饱和底**(如马斯克选志愿)。
- 2. **主体要够大**:人物至少占到半身。脸越小越跑(工具硬上限),封面天然适合给脸足够像素。
+ 1. **构图从「构图库」随机选,不锁右侧**:主体可左 / 中 / 右 / 前景大头 / 底部探出 / 对峙 / 分屏(见下表);核心只有一条——**主标题与主体不互相遮糊**,缩略图一眼读到标题。
+ 2. **主体要够大**:人物至少占到半身(前景大头构图更是脸占大头)。脸越小越跑(工具硬上限),封面天然适合给脸足够像素。
3. **顶角默认留空——不上品牌条 / 栏目名 / 英文 slogan**(如「GenJi冷知识」「DAILY FACT CHECK」这类顶部标签一律不要)。封面只承载「主标题 + 高亮字 + 一句副钩子」,文字越少越秒懂。运营信息(IP 名、栏目名、期号)写进视频简介 / 标题,不上封面。用户明确反馈(2026-06-24)。
- 4. **暗角 + 危险氛围**:背景深色科技感(蓝黑/红黑),四角压暗托出主体与文字;揭秘类加骷髅/警示三角/电光火花制造点击欲。
+ ### 构图库:主体不锁右侧(v1.2 核心,随机选位)
+
+ 同一套元素可以摆成很多构图。**每张封面从下表随机抽一种**,一批 3 张默认构图各不相同。下列是常用项,**不是穷举**——也可自由组合 / 新创,只要守住「文字不被主体糊住、缩略图读得到标题」:
+
+ | 构图 | 主体位置 | 主标题落点 | 适合 | 一句话画面 |
+ |---|---|---|---|---|
+ | **左置** | 人物在左、3/4 朝右 | 右侧大字 | 人物望向标题、引导视线 | 主体左、视线/手势把眼睛带到右边的字 |
+ | **居中** | 主体正中、看镜头 | 标题在上下两条或绕主体环抱 | 对视感强、单人高光 | 大头/半身居中,标题分跨顶部与底部 |
+ | **前景大头**(特写) | 脸/上半身怼满、近景大占比 | 标题压在一侧或半透叠脸缘 | 情绪脸、锁脸最稳(脸像素最多) | 超大脸占 50–70%,标题贴边不挡五官 |
+ | **底部探出** | 主体从画面下缘探半身/露头上来 | 标题占上半幅 | 上文字下人物、留出顶部大字区 | 人物像从下方冒出来,上方一片留给标题 |
+ | **左右对峙** | 两个主体(或主体 vs 对象)分踞左右 | 标题压中缝 / VS 字 | 对决、挑战、二选一、对比 | 左 A 右 B 中间对冲,红蓝分场 + 中缝大字 |
+ | **斜角构图** | 主体沿对角线、动势倾斜 | 标题顺另一条对角压角 | 活力、动感、运动、爆点 | 画面被一条斜线切,人物与字各占一斜半 |
+ | **分屏构图** | 画面竖切/横切成 2–3 格,主体分格 | 标题压在分隔条或跨格 | 前后对比、多状态、流程、Tier | 左「之前」右「之后」,中条嵌标题 |
+
+ 选位规则:
+
+ - **默认随机**,一批 3 张构图尽量都不同(如:左置 / 前景大头 / 左右对峙)。
+ - 题材给暗示就顺着选:**对决/挑战 → 左右对峙**;**情绪脸/单人揭秘 → 前景大头**;**前后对比/流程 → 分屏**;**运动/爆点 → 斜角**;常规人物解说 → 左置 / 居中 / 底部探出皆可。
+ - 用户**指定构图**("我要分屏""都用大头")则不随机,全按指定走。
+ - 不论哪种构图,**主标题与主体不互相遮糊**是铁律;前景大头时标题尤其要贴边、别压五官最好看的部分。
+
+ ### 影调:暗版 / 亮版双范式(v1.1 核心,随机产出)
+
+ 同一套版式骨架有两种影调,**每张封面随机选一种**;一批 3 张默认两种都出现。两者不是好坏之分,是不同情绪气口:
+
+ | 维度 | **暗版**(悬疑 / 揭秘 / 暗黑) | **亮版**(积极 / 科技 / 对决 / 活力) |
+ |---|---|---|
+ | 背景 | 深色科技底(蓝黑 / 红黑),**四角压暗**托主体 | 高调明亮底(亮蓝 / 白 / 浅色),通透高曝;亮体育馆、亮办公室、数据中心、亮天空 |
+ | 主体光照 | 暗部反衬 + 局部边缘高光 | **正面均匀打亮**,肤色明亮干净 |
+ | 文字撑读靠 | 暗底反衬浅色字 | **厚白多层描边 + 投影 + 高饱和填充**(亮底上靠描边和饱和度抢出来) |
+ | 氛围元素 | 危险信号:骷髅 / 警示三角 / 火花 / 暗电光 | 明亮科技:全息 HUD 面板 / 数据流 / 发光 AI 芯片 / 上升箭头 / 发光图标 |
+ | 强调色 | 警示黄、血红 | 亮蓝、荧光绿、亮黄、橙红 |
+
+ **亮版的成败关键**:背景亮了之后,文字最容易糊。所以亮版主标题**必须**厚白描边(常 2–3 层)+ 深色投影 + 高饱和填充色,别用低饱和浅字压在亮底上(会糊成一团)。
+
+ **影调选择规则**:
+
+ - 默认**随机**,但保证一批里明暗都有。可显式掷骰(如脚本随机 / 三张按「暗·亮·随机」分配)。
+ - 题材有强暗黑属性(诈骗、揭秘、危机)可偏暗版;积极向(赚钱、对决、教学、活力)可偏亮版——但不强制,随机更出多样性。
+ - 用户若指定「都要亮版 / 都要暗版」,则不随机,全按指定走。
+
### 字体与文字系统(封面成败关键)
- **主标题**:粗黑体或书法体,**必加厚描边/外发光**保证缩略图可读。常见三种配色:
- 黄字 + 黑描边(揭秘/暗黑:投毒术、魔改)
- 白字 + 局部红字(冲突/严肃:折解、缅北诈骗)
- 白→蓝/紫渐变 + 白描边(科技:影视级视频模型)
- **关键词高亮**:标题里最戏剧的 1–2 字换对比色单独跳出(「战争」红、「诈骗」血红书法),其余字保持主色。
- **英文幽灵层**:全大写英文,低透明度、大字号,压在主标题后面当背景肌理。
- **副钩子**:小一号,带感叹号/问号,可加小色块底。
- **中英文对照**:主标题旁配同义英文小字(中文「马斯克」+ 英文 `MUSK`),增加设计感。
- ### 配色情绪模板(按题材选)
+ ### 配色情绪模板(按题材选,再叠加影调)
- | 题材 | 主色 | 强调色 | 氛围 |
+ 先按题材定基调,再叠加第三步选定的暗版 / 亮版影调:
+
+ | 题材 | 暗版基调 | 亮版基调 | 强调色 |
|---|---|---|---|
- | 科技商单 | 蓝黑 | 电光紫 / 青 | 数据流、电路、光效 |
- | 揭秘 / 暗黑 | 红黑 | 警示黄 | 骷髅、警示三角、火花 |
- | 活泼 / 梗 | 高饱和撞色 | 紫 / 青 / 黄 | 漫画感、贴纸、问号 |
- | 教学 / 正经 | 深蓝 | 白 / 暖金 | 干净、专业、信任感 |
+ | 科技 / AI | 蓝黑 + 暗电路光 | 亮蓝 + 白 + 全息 HUD 高曝 | 电光紫 / 青 / 荧光绿 |
+ | 揭秘 / 暗黑 | 红黑 + 压暗 + 危险信号 | (暗黑题偏暗版;要亮版则亮蓝底 + 强警示色对冲) | 警示黄 / 血红 |
+ | 对决 / 挑战 | 深色擂台 + 聚光 | 亮体育馆 / 数据中心 + 通透高曝 | 红 vs 黄、亮蓝 |
+ | 活泼 / 梗 | 暗底高饱和撞色 | 亮底高饱和撞色 + 漫画描边 | 紫 / 青 / 黄 / 荧光绿 |
+ | 教学 / 正经 | 深蓝 + 暖金 | 亮白办公室 + 浅蓝 | 白 / 暖金 / 亮蓝 |
---
## 第四步:写 GPT Image 2 提示词(中间产物)
把第二、三步的决定翻译成一条结构化 prompt。**先给用户看 prompt 再出图**,重点核对「文字内容」和「身份锚点」两块。
提示词分块(英文为主、中文字符串照抄):
```
[1·画幅] Wide 16:9 horizontal video thumbnail, bold YouTube/Bilibili cover style.
[2·锁脸] A [年龄/性别] with the EXACT facial identity from the attached
reference photo — keep the same [点名锚点:如 round face, large blue-grey eyes],
same face shape, eyes, nose, lips, skin tone. Do NOT beautify or alter features.
- [主体景别与姿态:half-body, 3/4 turned to the right, pointing up / looking at camera].
+ [主体景别与姿态,按本张构图填:half-body / big close-up face / two figures facing off
+ / emerging from bottom edge ... , 3/4 turned / looking at camera / pointing].
- [3·版式] Place a HUGE bold Chinese title on the [left/center], occupying ~50%
- width. Main subject on the right.
+ [3·构图·按本张构图库选项填] Composition: [构图英文,二选一示例:
+ · 左置 Subject on the LEFT facing right; HUGE bold Chinese title fills the RIGHT ~50%.
+ · 居中 Subject CENTERED looking at camera; title split across top and bottom bands.
+ · 前景大头 Extreme close-up face filling 50–70%; title hugs one edge, never covering the face.
+ · 底部探出 Subject emerges from the BOTTOM edge; title occupies the upper half.
+ · 左右对峙 Two figures on LEFT vs RIGHT facing off; big title / "VS" down the center seam.
+ · 斜角 Subject along a diagonal, dynamic tilt; title runs along the opposite diagonal corner.
+ · 分屏 Frame split into 2 panels (before/after); title sits on the divider or spans panels.
+ ]. Keep title and subject from overlapping; title stays readable at thumbnail size.
[4·文字内容·逐条列清] Render ONLY this exact text — no other text anywhere:
- Main title: "折解" in [color], thick [outline color] outline.
- Highlight: the character "V4" in bright yellow.
- Subtitle: "DeepSeek" white bold below.
- Ghost English behind title: "DISASSEMBLE" large, low-opacity.
- NO top brand bar, NO channel name, NO English slogan in the top corners.
- Keep the top-left and top-right corners clean / empty.
- [5·配色氛围] [配色模板]: deep blue-black tech background, electric purple glow,
- vignette darkening the four corners, [危险元素:sparks / warning triangle / circuit lines].
+ [5·配色氛围 — 二选一,按本张影调]
+ · 暗版: deep blue-black (or red-black) tech background, vignette darkening the
+ four corners, moody rim light on the subject, [危险元素: sparks / warning
+ triangle / circuit lines]. Title in light color reads against the dark base.
+ · 亮版: BRIGHT high-key background (bright blue / white, airy, overexposed) —
+ [亮场景: bright arena / bright office / data center / bright sky], frontal even
+ lighting on the subject, glowing holographic HUD panels / data streams / rising
+ arrows / glowing AI chip. Title MUST have a thick white multi-layer outline +
+ drop shadow + high-saturation fill so it stays readable on the bright base.
[6·质感] Cinematic lighting, high contrast, crisp poster typography, ultra-detailed, 4k.
[7·负面] No garbled text, no misspelled Chinese characters, no extra random text,
no top brand bar / channel name / English slogan in the corners,
no watermark, no blurry low-quality.
```
写 prompt 的硬规则:
1. **锁脸块永远在最前面且显式禁美化**——GPT Image 2 默认会顺手美化导致跑脸。
2. **中文文字必须逐条列出确切字符串 + 颜色 + 位置**,别让模型自己编字。
3. **主标题字数压到 2–4 字**:中文越短越长的句子越容易糊/错字。复杂生僻字尽量避开或换近义短词。
4. **负面词必带** `no garbled text, no misspelled Chinese characters`。
- 5. 一个钩子一条 prompt;3 个钩子 = 3 条 prompt。
+ 5. **每条 prompt 标注本张构图**(左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏),[3·构图] 块按构图填;一批 3 张构图尽量各不相同。
+ 6. **每条 prompt 标注本张影调**(暗版 / 亮版),[5·配色氛围] 块按影调二选一填;一批 3 张里明暗都要有。
+ 7. 一个钩子一条 prompt;3 个钩子 = 3 条 prompt。
---
## 第五步:调用 GPT Image 2 出图
- 把参考图作为附件 + 对应 prompt 一起喂给 GPT Image 2,每个钩子出 1 张。
- 中文渲染有概率出错字 —— **预期 1–2 次重试**属正常,不是 prompt 写错。重试时只复述「确切文字 + 禁错字」,别整条重写。
---
## 第六步:自检 + 锁脸补救阶梯
出图后逐张自检:
- 缩到缩略图大小,**一眼能读到主标题**吗?描边够不够厚?
- **身份锚点**(第一步那个最强特征)还在吗?锚点丢就是锁脸失败,进补救。
- 中文有没有错字 / 多余乱码字?
- **顶角是否干净**——有没有混进品牌条 / 栏目名 / 英文 slogan 这类不该上封面的小标签?有就重出或裁掉。
- 主体够不够大、够不够抢眼?文字有没有糊住脸最好看的部分?
+ - **构图对不对**:主标题与主体有没有互相遮糊?前景大头是否压住了脸最好看的部分?一批 3 张构图是否各不相同、没全挤成「主体右置」一种?
+ - **影调对不对**:亮版背景是否真的高调通透、主体正面打亮、标题厚白描边没糊?暗版是否压暗到位、浅字反衬清楚?一批里明暗是否都出现了?
- 题材情绪对不对(暗黑题别出成小清新)?
**锁脸三级补救阶梯**(按性价比,来自 [[GPTImage2锁脸的脸占比上限_v1]]):
1. **对话式微调(首选)**:`The face is not matching the reference. Regenerate with her EXACT face from the photo: [点名锚点]. Keep pose, scene, text the same.` —— 只动脸不动景。
2. **拉近景别**:全身→半身/七分身,脸占比一上去锁脸立刻稳。封面本就该给脸足够像素。
3. **两步合成**(终极):先出脸部特写确认锁脸,再融合氛围图。要求最高时用。
> 收尾铁律:锚点对 + 气质对 + 文字无错 = 可定稿。**别为修小瑕疵重抽**——重抽有脸再次跑偏的风险,见好就收。
---
## 交付格式
交付时给:
- 3 张封面图路径(按钩子命名,如 `封面_悬念式_折解.png`)。
- 每张一句话:用了哪个钩子、哪套配色、保留了什么锚点。
- 用过的 prompt(中间产物,便于用户微调复用)。
不长篇讲设计理论。用户要的是能直接发的封面。
---
## 禁止行为
- ❌ 锁脸块不写在最前、不写禁美化(必跑脸)。
- ❌ 中文文字让模型自由发挥,不逐条列字符串(必出错字/乱码)。
- ❌ 主标题塞一长句、堆生僻字(缩略图糊成一团)。
- ❌ 只出一张就交付(要求是"若干张",默认发散 3 个钩子)。
- ❌ 主体做得太小、脸占比太低(违背工具锁脸规律,越缩越跑)。
- ❌ 出图错字直接整条 prompt 重写(应只复述确切文字 + 禁错字重试)。
- ❌ 把暗黑/揭秘题做成小清新配色(题材情绪错位)。
- ❌ 在顶角加品牌条 / 栏目名 / 英文 slogan 等小标签(用户明确不要;运营信息走标题简介)。
+ - ❌ 一批 3 张全暗版或全亮版、不给明暗对比(除非用户显式指定单一影调);亮版标题不加厚白描边直接压亮底(必糊)。
+ - ❌ 一批 3 张构图千篇一律全把主体塞右侧(除非用户显式指定单一构图);让主标题被主体遮糊、缩略图读不到标题。
---
## 关联文档
- [[GPTImage2锁脸的脸占比上限_v1]] —— 本 skill 锁脸打法的实测来源(~92% 上限、禁美化、三级补救)。
- [[严格人脸一致性二创的范式阶梯_假说_v1]] —— 若用户要"复制级"真人一致,升级到后期换脸 / InstantID / Nano / LoRA。
- [[aigc-poster-layout]] —— 保护已定稿原图做手工排版海报(不重绘)的姊妹流程。
- [[aigc-prompt-optimizer]] —— 通用 AIGC prompt 优化,本 skill 的 prompt 写法与其同源。
- [[角色一致性金字塔]] —— 角色跨图一致性的总框架。