优化脚本

This commit is contained in:
Azmat@qq.com
2026-08-28 14:45:38 +08:00
parent 849b14a0f6
commit c0a0b9603b
37 changed files with 541 additions and 1893 deletions
@@ -50,9 +50,12 @@
- [ ] **每镜 `narration` ≤ `duration × 5.2` 字,且绝不超过 78 字**15 秒镜 ≤78 字)。
- [ ] **口播 15 秒镜旁白 ≥ 64 字**(写作目标 66–74 字,4–5 句)。禁止一句 20 字收工;口播禁止整镜无声。
- [ ] **秒级分镜**:每镜 `visual` 至少 3 条 `0-3s:景别;机位;运镜;动作`,从 0 接到 15s;15 秒内至少切两次景别。上传视频提炼稿还要把音效/背景音乐/字幕折进 `【声音】`
- [ ] **秒级分镜**:每镜 `visual` 至少 3 条 `0-3s:景别;机位;运镜;动作;信息变化`,从 0 接到 15s;15 秒内至少切两次景别;**每镜至少出现一个运镜词**(手持跟拍/推近/拉远/横摇/环绕/固定机位)。上传视频提炼稿还要把音效/背景音乐/字幕折进 `【声音】`
- [ ] **四栏齐全**:每镜 `visual` 都有 `【本镜任务】【光线氛围】【声音】【画面内容】`,没有缺栏。
- [ ] **相邻镜光线衔接**:同一场戏各镜的光源方向、色温、色调一致,没有忽冷忽暖。
- [ ] **画面可拍**:没有「展示商品/呈现质感/体现高级感」这类评价词,没有心理描写,没有画面内字幕花字价签,没有一镜内跨场景跨时间。
- [ ] **商品原词**:旁白/对白出现了输入给出的至少一个勾选卖点原词;商品名全片点名 1–2 次即可,其余镜写描述/卖点细节,没有用空话替换。
- [ ] 每镜 `visual` 能撑满 15 秒(至少 72 字),写清手/商品/容器的空间关系和真实用法,不是一句静态动作。
- [ ] 每镜 `visual` 能撑满 15 秒(至少 110 字),写清哪只手、从哪个方向入画、握商品哪里,以及容器/材质的真实状态,不是一句静态动作。
- [ ] 口语化,无书面腔/AI 腔("综上""不仅…而且""值得一提"等已清除)。
- [ ] **违规词扫描**:无医疗功效词(治疗/根治/抗癌/消炎/排毒/速效…)。
- [ ] **绝对化用语扫描**:无 最/第一/唯一/100%/国家级/永久/绝对/史上 等。
@@ -69,8 +69,8 @@
- `visual_prompt` 由你**自动生成**(小白不打字):写清外观特征(角色:性别/年龄段/发型/穿着/气质;场景:地点/光线/风格;商品:品类/包装/颜色/摆放),用于直接喂图模型。
- **角色与商品必须隔离出图**:角色的 `visual_prompt` 只能写人物外观与气质,生成的是纯色背景的单人角色参考图;
禁止写商品、包装、品牌、Logo、价签、桌子、电脑、杯子、手持物或生活场景。商品由独立 product 基础资产锁定,
只在故事板和视频镜头里与人物合成,避免人物图把真实包装改掉。
- **儿童用品不生成儿童角色**:任何未成年人(婴儿、宝宝、幼儿、儿童、小朋友、0–17 岁)都不能作为 `character`、故事板或视频的画面主体。
只在视频镜头里与人物同框,避免人物图把真实包装改掉。
- **儿童用品不生成儿童角色**:任何未成年人(婴儿、宝宝、幼儿、儿童、小朋友、0–17 岁)都不能作为 `character` 或视频的画面主体。
这类商品改用商品平铺、材质/包装/尺寸细节和成人手部或成年照护者局部演示;适用年龄只写在旁白和商品信息中,不把儿童写成要生图的人物。
- `type` 三选一:`character`(人) / `scene`(环境) / `product`(商品)。一份脚本通常至少 1 个 `product`、**至少 1 个 `scene`**。
- **场景与镜头一一对应(可复用)**:**每个 segment 的 `entity_refs` 必须恰好引用一个 `scene`**——它就是这一镜画面所处的环境。多镜同环境就复用同一个 scene id(如全程宿舍 → 只一个「宿舍书桌」scene,4 镜都引用它);真正换了地点才新建另一个 scene。纯产品特写镜也要绑它所处环境的 scene(无明确环境则复用主场景)。这样下游「场景」基础资产能成图、且同环境背景一致。
@@ -131,22 +131,28 @@
## 六、15 秒场内的秒级分镜(硬规则)
主流程一场就是 15 秒。15 秒里**必须再切 3–5 刀**,写进 `visual`,下游故事板和视频只认这段
主流程一场就是 15 秒。15 秒里**必须再切 3–5 刀**,写进 `visual`
`visual` 不写普通画面摘要,固定按下面的导演说明书结构输出:
> **★ 中间没有分镜图了。** `visual` 会**原样交给视频生成模型**,不再经过一张关键帧图去补全画面。
> 你没写的,模型自己编;你写含糊的,画面就含糊。所以 `visual` 要写到
> 「一个不认识这个商品的摄影师照着就能拍」的程度。
`visual` 不写普通画面摘要,固定按下面的导演说明书结构输出(四栏,逐栏写满):
```
【本镜任务】本段要让观众看懂的变化或悬念
【光线氛围】光源方向与性质(窗光/顶光/台灯/逆光);色温冷暖;明暗对比;整体色调(各镜保持一致)
【声音】台词/旁白状态;音效;背景音乐;字幕(没有写无)
【画面内容】
0-3s:景别;机位;运镜;动作;表情;信息变化
3-8s:景别;机位;运镜;动作;表情;信息变化
0-3s:景别;机位;运镜;主体在画面中的位置;具体动作;信息变化
3-8s:景别;机位;运镜;手与商品的空间关系;可见细节
...
```
输入如果是 `【镜头 01】` 导演分镜稿(上传视频提炼),把原稿每镜的景别、机位、运镜、人物动作、表情、音效、背景音乐、字幕、备注折进对应栏,不要压成一句画面摘要。原稿写「无 / 不可见 / 听不清」的不要编造。
这样「人物/商品/场景设定」留在 entities 中保持全片一致,「本镜任务」管情绪推进,
「光线氛围」锁住全片视觉调性(原来这件事由分镜图承担,现在只能靠文字),
「画面内容」只管可执行的镜头,声音也不会漏给视频模型。不得写虚构或无法发生的音效。
```
@@ -157,8 +163,13 @@
```
- 第一条从 **0 秒**起,最后一条接到 **15s**
- 每一条写:**景别 + 机位 + 运镜 + 动作 + 信息变化**(至少四项),并写清谁、手从哪来、商品/容器什么样。
- 15 秒内至少切 **两次景别**(近景 / 特写 / 手持跟拍…)
- 每一条写:**景别 + 机位 + 运镜 + 动作 + 信息变化**(五项都要),并写清谁、用哪只手、
从哪个方向入画、握商品哪里、商品/容器什么样
- 15 秒内至少切 **两次景别**(大特写 / 特写 / 近景 / 中近景 / 中景 / 全景)。
- **每镜至少出现一个运镜词**(手持跟拍 / 推近 / 拉远 / 横摇 / 环绕 / 固定机位);
没有运镜词,出片会拍成呆板的静止画面。
- **只写拍得出来的东西**:禁止「展示商品 / 呈现质感 / 体现高级感」这类评价词,禁止心理描写,
禁止画面里出现字幕花字标题价签,禁止一镜内跨场景跨时间。
- 商品用法必须真实:茶要热水和蒸汽,不要把茶包丢进冷白开;手不要悬浮。
- **一场一个动作链**:把 15 秒拆成同一件事的起因 → 操作 → 可见变化 → 反应,不能把无关的
剧情、多个卖点、跳场景硬塞进同一场。画面提供证据,台词提供判断或转折,不要互相复述。