添加视频复刻和优化脚本旁白

This commit is contained in:
Azmat@qq.com
2026-08-24 10:48:01 +08:00
parent 368586d33e
commit 2f5b7304b0
33 changed files with 1172 additions and 109 deletions
@@ -59,7 +59,7 @@ description: >
"index": 0,
"duration": 15,
"role": "钩子|痛点|卖点|CTA",
"narration": "这一镜被说出来的台词/旁白,15秒口播目标38-47字(下限36,上限52)",
"narration": "这一镜被说出来的台词/旁白,15秒口播目标55-63字(下限54,上限67)",
"speaker": "可选,指向某 entity 的 id;画外旁白时为 null",
"visual": "0-3s:近景,……\\n3-8s:手持跟拍,开始使用商品\\n8-12s:特写,商品用法过程\\n12-15s:拉回中近景,使用后的反应",
"product_exposure": "商品露出方式(手持/特写/使用中)",
@@ -117,8 +117,8 @@ description: >
详见 `references/methodology.md`「旁白红线」。最关键的几条:
- **口语化**,像真人对着镜头说话,不准书面腔 / AI 腔。
- **口播 15 秒镜要说满**`narration` **3652 字**(写作目标 **3847 字,24 句短句**)。
上限仍是 `duration × 3.5` 且不超过 55 字。禁止一句 20 字收工。
- **口播 15 秒镜要说满**`narration` **5467 字**(写作目标 **5563 字,35 句短句**)。
上限 `duration × 4.5` 且不超过 68 字。禁止一句 20 字收工。
商品名全片点名 1–2 次即可,其余镜用卖点原词和可感知细节(口感/气味/动作/使用场景)。
Vlog 才允许个别镜纯画面;口播禁止整镜无声。
- **禁违规词**:医疗功效(治疗/根治/抗癌…)、绝对化用语(最/第一/100%/国家级…)一律不写。
@@ -182,7 +182,7 @@ description: >
4. **抽取/创建 entities** — 识别脚本需要的角色 / 场景 / 商品;为每个 entity 写一份**全脚本共用**的 `visual_prompt`(保证多镜同一角色同一张脸);可选写 `voice_ref` 锁音色。
5. **按套路填结构** — 优先用视频结构套路里的骨架给每个 segment 分配 `role`
套路没覆盖到的用「role 按镜数分配」表兜底;钩子镜套用该套路指定的钩子写法。
6. **写 narration / visual / 商品露出** — 口播 15 秒镜旁白 3847 字(下限 36)、口语化、过红线;
6. **写 narration / visual / 商品露出** — 口播 15 秒镜旁白 5563 字(下限 54)、口语化、过红线;
**visual 按秒拆成 3–5 条分镜**;必须把输入给出的卖点原词和商品描述细节写进旁白或对白,不要每句只重复商品名;
发声方式按表现形式套路来;每镜规划自然的 `product_exposure`。
7. **连引用** — 填 `entity_refs` 与 `speaker`,确认每个 entity 都被引用、id 都合法。
@@ -46,8 +46,8 @@
## C. 旁白红线扫描(逐镜)
- [ ] **每镜 `narration` ≤ `duration × 3.5` 字,且绝不超过 55**15 秒镜 ≤52 字)。
- [ ] **口播 15 秒镜旁白 ≥ 36**(写作目标 3847 字,24 句)。禁止一句 20 字收工;口播禁止整镜无声。
- [ ] **每镜 `narration` ≤ `duration × 4.5` 字,且绝不超过 68**15 秒镜 ≤67 字)。
- [ ] **口播 15 秒镜旁白 ≥ 54**(写作目标 5563 字,35 句)。禁止一句 20 字收工;口播禁止整镜无声。
- [ ] **秒级分镜**:每镜 `visual` 至少 3 条 `0-3s:景别,动作`,从 0 接到 15s;15 秒内至少切两次景别。
- [ ] **商品原词**:旁白/对白出现了输入给出的至少一个勾选卖点原词;商品名全片点名 1–2 次即可,其余镜写描述/卖点细节,没有用空话替换。
- [ ] 每镜 `visual` 能撑满 15 秒(至少 72 字),写清手/商品/容器的空间关系和真实用法,不是一句静态动作。
@@ -96,8 +96,8 @@
- **口语化**:像真人对着镜头唠嗑,不准书面腔 / 不准 AI 腔("综上所述""不仅…而且""值得一提的是"全禁)。
- **必须用商品原词**:输入给了商品名、品牌、卖点,就用这些词,不许改成「补水/好用/值得买」这种空卖点。品类示例句只是语气参考。
- **`narration` 字数按这一镜的秒数算**:出片模型在镜内直接发声。
可懂语速上限约 **3.5 字 / 秒**,口播下限约 **2.4 字 / 秒**(再短镜头空一半)。
**每镜上限 `duration × 3.5` 字,且不超过 55 字。口播 15 秒镜还有下限 36 字。**
可懂语速上限约 **4.5 字 / 秒**,口播下限约 **3.6 字 / 秒**(再短镜头空一半)。
**每镜上限 `duration × 4.5` 字,且不超过 68 字。口播 15 秒镜还有下限 54 字。**
| 单镜时长 | 下限 | 字数上限 | 写作目标 |
| ---- | ---- | ---- | ---- |
@@ -107,7 +107,7 @@
| 8 秒 | — | 28 字 | ≤ 25 字 |
| 10 秒 | — | 35 字 | ≤ 31 字 |
| 12 秒 | — | 42 字 | ≤ 38 字 |
| 15 秒 | **36** | 52 字 | **3847 字,24** |
| 15 秒 | **54** | 67 字 | **5563 字,35** |
主流程每镜都是 15 秒:**要说满,不要宁可短。** 一句 20 字撑不满镜头。
留白靠句间停顿和画面,不靠少写字。只有 Vlog 才允许个别镜纯画面无声。
@@ -53,7 +53,7 @@
- **单镜固定 15 秒**(短剧用镜内动作和对白交换撑满这 15 秒,不要靠切很多短镜)
- 一镜一次冲突或一次对话交换,**别在一镜里塞完整三幕**
- 有对白的镜,每句 `line` ≤ 25 字(两个人说话,总量还是受 55 字限制)
- 有对白的镜,每句 `line` ≤ 25 字(两个人说话,总量还是受 68 字限制)
**推荐总时长 45 秒(3 镜)。** 短剧需要装下三幕,低于 30 秒会讲不完整;
超过 60 秒在电商场景下性价比开始下降。
@@ -52,7 +52,7 @@
- **单镜固定 15 秒**(口播里说完一个完整意思需要时间;15 秒靠景别切换和手部动作撑满,不要切碎)
- 一句话讲一件事,**一镜 2–4 句短句**,禁止一句收工
- **visual 按秒拆 35 刀**,写成 `0-3s:近景……` / `3-8s:手持……` / `8-12s:特写……` / `12-15s:拉回……`
- 语速按 **2.43.5 字 / 秒** 估:15 秒镜 **3652**,写作目标 **3847**
- 语速按 **3.64.5 字 / 秒** 估:15 秒镜 **5467**,写作目标 **5563**
**推荐总时长 30 秒(2 镜)。** 口播超过 45 秒完播率掉得很快,除非是测评验证这种
需要举证的结构。