Files
yingqing/core/backend/skills/ecommerce-video-script/references/methodology.md
T

10 KiB
Raw Blame History

电商带货脚本 · 核心方法论

每次生成都读。本文件是脚本的"骨架 + 红线",钩子句式见 hook-library.md


一、黄金结构:钩子 → 痛点 → 卖点 → CTA

带货短视频的灵魂是前 3 秒留人 + 结尾促转化。四个功能镜各司其职:

role 功能 它要做的事 旁白要点
钩子 3 秒留人 第一句话/第一帧就让人停下不划走 hook-library.md 的公式,制造痛点共鸣或反差冲击
痛点 共鸣 把用户"对,我就这样"的处境讲出来 具体场景化,不抽象,让人对号入座
卖点 商品解决 商品如何恰好解决上面的痛点 卖点落到痛点上,给"凭什么信"的理由(成分/效果/对比/口碑)
CTA 转化行动 临门一脚,告诉用户现在做什么 明确动作 + 紧迫感(点下方小黄车 / 主页领券 / 限时)

铁原则:

  • 首镜永远是钩子——3 秒内必须抛出钩子,否则用户划走。
  • 末镜永远收 CTA——可以是独立 CTA 镜,也可以是末镜旁白末尾收一句行动指令。
  • 卖点必须挂在痛点上——不是罗列参数,是"这个痛点 → 商品这样解决"。
  • 一条只讲一个核心情境——先选一个「时间 + 地点 + 小麻烦/小欲望」,整条围绕它推进; 不要把商品详情页的所有卖点搬进来。
  • 每镜必须有变化——人物的处境、手上的动作或眼前的结果至少推进一项;镜与镜不能只是 换种说法重复夸商品。

二、时长 → 镜数 → 黄金结构映射(关键)

2.1 时长规则(每镜固定 15 秒)

  • 总时长由输入给定:15 / 30 / 45 / 60。未指定时默认 30。
  • 每镜时长固定 15 秒,这既是主流程产品规则,也是下游出片模型的硬上限。
  • 镜数直接由总时长决定:15 秒 → 1 镜,30 秒 → 2 镜,45 秒 → 3 镜,60 秒 → 4 镜。
  • 不要写成 8/10/12 这种不等长,也不要自行加减镜。15 秒要靠画面变化和一句完整意思撑满,不是靠切碎镜头。
  • 所有 segments[].duration 相加必须精确等于 total_duration

2.2 镜数怎么定

镜数不是按表现形式估算的,就是 total_duration / 15。 表现形式只影响这一镜里怎么拍(口播把 15 秒说完一件事;短剧在 15 秒里完成一次冲突/对白交换;Vlog 用镜内空镜+细节撑满),不改变镜数

2.3 role 按镜数分配

镜数 role 序列(index 0→N 说明
1 [钩子] 一镜到底:钩子 → 一句卖点 → 一句 CTA,全压进这一镜的旁白
2 [钩子, 卖点] 镜0 钩子里带出痛点;镜1 讲卖点并在末尾收 CTA
3 [钩子, 卖点, CTA] 痛点并进钩子镜
4 [钩子, 痛点, 卖点, CTA] 标准黄金结构,一镜一功能
5 [钩子, 痛点, 卖点, 卖点, CTA] 两个卖点镜要各有侧重
N ≥ 4 [钩子, 痛点, 卖点 × (N-3), CTA] 通用规则:首钩子、次痛点、末 CTA,中间全是卖点

说明:

  • role 只能取 钩子|痛点|卖点|CTA 四个枚举值。"信任背书""场景演示""前后对比"等都归入 卖点
  • 镜少也不许丢 CTA —— 镜数 ≤2 时把 CTA 压进末镜旁白的最后一句。
  • 多个卖点镜要各有侧重、不重复(核心功效 / 真实使用场景 / 别人为什么买 / 举证读数)。
  • 视频结构会覆盖这里的默认分配 —— 以 playbooks/structure-*.md 里的骨架为准, 本表只是没有指定结构时的兜底。

三、entity 一致性原则

entities 是全脚本共享的角色 / 场景 / 商品池,保证多镜同一角色是同一张脸、同一商品是同一个包装

  • 一个角色/场景/商品 = 一个 entity = 一份 visual_prompt。多镜复用同一 id绝不为同一对象写两份 visual_prompt(会导致下游生图人脸/包装漂移)。
  • visual_prompt 由你自动生成(小白不打字):写清外观特征(角色:性别/年龄段/发型/穿着/气质;场景:地点/光线/风格;商品:品类/包装/颜色/摆放),用于直接喂图模型。
  • type 三选一:character(人) / scene(环境) / product(商品)。一份脚本通常至少 1 个 product至少 1 个 scene
  • 场景与镜头一一对应(可复用)每个 segment 的 entity_refs 必须恰好引用一个 scene——它就是这一镜画面所处的环境。多镜同环境就复用同一个 scene id(如全程宿舍 → 只一个「宿舍书桌」scene,4 镜都引用它);真正换了地点才新建另一个 scene。纯产品特写镜也要绑它所处环境的 scene(无明确环境则复用主场景)。这样下游「场景」基础资产能成图、且同环境背景一致。
  • ref_index 是该 entity 在图集里的参考序号(从 1 递增,供下游三视图/参考图对齐)。
  • voice_ref(二期,可选):角色音色参考,用于锁音色;无则 null
  • 每个声明的 entity 至少被一个 segment 的 entity_refs 引用,不留孤儿。
  • segments[].speaker 指向某 character 的 id 表示该镜由角色开口说;null = 画外旁白。

四、商品露出规范(product_exposure

每镜都要规划商品怎么自然出现,避免生硬插入。按 role 给推荐露出方式:

role 推荐露出 说明
钩子 可弱露出或不露 钩子先抓人,商品可作悬念,第 1 镜末尾闪一下也行
痛点 不露 / 反面对照 展示"没有它"的糟糕状态,商品先按住
卖点 特写 / 使用中 商品成为主角:成分特写、质地特写、上脸/上手使用中
CTA 手持 / 包装正面 手持商品对镜头,包装正面清晰,配合行动指令

露出方式词汇统一用:手持 / 特写 / 使用中 / 包装正面 / 场景摆放 / 对比展示(可组合,如"手持+特写")。


五、旁白红线(硬规则,违反即不合格)

  • 口语化:像真人对着镜头唠嗑,不准书面腔 / 不准 AI 腔("综上所述""不仅…而且""值得一提的是"全禁)。

  • 必须用商品原词:输入给了商品名、品牌、卖点,就用这些词,不许改成「补水/好用/值得买」这种空卖点。品类示例句只是语气参考。

  • narration 字数按这一镜的秒数算:出片模型在镜内直接发声。 可懂语速上限约 4.5 字 / 秒,口播下限约 3.6 字 / 秒(再短镜头空一半)。 每镜上限 duration × 4.5 字,且不超过 68 字。口播 15 秒镜还有下限 54 字。

    单镜时长 下限 字数上限 写作目标
    4 秒 14 字 ≤ 12 字
    5 秒 17 字 ≤ 15 字
    6 秒 21 字 ≤ 19 字
    8 秒 28 字 ≤ 25 字
    10 秒 35 字 ≤ 31 字
    12 秒 42 字 ≤ 38 字
    15 秒 54 字 67 字 5563 字,35 句

    主流程每镜都是 15 秒:要说满,不要宁可短。 一句 20 字撑不满镜头。 留白靠句间停顿和画面,不靠少写字。只有 Vlog 才允许个别镜纯画面无声。

  • 不浮夸、不空喊:卖点要给具体理由,不堆形容词。

  • 拒绝详情页腔:禁止用「全面升级 / 高品质 / 性价比很高 / 闭眼入 / 值得买」替代体验与证据。 台词要有当下的个人判断,例如先说自己卡在哪,再说为什么这一步让自己改观。

  • 违规词禁令(电商广告法红线,一律不写):

    • 医疗功效类:治疗 / 根治 / 疗效 / 抗癌 / 消炎 / 杀菌(无证) / 排毒 / 速效 / 抑制 ××病 …
    • 绝对化用语:最 / 第一 / 顶级 / 唯一 / 100% / 国家级 / 世界级 / 永久 / 绝对 / 史上 …
    • 虚假承诺:包治 / 三天见效 / 立刻变白 / 永不反弹 …
    • 替换策略:用"帮助""更""不少人反馈""上脸清爽"等柔性、主观化表达替代。

自检阶段必须逐镜扫一遍违规词,命中即改写。详见 checklist.md


六、15 秒场内的秒级分镜(硬规则)

主流程一场就是 15 秒。15 秒里必须再切 35 刀,写进 visual,下游故事板和视频只认这段。

visual 不写普通画面摘要,固定按下面的导演说明书结构输出:

【本镜任务】本段要让观众看懂的变化或悬念
【声音】无配乐,仅同期声:包装摩擦声、倒水声;人物说话自然停顿
【画面内容】
0-3s:景别;构图;运镜;动作;信息变化
3-8s:景别;构图;运镜;动作;信息变化
...

这样「人物/商品/场景设定」留在 entities 中保持全片一致,「本镜任务」管情绪推进, 「画面内容」只管可执行的镜头,声音也不会漏给视频模型。不得写虚构或无法发生的音效。

0-3s:近景,人看镜头或看向场景,先立住环境和情绪
3-8s:手部入画,开始使用商品(写清容器、材质、液体/膏体状态)
8-12s:商品特写,用法过程可见
12-15s:拉回人物,使用后的反应
  • 第一条从 0 秒起,最后一条接到 15s
  • 每一条写:景别 + 构图 + 运镜 + 动作 + 信息变化(至少四项),并写清谁、手从哪来、商品/容器什么样。
  • 15 秒内至少切 两次景别(近景 / 特写 / 手持跟拍…)。
  • 商品用法必须真实:茶要热水和蒸汽,不要把茶包丢进冷白开;手不要悬浮。
  • 一场一个动作链:把 15 秒拆成同一件事的起因 → 操作 → 可见变化 → 反应,不能把无关的 剧情、多个卖点、跳场景硬塞进同一场。画面提供证据,台词提供判断或转折,不要互相复述。
  • 允许另给 beats:[{start,end,shot_size,action}],但 visual 仍要能折成上面这种多行文本。