这条视频是怎么"攒"出来的

// 商品 → 脚本 → 角色/场景图 → 分镜图 → 视频 · 每句提示词从哪来

从上往下看一条竖线。重点只有一件事:喂给 AI 的每句提示词,到底是谁写的 —— AI 临场编的?你填的?代码里写死的套话?还是之前生成的图。点任意一块看它从哪来;点右上▶ 播放看数据一路怎么流下来。

AI 编的 你填的 代码死模板 之前生成的图
// 一句话:提示词其实就 3 块 —— ① @图(指定谁是谁)· ② 画面描述 · ③ 质量词。点积木看来源。
0商品信息你填的
你建商品时填的:商品名、卖点、主图。整条链的起点。商品主图后面会一直当"参考图"用。
你填商品名 / 卖点 / 商品主图
→ 喂给第1步脚本 AI;商品主图 → 后面所有"商品参考图"都用它
1脚本 AI(源头)AI · 1 次文本调用
所有"人话"都在这一步由 AI 写好:它读商品信息,按一套"系统说明书"(skill)一口气产出脚本。角色长什么样、每镜画面、谁出场 —— 全在这里定,后面不再重新问 AI。
AI 这一步吐出的东西(后面全靠它)
AI编角色 / 场景 / 商品 "实体"
每个带:名字 name + 长相描述 visual_prompt(AI 自动写,小白不打字)
AI编每镜画面 + 这镜用谁
每 15 秒一镜:画面描述 visual / 旁白对白 narration + 这镜引用哪些实体 entity_refs
?AI 凭什么知道要提取角色/场景、还自动写长相?
靠一份系统说明书 skill(skills/ecommerce-video-script/)。里面明文要求 AI:"识别角色/场景/商品,给每个写一份全脚本通用的长相描述(visual_prompt),保证多镜同一张脸"。所以"提取"就发生在这一步,不是第2步。
# AI 产出(节选) 角色 c1 名="通勤女主" 长相="26岁都市女性,自然妆,米色针织衫…" 场景 s1 名="早高峰地铁" 镜3 画面="女主挤地铁戴上耳机" 用谁=[c1, s1, 商品]
2生成角色/场景/商品图AI · 画图
把第1步 AI 写的长相描述当提示词,生成一张角色立绘 / 场景图。生成完你"采用",这张图贴上标签 = 角色名,第3步就靠这名字把图对回去。
?你最模糊的:第2步怎么"正确拿到人物描述"?
不是这步重新提取 —— 是直接读第1步存好的 cast_prompts[角色名](就是 AI 写的那段长相)。链路:AI写长相 → 存进 cast_prompts → 第2步读出来当提示词。中间纯搬运,不再问 AI。
这步给画图 AI 的提示词 = 2 块
AI编② 画面描述 = 角色长相
直接用第1步 visual_prompt(AI 写的"26岁都市女性…")
模板③ 质量词(写死)
"电商真人模特,自然妆容,柔和影棚光,真实质感,纯色背景" —— 代码模板,每次一样
# 人物图提示词 电商真人模特,氛围正面全身照,{26岁都市女性,自然妆,米色针织衫…}, 自然妆容,柔和影棚光,真实质感,单人,纯色背景
商品图特殊:多一块 ① —— 拿商品真实主图当参考(锁包装/Logo 一致),所以商品三视图很还原。
3分镜图(故事板)AI · 多图合成
每 15 秒一镜出一张分镜图。提示词把参考图点名 + 这镜画面 + 质量词拼一起,喂给画图 AI 合成。
?你最模糊的:第3步怎么"正确引用参考图"?
这镜脚本里有 entity_refs(第1步 AI 写好的"这镜用谁",如 c1+s1+商品)。代码照着它:实体 → 按 标签=名字 找你第2步采用的图。商品没单独生成 → 自动用商品主图兜底(这条我已修)。再按 角色→商品→场景 排好,对上 @图1/@图2/@图3。
这步提示词 = 3 块(点每块看来源)
① @图N:指定谁是谁
@图1=角色图 @图2=商品图 @图3=场景图 ← 你第2步采用的图 +(商品)主图兜底
AI编② 画面描述
这镜脚本的 visual(画面)+ narration(对白/旁白)—— 第1步 AI 写的
模板③ 质量词(写死)
"严格锁同一张脸/同一商品,9:16 竖屏,一镜一图,画面清晰" —— 代码模板
【设定】@图1是通勤女主(角色),@图2是耳机(商品),@图3是地铁(场景)。 根据脚本生成导演故事板。 【画面】女主挤地铁戴上耳机… 请严格保持各参考图同一张脸/同一商品,9:16 竖屏,画面清晰。
4视频片段(Seedance)AI · 出视频带音
每镜 → 一段视频。跟第3步几乎一样,多塞一张刚生成的分镜图当参考,再交给 Seedance 出片(自带音效+人声)。
?你最模糊的:第4步参考图怎么引?
跟第3步同一套(一样按 entity_refs 找采用的角色/场景/商品图),额外加一张第3步出的分镜图。所以视频既锁人/锁商品、又跟分镜构图一致。
这步提示词 = 3 块 + 1 张分镜图
① @图N:谁是谁 + @分镜图
角色/场景/商品图(同第3步)+ 末位加第3步生成的分镜图
AI编② 画面描述
同一镜脚本的 visual / narration
模板③ 质量词(写死)
"15s · 9:16 竖屏电商带货,镜头稳定,商品露出清晰,节奏有转化感" —— 代码模板
【设定】@图1=女主 @图2=地铁 @图3=耳机【分镜】根据@图4分镜图生成「耳机」短视频。 【脚本】女主挤地铁戴上耳机… 15s · 9:16 竖屏带货,镜头稳定,商品露出清晰。
关于"质量词"(③):你猜对了,现在基本没有独立系统。 只有上面每步那几句质量/规格词写死在代码模板里(画面清晰、镜头稳定、9:16、真实质感…),不能配置、各步各一套。

一句话收口: ①@图(谁是谁)来自你采用的图/商品主图 · ②画面描述来自第1步 AI 写的脚本 · ③质量词是代码死模板。三步图/视频都这套,只是参考图越往后越多(故事板用基础资产图,视频再加分镜图)。