看清楚每一步:触发(哪个端点)→ 读了哪些数据 → 提示词怎么拼 → 哪步是 AI / 哪步是纯代码 → 参考图怎么引 → 落到哪。 橙色=真在调 AI 模型,灰色=纯程序在跑,绿色=数据落点。
visual_prompt(小白不用打字)。后端只做规范化兜底,不再二次调 AI。group.metadata.label = 前端传的实体 tag。下游故事板就靠它把参考图对回实体。build_storyboard_frame_prompt(没有 @图N、没有"锁脸锁商品"那句)→ 一致性会丢。所以参考图配齐很关键。| # | 阶段 | 能力 | 底座 / 模型 | 输入 | 纯代码 or AI |
|---|---|---|---|---|---|
| ① | 脚本 | text(LLM 流式) | 火山/中转站 · 文本模型 | skill 系统词 + 商品上下文 | AI 脚本+实体一次产出 |
| ② | 基础资产·商品 | image_edit | 中转站 gpt-image-2 | 商品主图 + 模板词 | AI |
| ② | 基础资产·人物/场景 | image_generation | 中转站 gpt-image-2 | 实体 visual_prompt | AI |
| ③ | 基础资产·三视图 | image_edit | 中转站 gpt-image-2 | 立绘/主图 | AI |
| ④ | 故事板分镜图 | image_edit 多图合成 | 中转站 gpt-image-2 | N 张参考图 + 分镜脚本 | AI |
| ⑤ | 视频片段 | video(Seedance) | 火山直连 VolcanoArk | 参考图+故事板帧+脚本 | AI |
其余全是纯代码:选模型、拼提示词、选参考图、规范化兜底、归组、落库、轮询调度、计费预扣结算。 「提取角色/场景」不是单独的程序步骤——它跟脚本一起由 AI ① 产出;后面所有图/视频用的"角色/场景/商品提示词"都源自 ① 那次,中途纯代码搬运、不再二次问 AI。
label==实体名 精确匹配参考图。若生成的资产被标成别的名(如脚本"通勤女主"、资产"通勤打工人"),精确匹配失败、退到"同类随便挑一个",多角色就挑错人。