跳到正文
今天9月29日周二
  1. r/comfyui38

    从审阅过的镜头清单到多镜头视频提示词:用 Ling-3.0-flash-VL 分析参考片段

    一套把镜头清单转成多镜头视频提示词的流程:用 Ling-3.0-flash-VL 经 OpenRouter 读取 38 秒参考片段中每 2 秒采样的 19 帧,输出含时间范围、景别、主体/动作、场景/光线、运镜与转场的 JSON。审阅镜头顺序与边界后,用该 JSON 填写序列级一致性描述与各镜头字段,并据此做单字段修改,生成可检查的提示词变更。