OPERATOR NOTES / METHODS & IMPLEMENTATION
逐镜生成,或保留实拍做局部合成。
没有可用实拍时,先锁商品、人物和场景参考,做好静帧,再逐镜生成动作。已有合适实拍时,保留背景与表演,只处理需要替换的部分;最后统一镜头衔接、声音和节奏。
01商品与人物先锁什么
商品、人物、服装、场景分别绑定原始参考。真实 SKU 看不到的背面和功能保持未知;个人形象遵循已确认的脸与身材资料。
02什么时候进入视频生成
每镜写用途、入点、动作、出点与机位。先通过静帧检查,再生成候选;动作和相机指令分开,失败只重做相关镜头。
03为什么不一直重抽整片
已有好实拍且局部有问题时,用遮罩、跟踪、阴影和反射合成;整段重生成会把原来正确的部分也改掉。
04最后怎么验收
镜头逐个核商品与动作,再整片看节奏、声音和字幕。文件可解码、镜头可剪辑、最终成片通过,是三个不同状态。
DECOMPOSITION / CONDITIONING / EVALUATION
镜头背后,具体怎么做。
参考片先拆成带时码的镜头,再绑定商品与人物资料、选择生成方式。每一步写明判断条件、输出内容和失败后的处理。
把“看起来像”,拆成可以重新制作的镜头。
输入参考片后,先定位切镜候选,再对齐声音、字幕和动作。逐镜写明它是在吸引注意、演示操作、提供证据,还是消除顾虑。复刻的是可迁移的表达方式,商品事实必须换成当前 SKU 的。
| 环节 | 判断与做法 |
|---|---|
| 时间定位 | 帧差定位候选;快摇、闪光和溶解需要人工确认。查看候选前后帧与动作转折,不只抽封面。 |
| 声音与文字 | ASR / OCR 提供带时码的观察,校对专名、数字与单位;识别结果不直接成为产品事实。 |
| DNA 怎么迁移 | 参考里的“开盖—倒出—看效果”,不能硬套到不开盖的设备;可以保留“操作—变化—验证”的信息顺序。 |
| 交付 | shot_id、入/出时码、画面任务、动作、镜头、声音、保留/替换项,以及每个判断的原片位置。 |
一张参考图,不能同时管商品、人物和整个世界。
商品、人物、接触、环境和上一镜出口分别指定控制范围。原商品图里出现的模特,不自动成为新片人物;生成参考也不能改写真实 SKU。
| 环节 | 判断与做法 |
|---|---|
| 商品 | 核多视角与标签;绑定源版本和 ROI。真实文字需要清楚时保留原像素合成,不让模型重画后凭观感放行。 |
| 人物 | 脸与身材分别有依据;侧脸、遮挡和全身镜单独核对。固定 seed 并不等于固定身份。 |
| 接触与空间 | 手、商品、桌面的尺度和遮挡关系单独设计。复杂操作优先真实演示;姿态/深度控制仅在后端实际支持时使用。 |
| 局部替换 | 目标遮罩与保护区域分开。分割、逐帧传播、遮挡修正后再处理边缘、阴影和反射;SAM 2 不负责生成替换内容。 |
先选制作方式,再决定用什么模型。
指定商品细节时先批准静帧;已有好实拍就保留实拍。请求只写后端实际支持的首帧、首尾帧、多参考或编辑参数,不用一个虚构接口包装所有模型。
| 环节 | 判断与做法 |
|---|---|
| 文字生成 | 适合概念探索或不要求精确 SKU 的环境镜。指定人物、包装、UI 时不能只靠文字描述。 |
| 首帧 / 首尾帧 | 能约束入口或端点,不保证中段动作合理。把主体动作与相机动作分开,生成后核动作转折。 |
| 连续性 | 只有使用上一真实出口的镜头需要串行;不依赖它的静物、环境镜可以在授权额度内并行。 |
| 任务记录 | 后端/版本、参考哈希、时长/比例、请求参数、任务 ID 和 take 一起保存。状态不明先查询原任务,不直接重发。 |
分数用来定位问题,不替商品和人物做决定。
先核 SKU、关键文字、身份、功能和权利,再看动作、连续性、声音与审美。商品结构错了,画面再漂亮也不能被平均分抵消。
| 环节 | 判断与做法 |
|---|---|
| 主体相似 | 可对主体 ROI 特征算余弦相似度,按视角和遮挡分别看;相似不等于同 SKU,也不能证明真人脸或身材正确。 |
| 时间变化 | 同一镜内可用光流对齐,再看非遮挡区域残差;切镜、真实运动和反射变化另判断。对齐失败记为未知。 |
| 文字与动作 | OCR 对已批准字段;动作核入口—转折—出口。静止片可能相似度很高,却没完成需要展示的动作。 |
| 阈值怎么定 | 用本项目已接受/拒绝片段校准,再留独立验证片检查误放行;不写“0.8 就合格”。VBench 等方法可作参考,当前未接入。 |
错误在哪里,就从哪里改。
先标 shot、take、时码、区域与失败项。文案或声音错先改文案/音轨;局部可修就保留正确像素;整镜动作不成立才重生成。
| 环节 | 判断与做法 |
|---|---|
| 依赖不是播放顺序 | S3 用 S2 的出口,S4 用 S3 的出口;S5 是独立静物镜。S2 改变后复查 S2/S3/S4,S1/S5 不因本次改动失效。 |
| 先复查,再重做 | 后续镜头进入待复查,不代表全部重新付费渲染。若实际消费的出口没变,可保留;剪辑接点和总时长另外检查。 |
| 困难接触 | 多次失败时比较补拍、切镜和简化动作的成本与信息损失,不靠重复抽卡掩盖问题。 |
| 可运行 | 公开 plan 命令计算依赖闭包、顺序和一次尝试预算。循环依赖、未知镜头与无剩余尝试会被拦住。 |
比较可用镜头的成本,而不是只数生成了多少条。
记录每次生成的成本、用时、失败类别和实际可用秒数。先测本任务最难的一镜,结果支持哪条路线,再安排剩余镜头。
| 环节 | 判断与做法 |
|---|---|
| 生成成本 | 本轮已消耗生成费用 ÷ 被接受的可用秒数;分母为零就不报一个好看的单价。编辑、人力与第三方素材费用另列。 |
| 控制变量 | 比较模型或参考方式时固定商品、动作、时长和验收标准;不要同时改提示词、模型、素材与机位后归因。 |
| 停止条件 | 单镜尝试次数和总剩余额度预先确定。额度不足,交付待决策任务,不默认缩水、换人或改商品。 |
| 真实结果 | 通过一次样片不代表所有品类都可自动生产;技术质量与投放效果分别记录。 |
RUNNABLE / ACTUAL VIDEO INPUT
视频分析:找出需要复看的位置。
用 TikTok「DNA,爆款元素复刻」第一条视频做了一次本地检查:扫描前 60 秒,解码 1,438 帧。以下是画面变化候选,不是模型自动判断出的剧情或质量分。原视频没有被修改。
| 读到的结果 | 怎么使用 |
|---|---|
| 15.070 s / 30.140 s / 45.210 s | 三个场景变化候选。打开前后帧判断是剪辑、转场还是快速运动,再决定是否进入镜头表。 |
| 低变化区间:0 个 | 本次参数下没有命中,不代表没有变形、闪烁、静止镜或其他视觉错误。 |
| 最后观察帧:59.960 s | 这是本次扫描的末帧时码,不是原片总时长,也不是整片验收。 |
| 参数与来源 | scene_threshold=10;freeze_seconds=1;freeze_noise=0.001;分析宽度最多640px。结果保留 FFmpeg 版本与源文件 SHA-256。 |
python3 scripts/multimodal.py inspect /absolute/path/video.mp4 \
--seconds 60 --scene-threshold 10 --freeze-seconds 1工具调用 FFmpeg 的场景变化与低变化检测,不分析声音,也不识别人脸、商品或“爆款原因”。阈值可调,候选需要回原片确认。
WORKED EXAMPLE / DEPENDENCY-AWARE REPAIR
改第二镜,为什么不用重做整片。
合成算例:五个镜头,S3 用 S2 的出口,S4 用 S3 的出口;S1、S5 独立。修改 S2 后,代码把 S2/S3/S4 列入待复查范围,保留 S1/S5。依赖表示实际渲染引用,不是简单的播放先后。
| 条件 | 计算与决定 |
|---|---|
| 每镜单次2单位,剩余6 | 三个受影响镜各一次,估算6。READY_FOR_REVIEW:可以审计划,不表示已批准或已开始生成。 |
| 剩余只有5,或任一镜无剩余尝试 | NEEDS_PRODUCTION_DECISION:调整范围、补拍或重新安排预算,不自动重试。 |
| 后续镜只是被标记 | 先检查实际消费的参考是否改变;不受影响的 take 可以保留,剪辑接点和总时长另查。 |
python3 scripts/multimodal.py plan /absolute/path/repair.json
# changed: [S2]
# recheck_or_rebuild: [S2, S3, S4]
# unaffected_by_declared_changes: [S1, S5]
# one_attempt_estimate: 6IMPLEMENTED / LOCAL / OPTIONAL
哪些已经有代码,哪些还要接模型。
| 能力 | 当前状态 | 具体边界 |
|---|---|---|
| 画面候选检查 + 返修依赖计算 | 本次公开实现,可本地运行 | 实际读像素、返回时码;依赖计算读取任务关系,不自动判断人物或 SKU。 |
| 商品 ROI / 来源哈希 / 参考角色 / 断点恢复 | 已有本地品牌片实现 | ROI 是对已批准坐标的裁剪;哈希防旧来源误用,不能证明画面正确。 |
| 连续片尾帧选择 | 已有本地实现 | 尾部三个候选用运动变化与模糊度排序;不是动作理解,失败回退不叫最优帧。 |
| 视频请求编译 | 已有本地适配器 | 当前已写适配器不等于所有模型通用,也不证明已接入服务或完成渲染。 |
| ASR/OCR、主体特征、光流、SAM 2 / VBench | 可选接入路线,未捆绑或在此运行 | 用项目样本校准后再辅助复查;不把第三方基础模型说成本人训练。 |
查看具体技术依据
FFmpeg 用于实际媒体检查;PySceneDetect 是可选拆镜方案;SAM 2 是分割与传播工具;VBench 是多维评价参考。它们各自解决一部分问题,不是一个自动成片保证。
实现方式、输入与本地检查
沿用 jingqiu-DTC 做短商品分镜,连续品牌片走既有品牌片方法。shots 工具整理带时码的审核与返修单,不读像素;reframe 公开默认流程会裁成 9:16 并换原声,横屏与保留原声任务不能直接运行该默认命令。
python3 scripts/review.py examples.json --example shots命令运行的是合成示例审核,不是在线账户接入,也不证明实际增长效果。
素材生成、画面审核和投放效果分别判断。商品与人物先核真实性,成片再检查连续性与声音;效果要等真实投放数据。