← 回到影像作品

MULTIMODAL / PRODUCTION METHODS

多模态:从拆解到可用镜头。

商品片、品牌故事、逐镜生成与实拍合成。作品在首页,制作方法与工具放在这里。

OPERATOR NOTES / METHODS & IMPLEMENTATION

逐镜生成,或保留实拍做局部合成。

没有可用实拍时,先锁商品、人物和场景参考,做好静帧,再逐镜生成动作。已有合适实拍时,保留背景与表演,只处理需要替换的部分;最后统一镜头衔接、声音和节奏。

01商品与人物先锁什么

商品、人物、服装、场景分别绑定原始参考。真实 SKU 看不到的背面和功能保持未知;个人形象遵循已确认的脸与身材资料。

02什么时候进入视频生成

每镜写用途、入点、动作、出点与机位。先通过静帧检查,再生成候选;动作和相机指令分开,失败只重做相关镜头。

03为什么不一直重抽整片

已有好实拍且局部有问题时,用遮罩、跟踪、阴影和反射合成;整段重生成会把原来正确的部分也改掉。

04最后怎么验收

镜头逐个核商品与动作,再整片看节奏、声音和字幕。文件可解码、镜头可剪辑、最终成片通过,是三个不同状态。

WORKFLOWBrief & true referencesShot cardsStill approvalGenerate / CompositeSound & editFull-film review

DECOMPOSITION / CONDITIONING / EVALUATION

镜头背后,具体怎么做。

参考片先拆成带时码的镜头,再绑定商品与人物资料、选择生成方式。每一步写明判断条件、输出内容和失败后的处理。

把“看起来像”,拆成可以重新制作的镜头。

输入参考片后,先定位切镜候选,再对齐声音、字幕和动作。逐镜写明它是在吸引注意、演示操作、提供证据,还是消除顾虑。复刻的是可迁移的表达方式,商品事实必须换成当前 SKU 的。

环节判断与做法
时间定位帧差定位候选;快摇、闪光和溶解需要人工确认。查看候选前后帧与动作转折,不只抽封面。
声音与文字ASR / OCR 提供带时码的观察,校对专名、数字与单位;识别结果不直接成为产品事实。
DNA 怎么迁移参考里的“开盖—倒出—看效果”,不能硬套到不开盖的设备;可以保留“操作—变化—验证”的信息顺序。
交付shot_id、入/出时码、画面任务、动作、镜头、声音、保留/替换项,以及每个判断的原片位置。
ANALYZEDecode & cut candidatesTimed observationsShot purposeKeep / replace map
PRODUCERole-scoped referencesApproved keyframeSupported backendActual take review
REPAIRLocate defectDependency closureBudget decisionRecheck & edit

RUNNABLE / ACTUAL VIDEO INPUT

视频分析:找出需要复看的位置。

用 TikTok「DNA,爆款元素复刻」第一条视频做了一次本地检查:扫描前 60 秒,解码 1,438 帧。以下是画面变化候选,不是模型自动判断出的剧情或质量分。原视频没有被修改。

读到的结果怎么使用
15.070 s / 30.140 s / 45.210 s三个场景变化候选。打开前后帧判断是剪辑、转场还是快速运动,再决定是否进入镜头表。
低变化区间:0 个本次参数下没有命中,不代表没有变形、闪烁、静止镜或其他视觉错误。
最后观察帧:59.960 s这是本次扫描的末帧时码,不是原片总时长,也不是整片验收。
参数与来源scene_threshold=10;freeze_seconds=1;freeze_noise=0.001;分析宽度最多640px。结果保留 FFmpeg 版本与源文件 SHA-256。
PIXEL EVENTS / PYTHON + FFMPEG
python3 scripts/multimodal.py inspect /absolute/path/video.mp4 \
  --seconds 60 --scene-threshold 10 --freeze-seconds 1

工具调用 FFmpeg 的场景变化与低变化检测,不分析声音,也不识别人脸、商品或“爆款原因”。阈值可调,候选需要回原片确认。

WORKED EXAMPLE / DEPENDENCY-AWARE REPAIR

改第二镜,为什么不用重做整片。

合成算例:五个镜头,S3 用 S2 的出口,S4 用 S3 的出口;S1、S5 独立。修改 S2 后,代码把 S2/S3/S4 列入待复查范围,保留 S1/S5。依赖表示实际渲染引用,不是简单的播放先后。

RECHECKS2 / changedS3 / exit-dependentS4 / exit-dependent
PRESERVES1 / independentS5 / independent
条件计算与决定
每镜单次2单位,剩余6三个受影响镜各一次,估算6。READY_FOR_REVIEW:可以审计划,不表示已批准或已开始生成。
剩余只有5,或任一镜无剩余尝试NEEDS_PRODUCTION_DECISION:调整范围、补拍或重新安排预算,不自动重试。
后续镜只是被标记先检查实际消费的参考是否改变;不受影响的 take 可以保留,剪辑接点和总时长另查。
DEPENDENCY PLAN / NO GENERATION CALLS
python3 scripts/multimodal.py plan /absolute/path/repair.json
# changed: [S2]
# recheck_or_rebuild: [S2, S3, S4]
# unaffected_by_declared_changes: [S1, S5]
# one_attempt_estimate: 6

IMPLEMENTED / LOCAL / OPTIONAL

哪些已经有代码,哪些还要接模型。

能力当前状态具体边界
画面候选检查 + 返修依赖计算本次公开实现,可本地运行实际读像素、返回时码;依赖计算读取任务关系,不自动判断人物或 SKU。
商品 ROI / 来源哈希 / 参考角色 / 断点恢复已有本地品牌片实现ROI 是对已批准坐标的裁剪;哈希防旧来源误用,不能证明画面正确。
连续片尾帧选择已有本地实现尾部三个候选用运动变化与模糊度排序;不是动作理解,失败回退不叫最优帧。
视频请求编译已有本地适配器当前已写适配器不等于所有模型通用,也不证明已接入服务或完成渲染。
ASR/OCR、主体特征、光流、SAM 2 / VBench可选接入路线,未捆绑或在此运行用项目样本校准后再辅助复查;不把第三方基础模型说成本人训练。
查看具体技术依据

FFmpeg 用于实际媒体检查;PySceneDetect 是可选拆镜方案;SAM 2 是分割与传播工具;VBench 是多维评价参考。它们各自解决一部分问题,不是一个自动成片保证。

实现方式、输入与本地检查

沿用 jingqiu-DTC 做短商品分镜,连续品牌片走既有品牌片方法。shots 工具整理带时码的审核与返修单,不读像素;reframe 公开默认流程会裁成 9:16 并换原声,横屏与保留原声任务不能直接运行该默认命令。

LOCAL REVIEW / NO ACCOUNT WRITES
python3 scripts/review.py examples.json --example shots

命令运行的是合成示例审核,不是在线账户接入,也不证明实际增长效果。

素材生成、画面审核和投放效果分别判断。商品与人物先核真实性,成片再检查连续性与声音;效果要等真实投放数据。