MetaDig

第 6 步 · 成片:调顺序、裁首尾、选音轨、还原画面文字,免费导出

全部段生成后进入成片步的轻量编辑器:段顺序上下移、每段首尾裁剪、音轨四选一(模型直出 / 沿用原片音轨按段对齐 / 上传配乐 / 静音)、按原片时机叠回画面文字(可逐条开关)、导出在服务端 ffmpeg 合成不花积分;原片与成片并排对照、下载、设为开源、在画布中精修。

更新时间:2026-09-03

第 6 步把各段拼成一条成片。全部段都有生成结果后自动进入;这里的编辑都是可逆的、导出不花积分,可以反复改反复导。

页面结构

页头显示"N 段 · 总秒数"和"与原片 ±x 秒"的时长差;有成片后顶部是原片 vs 成片并排对照,下面依次是段列表、音轨、画面文字、导出。设置随改随存(半秒防抖),刷新页面不丢。

段顺序与裁剪

每一段一行:原片起止、时长、缩略播放。

音轨方案

方案 效果 适合
模型直出音频 各段生成时自带的声音按段拼接 开着「音色跟随原片」生成的口播片
沿用原片音轨 成片画面配原片这一段的声音;各段按原片时间对齐,调过顺序或裁过头也不会错位 口播 / 节拍要和原片完全一致
上传配乐 静音各段,铺一条你上传的音乐,可调音量 纯画面类、要换 BGM
静音 只要画面 后期另配

原片没有可用音轨时"沿用原片音轨"不可选;选了它但音轨缺失,导出会按静音完成并在结果里说明。

画面文字还原

视频模型不画中文(渲染不稳、破坏画面),原片里的字幕、标题、价格标、贴纸由拆解识别出来后,在这里按原片的镜头时机叠回成片:白字黑边加半透明底,位置按原片(顶 / 中 / 底 / 四角),字号按类型(标题最大、贴纸次之、字幕最小)。

导出与之后

点「导出成片」:先把当前设置落盘,再在服务端用 ffmpeg 两遍法合成(逐段归一化 → 拼接 → 混音 → 叠字),几十秒到一两分钟,进度条实时。完成后:

导出失败不影响任何数据,会回到第 5 / 6 步提示原因,改完再导。

常见问题

成片比原片长 / 短了几秒。 页头的时长差就是提示。多出来的是模型生成的段比原镜头长——用首尾裁剪裁掉;短了通常是某段选了更短的时长档,回第 5 步用更大的档重生成。

叠上去的字位置不对。 位置来自拆解识别的原片位置,只有七个锚点。想精确排版进画布用时间线的字幕轨。

能加转场吗? 成片步只做首尾相接(这样接缝最少)。转场进画布时间线加。

相关

Markdown 原文