按时间线范围生成字幕,保留剪辑与变速后的声音。
当前存在尚未音频对齐的时间点;可开启“音频精准对齐”后重新矫正。原文列按比例分配。请点击字幕序号试听并核对入点、出点;“还原断句”可恢复调整前的条目。
识别或读取字幕,开始校对。
识别对白,或读取已有字幕进行矫正与翻译。
SOURCE
从 Resolve 当前时间线读取,或接续已有字幕文件。
读取时间线音频,保留剪辑与变速后的实际声音。
取音遵循交付页当前音频输出。需要完整混音时请选择主输出总线(如 Bus 1);也可选择对白总线避开配乐。
读取现有字幕后,可继续 AI 矫正或翻译;点击字幕序号可定位时间线。
点击字幕序号可定位试听。部分编码无法在此预览,仍可识别。
这些入口处理源文件,不包含时间线上的剪辑与变速。
LOCAL RECOGNITION
官方版本为 0.6B 与 1.7B;暂无 1.3B。轻量版资源占用较少,1.7B 适合优先考虑识别质量。
推荐 Python 3.12 独立虚拟环境,需安装 FFmpeg 与模型依赖。CPU 推理较慢,推荐使用 NVIDIA GPU。
REFERENCE SCRIPT
粘贴口播稿、采访提纲或背景资料。模型会按当前字幕匹配相关内容;文稿不是替换整段字幕的指令。
长文稿会按上下文预算截取相关片段。术语和人名请同时填入术语表,提高跨批次的一致性。
MODEL & CONTEXT
矫正与翻译会将字幕、相关参考内容及术语发送至此服务。模型需要稳定输出 JSON;推理模型请适当提高输出预算和超时时间。
程序会为提示词、参考文稿、邻近字幕与输出预留空间,必要时缩小批次。前后字幕仅提供语境,不会重复写入结果。已完成条目在重试时会跳过。
BACK TO THE TIMELINE
字幕时间相对原时间线起点,通常无需偏移。
发送后,字幕文件由插件管理并放入媒体池。请将字幕素材拖到原时间线起点;不会自动覆盖已有字幕轨。矫正未完成时使用原文,翻译 / 双语需先完成所有条目。
WORKFLOW
识别当前时间线范围,或通过“读取 / 导入”读取已有字幕轨。
设置 LLM,按需添加参考文稿。默认同时修复跨条目断句,可合并、拆分字幕。默认用本地 ForcedAligner 重新对齐音频;关闭音频对齐时才估算时间点。需要时可还原断句。
发送到媒体池后,将字幕素材拖到原时间线起点。当前公开 API 尚不支持直接写入任意字幕正文。
取音遵循交付页当前音频输出;需要全部混音时选择主输出总线,也可用对白总线避开配乐。