下载的课程、录制的讲座、收藏的教程视频没字幕:听不清的地方没法回查、关键词没法搜索。给它生成字幕,视频才真正可用。
视频文件 = 画面轨 + 音频轨。字幕生成只和音频轨打交道:抽出音频 → 语音识别引擎转成文字并标注时间 → 按 1~2 句一行切成条目 → 输出 SRT/VTT。全程不动视频本身。
选视频 → 生成字幕:引擎自动选本地 Whisper(COST_0);想用云端则在 Provider 市场选,任务开始前显示 Provider、模型、预计费用、预计时间、隐私说明(是否上传音频),确认才执行。生成的字幕可导出 SRT/VTT/ASS,可再翻译成双语,也可以直接封装成字幕版视频。字幕缓存在本地,同一段内容重复生成不重复计费。