Skip to content

工作流配方 ​

工作流配方是针对常见任务预先设计好的步骤组合。以下每个配方都列出了需要串联的具体步骤,以及获得最佳效果的关键配置建议。

NOTE

在 DuRT 中,打开工作流面板,按下方顺序添加步骤并完成配置,最后点击运行即可执行整条流水线。


配方 1:快速文件转录 → 导出 SRT ​

适用场景: 你有一个本地音视频文件,希望尽快获得字幕文件。

步骤组合 ​

  1. MediaTranscription(媒体文件转录)
  2. ExportArtifact(导出)

关键配置 ​

  • MediaTranscription → 来源: 选择本地文件(MP3、WAV、MP4、MKV 等)。
  • MediaTranscription → 词级时间戳: ✅ 开启——生成准确 SRT 时间码的必要条件。
  • MediaTranscription → 语言: 明确指定说话语言,而非依赖自动检测,以获得最佳识别率。
  • ExportArtifact → 格式: 选择 SRT。

TIP

若视频中有多位说话人,同时开启说话人分离,即可在转录结果中区分每位发言者。


配方 2:会议录音转录 + AI 总结 → 导出 TXT ​

适用场景: 你录制了一段会议,希望同时获得干净的文字稿和简洁的内容摘要,并保存为纯文本文件。

步骤组合 ​

  1. MediaTranscription(媒体文件转录)
  2. LLMProcess(校对)
  3. LLMProcess(总结)
  4. ExportArtifact(导出)

关键配置 ​

  • MediaTranscription → 说话人分离: ✅ 开启,使每段发言归属到对应参与者。
  • LLMProcess #1 → 模式: 设为校对(Proofreading),先修正 ASR 错误和标点,再进行总结。
  • LLMProcess #2 → 模式: 设为总结(Summary)。
  • LLMProcess #2 → 自定义提示词: 可补充说明,例如*"重点提炼行动项和决策结论。"*
  • ExportArtifact → 格式: 选择 TXT。

TIP

在导出步骤中同时勾选多个格式,可一次性导出校对后的完整文字稿和总结摘要。


配方 3:播客转录 + 翻译成中文 → 导出双语 SRT ​

适用场景: 你想为一个英文播客或视频添加中文字幕,或制作双语字幕文件进行分享。

步骤组合 ​

  1. MediaTranscription(媒体文件转录)
  2. LLMProcess(翻译)
  3. ExportArtifact(导出)

关键配置 ​

  • MediaTranscription → 来源: 粘贴 YouTube/播客 URL,或选择本地文件。
  • MediaTranscription → 词级时间戳: ✅ 开启,确保字幕时间准确。
  • LLMProcess → 模式: 翻译(Translation)。
  • LLMProcess → 目标语言: 简体中文(或你需要的其他语言)。
  • LLMProcess → 自定义提示词: 添加*"保留字幕换行格式。人名和专有名词保留原文形式。"*
  • ExportArtifact → 格式: SRT(或面向网页播放器的 VTT)。

NOTE

若需要真正的双语 SRT(原文 + 译文同时显示),可在自定义提示词中要求 LLM 将原文和译文逐行交替输出。


配方 4:实时字幕 → 导出文字记录 ​

适用场景: 在直播活动、在线会议或课堂中实时显示字幕,并在结束后保存完整的文字记录。

步骤组合 ​

  1. RealtimeASR(实时语音转录)
  2. ExportArtifact(导出)

关键配置 ​

  • RealtimeASR → 输入源: 在线会议选择系统音频(采集所有参与者声音);线下活动选择麦克风。
  • RealtimeASR → AEC 回声消除: ✅ 在使用系统音频且扬声器开启时务必开启。
  • RealtimeASR → 语言: 设置说话语言。
  • ExportArtifact → 格式: 纯文字记录选 TXT;需要时间戳选 SRT。

IMPORTANT

使用系统音频采集前,请确认 macOS 已授予 DuRT 屏幕录制权限(系统设置 → 隐私与安全性 → 屏幕录制)。


配方 5:语言学习——视频链接转录 + 翻译 + TTS 配音朗读 ​

适用场景: 你正在学习一门外语,想要转录外语视频、翻译为母语,并通过 TTS 朗读译文辅助练习发音和理解。

步骤组合 ​

  1. MediaTranscription(媒体文件转录)
  2. LLMProcess(翻译)
  3. TextToSpeech(语音合成)
  4. ExportArtifact(导出)

关键配置 ​

  • MediaTranscription → 来源: 粘贴视频链接(YouTube 等)或选择本地文件。
  • MediaTranscription → 词级时间戳: ✅ 开启。
  • LLMProcess → 模式: 翻译(Translation)。
  • LLMProcess → 目标语言: 你的母语。
  • TextToSpeech → 音色: 选择与目标语言匹配的预设音色。
  • TextToSpeech → 语速: 调低至 0.8× 或 0.75×,便于学习时理解。
  • ExportArtifact → 格式: MP3(音频)+ SRT(字幕),同时导出以便灵活使用。

TIP

听完一遍 TTS 朗读后,换一种不同口音或性别的音色再听一遍,练习在不同语境下理解目标语言。


配方 6:视频配音替换——转录 + 翻译 + TTS + 导出音频 ​

适用场景: 你有一段视频,希望制作另一种语言的配音音轨,用于后期视频剪辑中替换原音。

步骤组合 ​

  1. MediaTranscription(媒体文件转录)
  2. LLMProcess(校对)
  3. LLMProcess(翻译)
  4. TextToSpeech(语音合成)
  5. ExportArtifact(导出)

关键配置 ​

  • MediaTranscription → 来源: 选择本地视频文件。
  • MediaTranscription → 词级时间戳: ✅ 开启——精确的时间信息有助于配音与原片剪辑点对齐。
  • LLMProcess #1 → 模式: 校对(Proofreading)——在翻译前先修正 ASR 错误,避免错误传播。
  • LLMProcess #2 → 模式: 翻译(Translation)。
  • LLMProcess #2 → 目标语言: 配音语言。
  • LLMProcess #2 → 自定义提示词: "请以口语配音风格翻译,保持句子长度自然,尽量与原文节奏相近。"
  • TextToSpeech → 音色: 若需匹配原声,使用音色克隆;否则选择专业预设音色。
  • TextToSpeech → 语速: 适当调整以贴近原片说话节奏。
  • ExportArtifact → 格式: 音轨选 AAC 或 MP3;可同时导出 SRT 作为翻译字幕备用。

TIP

将导出的音频文件导入视频编辑器(Final Cut Pro、DaVinci Resolve 等),静音原音轨后替换为新音轨,即可完成配音替换。

NOTE

使用音色克隆时,请在运行工作流前先上传 10~30 秒的干净目标音色录音样本。

Released under the MIT License.