Skip to content

工作流步骤详解 ​

DuRT 的工作流引擎(Workflow Engine)允许你将最多 6 种步骤串联成一条完整的处理流水线——从音频采集或文件转录,经过 AI 处理,最终导出结果。每个步骤相互独立,按需配置;你只需加入任务所需的步骤即可。

NOTE

步骤按顺序执行,每个步骤的输出会自动作为下一步骤的输入。


步骤 1 — RealtimeASR(实时语音转录) ​

用途: 实时采集并转录麦克风或系统音频(Mac 上正在播放的任意应用声音),生成即时字幕或文字记录。

工作原理 ​

DuRT 使用 ScreenCaptureKit 直接采集系统音频,无需虚拟声卡或额外线缆,即可转录视频会议、网课、播客等的声音。也支持麦克风输入,适用于面对面会议或语音听写。

主要配置项 ​

配置项说明
输入源系统音频(ScreenCaptureKit)或麦克风
AEC 回声消除在使用系统音频且扬声器开启时,防止麦克风将扬声器声音再次采入,避免重复或乱码转录
语言设置说话语言以获得最佳识别准确率
引擎选择 ASR 引擎(Whisper 等)

最佳实践 ​

TIP

在使用系统音频输入且扬声器开启的情况下,请务必开启 AEC 回声消除。否则 ASR 引擎可能会重复识别扬声器播出的内容,产生冗余文字。

  • 参与在线会议时,选择系统音频,可同时采集所有参与者的声音,而不仅限于自己。
  • 做语音听写或录音备忘时,选择麦克风,信号更干净。
  • 务必正确设置目标语言——语言设置错误会显著降低识别准确率。

步骤 2 — MediaTranscription(媒体文件转录) ​

用途: 对本地音视频文件或远程链接进行转录。

支持的来源 ​

本地文件: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM 等。

远程链接:

  • YouTube 视频及播放列表
  • 其他视频平台链接
  • 直链音视频地址(.mp3、.mp4、.m3u8 等)

主要配置项 ​

配置项说明
来源本地文件路径或远程 URL
词级时间戳为每个单词标注精确时间戳,使字幕分行更准确
说话人分离自动识别并标注不同说话人(说话人 1、说话人 2……)
语言指定说话语言,或使用自动检测
引擎选择 ASR 引擎

最佳实践 ​

TIP

如果后续需要导出字幕(SRT/VTT),请开启词级时间戳。它能让字幕换行位置更自然、更精准。

TIP

对于采访、播客或多人会议录音,开启说话人分离,即可在转录结果中区分每位发言者。

  • 对于 YouTube 链接,DuRT 会自动下载音频并转录,无需手动下载。
  • 若视频已内置字幕或平台提供自动字幕,DuRT 可直接提取,速度远快于完整 ASR 转录。

步骤 3 — SubtitleInput(字幕/文本输入) ​

用途: 将现有文本或字幕导入工作流,无需重新转录音频。

输入方式 ​

方式说明
导入 SRT 文件从磁盘加载标准 .srt 字幕文件
引用历史任务调取之前某次 DuRT 任务的转录结果
直接输入/粘贴文本在编辑器中手动输入或粘贴文字

适用场景 ​

当你已有现成的转录稿,只需进行后续处理(如翻译已有 SRT 文件,或对他人发来的文字稿进行 AI 校对)时,使用 SubtitleInput 替代音频采集步骤。

NOTE

SubtitleInput 通常作为工作流的第一步,在无需重新采集音频时替代 RealtimeASR 或 MediaTranscription。

最佳实践 ​

  • 引用历史任务时,确保该任务已完成且转录结果可用,再启动新工作流。
  • 无时间戳的纯文本输入适用于 LLMProcess 步骤,但导出时无法生成带时间码的字幕。

步骤 4 — LLMProcess(AI 语言处理) ​

用途: 对转录文本进行 AI 处理:校对、翻译、分句或生成摘要。

可用模式 ​

模式功能
校对(Proofreading)修正标点、语法及 ASR 识别错误,保留原意
翻译(Translation)将转录文本翻译成目标语言
分句(Sentence Splitting)将长段文字切分为自然、易读的句子,适合字幕行长控制
总结(Summary)将完整转录内容精炼为简洁摘要,适合长会议或讲座

主要配置项 ​

配置项说明
模式选择上述四种模式之一
目标语言翻译模式下,指定翻译目标语言
LLM 提供商 / 模型选择 AI 模型(OpenAI GPT-4o 等)
自定义提示词添加自定义指令,引导 LLM 按特定要求处理

最佳实践 ​

TIP

可以串联多个 LLMProcess 步骤实现复杂处理。例如先校对,再翻译,每一步在上一步结果的基础上继续优化。

IMPORTANT

LLMProcess 需要在 DuRT 设置中配置所选 LLM 提供商的有效 API Key。

  • 在翻译前先进行校对,效果更佳——先纠错,避免错误随翻译传播。
  • 分句特别适合口语转录内容,因为自然语音通常缺乏明确的句子边界。
  • 会议录音推荐组合使用校对 + 总结,一次工作流同时获得干净的文字稿和快速摘要。

步骤 5 — TextToSpeech(语音合成) ​

用途: 将处理后的文本转换为自然流畅的语音音频。

音色选项 ​

选项说明
预设音色从多语言内置音色库中选择
音色克隆上传短段音频样本,克隆特定人声
音色设计调节音调、风格、口音等参数,创建自定义音色

主要配置项 ​

配置项说明
音色选择预设、克隆或自定义音色
语速调节朗读速度(如 0.75× 放慢,1.25× 加快)
语言 / 区域确保 TTS 引擎与文本语言匹配
TTS 提供商选择服务商(OpenAI TTS、系统语音等)

最佳实践 ​

TIP

使用音色克隆时,提供一段 10~30 秒、背景噪声尽量少的干净录音,可获得最佳克隆效果。

TIP

将 TextToSpeech 与前一步的翻译搭配使用,可为视频生成其他语言的配音音频。

  • TTS 音色语言必须与文本语言匹配——不匹配会导致发音严重失真或难以理解。
  • 利用语速调节满足不同需求:为语言学习者放慢语速,为播客或旁白适当加快。

步骤 6 — ExportArtifact(导出) ​

用途: 将工作流输出保存为一个或多个指定格式的文件。

字幕格式 ​

格式扩展名适用场景
SRT.srt通用字幕,适用于各类播放器和平台
VTT.vtt网页视频(HTML5)、YouTube、流媒体
TXT.txt纯文本转录稿,无时间戳

音频格式 ​

格式扩展名适用场景
AAC.aac高质量、小体积
MP3.mp3通用兼容性最佳

主要配置项 ​

配置项说明
格式选择一种或多种导出格式
输出路径选择文件保存位置
文件名自定义输出文件名
按说话人分割为每位说话人分别导出文件(需已启用说话人分离)

最佳实践 ​

TIP

可同时选择多种导出格式——例如在一步内同时导出 SRT 和 TXT。

NOTE

音频导出(AAC/MP3)仅在工作流包含 TextToSpeech 步骤时可用。

  • 视频剪辑场景下,导出 SRT 文件后可直接拖入视频编辑器使用。
  • 归档会议记录时,TXT 是最简洁、兼容性最好的格式。
  • 若工作流已启用说话人分离,可考虑开启按说话人分割,生成每位参与者各自的文字稿。

Released under the MIT License.