工作流步骤详解
DuRT 的工作流引擎(Workflow Engine)允许你将最多 6 种步骤串联成一条完整的处理流水线——从音频采集或文件转录,经过 AI 处理,最终导出结果。每个步骤相互独立,按需配置;你只需加入任务所需的步骤即可。
NOTE
步骤按顺序执行,每个步骤的输出会自动作为下一步骤的输入。
步骤 1 — RealtimeASR(实时语音转录)
用途: 实时采集并转录麦克风或系统音频(Mac 上正在播放的任意应用声音),生成即时字幕或文字记录。
工作原理
DuRT 使用 ScreenCaptureKit 直接采集系统音频,无需虚拟声卡或额外线缆,即可转录视频会议、网课、播客等的声音。也支持麦克风输入,适用于面对面会议或语音听写。
主要配置项
| 配置项 | 说明 |
|---|---|
| 输入源 | 系统音频(ScreenCaptureKit)或麦克风 |
| AEC 回声消除 | 在使用系统音频且扬声器开启时,防止麦克风将扬声器声音再次采入,避免重复或乱码转录 |
| 语言 | 设置说话语言以获得最佳识别准确率 |
| 引擎 | 选择 ASR 引擎(Whisper 等) |
最佳实践
TIP
在使用系统音频输入且扬声器开启的情况下,请务必开启 AEC 回声消除。否则 ASR 引擎可能会重复识别扬声器播出的内容,产生冗余文字。
- 参与在线会议时,选择系统音频,可同时采集所有参与者的声音,而不仅限于自己。
- 做语音听写或录音备忘时,选择麦克风,信号更干净。
- 务必正确设置目标语言——语言设置错误会显著降低识别准确率。
步骤 2 — MediaTranscription(媒体文件转录)
用途: 对本地音视频文件或远程链接进行转录。
支持的来源
本地文件: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM 等。
远程链接:
- YouTube 视频及播放列表
- 其他视频平台链接
- 直链音视频地址(
.mp3、.mp4、.m3u8等)
主要配置项
| 配置项 | 说明 |
|---|---|
| 来源 | 本地文件路径或远程 URL |
| 词级时间戳 | 为每个单词标注精确时间戳,使字幕分行更准确 |
| 说话人分离 | 自动识别并标注不同说话人(说话人 1、说话人 2……) |
| 语言 | 指定说话语言,或使用自动检测 |
| 引擎 | 选择 ASR 引擎 |
最佳实践
TIP
如果后续需要导出字幕(SRT/VTT),请开启词级时间戳。它能让字幕换行位置更自然、更精准。
TIP
对于采访、播客或多人会议录音,开启说话人分离,即可在转录结果中区分每位发言者。
- 对于 YouTube 链接,DuRT 会自动下载音频并转录,无需手动下载。
- 若视频已内置字幕或平台提供自动字幕,DuRT 可直接提取,速度远快于完整 ASR 转录。
步骤 3 — SubtitleInput(字幕/文本输入)
用途: 将现有文本或字幕导入工作流,无需重新转录音频。
输入方式
| 方式 | 说明 |
|---|---|
| 导入 SRT 文件 | 从磁盘加载标准 .srt 字幕文件 |
| 引用历史任务 | 调取之前某次 DuRT 任务的转录结果 |
| 直接输入/粘贴文本 | 在编辑器中手动输入或粘贴文字 |
适用场景
当你已有现成的转录稿,只需进行后续处理(如翻译已有 SRT 文件,或对他人发来的文字稿进行 AI 校对)时,使用 SubtitleInput 替代音频采集步骤。
NOTE
SubtitleInput 通常作为工作流的第一步,在无需重新采集音频时替代 RealtimeASR 或 MediaTranscription。
最佳实践
- 引用历史任务时,确保该任务已完成且转录结果可用,再启动新工作流。
- 无时间戳的纯文本输入适用于 LLMProcess 步骤,但导出时无法生成带时间码的字幕。
步骤 4 — LLMProcess(AI 语言处理)
用途: 对转录文本进行 AI 处理:校对、翻译、分句或生成摘要。
可用模式
| 模式 | 功能 |
|---|---|
| 校对(Proofreading) | 修正标点、语法及 ASR 识别错误,保留原意 |
| 翻译(Translation) | 将转录文本翻译成目标语言 |
| 分句(Sentence Splitting) | 将长段文字切分为自然、易读的句子,适合字幕行长控制 |
| 总结(Summary) | 将完整转录内容精炼为简洁摘要,适合长会议或讲座 |
主要配置项
| 配置项 | 说明 |
|---|---|
| 模式 | 选择上述四种模式之一 |
| 目标语言 | 翻译模式下,指定翻译目标语言 |
| LLM 提供商 / 模型 | 选择 AI 模型(OpenAI GPT-4o 等) |
| 自定义提示词 | 添加自定义指令,引导 LLM 按特定要求处理 |
最佳实践
TIP
可以串联多个 LLMProcess 步骤实现复杂处理。例如先校对,再翻译,每一步在上一步结果的基础上继续优化。
IMPORTANT
LLMProcess 需要在 DuRT 设置中配置所选 LLM 提供商的有效 API Key。
- 在翻译前先进行校对,效果更佳——先纠错,避免错误随翻译传播。
- 分句特别适合口语转录内容,因为自然语音通常缺乏明确的句子边界。
- 会议录音推荐组合使用校对 + 总结,一次工作流同时获得干净的文字稿和快速摘要。
步骤 5 — TextToSpeech(语音合成)
用途: 将处理后的文本转换为自然流畅的语音音频。
音色选项
| 选项 | 说明 |
|---|---|
| 预设音色 | 从多语言内置音色库中选择 |
| 音色克隆 | 上传短段音频样本,克隆特定人声 |
| 音色设计 | 调节音调、风格、口音等参数,创建自定义音色 |
主要配置项
| 配置项 | 说明 |
|---|---|
| 音色 | 选择预设、克隆或自定义音色 |
| 语速 | 调节朗读速度(如 0.75× 放慢,1.25× 加快) |
| 语言 / 区域 | 确保 TTS 引擎与文本语言匹配 |
| TTS 提供商 | 选择服务商(OpenAI TTS、系统语音等) |
最佳实践
TIP
使用音色克隆时,提供一段 10~30 秒、背景噪声尽量少的干净录音,可获得最佳克隆效果。
TIP
将 TextToSpeech 与前一步的翻译搭配使用,可为视频生成其他语言的配音音频。
- TTS 音色语言必须与文本语言匹配——不匹配会导致发音严重失真或难以理解。
- 利用语速调节满足不同需求:为语言学习者放慢语速,为播客或旁白适当加快。
步骤 6 — ExportArtifact(导出)
用途: 将工作流输出保存为一个或多个指定格式的文件。
字幕格式
| 格式 | 扩展名 | 适用场景 |
|---|---|---|
| SRT | .srt | 通用字幕,适用于各类播放器和平台 |
| VTT | .vtt | 网页视频(HTML5)、YouTube、流媒体 |
| TXT | .txt | 纯文本转录稿,无时间戳 |
音频格式
| 格式 | 扩展名 | 适用场景 |
|---|---|---|
| AAC | .aac | 高质量、小体积 |
| MP3 | .mp3 | 通用兼容性最佳 |
主要配置项
| 配置项 | 说明 |
|---|---|
| 格式 | 选择一种或多种导出格式 |
| 输出路径 | 选择文件保存位置 |
| 文件名 | 自定义输出文件名 |
| 按说话人分割 | 为每位说话人分别导出文件(需已启用说话人分离) |
最佳实践
TIP
可同时选择多种导出格式——例如在一步内同时导出 SRT 和 TXT。
NOTE
音频导出(AAC/MP3)仅在工作流包含 TextToSpeech 步骤时可用。
- 视频剪辑场景下,导出 SRT 文件后可直接拖入视频编辑器使用。
- 归档会议记录时,TXT 是最简洁、兼容性最好的格式。
- 若工作流已启用说话人分离,可考虑开启按说话人分割,生成每位参与者各自的文字稿。
