Skip to content

工作流程步驟詳解 ​

DuRT 的工作流程引擎(Workflow Engine)允許您將最多 6 種步驟串聯成一條完整的處理管線——從音訊擷取或檔案轉錄,經過 AI 處理,最終匯出結果。每個步驟相互獨立,按需配置;您只需加入任務所需的步驟即可。

NOTE

步驟按順序執行,每個步驟的輸出會自動作為下一步驟的輸入。


步驟 1 — RealtimeASR(即時語音轉錄) ​

用途: 即時擷取並轉錄麥克風或系統音訊(Mac 上正在播放的任意應用程式聲音),產生即時字幕或文字記錄。

工作原理 ​

DuRT 使用 ScreenCaptureKit 直接擷取系統音訊,無需虛擬音效卡或額外線材,即可轉錄視訊會議、線上課程、Podcast 等的聲音。也支援麥克風輸入,適用於面對面會議或語音聽寫。

主要配置項 ​

配置項說明
輸入源系統音訊(ScreenCaptureKit)或麥克風
AEC 回音消除在使用系統音訊且揚聲器開啟時,防止麥克風將揚聲器聲音再次採入,避免重複或亂碼轉錄
語言設定說話語言以獲得最佳辨識準確率
引擎選擇 ASR 引擎(Apple 語音辨識、OneASR 等)

最佳實踐 ​

TIP

在使用系統音訊輸入且揚聲器開啟的情況下,請務必開啟 AEC 回音消除。否則 ASR 引擎可能會重複辨識揚聲器播出的內容,產生冗餘文字。

  • 參與線上會議時,選擇系統音訊,可同時擷取所有參與者的聲音,而不僅限於自己。
  • 做語音聽寫或錄音備忘時,選擇麥克風,訊號更純淨。
  • 務必正確設定目標語言——語言設定錯誤會顯著降低辨識準確率。

步驟 2 — MediaTranscription(媒體檔案轉錄) ​

用途: 對本機音訊/視訊檔案或遠端連結進行轉錄。

支援的來源 ​

本機檔案: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM 等。

遠端連結:

  • YouTube 影片及播放清單
  • 其他影片平台連結
  • 直鏈音訊/視訊位址(.mp3、.mp4、.m3u8 等)

主要配置項 ​

配置項說明
來源本機檔案路徑或遠端 URL
字詞級時間戳記為每個單詞/單字標註精確時間戳記,使字幕分行更準確
說話者分離自動辨識並標註不同說話者(說話者 1、說話者 2……)
語言指定說話語言,或使用自動偵測
引擎選擇 ASR 引擎

最佳實踐 ​

TIP

如果後續需要匯出字幕(SRT/VTT),請開啟字詞級時間戳記。它能讓字幕斷行位置更自然、更精準。

TIP

對於採訪、Podcast 或多人會議錄音,開啟說話者分離,即可在轉錄結果中區分每位發言者。

  • 對於 YouTube 連結,DuRT 會自動下載音訊並轉錄,無需手動下載。
  • 若影片已內建字幕或平台提供自動字幕,DuRT 可直接擷取,速度遠快於完整 ASR 轉錄。

步驟 3 — SubtitleInput(字幕/文字輸入) ​

用途: 將現有文字或字幕匯入工作流程,無需重新轉錄音訊。

輸入方式 ​

方式說明
匯入 SRT 檔案從磁碟載入標準 .srt 字幕檔案
引用歷史任務調取之前某次 DuRT 任務的轉錄結果
直接輸入/貼上文字在編輯器中手動輸入或貼上文字

適用場景 ​

當您已有現成的轉錄稿,只需進行後續處理(如翻譯已有 SRT 檔案,或對他人發來的文字稿進行 AI 校對)時,使用 SubtitleInput 替代音訊擷取步驟。

NOTE

SubtitleInput 通常作為工作流程的第一步,在無需重新擷取音訊時替代 RealtimeASR 或 MediaTranscription。

最佳實踐 ​

  • 引用歷史任務時,確保該任務已完成且轉錄結果可用,再啟動新工作流程。
  • 無時間戳記的純文字輸入適用於 LLMProcess 步驟,但匯出時無法產生帶時間碼的字幕。

步驟 4 — LLMProcess(AI 語言處理) ​

用途: 對轉錄文字進行 AI 處理:校對、翻譯、分句或產生摘要。

可用模式 ​

模式功能
校對(Proofreading)修正標點、文法及 ASR 辨識錯誤,保留原意
翻譯(Translation)將轉錄文字翻譯成目標語言
分句(Sentence Splitting)將長段文字切分為自然、易讀的句子,適合字幕行長控制
總結(Summary)將完整轉錄內容精煉為簡潔摘要,適合長會議或演講

主要配置項 ​

配置項說明
模式選擇上述四種模式之一
目標語言翻譯模式下,指定翻譯目標語言
LLM 提供商 / 模型選擇 AI 模型(OpenAI GPT-4o 等)
自訂提示詞新增自訂指令,引導 LLM 按特定要求處理

最佳實踐 ​

TIP

可以串聯多個 LLMProcess 步驟實現複雜處理。例如先校對,再翻譯,每一步在上一步結果的基礎上繼續最佳化。

IMPORTANT

LLMProcess 需要在 DuRT 設定中配置所選 LLM 提供商的有效 API Key。

  • 在翻譯前先進行校對,效果更佳——先糾錯,避免錯誤隨翻譯傳播。
  • 分句特別適合口語轉錄內容,因為自然語音通常缺乏明確的句子邊界。
  • 會議錄音推薦組合使用校對 + 總結,一次工作流程同時獲得乾淨的文字稿和快速摘要。

步驟 5 — TextToSpeech(語音合成) ​

用途: 將處理後的文字轉換為自然流暢的語音音訊。

音色選項 ​

選項說明
預設音色從多語言內建音色庫中選擇
音色複製 (Voice Cloning)上傳短段音訊樣本,複製特定人聲
音色設計調整音調、風格、口音等參數,建立自訂音色

主要配置項 ​

配置項說明
音色選擇預設、複製或自訂音色
語速調整朗讀速度(如 0.75× 放慢,1.25× 加快)
語言 / 地區確保 TTS 引擎與文字語言相符
TTS 提供商選擇服務商(OpenAI TTS、系統語音等)

最佳實踐 ​

TIP

使用音色複製時,提供一段 10~30 秒、背景噪音盡量少的純淨錄音,可獲得最佳複製效果。

TIP

將 TextToSpeech 與前一步的翻譯搭配使用,可為影片產生其他語言的配音音訊。

  • TTS 音色語言必須與文字語言相符——不匹配會導致發音嚴重失真或難以理解。
  • 利用語速調節滿足不同需求:為語言學習者放慢語速,為 Podcast 或旁白適當加快。

步驟 6 — ExportArtifact(匯出) ​

用途: 將工作流程輸出儲存為一個或多個指定格式的檔案。

字幕格式 ​

格式副檔名適用場景
SRT.srt通用字幕,適用於各類播放器和平台
VTT.vtt網頁影片(HTML5)、YouTube、串流媒體
TXT.txt純文字轉錄稿,無時間戳記

音訊格式 ​

格式副檔名適用場景
AAC.aac高音質、小體積
MP3.mp3通用相容性最佳

主要配置項 ​

配置項說明
格式選擇一種或多種匯出格式
輸出路徑選擇檔案儲存位置
檔案名稱自訂輸出檔案名稱
按說話者分割為每位說話者分別匯出檔案(需已啟用說話者分離)

最佳實踐 ​

TIP

可同時選擇多種匯出格式——例如在一步內同時匯出 SRT 和 TXT。

NOTE

音訊匯出(AAC/MP3)僅在工作流程包含 TextToSpeech 步驟時可用。

  • 影片剪輯場景下,匯出 SRT 檔案後可直接拖入影片編輯器使用。
  • 歸檔會議記錄時,TXT 是最簡潔、相容性最好的格式。
  • 若工作流程已啟用說話者分離,可考慮開啟按說話者分割,產生每位參與者各自的文字稿。

Released under the MIT License.