工作流程步驟詳解
DuRT 的工作流程引擎(Workflow Engine)允許您將最多 6 種步驟串聯成一條完整的處理管線——從音訊擷取或檔案轉錄,經過 AI 處理,最終匯出結果。每個步驟相互獨立,按需配置;您只需加入任務所需的步驟即可。
NOTE
步驟按順序執行,每個步驟的輸出會自動作為下一步驟的輸入。
步驟 1 — RealtimeASR(即時語音轉錄)
用途: 即時擷取並轉錄麥克風或系統音訊(Mac 上正在播放的任意應用程式聲音),產生即時字幕或文字記錄。
工作原理
DuRT 使用 ScreenCaptureKit 直接擷取系統音訊,無需虛擬音效卡或額外線材,即可轉錄視訊會議、線上課程、Podcast 等的聲音。也支援麥克風輸入,適用於面對面會議或語音聽寫。
主要配置項
| 配置項 | 說明 |
|---|---|
| 輸入源 | 系統音訊(ScreenCaptureKit)或麥克風 |
| AEC 回音消除 | 在使用系統音訊且揚聲器開啟時,防止麥克風將揚聲器聲音再次採入,避免重複或亂碼轉錄 |
| 語言 | 設定說話語言以獲得最佳辨識準確率 |
| 引擎 | 選擇 ASR 引擎(Apple 語音辨識、OneASR 等) |
最佳實踐
TIP
在使用系統音訊輸入且揚聲器開啟的情況下,請務必開啟 AEC 回音消除。否則 ASR 引擎可能會重複辨識揚聲器播出的內容,產生冗餘文字。
- 參與線上會議時,選擇系統音訊,可同時擷取所有參與者的聲音,而不僅限於自己。
- 做語音聽寫或錄音備忘時,選擇麥克風,訊號更純淨。
- 務必正確設定目標語言——語言設定錯誤會顯著降低辨識準確率。
步驟 2 — MediaTranscription(媒體檔案轉錄)
用途: 對本機音訊/視訊檔案或遠端連結進行轉錄。
支援的來源
本機檔案: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM 等。
遠端連結:
- YouTube 影片及播放清單
- 其他影片平台連結
- 直鏈音訊/視訊位址(
.mp3、.mp4、.m3u8等)
主要配置項
| 配置項 | 說明 |
|---|---|
| 來源 | 本機檔案路徑或遠端 URL |
| 字詞級時間戳記 | 為每個單詞/單字標註精確時間戳記,使字幕分行更準確 |
| 說話者分離 | 自動辨識並標註不同說話者(說話者 1、說話者 2……) |
| 語言 | 指定說話語言,或使用自動偵測 |
| 引擎 | 選擇 ASR 引擎 |
最佳實踐
TIP
如果後續需要匯出字幕(SRT/VTT),請開啟字詞級時間戳記。它能讓字幕斷行位置更自然、更精準。
TIP
對於採訪、Podcast 或多人會議錄音,開啟說話者分離,即可在轉錄結果中區分每位發言者。
- 對於 YouTube 連結,DuRT 會自動下載音訊並轉錄,無需手動下載。
- 若影片已內建字幕或平台提供自動字幕,DuRT 可直接擷取,速度遠快於完整 ASR 轉錄。
步驟 3 — SubtitleInput(字幕/文字輸入)
用途: 將現有文字或字幕匯入工作流程,無需重新轉錄音訊。
輸入方式
| 方式 | 說明 |
|---|---|
| 匯入 SRT 檔案 | 從磁碟載入標準 .srt 字幕檔案 |
| 引用歷史任務 | 調取之前某次 DuRT 任務的轉錄結果 |
| 直接輸入/貼上文字 | 在編輯器中手動輸入或貼上文字 |
適用場景
當您已有現成的轉錄稿,只需進行後續處理(如翻譯已有 SRT 檔案,或對他人發來的文字稿進行 AI 校對)時,使用 SubtitleInput 替代音訊擷取步驟。
NOTE
SubtitleInput 通常作為工作流程的第一步,在無需重新擷取音訊時替代 RealtimeASR 或 MediaTranscription。
最佳實踐
- 引用歷史任務時,確保該任務已完成且轉錄結果可用,再啟動新工作流程。
- 無時間戳記的純文字輸入適用於 LLMProcess 步驟,但匯出時無法產生帶時間碼的字幕。
步驟 4 — LLMProcess(AI 語言處理)
用途: 對轉錄文字進行 AI 處理:校對、翻譯、分句或產生摘要。
可用模式
| 模式 | 功能 |
|---|---|
| 校對(Proofreading) | 修正標點、文法及 ASR 辨識錯誤,保留原意 |
| 翻譯(Translation) | 將轉錄文字翻譯成目標語言 |
| 分句(Sentence Splitting) | 將長段文字切分為自然、易讀的句子,適合字幕行長控制 |
| 總結(Summary) | 將完整轉錄內容精煉為簡潔摘要,適合長會議或演講 |
主要配置項
| 配置項 | 說明 |
|---|---|
| 模式 | 選擇上述四種模式之一 |
| 目標語言 | 翻譯模式下,指定翻譯目標語言 |
| LLM 提供商 / 模型 | 選擇 AI 模型(OpenAI GPT-4o 等) |
| 自訂提示詞 | 新增自訂指令,引導 LLM 按特定要求處理 |
最佳實踐
TIP
可以串聯多個 LLMProcess 步驟實現複雜處理。例如先校對,再翻譯,每一步在上一步結果的基礎上繼續最佳化。
IMPORTANT
LLMProcess 需要在 DuRT 設定中配置所選 LLM 提供商的有效 API Key。
- 在翻譯前先進行校對,效果更佳——先糾錯,避免錯誤隨翻譯傳播。
- 分句特別適合口語轉錄內容,因為自然語音通常缺乏明確的句子邊界。
- 會議錄音推薦組合使用校對 + 總結,一次工作流程同時獲得乾淨的文字稿和快速摘要。
步驟 5 — TextToSpeech(語音合成)
用途: 將處理後的文字轉換為自然流暢的語音音訊。
音色選項
| 選項 | 說明 |
|---|---|
| 預設音色 | 從多語言內建音色庫中選擇 |
| 音色複製 (Voice Cloning) | 上傳短段音訊樣本,複製特定人聲 |
| 音色設計 | 調整音調、風格、口音等參數,建立自訂音色 |
主要配置項
| 配置項 | 說明 |
|---|---|
| 音色 | 選擇預設、複製或自訂音色 |
| 語速 | 調整朗讀速度(如 0.75× 放慢,1.25× 加快) |
| 語言 / 地區 | 確保 TTS 引擎與文字語言相符 |
| TTS 提供商 | 選擇服務商(OpenAI TTS、系統語音等) |
最佳實踐
TIP
使用音色複製時,提供一段 10~30 秒、背景噪音盡量少的純淨錄音,可獲得最佳複製效果。
TIP
將 TextToSpeech 與前一步的翻譯搭配使用,可為影片產生其他語言的配音音訊。
- TTS 音色語言必須與文字語言相符——不匹配會導致發音嚴重失真或難以理解。
- 利用語速調節滿足不同需求:為語言學習者放慢語速,為 Podcast 或旁白適當加快。
步驟 6 — ExportArtifact(匯出)
用途: 將工作流程輸出儲存為一個或多個指定格式的檔案。
字幕格式
| 格式 | 副檔名 | 適用場景 |
|---|---|---|
| SRT | .srt | 通用字幕,適用於各類播放器和平台 |
| VTT | .vtt | 網頁影片(HTML5)、YouTube、串流媒體 |
| TXT | .txt | 純文字轉錄稿,無時間戳記 |
音訊格式
| 格式 | 副檔名 | 適用場景 |
|---|---|---|
| AAC | .aac | 高音質、小體積 |
| MP3 | .mp3 | 通用相容性最佳 |
主要配置項
| 配置項 | 說明 |
|---|---|
| 格式 | 選擇一種或多種匯出格式 |
| 輸出路徑 | 選擇檔案儲存位置 |
| 檔案名稱 | 自訂輸出檔案名稱 |
| 按說話者分割 | 為每位說話者分別匯出檔案(需已啟用說話者分離) |
最佳實踐
TIP
可同時選擇多種匯出格式——例如在一步內同時匯出 SRT 和 TXT。
NOTE
音訊匯出(AAC/MP3)僅在工作流程包含 TextToSpeech 步驟時可用。
- 影片剪輯場景下,匯出 SRT 檔案後可直接拖入影片編輯器使用。
- 歸檔會議記錄時,TXT 是最簡潔、相容性最好的格式。
- 若工作流程已啟用說話者分離,可考慮開啟按說話者分割,產生每位參與者各自的文字稿。
