ワークフローレシピ
ワークフローレシピは、頻出するタスクのためにあらかじめ設計されたステップの組み合わせです。以下の各レシピを参考にステップを連結し、最適な設定でワンクリック自動化を実現できます。
NOTE
DuRT のワークフローパネルを開き、下記の順序でステップを追加・設定したら、実行 ボタンを押すだけでパイプライン全体が自動処理されます。
レシピ 1:高速ファイル文字起こし → SRT エクスポート
利用シーン: ローカルにある音声・動画ファイルから、できるだけ素早く字幕ファイルを生成したいとき。
ステップ構成
- MediaTranscription(メディアファイル文字起こし)
- ExportArtifact(エクスポート)
主な設定項目
- MediaTranscription → ソース: ローカルファイル(MP3、WAV、MP4、MKV 等)を選択。
- MediaTranscription → 単語レベルのタイムスタンプ: ✅ オン(正確な SRT タイムコードの生成に必須)。
- MediaTranscription → 言語: 認識精度を高めるため、自動検出ではなく発話言語を明示的に指定。
- ExportArtifact → フォーマット: SRT を選択。
TIP
複数人が会話している動画の場合は、同時に 話者分離 を有効にすると、発言者ごとにラベル付けされた文字起こしが得られます。
レシピ 2:会議録音の文字起こし + AI 要約 → TXT エクスポート
利用シーン: 会議の録音データから、クリーンな書き起こしテキストと簡潔な決定事項サマリーを同時に作成したいとき。
ステップ構成
- MediaTranscription(メディアファイル文字起こし)
- LLMProcess(校正)
- LLMProcess(要約)
- ExportArtifact(エクスポート)
主な設定項目
- MediaTranscription → 話者分離: ✅ オン(各発言を参加者に紐付け)。
- LLMProcess #1 → モード: 校正(Proofreading)(要約の前に誤変換や句読点を修正)。
- LLMProcess #2 → モード: 要約(Summary)。
- LLMProcess #2 → カスタムプロンプト: 「決定事項と次回アクションアイテム(ToDo)を中心に要約してください」 などの指示を追加。
- ExportArtifact → フォーマット: TXT を選択。
TIP
エクスポートステップで複数のフォーマットを選択することで、校正済みの全文テキストと要約サマリーをまとめて書き出せます。
レシピ 3:ポッドキャスト文字起こし + 日本語翻訳 → 二言語 SRT エクスポート
利用シーン: 海外の英語ポッドキャストや動画に日本語字幕を付けたり、二言語字幕を作成して共有したいとき。
ステップ構成
- MediaTranscription(メディアファイル文字起こし)
- LLMProcess(翻訳)
- ExportArtifact(エクスポート)
主な設定項目
- MediaTranscription → ソース: YouTube やポッドキャストの URL を貼り付け、またはローカルファイルを選択。
- MediaTranscription → 単語レベルのタイムスタンプ: ✅ オン。
- LLMProcess → モード: 翻訳(Translation)。
- LLMProcess → ターゲット言語: 日本語(または希望する言語)。
- LLMProcess → カスタムプロンプト: 「字幕の改行構造を維持し、固有名詞は適切な表記を保ってください」 と指示。
- ExportArtifact → フォーマット: SRT(Web 用なら VTT)。
NOTE
原文と訳文を両方表示する二言語 SRT が必要な場合は、プロンプトで「原文と翻訳文を 1 行ずつ交互に出力してください」と指定します。
レシピ 4:リアルタイム字幕 → 会話ログのエクスポート
利用シーン: ライブ配信、オンラインセミナー、講義中にリアルタイム字幕を表示し、終了後に全文テキストを保存したいとき。
ステップ構成
- RealtimeASR(リアルタイム音声認識)
- ExportArtifact(エクスポート)
主な設定項目
- RealtimeASR → 入力ソース: オンライン会議や配信の視聴時は システム音声、対面での発言時は マイク を選択。
- RealtimeASR → AEC エコーキャンセラー: ✅ スピーカー再生時は必ず有効化。
- RealtimeASR → 言語: 発話言語を設定。
- ExportArtifact → フォーマット: プレーンテキストなら TXT、タイムスタンプ付きなら SRT。
IMPORTANT
システム音声をキャプチャする前に、macOS の 画面録画 権限が DuRT に許可されていることをご確認ください(システム設定 → プライバシーとセキュリティ → 画面とシステムオーディオ録音)。
レシピ 5:語学学習 — 動画 URL 文字起こし + 翻訳 + TTS 音声読み上げ
利用シーン: 外国語の動画を文字起こしして母国語に翻訳し、TTS で訳文を読み上げさせてリスニングや理解を深めたいとき。
ステップ構成
- MediaTranscription(メディアファイル文字起こし)
- LLMProcess(翻訳)
- TextToSpeech(音声合成)
- ExportArtifact(エクスポート)
主な設定項目
- MediaTranscription → ソース: 動画リンク(YouTube 等)を貼り付け。
- MediaTranscription → 単語レベルのタイムスタンプ: ✅ オン。
- LLMProcess → モード: 翻訳(Translation)。
- LLMProcess → ターゲット言語: 母国語(日本語など)。
- TextToSpeech → ボイス: ターゲット言語に合ったプリセットボイスを選択。
- TextToSpeech → 話速: 学習しやすいよう 0.8× 程度に設定。
- ExportArtifact → フォーマット: MP3(音声)と SRT(字幕)を同時選択。
TIP
異なるアクセントや性別のボイスに切り替えて再生することで、多様な音声表現に耳を慣らす練習ができます。
レシピ 6:動画吹き替え — 文字起こし + 翻訳 + TTS + 音声トラック書き出し
利用シーン: 元動画の音声を別言語に翻訳し、新しい AI ナレーション音声を生成して動画編集ソフトで差し替えたいとき。
ステップ構成
- MediaTranscription(メディアファイル文字起こし)
- LLMProcess(校正)
- LLMProcess(翻訳)
- TextToSpeech(音声合成)
- ExportArtifact(エクスポート)
主な設定項目
- MediaTranscription → ソース: ローカルの動画ファイルを選択。
- MediaTranscription → 単語レベルのタイムスタンプ: ✅ オン(元の動画のカットタイミングと合わせるために重要)。
- LLMProcess #1 → モード: 校正(Proofreading)(誤認識を事前に修正)。
- LLMProcess #2 → モード: 翻訳(Translation)。
- LLMProcess #2 → ターゲット言語: 吹き替え対象の言語。
- LLMProcess #2 → カスタムプロンプト: 「ナレーションに適した自然な口語表現で翻訳し、原文と文の長さが近くなるように調整してください」 と指示。
- TextToSpeech → ボイス: 目的に適したプロフェッショナルなプリセットボイスを選択。
- TextToSpeech → 話速: 元動画の発話テンポに合わせて調整。
- ExportArtifact → フォーマット: 音声は AAC または MP3、字幕として SRT も同時出力。
TIP
書き出された音声ファイルを Final Cut Pro や DaVinci Resolve などの編集ソフトに読み込み、元の音声をミュートして配置すれば、吹き替え動画が完成します。
