ワークフローステップ詳細
DuRT のワークフローエンジン(Workflow Engine)を使用すると、最大 6 種類のステップを連結して完全な処理パイプラインを構築できます。音声キャプチャやファイル文字起こしから、AI による言語処理、最終的なファイル書き出しまでを柔軟に自動化できます。各ステップは独立しており、タスクに必要なステップだけを組み合わせて使用します。
NOTE
ステップは上から順に実行され、前のステップの出力結果が自動的に次のステップの入力として渡されます。
ステップ 1 — RealtimeASR(リアルタイム音声認識)
用途: マイクやシステム内部音声(Mac 上で再生中のあらゆるアプリの音)をリアルタイムにキャプチャして文字起こしを行い、即座に字幕やテキスト記録を生成します。
仕組み
DuRT は ScreenCaptureKit を使用してシステム音声を直接キャプチャするため、仮想オーディオドライバを導入することなく、ビデオ会議、オンライン授業、ポッドキャストなどの音声をクリアに文字起こしできます。対面での会話や音声入力にはマイク入力も利用可能です。
主な設定項目
| 設定項目 | 説明 |
|---|---|
| 入力ソース | システム音声(ScreenCaptureKit)またはマイク |
| AEC エコーキャンセラー | スピーカーから音声を出しながらシステム音声を録音する際、マイクがスピーカー音を再録音するのを防ぎ、重複認識を防止 |
| 言語 | 最も高い認識精度を得るために発話言語を指定 |
| エンジン | 使用する ASR エンジン(Apple 音声認識、OneASR、OpenAI など)を選択 |
ベストプラクティス
TIP
スピーカーから音声を再生しながらシステム音声をキャプチャする場合は、必ず AEC エコーキャンセラー を有効にしてください。スピーカーから出た音をマイクが拾って二重に文字起こししてしまうのを防ぎます。
- オンライン会議では、システム音声を選択することで、自分以外の参加者全員の音声をまとめてキャプチャできます。
- 音声メモやスピーチの文字起こしには、マイクを選択するとノイズの少ないクリアな音声が得られます。
- 認識精度を最大化するために、発話言語を正確に設定してください。
ステップ 2 — MediaTranscription(メディアファイル文字起こし)
用途: ローカルの音声・動画ファイルや Web 上のメディアリンクを一括で文字起こしします。
対応する音源
ローカルファイル: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM など。
リモートリンク:
- YouTube 動画および再生リスト
- その他の主要動画配信プラットフォームのリンク
- 音声・動画の直接リンク(
.mp3,.mp4,.m3u8など)
主な設定項目
| 設定項目 | 説明 |
|---|---|
| ソース | ローカルファイルのパス、またはリモート URL |
| 単語レベルのタイムスタンプ | 単語ごとに正確なタイムスタンプを付与し、字幕の改行やアニメーションを最適化 |
| 話者分離 | 発言者の違いを自動識別してラベル付け(Speaker 1、Speaker 2…) |
| 言語 | 発話言語を指定、または自動検出 |
| エンジン | 使用する ASR エンジンを選択 |
ベストプラクティス
TIP
後から字幕ファイル(SRT/VTT)を出力する場合は、単語レベルのタイムスタンプ を有効にしてください。字幕の改行タイミングが自然で正確になります。
TIP
インタビュー、対談、複数人の会議録音では、話者分離 をオンにすることで、発言者ごとの会話ログをきれいに整理できます。
- YouTube などのリンクを指定した場合、DuRT が自動で音声をストリーミング取得して処理するため、手動での事前ダウンロードは不要です。
- 動画にあらかじめ字幕が含まれている場合、DuRT は字幕トラックを高速抽出することも可能です。
ステップ 3 — SubtitleInput(字幕・テキスト入力)
用途: 音声を再度文字起こしすることなく、既存のテキストや字幕ファイルをワークフローに直接取り込みます。
インポート方法
| 方法 | 説明 |
|---|---|
| SRT ファイルの読み込み | ストレージから標準的な .srt 字幕ファイルを読み込む |
| 履歴タスクの参照 | 過去に DuRT で実行した文字起こし結果を呼び出す |
| テキストの直接入力・貼り付け | エディタ内にテキストを直接入力またはペーストする |
主な利用シーン
すでに手元に文字起こし原稿や SRT 字幕があり、後続の AI 処理(既存字幕の翻訳や、他から提供されたテキストの校正・要約など)だけを行いたい場合に、音声キャプチャステップの代わりとして SubtitleInput を使用します。
NOTE
SubtitleInput は通常、ワークフローの最初のステップとして配置し、RealtimeASR や MediaTranscription の代わりとして機能します。
ステップ 4 — LLMProcess(AI 言語処理)
用途: 大規模言語モデル(LLM)を用いて、文字起こしテキストの校正、翻訳、文分割、要約などを実行します。
利用可能な処理モード
| モード | 機能 |
|---|---|
| 校正(Proofreading) | 文脈を保ちながら、誤字脱字、句読点、ASR の誤変換を自動修正 |
| 翻訳(Translation) | テキストを指定したターゲット言語へと高精度に翻訳 |
| 文分割(Sentence Splitting) | 長文を自然な長さの文章に分割し、字幕の行長や読みやすさを最適化 |
| 要約(Summary) | 文字起こし全体から主要な要点や決定事項を抽出し、簡潔なサマリーを作成 |
主な設定項目
| 設定項目 | 説明 |
|---|---|
| モード | 上記 4 つのモードから選択 |
| ターゲット言語 | 翻訳モード時に翻訳先の言語を指定 |
| LLM プロバイダ / モデル | 使用する AI モデル(OpenAI GPT-4o、DeepSeek、Ollama 等)を選択 |
| カスタムプロンプト | 独自の指示文を追加し、特定のフォーマットやトーンで処理 |
ベストプラクティス
TIP
複数の LLMProcess ステップを連結することが可能です。例えば「校正」ステップで誤字を直した後に「翻訳」ステップを実行することで、より高品質な翻訳結果が得られます。
IMPORTANT
LLMProcess を利用するには、DuRT の設定画面で対象プロバイダの有効な API Key を設定しておく必要があります。
ステップ 5 — TextToSpeech(音声合成)
用途: 処理されたテキストを、自然で滑らかな AI 音声オーディオに変換します。
音声オプション
| オプション | 説明 |
|---|---|
| プリセットボイス | 多言語対応の豊富な標準ボイスライブラリから選択 |
| ボイスクローン | 短い音声サンプルをアップロードして特定の話者の声を再現 |
| ボイスデザイン | ピッチ、トーン、アクセントなどのパラメータを調整したカスタム音声 |
主な設定項目
| 設定項目 | 説明 |
|---|---|
| ボイス | プリセット、クローン、またはカスタムボイスを選択 |
| 話速 | 読み上げ速度を調整(例:0.8× でゆっくり、1.2× で速く) |
| 言語 / 地域 | テキストの言語と一致する音声を選択 |
| TTS プロバイダ | 利用するサービス(OpenAI TTS、macOS システム音声など)を選択 |
ベストプラクティス
TIP
TextToSpeech を直前の 翻訳 ステップと組み合わせることで、動画の外国語吹き替え音声を自動生成できます。
- テキストの言語と TTS ボイスの言語設定は必ず一致させてください。言語が異なると発音が不自然になります。
- 語学学習用途にはややゆっくり(0.8×)、ナレーション用途には自然な速度(1.0×)など、用途に応じて速度を調整してください。
ステップ 6 — ExportArtifact(成果物エクスポート)
用途: ワークフローの最終出力を、指定した形式のファイルとして保存します。
字幕フォーマット
| 形式 | 拡張子 | 主な用途 |
|---|---|---|
| SRT | .srt | 一般的な動画プレーヤーや動画編集ソフト全般 |
| VTT | .vtt | Web ページ(HTML5)、YouTube、ストリーミング |
| TXT | .txt | タイムスタンプなしのプレーンテキスト原稿 |
音声フォーマット
| 形式 | 拡張子 | 主な用途 |
|---|---|---|
| AAC | .aac | 高音質・コンパクトなファイルサイズ |
| MP3 | .mp3 | 最高の汎用性と互換性 |
主な設定項目
| 設定項目 | 説明 |
|---|---|
| フォーマット | 1 つまたは複数の出力形式を選択 |
| 出力先パス | ファイルの保存先ディレクトリを指定 |
| ファイル名 | 出力ファイル名をカスタマイズ |
| 話者ごとに分割 | 話者分離が有効な場合、発言者ごとに個別のファイルとして出力 |
ベストプラクティス
TIP
複数の出力形式を同時に選択できます。例えば、1 回の実行で SRT 字幕と TXT 本文の両方を同時に保存可能です。
NOTE
音声形式(AAC/MP3)のエクスポートは、ワークフロー内に TextToSpeech ステップが含まれている場合に利用できます。
- 動画編集ソフト(Final Cut Pro や Premiere Pro など)で使用する場合は SRT を選択するとそのままタイムラインに取り込めます。
- 会議の議事録アーカイブには、最もシンプルで扱いやすい TXT が適しています。
