Skip to content

ワークフローステップ詳細 ​

DuRT のワークフローエンジン(Workflow Engine)を使用すると、最大 6 種類のステップを連結して完全な処理パイプラインを構築できます。音声キャプチャやファイル文字起こしから、AI による言語処理、最終的なファイル書き出しまでを柔軟に自動化できます。各ステップは独立しており、タスクに必要なステップだけを組み合わせて使用します。

NOTE

ステップは上から順に実行され、前のステップの出力結果が自動的に次のステップの入力として渡されます。


ステップ 1 — RealtimeASR(リアルタイム音声認識) ​

用途: マイクやシステム内部音声(Mac 上で再生中のあらゆるアプリの音)をリアルタイムにキャプチャして文字起こしを行い、即座に字幕やテキスト記録を生成します。

仕組み ​

DuRT は ScreenCaptureKit を使用してシステム音声を直接キャプチャするため、仮想オーディオドライバを導入することなく、ビデオ会議、オンライン授業、ポッドキャストなどの音声をクリアに文字起こしできます。対面での会話や音声入力にはマイク入力も利用可能です。

主な設定項目 ​

設定項目説明
入力ソースシステム音声(ScreenCaptureKit)またはマイク
AEC エコーキャンセラースピーカーから音声を出しながらシステム音声を録音する際、マイクがスピーカー音を再録音するのを防ぎ、重複認識を防止
言語最も高い認識精度を得るために発話言語を指定
エンジン使用する ASR エンジン(Apple 音声認識、OneASR、OpenAI など)を選択

ベストプラクティス ​

TIP

スピーカーから音声を再生しながらシステム音声をキャプチャする場合は、必ず AEC エコーキャンセラー を有効にしてください。スピーカーから出た音をマイクが拾って二重に文字起こししてしまうのを防ぎます。

  • オンライン会議では、システム音声を選択することで、自分以外の参加者全員の音声をまとめてキャプチャできます。
  • 音声メモやスピーチの文字起こしには、マイクを選択するとノイズの少ないクリアな音声が得られます。
  • 認識精度を最大化するために、発話言語を正確に設定してください。

ステップ 2 — MediaTranscription(メディアファイル文字起こし) ​

用途: ローカルの音声・動画ファイルや Web 上のメディアリンクを一括で文字起こしします。

対応する音源 ​

ローカルファイル: MP3、WAV、M4A、FLAC、OGG、MP4、MKV、MOV、AVI、WEBM など。

リモートリンク:

  • YouTube 動画および再生リスト
  • その他の主要動画配信プラットフォームのリンク
  • 音声・動画の直接リンク(.mp3, .mp4, .m3u8 など)

主な設定項目 ​

設定項目説明
ソースローカルファイルのパス、またはリモート URL
単語レベルのタイムスタンプ単語ごとに正確なタイムスタンプを付与し、字幕の改行やアニメーションを最適化
話者分離発言者の違いを自動識別してラベル付け(Speaker 1、Speaker 2…)
言語発話言語を指定、または自動検出
エンジン使用する ASR エンジンを選択

ベストプラクティス ​

TIP

後から字幕ファイル(SRT/VTT)を出力する場合は、単語レベルのタイムスタンプ を有効にしてください。字幕の改行タイミングが自然で正確になります。

TIP

インタビュー、対談、複数人の会議録音では、話者分離 をオンにすることで、発言者ごとの会話ログをきれいに整理できます。

  • YouTube などのリンクを指定した場合、DuRT が自動で音声をストリーミング取得して処理するため、手動での事前ダウンロードは不要です。
  • 動画にあらかじめ字幕が含まれている場合、DuRT は字幕トラックを高速抽出することも可能です。

ステップ 3 — SubtitleInput(字幕・テキスト入力) ​

用途: 音声を再度文字起こしすることなく、既存のテキストや字幕ファイルをワークフローに直接取り込みます。

インポート方法 ​

方法説明
SRT ファイルの読み込みストレージから標準的な .srt 字幕ファイルを読み込む
履歴タスクの参照過去に DuRT で実行した文字起こし結果を呼び出す
テキストの直接入力・貼り付けエディタ内にテキストを直接入力またはペーストする

主な利用シーン ​

すでに手元に文字起こし原稿や SRT 字幕があり、後続の AI 処理(既存字幕の翻訳や、他から提供されたテキストの校正・要約など)だけを行いたい場合に、音声キャプチャステップの代わりとして SubtitleInput を使用します。

NOTE

SubtitleInput は通常、ワークフローの最初のステップとして配置し、RealtimeASR や MediaTranscription の代わりとして機能します。


ステップ 4 — LLMProcess(AI 言語処理) ​

用途: 大規模言語モデル(LLM)を用いて、文字起こしテキストの校正、翻訳、文分割、要約などを実行します。

利用可能な処理モード ​

モード機能
校正(Proofreading)文脈を保ちながら、誤字脱字、句読点、ASR の誤変換を自動修正
翻訳(Translation)テキストを指定したターゲット言語へと高精度に翻訳
文分割(Sentence Splitting)長文を自然な長さの文章に分割し、字幕の行長や読みやすさを最適化
要約(Summary)文字起こし全体から主要な要点や決定事項を抽出し、簡潔なサマリーを作成

主な設定項目 ​

設定項目説明
モード上記 4 つのモードから選択
ターゲット言語翻訳モード時に翻訳先の言語を指定
LLM プロバイダ / モデル使用する AI モデル(OpenAI GPT-4o、DeepSeek、Ollama 等)を選択
カスタムプロンプト独自の指示文を追加し、特定のフォーマットやトーンで処理

ベストプラクティス ​

TIP

複数の LLMProcess ステップを連結することが可能です。例えば「校正」ステップで誤字を直した後に「翻訳」ステップを実行することで、より高品質な翻訳結果が得られます。

IMPORTANT

LLMProcess を利用するには、DuRT の設定画面で対象プロバイダの有効な API Key を設定しておく必要があります。


ステップ 5 — TextToSpeech(音声合成) ​

用途: 処理されたテキストを、自然で滑らかな AI 音声オーディオに変換します。

音声オプション ​

オプション説明
プリセットボイス多言語対応の豊富な標準ボイスライブラリから選択
ボイスクローン短い音声サンプルをアップロードして特定の話者の声を再現
ボイスデザインピッチ、トーン、アクセントなどのパラメータを調整したカスタム音声

主な設定項目 ​

設定項目説明
ボイスプリセット、クローン、またはカスタムボイスを選択
話速読み上げ速度を調整(例:0.8× でゆっくり、1.2× で速く)
言語 / 地域テキストの言語と一致する音声を選択
TTS プロバイダ利用するサービス(OpenAI TTS、macOS システム音声など)を選択

ベストプラクティス ​

TIP

TextToSpeech を直前の 翻訳 ステップと組み合わせることで、動画の外国語吹き替え音声を自動生成できます。

  • テキストの言語と TTS ボイスの言語設定は必ず一致させてください。言語が異なると発音が不自然になります。
  • 語学学習用途にはややゆっくり(0.8×)、ナレーション用途には自然な速度(1.0×)など、用途に応じて速度を調整してください。

ステップ 6 — ExportArtifact(成果物エクスポート) ​

用途: ワークフローの最終出力を、指定した形式のファイルとして保存します。

字幕フォーマット ​

形式拡張子主な用途
SRT.srt一般的な動画プレーヤーや動画編集ソフト全般
VTT.vttWeb ページ(HTML5)、YouTube、ストリーミング
TXT.txtタイムスタンプなしのプレーンテキスト原稿

音声フォーマット ​

形式拡張子主な用途
AAC.aac高音質・コンパクトなファイルサイズ
MP3.mp3最高の汎用性と互換性

主な設定項目 ​

設定項目説明
フォーマット1 つまたは複数の出力形式を選択
出力先パスファイルの保存先ディレクトリを指定
ファイル名出力ファイル名をカスタマイズ
話者ごとに分割話者分離が有効な場合、発言者ごとに個別のファイルとして出力

ベストプラクティス ​

TIP

複数の出力形式を同時に選択できます。例えば、1 回の実行で SRT 字幕と TXT 本文の両方を同時に保存可能です。

NOTE

音声形式(AAC/MP3)のエクスポートは、ワークフロー内に TextToSpeech ステップが含まれている場合に利用できます。

  • 動画編集ソフト(Final Cut Pro や Premiere Pro など)で使用する場合は SRT を選択するとそのままタイムラインに取り込めます。
  • 会議の議事録アーカイブには、最もシンプルで扱いやすい TXT が適しています。

Released under the MIT License.