Skip to content

6대 표준 워크플로우 단계 ​

DuRT의 워크플로우 엔진은 작업을 순차적으로 실행되는 개별 단계(Step)로 분할합니다. 각 단계는 이전 단계의 결과물을 입력받아 처리한 후 다음 단계로 전달합니다.


1. RealtimeASR (실시간 음성 전사) ​

시스템 오디오 또는 마이크 입력을 실시간으로 텍스트로 변환합니다.

주요 설정 항목 ​

  • 오디오 소스: 시스템 오디오(내부 사운드) 또는 마이크 입력.
  • AEC 에코 제거: 스피커 출력 소리가 마이크로 재유입되는 현상을 상쇄.
  • 전사 엔진: Apple 음성 인식 또는 기타 연동 ASR 엔진.
  • 언어 설정: 발화 언어 지정.

2. MediaTranscription (미디어 파일 전사) ​

로컬 오디오/비디오 파일 또는 웹 미디어 URL을 분석하여 전사합니다.

주요 설정 항목 ​

  • 소스: 로컬 파일 선택 또는 스트리밍 링크 입력.
  • 단어별 타임스탬프: 단어 단위의 정밀한 시작/종료 시간 생성 여부.
  • 화자 분리(Diarization): 다중 화자 자동 구분.
  • 인식 언어: 대상 오디오의 언어 선택.

3. LLMProcess (대형 언어 모델 처리) ​

전사된 텍스트를 LLM에 전달하여 교정, 번역, 요약, 문장 분할 등의 고도화 처리를 수행합니다.

주요 설정 항목 ​

  • LLM 서비스: OpenAI, DeepSeek, Ollama 등 연동된 AI 서비스 선택.
  • 처리 모드: 문장 분할, 번역, 교정, 요약, 커스텀 지시.
  • 프롬프트 선택: 사전 저장된 프롬프트 또는 맞춤형 프롬프트 적용.
  • 대상 언어: 번역 모드 시 출력 언어 지정.

4. TextToSpeech (TTS 음성 합성) ​

텍스트를 자연스러운 음성 오디오로 변환합니다.

주요 설정 항목 ​

  • TTS 서비스: OpenAI TTS 또는 시스템 내장 음성 합성기.
  • 음색(Voice): 원하는 보이스 캐릭터 선택.
  • 속도(Speed): 재생 배속 조절 (0.5x ~ 2.0x).

5. ExportArtifact (결과물 내보내기) ​

파이프라인에서 생성된 텍스트, 자막, 오디오 파일을 디스크로 저장합니다.

지원 포맷 ​

  • 자막 및 텍스트: SRT, VTT, JSON, TXT, CSV
  • 오디오 파일: AAC, MP3

주요 설정 항목 ​

  • 내보내기 형식: 한 번에 여러 형식을 동시 선택 가능.
  • 저장 경로 및 파일명: 출력 위치 및 명명 규칙 지정.
  • 화자별 분할 저장: 화자 분리 결과에 따라 파일 분할 내보내기 지원.

Released under the MIT License.