6대 표준 워크플로우 단계
DuRT의 워크플로우 엔진은 작업을 순차적으로 실행되는 개별 단계(Step)로 분할합니다. 각 단계는 이전 단계의 결과물을 입력받아 처리한 후 다음 단계로 전달합니다.
1. RealtimeASR (실시간 음성 전사)
시스템 오디오 또는 마이크 입력을 실시간으로 텍스트로 변환합니다.
주요 설정 항목
- 오디오 소스: 시스템 오디오(내부 사운드) 또는 마이크 입력.
- AEC 에코 제거: 스피커 출력 소리가 마이크로 재유입되는 현상을 상쇄.
- 전사 엔진: Apple 음성 인식 또는 기타 연동 ASR 엔진.
- 언어 설정: 발화 언어 지정.
2. MediaTranscription (미디어 파일 전사)
로컬 오디오/비디오 파일 또는 웹 미디어 URL을 분석하여 전사합니다.
주요 설정 항목
- 소스: 로컬 파일 선택 또는 스트리밍 링크 입력.
- 단어별 타임스탬프: 단어 단위의 정밀한 시작/종료 시간 생성 여부.
- 화자 분리(Diarization): 다중 화자 자동 구분.
- 인식 언어: 대상 오디오의 언어 선택.
3. LLMProcess (대형 언어 모델 처리)
전사된 텍스트를 LLM에 전달하여 교정, 번역, 요약, 문장 분할 등의 고도화 처리를 수행합니다.
주요 설정 항목
- LLM 서비스: OpenAI, DeepSeek, Ollama 등 연동된 AI 서비스 선택.
- 처리 모드: 문장 분할, 번역, 교정, 요약, 커스텀 지시.
- 프롬프트 선택: 사전 저장된 프롬프트 또는 맞춤형 프롬프트 적용.
- 대상 언어: 번역 모드 시 출력 언어 지정.
4. TextToSpeech (TTS 음성 합성)
텍스트를 자연스러운 음성 오디오로 변환합니다.
주요 설정 항목
- TTS 서비스: OpenAI TTS 또는 시스템 내장 음성 합성기.
- 음색(Voice): 원하는 보이스 캐릭터 선택.
- 속도(Speed): 재생 배속 조절 (0.5x ~ 2.0x).
5. ExportArtifact (결과물 내보내기)
파이프라인에서 생성된 텍스트, 자막, 오디오 파일을 디스크로 저장합니다.
지원 포맷
- 자막 및 텍스트:
SRT,VTT,JSON,TXT,CSV - 오디오 파일:
AAC,MP3
주요 설정 항목
- 내보내기 형식: 한 번에 여러 형식을 동시 선택 가능.
- 저장 경로 및 파일명: 출력 위치 및 명명 규칙 지정.
- 화자별 분할 저장: 화자 분리 결과에 따라 파일 분할 내보내기 지원.
