Die 6 Standard-Workflow-Schritte
Die Workflow-Engine von DuRT teilt Verarbeitungsprozesse in modulare Einzelschritte auf. Jeder Schritt übernimmt die Daten des vorherigen Schritts und verarbeitet sie weiter.
1. RealtimeASR (Echtzeit-Spracherkennung)
Transkribiert laufenden Systemton oder Mikrofoneingaben in Echtzeit.
Konfigurationsoptionen
- Audioquelle: Systemton (intern) oder Mikrofon.
- AEC (Echounterdrückung): Beseitigt Rückkopplungen von Lautsprechern.
- ASR-Engine: Apple Speech oder angebundene ASR-Dienste.
- Sprache: Festlegung der gesprochenen Sprache.
2. MediaTranscription (Medientranskription)
Verarbeitet lokale Audio-/Videodateien oder Online-Medienlinks.
Konfigurationsoptionen
- Quelle: Lokale Datei auswählen oder Stream-URL eingeben.
- Wort-Zeitstempel: Präzise Zeitcodes pro Wort generieren.
- Sprechertrennung (Diarization): Mehrere Sprecher automatisch unterscheiden.
- Sprache: Audiosprache festlegen.
3. LLMProcess (KI-Sprachmodellverarbeitung)
Übergibt den transkribierten Text an ein LLM zur Korrektur, Übersetzung, Zusammenfassung oder Satztrennung.
Konfigurationsoptionen
- LLM-Dienst: OpenAI, DeepSeek, Ollama etc.
- Modus: Sentence Splitting, Translation, Proofreading, Summary, Custom.
- Prompt: Vordefinierten oder eigenen Prompt zuweisen.
- Zielsprache: Sprache für Übersetzungsschritte.
4. TextToSpeech (Sprachsynthese)
Synthetisiert Text in natürlich klingende Sprache.
Konfigurationsoptionen
- TTS-Dienst: OpenAI TTS oder lokale Sprachsynthesizer.
- Stimme (Voice): Auswahl des Stimmcharakters.
- Geschwindigkeit: Sprechtempo (0,5x bis 2,0x).
5. ExportArtifact (Artefakt-Export)
Speichert die erzeugten Texte, Untertitel und Audiodateien auf der Festplatte.
Unterstützte Formate
- Untertitel & Text:
SRT,VTT,JSON,TXT,CSV - Audiodateien:
AAC,MP3
Konfigurationsoptionen
- Formate: Mehrfachauswahl möglich.
- Speicherort & Dateiname: Zielverzeichnis und Namensmuster.
- Nach Sprechern aufteilen: Erzeugt separate Dateien pro Sprecher.
