Skip to content

Die 6 Standard-Workflow-Schritte ​

Die Workflow-Engine von DuRT teilt Verarbeitungsprozesse in modulare Einzelschritte auf. Jeder Schritt übernimmt die Daten des vorherigen Schritts und verarbeitet sie weiter.


1. RealtimeASR (Echtzeit-Spracherkennung) ​

Transkribiert laufenden Systemton oder Mikrofoneingaben in Echtzeit.

Konfigurationsoptionen ​

  • Audioquelle: Systemton (intern) oder Mikrofon.
  • AEC (Echounterdrückung): Beseitigt Rückkopplungen von Lautsprechern.
  • ASR-Engine: Apple Speech oder angebundene ASR-Dienste.
  • Sprache: Festlegung der gesprochenen Sprache.

2. MediaTranscription (Medientranskription) ​

Verarbeitet lokale Audio-/Videodateien oder Online-Medienlinks.

Konfigurationsoptionen ​

  • Quelle: Lokale Datei auswählen oder Stream-URL eingeben.
  • Wort-Zeitstempel: Präzise Zeitcodes pro Wort generieren.
  • Sprechertrennung (Diarization): Mehrere Sprecher automatisch unterscheiden.
  • Sprache: Audiosprache festlegen.

3. LLMProcess (KI-Sprachmodellverarbeitung) ​

Übergibt den transkribierten Text an ein LLM zur Korrektur, Übersetzung, Zusammenfassung oder Satztrennung.

Konfigurationsoptionen ​

  • LLM-Dienst: OpenAI, DeepSeek, Ollama etc.
  • Modus: Sentence Splitting, Translation, Proofreading, Summary, Custom.
  • Prompt: Vordefinierten oder eigenen Prompt zuweisen.
  • Zielsprache: Sprache für Übersetzungsschritte.

4. TextToSpeech (Sprachsynthese) ​

Synthetisiert Text in natürlich klingende Sprache.

Konfigurationsoptionen ​

  • TTS-Dienst: OpenAI TTS oder lokale Sprachsynthesizer.
  • Stimme (Voice): Auswahl des Stimmcharakters.
  • Geschwindigkeit: Sprechtempo (0,5x bis 2,0x).

5. ExportArtifact (Artefakt-Export) ​

Speichert die erzeugten Texte, Untertitel und Audiodateien auf der Festplatte.

Unterstützte Formate ​

  • Untertitel & Text: SRT, VTT, JSON, TXT, CSV
  • Audiodateien: AAC, MP3

Konfigurationsoptionen ​

  • Formate: Mehrfachauswahl möglich.
  • Speicherort & Dateiname: Zielverzeichnis und Namensmuster.
  • Nach Sprechern aufteilen: Erzeugt separate Dateien pro Sprecher.

Released under the MIT License.