Skip to content

Pasos del Flujo de Trabajo ​

El motor de flujos de trabajo de DuRT te permite encadenar hasta 6 tipos de pasos en un único proceso automatizado: desde la captura de audio o transcripción de archivos, pasando por el procesamiento con IA, hasta la exportación final. Cada paso es modular y configurable; solo incluyes los que tu tarea requiere.

NOTE

Los pasos se ejecutan de manera secuencial. La salida de cada paso se transmite automáticamente como entrada al siguiente.


Paso 1 — RealtimeASR ​

Propósito: Capturar y transcribir audio en vivo en tiempo real, ya sea desde tu micrófono o desde el audio del sistema (cualquier aplicación que reproduzca sonido en tu Mac).

Cómo Funciona ​

DuRT utiliza ScreenCaptureKit para capturar el audio interno del sistema, permitiéndote transcribir videollamadas, clases virtuales o podcasts sin necesidad de cables ni configuraciones complejas. También admite la entrada de micrófono para dictados o reuniones presenciales.

Opciones Principales ​

OpciónDescripción
Fuente de EntradaAudio del Sistema (ScreenCaptureKit) o Micrófono
AEC (Cancelación de Eco)Elimina la retroalimentación del micrófono cuando los altavoces están activos
IdiomaSelecciona el idioma hablado para optimizar la precisión
MotorElige el motor de reconocimiento de voz deseado (Apple Speech, etc.)

Buenas Prácticas ​

TIP

Activa AEC siempre que utilices la entrada de Audio del Sistema con los altavoces encendidos para evitar transcripciones duplicadas.


Paso 2 — MediaTranscription ​

Propósito: Transcribir archivos locales de audio o video, o enlaces remotos de streaming.

Fuentes Compatibles ​

Archivos locales: MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, AVI, WEBM, entre otros.

URLs remotas:

  • Enlaces de video y listas de reproducción de plataformas web
  • URLs directas a flujos de audio/video (.mp3, .mp4, .m3u8, etc.)

Opciones Principales ​

OpciónDescripción
OrigenRuta del archivo local o URL remota
Marcas a Nivel de PalabraAsigna una marca temporal exacta a cada palabra para subtítulos de alta precisión
Diarización de HablantesIdentifica y etiqueta a los distintos interlocutores (Hablante 1, Hablante 2…)
IdiomaEspecifica el idioma hablado o utiliza la detección automática
MotorSelecciona el motor de ASR para el procesamiento

Paso 3 — SubtitleInput ​

Propósito: Importar texto o subtítulos existentes al flujo de trabajo en lugar de transcribir audio desde el principio.

Métodos de Entrada ​

MétodoDescripción
Importar archivo SRTCarga un archivo de subtítulos .srt desde tu disco
Referenciar tarea previaUtiliza la transcripción resultante de una sesión anterior en DuRT
Escribir o pegar textoIntroduce o pega texto directamente en el editor

Cuándo Utilizar Este Paso ​

Utiliza SubtitleInput cuando ya dispongas de una transcripción y solo requieras tareas posteriores con IA: por ejemplo, traducir un archivo SRT existente o aplicar corrección gramatical a un texto externo.


Paso 4 — LLMProcess ​

Propósito: Aplicar modelos de lenguaje para corregir, traducir, segmentar frases o generar resúmenes del texto transcrito.

Modos Disponibles ​

ModoQué Hace
Corrección (Proofreading)Corrige puntuación, gramática y posibles errores de transcripción
Traducción (Translation)Traduce el texto al idioma de destino seleccionado
División de Frases (Sentence Splitting)Divide bloques de texto largos en oraciones naturales y legibles
Resumen (Summary)Condensa el contenido en un resumen ejecutivo o lista de acuerdos

TIP

Puedes encadenar múltiples pasos LLMProcess. Por ejemplo: primero Corrección y después Traducción para obtener la máxima fidelidad.


Paso 5 — TextToSpeech ​

Propósito: Convertir el texto procesado o traducido en audio con voz natural.

Opciones Principales ​

OpciónDescripción
VozSelecciona entre voces predefinidas o personalizadas
VelocidadAjusta el ritmo de habla (por ejemplo, 0.8× para explicaciones, 1.2× para resúmenes rápidos)
Idioma / RegiónAsegúrate de que coincida con el idioma del texto
Proveedor TTSEscoge el motor (OpenAI TTS, voces del sistema macOS, etc.)

Paso 6 — ExportArtifact ​

Propósito: Guardar los resultados del flujo de trabajo en uno o varios formatos de archivo.

Formatos de Subtítulos ​

  • SRT (.srt): Subtítulos universales para reproductores de video y editores profesionales.
  • VTT (.vtt): Subtítulos optimizados para web (HTML5) y plataformas online.
  • TXT (.txt): Transcripción en texto limpio sin marcas de tiempo.

Formatos de Audio ​

  • AAC (.aac): Excelente calidad con tamaño de archivo reducido.
  • MP3 (.mp3): Máxima compatibilidad universal.

Released under the MIT License.