Saltar al contenido principal

Reconocimiento de voz con IA: hablantes, eventos de audio y puntuación

· 3 min de lectura

El reconocimiento de voz de QuantumSubtitle convierte el habla de archivos de audio y vídeo en texto para subtítulos con marcas de tiempo. Las nuevas opciones permiten controlar quién dijo cada línea, qué sonidos no verbales aparecen en la transcripción y si se muestra la puntuación.

Nuevas opciones de reconocimiento de voz​

Al crear una tarea, puedes configurar estas opciones según tus necesidades:

  • Reconocimiento de hablantes: separa las distintas voces y etiqueta sus fragmentos de subtítulos. Después puedes cambiar los nombres de las etiquetas en el editor.
  • Eventos de audio: incluye sonidos no verbales detectados, como risas, aplausos y sonidos de fondo. Puedes filtrar o editar sus segmentos en el visor de subtítulos.
  • Control de puntuación: elige si el texto de los subtítulos muestra signos de puntuación. La preferencia también se aplica al copiar o exportar el texto.

El reconocimiento de hablantes distingue voces y asigna etiquetas; no identifica automáticamente los nombres reales de las personas. Revisa la transcripción y cambia las etiquetas si lo necesitas.

Cómo usar estas opciones​

  1. Abre Reconocimiento de voz y sube un archivo de audio o vídeo.
  2. Elige el idioma del audio o deja la detección automática si no lo sabes.
  3. Activa el reconocimiento de hablantes o los eventos de audio según necesites y decide si quieres incluir la puntuación.
  4. Inicia el reconocimiento y revisa la transcripción con marcas de tiempo en el editor.
  5. Corrige el texto, cambia los nombres de los hablantes y filtra o edita los eventos antes de descargar un archivo SRT o copiar el texto.

Estas opciones resultan útiles en entrevistas, pódcast, clases, seminarios web y otras grabaciones en las que conviene distinguir varias voces o mostrar sonidos importantes además del diálogo. Una buena calidad de audio y una revisión final ayudan a corregir nombres, voces superpuestas y errores de reconocimiento.

Preguntas frecuentes​

¿Qué es el reconocimiento o la diarización de hablantes?​

Separa las voces de una grabación y asigna etiquetas a los segmentos de subtítulos correspondientes. Puedes cambiar las etiquetas en el editor.

¿Qué eventos de audio puede detectar?​

Puede incluir sonidos no verbales como risas, aplausos y sonidos de fondo. Puedes filtrar o editar esos segmentos en el visor de subtítulos.

¿Puedo quitar la puntuación de los subtítulos?​

Sí. Activa o desactiva la visualización de la puntuación. La opción elegida se aplica al copiar o exportar el texto.

¿Puedo exportar la transcripción como SRT?​

Sí. Revisa el resultado y descarga un archivo de subtítulos SRT.

Prueba el reconocimiento de voz con IA, consulta la guía de reconocimiento de voz o visita la introducción a esta función.