Metodología

Cómo Musavox transcribe música

Musavox utiliza un pipeline de IA multi-etapa diseñado específicamente para música — no para voz hablada, podcasts ni reuniones. Cada etapa está construida para manejar los desafíos que hacen la transcripción musical fundamentalmente diferente de la palabra hablada: vocales superpuestas, ad-libs, instrumentación pesada, jerga regional y alternancia de código bilingüe.

Resumen del Pipeline

01

Ingestión de Audio

02

Aislamiento Vocal

03

Reconocimiento de Voz

04

Mejora Contextual

05

Puntuación de Calidad

Etapa 1 — Aislamiento Vocal

Antes de cualquier transcripción, el audio se procesa a través de un modelo de separación de fuentes que aísla la pista vocal de la mezcla instrumental. Este paso es crítico — los modelos estándar de reconocimiento de voz están entrenados con grabaciones de voz limpia y fallan dramáticamente al procesar mezclas musicales completas con bajo, batería y efectos.

El modelo de aislamiento separa el audio en stems (vocales, batería, bajo, otros), reteniendo solo la pista vocal para el procesamiento posterior. El aislamiento vocal eleva materialmente el piso de transcripción en tracks con 808s pesados, autotune y producción vocal en capas común en la música urbana latina; el post-procesamiento consciente de la región luego refina la salida para el dialecto y el género.

Etapa 2 — Reconocimiento de Voz

La pista vocal aislada se procesa mediante un modelo de reconocimiento automático de voz (ASR) a gran escala optimizado para audio multilingüe. El modelo produce:

  • Transcripción completa del texto de la interpretación vocal
  • Marcas de tiempo a nivel de palabra (inicio y fin de cada palabra)
  • Detección de idioma (inglés, español o mixto)

Las marcas de tiempo a nivel de palabra permiten la exportación sincronizada de letras (formato LRC) y se preservan a través de todas las etapas de procesamiento posteriores.

Etapa 3 — Mejora Contextual

La salida cruda del ASR es precisa pero carece de contexto musical. Un modelo de lenguaje grande post-procesa la transcripción con inteligencia específica del dominio:

Corrección de dialecto regional

Un léxico curado de más de 302 términos a través de ocho variedades regionales completamente curadas: español puertorriqueño, mexicano, colombiano, dominicano, argentino, chileno, venezolano y U.S. Latin. La cobertura se expande a medida que nuevos territorios entran a la plataforma. El modelo corrige errores del ASR usando contexto lingüístico — por ejemplo, distinguiendo "jevo" (jerga PR para pareja) de "huevo", o reconociendo "corillo" como un grupo social en lugar de un error de transcripción.

Detección de secciones

Identifica límites de verso, pre-coro, coro, puente y outro basado en patrones de repetición lírica y señales estructurales.

Clasificación de ad-libs

Separa ad-libs (exclamaciones, efectos vocales, tags de productor) de las letras principales. Cada ad-lib se etiqueta con su tipo y marca de tiempo. Esto importa para publicación: los ad-libs no son letras protegibles por derechos de autor.

Detección de cambio de código

Cuando un artista cambia de idioma a mitad de verso (común en música latina y hip-hop), el sistema marca el punto de transición. Esto afecta los metadatos de registro de derechos de autor y los flujos de traducción.

Identificación de tags de productor

Reconoce y etiqueta tags de productor que aparecen al inicio o durante los tracks, manteniéndolos separados del contenido lírico.

Etapa 4 — Puntuación de Calidad

Cada línea de la transcripción recibe una puntuación de confianza de 0.0 a 1.0. Las líneas que puntuan por debajo de 0.7 se marcan para revisión humana. El editor las muestra como líneas resaltadas con sugerencias alternativas — la segunda y tercera mejor interpretación del modelo.

Este sistema de puntuación permite que un revisor se enfoque solo en líneas inciertas en lugar de leer toda la transcripción, reduciendo materialmente el tiempo de revisión por track.

Etapa 5 — Motor de Dialecto Adaptativo

El sistema mejora con el tiempo. Cuando un usuario corrige una transcripción en el editor, la corrección se registra con su contexto: la salida original del ASR, el texto corregido, el idioma y la variante regional.

Fase 1 (actual)

Glosario curado estático integrado en el prompt de mejora.

Fase 2 (planificada)

Las correcciones se acumulan como datos de entrenamiento, permitiendo mejoras de precisión específicas por región.

Fase 3 (futuro)

Modelo personalizado ajustado con correcciones acumuladas — un dataset propietario que ningún competidor puede replicar.

Formatos de Exportación

Las transcripciones procesadas se pueden exportar en formatos estándar de la industria:

  • TXTTexto plano con marcadores de sección. Compatibilidad universal.
  • LRCLetras sincronizadas con marcas de tiempo. Usado por DSPs, sistemas de karaoke y reproductores de música para visualización de letras en tiempo real.
  • SRT (planificado)Formato de subtítulos para videos musicales.
  • JSON (planificado)Datos estructurados para consumidores de API e integraciones.

Tiempo de Procesamiento

Un track típico de 3.5 minutos completa el procesamiento en 30–90 segundos. La visibilidad del pipeline en tiempo real muestra cada etapa mientras progresa: subiendo, aislando vocales, transcribiendo, mejorando, completo.

Deduplicación

Si el mismo archivo de audio se sube dos veces (detectado mediante comparación de hash calculada antes de la subida), el sistema devuelve la transcripción existente instantáneamente sin costo y sin tiempo de procesamiento.

¿Preguntas sobre nuestra metodología? Contáctanos en support@musavox.io