Saltar al contenido

Corregir la mala calidad de transcripción

Si las transcripciones de Hedy están llenas de errores — palabras omitidas, nombres propios incorrectos, frases confusas — la causa rara vez es el propio modelo de IA. Casi siempre es una de estas: un entorno de captura de audio deficiente, el micrófono equivocado, el idioma equivocado o un proveedor que no encaja con su caso de uso. Aquí tiene cómo diagnosticar y corregir cada causa, ordenadas según la frecuencia con que aparecen.

Primero, confirme lo básico

Antes de cambiar nada, revise esto:

  • ¿Meeting/Class Language está configurado en el idioma que realmente está hablando? Configuración > Perfil > Preferencias de idioma. El proveedor de reconocimiento de voz predeterminado (Whisper) no detecta el idioma automáticamente: transcribe suponiendo el idioma que usted configuró. Si no coinciden, todas las palabras saldrán mal. Consulte La transcripción salió en el idioma equivocado.

  • ¿Está seleccionado el micrófono correcto? Configuración > Sesiones > Configuración del micrófono. Si eligió por accidente un auricular Bluetooth desconectado o un micrófono USB que no está conectado, Hedy está capturando silencio y la transcripción será inutilizable.

La mayoría de las quejas de “baja calidad” son una de estas dos configuraciones, no algo técnico.

Mejore el entorno de audio

Hedy no aplica supresión de ruido, control automático de ganancia ni cancelación de eco del lado del cliente. En un Mac que captura el audio del sistema, Hedy sí baja su micrófono mientras habla la otra parte, para que su voz no se capte por segunda vez a través de sus altavoces. El audio que entra a la transcripción es, en esencia, lo que capta su micrófono. Audio más limpio entra = transcripción más limpia sale.

  • Acerque el micrófono a quienes hablan. Para reuniones presenciales, un teléfono colocado en el centro de una mesa pequeña funciona para 4-5 personas. Para una sala grande, 8 o más personas, o entornos ruidosos, use varios dispositivos o un micrófono de conferencia dedicado.

  • Reduzca el ruido de fondo. Ventiladores, aire acondicionado, electrodomésticos de cocina, tráfico y otras personas hablando de fondo degradan la precisión. Cierre puertas y ventanas. Apague el ventilador si es posible.

  • Evite grabar altavoces de portátil reproducidos por altavoces de portátil. Si está intentando capturar una reunión que suena por los altavoces del portátil (por ejemplo, un video de YouTube), use las funciones de captura de audio del sistema. Consulte Hedy no captura a otros participantes en reuniones virtuales.

  • No hablen unos encima de otros. El habla superpuesta es el caso más difícil para cualquier reconocimiento de voz. La diarización de Hedy intenta separar hablantes, pero si varias personas hablan a la vez, la precisión cae mucho.

Elija el proveedor de reconocimiento de voz correcto

Hedy ofrece tres opciones de reconocimiento de voz en el dispositivo y dos proveedores en la nube. Puede verlos y cambiarlos en Configuración > Voz e IA > Opciones de Reconocimiento de Voz.

ProveedorTipoIdeal paraCompromiso
Whisper (local), predeterminadoLocalUso sensible a la privacidad, trabajo sin conexión, amplia compatibilidad de idiomasMás lento en gráficos integrados; usa su Idioma de la reunión/clase (sin detección automática)
Nemotron English Only (local)Local (todas las plataformas con app nativa)Reuniones íntegramente en inglés, con etiquetas de hablante en el dispositivoSolo inglés; no puede generar texto en ningún otro idioma
Nemotron Multilingual (local)Local (todas las plataformas con app nativa)Unos 40 idiomas, con etiquetas de hablante en el dispositivoUsa su Idioma de la reunión/clase salvo que active Auto-detect language; el idioma es una indicación firme, así que el modelo puede cambiar ocasionalmente a un idioma que suene parecido
Deepgram (requiere su propia clave API)NubeQuienes ya usan Deepgram; detección automática multilingüeRequiere una cuenta y una clave API de Deepgram; no es local
OpenAI (requiere su propia clave API)NubeQuienes ya usan OpenAI; detección automática de idiomaRequiere una cuenta y una clave API de OpenAI; no es local

Si está usando el proveedor predeterminado Whisper y la precisión no es suficiente, pruebe lo siguiente:

  • Procese el mismo audio con Nemotron y compare. Elija Nemotron Multilingual (local) para reuniones que no sean en inglés, o Nemotron English Only (local) para reuniones íntegramente en inglés. En hardware Apple, Nemotron se ejecuta en el Neural Engine. Con Nemotron Multilingual, mantenga Auto-detect language desactivado para que use su Idioma de la reunión/clase. La detección automática hace más probable que el modelo se decante por un idioma que suene parecido (por ejemplo, alemán en lugar de neerlandés).

  • Para reuniones que cambian de idioma: Whisper asume un solo idioma para toda la sesión. Nemotron Multilingual con Auto-detect language activado puede seguir el audio. Si ya usa Deepgram u OpenAI con su propia clave API, ambos también detectan el idioma automáticamente.

  • Si necesita permanecer sin conexión o con privacidad total y Whisper es lento en su hardware: consulte Solucionar transcripción lenta en Windows (configuración de GPU) para la corrección específica de aceleración GPU en Windows, o pase a Nemotron, que funciona en todas las plataformas con app nativa.

Use Custom Vocabulary para nombres propios

Si Hedy transcribe mal nombres, términos técnicos, nombres de productos o jerga de su sector, agréguelos a Custom Vocabulary.

  1. Abra Settings en Hedy

  2. Vaya a Personalización > Vocabulario personalizado > Administrar términos del vocabulario

  3. Introduzca cada término en “Enter a custom term…” y toque Add

  4. Asegúrese de que Enable Custom Vocabulary esté activado

Custom Vocabulary se integra directamente en la transcripción de Whisper local como prompt, para que Whisper pueda reconocer y escribir correctamente los términos específicos de su ámbito. Deepgram también recibe la lista: en el modelo Nova-3 (el predeterminado), Hedy envía sus términos a Deepgram como keyterms. Deepgram limita el número de términos que acepta, por lo que, de una lista larga, solo pasan las primeras decenas. Su lista también ayuda al paso de limpieza de la transcripción (que se ejecuta con todos los proveedores, incluidos Nemotron, Deepgram y OpenAI) a detectar y corregir errores.

Nota: Custom Vocabulary tiene su efecto directo más fuerte con Whisper local y con Deepgram en Nova-3. El modelo anterior Nova-2 de Deepgram no recibe la lista, y tampoco la reciben Nemotron ni OpenAI. En esos casos, el paso de limpieza sigue utilizando su lista de vocabulario, pero el propio reconocedor de voz nunca la ve.

Para una guía más extensa sobre cómo crear una buena lista de vocabulario, consulte Guía de Custom Vocabulary.

Corrija problemas de hardware del micrófono

Si la calidad de audio empeora a mitad de sesión o solo se escuchan algunos hablantes, el hardware es sospechoso:

  • Los auriculares Bluetooth suelen degradarse cuando baja la batería o aumenta la distancia. Consulte AirPods y auriculares Bluetooth se cortan.

  • Los micrófonos USB pueden sufrir problemas de cable: pruebe otro puerto USB u otro cable

  • Los micrófonos integrados de portátiles están bien para una o dos personas sentadas cerca del teclado. No son ideales para salas de conferencias.

  • Teléfonos dentro de fundas o bajo tela pueden sonar apagados

Prueba rápida: grabe una nota de voz corta con el mismo micrófono en Voice Memos / Recorder / una app sencilla similar. Si esa grabación suena mal, el problema es el micrófono, no Hedy.

Formato de audio que usa Hedy

Como referencia, Hedy captura audio a 16 kHz, mono, PCM de 16 bits: el estándar para reconocimiento de voz. Este formato va directamente a Whisper local y Deepgram. Para OpenAI Realtime, Hedy remuestrea a 24 kHz antes de enviar (el formato requerido por OpenAI). Todos estos formatos son adecuados para voz, pero con pérdida para música o audio de alta fidelidad. No espere grandes resultados intentando transcribir canciones.

Cuándo escalar

Si revisó todo lo anterior y la precisión sigue siendo baja:

  1. Anote el tipo específico de error (palabras incorrectas, secciones omitidas, atribución incorrecta de hablantes, texto totalmente incoherente)

  2. Capture una muestra de 30 segundos donde ocurra el error

  3. Contacte con nosotros a través del widget de chat con la muestra y su configuración de proveedor/idioma

Normalmente podemos identificar si el problema es ambiental, de configuración o del proveedor.

Artículos relacionados

¿Sigue teniendo problemas? Contacte con nosotros a través del widget de chat con su proveedor, su configuración de Meeting/Class Language, el modelo de su dispositivo y una muestra donde el problema sea visible.