Corrigir Baixa Qualidade de Transcrição
Se as transcrições do Hedy estão cheias de erros — palavras perdidas, nomes próprios errados, frases embaralhadas — a causa raramente é o próprio modelo de IA. Quase sempre é uma destas: ambiente de captura de áudio ruim, microfone errado, configuração de idioma errada ou um provedor que não combina com seu caso de uso. Veja como diagnosticar e corrigir cada uma, em ordem do que mais costuma causar o problema.
Primeiro, Confirme o Básico
Antes de mudar qualquer coisa, verifique isto:
-
O Meeting/Class Language está definido para o idioma que você realmente está falando? Configurações > Perfil > Preferências de Idioma. O provedor padrão de reconhecimento de fala (Whisper) não detecta o idioma automaticamente — ele transcreve assumindo o idioma que você configurou. Se eles não baterem, todas as palavras sairão erradas. Veja A Transcrição Saiu no Idioma Errado.
-
O microfone certo está selecionado? Configurações > Sessões > Configurações do Microfone. Se você escolheu por engano um fone Bluetooth desconectado ou um microfone USB desconectado, o Hedy está capturando silêncio e a transcrição será inutilizável.
A maioria das reclamações de “baixa qualidade” vem de uma dessas duas configurações, não de algo técnico.
Melhore o Ambiente de Áudio
O Hedy não aplica supressão de ruído, controle automático de ganho ou cancelamento de eco do lado do cliente. Em um Mac que captura o áudio do sistema, o Hedy abaixa o seu microfone enquanto o outro lado está falando, para que a voz dele saindo dos seus alto-falantes não seja captada uma segunda vez. O áudio que entra na transcrição é essencialmente o que seu microfone capta. Áudio mais limpo entra = transcrição mais limpa sai.
-
Aproxime o microfone das pessoas falando. Para reuniões presenciais, um celular no meio de uma mesa pequena funciona para 4 a 5 pessoas. Para uma sala grande, 8+ pessoas ou ambientes barulhentos, use vários dispositivos ou um microfone de conferência dedicado.
-
Reduza ruído de fundo. Ventiladores, ar-condicionado, eletrodomésticos, trânsito e outras pessoas falando ao fundo degradam a precisão. Feche portas e janelas. Desligue o ventilador se possível.
-
Evite gravar alto-falantes de laptop reproduzidos por alto-falantes de laptop. Se você está tentando capturar uma reunião que está tocando nos alto-falantes do laptop (por exemplo, um vídeo no YouTube), use os recursos de captura de áudio do sistema. Veja O Hedy Não Está Capturando Outros Participantes em Reuniões Virtuais.
-
Não falem por cima uns dos outros. Fala sobreposta é o caso mais difícil para qualquer reconhecimento de fala. A diarização do Hedy tenta separar os falantes, mas, se várias pessoas falam ao mesmo tempo, a precisão cai drasticamente.
Escolha o Provedor de Reconhecimento de Fala Certo
O Hedy oferece três opções de reconhecimento de fala no dispositivo e dois provedores na nuvem. Você pode vê-los e alterá-los em Configurações > Fala e IA > Opções de Reconhecimento de Fala.
| Provedor | Tipo | Melhor para | Trade-off |
|---|---|---|---|
| Whisper (local), padrão | Local | Uso sensível à privacidade, trabalho offline, amplo suporte a idiomas | Mais lento em gráficos integrados; usa seu Idioma da reunião/aula (sem detecção automática) |
| Nemotron English Only (local) | Local (todas as plataformas nativas) | Reuniões inteiramente em inglês, com rótulos de falantes no dispositivo | Apenas inglês; não pode produzir texto em nenhum outro idioma |
| Nemotron Multilingual (local) | Local (todas as plataformas nativas) | Cerca de 40 idiomas, com rótulos de falantes no dispositivo | Usa seu Idioma da reunião/aula, a menos que você ative Auto-detect language; o idioma é uma orientação forte, então o modelo pode ocasionalmente mudar para um idioma com som parecido |
| Deepgram (requer sua própria chave de API) | Nuvem | Quem já usa a Deepgram; detecção automática multilíngue | Requer uma conta e uma chave de API da Deepgram; não é local |
| OpenAI (requer sua própria chave de API) | Nuvem | Quem já usa a OpenAI; detecção automática de idioma | Requer uma conta e uma chave de API da OpenAI; não é local |
Se você está usando o provedor padrão Whisper e a precisão não é boa o suficiente, tente o seguinte:
-
Processe o mesmo áudio com o Nemotron e compare. Escolha Nemotron Multilingual (local) para reuniões que não sejam em inglês, ou Nemotron English Only (local) para reuniões inteiramente em inglês. Em hardware Apple, o Nemotron roda na Neural Engine. Com o Nemotron Multilingual, mantenha Auto-detect language desativado para que ele use seu Idioma da reunião/aula. A detecção automática torna mais provável que o modelo escolha um idioma com som parecido (por exemplo, alemão em vez de holandês).
-
Para reuniões que alternam entre idiomas: o Whisper assume um único idioma para a sessão inteira. O Nemotron Multilingual com Auto-detect language ativado pode acompanhar o áudio. Se você já usa Deepgram ou OpenAI com sua própria chave de API, ambos também detectam o idioma automaticamente.
-
Se você precisa ficar offline ou totalmente privado e o Whisper está lento no seu hardware: veja Corrigir Transcrição Lenta no Windows (Configurações de GPU) para a correção específica de aceleração por GPU no Windows, ou mude para Nemotron, que roda em todas as plataformas nativas.
Use Custom Vocabulary para Nomes Próprios
Se o Hedy transcreve incorretamente nomes, termos técnicos, nomes de produtos ou jargão do setor, adicione-os ao Custom Vocabulary.
-
Abra Settings no Hedy
-
Vá para Personalização > Vocabulário Personalizado > Gerenciar Termos do Vocabulário
-
Insira cada termo em “Enter a custom term…” e toque em Add
-
Certifique-se de que Enable Custom Vocabulary está ativado
O Custom Vocabulary é enviado diretamente à transcrição do Whisper local como um prompt, para que o Whisper possa reconhecer e escrever corretamente os termos específicos da sua área. O Deepgram também recebe a lista: no modelo Nova-3 (o padrão), o Hedy envia seus termos ao Deepgram como keyterms. O Deepgram limita a quantidade de termos que aceita, então, em uma lista longa, apenas algumas dezenas do início da lista são enviadas. Sua lista também ajuda a etapa de limpeza da transcrição (que é executada em todos os provedores, incluindo Nemotron, Deepgram e OpenAI) a detectar e corrigir erros.
Nota: O Custom Vocabulary tem seu efeito direto mais forte com o Whisper local e com o Deepgram no Nova-3. O modelo mais antigo do Deepgram, o Nova-2, não recebe a lista, e Nemotron e OpenAI também não. Nesses casos, a etapa de limpeza ainda usa sua lista de vocabulário, mas o próprio reconhecedor de fala nunca a recebe.
Para um guia mais longo sobre como montar uma boa lista de vocabulário, veja Guia de Custom Vocabulary.
Corrija Problemas de Hardware do Microfone
Se a qualidade de áudio degrada no meio da sessão ou apenas alguns falantes aparecem, o hardware é suspeito:
-
Fones Bluetooth costumam degradar quando a bateria cai ou quando a distância aumenta. Veja AirPods e Fones Bluetooth Cortando.
-
Microfones USB podem sofrer com problemas de cabo — tente outra porta USB ou outro cabo
-
Microfones integrados de laptop são bons para uma ou duas pessoas sentadas perto do teclado. Não são ótimos para salas de conferência.
-
Celulares dentro de capas ou sob tecido podem soar abafados
Um teste rápido: grave um memorando de voz curto com o mesmo microfone no Voice Memos / Gravador / um app simples semelhante. Se essa gravação soa ruim, o problema é o microfone — não o Hedy.
Formato de Áudio Que o Hedy Usa
Para referência, o Hedy captura áudio em 16 kHz, mono, PCM de 16 bits — o padrão para reconhecimento de fala. Esse formato vai diretamente para o Whisper local e o Deepgram. Para OpenAI Realtime, o Hedy reamostra para 24 kHz antes de enviar (o formato exigido pela OpenAI). Todos eles são bons para fala, mas com perdas para música ou áudio de alta fidelidade. Não espere ótimos resultados tentando transcrever músicas.
Quando Escalar
Se você verificou tudo acima e a precisão ainda está ruim:
-
Anote o tipo específico de erro (palavras erradas, trechos ausentes, atribuição errada de falante, texto completamente inutilizável)
-
Capture uma amostra de 30 segundos em que o erro acontece
-
Entre em contato pelo widget de chat com a amostra e sua configuração de provedor/idioma
Normalmente conseguimos identificar se é um problema de ambiente, configuração ou provedor.
Artigos Relacionados
Ainda está tendo problemas? Entre em contato pelo widget de chat com seu provedor, sua configuração de Meeting/Class Language, o modelo do dispositivo e uma amostra em que o problema aparece.