Corriger une mauvaise qualité de transcription
Si les transcriptions de Hedy contiennent beaucoup d’erreurs — mots manqués, noms propres incorrects, phrases brouillées — la cause est rarement le modèle d’IA lui-même. C’est presque toujours l’un des éléments suivants : environnement de capture audio médiocre, mauvais microphone, mauvais réglage de langue, ou fournisseur qui ne correspond pas à votre cas d’utilisation. Voici comment diagnostiquer et corriger chaque cause, classée selon sa fréquence.
Commencez par vérifier les bases
Avant de changer quoi que ce soit, vérifiez ceci :
-
Le paramètre Meeting/Class Language correspond-il à la langue que vous parlez réellement ? Paramètres > Profil > Préférences linguistiques. Le fournisseur de reconnaissance vocale par défaut (Whisper) ne détecte pas automatiquement la langue — il transcrit en supposant la langue que vous avez configurée. Si les deux ne correspondent pas, chaque mot sera faux. Consultez La transcription est sortie dans la mauvaise langue.
-
Le bon microphone est-il sélectionné ? Paramètres > Sessions > Paramètres du microphone. Si vous avez choisi par erreur un casque Bluetooth débranché ou un micro USB déconnecté, Hedy capture du silence et la transcription sera inutilisable.
La plupart des plaintes de “mauvaise qualité” viennent de l’un de ces deux réglages, pas d’un problème technique.
Améliorer l’environnement audio
Hedy n’applique pas de suppression du bruit côté client, de contrôle automatique du gain ni d’annulation d’écho. Sur un Mac qui capture l’audio système, Hedy baisse toutefois votre microphone pendant que l’autre partie parle, afin que sa voix sortant de vos haut-parleurs ne soit pas captée une seconde fois. L’audio envoyé à la transcription correspond essentiellement à ce que votre microphone capte. Audio plus propre à l’entrée = transcription plus propre à la sortie.
-
Rapprochez le microphone des personnes qui parlent. Pour les réunions en personne, un téléphone placé au milieu d’une petite table fonctionne pour 4 à 5 personnes. Pour une grande salle, 8 personnes ou plus, ou un environnement bruyant, utilisez plusieurs appareils ou un micro de conférence dédié.
-
Réduisez le bruit de fond. Ventilateurs, climatisation, appareils de cuisine, circulation et autres personnes qui parlent en arrière-plan dégradent tous la précision. Fermez les portes et fenêtres. Éteignez le ventilateur si possible.
-
Évitez d’enregistrer depuis des haut-parleurs d’ordinateur portable captés par le micro du même ordinateur. Si vous essayez de capturer une réunion lue via les haut-parleurs du portable (par exemple, une vidéo YouTube), utilisez plutôt les fonctionnalités de capture de l’audio système. Consultez Hedy ne capture pas les autres participants dans les réunions virtuelles.
-
Ne parlez pas les uns par-dessus les autres. Les paroles qui se chevauchent sont le cas le plus difficile pour toute reconnaissance vocale. La diarisation de Hedy essaie de séparer les locuteurs, mais si plusieurs personnes parlent en même temps, la précision chute fortement.
Choisir le bon fournisseur de reconnaissance vocale
Hedy propose trois options de reconnaissance vocale sur l’appareil et deux fournisseurs cloud. Vous pouvez les consulter et les modifier dans Paramètres > Discours et IA > Options de reconnaissance vocale.
| Fournisseur | Type | Idéal pour | Compromis |
|---|---|---|---|
| Whisper (local), par défaut | Local | Usage sensible à la confidentialité, travail hors ligne, large prise en charge des langues | Plus lent sur les cartes graphiques intégrées ; utilise votre Langue de la réunion/du cours (pas d’auto-détection) |
| Nemotron English Only (local) | Local (toutes les plateformes avec application native) | Réunions entièrement en anglais, avec étiquettes de locuteur sur l’appareil | Anglais uniquement ; ne peut produire aucune autre langue |
| Nemotron Multilingual (local) | Local (toutes les plateformes avec application native) | Environ 40 langues, avec étiquettes de locuteur sur l’appareil | Utilise votre Langue de la réunion/du cours, sauf si vous activez Auto-detect language ; la langue est une indication forte, le modèle peut donc parfois dériver vers une langue aux sonorités proches |
| Deepgram (nécessite votre propre clé API) | Cloud | Les personnes qui utilisent déjà Deepgram ; auto-détection multilingue | Nécessite un compte Deepgram et une clé API ; pas local |
| OpenAI (nécessite votre propre clé API) | Cloud | Les personnes qui utilisent déjà OpenAI ; détection automatique de la langue | Nécessite un compte OpenAI et une clé API ; pas local |
Si vous utilisez le fournisseur par défaut Whisper et que la précision n’est pas suffisante, voici quoi essayer :
-
Faites passer le même audio par Nemotron et comparez. Choisissez Nemotron Multilingual (local) pour les réunions non anglophones, ou Nemotron English Only (local) pour les réunions entièrement en anglais. Sur le matériel Apple, Nemotron s’exécute sur le Neural Engine. Avec Nemotron Multilingual, laissez Auto-detect language désactivé pour qu’il utilise votre Langue de la réunion/du cours. L’auto-détection le rend plus susceptible de choisir une langue aux sonorités proches (par exemple l’allemand au lieu du néerlandais).
-
Pour les réunions qui changent de langue : Whisper suppose une seule langue pour toute la session. Nemotron Multilingual avec Auto-detect language activé peut suivre l’audio à la place. Si vous utilisez déjà Deepgram ou OpenAI avec votre propre clé API, les deux détectent aussi la langue automatiquement.
-
Si vous devez rester hors ligne ou entièrement privé et que Whisper est lent sur votre matériel : consultez Corriger la transcription lente sur Windows (paramètres GPU) pour le correctif d’accélération GPU spécifique à Windows, ou passez à Nemotron, qui fonctionne sur toutes les plateformes pour lesquelles Hedy propose une application native.
Utiliser le vocabulaire personnalisé pour les noms propres
Si Hedy transcrit mal les noms, termes techniques, noms de produits ou jargon métier, ajoutez-les au Custom Vocabulary.
-
Ouvrez les Settings de Hedy
-
Allez dans Personnalisation > Vocabulaire personnalisé > Gérer les termes du vocabulaire
-
Saisissez chaque terme dans “Enter a custom term…” et appuyez sur Add
-
Assurez-vous que Enable Custom Vocabulary est activé
Le Custom Vocabulary est transmis directement à la transcription Whisper locale comme prompt, afin que Whisper puisse reconnaître et orthographier correctement les termes propres à votre domaine. Deepgram le reçoit également : avec le modèle Nova-3 (par défaut), Hedy envoie vos termes à Deepgram sous forme de keyterms. Deepgram limite le nombre de termes qu’il accepte, si bien que, pour une longue liste, seules les premières dizaines de termes sont transmises. Votre liste aide aussi l’étape de nettoyage de transcription (qui s’exécute pour tous les fournisseurs, y compris Nemotron, Deepgram et OpenAI) à repérer et corriger les erreurs.
Remarque : Custom Vocabulary a son effet direct le plus fort avec Whisper local et avec Deepgram sur Nova-3. L’ancien modèle Nova-2 de Deepgram ne le reçoit pas, pas plus que Nemotron ou OpenAI. Dans ces cas, l’étape de nettoyage utilise toujours votre liste de vocabulaire, mais le moteur de reconnaissance vocale lui-même ne la voit jamais.
Pour un guide plus complet sur la création d’une bonne liste de vocabulaire, consultez le guide du vocabulaire personnalisé.
Corriger les problèmes matériels de microphone
Si la qualité audio se dégrade en pleine session ou si seules certaines personnes sont captées, le matériel est suspect :
-
Les casques Bluetooth se dégradent souvent lorsque la batterie baisse ou que la portée augmente. Consultez AirPods et casques Bluetooth qui se coupent.
-
Les microphones USB peuvent souffrir de problèmes de câble — essayez un autre port USB ou un autre câble
-
Les micros intégrés d’ordinateur portable conviennent pour une ou deux personnes assises près du clavier. Ils ne sont pas idéaux pour les salles de conférence.
-
Les téléphones dans une coque ou sous du tissu peuvent produire un son étouffé
Test rapide : enregistrez un court mémo vocal avec le même microphone dans Dictaphone / Recorder / une application simple équivalente. Si cet enregistrement sonne mal, le problème vient du micro, pas de Hedy.
Format audio utilisé par Hedy
Pour référence, Hedy capture l’audio en 16 kHz, mono, PCM 16 bits — le standard de la reconnaissance vocale. Ce format va directement vers Whisper local et Deepgram. Pour OpenAI Realtime, Hedy rééchantillonne en 24 kHz avant l’envoi (format requis par OpenAI). Tous ces formats conviennent à la parole, mais sont avec perte pour la musique ou l’audio haute fidélité. N’attendez pas d’excellents résultats en essayant de transcrire des chansons.
Quand escalader
Si vous avez vérifié tout ce qui précède et que la précision reste mauvaise :
-
Notez le type précis d’erreur (mauvais mots, sections manquées, mauvaise attribution des locuteurs, texte complètement incohérent)
-
Capturez un échantillon de 30 secondes où l’erreur se produit
-
Contactez-nous via le widget de chat avec l’échantillon et votre configuration fournisseur/langue
Nous pouvons généralement identifier s’il s’agit d’un problème d’environnement, de configuration ou de fournisseur.
Articles connexes
Vous avez toujours des problèmes ? Contactez-nous via le widget de chat avec votre fournisseur, votre réglage Meeting/Class Language, le modèle de votre appareil et un échantillon où le problème est visible.