Schlechte Transkriptionsqualität beheben
Wenn Hedys Transkripte voller Fehler sind - fehlende Wörter, falsche Eigennamen, unverständliche Phrasen - liegt die Ursache selten am KI-Modell selbst. Fast immer ist es eine von vier Ursachen: schlechte Audioaufnahmeumgebung, falsches Mikrofon, falsche Spracheinstellung oder ein Anbieter, der nicht zu Ihrem Anwendungsfall passt. So diagnostizieren und beheben Sie jede Ursache, geordnet danach, wie oft sie der Auslöser ist.
Zuerst die Grundlagen prüfen
Bevor Sie etwas ändern, prüfen Sie:
-
Ist Meeting/Class Language auf die Sprache gesetzt, die Sie tatsächlich sprechen? Einstellungen > Profil > Spracheinstellungen. Der Standardanbieter für Spracherkennung (Whisper) erkennt die Sprache nicht automatisch - er transkribiert unter der Annahme, dass die konfigurierte Sprache gesprochen wird. Wenn das nicht passt, ist jedes Wort falsch. Siehe Transkript wurde in der falschen Sprache erstellt.
-
Ist das richtige Mikrofon ausgewählt? Einstellungen > Sitzungen > Mikrofoneinstellungen. Wenn Sie versehentlich ein Bluetooth-Headset ausgewählt haben, das nicht verbunden ist, oder ein getrenntes USB-Mikrofon, erfasst Hedy Stille und das Transkript ist unbrauchbar.
Die meisten Beschwerden über “niedrige Qualität” sind eine dieser beiden Einstellungen, nichts Technisches.
Audioumgebung verbessern
Hedy wendet keine clientseitige Rauschunterdrückung, automatische Verstärkungsregelung oder Echokompensation an. Auf einem Mac, der das Systemaudio mit aufnimmt, senkt Hedy allerdings die Lautstärke Ihres Mikrofons, während die Gegenseite spricht, damit deren Stimme aus Ihren Lautsprechern nicht ein zweites Mal erfasst wird. Das Audio, das in die Transkription geht, ist im Wesentlichen das, was Ihr Mikrofon aufnimmt. Saubereres Audio hinein = saubereres Transkript heraus.
-
Bringen Sie das Mikrofon näher an die Sprechenden. Bei Präsenzmeetings funktioniert ein Telefon in der Mitte eines kleinen Tisches für 4-5 Personen. Für einen großen Raum, 8+ Personen oder laute Umgebungen nutzen Sie mehrere Geräte oder ein dediziertes Konferenzmikrofon.
-
Reduzieren Sie Hintergrundgeräusche. Ventilatoren, Klimaanlagen, Küchengeräte, Verkehr und andere Personen im Hintergrund verschlechtern die Genauigkeit. Schließen Sie Türen und Fenster. Schalten Sie den Ventilator aus, wenn möglich.
-
Vermeiden Sie, Laptop-Lautsprecher über ein Laptop-Mikrofon aufzunehmen. Wenn Sie ein Meeting erfassen möchten, das über Laptop-Lautsprecher abgespielt wird (z. B. ein YouTube-Video), nutzen Sie stattdessen die Systemaudio-Erfassung. Siehe Hedy erfasst andere Teilnehmende in virtuellen Meetings nicht.
-
Sprechen Sie nicht durcheinander. Überlappende Sprache ist der schwierigste Fall für jede Spracherkennung. Hedys Diarization versucht, Sprecher zu trennen, aber wenn mehrere Personen gleichzeitig sprechen, fällt die Genauigkeit stark ab.
Den richtigen Spracherkennungsanbieter wählen
Hedy bietet drei Spracherkennungsoptionen auf dem Gerät und zwei Cloud-Anbieter. Sie sehen und ändern diese unter Einstellungen > Sprache & KI > Spracherkennungsoptionen.
| Anbieter | Typ | Am besten für | Kompromiss |
|---|---|---|---|
| Whisper (local), Standard | Lokal | Datenschutzsensible Nutzung, Offline-Arbeit, breite Sprachunterstützung | Langsamer auf integrierter Grafik; nutzt Ihre Meeting-/Unterrichtssprache (keine Auto-Erkennung) |
| Nemotron English Only (local) | Lokal (jede native Plattform) | Meetings, die vollständig auf Englisch stattfinden, mit Sprecherlabels auf dem Gerät | Nur Englisch; kann keine andere Sprache ausgeben |
| Nemotron Multilingual (local) | Lokal (jede native Plattform) | Rund 40 Sprachen, mit Sprecherlabels auf dem Gerät | Nutzt Ihre Meeting-/Unterrichtssprache, sofern Sie Auto-detect language nicht aktivieren; die Sprache ist ein deutlicher Hinweis, daher kann das Modell gelegentlich zu einer ähnlich klingenden Sprache wechseln |
| Deepgram (erfordert eigenen API-Key) | Cloud | Wer Deepgram bereits nutzt; mehrsprachige Auto-Erkennung | Erfordert ein Deepgram-Konto und einen API-Key; nicht lokal |
| OpenAI (erfordert eigenen API-Key) | Cloud | Wer OpenAI bereits nutzt; automatische Spracherkennung | Erfordert ein OpenAI-Konto und einen API-Key; nicht lokal |
Wenn Sie den Standardanbieter Whisper verwenden und die Genauigkeit nicht gut genug ist, probieren Sie Folgendes:
-
Lassen Sie dasselbe Audio durch Nemotron laufen und vergleichen Sie. Wählen Sie Nemotron Multilingual (local) für nicht-englische Meetings oder Nemotron English Only (local) für Meetings, die vollständig auf Englisch stattfinden. Auf Apple-Hardware läuft Nemotron auf der Neural Engine. Lassen Sie bei Nemotron Multilingual Auto-detect language deaktiviert, damit Ihre Meeting-/Unterrichtssprache verwendet wird. Mit Auto-Erkennung landet das Modell eher bei einer ähnlich klingenden Sprache (zum Beispiel Deutsch statt Niederländisch).
-
Für Meetings, in denen die Sprache wechselt: Whisper geht für die gesamte Sitzung von einer einzigen Sprache aus. Nemotron Multilingual mit aktiviertem Auto-detect language kann stattdessen dem Audio folgen. Wenn Sie Deepgram oder OpenAI bereits mit Ihrem eigenen API-Key nutzen, erkennen beide die Sprache ebenfalls automatisch.
-
Wenn Sie offline oder vollständig privat bleiben müssen und Whisper auf Ihrer Hardware langsam ist: Lesen Sie Langsame Transkription unter Windows beheben (GPU-Einstellungen) für die Windows-spezifische GPU-Beschleunigung, oder wechseln Sie zu Nemotron, das auf jeder nativen Plattform läuft.
Custom Vocabulary für Eigennamen verwenden
Wenn Hedy Namen, technische Begriffe, Produktnamen oder Branchenjargon falsch transkribiert, fügen Sie sie zu Custom Vocabulary hinzu.
-
Öffnen Sie Hedys Settings
-
Gehen Sie zu Personalisierung > Benutzerdefiniertes Vokabular > Vokabelterme verwalten
-
Geben Sie jeden Begriff in “Enter a custom term…” ein und tippen Sie auf Add
-
Stellen Sie sicher, dass Enable Custom Vocabulary aktiviert ist
Custom Vocabulary fließt als Prompt direkt in die lokale Whisper-Transkription ein, damit Whisper Ihre domänenspezifischen Begriffe erkennen und korrekt schreiben kann. Auch Deepgram erhält die Liste: Beim Modell Nova-3 (der Standardeinstellung) sendet Hedy Ihre Begriffe als keyterms an Deepgram. Deepgram begrenzt die Anzahl der akzeptierten Begriffe, sodass bei einer langen Liste nur die ersten paar Dutzend übermittelt werden. Ihre Liste hilft außerdem dem Bereinigungsschritt für das Transkript (der bei allen Anbietern läuft, einschließlich Nemotron, Deepgram und OpenAI), Fehler zu erkennen und zu beheben.
Hinweis: Custom Vocabulary hat seine stärkste direkte Wirkung bei lokalem Whisper und bei Deepgram mit Nova-3. Das ältere Modell Nova-2 von Deepgram erhält die Liste nicht, ebenso wenig wie Nemotron oder OpenAI. Bei diesen nutzt der Bereinigungsschritt Ihre Vokabelliste weiterhin, der Spracherkenner selbst sieht sie jedoch nie.
Eine längere Anleitung zum Aufbau einer guten Vokabelliste finden Sie im Custom Vocabulary Guide.
Mikrofon-Hardwareprobleme beheben
Wenn die Audioqualität mitten in der Sitzung schlechter wird oder nur bestimmte Sprecher durchkommen, ist die Hardware verdächtig:
-
Bluetooth-Headsets verschlechtern sich oft, wenn der Akku sinkt oder die Reichweite größer wird. Siehe AirPods und Bluetooth-Kopfhörer brechen ab.
-
USB-Mikrofone können unter Kabelproblemen leiden - probieren Sie einen anderen USB-Port oder ein anderes Kabel
-
Eingebaute Laptop-Mikrofone sind für ein oder zwei Personen nahe an der Tastatur in Ordnung. Für Konferenzräume sind sie nicht ideal.
-
Telefone in Hülle oder unter Stoff können dumpf klingen
Ein schneller Test: Nehmen Sie eine kurze Sprachnotiz mit demselben Mikrofon in Sprachmemos / Recorder / einer ähnlichen einfachen App auf. Wenn diese Aufnahme schlecht klingt, liegt das Problem am Mikrofon - nicht an Hedy.
Audioformat, das Hedy verwendet
Zur Einordnung: Hedy erfasst Audio mit 16 kHz, mono, 16-bit PCM - dem Standard für Spracherkennung. Dieses Format geht direkt an lokales Whisper und Deepgram. Für OpenAI Realtime sampelt Hedy vor dem Senden auf 24 kHz um (OpenAIs erforderliches Format). All diese Formate sind für Sprache geeignet, aber verlustbehaftet für Musik oder Hi-Fi-Audio. Erwarten Sie keine guten Ergebnisse beim Transkribieren von Liedern.
Wann Sie eskalieren sollten
Wenn Sie alles oben Genannte geprüft haben und die Genauigkeit weiterhin schlecht ist:
-
Notieren Sie die genaue Fehlerart (falsche Wörter, fehlende Abschnitte, falsche Sprecherzuordnung, völlig unbrauchbar)
-
Erfassen Sie eine 30-sekündige Probe, in der der Fehler auftritt
-
Kontaktieren Sie uns über das Chat-Widget mit der Probe und Ihrer Anbieter-/Spracheinstellung
Meist können wir erkennen, ob es ein Umgebungs-, Konfigurations- oder Anbieterproblem ist.
Verwandte Artikel
Weiterhin Probleme? Kontaktieren Sie uns über das Chat-Widget mit Ihrem Anbieter, Ihrer Meeting/Class Language-Einstellung, Ihrem Gerätemodell und einer Probe, in der das Problem sichtbar ist.