Schlechte Transkriptionsqualität beheben
Wenn Hedys Transkripte voller Fehler sind - fehlende Wörter, falsche Eigennamen, unverständliche Phrasen - liegt die Ursache selten am KI-Modell selbst. Fast immer ist es eine von vier Ursachen: schlechte Audioaufnahmeumgebung, falsches Mikrofon, falsche Spracheinstellung oder ein Anbieter, der nicht zu Ihrem Anwendungsfall passt. So diagnostizieren und beheben Sie jede Ursache, geordnet danach, wie oft sie der Auslöser ist.
Zuerst die Grundlagen prüfen
Bevor Sie etwas ändern, prüfen Sie:
-
Ist Meeting/Class Language auf die Sprache gesetzt, die Sie tatsächlich sprechen? Einstellungen > Profil > Spracheinstellungen. Der Standardanbieter für Spracherkennung (Whisper) erkennt die Sprache nicht automatisch - er transkribiert unter der Annahme, dass die konfigurierte Sprache gesprochen wird. Wenn das nicht passt, ist jedes Wort falsch. Siehe Transkript wurde in der falschen Sprache erstellt.
-
Ist das richtige Mikrofon ausgewählt? Einstellungen > Sitzungen > Mikrofoneinstellungen. Wenn Sie versehentlich ein Bluetooth-Headset ausgewählt haben, das nicht verbunden ist, oder ein getrenntes USB-Mikrofon, erfasst Hedy Stille und das Transkript ist unbrauchbar.
Die meisten Beschwerden über “niedrige Qualität” sind eine dieser beiden Einstellungen, nichts Technisches.
Audioumgebung verbessern
Hedy wendet keine clientseitige Rauschunterdrückung, automatische Verstärkungsregelung oder Echokompensation an. Das Audio, das in die Transkription geht, ist im Wesentlichen das, was Ihr Mikrofon aufnimmt. Saubereres Audio hinein = saubereres Transkript heraus.
-
Bringen Sie das Mikrofon näher an die Sprechenden. Bei Präsenzmeetings funktioniert ein Telefon in der Mitte eines kleinen Tisches für 4-5 Personen. Für einen großen Raum, 8+ Personen oder laute Umgebungen nutzen Sie mehrere Geräte oder ein dediziertes Konferenzmikrofon.
-
Reduzieren Sie Hintergrundgeräusche. Ventilatoren, Klimaanlagen, Küchengeräte, Verkehr und andere Personen im Hintergrund verschlechtern die Genauigkeit. Schließen Sie Türen und Fenster. Schalten Sie den Ventilator aus, wenn möglich.
-
Vermeiden Sie, Laptop-Lautsprecher über ein Laptop-Mikrofon aufzunehmen. Wenn Sie ein Meeting erfassen möchten, das über Laptop-Lautsprecher abgespielt wird (z. B. ein YouTube-Video), nutzen Sie stattdessen die Systemaudio-Erfassung. Siehe Hedy erfasst andere Teilnehmende in virtuellen Meetings nicht.
-
Sprechen Sie nicht durcheinander. Überlappende Sprache ist der schwierigste Fall für jede Spracherkennung. Hedys Diarization versucht, Sprecher zu trennen, aber wenn mehrere Personen gleichzeitig sprechen, fällt die Genauigkeit stark ab.
Den richtigen Spracherkennungsanbieter wählen
Hedy unterstützt vier Spracherkennungsanbieter - zwei lokal, zwei in der Cloud. Sie sehen und ändern diese unter Einstellungen > Sprache & KI > Spracherkennungsoptionen.
| Anbieter | Typ | Am besten für | Kompromiss |
|---|---|---|---|
| Whisper (local) - Standard | Lokal | Datenschutzsensible Nutzung, Offline-Arbeit, breite Sprachunterstützung | Langsamer als Cloud auf integrierter Grafik; nutzt die konfigurierte Meeting-Sprache (keine Auto-Erkennung) |
| Nemotron (local) [Beta] | Lokal (jede native Plattform) | Schnellere Echtzeit-Transkription mit Sprecherlabels auf dem Gerät; bietet einen English Only-Modus und einen Multilingual-Modus | Beta; erkennt die Sprache aus dem Audio statt aus Ihrer Meeting-Spracheinstellung |
| Deepgram (erfordert eigenen API-Key) | Cloud | Cloud-Genauigkeit, mehrsprachige Auto-Erkennung, große Meetings | Erfordert Deepgram-Konto und API-Key; nicht lokal |
| OpenAI (erfordert eigenen API-Key) | Cloud | Cloud-Genauigkeit, automatische Spracherkennung | Erfordert OpenAI-Konto und API-Key; nicht lokal |
Wenn Sie den Standardanbieter Whisper verwenden und die Genauigkeit nicht gut genug ist, probieren Sie je nach Situation diese Schritte in dieser Reihenfolge:
-
Auf jedem Gerät, auf dem eine native Hedy-App läuft: Probieren Sie Nemotron. Es ist für Echtzeit-Transkription oft schneller und genauer als Whisper und läuft auf Apple-Hardware auf der Neural Engine. Es ist weiterhin Beta - es erkennt die Sprache aus dem Audio. Achten Sie daher auf Verwechslungen “ähnlicher Sprachen” (z. B. Deutsch vs. Niederländisch). Für nicht-englische Meetings verwenden Sie den Multilingual-Modus.
-
Für mehrsprachige Meetings, akzentuierte Sprache oder laute Umgebungen: Probieren Sie Deepgram (mehrsprachige Auto-Erkennung) oder OpenAI (Auto-Erkennung). Beide erfordern Ihren eigenen API-Key, sind aber bei schwierigem Audio meist besser als lokale Modelle.
-
Wenn Sie offline oder vollständig privat bleiben müssen und Whisper auf Ihrer Hardware langsam ist: Lesen Sie Langsame Transkription unter Windows beheben (GPU-Einstellungen) für die Windows-spezifische GPU-Beschleunigung, oder wechseln Sie zu Nemotron, das auf jeder nativen Plattform läuft.
Custom Vocabulary für Eigennamen verwenden
Wenn Hedy Namen, technische Begriffe, Produktnamen oder Branchenjargon falsch transkribiert, fügen Sie sie zu Custom Vocabulary hinzu.
-
Öffnen Sie Hedys Settings
-
Gehen Sie zu Personalisierung > Benutzerdefiniertes Vokabular > Vokabelterme verwalten
-
Geben Sie jeden Begriff in “Enter a custom term…” ein und tippen Sie auf Add
-
Stellen Sie sicher, dass Enable Custom Vocabulary aktiviert ist
Custom Vocabulary fließt direkt als Prompt in die lokale Whisper-Transkription ein und hilft ihr, domänenspezifische Begriffe korrekt zu erkennen und zu schreiben. Es hilft außerdem dem Schritt zur Transkriptbereinigung (der bei allen Anbietern läuft, einschließlich Nemotron, Deepgram und OpenAI), Fehler zu erkennen und zu beheben.
Hinweis: Custom Vocabulary wirkt am stärksten direkt, wenn Sie lokales Whisper STT verwenden. Bei Nemotron, Deepgram und OpenAI profitiert der Bereinigungsschritt weiterhin von Ihrer Begriffsliste, aber der Spracherkenner selbst erhält sie nicht als Prompt.
Eine längere Anleitung zum Aufbau einer guten Vokabelliste finden Sie im Custom Vocabulary Guide.
Mikrofon-Hardwareprobleme beheben
Wenn die Audioqualität mitten in der Sitzung schlechter wird oder nur bestimmte Sprecher durchkommen, ist die Hardware verdächtig:
-
Bluetooth-Headsets verschlechtern sich oft, wenn der Akku sinkt oder die Reichweite größer wird. Siehe AirPods und Bluetooth-Kopfhörer brechen ab.
-
USB-Mikrofone können unter Kabelproblemen leiden - probieren Sie einen anderen USB-Port oder ein anderes Kabel
-
Eingebaute Laptop-Mikrofone sind für ein oder zwei Personen nahe an der Tastatur in Ordnung. Für Konferenzräume sind sie nicht ideal.
-
Telefone in Hülle oder unter Stoff können dumpf klingen
Ein schneller Test: Nehmen Sie eine kurze Sprachnotiz mit demselben Mikrofon in Sprachmemos / Recorder / einer ähnlichen einfachen App auf. Wenn diese Aufnahme schlecht klingt, liegt das Problem am Mikrofon - nicht an Hedy.
Audioformat, das Hedy verwendet
Zur Einordnung: Hedy erfasst Audio mit 16 kHz, mono, 16-bit PCM - dem Standard für Spracherkennung. Dieses Format geht direkt an lokales Whisper und Deepgram. Für OpenAI Realtime sampelt Hedy vor dem Senden auf 24 kHz um (OpenAIs erforderliches Format). All diese Formate sind für Sprache geeignet, aber verlustbehaftet für Musik oder Hi-Fi-Audio. Erwarten Sie keine guten Ergebnisse beim Transkribieren von Liedern.
Wann Sie eskalieren sollten
Wenn Sie alles oben Genannte geprüft haben und die Genauigkeit weiterhin schlecht ist:
-
Notieren Sie die genaue Fehlerart (falsche Wörter, fehlende Abschnitte, falsche Sprecherzuordnung, völlig unbrauchbar)
-
Erfassen Sie eine 30-sekündige Probe, in der der Fehler auftritt
-
Kontaktieren Sie uns über das Chat-Widget mit der Probe und Ihrer Anbieter-/Spracheinstellung
Meist können wir erkennen, ob es ein Umgebungs-, Konfigurations- oder Anbieterproblem ist.
Verwandte Artikel
Weiterhin Probleme? Kontaktieren Sie uns über das Chat-Widget mit Ihrem Anbieter, Ihrer Meeting/Class Language-Einstellung, Ihrem Gerätemodell und einer Probe, in der das Problem sichtbar ist.