Diktieren mit KI
Diktieren mit KI: was dahintersteckt und woran du die Unterschiede erkennst
Die kurze Antwort: „KI-Spracherkennung“ meint heute bei fast allen Anbietern dieselbe Art von Modell. Es transkribiert nicht nur, es sagt Sprache voraus, und genau daraus entsteht die eigentliche Schwäche: Wenn die Aufnahme unklar ist, lässt das Modell keine Lücke, sondern schreibt die wahrscheinlichsten Wörter hin. OpenAI schreibt das in der Whisper-Modellkarte selbst, und eine begutachtete Studie fand in rund 1 % der untersuchten Transkripte ganze Sätze, die im Audio überhaupt nicht vorkamen. Unterscheiden musst du Anbieter deshalb nicht nach dem Wort KI, sondern nach zwei Fragen: Wo läuft die Erkennung, und was zeigt dir das Programm, wenn es unsicher war.[2][3]
Für Mac-Nutzer, die täglich viel Text schreiben und dabei Deutsch und Englisch mischen. Läuft auf Apple Silicon.
Die zwei Fragen, an denen sich KI-Diktierprogramme unterscheiden
| Kriterium | Witness | Typische KI-Diktier-Cloud |
|---|---|---|
| Wo die Erkennung läuft | Lokal auf Apple Silicon | Auf Servern des Anbieters, bei Wispr Flow in den USA |
| Konto | Kein Produktkonto vorgesehen | Anmeldung erforderlich, etwa bei Wispr Flow |
| Was die KI mit dem Text macht | Konservative Bereinigung, per Hotkey umkehrbar | Glättung, Grammatikkorrektur, Umformulierung |
| Unsichere Stellen | Zahlen, Daten, Namen, Verneinungen und Wörterbuchbegriffe vor dem Einfügen markiert | Nicht öffentlich dokumentiert |
| Originalton nachhören | Bei markierten Stellen, aus dem Arbeitsspeicher | Nicht öffentlich dokumentiert |
| Kosten | €99 einmalig oder €49/Jahr, zwei Macs | Abo, bei Wispr Flow Pro $144 im Jahr |
Was „KI“ bei Spracherkennung wirklich bedeutet
Ein heutiges Spracherkennungsmodell ordnet nicht Laut für Laut Buchstaben zu. Es schätzt, welche Wortfolge zu dem Gehörten am besten passt, und bezieht dabei mit ein, was sprachlich wahrscheinlich ist. Deshalb klingt das Ergebnis flüssig, auch wenn die Aufnahme es nicht war. Dasselbe Prinzip steckt in den meisten Produkten, die mit KI werben, egal ob sie lokal oder in der Cloud rechnen.[2]
Die Kehrseite steht in der Modellkarte von OpenAI: Die Vorhersagen können Text enthalten, der im Audio gar nicht gesprochen wurde, und die Architektur neigt zusätzlich dazu, Textstellen zu wiederholen. Das ist keine Macke eines einzelnen Anbieters, sondern eine Eigenschaft dieser Modellklasse.[2]
Wie oft die KI etwas erfindet
Die belastbarste öffentliche Zahl stammt aus „Careless Whisper“, vorgestellt 2024 auf der ACM-Konferenz für Fairness, Accountability and Transparency. In rund 1 % der untersuchten Transkripte standen ganze erfundene Formulierungen oder Sätze, die im zugrunde liegenden Audio in keiner Form vorkamen. 38 % dieser Halluzinationen enthielten ausdrücklich schädliche Inhalte, etwa erfundene Zusammenhänge oder vorgetäuschte Autorität.[3]
Ein Prozent klingt wenig, bis man zählt, wie viele Diktate ein Arbeitstag enthält. Und es verteilt sich ungleich: Die Studie fand mehr Halluzinationen bei Sprechenden mit längeren Sprechpausen, einem häufigen Symptom bei Aphasie. Die Modellkarte nennt aus demselben Grund ungleiche Qualität über Sprachen, Akzente und Dialekte hinweg.[3][2]
Lokal rechnen ändert den Weg, nicht das Modell
Das gehört hierher, obwohl wir lokale Verarbeitung verkaufen: Wenn die Erkennung auf deinem Mac läuft, verlässt das Audio das Gerät nicht. Am Verhalten des Modells bei undeutlicher Aufnahme ändert das nichts. Ein lokales Modell verschluckt ein „nicht“ genauso wie ein Modell in der Cloud. Lokal heißt vertraulich, nicht fehlerfrei.[2][1]
Trotzdem ist der Unterschied real, nur an anderer Stelle: Wispr Flow beschreibt sich in der eigenen Dokumentation als Cloud-Dienst, der Kundendaten in den USA verarbeitet und speichert, und verlangt bei der Einrichtung ein Konto. Was du diktierst, geht dort also zur Erkennung hinaus. Bei Witness bleibt es auf dem Mac, und für Aktivierung, Lizenz und Updates gehen nur offengelegte Nicht-Inhaltsdaten hinaus.[4][5][1]
KI-Glättung macht Fehler schwerer sichtbar
Fast alle KI-Diktierprogramme bieten heute einen zweiten Durchgang an: Grammatik korrigieren, Füllwörter entfernen, Satzzeichen setzen, den Text in sauberes Deutsch bringen. Für viele Texte willst du genau das. Nur entfernt dieser Durchgang auch die Spuren. Zögern, ein halb wiederholtes Wort, ein schiefer Satzbau sind die Dinge, bei denen man stutzt und noch einmal liest.[1]
Je glatter der Text, desto weniger fällt auf, dass der Betrag unterwegs ein anderer geworden ist. Witness bereinigt deshalb konservativ und umkehrbar: Ein Hotkey zeigt das unveränderte Rohtranskript, damit nachvollziehbar bleibt, was das Programm geändert hat.[1]
Woran du ein brauchbares KI-Diktat erkennst
Vier Punkte, und sie sind konkret. Werden die Stellen markiert, an denen ein Fehler die Bedeutung ändert, also Zahlen, Datumsangaben, Eigennamen, Verneinungen und eigene Fachbegriffe? Kommst du an das unveränderte Rohtranskript? Kannst du den Originalton einer markierten Stelle nachhören, statt den Text nur noch einmal zu lesen? Und bestimmst du selbst, welche Sprachen überhaupt in Frage kommen? Bei den geprüften öffentlichen Seiten der großen KI-Diktier-Clouds ist eine automatische Risiko- oder Confidence-Markierung auf Fragmentebene nicht öffentlich dokumentiert. Das ist keine Aussage darüber, wie gut sie erkennen, und kein Genauigkeitsvergleich: Es heißt nur, dass wir diese eine Funktion nicht als belegten Gleichstand eintragen können.[1][4]
Witness ist um diese vier gebaut: markierte Risikostellen vor dem Einfügen, Rohtranskript per Hotkey, Nachhören des kurzen Fragments aus dem Arbeitsspeicher, und du kreuzt aus 100 Sprachen an, welche vorkommen. Deutsch, Englisch, Russisch und Ukrainisch sind end-to-end gemessen; bei den übrigen bleiben sprachabhängig kalibrierte Markierungen aus, statt zu raten. Eine bessere Erkennung behaupten wir dabei nicht: Es gibt keinen gemeinsamen veröffentlichten Benchmark, der die Programme belastbar ordnet. 13 Tage lassen sich kostenlos testen, ohne Konto.[1]
Unsere Empfehlung, mit klarer Grenze
Unsere Empfehlung: Lass dich nicht vom Wort KI leiten, es steckt überall dasselbe Prinzip dahinter. Entscheide nach den zwei Fragen, die wirklich auseinandergehen. Wenn deine Diktate Inhalte enthalten, die den Mac nicht verlassen sollen, und darin regelmäßig Zahlen, Namen oder Fristen vorkommen, ist Witness die passende Wahl: einmal €99 statt eines Abos, kein Konto, und die unsicheren Stellen stehen vor dem Einfügen zur Freigabe. Eine Cloud-Lösung wie Wispr Flow bleibt sinnvoll, wenn du dieselbe Oberfläche auf Windows, iPhone und Android brauchst.[4][1]
Häufige Fragen
Was ist KI-Spracherkennung?
Ein Modell, das aus einer Aufnahme die wahrscheinlichste Wortfolge vorhersagt, statt Laute einzeln zuzuordnen. Deshalb klingt das Ergebnis flüssig, und deshalb kann es Text enthalten, der so nicht gesprochen wurde.
Erfindet KI-Diktat wirklich Wörter?
Ja, und die Hersteller dokumentieren es. Die Whisper-Modellkarte von OpenAI nennt Vorhersagen, die im Audio nicht gesprochen wurden. Eine Studie auf der ACM FAccT 2024 fand in rund 1 % der Transkripte vollständig erfundene Formulierungen.
Ist lokale KI-Spracherkennung genauer als die Cloud?
Das lässt sich öffentlich nicht belegen. Lokal entscheidet darüber, wo das Audio verarbeitet wird, nicht darüber, wie das Modell bei undeutlicher Aufnahme reagiert. Einen gemeinsamen Benchmark, der die Programme nach Genauigkeit ordnet, gibt es nicht.
Diktieren mit KI ohne Cloud, geht das auf dem Mac?
Ja. Die Erkennung läuft auf Apple Silicon schnell genug für laufendes Diktat. Witness verarbeitet Audio, Transkript und Wörterbuch lokal; das Audio bleibt standardmäßig nur im Arbeitsspeicher.
Worauf sollte ich bei einem KI-Diktierprogramm achten?
Wo die Erkennung läuft, ob ein Konto nötig ist, ob riskante Stellen vor dem Einfügen markiert werden, ob du an das unveränderte Rohtranskript kommst und ob du die Sprachauswahl selbst bestimmst.
Offizielle Quellen
Ausschließlich offizielle Produkt-, Hilfe-, Preis- und Rechtstexte. Alle Quellen wurden am 1. Oktober 2026 abgerufen.
- WitnessWitness Produktseite und Produktstatus
- OpenAIWhisper model card, Limitations and biases
- Koenecke, Choi, Mei, Schellmann, SloaneCareless Whisper: Speech-to-Text Hallucination Harms (ACM FAccT 2024)
- Wispr FlowSecurity and Compliance FAQ
- Wispr FlowSetup guide