Aktualisiert 3. September 2026 · Von Sumbat.T

Diktat, das in der Prompt-Box und überall sonst funktioniert



Ihr Agent-Prompt ist Prosa. Sprechen Sie ihn.
BlabbyAI tippt in jedes Feld mit Cursor, ob Claude Code, Cursor, eine Pull-Request-Beschreibung oder ein Jira-Ticket. Es drückt nie Enter für Sie. 60 Credits pro Woche gratis, ohne Karte.
Wenn Sie vor fünf Jahren und diese Woche nach Voice Coding gesucht haben, bekamen Sie Antworten auf zwei verschiedene Fragen. Der Begriff wurde still umgedeutet, und niemand hat es angekündigt. Das lohnt sich zuerst zu entwirren, denn je nachdem, welche Variante Sie meinen, lautet die Antwort entweder „das braucht einen Monat zum Lernen“ oder „Sie können in den nächsten zehn Minuten starten“.
Die Bedeutung 2000 bis 2022
Sie sprechen eine Befehlsgrammatik, und eine Engine macht daraus Code. „Camel case new function get user by ID“ erzeugt getUserById(). Braucht ein spezialisiertes Tool, ein gelerntes Vokabular und Wochen Übung.
Tools: Talon Voice, Serenade, VoiceCode, Dragon mit eigenen Grammatiken
Lernkurve: Wochen Training
Die Bedeutung 2026
Sie sprechen normales Englisch an einen KI-Agenten, und er schreibt die Syntax. „Add a retry with exponential backoff to the fetch helper and cover it with a test“ ist eine vollständige Anweisung. Keine Grammatik zu lernen.
Tools: Jedes genaue Diktier-Tool, plus Claude Code, Cursor, Copilot
Lernkurve: Keine
Der Entwickler, dessen Artikel derzeit auf der ersten Google-Seite für diesen Begriff steht, fasste den Wandel in einem Satz, und es ist die klarste Formulierung dazu:
Instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.
dev.to, „I Ditched My Keyboard for Voice Coding“, April 2026
Lesen Sie das genau, denn darin steckt die praktische Konsequenz. Was Voice Coding schwer machte, war nie das Sprechen. Es war, dass Code eine schlechte Sache ist, um sie laut auszusprechen. Satzzeichen, Großschreibung, Verschachtelung und Symbolnamen müssen explizit gesprochen werden, deshalb brauchten die alten Tools eine Befehlsgrammatik und deshalb dauerte das Lernen Wochen. Wenn die Syntax von einem Modell erzeugt wird, gilt nichts davon. Sie diktieren einen Satz, und Sätze zu diktieren ist seit einer Weile gelöst.
Warum das für die Tool-Wahl zählt
Wenn Sie Prompts statt Syntax diktieren, bringt Ihnen ein spezialisiertes Voice-Coding-Tool nichts. Was Sie brauchen, ist ein genaues allgemeines Diktier-Tool, das in jedes Feld mit Fokus tippt, weil die Prompt-Box nur eine der Boxen ist, die Sie an einem Tag füllen. Das ist eine andere Produktkategorie, und eine deutlich günstigere.
Das ist kein Bauchgefühl. Jeder dieser Punkte ist nachprüfbar, und zusammen zeigen sie eine fünfzehn Jahre alte Accessibility-Praxis, die von etwas ergänzt und dann zahlenmäßig überholt wird, das zufällig denselben Namen trägt.
2000
Programming by Voice kommt in die Literatur
Das ACM-Paper „Programming by voice, VocalProgramming“ erscheint und wird bis heute 77-mal zitiert. Voice Coding beginnt als Accessibility-Forschungsproblem.
Oktober 2020
Talon wird die Praxis-Antwort
Josh Comeau veröffentlicht seinen Bericht über freihändiges Coding mit Talon Voice. Für die nächsten fünf Jahre ist das die kanonische Referenz, und sie handelt ausschließlich vom Diktieren von Syntax.
Dezember 2022
Atom wird eingestellt
GitHub stellt Atom ein. Serenade, das heute noch auf Platz drei für Voice Coding steht, listet Atom weiterhin als unterstützten Editor auf der Startseite.
Juni 2024
Serenade wird still
Der letzte Commit geht an serenadeai/serenade, mit 26 offenen Issues. Das Repository ist nicht archiviert, deshalb taucht es weiter in Empfehlungen auf.
April 2026
Die Definition kippt öffentlich
Ein dev.to-Artikel, der jetzt auf Seite eins steht, formuliert die neue Prämisse direkt: „instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.“
September 2026
Beide Zweige leben, einer wächst
Das Community-Repository von Talon wird am 2. September aktualisiert. Parallel liefert Claude Code /voice-Diktat und VS Code ein On-Device-Diktier-Modell. Suchen nach Voice Coding liegen 23 % über dem Vorjahr.
Genauigkeit ist nicht mehr die Achse, die sie trennt. Alle aktuellen Optionen transkribieren gewöhnliches technisches Englisch gut. Was sie trennt, ist Scope: wie viel von Ihrem Tag ein Tool abdeckt, und ob es am Rand eines Programms endet.
| Tool | Wo es funktioniert | Läuft auf | Sendet für Sie | Preis |
|---|---|---|---|---|
BlabbyAI | Jedes Textfeld, systemweit | Windows-App, Chrome-Erweiterung | Nie, Sie drücken Enter | 8,49 $/Monat |
Claude Code /voice | Nur Claude-Code-Prompt | CLI und VS-Code-Erweiterung | Ja im Tap-Modus | Inklusive mit Claude.ai |
VS Code dictation | VS-Code-Editor und Chat | On-Device-Modell | Nein | Kostenlos |
Wispr Flow | Jedes Textfeld, systemweit | Mac, Windows, iOS, Android | Nein | 15 $/Monat |
Talon Voice | Volle freihändige Steuerung | Mac, Windows, Linux | Befehlsgetrieben | Kostenlos, bezahlte Beta |
Serenade | Syntax-Befehle in Editoren | Letzter Push Juni 2024 | Befehlsgetrieben | Kostenlos, Open Source |
Zwei Zeilen in dieser Tabelle verdienen einen eigenen Absatz, weil beide regelmäßig von Artikeln empfohlen werden, die nicht nachgeprüft haben.
Serenade ist ein Open-Source-Voice-Coding-Tool auf Platz drei bei Google für diesen Begriff, und das heißt: Ein großer Teil der Leute, die Voice Coding recherchieren, wird direkt dorthin geschickt. Sein GitHub-Repository, serenadeai/serenade, bekam den letzten Push am 11. Juni 2024, mit 26 noch offenen Issues. Das Repository ist nicht archiviert, und genau deshalb wird es weiter empfohlen: Nichts darauf kündigt an, dass die Arbeit gestoppt hat.
Es gibt ein zweites Indiz auf der Marketing-Seite selbst. Serenade listet die unterstützten Editoren prominent, und Atom steht noch dabei. GitHub hat Atom im Dezember 2022 eingestellt. Eine Seite, die Support für einen Editor bewirbt, der seit fast vier Jahren tot ist, ist eine Seite, die niemand mehr angefasst hat.
$ gh api repos/serenadeai/serenade --jq .pushed_at
2024-06-11T20:08:49Z
$ gh api repos/talonhub/community --jq .pushed_at
2026-09-02T08:27:58Z
Die tatsächliche Aktivität eines Projekts prüft man mit einem Befehl, und das lohnt sich, bevor Sie einen Workflow auf irgendein Tool bauen.
Nichts davon heißt, dass Serenade heute nicht läuft. Es heißt, dass die Empfehlung, die Sie gelesen haben, wahrscheinlich geschrieben wurde, bevor das Projekt still wurde, und dass Sie das Repository selbst prüfen sollten statt einem Suchranking zu vertrauen. Derselbe Befehl klärt das für jedes Tool in dieser Kategorie.
Der Kontrast zählt, weil Talon Voice oft in Takes vom Typ „Voice Coding ist tot“ mitgeschoben wird. Das ist es nicht. Sein Community-Repository wurde am 2. September 2026 aktualisiert, und es bleibt das Tool, auf das sich Menschen verlassen, die wirklich keine Tastatur nutzen können. Talon konkurriert nicht wirklich mit Diktier-Apps: Es ersetzt Maus und Tastatur komplett, mit gesprochenen Befehlen für Navigation, Auswahl, Fenstermanagement und Syntax. Das ist eine deutlich größere und schwerere Aufgabe, deshalb hat es eine Lernkurve und deshalb hat es nichts anderes ersetzt.
Die Wahl zwischen beiden
Wenn Ihr Ziel ist, weniger zu tippen, nutzen Sie allgemeines Diktat, weil der Großteil dessen, was Sie an einem Tag tippen, Prosa ist. Wenn Ihr Ziel ist, gar keine Tastatur zu nutzen, lernen Sie Talon. Das sind keine konkurrierenden Antworten auf eine Frage, sondern Antworten auf zwei.
Bevor Sie für irgendetwas bezahlen, lohnt es sich zu wissen, dass zwei der Orte, an denen Entwickler am meisten diktieren, schon Diktat eingebaut haben, und dass sie entgegengesetzte Designentscheidungen getroffen haben. Beides unten aus der Dokumentation der Hersteller selbst gelesen.
| Host | Eingebautes Diktat | Audio verarbeitet | Wo es endet |
|---|---|---|---|
Claude Code CLI | Ja, /voice | Anthropic-Server | Braucht Claude.ai-Konto. Kein SSH, kein Web. Stoppt nach 2 Minuten. |
VS Code | Ja, Ctrl+Alt+V | Auf dem Gerät, offline | Nur innerhalb von VS Code. Nicht in Remote-SSH über die Claude-Erweiterung. |
Cursor | Kein First-Party-Diktat | Nicht zutreffend | Braucht ein systemweites Tool oder die OS-Diktat-Taste. |

Claude Code liefert Diktat, das Sie mit /voice einschalten. Es bietet zwei Modi: Hold-Modus, bei dem Sie Space halten während Sie sprechen, und Tap-Modus, bei dem Sie einmal tippen zum Start und nochmal zum Senden. Die Transkription ist auf Coding-Vokabular abgestimmt, und Anthropics Dokumentation merkt an, dass Projektname und aktueller Git-Branch automatisch als Erkennungshinweise hinzugefügt werden, ein wirklich durchdachtes Detail.
> /voice
Voice mode enabled (hold). Hold space to record.
Dictation language: en (/config to change).
Quelle: Claude-Code-Dokumentation, code.claude.com/docs/en/voice-dictation
Die drei Grenzen stehen alle klar in demselben Dokument, und jede schließt ein reales Arbeitssetup aus. Die erste betrifft die Authentifizierung:
A Claude.ai account: the speech-to-text service is only available when you authenticate with one, and is not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry.
Claude-Code-Dokumentation, Voice dictation, Requirements
Das ist in der Praxis ein großer Ausschluss. Viele Engineering-Organisationen leiten Claude Code über Bedrock oder einen direkten API-Key aus Abrechnungs- und Compliance-Gründen, und jeder Entwickler in diesen Organisationen liegt komplett außerhalb des eingebauten Diktats.
Die zweite betrifft, wo Sie arbeiten. Diktat braucht ein lokales Mikrofon, deshalb läuft es nicht in Claude Code im Web oder über SSH. Die VS-Code-Erweiterung hat dasselbe Problem aus demselben Grund: Die Dokumentation erklärt, sie sei in Remote-SSH, Dev Containers und Codespaces nicht verfügbar, „because the microphone is on your local machine and the extension runs on the remote host“. Wenn Ihre Entwicklungsumgebung in einem Container oder auf einer Remote-Box lebt, was zunehmend normal ist, scheidet das aus.
Die dritte ist ein Timer. Die Aufnahme „stops automatically after 15 seconds of silence or two minutes total“. Zwei Minuten sind viel Sprache für eine Chat-Nachricht und nicht besonders viel für den Prompt-Typ, der vom Sprechen wirklich profitiert, wo Sie einen Bug beschreiben, die drei Dinge, die Sie schon versucht haben, und die Grenze, die der Fix einhalten muss. Sechzehn Sekunden nachdenken beendet die Aufnahme.
Das, was Leute überrascht
Das Diktat von Claude Code ist nicht lokal. Die Dokumentation sagt es direkt: „Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.“ Das ist für ein Cloud-Tool unauffällig, aber es lohnt sich zu wissen, wenn Sie angenommen haben, eine CLI auf Ihrem Rechner würde auf Ihrem Rechner transkribieren.

Das eingebaute Diktat von VS Code ist die interessanteste Option in dieser ganzen Kategorie und die am wenigsten besprochene, weil es den entgegengesetzten Trade zu allen anderen gemacht hat. Es ist standardmäßig an, wenn KI-Funktionen aktiv sind, gestartet mit Ctrl+Alt+V im Editor oder Ctrl+I im Chat, und das Modell läuft dort, wo Sie sitzen:
Dictation uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service. After the initial model download, speech recognition does not require an internet connection.
Visual-Studio-Code-Dokumentation, Voice support
Für Entwickler, deren Einwand gegen Diktat ist, dass Audio den Rechner verlässt, ist das die Antwort, und sie ist schon installiert. Es kostet nichts und braucht kein Konto. Es gibt einen Hinweis in derselben Dokumentation: Eine optionale Einstellung namens llmCleanup sendet den Transkript-Text, allerdings nicht das Audio, an ein Sprachmodell zur Bereinigung. Lassen Sie das aus, verlässt nichts das Gerät.
Die Grenze ist die offensichtliche, und genau deshalb ist das nicht das Ende des Artikels. Es diktiert in VS Code. Ihre Pull-Request-Beschreibung liegt im Browser. Ihr Ticket liegt in Jira. Ihre Antwort an die Person, die reviewed hat, liegt in Slack. Ihre Antwort an den Kunden, der den Bug gemeldet hat, liegt in einem Support-Tool. An einem typischen Tag ist der Editor nicht der Ort, an dem die meisten Ihrer Worte landen.
Das ist der Punkt, den die ganze Kategorie ständig verfehlt, und deshalb schlägt Scope Genauigkeit bei der Tool-Wahl. Denken Sie ehrlich an einen Arbeitstag und zählen Sie, wohin die Worte gehen. Sehr wenig davon ist Syntax, und fast alles Übrige ist Prosa, die gesprochen schneller wäre.
Agent-Prompts
Der Teil, der länger geworden ist, je besser die Agenten wurden. Absicht, Grenzen und was Sie schon ausgeschlossen haben zu beschreiben, ist reine Prosa, und das ist inzwischen ein großer Anteil der Arbeit.
Pull-Request-Beschreibungen
Kontext, Begründung, worauf ein Reviewer zuerst schauen soll. Geschrieben in einem Browser-Textfeld, nicht im Editor.
Code-Review-Kommentare
Erklären, warum sich etwas ändern sollte, braucht mehr Worte als die Änderung selbst. In GitHub oder GitLab, im Browser.
Tickets und Standups
Jira, Linear, Slack. Kurz, häufig, und unverhältnismäßig nervig zu tippen, weil sie etwas anderes unterbrechen.
Dokumentation und READMEs
Das, was alle aufschieben. Einen Erstentwurf sprechen und aufräumen schlägt das Starren auf eine leere Datei.
Commit-Messages
Besonders der Body, wo die Begründung hingehört und wo sie meist nie landet.
Jedes davon ist Prosa, und bei Prosa gewinnt Sprache klar. Angenehmes Sprechen liegt bei etwa 130 bis 150 Wörtern pro Minute gegen grob 40 beim durchschnittlichen Tippen. Die zugrunde liegende Forschung haben wir in unserem Stück zu Wörtern pro Minute beim Sprechen durchgegangen, und die Kurzfassung lautet: Die Lücke ist bei Sätzen real und verschwindet bei Symbolen.
Merken Sie, was das für die Tool-Wahl heißt. Ein Tool, das nur auf Ihren Editor beschränkt ist, deckt den kleinsten Teil dieser Liste ab. Ein Tool, das auf einen Agenten beschränkt ist, deckt einen Punkt ab. Ein Tool, das in jedes Feld mit Cursor tippt, deckt alle sechs ab, und es ist das günstigste der drei.

BlabbyAI baut auf der Annahme oben: Die sinnvolle Einheit ist nicht „Diktat fürs Coding“, sondern Diktat überall, weil der Editor ein Fenster unter einem Dutzend ist. Drücken Sie Ctrl+Space, sprechen Sie, drücken Sie nochmal, und der Text wird in das Feld getippt, das Fokus hatte. Das Feld kann der Claude-Code-Prompt sein, Cursors Composer, eine GitHub-Review-Box, eine Jira-Beschreibung, ein Slack-Thread oder ein Terminal. Es gibt nichts zu integrieren, weil es keine Integration gibt: Es tippt dorthin, wo Ihr Cursor schon steht.

Das globale Kürzel lässt sich unter Settings umbinden, und das zählt hier: Ctrl+Space ist in den meisten Editoren IntelliSense, deshalb verschieben Entwickler es meist.
Dieses Default lohnt sich zu markieren statt darüber hinwegzugehen. Ctrl+Space ist der Autocomplete-Trigger in VS Code, IntelliJ und den meisten Editoren, deshalb ist das das Erste, was ein Entwickler ändern sollte. Ein Klick unter Settings, und es gibt keinen Grund, die Kollision stehen zu lassen.
Ein Mode ist eine freie Anweisung, die auf das angewendet wird, was Sie gerade gesagt haben, nach der Transkription und bevor der Text getippt wird. Sie schreiben die Anweisung einmal, weisen ein Kürzel zu, und ab dann erzeugt dieses Kürzel Sprache in dieser Form. Ihre Sprache ist der Input, keine Anfrage: Ein Mode formt um, was Sie gesagt haben, statt es zu beantworten.
Für Entwickler ist das nützlicher, als es zuerst klingt, weil die Schreibaufgaben in der Liste oben jeweils einen Hausstil haben, und das Umformatieren ist, was sie mühsam macht. Ein paar Anweisungen, die echte Arbeit leisten:
| Mode-Anweisung | Was Sie sagen | Was getippt wird |
|---|---|---|
| Als Conventional Commit mit Typ-Präfix und Body umschreiben, der erklärt warum | „fixed the retry loop, it was hammering the API when the token expired“ | Eine fix:-Subject-Zeile mit der Begründung im Body |
| Als PR-Beschreibung mit Summary und Testing-Abschnitt formatieren | Ihr gesprochener Walkthrough der Änderung | Strukturiertes Markdown mit den Überschriften schon da |
| Füllwörter und Fehlstarts streichen, alles andere wörtlich behalten | Ein langer, umschweifender Agent-Prompt laut gedacht | Derselbe Prompt ohne Ähs und Neustarts |
| Wenn ich „new bullet“ sage, einen neuen Listenpunkt starten statt diese Worte zu schreiben | „the cache is stale new bullet the TTL is wrong“ | Zwei echte Aufzählungspunkte |

Ein Mode ist eine Anweisung plus ein Kürzel. Die letzte Zeile oben zeigt, wie gesprochene Befehle funktionieren: Sie beschreiben sie in der Anweisung, statt auf eine feste Befehlsliste zu setzen.
Bei der letzten Zeile lohnt es sich zu verweilen, weil das der Mechanismus ist, den Leute falsch verstehen. Das Modell bekommt Ihr volles wörtliches Transkript, inklusive Worte, die Sie als Befehle meinten, deshalb können Sie Ihr eigenes gesprochenes Vokabular definieren, indem Sie es in der Anweisung beschreiben. „New paragraph“, „bullet point“, „scratch that“: Keines davon ist eine eingebaute Funktion, und alle funktionieren, weil Sie definieren, was sie bedeuten.
Der vorhersehbare Einwand gegen Diktat irgendwo in der Nähe von Code sind Eigennamen. Ihr interner Service heißt etwas, das außerhalb der Firma niemand gehört hat, und kein allgemeines Modell schreibt das richtig. Custom Spelling löst das: Begriff einmal unter Settings, dann Languages hinzufügen, genau so getippt, wie er geschrieben werden soll, und ab dann wird er gematcht. Library-Namen, Service-Namen, der Nachname eines Kollegen, ein Akronym, das Ihr Team erfunden hat. Blabby unterstützt außerdem 90+ Sprachen mit Auto-Detect, was in verteilten Teams zählt, in denen Leute in einer Sprache denken und in einer anderen shippen.
Es drückt nie Enter
Blabby schreibt Text in das fokussierte Feld und hört dort auf. Es klickt keine Buttons, sendet keine Formulare und drückt kein Enter. Für einen Agent-Prompt ist das das gewünschte Verhalten: Ihre Worte landen in der Box und warten, sodass Sie eine lange Anweisung nachlesen können, bevor Sie sie senden, statt dass sie abgefeuert wird, sobald Sie aufhören zu reden.
Die Windows-Desktop-App ist das vollere Produkt: Sie tippt systemweit in jede Anwendung und hat History, die jede Aufnahme im Moment des Stopps auf Ihre eigene Festplatte schreibt, bevor die Transkription beginnt. Nichts an History berührt einen Server, und Sie können jede vergangene Aufnahme später abspielen oder neu transkribieren, optional durch einen anderen Mode.
Die Chrome-Erweiterung ist die andere Hälfte, und für viele Entwickler ist genau sie die passende. Wenn Ihr Agent die Web-Ansicht von Cursor ist, wenn Ihre Reviews in GitHub passieren, wenn Ihre Tickets in Linear und Ihre Docs in Notion liegen, dann liegt alles, was Sie diktieren, schon in einem Browser-Tab. Die Erweiterung zeigt eine kleine Bubble neben dem fokussierten Textfeld und braucht keinen Download und keine Admin-Rechte, und das ist der Unterschied zwischen Arbeiten und Nicht-Arbeiten auf einem verwalteten Laptop. Es ist auch die Option für Mac und Chrome OS. Beides deckt derselbe 8,49 $-Monatspreis ab, und der Gratis-Tarif sind 60 Credits pro Woche ohne Karte.
Nichts davon verlangt, dass Sie sich auf einen Workflow festlegen, bevor Sie wissen, ob er Ihnen gefällt. Die Reihenfolge zählt ein Stück: Bringen Sie Diktat zuerst bei Prosa zum Laufen, weil dort der Gewinn offensichtlich ist, und entscheiden Sie erst danach, ob Sie etwas Spezielleres wollen.
Die Gewohnheit, die es funktionieren lässt
Sprechen Sie den Prompt, den Sie gedacht und dann abgekürzt hätten. Die meisten schwachen Agent-Prompts sind schwach, weil sie auszuschreiben mühsam war, nicht weil der Entwickler den Kontext nicht kannte. Die Tippkosten wegzunehmen nimmt den Grund weg, abzukürzen.
Ein Guide, der behauptet, Stimme gewinne überall, ist nicht lesenswert, und die Grenzen hier sind klar genug, um sie zu nennen.
Rohe Syntax tippt man weiterhin schneller, für jeden, der kompetent tippt. const [x, setX] = useState(0) laut auszusprechen ist in jedem Tool eine schlechtere Erfahrung als tippen, und keine Modellverbesserung ändert das, weil der Engpass die gesprochene Form von Satzzeichen ist und nicht die Erkennung. Präzise Edits haben dasselbe Problem: Den Cursor drei Zeichen nach links zu bewegen ist ein Tastendruck und ein Satz.
Es gibt auch eine Umgebungsgrenze, die keine Herstellerseite erwähnt. Diktat setzt voraus, dass Sie reden können. Im Großraumbüro, im Zug oder im gemeinsamen Zimmer zu Hause mit jemandem, der schläft, fällt diese Annahme aus, und sie fällt für ganze Tage aus, nicht nur gelegentlich. Das ist ein echter Grund, warum Leute Diktier-Tools aufgeben, und er hat nichts mit der Software zu tun.
Die ehrliche Fassung lautet: Diktat ist eine zweite Eingabemethode, kein Ersatz. Sie tippen weiter und sprechen die Teile, die Sätze sind. Das ist eine kleinere Behauptung als die meiste Kategorie macht, und es ist die, die Kontakt mit einer Arbeitswoche überlebt.
Beide Varianten funktionieren, für unterschiedliche Menschen, und der Grund, warum die Frage ungelöst wirkt, ist, dass es eigentlich zwei Fragen sind.
Syntax zu diktieren funktioniert, funktioniert seit Jahren und bleibt anspruchsvoll. Talon wird aktiv gepflegt und ist die richtige Antwort, wenn Sie keine Tastatur nutzen können, aber es ist eine Fertigkeit, die man erwirbt, kein Tool, das man installiert. Wer Ihnen erzählt, diese Variante sei mühelos, hat sie nicht gemacht.
Anweisungen an einen Agenten zu diktieren funktioniert sofort, braucht kein Training und ist das, was der Begriff jetzt vorwiegend meint. Es hat auch eine Konsequenz, die die Tool-Diskussion oft überspringt: Weil das, was Sie sprechen, Prosa ist, ist das Tool, das Sie brauchen, gar kein Coding-Tool. Es ist genaues Diktat, das Ihrem Cursor in jedes Fenster folgt, in dem Sie sind, weil die Prompt-Box einer von vielleicht sechs Orten ist, an denen Ihre Worte an einem Tag landen.
Das ist der ganze Wandel, und deshalb liegt ein Begriff, der fünfzehn Jahre Nische war, 23 % über dem Vorjahr. BlabbyAI deckt diesen Job für 8,49 $ im Monat ab, unter Windows oder in Chrome, und der Gratis-Tarif reicht, um herauszufinden, ob Ihnen das Sprechen Ihrer Prompts gefällt, bevor Sie für irgendetwas bezahlen. Wenn Sie den breiteren Vergleich wollen, halten wir einen Überblick der besten Diktier-Apps, und einen Guide zu Diktat für Programmierer, der tiefer in die Alltags-Schreibseite geht.
Der Begriff deckt heute zwei verschiedene Praktiken ab, und die meiste Verwirrung entsteht, weil man sie vermischt. Die ältere Bedeutung ist, Code selbst zu diktieren: Man spricht eine Befehlssprache, und eine spezialisierte Engine macht daraus Syntax, sodass „camel case new function get user by id“ zu getUserById() wird. Talon Voice und Serenade arbeiten so, und das braucht Wochen Übung. Die neuere Bedeutung, die 2026 fast alle meinen, ist: Anweisungen an einen KI-Coding-Agenten wie Claude Code, Cursor oder Copilot sprechen und den Agenten die Syntax schreiben lassen. Diese zweite Variante braucht gar keine Syntax-Engine, weil man englische Prosa in ein Textfeld diktiert. Jedes genaue allgemeine Diktier-Tool reicht, deshalb ist die Einstiegshürde eingebrochen. BlabbyAI tippt Ihre Sprache in jedes Feld mit Cursor, inklusive Agent-Prompt-Box, für 8,49 $ im Monat.
Ja, aber die ehrliche Antwort hängt davon ab, welche der beiden Praktiken Sie meinen. Rohe Syntax per Stimme zu diktieren funktioniert, und Menschen machen das hauptberuflich, vor allem mit Talon Voice, dessen Community-Repository im September 2026 noch aktualisiert wurde. Man muss eine Befehlsgrammatik lernen, und das ist wirklich langsam am Anfang, deshalb blieb es fünfzehn Jahre Nische. Anweisungen an einen KI-Agenten zu diktieren funktioniert dagegen sofort ohne Training, weil man normale Sätze spricht wie „add a retry with exponential backoff to the fetch helper and cover it with a test“. Der Agent erzeugt die Syntax. Entwickler, die Voice Coding vor Jahren ausprobiert und aufgegeben haben, haben meist die erste Variante gemeint. Die zweite ist eine andere Tätigkeit, die zufällig denselben Namen trägt.
Ja. Claude Code hat eingebautes Diktat, das Sie mit dem Befehl /voice aktivieren, entweder im Hold-to-Record-Modus (Space halten während Sie sprechen) oder im Tap-Modus (einmal tippen zum Start, nochmal tippen zum Senden). Drei Grenzen sollte man kennen, bevor man sich darauf verlässt, und alle drei stehen in Anthropics eigener Dokumentation. Erstens: Es braucht ein Claude.ai-Konto und ist ausdrücklich „not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry“, ein Team auf Bedrock kann es also nicht nutzen. Zweitens: Es braucht ein lokales Mikrofon und funktioniert nicht über SSH oder in Claude Code im Web. Drittens: Die Aufnahme „stops automatically after 15 seconds of silence or two minutes total“, ein langer laut-gedachter Prompt wird also abgeschnitten. Ein systemweites Diktier-Tool hat keine dieser drei Einschränkungen, weil es egal ist, in welchem Programm der Cursor steht.
Ja, und es funktioniert anders als jedes Cloud-Tool in dieser Kategorie. VS Code liefert Diktat, das standardmäßig an ist, wenn KI-Funktionen aktiviert sind, gestartet mit Ctrl+Alt+V (Cmd+Option+V auf dem Mac) im Editor oder Ctrl+I im Chat. Bemerkenswert ist, wo die Verarbeitung läuft: Microsofts Dokumentation sagt, es „uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service“, und nach dem ersten Modell-Download „speech recognition does not require an internet connection“. Das macht es zur einzigen wirklich offline laufenden Option, die die meisten Entwickler schon installiert haben. Der Preis ist der Scope. Es diktiert in VS Code und nirgendwo sonst, also brauchen Pull-Request-Beschreibung, Jira-Ticket, Slack-Antwort und Terminal weiterhin etwas anderes.
Bei Prosa klar ja. Angenehmes Sprechen liegt bei etwa 130 bis 150 Wörtern pro Minute gegen grob 40 Wörter pro Minute beim durchschnittlichen Tippen, und genau deshalb lohnt sich Diktat für alles Satzförmige. Bei Syntax nein, und wer etwas anderes behauptet, verkauft etwas: Satzzeichen und Camel Case auszusprechen ist für jemanden, der gut tippt, langsamer als tippen. Genau deshalb hat die Prompt-Diktat-Variante von Voice Coding abgehoben und die Syntax-Variante nicht. Prompts an einen KI-Agenten sind Prosa, liegen also auf der guten Seite dieses Verhältnisses, und genau dieser Teil der Arbeit ist länger geworden, je besser die Agenten wurden. Siehe unseren Vergleich von Sprech- und Tippgeschwindigkeit für die Zahlen dahinter.
Die richtige Frage ist Scope, nicht Genauigkeit, weil jedes ernsthafte Tool in dieser Kategorie inzwischen genau genug ist. Wenn Sie nur in einem Editor diktieren, reicht das eingebaute Diktat kostenlos: Das von VS Code läuft auf dem Gerät. Wenn Sie den ganzen Tag diktieren, und für die meisten Entwickler heißt das Agent-Prompt, Pull-Request-Beschreibung, Jira-Kommentar, Slack-Antwort und Dokumentation, brauchen Sie ein systemweites Tool, das in jedes fokussierte Feld tippt. BlabbyAI kostet dafür 8,49 $ im Monat, mit Gratis-Tarif von 60 Credits pro Woche ohne Karte, als Windows-Desktop-App oder Chrome-Erweiterung. Wenn Sie freihändige Navigation brauchen statt Diktat, wegen RSI oder einer Mobilitätseinschränkung, ist Talon Voice die ernsthafte Antwort und nichts anderes kommt nah ran.
Scheinbar nicht. Serenade ist ein Open-Source-Voice-Coding-Tool, das bei Google für den Begriff noch weit oben steht und deshalb ständig empfohlen wird, aber sein GitHub-Repository serenadeai/serenade bekam den letzten Push am 11. Juni 2024, mehr als zwei Jahre vor diesem Artikel, mit 26 noch offenen Issues. Die eigene Website listet Atom weiterhin unter den unterstützten Editoren, und GitHub hat Atom im Dezember 2022 eingestellt. Das heißt nicht, dass die Software heute nicht läuft, und das Projekt ist nicht archiviert. Es heißt, dass man eine Empfehlung für Serenade im Jahr 2026 mit Vorsicht behandeln und das Repository selbst prüfen sollte, bevor man einen Workflow darauf baut. Talon Voice dagegen wird aktiv gepflegt: Sein Community-Repository wurde am 2. September 2026 aktualisiert.
Das ist der Use Case, für den Voice Coding ursprünglich gebaut wurde, und er bleibt der stärkste. Zwei Dinge helfen, und es sind unterschiedliche Tools für unterschiedliche Jobs. Um die Tastatur komplett zu ersetzen, inklusive Navigation, Auswahl und Fenstermanagement, ist Talon Voice die etablierte Antwort, hat eine aktive Community und ist das Tool, das die meisten freihändig arbeitenden Entwickler wirklich nutzen. Um die Tipplast zu senken statt sie zu eliminieren, erledigt allgemeines Diktat den Großteil der Arbeit ohne Lernkurve, weil der Großteil dessen, was ein Entwickler an einem Tag tippt, Prosa ist und keine Syntax: Prompts, Reviews, Tickets, Nachrichten, Docs. Diesen Anteil rauszunehmen reicht oft. Wir haben einen eigenen Guide zum Tippen mit Karpaltunnelsyndrom, der die Setup-Seite abdeckt.
Besser als früher, und genau dieses Handling trennt Tools heute am stärksten. Claude Code sagt, seine Transkription sei „tuned for coding vocabulary“ und Begriffe wie regex, OAuth, JSON und localhost werden erkannt, dazu kommen Projektname und aktueller Git-Branch automatisch als Erkennungshinweise. Allgemeine Tools lösen das mit einem eigenen Wörterbuch. BlabbyAI hat eine Custom-Spelling-Funktion: Begriff einmal unter Settings, dann Languages hinzufügen, und ab dann wird er gematcht, so lehren Sie interne Service-Namen, eine ungewöhnliche Library oder den Namen eines Kollegen. Was kein Tool gut kann, sind rohe Identifier als Syntax gesprochen, also getUserById Zeichen für Zeichen bleibt überall holprig. Im Agent-Workflow brauchen Sie das nie, weil Sie „the get user by ID helper“ sagen und das Modell es auflöst.
Manche Tools tun das automatisch, und ob Sie das wollen, ist eine echte Präferenz und keine Feature-Lücke. Der Tap-Modus von Claude Code sendet den Prompt, sobald das Transkript mindestens drei Wörter hat, und der Hold-Modus kann dasselbe mit einer autoSubmit-Einstellung. Der Entwickler, dessen dev.to-Artikel auf Seite eins für Voice Coding steht, nannte genau das als Grund, vom eingebauten Voice wegzugehen: Das Problem, schrieb er, „is that it automatically sends the message when you finish talking, so you don't have time to actually think“. BlabbyAI sendet nie. Es ist ein Diktier-Tool und schreibt nur Text in das fokussierte Feld, Ihre Worte landen in der Prompt-Box und bleiben, bis Sie selbst Enter drücken. Für einen langen Agent-Prompt, den Sie vor dem Senden noch lesen wollen, ist genau das das gewünschte Verhalten.
Sprechen Sie Ihren nächsten Agent-Prompt
BlabbyAI tippt in jedes fokussierte Feld, unter Windows oder in Chrome, und drückt nie Enter für Sie. 8,49 $ im Monat, oder 60 Credits pro Woche gratis ohne Karte.