Aktualisiert 3. September 2026 · Von Sumbat.T

Voice Coding 2026: Der Begriff meint jetzt etwas anderes

Ein Schreibtischmikrofon neben einem Laptop mit einer Python-Datei im Code-Editor

Die kurze Antwort

  • Voice Coding hieß früher Syntax diktieren. 2026 meint es vorwiegend, Prompts an einen KI-Agenten zu sprechen. Das sind unterschiedliche Tätigkeiten mit demselben Namen, und fast jeder Streit darüber, ob Voice Coding funktioniert, ist eigentlich zwei Leute, die über verschiedene Dinge reden.
  • Die neue Variante braucht keine Spezialsoftware. Sie diktieren englische Prosa in ein Textfeld, deshalb reicht jedes genaue Diktier-Tool. Darum fiel die Hürde von Wochen Übung auf null. BlabbyAI tippt in jedes fokussierte Feld, inklusive Agent-Prompt, für 8,49 $/Monat mit Gratis-Tarif.
  • Die alte Variante ist nicht tot, sie ist nur enger geworden. Talon Voice wird aktiv gepflegt und bleibt die Antwort für wirklich freihändiges Arbeiten. Serenade, das bei Google für diesen Begriff noch auf Platz drei steht, bekam den letzten Commit im Juni 2024.
  • Eingebautes Diktat gibt es in Claude Code und VS Code, mit echten Grenzen. Das von Claude Code braucht ein Claude.ai-Konto, läuft nicht über SSH und stoppt die Aufnahme nach zwei Minuten. Das von VS Code läuft auf dem Gerät und offline, aber nur innerhalb von VS Code.

Diktat, das in der Prompt-Box und überall sonst funktioniert

ChatGPTGoogle DocsGmailWhatsAppMicrosoft Word

Microphone

Ihr Agent-Prompt ist Prosa. Sprechen Sie ihn.

BlabbyAI tippt in jedes Feld mit Cursor, ob Claude Code, Cursor, eine Pull-Request-Beschreibung oder ein Jira-Ticket. Es drückt nie Enter für Sie. 60 Credits pro Woche gratis, ohne Karte.

Add BlabbyAI to Chrome

Zwei Tätigkeiten, ein Name

Wenn Sie vor fünf Jahren und diese Woche nach Voice Coding gesucht haben, bekamen Sie Antworten auf zwei verschiedene Fragen. Der Begriff wurde still umgedeutet, und niemand hat es angekündigt. Das lohnt sich zuerst zu entwirren, denn je nachdem, welche Variante Sie meinen, lautet die Antwort entweder „das braucht einen Monat zum Lernen“ oder „Sie können in den nächsten zehn Minuten starten“.

Die Bedeutung 2000 bis 2022

Syntax diktieren

Sie sprechen eine Befehlsgrammatik, und eine Engine macht daraus Code. „Camel case new function get user by ID“ erzeugt getUserById(). Braucht ein spezialisiertes Tool, ein gelerntes Vokabular und Wochen Übung.

Tools: Talon Voice, Serenade, VoiceCode, Dragon mit eigenen Grammatiken

Lernkurve: Wochen Training

Die Bedeutung 2026

Prompts diktieren

Sie sprechen normales Englisch an einen KI-Agenten, und er schreibt die Syntax. „Add a retry with exponential backoff to the fetch helper and cover it with a test“ ist eine vollständige Anweisung. Keine Grammatik zu lernen.

Tools: Jedes genaue Diktier-Tool, plus Claude Code, Cursor, Copilot

Lernkurve: Keine

Der Entwickler, dessen Artikel derzeit auf der ersten Google-Seite für diesen Begriff steht, fasste den Wandel in einem Satz, und es ist die klarste Formulierung dazu:

Instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.

dev.to, „I Ditched My Keyboard for Voice Coding“, April 2026

Lesen Sie das genau, denn darin steckt die praktische Konsequenz. Was Voice Coding schwer machte, war nie das Sprechen. Es war, dass Code eine schlechte Sache ist, um sie laut auszusprechen. Satzzeichen, Großschreibung, Verschachtelung und Symbolnamen müssen explizit gesprochen werden, deshalb brauchten die alten Tools eine Befehlsgrammatik und deshalb dauerte das Lernen Wochen. Wenn die Syntax von einem Modell erzeugt wird, gilt nichts davon. Sie diktieren einen Satz, und Sätze zu diktieren ist seit einer Weile gelöst.

Warum das für die Tool-Wahl zählt

Wenn Sie Prompts statt Syntax diktieren, bringt Ihnen ein spezialisiertes Voice-Coding-Tool nichts. Was Sie brauchen, ist ein genaues allgemeines Diktier-Tool, das in jedes Feld mit Fokus tippt, weil die Prompt-Box nur eine der Boxen ist, die Sie an einem Tag füllen. Das ist eine andere Produktkategorie, und eine deutlich günstigere.

Wie sich die Bedeutung verschoben hat, mit Daten

Das ist kein Bauchgefühl. Jeder dieser Punkte ist nachprüfbar, und zusammen zeigen sie eine fünfzehn Jahre alte Accessibility-Praxis, die von etwas ergänzt und dann zahlenmäßig überholt wird, das zufällig denselben Namen trägt.

2000

Programming by Voice kommt in die Literatur

Das ACM-Paper „Programming by voice, VocalProgramming“ erscheint und wird bis heute 77-mal zitiert. Voice Coding beginnt als Accessibility-Forschungsproblem.

Oktober 2020

Talon wird die Praxis-Antwort

Josh Comeau veröffentlicht seinen Bericht über freihändiges Coding mit Talon Voice. Für die nächsten fünf Jahre ist das die kanonische Referenz, und sie handelt ausschließlich vom Diktieren von Syntax.

Dezember 2022

Atom wird eingestellt

GitHub stellt Atom ein. Serenade, das heute noch auf Platz drei für Voice Coding steht, listet Atom weiterhin als unterstützten Editor auf der Startseite.

Juni 2024

Serenade wird still

Der letzte Commit geht an serenadeai/serenade, mit 26 offenen Issues. Das Repository ist nicht archiviert, deshalb taucht es weiter in Empfehlungen auf.

April 2026

Die Definition kippt öffentlich

Ein dev.to-Artikel, der jetzt auf Seite eins steht, formuliert die neue Prämisse direkt: „instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.“

September 2026

Beide Zweige leben, einer wächst

Das Community-Repository von Talon wird am 2. September aktualisiert. Parallel liefert Claude Code /voice-Diktat und VS Code ein On-Device-Diktier-Modell. Suchen nach Voice Coding liegen 23 % über dem Vorjahr.

Die Tools, und was jedes wirklich abdeckt

Genauigkeit ist nicht mehr die Achse, die sie trennt. Alle aktuellen Optionen transkribieren gewöhnliches technisches Englisch gut. Was sie trennt, ist Scope: wie viel von Ihrem Tag ein Tool abdeckt, und ob es am Rand eines Programms endet.

ToolWo es funktioniertLäuft aufSendet für SiePreis
BlabbyAI LogoBlabbyAI
Jedes Textfeld, systemweitWindows-App, Chrome-ErweiterungNie, Sie drücken Enter8,49 $/Monat
Claude Code /voice LogoClaude Code /voice
Nur Claude-Code-PromptCLI und VS-Code-ErweiterungJa im Tap-ModusInklusive mit Claude.ai
VS Code dictation LogoVS Code dictation
VS-Code-Editor und ChatOn-Device-ModellNeinKostenlos
Wispr Flow LogoWispr Flow
Jedes Textfeld, systemweitMac, Windows, iOS, AndroidNein15 $/Monat
Talon Voice
Volle freihändige SteuerungMac, Windows, LinuxBefehlsgetriebenKostenlos, bezahlte Beta
Serenade
Syntax-Befehle in EditorenLetzter Push Juni 2024BefehlsgetriebenKostenlos, Open Source

Zwei Zeilen in dieser Tabelle verdienen einen eigenen Absatz, weil beide regelmäßig von Artikeln empfohlen werden, die nicht nachgeprüft haben.

Serenade steht auf Platz drei und hat 2024 aufgehört zu liefern

Serenade ist ein Open-Source-Voice-Coding-Tool auf Platz drei bei Google für diesen Begriff, und das heißt: Ein großer Teil der Leute, die Voice Coding recherchieren, wird direkt dorthin geschickt. Sein GitHub-Repository, serenadeai/serenade, bekam den letzten Push am 11. Juni 2024, mit 26 noch offenen Issues. Das Repository ist nicht archiviert, und genau deshalb wird es weiter empfohlen: Nichts darauf kündigt an, dass die Arbeit gestoppt hat.

Es gibt ein zweites Indiz auf der Marketing-Seite selbst. Serenade listet die unterstützten Editoren prominent, und Atom steht noch dabei. GitHub hat Atom im Dezember 2022 eingestellt. Eine Seite, die Support für einen Editor bewirbt, der seit fast vier Jahren tot ist, ist eine Seite, die niemand mehr angefasst hat.

$ gh api repos/serenadeai/serenade --jq .pushed_at

2024-06-11T20:08:49Z

$ gh api repos/talonhub/community --jq .pushed_at

2026-09-02T08:27:58Z

Die tatsächliche Aktivität eines Projekts prüft man mit einem Befehl, und das lohnt sich, bevor Sie einen Workflow auf irgendein Tool bauen.

Nichts davon heißt, dass Serenade heute nicht läuft. Es heißt, dass die Empfehlung, die Sie gelesen haben, wahrscheinlich geschrieben wurde, bevor das Projekt still wurde, und dass Sie das Repository selbst prüfen sollten statt einem Suchranking zu vertrauen. Derselbe Befehl klärt das für jedes Tool in dieser Kategorie.

Talon lebt, und es ist ein anderes Produkt

Der Kontrast zählt, weil Talon Voice oft in Takes vom Typ „Voice Coding ist tot“ mitgeschoben wird. Das ist es nicht. Sein Community-Repository wurde am 2. September 2026 aktualisiert, und es bleibt das Tool, auf das sich Menschen verlassen, die wirklich keine Tastatur nutzen können. Talon konkurriert nicht wirklich mit Diktier-Apps: Es ersetzt Maus und Tastatur komplett, mit gesprochenen Befehlen für Navigation, Auswahl, Fenstermanagement und Syntax. Das ist eine deutlich größere und schwerere Aufgabe, deshalb hat es eine Lernkurve und deshalb hat es nichts anderes ersetzt.

Die Wahl zwischen beiden

Wenn Ihr Ziel ist, weniger zu tippen, nutzen Sie allgemeines Diktat, weil der Großteil dessen, was Sie an einem Tag tippen, Prosa ist. Wenn Ihr Ziel ist, gar keine Tastatur zu nutzen, lernen Sie Talon. Das sind keine konkurrierenden Antworten auf eine Frage, sondern Antworten auf zwei.

Was Ihr Editor schon mitbringt

Bevor Sie für irgendetwas bezahlen, lohnt es sich zu wissen, dass zwei der Orte, an denen Entwickler am meisten diktieren, schon Diktat eingebaut haben, und dass sie entgegengesetzte Designentscheidungen getroffen haben. Beides unten aus der Dokumentation der Hersteller selbst gelesen.

HostEingebautes DiktatAudio verarbeitetWo es endet
Claude Code CLI LogoClaude Code CLI
Ja, /voiceAnthropic-ServerBraucht Claude.ai-Konto. Kein SSH, kein Web. Stoppt nach 2 Minuten.
VS Code LogoVS Code
Ja, Ctrl+Alt+VAuf dem Gerät, offlineNur innerhalb von VS Code. Nicht in Remote-SSH über die Claude-Erweiterung.
Cursor LogoCursor
Kein First-Party-DiktatNicht zutreffendBraucht ein systemweites Tool oder die OS-Diktat-Taste.
Claude Logo

Claude Code hat /voice, mit drei Grenzen, die man kennen sollte

Claude Code liefert Diktat, das Sie mit /voice einschalten. Es bietet zwei Modi: Hold-Modus, bei dem Sie Space halten während Sie sprechen, und Tap-Modus, bei dem Sie einmal tippen zum Start und nochmal zum Senden. Die Transkription ist auf Coding-Vokabular abgestimmt, und Anthropics Dokumentation merkt an, dass Projektname und aktueller Git-Branch automatisch als Erkennungshinweise hinzugefügt werden, ein wirklich durchdachtes Detail.

> /voice

Voice mode enabled (hold). Hold space to record.

Dictation language: en (/config to change).

Quelle: Claude-Code-Dokumentation, code.claude.com/docs/en/voice-dictation

Die drei Grenzen stehen alle klar in demselben Dokument, und jede schließt ein reales Arbeitssetup aus. Die erste betrifft die Authentifizierung:

A Claude.ai account: the speech-to-text service is only available when you authenticate with one, and is not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry.

Claude-Code-Dokumentation, Voice dictation, Requirements

Das ist in der Praxis ein großer Ausschluss. Viele Engineering-Organisationen leiten Claude Code über Bedrock oder einen direkten API-Key aus Abrechnungs- und Compliance-Gründen, und jeder Entwickler in diesen Organisationen liegt komplett außerhalb des eingebauten Diktats.

Die zweite betrifft, wo Sie arbeiten. Diktat braucht ein lokales Mikrofon, deshalb läuft es nicht in Claude Code im Web oder über SSH. Die VS-Code-Erweiterung hat dasselbe Problem aus demselben Grund: Die Dokumentation erklärt, sie sei in Remote-SSH, Dev Containers und Codespaces nicht verfügbar, „because the microphone is on your local machine and the extension runs on the remote host“. Wenn Ihre Entwicklungsumgebung in einem Container oder auf einer Remote-Box lebt, was zunehmend normal ist, scheidet das aus.

Die dritte ist ein Timer. Die Aufnahme „stops automatically after 15 seconds of silence or two minutes total“. Zwei Minuten sind viel Sprache für eine Chat-Nachricht und nicht besonders viel für den Prompt-Typ, der vom Sprechen wirklich profitiert, wo Sie einen Bug beschreiben, die drei Dinge, die Sie schon versucht haben, und die Grenze, die der Fix einhalten muss. Sechzehn Sekunden nachdenken beendet die Aufnahme.

Das, was Leute überrascht

Das Diktat von Claude Code ist nicht lokal. Die Dokumentation sagt es direkt: „Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally.“ Das ist für ein Cloud-Tool unauffällig, aber es lohnt sich zu wissen, wenn Sie angenommen haben, eine CLI auf Ihrem Rechner würde auf Ihrem Rechner transkribieren.

VS Code Logo

VS Code ging den anderen Weg und machte es offline

Das eingebaute Diktat von VS Code ist die interessanteste Option in dieser ganzen Kategorie und die am wenigsten besprochene, weil es den entgegengesetzten Trade zu allen anderen gemacht hat. Es ist standardmäßig an, wenn KI-Funktionen aktiv sind, gestartet mit Ctrl+Alt+V im Editor oder Ctrl+I im Chat, und das Modell läuft dort, wo Sie sitzen:

Dictation uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service. After the initial model download, speech recognition does not require an internet connection.

Visual-Studio-Code-Dokumentation, Voice support

Für Entwickler, deren Einwand gegen Diktat ist, dass Audio den Rechner verlässt, ist das die Antwort, und sie ist schon installiert. Es kostet nichts und braucht kein Konto. Es gibt einen Hinweis in derselben Dokumentation: Eine optionale Einstellung namens llmCleanup sendet den Transkript-Text, allerdings nicht das Audio, an ein Sprachmodell zur Bereinigung. Lassen Sie das aus, verlässt nichts das Gerät.

Die Grenze ist die offensichtliche, und genau deshalb ist das nicht das Ende des Artikels. Es diktiert in VS Code. Ihre Pull-Request-Beschreibung liegt im Browser. Ihr Ticket liegt in Jira. Ihre Antwort an die Person, die reviewed hat, liegt in Slack. Ihre Antwort an den Kunden, der den Bug gemeldet hat, liegt in einem Support-Tool. An einem typischen Tag ist der Editor nicht der Ort, an dem die meisten Ihrer Worte landen.

Der Großteil dessen, was ein Entwickler tippt, ist kein Code

Das ist der Punkt, den die ganze Kategorie ständig verfehlt, und deshalb schlägt Scope Genauigkeit bei der Tool-Wahl. Denken Sie ehrlich an einen Arbeitstag und zählen Sie, wohin die Worte gehen. Sehr wenig davon ist Syntax, und fast alles Übrige ist Prosa, die gesprochen schneller wäre.

Agent-Prompts

Der Teil, der länger geworden ist, je besser die Agenten wurden. Absicht, Grenzen und was Sie schon ausgeschlossen haben zu beschreiben, ist reine Prosa, und das ist inzwischen ein großer Anteil der Arbeit.

Pull-Request-Beschreibungen

Kontext, Begründung, worauf ein Reviewer zuerst schauen soll. Geschrieben in einem Browser-Textfeld, nicht im Editor.

Code-Review-Kommentare

Erklären, warum sich etwas ändern sollte, braucht mehr Worte als die Änderung selbst. In GitHub oder GitLab, im Browser.

Tickets und Standups

Jira, Linear, Slack. Kurz, häufig, und unverhältnismäßig nervig zu tippen, weil sie etwas anderes unterbrechen.

Dokumentation und READMEs

Das, was alle aufschieben. Einen Erstentwurf sprechen und aufräumen schlägt das Starren auf eine leere Datei.

Commit-Messages

Besonders der Body, wo die Begründung hingehört und wo sie meist nie landet.

Jedes davon ist Prosa, und bei Prosa gewinnt Sprache klar. Angenehmes Sprechen liegt bei etwa 130 bis 150 Wörtern pro Minute gegen grob 40 beim durchschnittlichen Tippen. Die zugrunde liegende Forschung haben wir in unserem Stück zu Wörtern pro Minute beim Sprechen durchgegangen, und die Kurzfassung lautet: Die Lücke ist bei Sätzen real und verschwindet bei Symbolen.

Merken Sie, was das für die Tool-Wahl heißt. Ein Tool, das nur auf Ihren Editor beschränkt ist, deckt den kleinsten Teil dieser Liste ab. Ein Tool, das auf einen Agenten beschränkt ist, deckt einen Punkt ab. Ein Tool, das in jedes Feld mit Cursor tippt, deckt alle sechs ab, und es ist das günstigste der drei.

BlabbyAI Logo

BlabbyAI: Diktat, dem egal ist, in welchem Programm Sie sind

BlabbyAI baut auf der Annahme oben: Die sinnvolle Einheit ist nicht „Diktat fürs Coding“, sondern Diktat überall, weil der Editor ein Fenster unter einem Dutzend ist. Drücken Sie Ctrl+Space, sprechen Sie, drücken Sie nochmal, und der Text wird in das Feld getippt, das Fokus hatte. Das Feld kann der Claude-Code-Prompt sein, Cursors Composer, eine GitHub-Review-Box, eine Jira-Beschreibung, ein Slack-Thread oder ein Terminal. Es gibt nichts zu integrieren, weil es keine Integration gibt: Es tippt dorthin, wo Ihr Cursor schon steht.

BlabbyAI-Tastenkürzel-Einstellungen mit dem globalen Aufnahme-Shortcut

Das globale Kürzel lässt sich unter Settings umbinden, und das zählt hier: Ctrl+Space ist in den meisten Editoren IntelliSense, deshalb verschieben Entwickler es meist.

Dieses Default lohnt sich zu markieren statt darüber hinwegzugehen. Ctrl+Space ist der Autocomplete-Trigger in VS Code, IntelliJ und den meisten Editoren, deshalb ist das das Erste, was ein Entwickler ändern sollte. Ein Klick unter Settings, und es gibt keinen Grund, die Kollision stehen zu lassen.

Custom Modes sind der Teil, der zu diesem Workflow passt

Ein Mode ist eine freie Anweisung, die auf das angewendet wird, was Sie gerade gesagt haben, nach der Transkription und bevor der Text getippt wird. Sie schreiben die Anweisung einmal, weisen ein Kürzel zu, und ab dann erzeugt dieses Kürzel Sprache in dieser Form. Ihre Sprache ist der Input, keine Anfrage: Ein Mode formt um, was Sie gesagt haben, statt es zu beantworten.

Für Entwickler ist das nützlicher, als es zuerst klingt, weil die Schreibaufgaben in der Liste oben jeweils einen Hausstil haben, und das Umformatieren ist, was sie mühsam macht. Ein paar Anweisungen, die echte Arbeit leisten:

Mode-AnweisungWas Sie sagenWas getippt wird
Als Conventional Commit mit Typ-Präfix und Body umschreiben, der erklärt warum„fixed the retry loop, it was hammering the API when the token expired“Eine fix:-Subject-Zeile mit der Begründung im Body
Als PR-Beschreibung mit Summary und Testing-Abschnitt formatierenIhr gesprochener Walkthrough der ÄnderungStrukturiertes Markdown mit den Überschriften schon da
Füllwörter und Fehlstarts streichen, alles andere wörtlich behaltenEin langer, umschweifender Agent-Prompt laut gedachtDerselbe Prompt ohne Ähs und Neustarts
Wenn ich „new bullet“ sage, einen neuen Listenpunkt starten statt diese Worte zu schreiben„the cache is stale new bullet the TTL is wrong“Zwei echte Aufzählungspunkte
Der BlabbyAI-Mode-Editor mit freiem KI-Anweisungsfeld, Name und Modellwahl

Ein Mode ist eine Anweisung plus ein Kürzel. Die letzte Zeile oben zeigt, wie gesprochene Befehle funktionieren: Sie beschreiben sie in der Anweisung, statt auf eine feste Befehlsliste zu setzen.

Bei der letzten Zeile lohnt es sich zu verweilen, weil das der Mechanismus ist, den Leute falsch verstehen. Das Modell bekommt Ihr volles wörtliches Transkript, inklusive Worte, die Sie als Befehle meinten, deshalb können Sie Ihr eigenes gesprochenes Vokabular definieren, indem Sie es in der Anweisung beschreiben. „New paragraph“, „bullet point“, „scratch that“: Keines davon ist eine eingebaute Funktion, und alle funktionieren, weil Sie definieren, was sie bedeuten.

Ihm Ihr Codebase-Vokabular beibringen

Der vorhersehbare Einwand gegen Diktat irgendwo in der Nähe von Code sind Eigennamen. Ihr interner Service heißt etwas, das außerhalb der Firma niemand gehört hat, und kein allgemeines Modell schreibt das richtig. Custom Spelling löst das: Begriff einmal unter Settings, dann Languages hinzufügen, genau so getippt, wie er geschrieben werden soll, und ab dann wird er gematcht. Library-Namen, Service-Namen, der Nachname eines Kollegen, ein Akronym, das Ihr Team erfunden hat. Blabby unterstützt außerdem 90+ Sprachen mit Auto-Detect, was in verteilten Teams zählt, in denen Leute in einer Sprache denken und in einer anderen shippen.

Es drückt nie Enter

Blabby schreibt Text in das fokussierte Feld und hört dort auf. Es klickt keine Buttons, sendet keine Formulare und drückt kein Enter. Für einen Agent-Prompt ist das das gewünschte Verhalten: Ihre Worte landen in der Box und warten, sodass Sie eine lange Anweisung nachlesen können, bevor Sie sie senden, statt dass sie abgefeuert wird, sobald Sie aufhören zu reden.

Zwei Produkte, und das Browser-Produkt braucht keine Installation

Die Windows-Desktop-App ist das vollere Produkt: Sie tippt systemweit in jede Anwendung und hat History, die jede Aufnahme im Moment des Stopps auf Ihre eigene Festplatte schreibt, bevor die Transkription beginnt. Nichts an History berührt einen Server, und Sie können jede vergangene Aufnahme später abspielen oder neu transkribieren, optional durch einen anderen Mode.

Die Chrome-Erweiterung ist die andere Hälfte, und für viele Entwickler ist genau sie die passende. Wenn Ihr Agent die Web-Ansicht von Cursor ist, wenn Ihre Reviews in GitHub passieren, wenn Ihre Tickets in Linear und Ihre Docs in Notion liegen, dann liegt alles, was Sie diktieren, schon in einem Browser-Tab. Die Erweiterung zeigt eine kleine Bubble neben dem fokussierten Textfeld und braucht keinen Download und keine Admin-Rechte, und das ist der Unterschied zwischen Arbeiten und Nicht-Arbeiten auf einem verwalteten Laptop. Es ist auch die Option für Mac und Chrome OS. Beides deckt derselbe 8,49 $-Monatspreis ab, und der Gratis-Tarif sind 60 Credits pro Woche ohne Karte.

Ein Setup, das funktioniert, in etwa zehn Minuten

Nichts davon verlangt, dass Sie sich auf einen Workflow festlegen, bevor Sie wissen, ob er Ihnen gefällt. Die Reihenfolge zählt ein Stück: Bringen Sie Diktat zuerst bei Prosa zum Laufen, weil dort der Gewinn offensichtlich ist, und entscheiden Sie erst danach, ob Sie etwas Spezielleres wollen.

  1. Binden Sie das Kürzel um, bevor Sie sonst etwas tun. Welches Tool Sie auch wählen: Legen Sie es irgendwohin, wo Ihr Editor es nicht schon nutzt. Ctrl+Space ist Autocomplete, und Ctrl+Alt+V kann schon belegt sein. Zehn Sekunden jetzt sparen eine Woche Kollisionen.
  2. Starten Sie mit einer Pull-Request-Beschreibung, nicht mit einem Prompt. Sie ist lang, sie ist Prosa, sie ist risikoarm, und sie ist die Aufgabe, bei der der Geschwindigkeitsunterschied unmöglich zu übersehen ist. Wenn Diktat für Sie funktionieren wird, wissen Sie es am Ende eines PRs.
  3. Fügen Sie Ihre fünf schlimmsten Wörter dem Wörterbuch hinzu. Der Service-Name, die Library, das Akronym, der Nachname. Fünf Einträge nehmen den Großteil der Reibung weg, wegen der Leute aufhören.
  4. Dann versuchen Sie es an einem Agent-Prompt, und seien Sie spezifischer, als Sie tippen würden. Das ist der eigentliche Unlock. Weil Sprechen etwa dreimal so schnell ist wie Tippen, ist der Prompt, den Sie sprechen, von Natur aus länger und detaillierter als der, den Sie getippt hätten, und Agenten reagieren gut darauf. Sagen Sie die Grenze. Sagen Sie, was Sie schon versucht haben. Sagen Sie, was der Fix nicht kaputt machen darf.
  5. Erst dann freihändige Tools in Betracht ziehen. Wenn Ihr Bedarf medizinisch ist statt Bequemlichkeit, kommt hier Talon rein, und es verdient eine echte Zeitinvestition statt eines Nachmittags.

Die Gewohnheit, die es funktionieren lässt

Sprechen Sie den Prompt, den Sie gedacht und dann abgekürzt hätten. Die meisten schwachen Agent-Prompts sind schwach, weil sie auszuschreiben mühsam war, nicht weil der Entwickler den Kontext nicht kannte. Die Tippkosten wegzunehmen nimmt den Grund weg, abzukürzen.

Wo Sprechen immer noch das falsche Werkzeug ist

Ein Guide, der behauptet, Stimme gewinne überall, ist nicht lesenswert, und die Grenzen hier sind klar genug, um sie zu nennen.

Rohe Syntax tippt man weiterhin schneller, für jeden, der kompetent tippt. const [x, setX] = useState(0) laut auszusprechen ist in jedem Tool eine schlechtere Erfahrung als tippen, und keine Modellverbesserung ändert das, weil der Engpass die gesprochene Form von Satzzeichen ist und nicht die Erkennung. Präzise Edits haben dasselbe Problem: Den Cursor drei Zeichen nach links zu bewegen ist ein Tastendruck und ein Satz.

Es gibt auch eine Umgebungsgrenze, die keine Herstellerseite erwähnt. Diktat setzt voraus, dass Sie reden können. Im Großraumbüro, im Zug oder im gemeinsamen Zimmer zu Hause mit jemandem, der schläft, fällt diese Annahme aus, und sie fällt für ganze Tage aus, nicht nur gelegentlich. Das ist ein echter Grund, warum Leute Diktier-Tools aufgeben, und er hat nichts mit der Software zu tun.

Die ehrliche Fassung lautet: Diktat ist eine zweite Eingabemethode, kein Ersatz. Sie tippen weiter und sprechen die Teile, die Sätze sind. Das ist eine kleinere Behauptung als die meiste Kategorie macht, und es ist die, die Kontakt mit einer Arbeitswoche überlebt.

Funktioniert Voice Coding also?

Beide Varianten funktionieren, für unterschiedliche Menschen, und der Grund, warum die Frage ungelöst wirkt, ist, dass es eigentlich zwei Fragen sind.

Syntax zu diktieren funktioniert, funktioniert seit Jahren und bleibt anspruchsvoll. Talon wird aktiv gepflegt und ist die richtige Antwort, wenn Sie keine Tastatur nutzen können, aber es ist eine Fertigkeit, die man erwirbt, kein Tool, das man installiert. Wer Ihnen erzählt, diese Variante sei mühelos, hat sie nicht gemacht.

Anweisungen an einen Agenten zu diktieren funktioniert sofort, braucht kein Training und ist das, was der Begriff jetzt vorwiegend meint. Es hat auch eine Konsequenz, die die Tool-Diskussion oft überspringt: Weil das, was Sie sprechen, Prosa ist, ist das Tool, das Sie brauchen, gar kein Coding-Tool. Es ist genaues Diktat, das Ihrem Cursor in jedes Fenster folgt, in dem Sie sind, weil die Prompt-Box einer von vielleicht sechs Orten ist, an denen Ihre Worte an einem Tag landen.

Das ist der ganze Wandel, und deshalb liegt ein Begriff, der fünfzehn Jahre Nische war, 23 % über dem Vorjahr. BlabbyAI deckt diesen Job für 8,49 $ im Monat ab, unter Windows oder in Chrome, und der Gratis-Tarif reicht, um herauszufinden, ob Ihnen das Sprechen Ihrer Prompts gefällt, bevor Sie für irgendetwas bezahlen. Wenn Sie den breiteren Vergleich wollen, halten wir einen Überblick der besten Diktier-Apps, und einen Guide zu Diktat für Programmierer, der tiefer in die Alltags-Schreibseite geht.

Häufig gestellte Fragen

Was ist Voice Coding?

Der Begriff deckt heute zwei verschiedene Praktiken ab, und die meiste Verwirrung entsteht, weil man sie vermischt. Die ältere Bedeutung ist, Code selbst zu diktieren: Man spricht eine Befehlssprache, und eine spezialisierte Engine macht daraus Syntax, sodass „camel case new function get user by id“ zu getUserById() wird. Talon Voice und Serenade arbeiten so, und das braucht Wochen Übung. Die neuere Bedeutung, die 2026 fast alle meinen, ist: Anweisungen an einen KI-Coding-Agenten wie Claude Code, Cursor oder Copilot sprechen und den Agenten die Syntax schreiben lassen. Diese zweite Variante braucht gar keine Syntax-Engine, weil man englische Prosa in ein Textfeld diktiert. Jedes genaue allgemeine Diktier-Tool reicht, deshalb ist die Einstiegshürde eingebrochen. BlabbyAI tippt Ihre Sprache in jedes Feld mit Cursor, inklusive Agent-Prompt-Box, für 8,49 $ im Monat.

Kann man wirklich Code mit der Stimme schreiben?

Ja, aber die ehrliche Antwort hängt davon ab, welche der beiden Praktiken Sie meinen. Rohe Syntax per Stimme zu diktieren funktioniert, und Menschen machen das hauptberuflich, vor allem mit Talon Voice, dessen Community-Repository im September 2026 noch aktualisiert wurde. Man muss eine Befehlsgrammatik lernen, und das ist wirklich langsam am Anfang, deshalb blieb es fünfzehn Jahre Nische. Anweisungen an einen KI-Agenten zu diktieren funktioniert dagegen sofort ohne Training, weil man normale Sätze spricht wie „add a retry with exponential backoff to the fetch helper and cover it with a test“. Der Agent erzeugt die Syntax. Entwickler, die Voice Coding vor Jahren ausprobiert und aufgegeben haben, haben meist die erste Variante gemeint. Die zweite ist eine andere Tätigkeit, die zufällig denselben Namen trägt.

Hat Claude Code eine Spracheingabe?

Ja. Claude Code hat eingebautes Diktat, das Sie mit dem Befehl /voice aktivieren, entweder im Hold-to-Record-Modus (Space halten während Sie sprechen) oder im Tap-Modus (einmal tippen zum Start, nochmal tippen zum Senden). Drei Grenzen sollte man kennen, bevor man sich darauf verlässt, und alle drei stehen in Anthropics eigener Dokumentation. Erstens: Es braucht ein Claude.ai-Konto und ist ausdrücklich „not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry“, ein Team auf Bedrock kann es also nicht nutzen. Zweitens: Es braucht ein lokales Mikrofon und funktioniert nicht über SSH oder in Claude Code im Web. Drittens: Die Aufnahme „stops automatically after 15 seconds of silence or two minutes total“, ein langer laut-gedachter Prompt wird also abgeschnitten. Ein systemweites Diktier-Tool hat keine dieser drei Einschränkungen, weil es egal ist, in welchem Programm der Cursor steht.

Hat VS Code eingebautes Diktat?

Ja, und es funktioniert anders als jedes Cloud-Tool in dieser Kategorie. VS Code liefert Diktat, das standardmäßig an ist, wenn KI-Funktionen aktiviert sind, gestartet mit Ctrl+Alt+V (Cmd+Option+V auf dem Mac) im Editor oder Ctrl+I im Chat. Bemerkenswert ist, wo die Verarbeitung läuft: Microsofts Dokumentation sagt, es „uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service“, und nach dem ersten Modell-Download „speech recognition does not require an internet connection“. Das macht es zur einzigen wirklich offline laufenden Option, die die meisten Entwickler schon installiert haben. Der Preis ist der Scope. Es diktiert in VS Code und nirgendwo sonst, also brauchen Pull-Request-Beschreibung, Jira-Ticket, Slack-Antwort und Terminal weiterhin etwas anderes.

Ist Voice Coding schneller als Tippen?

Bei Prosa klar ja. Angenehmes Sprechen liegt bei etwa 130 bis 150 Wörtern pro Minute gegen grob 40 Wörter pro Minute beim durchschnittlichen Tippen, und genau deshalb lohnt sich Diktat für alles Satzförmige. Bei Syntax nein, und wer etwas anderes behauptet, verkauft etwas: Satzzeichen und Camel Case auszusprechen ist für jemanden, der gut tippt, langsamer als tippen. Genau deshalb hat die Prompt-Diktat-Variante von Voice Coding abgehoben und die Syntax-Variante nicht. Prompts an einen KI-Agenten sind Prosa, liegen also auf der guten Seite dieses Verhältnisses, und genau dieser Teil der Arbeit ist länger geworden, je besser die Agenten wurden. Siehe unseren Vergleich von Sprech- und Tippgeschwindigkeit für die Zahlen dahinter.

Was ist das beste Sprache-zu-Text-Tool fürs Coding?

Die richtige Frage ist Scope, nicht Genauigkeit, weil jedes ernsthafte Tool in dieser Kategorie inzwischen genau genug ist. Wenn Sie nur in einem Editor diktieren, reicht das eingebaute Diktat kostenlos: Das von VS Code läuft auf dem Gerät. Wenn Sie den ganzen Tag diktieren, und für die meisten Entwickler heißt das Agent-Prompt, Pull-Request-Beschreibung, Jira-Kommentar, Slack-Antwort und Dokumentation, brauchen Sie ein systemweites Tool, das in jedes fokussierte Feld tippt. BlabbyAI kostet dafür 8,49 $ im Monat, mit Gratis-Tarif von 60 Credits pro Woche ohne Karte, als Windows-Desktop-App oder Chrome-Erweiterung. Wenn Sie freihändige Navigation brauchen statt Diktat, wegen RSI oder einer Mobilitätseinschränkung, ist Talon Voice die ernsthafte Antwort und nichts anderes kommt nah ran.

Wird Serenade noch gepflegt?

Scheinbar nicht. Serenade ist ein Open-Source-Voice-Coding-Tool, das bei Google für den Begriff noch weit oben steht und deshalb ständig empfohlen wird, aber sein GitHub-Repository serenadeai/serenade bekam den letzten Push am 11. Juni 2024, mehr als zwei Jahre vor diesem Artikel, mit 26 noch offenen Issues. Die eigene Website listet Atom weiterhin unter den unterstützten Editoren, und GitHub hat Atom im Dezember 2022 eingestellt. Das heißt nicht, dass die Software heute nicht läuft, und das Projekt ist nicht archiviert. Es heißt, dass man eine Empfehlung für Serenade im Jahr 2026 mit Vorsicht behandeln und das Repository selbst prüfen sollte, bevor man einen Workflow darauf baut. Talon Voice dagegen wird aktiv gepflegt: Sein Community-Repository wurde am 2. September 2026 aktualisiert.

Kann ich mit RSI oder Karpaltunnelsyndrom per Stimme coden?

Das ist der Use Case, für den Voice Coding ursprünglich gebaut wurde, und er bleibt der stärkste. Zwei Dinge helfen, und es sind unterschiedliche Tools für unterschiedliche Jobs. Um die Tastatur komplett zu ersetzen, inklusive Navigation, Auswahl und Fenstermanagement, ist Talon Voice die etablierte Antwort, hat eine aktive Community und ist das Tool, das die meisten freihändig arbeitenden Entwickler wirklich nutzen. Um die Tipplast zu senken statt sie zu eliminieren, erledigt allgemeines Diktat den Großteil der Arbeit ohne Lernkurve, weil der Großteil dessen, was ein Entwickler an einem Tag tippt, Prosa ist und keine Syntax: Prompts, Reviews, Tickets, Nachrichten, Docs. Diesen Anteil rauszunehmen reicht oft. Wir haben einen eigenen Guide zum Tippen mit Karpaltunnelsyndrom, der die Setup-Seite abdeckt.

Kann Diktat Fachbegriffe und Variablennamen?

Besser als früher, und genau dieses Handling trennt Tools heute am stärksten. Claude Code sagt, seine Transkription sei „tuned for coding vocabulary“ und Begriffe wie regex, OAuth, JSON und localhost werden erkannt, dazu kommen Projektname und aktueller Git-Branch automatisch als Erkennungshinweise. Allgemeine Tools lösen das mit einem eigenen Wörterbuch. BlabbyAI hat eine Custom-Spelling-Funktion: Begriff einmal unter Settings, dann Languages hinzufügen, und ab dann wird er gematcht, so lehren Sie interne Service-Namen, eine ungewöhnliche Library oder den Namen eines Kollegen. Was kein Tool gut kann, sind rohe Identifier als Syntax gesprochen, also getUserById Zeichen für Zeichen bleibt überall holprig. Im Agent-Workflow brauchen Sie das nie, weil Sie „the get user by ID helper“ sagen und das Modell es auflöst.

Kann Diktat den Prompt für mich absenden?

Manche Tools tun das automatisch, und ob Sie das wollen, ist eine echte Präferenz und keine Feature-Lücke. Der Tap-Modus von Claude Code sendet den Prompt, sobald das Transkript mindestens drei Wörter hat, und der Hold-Modus kann dasselbe mit einer autoSubmit-Einstellung. Der Entwickler, dessen dev.to-Artikel auf Seite eins für Voice Coding steht, nannte genau das als Grund, vom eingebauten Voice wegzugehen: Das Problem, schrieb er, „is that it automatically sends the message when you finish talking, so you don't have time to actually think“. BlabbyAI sendet nie. Es ist ein Diktier-Tool und schreibt nur Text in das fokussierte Feld, Ihre Worte landen in der Prompt-Box und bleiben, bis Sie selbst Enter drücken. Für einen langen Agent-Prompt, den Sie vor dem Senden noch lesen wollen, ist genau das das gewünschte Verhalten.

Sprechen Sie Ihren nächsten Agent-Prompt

BlabbyAI tippt in jedes fokussierte Feld, unter Windows oder in Chrome, und drückt nie Enter für Sie. 8,49 $ im Monat, oder 60 Credits pro Woche gratis ohne Karte.

Add BlabbyAI to Chrome