Atualizado 3 de setembro de 2026 · Por Sumbat.T

Voice Coding em 2026: a palavra agora quer dizer outra coisa

Um microfone de mesa ao lado de um laptop mostrando um arquivo Python em um editor de código

A resposta curta

  • Voice coding antes significava ditar sintaxe. Em 2026, na maior parte, significa falar prompts a um agente de IA. São atividades diferentes com o mesmo nome, e quase toda discussão sobre se voice coding funciona é na verdade duas pessoas falando de coisas distintas.
  • A versão nova não precisa de software especial. Você está ditando prosa em inglês em um campo de texto, então qualquer ferramenta de ditado precisa já serve. Por isso a barreira caiu de semanas de prática para zero. BlabbyAI digita em qualquer campo em foco, inclusive o prompt de um agente, por $8.49/mês com plano gratuito.
  • A versão antiga não morreu, só ficou mais estreita. O Talon Voice é mantido ativamente e continua sendo a resposta para trabalho genuinamente mãos livres. O Serenade, que ainda aparece em terceiro no Google para esse termo, teve o último commit em junho de 2024.
  • Existe ditado integrado no Claude Code e no VS Code, com limites reais. O do Claude Code precisa de conta Claude.ai, não roda via SSH e para a gravação depois de dois minutos. O do VS Code roda no dispositivo e offline, mas só dentro do VS Code.

Ditado que funciona na caixa de prompt e em todo o resto

ChatGPTGoogle DocsGmailWhatsAppMicrosoft Word

Microphone

O prompt do seu agente é prosa. Fale.

O BlabbyAI digita em qualquer campo com o cursor, seja Claude Code, Cursor, descrição de pull request ou ticket no Jira. Nunca aperta Enter por você. 60 créditos por semana grátis, sem cartão.

Add BlabbyAI to Chrome

Duas atividades, um nome

Se você buscou voice coding há cinco anos e de novo esta semana, recebeu respostas a duas perguntas diferentes. A expressão foi reaproveitada em silêncio, e ninguém anunciou. Vale desemaranhar isso antes de qualquer outra coisa, porque o sentido que você tem em mente decide se a resposta é "isso leva um mês para aprender" ou "você pode começar nos próximos dez minutos".

O sentido de 2000 a 2022

Ditar sintaxe

Você fala uma gramática de comandos e um motor transforma isso em código. "Camel case new function get user by ID" produz getUserById(). Exige ferramenta especializada, vocabulário aprendido e semanas de prática.

Ferramentas: Talon Voice, Serenade, VoiceCode, Dragon com gramáticas customizadas

Curva de aprendizado: Semanas de treino

O sentido de 2026

Ditar prompts

Você fala inglês comum a um agente de IA e ele escreve a sintaxe. "Add a retry with exponential backoff to the fetch helper and cover it with a test" é uma instrução completa. Nenhuma gramática para aprender.

Ferramentas: Qualquer ditado preciso, mais Claude Code, Cursor, Copilot

Curva de aprendizado: Nenhuma

O desenvolvedor cujo texto hoje aparece na primeira página do Google para esse termo resumiu a mudança em uma frase, e é a declaração mais clara dela em qualquer lugar:

Instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.

dev.to, "I Ditched My Keyboard for Voice Coding", abril de 2026

Leia com cuidado, porque aí está a consequência prática. O que tornava o voice coding difícil nunca foi falar. Era o fato de que código é uma coisa péssima de dizer em voz alta. Pontuação, maiúsculas, aninhamento e nomes de símbolos precisam ser falados de forma explícita, por isso as ferramentas antigas precisavam de uma gramática de comandos e por isso aprender uma levava semanas. Quando a sintaxe é gerada por um modelo, nada disso se aplica. Você está ditando uma frase, e ditar frases já é um problema resolvido há um tempo.

Por que isso importa na escolha da ferramenta

Se você está ditando prompts e não sintaxe, uma ferramenta especializada de voice coding não compra nada. O que você precisa é de um ditado geral preciso que digite em qualquer campo em foco, porque a caixa de prompt é só uma das caixas que você preenche num dia. Essa é outra categoria de produto, e bem mais barata.

Como o sentido mudou, com datas

Isso não é vibe. Cada um desses pontos é verificável, e juntos mostram uma prática de acessibilidade de quinze anos sendo acompanhada, e depois numericamente ultrapassada, por algo que por acaso compartilha o nome.

2000

A programação por voz entra na literatura

O artigo da ACM "Programming by voice, VocalProgramming" é publicado e ainda é citado 77 vezes. O voice coding nasce como um problema de pesquisa em acessibilidade.

Outubro de 2020

O Talon vira a resposta dos praticantes

Josh Comeau publica seu relato de coding mãos livres com o Talon Voice. Pela maior parte dos cinco anos seguintes essa é a referência canônica, e trata só de ditar sintaxe.

Dezembro de 2022

O Atom é encerrado

O GitHub aposenta o Atom. O Serenade, que ainda aparece em terceiro para voice coding hoje, ainda lista o Atom como editor suportado na página inicial.

Junho de 2024

O Serenade fica quieto

O último commit é enviado a serenadeai/serenade, com 26 issues abertas. O repositório não está arquivado, então continua aparecendo em recomendações.

Abril de 2026

A definição vira em público

Um texto no dev.to que agora aparece na primeira página enuncia a nova premissa diretamente: "instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable."

Setembro de 2026

Os dois ramos estão vivos, um está crescendo

O repositório da comunidade do Talon recebe push em 2 de setembro. Enquanto isso, o Claude Code entrega ditado /voice e o VS Code entrega um modelo de ditado no dispositivo. Buscas por voice coding sobem 23% em relação ao ano anterior.

As ferramentas, e o que cada uma realmente cobre

Precisão não é mais o eixo que separa essas opções. Todas as atuais transcrevem inglês técnico comum bem. O que as separa é o alcance: quanto do seu dia uma ferramenta cobre, e se ela para na borda de um programa.

FerramentaOnde funcionaRoda emEnvia por vocêPreço
Logo do BlabbyAIBlabbyAI
Qualquer campo de texto, em todo o sistemaApp Windows, extensão ChromeNunca, você aperta Enter$8.49/mês
Logo do Claude Code /voiceClaude Code /voice
Só o prompt do Claude CodeCLI e extensão VS CodeSim no modo tapIncluído com Claude.ai
Logo do VS Code dictationVS Code dictation
Editor e chat do VS CodeModelo no dispositivoNãoGrátis
Logo do Wispr FlowWispr Flow
Qualquer campo de texto, em todo o sistemaMac, Windows, iOS, AndroidNão$15/mês
Talon Voice
Controle mãos livres completoMac, Windows, LinuxGuiado por comandosGrátis, plano beta pago
Serenade
Comandos de sintaxe em editoresÚltimo push em junho de 2024Guiado por comandosGrátis, open source

Duas linhas dessa tabela merecem o próprio parágrafo, porque as duas são recomendadas com frequência por artigos que não checaram.

O Serenade aparece em terceiro e parou de publicar em 2024

O Serenade é uma ferramenta open source de voice coding que fica na posição três do Google para esse termo, o que significa que uma fatia grande de quem pesquisa voice coding é apontada direto para ele. O repositório no GitHub, serenadeai/serenade, recebeu o último push em 11 de junho de 2024, com 26 issues ainda abertas. O repositório não está arquivado, e é exatamente por isso que continua sendo recomendado: nada nele anuncia que o trabalho parou.

Há um segundo sinal no próprio site de marketing. O Serenade lista os editores suportados em destaque, e o Atom ainda está entre eles. O GitHub encerrou o Atom em dezembro de 2022. Uma página que anuncia suporte a um editor aposentado há quase quatro anos é uma página que ninguém revisitou.

$ gh api repos/serenadeai/serenade --jq .pushed_at

2024-06-11T20:08:49Z

$ gh api repos/talonhub/community --jq .pushed_at

2026-09-02T08:27:58Z

Checar a atividade real de um projeto leva um comando, e vale a pena antes de montar um fluxo em cima de qualquer ferramenta.

Nada disso significa que o Serenade não rode hoje. Significa que a recomendação que você leu provavelmente foi escrita antes do projeto ficar quieto, e que você deve checar o repositório você mesmo em vez de confiar num ranking de busca. O mesmo comando resolve isso para qualquer ferramenta dessa categoria.

O Talon está vivo, e é outro produto

O contraste importa porque o Talon Voice com frequência é engolido por takes do tipo "voice coding morreu". Não morreu. O repositório da comunidade recebeu push em 2 de setembro de 2026, e continua sendo a ferramenta em que quem de fato não consegue usar teclado se apoia. O Talon não compete de verdade com apps de ditado: ele substitui mouse e teclado por completo, com comandos falados para navegação, seleção, gerenciamento de janelas e sintaxe. Isso é bem maior e mais difícil de fazer, e por isso tem curva de aprendizado e por isso nada o substituiu.

Escolhendo entre eles

Se o seu objetivo é digitar menos, use ditado geral, porque a maior parte do que você digita num dia é prosa. Se o seu objetivo é não usar teclado de jeito nenhum, aprenda o Talon. Não são respostas concorrentes a uma pergunta, são respostas a duas.

O que o seu editor já te dá

Antes de pagar por qualquer coisa, vale saber que dois dos lugares onde desenvolvedores mais ditam já têm ditado integrado, e que eles fizeram escolhas de design opostas. Os dois estão lidos em primeira mão na documentação dos próprios fornecedores abaixo.

HostDitado integradoÁudio processadoOnde para
Logo do Claude Code CLIClaude Code CLI
Sim, /voiceServidores da AnthropicPrecisa de conta Claude.ai. Sem SSH, sem web. Para após 2 minutos.
Logo do VS CodeVS Code
Sim, Ctrl+Alt+VNo dispositivo, offlineSó dentro do VS Code. Não em Remote-SSH via a extensão Claude.
Logo do CursorCursor
Sem ditado first-partyNão se aplicaPrecisa de ferramenta em todo o sistema ou da tecla de ditado do SO.
Logo do Claude

O Claude Code tem /voice, com três restrições que valem conhecer

O Claude Code traz ditado que você liga com /voice. Oferece dois modos: modo hold, em que você segura Space enquanto fala, e modo tap, em que toca uma vez para começar e de novo para enviar. A transcrição é afinada para vocabulário de coding, e a documentação da Anthropic nota que o nome do projeto e o branch git atual são adicionados automaticamente como dicas de reconhecimento, o que é um detalhe de fato cuidadoso.

> /voice

Voice mode enabled (hold). Hold space to record.

Dictation language: en (/config to change).

Fonte: documentação do Claude Code, code.claude.com/docs/en/voice-dictation

Os três limites estão declarados com clareza no mesmo documento, e cada um elimina um setup de trabalho real. O primeiro é sobre autenticação:

A Claude.ai account: the speech-to-text service is only available when you authenticate with one, and is not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry.

Documentação do Claude Code, Voice dictation, Requirements

Na prática, isso é uma exclusão grande. Muitas organizações de engenharia roteiam o Claude Code pelo Bedrock ou por uma chave de API direta por motivos de cobrança e conformidade, e todo desenvolvedor nessas organizações fica fora do ditado integrado por completo.

O segundo é sobre onde você trabalha. O ditado precisa de microfone local, então não roda no Claude Code na web nem via SSH. A extensão do VS Code tem o mesmo problema pelo mesmo motivo: a documentação explica que fica indisponível em Remote-SSH, Dev Containers e Codespaces "because the microphone is on your local machine and the extension runs on the remote host". Se o seu ambiente de desenvolvimento vive num container ou numa máquina remota, o que é cada vez mais normal, isso o elimina.

O terceiro é um timer. A gravação "stops automatically after 15 seconds of silence or two minutes total". Dois minutos são bastante fala para uma mensagem de chat e não tanto para o tipo de prompt que de fato se beneficia de ser falado, em que você descreve um bug, as três coisas que já tentou e a restrição que a correção precisa respeitar. Pausar para pensar por dezesseis segundos encerra a gravação.

O que surpreende as pessoas

O ditado do Claude Code não é local. A documentação diz direto: "Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally." Isso é banal para uma ferramenta na nuvem, mas vale saber se você assumiu que uma CLI rodando na sua máquina estava transcrevendo na sua máquina.

Logo do VS Code

O VS Code foi pelo outro caminho, e fez offline

O ditado integrado do VS Code é a opção mais interessante dessa categoria inteira e a menos discutida, porque fez o trade-off oposto a todo mundo. Fica ligado por padrão quando os recursos de IA estão ativos, inicia com Ctrl+Alt+V no editor ou Ctrl+I no chat, e o modelo roda onde você está sentado:

Dictation uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service. After the initial model download, speech recognition does not require an internet connection.

Documentação do Visual Studio Code, Voice support

Para um desenvolvedor cuja objeção ao ditado é que o áudio sai da máquina, essa é a resposta, e ela já está instalada. Não custa nada e não precisa de conta. Há um detalhe na mesma documentação: uma configuração opcional chamada llmCleanup envia o texto da transcrição, embora não o áudio, a um modelo de linguagem para limpar. Deixe isso desligado e nada sai do dispositivo.

A limitação é a óbvia, e é por isso que este não é o fim do artigo. Ele dita no VS Code. A descrição do seu pull request está no navegador. Seu ticket está no Jira. Sua resposta a quem revisou está no Slack. Sua resposta ao cliente que reportou o bug está numa ferramenta de suporte. Num dia típico, o editor não é para onde a maior parte das suas palavras vai.

A maior parte do que um desenvolvedor digita não é código

Esse é o ponto que a categoria inteira continua perdendo, e é a razão pela qual alcance vence precisão na escolha de uma ferramenta. Pense com honestidade num dia de trabalho e conte para onde as palavras vão. Quase nada disso é sintaxe, e quase todo o resto é prosa que seria mais rápida falada.

Prompts de agente

A parte que ficou mais longa à medida que os agentes melhoraram. Descrever intenção, restrições e o que você já descartou é prosa pura, e agora é uma fatia grande do trabalho.

Descrições de pull request

Contexto, raciocínio, o que um revisor deve olhar primeiro. Escrito numa área de texto do navegador, não no seu editor.

Comentários de code review

Explicar por que algo deve mudar, o que leva mais palavras do que a mudança em si. No GitHub ou GitLab, no navegador.

Tickets e standups

Jira, Linear, Slack. Curtos, frequentes e desproporcionalmente chatos de digitar porque interrompem outra coisa.

Documentação e READMEs

A coisa que todo mundo adia. Falar um primeiro rascunho e limpar depois vence ficar olhando para um arquivo vazio.

Mensagens de commit

Sobretudo o corpo, que é onde o raciocínio deveria estar e onde em geral não acaba.

Cada um desses é prosa, e prosa é onde a fala ganha com clareza. Falar com conforto fica em cerca de 130 a 150 palavras por minuto contra cerca de 40 na digitação média. Passamos pela pesquisa por trás disso no nosso texto sobre palavras por minuto ao falar, e a versão curta é que a diferença é real para frases e some para símbolos.

Note o que isso significa na escolha da ferramenta. Uma ferramenta restrita ao editor cobre a fatia menor dessa lista. Uma restrita a um agente cobre um item. Uma que digita em qualquer campo com o cursor cobre os seis, e é a mais barata das três.

Logo do BlabbyAI

BlabbyAI: ditado que não se importa com o programa em que você está

O BlabbyAI é construído na premissa acima: que a unidade útil não é "ditado para coding", e sim ditado em todo lugar, porque o editor é uma janela entre uma dúzia. Aperte Ctrl+Space, fale, aperte de novo, e o texto é digitado no campo que estava em foco. Esse campo pode ser o prompt do Claude Code, o composer do Cursor, uma caixa de review no GitHub, uma descrição no Jira, um fio no Slack ou um terminal. Não há nada para integrar, porque não há integração: ele digita onde o cursor já está.

Configurações de atalho de teclado do BlabbyAI, mostrando o atalho global de gravação

O atalho global é remapeável em Configurações, o que importa aqui: Ctrl+Space é IntelliSense na maioria dos editores, então desenvolvedores em geral mudam.

Esse padrão vale sinalizar em vez de passar por cima. Ctrl+Space é o gatilho de autocompletar no VS Code, IntelliJ e na maioria dos editores, então é a primeira coisa que um desenvolvedor deve mudar. Leva um clique em Configurações, e não há motivo para deixar colidindo.

Modos personalizados são a parte que encaixa nesse fluxo

Um modo é uma instrução em texto livre aplicada ao que você acabou de dizer, depois da transcrição e antes de o texto ser digitado. Você escreve a instrução uma vez, atribui um atalho, e daí em diante esse atalho produz fala moldada daquele jeito. Sua fala é a entrada, não um pedido: um modo reformata o que você disse em vez de responder a ele.

Para desenvolvedores isso é mais útil do que parece no começo, porque as tarefas de escrita da lista acima têm cada uma um estilo da casa, e a reformatação é o que as torna tediosas. Algumas instruções que fazem trabalho de verdade:

Instrução do modoO que você dizO que é digitado
Reescreva como um conventional commit com prefixo de tipo e um corpo explicando o porquê"consertou o loop de retry, estava martelando a API quando o token expirava"Uma linha de assunto fix: com o raciocínio no corpo
Formate como descrição de PR com um resumo e uma seção de testesSeu walk-through falado da mudançaMarkdown estruturado com os títulos já no lugar
Remova muletas e recomeços, mantenha todo o resto literalmenteUm prompt longo e enrolado de agente pensado em voz altaO mesmo prompt sem os ãs e recomeços
Quando eu disser "novo bullet", comece um novo item de lista em vez de escrever essas palavras"o cache está velho novo bullet o TTL está errado"Dois bullets de verdade
O editor de modos do BlabbyAI com um campo de instrução de IA em texto livre, nome e seletor de modelo

Um modo é uma instrução mais um atalho. A última linha acima é como comandos falados funcionam: você os descreve na instrução em vez de depender de uma lista fixa de comandos.

Essa última linha merece atenção, porque é a mecânica que as pessoas erram. O modelo recebe sua transcrição literal completa, inclusive palavras que você pretendia como comandos, então você pode definir o próprio vocabulário falado descrevendo-o na instrução. "Novo parágrafo", "bullet point", "apaga isso": nenhum desses é recurso embutido, e todos funcionam, porque você define o que significam.

Ensinando o vocabulário do seu codebase

A objeção previsível a ditar perto de código são nomes próprios. Seu serviço interno se chama algo que ninguém fora da empresa ouviu, e nenhum modelo geral vai soletrar certo. A grafia personalizada resolve isso: adicione o termo uma vez em Configurações, depois Idiomas, digitado exatamente como você quer que seja escrito, e a partir daí ele é reconhecido. Nomes de bibliotecas, de serviços, o sobrenome de um colega, um acrônimo que o time inventou. O Blabby também oferece 90+ idiomas com detecção automática, o que importa em times distribuídos em que as pessoas pensam em um idioma e entregam em outro.

Ele nunca aperta Enter

O Blabby escreve texto no campo em foco e para aí. Não clica em botões, não envia formulários e não aperta Enter. Para um prompt de agente, esse é o comportamento que você quer: suas palavras caem na caixa e esperam, para você reler uma instrução longa antes de enviar em vez de dispará-la no momento em que você para de falar.

Dois produtos, e o do navegador não precisa de instalação

O app desktop Windows é o produto mais completo: digita em todo o sistema em qualquer aplicativo, e tem o History, que grava cada gravação no seu próprio disco no instante em que você para de falar, antes da transcrição começar. Nada do History toca um servidor, e você pode reproduzir ou retranscrever qualquer gravação passada depois, opcionalmente por um modo diferente.

A extensão Chrome é a outra metade, e para muitos desenvolvedores é a que encaixa. Se o seu agente é a visão web do Cursor, se seus reviews acontecem no GitHub, se seus tickets estão no Linear e seus docs no Notion, então tudo o que você dita já está numa aba do navegador. A extensão mostra uma bolha pequena ao lado do campo de texto em foco e não precisa de download nem de direitos de admin, o que é a diferença entre funcionar e não funcionar num laptop gerenciado. Também é a opção para Mac e Chrome OS. Os dois estão cobertos pelo mesmo $8.49 por mês, e o plano gratuito é 60 créditos por semana sem cartão.

Um setup que funciona, em cerca de dez minutos

Nada aqui exige se comprometer com um fluxo antes de saber se você gosta. A ordem importa um pouco: faça o ditado funcionar na prosa primeiro, porque é aí que o ganho é óbvio, e só então decida se quer algo mais especializado.

  1. Remapeie o atalho antes de qualquer outra coisa. Qualquer ferramenta que você escolher, coloque em algum lugar que o editor ainda não esteja usando. Ctrl+Space é autocompletar e Ctrl+Alt+V pode já estar ocupado. Dez segundos agora poupam uma semana de colisões.
  2. Comece com a descrição de um pull request, não com um prompt. É longo, é prosa, é de baixo risco, e é a tarefa em que a diferença de velocidade é impossível de não notar. Se o ditado vai funcionar para você, você vai saber ao fim de um PR.
  3. Adicione suas cinco piores palavras ao dicionário. O nome do serviço, a biblioteca, o acrônimo, o sobrenome. Cinco entradas removem a maior parte do atrito por causa do qual as pessoas desistem.
  4. Depois tente num prompt de agente, e seja mais específico do que digitaria. Esse é o desbloqueio de verdade. Como falar é cerca de três vezes mais rápido que digitar, o prompt que você fala fica naturalmente mais longo e mais detalhado do que o que você teria digitado, e agentes respondem bem a isso. Diga a restrição. Diga o que já tentou. Diga o que a correção não pode quebrar.
  5. Só então considere ferramentas mãos livres. Se a sua necessidade é médica e não de conveniência, é aí que o Talon entra, e merece um compromisso de tempo de verdade, não uma tarde.

O hábito que faz funcionar

Fale o prompt que você teria pensado e depois abreviado. A maioria dos prompts fracos de agente é fraca porque digitá-los por completo era tedioso, não porque o desenvolvedor não soubesse o contexto. Remover o custo de digitar remove a razão de abreviar.

Onde falar ainda é a ferramenta errada

Um guia que afirma que a voz vence em todo lugar não vale a leitura, e os limites aqui são claros o bastante para declarar.

Sintaxe pura ainda é mais rápida digitada, para quem digita com competência. Falar const [x, setX] = useState(0) em voz alta é uma experiência pior do que digitar, em qualquer ferramenta, e nenhuma melhoria de modelo muda isso, porque o gargalo é a forma falada da pontuação, não o reconhecimento. Edições precisas têm o mesmo problema: mover o cursor três caracteres para a esquerda é uma tecla e uma frase.

Há também uma restrição de ambiente que nenhuma página de fornecedor menciona. O ditado assume que você pode falar. Num escritório aberto, num trem, ou numa sala compartilhada em casa com alguém dormindo, essa premissa falha, e falha por dias inteiros de cada vez, não só de vez em quando. Essa é uma razão real pela qual as pessoas abandonam ferramentas de ditado, e não tem nada a ver com o software.

O enquadramento honesto é que o ditado é um segundo método de entrada, não um substituto. Você continua digitando, e fala as partes que são frases. Essa é uma afirmação menor do que a maior parte dessa categoria faz, e é a que sobrevive ao contato com uma semana de trabalho.

Então, voice coding funciona?

As duas versões funcionam, para pessoas diferentes, e a razão pela qual a pergunta parece em aberto é que são mesmo duas perguntas.

Ditar sintaxe funciona, funciona há anos, e continua exigente. O Talon é mantido ativamente e é a resposta certa se você não pode usar teclado, mas é uma habilidade que se adquire, não uma ferramenta que se instala. Quem diz que essa versão é sem esforço não fez isso.

Ditar instruções a um agente funciona na hora, não precisa de treino, e é o que o termo agora quer dizer na maior parte. Também tem uma consequência que a discussão de ferramentas tende a pular: como o que você está falando é prosa, a ferramenta de que você precisa não é uma ferramenta de coding. É ditado preciso que segue o cursor para qualquer janela em que você esteja, porque a caixa de prompt é um de talvez seis lugares para onde suas palavras vão num dia.

Essa é a mudança inteira, e é por isso que um termo que ficou de nicho por quinze anos sobe 23% em relação ao ano anterior. BlabbyAI cobre esse trabalho por $8.49 por mês, no Windows ou no Chrome, e o plano gratuito basta para descobrir se você gosta de falar seus prompts antes de pagar por qualquer coisa. Se quiser a comparação mais ampla, mantemos um panorama dos melhores apps de ditado, e um guia de ditado para programadores que aprofunda o lado da escrita no dia a dia.

Perguntas frequentes

O que é voice coding?

O termo cobre hoje duas práticas diferentes, e a maior parte da confusão vem de misturá-las. O sentido antigo é ditar o código em si: você fala uma gramática de comandos e um motor especializado transforma isso em sintaxe, de modo que "camel case new function get user by id" vira getUserById(). Talon Voice e Serenade funcionam assim e levam semanas de prática. O sentido mais novo, o que quase todo mundo quer dizer em 2026, é falar suas instruções a um agente de coding com IA como Claude Code, Cursor ou Copilot e deixar o agente escrever a sintaxe. Essa segunda versão não precisa de motor de sintaxe algum, porque você está ditando prosa em inglês em um campo de texto. Qualquer ferramenta de ditado geral precisa já serve, e por isso a barreira de entrada desabou. O BlabbyAI digita sua fala em qualquer campo com o cursor, inclusive a caixa de prompt de um agente, por $8.49 por mês.

Dá para escrever código de verdade com a voz?

Sim, mas a resposta honesta depende de qual das duas práticas você quer dizer. Ditar sintaxe pura por voz funciona e tem gente que faz isso em tempo integral, sobretudo com o Talon Voice, cujo repositório da comunidade ainda recebia atualizações em setembro de 2026. Exige aprender uma gramática de comandos e é realmente lento no começo, por isso ficou de nicho por quinze anos. Ditar instruções a um agente de IA, por outro lado, funciona na hora sem treinamento, porque você fala frases comuns como "add a retry with exponential backoff to the fetch helper and cover it with a test". O agente produz a sintaxe. Desenvolvedores que tentaram e abandonaram voice coding anos atrás em geral tentaram a primeira versão. A segunda é outra atividade que por acaso compartilha o nome.

O Claude Code tem entrada por voz?

Sim. O Claude Code tem ditado integrado que você ativa com o comando /voice, no modo hold-to-record (segurar Space enquanto fala) ou no modo tap (tocar uma vez para começar, tocar de novo para enviar). Três limites valem a pena conhecer antes de confiar nisso, e os três estão na documentação da própria Anthropic. Primeiro, exige uma conta Claude.ai e está explicitamente "not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry", então um time no Bedrock não consegue usar. Segundo, precisa de microfone local e não funciona via SSH nem no Claude Code na web. Terceiro, a gravação "stops automatically after 15 seconds of silence or two minutes total", então um prompt longo pensado em voz alta é cortado. Uma ferramenta de ditado em todo o sistema não tem nenhuma dessas três restrições, porque não importa em qual programa o cursor está.

O VS Code tem ditado integrado?

Tem, e funciona diferente de toda ferramenta na nuvem dessa categoria. O VS Code traz ditado ligado por padrão quando os recursos de IA estão ativos, iniciado com Ctrl+Alt+V (Cmd+Option+V no Mac) no editor ou Ctrl+I no chat. O ponto notável é onde o processamento acontece: a documentação da Microsoft diz que ele "uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service", e que depois do download inicial do modelo "speech recognition does not require an internet connection". Isso o torna a única opção genuinamente offline que a maioria dos desenvolvedores já tem instalada. O trade-off é o alcance. Ele dita no VS Code e em nenhum outro lugar, então a descrição do pull request, o ticket do Jira, a resposta no Slack e o terminal ainda precisam de outra coisa.

Voice coding é mais rápido que digitar?

Para prosa, com folga. Falar com conforto fica em torno de 130 a 150 palavras por minuto contra cerca de 40 palavras por minuto na digitação média, e essa diferença é por que o ditado compensa em tudo que tem forma de frase. Para sintaxe, não, e quem afirma o contrário está vendendo alguma coisa: falar pontuação e camel case é mais lento do que digitar para quem digita bem. É exatamente por isso que a versão de ditar prompts do voice coding decolou e a de sintaxe não. Prompts a um agente de IA são prosa, então ficam do lado bom dessa proporção, e são a parte do trabalho que ficou mais longa à medida que os agentes melhoraram. Veja nosso comparativo de velocidade ao falar versus digitar para os números por trás.

Qual é a melhor ferramenta de voz para texto para coding?

A pergunta certa é alcance, não precisão, porque toda ferramenta séria dessa categoria já é precisa o bastante. Se você só dita dentro de um editor, o ditado integrado daquele editor é grátis e suficiente: o do VS Code roda no dispositivo. Se você dita o dia inteiro, o que para a maioria dos desenvolvedores significa prompt de agente, descrição de pull request, comentário no Jira, resposta no Slack e documentação, você quer uma ferramenta em todo o sistema que digite em qualquer campo em foco. O BlabbyAI custa $8.49 por mês para isso, com um plano gratuito de 60 créditos por semana sem cartão, como app desktop Windows ou extensão Chrome. Se você precisa de navegação mãos livres em vez de ditado, por LER ou necessidade de mobilidade, o Talon Voice é a resposta séria e nada mais chega perto.

O Serenade ainda é mantido?

Parece que não. O Serenade é uma ferramenta open source de voice coding que ainda aparece perto do topo do Google para o termo, então é recomendado o tempo todo, mas o repositório GitHub serenadeai/serenade recebeu o último push em 11 de junho de 2024, mais de dois anos antes deste artigo, com 26 issues ainda abertas. O próprio site ainda lista o Atom entre os editores suportados, e o GitHub encerrou o Atom em dezembro de 2022. Nada disso significa que o software não rode hoje, e o projeto não está arquivado. Significa que uma recomendação de Serenade em 2026 merece cuidado e que você deve checar o repositório você mesmo antes de montar um fluxo em cima dele. O Talon Voice, em contraste, é mantido ativamente: o repositório da comunidade recebeu push em 2 de setembro de 2026.

Posso programar por voz com LER ou túnel do carpo?

Esse é o caso de uso para o qual o voice coding foi criado originalmente e continua sendo o mais forte. Duas coisas ajudam, e são ferramentas diferentes para trabalhos diferentes. Para substituir o teclado por completo, incluindo navegação, seleção e gerenciamento de janelas, o Talon Voice é a resposta estabelecida, tem uma comunidade ativa e é a ferramenta que a maioria dos desenvolvedores que programam mãos livres realmente usa. Para reduzir o volume de digitação em vez de eliminá-lo, o ditado geral faz a maior parte do trabalho sem curva de aprendizado, porque a maior parte do que um desenvolvedor digita num dia é prosa e não sintaxe: prompts, reviews, tickets, mensagens, docs. Tirar essa fatia muitas vezes basta. Temos um guia separado sobre digitar com túnel do carpo que cobre o lado da configuração.

O ditado lida com termos técnicos e nomes de variáveis?

Melhor do que antes, e esse tratamento é agora o principal que separa as ferramentas. O Claude Code diz que a transcrição é "tuned for coding vocabulary" e que termos como regex, OAuth, JSON e localhost são reconhecidos, com o nome do projeto e o branch git atual adicionados automaticamente como dicas de reconhecimento. Ferramentas gerais resolvem isso com um dicionário personalizado. O BlabbyAI tem grafia personalizada: você adiciona o termo uma vez em Configurações e depois Idiomas, e a partir daí ele é reconhecido, que é como você ensina nomes de serviços internos, uma biblioteca incomum ou o sobrenome de um colega. O que nenhuma ferramenta faz bem são identificadores crus falados como sintaxe, então getUserById ditado caractere a caractere continua estranho em todo lugar. No fluxo com agente você nunca precisa disso, porque diz "the get user by ID helper" e o modelo resolve.

O ditado pode enviar o prompt por mim?

Algumas ferramentas fazem isso automaticamente, e se você quer isso é uma preferência real, não uma lacuna de recurso. O modo tap do Claude Code envia o prompt assim que a transcrição tem pelo menos três palavras, e o modo hold pode fazer o mesmo com a configuração autoSubmit. O desenvolvedor cujo texto no dev.to aparece na primeira página para voice coding citou exatamente isso como o que o tirou da voz integrada: o problema, escreveu ele, "is that it automatically sends the message when you finish talking, so you don't have time to actually think". O BlabbyAI nunca envia. É uma ferramenta de ditado e só escreve texto no campo em foco, então suas palavras caem na caixa de prompt e ficam lá até você apertar Enter. Para um prompt longo de agente que você quer reler antes de enviar, esse é o comportamento que você quer.

Fale o próximo prompt do seu agente

O BlabbyAI digita em qualquer campo em foco, no Windows ou no Chrome, e nunca aperta Enter por você. $8.49 por mês, ou 60 créditos por semana grátis sem cartão.

Add BlabbyAI to Chrome