Atualizado 4 de setembro de 2026 · Por Sumbat.T

Dite no Linux



Um build Linux que instala a partir de um .deb
Ubuntu GNOME no Wayland, Ubuntu GNOME no X11 e Mint Cinnamon estão listados como released. Ou use a extensão Chrome, que contorna o servidor de display por completo.
Busque Linux speech to text e você vai receber uma lista de sete ou oito ferramentas, cada uma com um parágrafo sobre o modelo e a licença. Instale a recomendação do topo e há uma chance decente de que transcreva sua voz com perfeição e depois não digite absolutamente nada no seu editor. Nada está quebrado. Você simplesmente bateu na coisa que essas listas deixaram de fora.
Software de ditado não digita de verdade. Converte sua fala em texto e depois simula teclas para que o texto caia no aplicativo que tem o foco. No Windows e no macOS essa simulação é um serviço de sistema documentado e invisível para você. No Linux é a parte mais difícil do problema inteiro, porque a forma de simular uma tecla depende inteiramente de qual servidor de display você está rodando.
No X11, qualquer programa pode injetar eventos de entrada em qualquer outro. É isso que faz o xdotool funcionar, e também é uma fraqueza de segurança do X11 reconhecida há muito tempo: um keylogger é trivial de escrever no X11 exatamente pela mesma razão pela qual o ditado é fácil. O Wayland fechou esse buraco de propósito. Uma aplicação Wayland normal não consegue empurrar teclas para outra aplicação, o que é uma melhoria de segurança real e, ao mesmo tempo, a razão de sua ferramenta de ditado ficar ali sem fazer nada.
Confira isto primeiro
Rode echo $XDG_SESSION_TYPE num terminal. Se imprimir wayland, várias das ferramentas mais recomendadas desta página precisam de configuração extra antes de digitar um único caractere. Se imprimir x11, quase tudo funciona de imediato.
Isso importa mais a cada ano, porque as distribuições principais têm migrado para Wayland por padrão. Isso significa que o conselho padrão da primeira página do Google fica mais desatualizado a cada versão do Ubuntu, e as ferramentas recomendadas com mais entusiasmo costumam ser as que mais deixam setup pela frente.
Quase toda ferramenta de ditado open source no Linux delega o passo de digitar a uma de quatro utilidades pequenas. Qual você precisa é decidido pelo seu servidor de display, e a quantidade de setup varia enormemente entre elas. Esta tabela é a parte da decisão que de fato determina se uma noite de instalação corre bem.
| Backend | Servidor de display | Setup | O que vale saber |
|---|---|---|---|
xdotool | Só X11 | Instalar um pacote | O padrão do nerd-dictation. Não digita nada no Wayland. |
wtype | Wayland | Instalar um pacote | O Handy prefere, mas a README diz que não funciona no Ubuntu 26.04. |
ydotool | X11, Wayland, TTY | Binário, grupo, regra udev, systemd | A resposta confiável, e de longe o setup mais pesado. |
dotool | X11, Wayland, TTY | Binário mais acesso a uinput | A mesma abordagem uinput do ydotool com uma interface mais simples. |
Fonte: a documentação própria dos projetos, lida em setembro de 2026.
A lacuna entre a segunda e a terceira linha é a história inteira. Adicionar wtype é um apt install. Adicionar ydotool significa baixar um binário da página de releases do projeto, colocar em algum lugar do seu $PATH, adicionar seu usuário ao grupo input e escrever uma regra udev para que /dev/uinput seja gravável sem root. O projeto nerd-dictation documenta tudo isso ele mesmo, e é sincero sobre por que não é o padrão: ydotool “requires some system configuration to use conveniently” e “lacks accessible documentation”.
# Which display server am I actually running?
$ echo $XDG_SESSION_TYPE
wayland
# The X11 answer: one package, done.
$ sudo apt install xdotool
# The Wayland answer, short version:
$ sudo apt install wtype
# The Wayland answer when wtype will not do:
$ sudo usermod -aG input $USER
$ echo 'KERNEL=="uinput", GROUP="input", MODE="0660"' \
| sudo tee /etc/udev/rules.d/80-uinput.rules
# then a systemd unit for ydotoold, then log out and back inNada disso está fora do alcance de quem usa Linux por escolha. Só vale saber que está à sua frente antes de começar, em vez de descobrir no momento em que você esperava estar ditando.
Ordenadas por quanto trabalho há entre instalar e ditar, não por preferência. A coluna de Wayland é a que você deve ler primeiro.
| Ferramenta | Tipo | Wayland | Instalação | Preço |
|---|---|---|---|---|
BlabbyAI | App desktop empacotado | Ubuntu GNOME Wayland listado como released | .deb, AppImage, snap | $8.49/mês, plano grátis 60 créditos semanais |
Handy | App desktop open source | Limitado; precisa de wtype, ou ydotool no Ubuntu 26.04 | Binários pré-compilados | Grátis, MIT |
Speech Note | Janela independente | Não afetado, não digita em outros apps | Flatpak | Grátis, MPL-2.0 |
Whispering | App desktop open source | Mesma classe de setup de backend de entrada | Binários pré-compilados | Grátis, traga sua própria API key |
nerd-dictation | Script CLI | Não digita nada com o backend xdotool padrão | Clonar o repo | Grátis, GPL-3.0 |
whisper.cpp | Library e CLI | Você liga a entrada | Compilar a partir do código-fonte | Grátis, MIT |
ibus-speech-to-text | Método de entrada | Funciona via IBus no GNOME | Pacote da distro | Grátis |
Fonte: documentação dos fabricantes e README dos projetos, lidas em setembro de 2026. Números do GitHub via a API do GitHub em 4 de setembro de 2026.


O BlabbyAI é um app de ditado, não uma ferramenta de transcrição: você aperta um atalho, fala, e o texto aparece no campo onde o cursor está. Uma barra fica no centro inferior da tela, e o mesmo build traz modos personalizados, grafias personalizadas e seleção de idioma.
A razão de ele encabeçar uma lista de Linux é estreita e específica: é empacotado. O download é um .deb, um AppImage ou um snap, então num derivado de Debian ou Ubuntu é um duplo clique ou um dpkg -i, e o AppImage roda sem instalar nada no sistema. A matriz de suporte na página de Linux lista Mint Cinnamon X11, Ubuntu GNOME X11 e Ubuntu GNOME Wayland como released, com KDE Plasma ainda em desenvolvimento. Esse último detalhe é o que importa, dado tudo acima.

Fonte: app Linux do BlabbyAI.
O que você recebe pelo dinheiro
$8.49 por mês, ilimitado. O plano gratuito são 60 créditos semanais sem cartão, que se recarregam em vez de acabar de vez, então você pode testar em trabalho real ao longo de várias semanas.
Onde difere das ferramentas grátis
Modos personalizados. Um modo é uma instrução livre de IA aplicada ao que você acabou de dizer, de modo que o mesmo ditado pode sair como um parágrafo limpo, uma lista com marcadores ou uma mensagem de commit.
Modos personalizados merecem mais uma frase, porque são a parte sem equivalente open source nesta página. A instrução é texto livre, não um preset, então faz o que um modelo de linguagem consegue fazer com um texto: tirar enrolação, impor um estilo da casa, traduzir, converter fala enrolada num relatório estruturado, ou honrar comandos falados que você define, como dizer “new paragraph”. Sua fala é a entrada do modo, e o modo a reescreve.
A rota do navegador
Se a maior parte da sua escrita acontece num navegador, a extensão Chrome do BlabbyAI remove o problema do servidor de display ao não participar dele. Roda dentro do Chrome, então X11, Wayland e uinput são todos irrelevantes, e funciona em qualquer distribuição e qualquer ambiente desktop. Não há nada para instalar no nível do sistema nem regra udev para escrever.

O Handy é um app de ditado com licença MIT, totalmente offline e escrito em Rust, e é de longe a opção grátis mais crível desta categoria. Funciona no Windows, macOS e Linux, se descreve como extensível, e o princípio declarado é que ferramentas de acessibilidade não deveriam ficar atrás de um paywall. Conferido na API do GitHub em 4 de setembro de 2026 tem 30.961 estrelas e o último push foi em 31 de agosto de 2026, então é popular e mantido de forma ativa, o que não é dado nesta categoria.
O asterisco é o Wayland, e é mérito do projeto que esteja na README em vez de enterrado num issue tracker. O Handy lista “limited support for Wayland display server” e exige wtype ou dotool para a entrada de texto funcionar. Depois vem a frase que reenquadra a categoria inteira:
Da própria README do Handy
“Ubuntu 26.04: Has Wayland display server by default. wtype does not work, you need to install ydotool and configure systemd.”
Leia isso diante do fato de que o Ubuntu é a distribuição desktop mais usada e que o Ubuntu atual entrega Wayland de fábrica. A ferramenta de ditado grátis mais recomendada, na distribuição mais comum, na configuração padrão, precisa do mais pesado dos quatro backends de entrada e de uma unidade systemd. Isso não é uma crítica ao Handy, que aqui é excepcionalmente honesto. É a ilustração mais clara de por que o ditado no Linux tem fama de ser chato de configurar.

O Speech Note, às vezes chamado dsnote, é o aplicativo de voz offline mais completo no Linux e resolve o problema do servidor de display ao se recusar a tê-lo. É uma janela. Você dita no Speech Note, e o texto aparece no Speech Note. Como nunca tenta injetar teclas em outro aplicativo, X11 e Wayland vão igualmente bem, e não há backend de entrada para instalar.
Tem licença MPL-2.0, instala limpo como Flatpak, e o último push foi em 2 de setembro de 2026 com 1.624 estrelas, então está bem vivo. Também faz mais do que ditado: speech to text offline, text to speech e tradução automática num único aplicativo, com aceleração GPU Vulkan para modelos maiores. Se o seu trabalho é produzir um bloco de texto que você depois cola em outro lugar, é argumentavelmente a melhor ferramenta da página.
O trade-off, dito com clareza
O Speech Note não é ditado em todo o sistema. Cada frase implica falar na janela dele e depois copiar o resultado para onde você realmente queria. Isso serve para redigir um documento e fica cansativo para uma resposta no Slack. As ferramentas que digitam direto nos seus apps são as que pagam o pedágio do Wayland, e esta é a outra face desse acordo.

O Whispering, parte do projeto Epicenter, é um app de ditado open source cuja ideia distintiva é que você fornece o backend de transcrição. Suporta modelos locais e uma longa lista de provedores hospedados, o que significa que a precisão e o custo são ambos seus para escolher, não do desenvolvedor para fixar. Conferido em 4 de setembro de 2026, o repositório tinha 4.786 estrelas e o último push foi em 30 de agosto de 2026.
Serve muito bem a uma pessoa específica: alguém que já tem uma API key, sabe qual modelo quer, e se opõe por princípio a pagar uma assinatura por uma camada fina sobre um modelo que poderia chamar sozinho. Se essa pessoa não é você, a escolha de provedor é mais uma decisão entre você e o ditado, e o mesmo trabalho de backend de entrada do Linux ainda se aplica no Wayland.
O nerd-dictation é um script Python de um único arquivo baseado na API VOSK, GPL-3.0, e é genuinamente elegante: modelos minúsculos com menos de 50 MB, quase sem uso de recursos, e hackeável por quem se sente à vontade em Python. Aparece em essencialmente todo roundup de ditado no Linux, inclusive na própria AI Overview do Google para esta consulta.
Duas coisas valem ser ditas, porque os roundups que o recomendam em geral não dizem nenhuma. A primeira é a manutenção: conferido na API do GitHub em 4 de setembro de 2026, o repositório teve o último push em 10 de outubro de 2025, perto de onze meses sem um commit. Não está arquivado e o código ainda roda, mas não está sob desenvolvimento ativo como o Handy e o Speech Note.
A segunda é o comportamento no Wayland, que a própria documentação descreve com mais clareza do que qualquer artigo sobre ele. O backend de entrada padrão é xdotool, e o guia de ydotool do projeto diz dele, em palavras claras:
Da documentação do nerd-dictation
“It is only compatible with Xorg, not with Wayland. If you want to use Wayland, the program will not type anything.”
O conserto é real e está documentado: passe --simulate-input-tool e escolha DOTOOL, YDOTOOL ou WTYPE no lugar. O mesmo guia aponta uma segunda limitação do xdotool que vale conhecer se você dita em algo que não seja inglês: sofre “considerable slowdowns when writing characters not found in the English language, temporarily freezing your computer’s display”.
# nerd-dictation on Wayland: the default will type nothing.
$ nerd-dictation begin --simulate-input-tool=DOTOOL
# ...or YDOTOOL, if you have done the uinput and systemd setup:
$ nerd-dictation begin --simulate-input-tool=YDOTOOL
# Non-English text under xdotool can freeze the display.
# This is documented behaviour, not a bug in your setup.O whisper.cpp é o port em C e C++ do modelo Whisper da OpenAI, e sustenta vários dos aplicativos acima em vez de competir com eles. Sozinho não é uma ferramenta de ditado: transforma áudio em texto, e todo o resto, o atalho, a captura do microfone, a simulação de teclas, é você quem escreve.
Para certo tipo de usuário de Linux isso é o atrativo, não o inconveniente. Vinte linhas de shell ligando arecord ao whisper.cpp ao dotool produzem exatamente o fluxo de ditado que você quer e nada mais, sem telemetria, sem conta e sem atualização que você não pediu. Se você já montou a própria barra de status, já sabe se este parágrafo descreve uma boa tarde ou uma ruim.
A última opção é diferente em espécie. Em vez de ser um aplicativo que digita em outros aplicativos, se encaixa no IBus, o framework de métodos de entrada que o GNOME já usa para todo outro layout de teclado e método de entrada. Você instala o pacote, adiciona Speech to Text em Input Sources nas configurações do teclado, e ele fica disponível em aplicativos padrão do jeito que qualquer outro método de entrada fica.
Como trabalha pela camada de métodos de entrada em vez de simular teclas, não bate no muro do Wayland do mesmo jeito. As restrições são que na prática é território GNOME e Fedora, e que te dá transcrição crua sem a limpeza, a formatação nem as instruções personalizadas que as ferramentas empacotadas colocam por cima. Como demonstração de que o ditado no Linux pode parecer nativo, é a coisa mais encorajadora desta lista.
O conselho habitual é começar pela precisão, e é o extremo errado. A precisão é uma propriedade do modelo, e cada ferramenta aqui pode rodar um modelo Whisper comparável, então a maioria das diferenças de precisão percebidas são diferenças de tamanho de modelo que você escolheu sem perceber. Percorra isto em ordem no lugar.
echo $XDG_SESSION_TYPE. Tudo abaixo depende dessa resposta, e leva dois segundos.Pule a noite do backend de entrada



Instale um .deb e comece a ditar
60 créditos toda semana no plano gratuito, sem cartão. Ubuntu GNOME Wayland, Ubuntu GNOME X11 e Mint Cinnamon estão listados como released, e a extensão Chrome funciona em todas as distribuições.
Vale nomear a assimetria de fundo, porque explica a forma de tudo acima. O Windows traz digitação por voz com Win+H e o macOS traz Dictation. Os dois vêm dentro do sistema operacional, os dois funcionam em qualquer campo de texto, e nenhum pede que você pense em como as teclas são entregues. Nessas plataformas uma ferramenta de ditado de terceiros tem que superar um padrão grátis decente.
Nenhuma distribuição Linux mainstream traz um equivalente sempre disponível. O buraco que isso deixa é por que existem aqui sete projetos críveis, a maioria grátis e vários excelentes, e também por que todos resolvem a última milha de forma diferente. Não há um serviço de sistema para delegar, então cada projeto escolhe a própria resposta, e as respostas não coincidem.
O que o Linux acerta
Escolha de verdade, processamento offline real e sem cobrança por minuto. Nada aqui envia seu áudio a lugar nenhum a menos que você escolha uma ferramenta que faça isso, e várias são auditáveis linha a linha.
O que custa
A última milha. Toda ferramenta aqui resolveu o reconhecimento de fala; o que as separa é quanto trabalho resta entre uma transcrição que funciona e o texto aparecendo onde você queria.
Essa também é a forma mais justa de ler esta lista. Não são sete ferramentas de qualidade variável. São sete respostas diferentes a uma pergunta de engenharia pouco glamourosa que Windows e macOS responderam de forma central anos atrás, e a certa para você depende menos do modelo do que do seu servidor de display e de onde suas palavras precisam aterrissar.
Não do jeito que Windows e macOS têm. O Windows traz digitação por voz com Win+H no sistema operacional e o macOS traz Dictation, e os dois funcionam em qualquer campo de texto assim que você ativa. Nenhuma distribuição Linux mainstream traz um equivalente ligado por padrão. Usuários de GNOME e Fedora podem instalar o pacote ibus-speech-to-text e adicionar Speech to Text como fonte de entrada, que é o mais perto de uma opção nativa, mas é algo que você instala e configura, não algo que já está lá. Em todo o resto, ditado no Linux significa escolher uma ferramenta de terceiros. Essa é a razão inteira de esta categoria existir no Linux e quase não existir no Windows: o sistema operacional deixa um buraco, e sete ou oito projetos o preencheram cada um de um jeito diferente.
Porque ferramentas de ditado não "digitam" de verdade. Elas simulam teclas, e a forma de simular uma tecla no Linux depende inteiramente do seu servidor de display. No X11 qualquer programa pode injetar entrada em qualquer outro, que é o que faz o xdotool funcionar e, de passagem, uma fraqueza de segurança do X11. O Wayland fechou esse buraco de propósito: uma aplicação normal não consegue empurrar teclas para outra aplicação. Assim, uma ferramenta de ditado baseada em xdotool transcreve sua fala com perfeição e depois não digita nada, porque o mecanismo que usa para digitar foi bloqueado por design. Os workarounds são ydotool e dotool, que operam na camada uinput do kernel abaixo do servidor de display, e wtype, que pede licença ao compositor por um protocolo Wayland que nem todo compositor implementa. É a coisa mais útil a entender antes de escolher uma ferramenta, e quase nenhum roundup menciona.
O Ubuntu moderno usa por padrão o servidor de display Wayland, então a pergunta de verdade é quais ferramentas lidam com Wayland. O BlabbyAI oferece um build Linux com Ubuntu GNOME no Wayland listado como released, junto com Ubuntu GNOME X11 e Mint Cinnamon X11, e instala a partir de um .deb, um AppImage ou um snap. O Handy roda no Ubuntu, mas a própria README diz que no Ubuntu 26.04, que é Wayland por padrão, o wtype não funciona e você precisa instalar ydotool e configurar systemd. O nerd-dictation funciona se você trocar o backend de simulação de entrada do xdotool padrão. O Speech Note funciona porque é uma janela na qual você dita, não uma ferramenta que digita em outros apps, o que evita o problema por completo ao custo de não ser em todo o sistema.
Sim, e o Linux é excepcionalmente bem servido aqui em comparação com outras plataformas. O Handy tem licença MIT e é grátis, o Speech Note é grátis sob MPL-2.0, o nerd-dictation é GPL-3.0, e o whisper.cpp é grátis se você topa escrever scripts em volta. Todos rodam localmente, então não há cobrança por minuto nem conta. O custo é o seu tempo: cada um pede que você escolha um modelo, dimensione para o hardware e, no Wayland, instale e configure também um backend de entrada. Ferramentas pagas cobram por tirar esse trabalho de você. O BlabbyAI tem um plano gratuito de 60 créditos semanais sem cartão, para você comparar uma ferramenta empacotada com uma open source nas suas próprias frases antes de decidir que tipo de custo prefere pagar.
Os termos são usados de forma intercambiável e descrevem dois trabalhos realmente diferentes. Transcrição pega um arquivo de áudio já existente e transforma em texto, que é para o que Buzz e whisper.cpp foram feitos. Ditado digita suas palavras no aplicativo que você está usando, ao vivo, como parte de escrever. No Linux essa separação importa mais do que em outros lugares, porque ferramentas de transcrição não têm problema nenhum de servidor de display: leem um arquivo e escrevem um arquivo, e ninguém precisa injetar teclas. As ferramentas de ditado são as que quebram no Wayland. Se você busca Linux speech to text e cai numa ferramenta que funciona impecável, mas só dentro da própria janela, essa distinção é o porquê.
Sim. O BlabbyAI oferece um app desktop Linux como pacote .deb, AppImage e snap, então instala em derivados de Debian e Ubuntu pelo gerenciador de pacotes, ou roda a partir do AppImage sem instalar nada no sistema. A matriz de suporte na página de Linux lista atualmente Mint Cinnamon X11, Ubuntu GNOME X11 e Ubuntu GNOME Wayland como released, com KDE Plasma em desenvolvimento. Funciona do mesmo jeito que o app Windows: um atalho de teclado, uma barra no centro inferior e texto digitado no aplicativo que tem o foco, mais modos personalizados, grafias personalizadas e seleção de idioma. O app Windows e a extensão Chrome continuam sendo os dois produtos que mais promovemos, mas o build Linux é real e baixável, não uma lista de espera.
Essa é a resposta mais subestimada para a pergunta inteira e merece mais atenção do que recebe. Uma extensão Chrome roda dentro do navegador, então nunca toca em X11, Wayland, uinput nem em nenhuma tubulação de servidor de display. O problema de compatibilidade que domina todas as outras opções desta página simplesmente não se aplica. Se a maior parte do que você escreve acontece num navegador, que para muita gente é Gmail, Google Docs, Notion, Jira, Slack, Linear e cada ferramenta web interna do trabalho, a extensão Chrome do BlabbyAI dita em todas elas em qualquer distribuição Linux e qualquer ambiente desktop, sem pacote para instalar e sem regra udev para escrever. Ela não digita num aplicativo nativo GTK ou Qt, então não substitui por completo um app desktop, mas para trabalho centrado no navegador remove a parte mais difícil do ditado no Linux ao não participar dela.
A precisão é uma propriedade do modelo, não do sistema operacional, então um modelo Whisper dado produz a mesma qualidade de transcrição no Linux que em qualquer outro lugar. O que muda no Linux é qual modelo você acaba rodando. Ferramentas open source usam por padrão modelos locais menores, dimensionados para rodar confortáveis em hardware comum, e um modelo pequeno é mensuravelmente pior com nomes próprios, termos técnicos e nomes incomuns. Assim, a lacuna de precisão que as pessoas relatam entre ditado no Linux e no Windows costuma ser uma lacuna de tamanho de modelo que escolheram sem perceber, não uma limitação da plataforma. Se uma ferramenta local parece imprecisa, experimente um modelo maior antes de trocar de ferramenta, e espere que fique mais lenta.
Desenvolvedores enfrentam uma versão específica do problema, porque os aplicativos em que mais digitam, um terminal e um editor, são exatamente onde a injeção de teclas é mais delicada, e porque o vocabulário perto de código castiga modelos pequenos. Duas abordagens funcionam bem. Use uma ferramenta empacotada de todo o sistema como o BlabbyAI para que o ditado se comporte igual num navegador, num editor e numa janela de chat, e use um modo personalizado para dar forma ao texto falado. Ou, se preferir montar você mesmo, combine whisper.cpp com dotool e escreva scripts que unam as peças. O ponto maior é que a maior parte do dia de um desenvolvedor não é escrever código: são descrições de pull request, mensagens de commit, respostas no Slack, comentários de tickets e documentação, toda prosa comum que se dita bem.
Não, mas muda quais ferramentas parecem usáveis. Toda opção local aqui roda na CPU, e modelos Whisper pequenos transcrevem uma fala curta na CPU de um laptop comum em um ou dois segundos, o que basta para pedaços do tamanho de ditado. Onde uma GPU importa é transcrição longa e modelos maiores, e o Speech Note anuncia de propósito aceleração GPU Vulkan exatamente por isso. Ferramentas na nuvem evitam a pergunta de hardware ao fazer o trabalho num servidor, por isso parecem instantâneas num laptop fino e por isso precisam de conexão de rede. Decida qual desses trade-offs incomoda menos antes de julgar uma ferramenta pela velocidade.
Ditado no Linux sem a noite de setup
O BlabbyAI oferece .deb, AppImage e snap Linux, com Ubuntu GNOME Wayland listado como released, mais uma extensão Chrome que funciona em todas as distribuições. O plano gratuito são 60 créditos semanais, sem cartão.