Actualizado 4 de septiembre de 2026 · Por Sumbat.T

Dicte en Linux



Un build de Linux que se instala desde un .deb
Ubuntu GNOME en Wayland, Ubuntu GNOME en X11 y Mint Cinnamon están listados como released. O use la extensión de Chrome, que evita por completo el servidor de pantalla.
Busque Linux speech to text y obtendrá una lista de siete u ocho herramientas, cada una con un párrafo sobre su modelo y su licencia. Instale la recomendación principal y hay una probabilidad decente de que transcriba su voz a la perfección y luego no escriba absolutamente nada en su editor. Nada está roto. Simplemente ha chocado con lo que esas listas dejaron fuera.
El software de dictado no escribe de verdad. Convierte su voz en texto y luego simula pulsaciones para que el texto aterrice en la aplicación que tenga el foco. En Windows y macOS esa simulación es un servicio del sistema documentado e invisible para usted. En Linux es la parte más dura de todo el problema, porque cómo se simula una pulsación depende por completo de qué servidor de pantalla esté corriendo.
Bajo X11, cualquier programa puede inyectar eventos de entrada en cualquier otro. Eso es lo que hace funcionar xdotool, y también es una debilidad de seguridad de X11 reconocida desde hace tiempo: un keylogger es trivial de escribir bajo X11 exactamente por la misma razón por la que el dictado es fácil. Wayland cerró ese hueco a propósito. Una aplicación Wayland normal no puede empujar pulsaciones a otra aplicación, lo que es una mejora de seguridad real y a la vez la razón de que su herramienta de dictado se quede ahí sin hacer nada.
Compruebe esto primero
Ejecute echo $XDG_SESSION_TYPE en una terminal. Si imprime wayland, varias de las herramientas más recomendadas de esta página necesitan configuración extra antes de escribir un solo carácter. Si imprime x11, casi todo funciona de entrada.
Esto importa más cada año, porque las distribuciones principales se están pasando a Wayland por defecto. Eso significa que el consejo estándar de la primera página de Google se queda más desfasado con cada versión de Ubuntu, y las herramientas que se recomiendan con más entusiasmo suelen ser las que más setup dejan por hacer.
Casi toda herramienta de dictado open source en Linux delega el paso de escribir en una de cuatro utilidades pequeñas. Cuál necesita lo decide su servidor de pantalla, y la cantidad de setup varía enormemente entre ellas. Esta tabla es la parte de la decisión que realmente determina si una tarde de instalación sale bien.
| Backend | Servidor de pantalla | Setup | Qué conviene saber |
|---|---|---|---|
xdotool | Solo X11 | Instalar un paquete | El valor por defecto de nerd-dictation. No escribe nada bajo Wayland. |
wtype | Wayland | Instalar un paquete | Handy lo prefiere, pero su README dice que no funciona en Ubuntu 26.04. |
ydotool | X11, Wayland, TTY | Binario, grupo, regla udev, systemd | La respuesta fiable, y con mucho el setup más pesado. |
dotool | X11, Wayland, TTY | Binario más acceso a uinput | El mismo enfoque uinput que ydotool con una interfaz más simple. |
Fuente: la documentación propia de los proyectos, leída en septiembre de 2026.
La brecha entre la segunda y la tercera fila es toda la historia. Añadir wtype es un apt install. Añadir ydotool significa bajar un binario de la página de releases del proyecto, ponerlo en algún sitio de su $PATH, añadir su usuario al grupo input y escribir una regla udev para que /dev/uinput sea escribible sin root. El proyecto nerd-dictation documenta todo esto él mismo, y es sincero sobre por qué no es el valor por defecto: ydotool “requires some system configuration to use conveniently” y “lacks accessible documentation”.
# Which display server am I actually running?
$ echo $XDG_SESSION_TYPE
wayland
# The X11 answer: one package, done.
$ sudo apt install xdotool
# The Wayland answer, short version:
$ sudo apt install wtype
# The Wayland answer when wtype will not do:
$ sudo usermod -aG input $USER
$ echo 'KERNEL=="uinput", GROUP="input", MODE="0660"' \
| sudo tee /etc/udev/rules.d/80-uinput.rules
# then a systemd unit for ydotoold, then log out and back inNada de eso está fuera del alcance de quien usa Linux por elección. Simplemente conviene saber que lo tiene delante antes de empezar, en lugar de descubrirlo en el momento en que esperaba estar dictando.
Ordenadas por cuánto trabajo hay entre instalar y dictar, no por preferencia. La columna de Wayland es la que hay que leer primero.
| Herramienta | Tipo | Wayland | Instalación | Precio |
|---|---|---|---|---|
BlabbyAI | App de escritorio empaquetada | Ubuntu GNOME Wayland listado como released | .deb, AppImage, snap | $8.49/mes, plan gratis 60 créditos semanales |
Handy | App de escritorio open source | Limitado; necesita wtype, o ydotool en Ubuntu 26.04 | Binarios precompilados | Gratis, MIT |
Speech Note | Ventana independiente | No afectado, no escribe en otras apps | Flatpak | Gratis, MPL-2.0 |
Whispering | App de escritorio open source | Misma clase de setup de backend de entrada | Binarios precompilados | Gratis, traiga su propia API key |
nerd-dictation | Script CLI | No escribe nada con el backend xdotool por defecto | Clonar el repo | Gratis, GPL-3.0 |
whisper.cpp | Library y CLI | Usted cablea la entrada | Compilar desde el código fuente | Gratis, MIT |
ibus-speech-to-text | Método de entrada | Funciona vía IBus en GNOME | Paquete de la distro | Gratis |
Fuente: documentación de fabricantes y README de los proyectos, leídas en septiembre de 2026. Cifras de GitHub vía la API de GitHub el 4 de septiembre de 2026.


BlabbyAI es una app de dictado, no una herramienta de transcripción: pulsa un atajo, habla, y el texto aparece en el campo donde esté el cursor. Una barra se sitúa abajo en el centro de la pantalla, y el mismo build incluye modos personalizados, ortografías personalizadas y selección de idioma.
La razón de que encabece una lista de Linux es estrecha y concreta: está empaquetada. La descarga es un .deb, un AppImage o un snap, así que en un derivado de Debian o Ubuntu es un doble clic o un dpkg -i, y el AppImage corre sin instalar nada a nivel de sistema. La matriz de soporte en la página de Linux lista Mint Cinnamon X11, Ubuntu GNOME X11 y Ubuntu GNOME Wayland como released, con KDE Plasma aún en desarrollo. Ese último detalle es el que importa, dado todo lo anterior.

Fuente: app de Linux de BlabbyAI.
Qué obtiene a cambio del dinero
$8.49 al mes, ilimitado. El plan gratis son 60 créditos semanales sin tarjeta, que se recargan en lugar de agotarse para siempre, así que puede probarlo en trabajo real durante varias semanas.
En qué se diferencia de las herramientas gratis
Modos personalizados. Un modo es una instrucción libre de IA aplicada a lo que acaba de decir, de modo que el mismo dictado puede salir como un párrafo limpio, una lista con viñetas o un mensaje de commit.
Los modos personalizados merecen una frase más, porque son la parte sin equivalente open source en esta página. La instrucción es texto libre, no un preset, así que hace lo que un modelo de lenguaje puede hacer con un texto: quitar relleno, imponer un estilo de casa, traducir, convertir habla divagante en un informe estructurado, u honrar comandos hablados que usted define, como decir “new paragraph”. Su voz es la entrada del modo, y el modo la reescribe.
La ruta del navegador
Si la mayor parte de su escritura ocurre en un navegador, la extensión de Chrome de BlabbyAI elimina el problema del servidor de pantalla al no participar en él. Corre dentro de Chrome, así que X11, Wayland y uinput son irrelevantes, y funciona en cualquier distribución y cualquier entorno de escritorio. No hay nada que instalar a nivel de sistema ni regla udev que escribir.

Handy es una app de dictado con licencia MIT, totalmente offline y escrita en Rust, y es con diferencia la opción gratis más creíble de esta categoría. Funciona en Windows, macOS y Linux, se describe como extensible, y su principio declarado es que las herramientas de accesibilidad no deberían estar detrás de un muro de pago. Contrastada con la API de GitHub el 4 de septiembre de 2026 tiene 30.961 estrellas y el último push fue el 31 de agosto de 2026, así que es popular y se mantiene activa, lo que no es una garantía en esta categoría.
El asterisco es Wayland, y es mérito del proyecto que esté en la README en lugar de enterrado en un issue tracker. Handy lista “limited support for Wayland display server” y requiere wtype o dotool para que la entrada de texto funcione. Luego llega la frase que reencuadra toda la categoría:
De la propia README de Handy
“Ubuntu 26.04: Has Wayland display server by default. wtype does not work, you need to install ydotool and configure systemd.”
Léalo frente al hecho de que Ubuntu es la distribución de escritorio más usada y que Ubuntu actual entrega Wayland de serie. La herramienta de dictado gratis más recomendada, en la distribución más común, en su configuración por defecto, necesita el más pesado de los cuatro backends de entrada y una unidad systemd. No es una crítica a Handy, que aquí es inusualmente honesta. Es la ilustración más clara de por qué el dictado en Linux tiene fama de ser delicado.

Speech Note, a veces llamada dsnote, es la aplicación de voz offline más completa en Linux y resuelve el problema del servidor de pantalla al negarse a tenerlo. Es una ventana. Usted dicta en Speech Note, y el texto aparece en Speech Note. Como nunca intenta inyectar pulsaciones en otra aplicación, X11 y Wayland van igual de bien, y no hay backend de entrada que instalar.
Tiene licencia MPL-2.0, se instala limpio como Flatpak, y el último push fue el 2 de septiembre de 2026 con 1.624 estrellas, así que está muy viva. También hace más que dictar: speech to text offline, text to speech y traducción automática en una sola aplicación, con aceleración GPU Vulkan para modelos más grandes. Si su trabajo es producir un bloque de texto que luego pegará en otro sitio, es argumentablemente la mejor herramienta de la página.
El intercambio, dicho claro
Speech Note no es dictado de todo el sistema. Cada frase implica hablar en su ventana y luego copiar el resultado a donde realmente lo quería. Eso vale para redactar un documento y se hace pesado para una respuesta en Slack. Las herramientas que escriben directo en sus apps son las que pagan el peaje de Wayland, y esta es la otra cara de ese trato.

Whispering, parte del proyecto Epicenter, es una app de dictado open source cuya idea distintiva es que usted aporta el backend de transcripción. Soporta modelos locales y una larga lista de proveedores alojados, lo que significa que la precisión y el coste son ambos suyos para elegir, no del desarrollador para fijar. Contrastado el 4 de septiembre de 2026, el repositorio tenía 4.786 estrellas y el último push fue el 30 de agosto de 2026.
Encaja muy bien con una persona concreta: alguien que ya tiene una API key, sabe qué modelo quiere, y se opone por principio a pagar una suscripción por una capa fina sobre un modelo que podría llamar él mismo. Si esa no es usted, la elección de proveedor es una decisión más entre usted y el dictado, y el mismo trabajo de backend de entrada de Linux sigue aplicando en Wayland.
nerd-dictation es un script Python de un solo archivo basado en la API VOSK, GPL-3.0, y es genuinamente elegante: modelos diminutos de menos de 50 MB, casi sin uso de recursos, y hackeable por cualquiera cómodo en Python. Aparece en esencialmente todos los roundups de dictado en Linux, incluida la propia AI Overview de Google para esta consulta.
Dos cosas conviene decir, porque los roundups que lo recomiendan por lo general no dicen ninguna. La primera es el mantenimiento: contrastado con la API de GitHub el 4 de septiembre de 2026, el repositorio tuvo el último push el 10 de octubre de 2025, cerca de once meses sin un commit. No está archivado y el código sigue corriendo, pero no está bajo desarrollo activo como Handy y Speech Note.
La segunda es el comportamiento en Wayland, que su propia documentación describe con más claridad que cualquier artículo sobre ella. El backend de entrada por defecto es xdotool, y la guía de ydotool del proyecto dice de él, en palabras claras:
De la documentación de nerd-dictation
“It is only compatible with Xorg, not with Wayland. If you want to use Wayland, the program will not type anything.”
El arreglo es real y está documentado: pase --simulate-input-tool y elija DOTOOL, YDOTOOL o WTYPE en su lugar. La misma guía señala una segunda limitación de xdotool que conviene conocer si dicta en algo que no sea inglés: sufre “considerable slowdowns when writing characters not found in the English language, temporarily freezing your computer’s display”.
# nerd-dictation on Wayland: the default will type nothing.
$ nerd-dictation begin --simulate-input-tool=DOTOOL
# ...or YDOTOOL, if you have done the uinput and systemd setup:
$ nerd-dictation begin --simulate-input-tool=YDOTOOL
# Non-English text under xdotool can freeze the display.
# This is documented behaviour, not a bug in your setup.whisper.cpp es el port en C y C++ del modelo Whisper de OpenAI, y sostiene varias de las aplicaciones de arriba en lugar de competir con ellas. Por sí solo no es una herramienta de dictado: convierte audio en texto, y todo lo demás, el atajo, la captura del micrófono, la simulación de pulsaciones, lo escribe usted.
Para cierto tipo de usuario de Linux eso es el atractivo, no el inconveniente. Veinte líneas de shell que unen arecord a whisper.cpp a dotool producen exactamente el flujo de dictado que quiere y nada más, sin telemetría, sin cuenta y sin actualización que no haya pedido. Si alguna vez ha construido su propia barra de estado, ya sabe si este párrafo describe una buena tarde o una mala.
La última opción es distinta en especie. En lugar de ser una aplicación que escribe en otras aplicaciones, se enchufa a IBus, el framework de métodos de entrada que GNOME ya usa para cada otro teclado y método de entrada. Instala el paquete, añade Speech to Text bajo Input Sources en los ajustes del teclado, y queda disponible en aplicaciones estándar como cualquier otro método de entrada.
Como trabaja a través de la capa de métodos de entrada en lugar de simular pulsaciones, no choca con el muro de Wayland de la misma forma. Las restricciones son que en la práctica es territorio GNOME y Fedora, y que le da transcripción en bruto sin la limpieza, el formato ni las instrucciones personalizadas que las herramientas empaquetadas ponen encima. Como demostración de que el dictado en Linux puede sentirse nativo, es lo más alentador de esta lista.
El consejo habitual es empezar por la precisión, y es el extremo equivocado. La precisión es una propiedad del modelo, y cada herramienta de aquí puede correr un modelo Whisper comparable, así que la mayoría de diferencias de precisión percibidas son diferencias de tamaño de modelo que eligió sin darse cuenta. Recorra esto en orden en su lugar.
echo $XDG_SESSION_TYPE. Todo lo de abajo depende de esa respuesta, y tarda dos segundos.Sáltese la tarde del backend de entrada



Instale un .deb y empiece a dictar
60 créditos cada semana en el plan gratis, sin tarjeta. Ubuntu GNOME Wayland, Ubuntu GNOME X11 y Mint Cinnamon están listados como released, y la extensión de Chrome funciona en todas las distribuciones.
Vale la pena nombrar la asimetría de fondo, porque explica la forma de todo lo anterior. Windows incluye escritura por voz con Win+H y macOS incluye Dictation. Ambos van dentro del sistema operativo, ambos funcionan en cualquier campo de texto, y ninguno le pide pensar en cómo se entregan las pulsaciones. En esas plataformas una herramienta de dictado de terceros tiene que superar un default gratis decente.
Ninguna distribución Linux mayoritaria incluye un equivalente siempre disponible. El hueco que eso deja es por qué existen aquí siete proyectos creíbles, la mayoría gratis y varios excelentes, y también por qué todos resuelven la última milla de forma distinta. No hay un servicio del sistema al que delegar, así que cada proyecto elige su propia respuesta, y las respuestas no coinciden.
Lo que Linux hace bien
Elección real, procesamiento offline de verdad y sin facturación por minuto. Nada de aquí envía su audio a ningún sitio a menos que elija una herramienta que lo haga, y varias son auditables línea a línea.
Lo que cuesta
La última milla. Cada herramienta de aquí ha resuelto el reconocimiento de voz; lo que las separa es cuánto trabajo queda entre una transcripción que funciona y el texto apareciendo donde lo quería.
Esa es también la forma más justa de leer esta lista. No son siete herramientas de calidad variable. Son siete respuestas distintas a una pregunta de ingeniería poco glamurosa que Windows y macOS respondieron de forma central hace años, y la adecuada para usted depende menos del modelo que de su servidor de pantalla y de dónde tienen que aterrizar sus palabras.
No como Windows y macOS. Windows incluye escritura por voz con Win+H en el sistema operativo y macOS incluye Dictation, y ambos funcionan en cualquier campo de texto en cuanto los activa. Ninguna distribución Linux mayoritaria incluye un equivalente activo por defecto. Los usuarios de GNOME y Fedora pueden instalar el paquete ibus-speech-to-text y añadir Speech to Text como fuente de entrada, que es lo más cercano a una opción nativa, pero es algo que usted instala y configura, no algo que ya esté ahí. En el resto de sitios, dictar en Linux significa elegir una herramienta de terceros. Esa es toda la razón de que esta categoría exista en Linux y casi no exista en Windows: el sistema operativo deja un hueco, y siete u ocho proyectos lo han llenado cada uno a su manera.
Porque las herramientas de dictado no "escriben" de verdad. Simulan pulsaciones de tecla, y cómo se simula una pulsación en Linux depende por completo de su servidor de pantalla. Bajo X11 cualquier programa puede inyectar entrada en cualquier otro, que es lo que hace funcionar xdotool y, de paso, una debilidad de seguridad de X11. Wayland cerró ese hueco a propósito: una aplicación normal no puede empujar pulsaciones a otra aplicación. Así que una herramienta de dictado basada en xdotool transcribe su voz a la perfección y luego no escribe nada, porque el mecanismo que usa para escribir está bloqueado por diseño. Los workaround son ydotool y dotool, que operan en la capa uinput del kernel por debajo del servidor de pantalla, y wtype, que pide permiso al compositor con un protocolo Wayland que no todos los compositores implementan. Es lo más útil que hay que entender antes de elegir herramienta, y casi ningún roundup lo menciona.
Ubuntu moderno usa por defecto el servidor de pantalla Wayland, así que la pregunta real es qué herramientas manejan Wayland. BlabbyAI ofrece un build de Linux con Ubuntu GNOME en Wayland listado como released, junto a Ubuntu GNOME X11 y Mint Cinnamon X11, e instala desde un .deb, un AppImage o un snap. Handy corre en Ubuntu, pero su propia README dice que en Ubuntu 26.04, que es Wayland por defecto, wtype no funciona y hay que instalar ydotool y configurar systemd. nerd-dictation funciona si cambia el backend de simulación de entrada del xdotool por defecto. Speech Note funciona porque es una ventana en la que usted dicta, no una herramienta que escribe en otras apps, lo que evita el problema por completo a costa de no ser de todo el sistema.
Sí, y Linux está inusualmente bien servido aquí frente a otras plataformas. Handy tiene licencia MIT y es gratis, Speech Note es gratis bajo MPL-2.0, nerd-dictation es GPL-3.0, y whisper.cpp es gratis si está dispuesto a escribir scripts a su alrededor. Todos corren en local, así que no hay cobro por minuto ni cuenta. El coste es su tiempo: cada uno le pide elegir un modelo, dimensionarlo a su hardware y, en Wayland, instalar y configurar también un backend de entrada. Las herramientas de pago cobran por quitarle ese trabajo. BlabbyAI tiene un plan gratis de 60 créditos semanales sin tarjeta, para que pueda comparar una herramienta empaquetada con una open source en sus propias frases antes de decidir qué tipo de coste prefiere pagar.
Se usan de forma intercambiable y describen dos trabajos realmente distintos. La transcripción toma un archivo de audio ya existente y lo convierte en texto, que es para lo que están hechos Buzz y whisper.cpp. El dictado escribe sus palabras en la aplicación que esté usando, en vivo, como parte de escribir. En Linux esa separación importa más que en otros sitios, porque las herramientas de transcripción no tienen ningún problema de servidor de pantalla: leen un archivo y escriben un archivo, y nadie necesita inyectar pulsaciones. Las herramientas de dictado son las que se rompen en Wayland. Si busca Linux speech to text y cae en una herramienta que funciona impecable pero solo dentro de su propia ventana, esta distinción es el porqué.
Sí. BlabbyAI ofrece una app de escritorio para Linux como paquete .deb, AppImage y snap, así que se instala en derivados de Debian y Ubuntu con el gestor de paquetes, o corre desde el AppImage sin instalar nada a nivel de sistema. La matriz de soporte en la página de Linux lista actualmente Mint Cinnamon X11, Ubuntu GNOME X11 y Ubuntu GNOME Wayland como released, con KDE Plasma en desarrollo. Funciona igual que la app de Windows: un atajo de teclado, una barra abajo en el centro y texto escrito en la aplicación que tenga el foco, más modos personalizados, ortografías personalizadas y selección de idioma. La app de Windows y la extensión de Chrome siguen siendo los dos productos que más promocionamos, pero el build de Linux es real y descargable, no una lista de espera.
Es la respuesta más infravalorada a toda la pregunta y merece más atención de la que recibe. Una extensión de Chrome corre dentro del navegador, así que no toca X11, Wayland, uinput ni ninguna tubería del servidor de pantalla. El problema de compatibilidad que domina el resto de opciones de esta página simplemente no aplica. Si la mayor parte de lo que escribe ocurre en un navegador, que para mucha gente es Gmail, Google Docs, Notion, Jira, Slack, Linear y cada herramienta web interna del trabajo, la extensión de Chrome de BlabbyAI dicta en todas ellas en cualquier distribución Linux y cualquier entorno de escritorio, sin paquete que instalar y sin regla udev que escribir. No escribirá en una aplicación nativa GTK o Qt, así que no sustituye del todo a una app de escritorio, pero para trabajo centrado en el navegador elimina la parte más dura del dictado en Linux al no participar en ella.
La precisión es una propiedad del modelo, no del sistema operativo, así que un modelo Whisper concreto produce la misma calidad de transcripción en Linux que en cualquier otro sitio. Lo que cambia en Linux es qué modelo acaba ejecutando. Las herramientas open source usan por defecto modelos locales más pequeños, dimensionados para correr cómodos en hardware ordinario, y un modelo pequeño es mediblemente peor con nombres propios, términos técnicos y nombres poco habituales. Así que la brecha de precisión que la gente reporta entre dictado en Linux y en Windows suele ser una brecha de tamaño de modelo que eligió sin darse cuenta, no una limitación de la plataforma. Si una herramienta local se siente imprecisa, pruebe un modelo más grande antes de cambiar de herramienta, y espere que sea más lenta.
Los desarrolladores enfrentan una versión concreta del problema, porque las aplicaciones en las que más escribe, un terminal y un editor, son exactamente donde la inyección de pulsaciones es más delicada, y porque el vocabulario cercano al código castiga a los modelos pequeños. Dos enfoques funcionan bien. Use una herramienta empaquetada de todo el sistema como BlabbyAI para que el dictado se comporte igual en un navegador, un editor y una ventana de chat, y use un modo personalizado para dar forma al texto hablado. O, si prefiere armarlo usted mismo, combine whisper.cpp con dotool y escriba scripts que unan las piezas. El punto mayor es que la mayor parte del día de un desarrollador no es escribir código: son descripciones de pull request, mensajes de commit, respuestas en Slack, comentarios de tickets y documentación, toda prosa ordinaria que se dicta bien.
No, pero cambia qué herramientas se sienten usables. Todas las opciones locales de aquí corren en CPU, y los modelos Whisper pequeños transcriben una frase corta en la CPU de un portátil ordinario en uno o dos segundos, lo que basta para trozos de tamaño de dictado. Donde una GPU importa es la transcripción larga y los modelos más grandes, y Speech Note anuncia expresamente aceleración GPU Vulkan por exactamente ese motivo. Las herramientas en la nube evitan la pregunta de hardware al hacer el trabajo en un servidor, por eso se sienten instantáneas en un portátil fino y por eso necesitan conexión de red. Decida cuál de esos intercambios le molesta menos antes de juzgar una herramienta por velocidad.
Dictado en Linux sin la tarde de setup
BlabbyAI ofrece un .deb, AppImage y snap de Linux, con Ubuntu GNOME Wayland listado como released, más una extensión de Chrome que funciona en todas las distribuciones. El plan gratis son 60 créditos semanales, sin tarjeta.