Actualizado 4 de septiembre de 2026 · Por Sumbat.T

Speech to Text en Linux: 7 herramientas que sí escriben (2026)

Una ventana de terminal Linux con una onda de sonido atravesándola, que representa el dictado por voz en un escritorio Linux

La respuesta corta

  • Su servidor de pantalla decide qué herramientas funcionan, y casi ninguna guía se lo dice. Las herramientas de dictado no escriben, simulan pulsaciones, y Wayland bloquea eso por diseño. La propia documentación de nerd-dictation dice que en Wayland “the program will not type anything” con su backend por defecto. Compruebe si corre X11 o Wayland antes de elegir nada.
  • Ubuntu es el caso más duro, porque usa Wayland por defecto. La README de Handy afirma que en Ubuntu 26.04, wtype no funciona y necesita ydotool más una unidad systemd. Ese es el estado de la herramienta gratis más recomendada en la distribución más popular.
  • Las herramientas gratis son realmente buenas y cuestan tiempo. Handy (MIT, 30.961 estrellas en GitHub), Speech Note (MPL-2.0) y nerd-dictation (GPL-3.0) corren todas totalmente offline. Usted paga en selección de modelo y configuración del backend de entrada, no en dinero.
  • Si prefiere saltarse todo eso, BlabbyAI ofrece un build de Linux como .deb, AppImage y snap, con Ubuntu GNOME Wayland listado como released. Cuesta $8.49 al mes con un plan gratis de 60 créditos semanales, sin tarjeta. Y como la extensión de Chrome corre en el navegador, no toca X11 ni Wayland en absoluto.

Dicte en Linux

ChatGPTGoogle DocsGmailWhatsAppMicrosoft Word

Microphone

Un build de Linux que se instala desde un .deb

Ubuntu GNOME en Wayland, Ubuntu GNOME en X11 y Mint Cinnamon están listados como released. O use la extensión de Chrome, que evita por completo el servidor de pantalla.

Add BlabbyAI to Chrome

La pregunta que omite toda guía de dictado en Linux

Busque Linux speech to text y obtendrá una lista de siete u ocho herramientas, cada una con un párrafo sobre su modelo y su licencia. Instale la recomendación principal y hay una probabilidad decente de que transcriba su voz a la perfección y luego no escriba absolutamente nada en su editor. Nada está roto. Simplemente ha chocado con lo que esas listas dejaron fuera.

El software de dictado no escribe de verdad. Convierte su voz en texto y luego simula pulsaciones para que el texto aterrice en la aplicación que tenga el foco. En Windows y macOS esa simulación es un servicio del sistema documentado e invisible para usted. En Linux es la parte más dura de todo el problema, porque cómo se simula una pulsación depende por completo de qué servidor de pantalla esté corriendo.

Bajo X11, cualquier programa puede inyectar eventos de entrada en cualquier otro. Eso es lo que hace funcionar xdotool, y también es una debilidad de seguridad de X11 reconocida desde hace tiempo: un keylogger es trivial de escribir bajo X11 exactamente por la misma razón por la que el dictado es fácil. Wayland cerró ese hueco a propósito. Una aplicación Wayland normal no puede empujar pulsaciones a otra aplicación, lo que es una mejora de seguridad real y a la vez la razón de que su herramienta de dictado se quede ahí sin hacer nada.

Compruebe esto primero

Ejecute echo $XDG_SESSION_TYPE en una terminal. Si imprime wayland, varias de las herramientas más recomendadas de esta página necesitan configuración extra antes de escribir un solo carácter. Si imprime x11, casi todo funciona de entrada.

Esto importa más cada año, porque las distribuciones principales se están pasando a Wayland por defecto. Eso significa que el consejo estándar de la primera página de Google se queda más desfasado con cada versión de Ubuntu, y las herramientas que se recomiendan con más entusiasmo suelen ser las que más setup dejan por hacer.

Los cuatro backends de entrada, y lo que le cuesta cada uno

Casi toda herramienta de dictado open source en Linux delega el paso de escribir en una de cuatro utilidades pequeñas. Cuál necesita lo decide su servidor de pantalla, y la cantidad de setup varía enormemente entre ellas. Esta tabla es la parte de la decisión que realmente determina si una tarde de instalación sale bien.

BackendServidor de pantallaSetupQué conviene saber
xdotoolSolo X11Instalar un paqueteEl valor por defecto de nerd-dictation. No escribe nada bajo Wayland.
wtypeWaylandInstalar un paqueteHandy lo prefiere, pero su README dice que no funciona en Ubuntu 26.04.
ydotoolX11, Wayland, TTYBinario, grupo, regla udev, systemdLa respuesta fiable, y con mucho el setup más pesado.
dotoolX11, Wayland, TTYBinario más acceso a uinputEl mismo enfoque uinput que ydotool con una interfaz más simple.

Fuente: la documentación propia de los proyectos, leída en septiembre de 2026.

La brecha entre la segunda y la tercera fila es toda la historia. Añadir wtype es un apt install. Añadir ydotool significa bajar un binario de la página de releases del proyecto, ponerlo en algún sitio de su $PATH, añadir su usuario al grupo input y escribir una regla udev para que /dev/uinput sea escribible sin root. El proyecto nerd-dictation documenta todo esto él mismo, y es sincero sobre por qué no es el valor por defecto: ydotool “requires some system configuration to use conveniently” y “lacks accessible documentation”.

# Which display server am I actually running? $ echo $XDG_SESSION_TYPE wayland # The X11 answer: one package, done. $ sudo apt install xdotool # The Wayland answer, short version: $ sudo apt install wtype # The Wayland answer when wtype will not do: $ sudo usermod -aG input $USER $ echo 'KERNEL=="uinput", GROUP="input", MODE="0660"' \ | sudo tee /etc/udev/rules.d/80-uinput.rules # then a systemd unit for ydotoold, then log out and back in

Nada de eso está fuera del alcance de quien usa Linux por elección. Simplemente conviene saber que lo tiene delante antes de empezar, en lugar de descubrirlo en el momento en que esperaba estar dictando.

Las siete herramientas de un vistazo

Ordenadas por cuánto trabajo hay entre instalar y dictar, no por preferencia. La columna de Wayland es la que hay que leer primero.

HerramientaTipoWaylandInstalaciónPrecio
Logo de BlabbyAIBlabbyAI
App de escritorio empaquetadaUbuntu GNOME Wayland listado como released.deb, AppImage, snap$8.49/mes, plan gratis 60 créditos semanales
Logo de HandyHandy
App de escritorio open sourceLimitado; necesita wtype, o ydotool en Ubuntu 26.04Binarios precompiladosGratis, MIT
Logo de Speech NoteSpeech Note
Ventana independienteNo afectado, no escribe en otras appsFlatpakGratis, MPL-2.0
Logo de WhisperingWhispering
App de escritorio open sourceMisma clase de setup de backend de entradaBinarios precompiladosGratis, traiga su propia API key
nerd-dictation
Script CLINo escribe nada con el backend xdotool por defectoClonar el repoGratis, GPL-3.0
whisper.cpp
Library y CLIUsted cablea la entradaCompilar desde el código fuenteGratis, MIT
ibus-speech-to-text
Método de entradaFunciona vía IBus en GNOMEPaquete de la distroGratis

Fuente: documentación de fabricantes y README de los proyectos, leídas en septiembre de 2026. Cifras de GitHub vía la API de GitHub el 4 de septiembre de 2026.

BlabbyAILinux

1. BlabbyAI: un build de Linux empaquetado, incluido Wayland

BlabbyAI es una app de dictado, no una herramienta de transcripción: pulsa un atajo, habla, y el texto aparece en el campo donde esté el cursor. Una barra se sitúa abajo en el centro de la pantalla, y el mismo build incluye modos personalizados, ortografías personalizadas y selección de idioma.

La razón de que encabece una lista de Linux es estrecha y concreta: está empaquetada. La descarga es un .deb, un AppImage o un snap, así que en un derivado de Debian o Ubuntu es un doble clic o un dpkg -i, y el AppImage corre sin instalar nada a nivel de sistema. La matriz de soporte en la página de Linux lista Mint Cinnamon X11, Ubuntu GNOME X11 y Ubuntu GNOME Wayland como released, con KDE Plasma aún en desarrollo. Ese último detalle es el que importa, dado todo lo anterior.

BlabbyAI en un escritorio Linux, con la barra de dictado en la parte inferior de la pantalla

Fuente: app de Linux de BlabbyAI.

Qué obtiene a cambio del dinero

$8.49 al mes, ilimitado. El plan gratis son 60 créditos semanales sin tarjeta, que se recargan en lugar de agotarse para siempre, así que puede probarlo en trabajo real durante varias semanas.

En qué se diferencia de las herramientas gratis

Modos personalizados. Un modo es una instrucción libre de IA aplicada a lo que acaba de decir, de modo que el mismo dictado puede salir como un párrafo limpio, una lista con viñetas o un mensaje de commit.

Los modos personalizados merecen una frase más, porque son la parte sin equivalente open source en esta página. La instrucción es texto libre, no un preset, así que hace lo que un modelo de lenguaje puede hacer con un texto: quitar relleno, imponer un estilo de casa, traducir, convertir habla divagante en un informe estructurado, u honrar comandos hablados que usted define, como decir “new paragraph”. Su voz es la entrada del modo, y el modo la reescribe.

La ruta del navegador

Si la mayor parte de su escritura ocurre en un navegador, la extensión de Chrome de BlabbyAI elimina el problema del servidor de pantalla al no participar en él. Corre dentro de Chrome, así que X11, Wayland y uinput son irrelevantes, y funciona en cualquier distribución y cualquier entorno de escritorio. No hay nada que instalar a nivel de sistema ni regla udev que escribir.

Handy

2. Handy: la mejor opción de escritorio gratis, con un asterisco de Wayland

Handy es una app de dictado con licencia MIT, totalmente offline y escrita en Rust, y es con diferencia la opción gratis más creíble de esta categoría. Funciona en Windows, macOS y Linux, se describe como extensible, y su principio declarado es que las herramientas de accesibilidad no deberían estar detrás de un muro de pago. Contrastada con la API de GitHub el 4 de septiembre de 2026 tiene 30.961 estrellas y el último push fue el 31 de agosto de 2026, así que es popular y se mantiene activa, lo que no es una garantía en esta categoría.

El asterisco es Wayland, y es mérito del proyecto que esté en la README en lugar de enterrado en un issue tracker. Handy lista “limited support for Wayland display server” y requiere wtype o dotool para que la entrada de texto funcione. Luego llega la frase que reencuadra toda la categoría:

De la propia README de Handy

“Ubuntu 26.04: Has Wayland display server by default. wtype does not work, you need to install ydotool and configure systemd.”

Léalo frente al hecho de que Ubuntu es la distribución de escritorio más usada y que Ubuntu actual entrega Wayland de serie. La herramienta de dictado gratis más recomendada, en la distribución más común, en su configuración por defecto, necesita el más pesado de los cuatro backends de entrada y una unidad systemd. No es una crítica a Handy, que aquí es inusualmente honesta. Es la ilustración más clara de por qué el dictado en Linux tiene fama de ser delicado.

Speech Note

3. Speech Note: evita todo el problema

Speech Note, a veces llamada dsnote, es la aplicación de voz offline más completa en Linux y resuelve el problema del servidor de pantalla al negarse a tenerlo. Es una ventana. Usted dicta en Speech Note, y el texto aparece en Speech Note. Como nunca intenta inyectar pulsaciones en otra aplicación, X11 y Wayland van igual de bien, y no hay backend de entrada que instalar.

Tiene licencia MPL-2.0, se instala limpio como Flatpak, y el último push fue el 2 de septiembre de 2026 con 1.624 estrellas, así que está muy viva. También hace más que dictar: speech to text offline, text to speech y traducción automática en una sola aplicación, con aceleración GPU Vulkan para modelos más grandes. Si su trabajo es producir un bloque de texto que luego pegará en otro sitio, es argumentablemente la mejor herramienta de la página.

El intercambio, dicho claro

Speech Note no es dictado de todo el sistema. Cada frase implica hablar en su ventana y luego copiar el resultado a donde realmente lo quería. Eso vale para redactar un documento y se hace pesado para una respuesta en Slack. Las herramientas que escriben directo en sus apps son las que pagan el peaje de Wayland, y esta es la otra cara de ese trato.

Whispering

4. Whispering: traiga su propio proveedor de transcripción

Whispering, parte del proyecto Epicenter, es una app de dictado open source cuya idea distintiva es que usted aporta el backend de transcripción. Soporta modelos locales y una larga lista de proveedores alojados, lo que significa que la precisión y el coste son ambos suyos para elegir, no del desarrollador para fijar. Contrastado el 4 de septiembre de 2026, el repositorio tenía 4.786 estrellas y el último push fue el 30 de agosto de 2026.

Encaja muy bien con una persona concreta: alguien que ya tiene una API key, sabe qué modelo quiere, y se opone por principio a pagar una suscripción por una capa fina sobre un modelo que podría llamar él mismo. Si esa no es usted, la elección de proveedor es una decisión más entre usted y el dictado, y el mismo trabajo de backend de entrada de Linux sigue aplicando en Wayland.

5. nerd-dictation: lo que la primera página sigue recomendando

nerd-dictation es un script Python de un solo archivo basado en la API VOSK, GPL-3.0, y es genuinamente elegante: modelos diminutos de menos de 50 MB, casi sin uso de recursos, y hackeable por cualquiera cómodo en Python. Aparece en esencialmente todos los roundups de dictado en Linux, incluida la propia AI Overview de Google para esta consulta.

Dos cosas conviene decir, porque los roundups que lo recomiendan por lo general no dicen ninguna. La primera es el mantenimiento: contrastado con la API de GitHub el 4 de septiembre de 2026, el repositorio tuvo el último push el 10 de octubre de 2025, cerca de once meses sin un commit. No está archivado y el código sigue corriendo, pero no está bajo desarrollo activo como Handy y Speech Note.

La segunda es el comportamiento en Wayland, que su propia documentación describe con más claridad que cualquier artículo sobre ella. El backend de entrada por defecto es xdotool, y la guía de ydotool del proyecto dice de él, en palabras claras:

De la documentación de nerd-dictation

“It is only compatible with Xorg, not with Wayland. If you want to use Wayland, the program will not type anything.”

El arreglo es real y está documentado: pase --simulate-input-tool y elija DOTOOL, YDOTOOL o WTYPE en su lugar. La misma guía señala una segunda limitación de xdotool que conviene conocer si dicta en algo que no sea inglés: sufre “considerable slowdowns when writing characters not found in the English language, temporarily freezing your computer’s display”.

# nerd-dictation on Wayland: the default will type nothing. $ nerd-dictation begin --simulate-input-tool=DOTOOL # ...or YDOTOOL, if you have done the uinput and systemd setup: $ nerd-dictation begin --simulate-input-tool=YDOTOOL # Non-English text under xdotool can freeze the display. # This is documented behaviour, not a bug in your setup.

6. whisper.cpp: las piezas, no el producto

whisper.cpp es el port en C y C++ del modelo Whisper de OpenAI, y sostiene varias de las aplicaciones de arriba en lugar de competir con ellas. Por sí solo no es una herramienta de dictado: convierte audio en texto, y todo lo demás, el atajo, la captura del micrófono, la simulación de pulsaciones, lo escribe usted.

Para cierto tipo de usuario de Linux eso es el atractivo, no el inconveniente. Veinte líneas de shell que unen arecord a whisper.cpp a dotool producen exactamente el flujo de dictado que quiere y nada más, sin telemetría, sin cuenta y sin actualización que no haya pedido. Si alguna vez ha construido su propia barra de estado, ya sabe si este párrafo describe una buena tarde o una mala.

7. ibus-speech-to-text: lo más cercano a una opción nativa

La última opción es distinta en especie. En lugar de ser una aplicación que escribe en otras aplicaciones, se enchufa a IBus, el framework de métodos de entrada que GNOME ya usa para cada otro teclado y método de entrada. Instala el paquete, añade Speech to Text bajo Input Sources en los ajustes del teclado, y queda disponible en aplicaciones estándar como cualquier otro método de entrada.

Como trabaja a través de la capa de métodos de entrada en lugar de simular pulsaciones, no choca con el muro de Wayland de la misma forma. Las restricciones son que en la práctica es territorio GNOME y Fedora, y que le da transcripción en bruto sin la limpieza, el formato ni las instrucciones personalizadas que las herramientas empaquetadas ponen encima. Como demostración de que el dictado en Linux puede sentirse nativo, es lo más alentador de esta lista.

Cómo elegir, en el orden que de verdad importa

El consejo habitual es empezar por la precisión, y es el extremo equivocado. La precisión es una propiedad del modelo, y cada herramienta de aquí puede correr un modelo Whisper comparable, así que la mayoría de diferencias de precisión percibidas son diferencias de tamaño de modelo que eligió sin darse cuenta. Recorra esto en orden en su lugar.

    1. Averigüe qué está corriendo. echo $XDG_SESSION_TYPE. Todo lo de abajo depende de esa respuesta, y tarda dos segundos.
    2. Decida si necesita escritura de todo el sistema. Si está redactando texto largo que de todos modos va a pegar, Speech Note es excelente y se salta todo el problema. Si quiere dictar una respuesta en Slack sin cambiar de ventana, necesita una herramienta que escriba en otras aplicaciones, y la pregunta del servidor de pantalla se vuelve real.
    3. Pregúntese dónde ocurre de verdad su escritura. Si la respuesta honesta es “en una pestaña del navegador”, una extensión de Chrome lo resuelve sin instalación a nivel de sistema en cualquier distribución.
    4. Luego decida qué prefiere gastar. Las herramientas gratis cuestan una tarde de configuración y mantenimiento ocasional. Una herramienta empaquetada como BlabbyAI cuesta $8.49 al mes y llega como .deb. Ambas son respuestas legítimas, y los usuarios de Linux están inusualmente bien situados para elegir la primera a propósito.
    5. Solo entonces compare modelos. Y cuando una herramienta se sienta imprecisa, pruebe un modelo más grande antes de probar una herramienta distinta.

Sáltese la tarde del backend de entrada

ChatGPTGoogle DocsGmailWhatsAppMicrosoft Word

Microphone

Instale un .deb y empiece a dictar

60 créditos cada semana en el plan gratis, sin tarjeta. Ubuntu GNOME Wayland, Ubuntu GNOME X11 y Mint Cinnamon están listados como released, y la extensión de Chrome funciona en todas las distribuciones.

Add BlabbyAI to Chrome

Por qué esta categoría existe en Linux y apenas existe en otros sitios

Vale la pena nombrar la asimetría de fondo, porque explica la forma de todo lo anterior. Windows incluye escritura por voz con Win+H y macOS incluye Dictation. Ambos van dentro del sistema operativo, ambos funcionan en cualquier campo de texto, y ninguno le pide pensar en cómo se entregan las pulsaciones. En esas plataformas una herramienta de dictado de terceros tiene que superar un default gratis decente.

Ninguna distribución Linux mayoritaria incluye un equivalente siempre disponible. El hueco que eso deja es por qué existen aquí siete proyectos creíbles, la mayoría gratis y varios excelentes, y también por qué todos resuelven la última milla de forma distinta. No hay un servicio del sistema al que delegar, así que cada proyecto elige su propia respuesta, y las respuestas no coinciden.

Lo que Linux hace bien

Elección real, procesamiento offline de verdad y sin facturación por minuto. Nada de aquí envía su audio a ningún sitio a menos que elija una herramienta que lo haga, y varias son auditables línea a línea.

Lo que cuesta

La última milla. Cada herramienta de aquí ha resuelto el reconocimiento de voz; lo que las separa es cuánto trabajo queda entre una transcripción que funciona y el texto apareciendo donde lo quería.

Esa es también la forma más justa de leer esta lista. No son siete herramientas de calidad variable. Son siete respuestas distintas a una pregunta de ingeniería poco glamurosa que Windows y macOS respondieron de forma central hace años, y la adecuada para usted depende menos del modelo que de su servidor de pantalla y de dónde tienen que aterrizar sus palabras.

Preguntas frecuentes

¿Linux tiene speech to text integrado?

No como Windows y macOS. Windows incluye escritura por voz con Win+H en el sistema operativo y macOS incluye Dictation, y ambos funcionan en cualquier campo de texto en cuanto los activa. Ninguna distribución Linux mayoritaria incluye un equivalente activo por defecto. Los usuarios de GNOME y Fedora pueden instalar el paquete ibus-speech-to-text y añadir Speech to Text como fuente de entrada, que es lo más cercano a una opción nativa, pero es algo que usted instala y configura, no algo que ya esté ahí. En el resto de sitios, dictar en Linux significa elegir una herramienta de terceros. Esa es toda la razón de que esta categoría exista en Linux y casi no exista en Windows: el sistema operativo deja un hueco, y siete u ocho proyectos lo han llenado cada uno a su manera.

¿Por qué falla el software de dictado en Wayland?

Porque las herramientas de dictado no "escriben" de verdad. Simulan pulsaciones de tecla, y cómo se simula una pulsación en Linux depende por completo de su servidor de pantalla. Bajo X11 cualquier programa puede inyectar entrada en cualquier otro, que es lo que hace funcionar xdotool y, de paso, una debilidad de seguridad de X11. Wayland cerró ese hueco a propósito: una aplicación normal no puede empujar pulsaciones a otra aplicación. Así que una herramienta de dictado basada en xdotool transcribe su voz a la perfección y luego no escribe nada, porque el mecanismo que usa para escribir está bloqueado por diseño. Los workaround son ydotool y dotool, que operan en la capa uinput del kernel por debajo del servidor de pantalla, y wtype, que pide permiso al compositor con un protocolo Wayland que no todos los compositores implementan. Es lo más útil que hay que entender antes de elegir herramienta, y casi ningún roundup lo menciona.

¿Qué herramienta de speech to text funciona en Ubuntu?

Ubuntu moderno usa por defecto el servidor de pantalla Wayland, así que la pregunta real es qué herramientas manejan Wayland. BlabbyAI ofrece un build de Linux con Ubuntu GNOME en Wayland listado como released, junto a Ubuntu GNOME X11 y Mint Cinnamon X11, e instala desde un .deb, un AppImage o un snap. Handy corre en Ubuntu, pero su propia README dice que en Ubuntu 26.04, que es Wayland por defecto, wtype no funciona y hay que instalar ydotool y configurar systemd. nerd-dictation funciona si cambia el backend de simulación de entrada del xdotool por defecto. Speech Note funciona porque es una ventana en la que usted dicta, no una herramienta que escribe en otras apps, lo que evita el problema por completo a costa de no ser de todo el sistema.

¿Hay software de speech to text gratis para Linux?

Sí, y Linux está inusualmente bien servido aquí frente a otras plataformas. Handy tiene licencia MIT y es gratis, Speech Note es gratis bajo MPL-2.0, nerd-dictation es GPL-3.0, y whisper.cpp es gratis si está dispuesto a escribir scripts a su alrededor. Todos corren en local, así que no hay cobro por minuto ni cuenta. El coste es su tiempo: cada uno le pide elegir un modelo, dimensionarlo a su hardware y, en Wayland, instalar y configurar también un backend de entrada. Las herramientas de pago cobran por quitarle ese trabajo. BlabbyAI tiene un plan gratis de 60 créditos semanales sin tarjeta, para que pueda comparar una herramienta empaquetada con una open source en sus propias frases antes de decidir qué tipo de coste prefiere pagar.

¿Cuál es la diferencia entre speech to text y dictado en Linux?

Se usan de forma intercambiable y describen dos trabajos realmente distintos. La transcripción toma un archivo de audio ya existente y lo convierte en texto, que es para lo que están hechos Buzz y whisper.cpp. El dictado escribe sus palabras en la aplicación que esté usando, en vivo, como parte de escribir. En Linux esa separación importa más que en otros sitios, porque las herramientas de transcripción no tienen ningún problema de servidor de pantalla: leen un archivo y escriben un archivo, y nadie necesita inyectar pulsaciones. Las herramientas de dictado son las que se rompen en Wayland. Si busca Linux speech to text y cae en una herramienta que funciona impecable pero solo dentro de su propia ventana, esta distinción es el porqué.

¿BlabbyAI funciona en Linux?

Sí. BlabbyAI ofrece una app de escritorio para Linux como paquete .deb, AppImage y snap, así que se instala en derivados de Debian y Ubuntu con el gestor de paquetes, o corre desde el AppImage sin instalar nada a nivel de sistema. La matriz de soporte en la página de Linux lista actualmente Mint Cinnamon X11, Ubuntu GNOME X11 y Ubuntu GNOME Wayland como released, con KDE Plasma en desarrollo. Funciona igual que la app de Windows: un atajo de teclado, una barra abajo en el centro y texto escrito en la aplicación que tenga el foco, más modos personalizados, ortografías personalizadas y selección de idioma. La app de Windows y la extensión de Chrome siguen siendo los dos productos que más promocionamos, pero el build de Linux es real y descargable, no una lista de espera.

¿Puedo usar una extensión de Chrome para dictar en Linux en su lugar?

Es la respuesta más infravalorada a toda la pregunta y merece más atención de la que recibe. Una extensión de Chrome corre dentro del navegador, así que no toca X11, Wayland, uinput ni ninguna tubería del servidor de pantalla. El problema de compatibilidad que domina el resto de opciones de esta página simplemente no aplica. Si la mayor parte de lo que escribe ocurre en un navegador, que para mucha gente es Gmail, Google Docs, Notion, Jira, Slack, Linear y cada herramienta web interna del trabajo, la extensión de Chrome de BlabbyAI dicta en todas ellas en cualquier distribución Linux y cualquier entorno de escritorio, sin paquete que instalar y sin regla udev que escribir. No escribirá en una aplicación nativa GTK o Qt, así que no sustituye del todo a una app de escritorio, pero para trabajo centrado en el navegador elimina la parte más dura del dictado en Linux al no participar en ella.

¿Qué tan preciso es el speech to text en Linux frente a Windows?

La precisión es una propiedad del modelo, no del sistema operativo, así que un modelo Whisper concreto produce la misma calidad de transcripción en Linux que en cualquier otro sitio. Lo que cambia en Linux es qué modelo acaba ejecutando. Las herramientas open source usan por defecto modelos locales más pequeños, dimensionados para correr cómodos en hardware ordinario, y un modelo pequeño es mediblemente peor con nombres propios, términos técnicos y nombres poco habituales. Así que la brecha de precisión que la gente reporta entre dictado en Linux y en Windows suele ser una brecha de tamaño de modelo que eligió sin darse cuenta, no una limitación de la plataforma. Si una herramienta local se siente imprecisa, pruebe un modelo más grande antes de cambiar de herramienta, y espere que sea más lenta.

¿Cuál es la mejor herramienta de speech to text para desarrolladores en Linux?

Los desarrolladores enfrentan una versión concreta del problema, porque las aplicaciones en las que más escribe, un terminal y un editor, son exactamente donde la inyección de pulsaciones es más delicada, y porque el vocabulario cercano al código castiga a los modelos pequeños. Dos enfoques funcionan bien. Use una herramienta empaquetada de todo el sistema como BlabbyAI para que el dictado se comporte igual en un navegador, un editor y una ventana de chat, y use un modo personalizado para dar forma al texto hablado. O, si prefiere armarlo usted mismo, combine whisper.cpp con dotool y escriba scripts que unan las piezas. El punto mayor es que la mayor parte del día de un desarrollador no es escribir código: son descripciones de pull request, mensajes de commit, respuestas en Slack, comentarios de tickets y documentación, toda prosa ordinaria que se dicta bien.

¿Necesito una GPU para ejecutar speech to text en Linux?

No, pero cambia qué herramientas se sienten usables. Todas las opciones locales de aquí corren en CPU, y los modelos Whisper pequeños transcriben una frase corta en la CPU de un portátil ordinario en uno o dos segundos, lo que basta para trozos de tamaño de dictado. Donde una GPU importa es la transcripción larga y los modelos más grandes, y Speech Note anuncia expresamente aceleración GPU Vulkan por exactamente ese motivo. Las herramientas en la nube evitan la pregunta de hardware al hacer el trabajo en un servidor, por eso se sienten instantáneas en un portátil fino y por eso necesitan conexión de red. Decida cuál de esos intercambios le molesta menos antes de juzgar una herramienta por velocidad.

Dictado en Linux sin la tarde de setup

BlabbyAI ofrece un .deb, AppImage y snap de Linux, con Ubuntu GNOME Wayland listado como released, más una extensión de Chrome que funciona en todas las distribuciones. El plan gratis son 60 créditos semanales, sin tarjeta.

Add BlabbyAI to Chrome