Publicado el 13 de agosto de 2026 · Por Sumbat.T

El dictado no va a sustituir su teclado para escribir código, y quien diga lo contrario está vendiendo algo. Escribir código de verdad por voz es un nicho especializado, y Talon con Cursorless lo ocupa. Lo que cubre el dictado general es todo lo que rodea al código: prompts de IA, descripciones de PR, comentarios de revisión, mensajes de commit, docs y chat. Para muchos desarrolladores eso es el 30 a 50% de lo que teclean en un día.
Para esa mitad en prosa, una herramienta de todo el sistema como BlabbyAI (Windows y Linux, un atajo global) le lleva a unas 150 palabras habladas por minuto, sin curva de aprendizaje. Transparencia: nosotros desarrollamos BlabbyAI, así que lea nuestra recomendación con eso en mente. El resto de esta guía se mantiene honesta sobre lo que la voz puede y no puede hacer por los desarrolladores.
Consiga BlabbyAI para Windows
Dictado con IA en todo el sistema. Gratis para empezar, sin tarjeta.
Los desarrolladores oyen "dictado" y se imaginan a alguien intentando dictar llaves de código. Esa imagen está equivocada de un modo útil. La mayor parte de lo que un desarrollador teclea en 2026 no es código: son prompts de IA, descripciones de PR, comentarios de revisión, mensajes de commit, docs y chat. La gente habla a 130 a 150 palabras por minuto pero teclea unas 40 (Mobius MD). La voz es la entrada más rápida justo para esa mitad en prosa del trabajo.
Esta guía es deliberadamente honesta sobre el alcance. Programar por voz es una disciplina real, con sus propias herramientas, y las cubrimos más abajo. El caso de la voz a texto en el día de un desarrollador se sostiene en todo lo que rodea al código, no en el código en sí. Para el panorama de herramientas más allá de la programación, nuestro hub de software de dictado tiene el cuadro completo.
El reflejo va así: dictado significa escribir código por voz, decir en voz alta for, open paren, let i equals zero es absurdo, luego el dictado no es para programadores. Se descarta toda la categoría de un golpe. El razonamiento es sólido; la premisa es falsa.
Lo que se rechaza es real, y tiene herramientas reales. Talon, normalmente junto con Cursorless en VS Code, es una pila seria y muy trabajada de codificación por voz: gramáticas de comandos hablados, edición estructural, soporte de seguimiento ocular, navegación completa del editor. Hay quien programa así a jornada completa, a menudo después de que una lesión obligara al cambio. Si su objetivo es escribir código sin manos, ahí es donde hay que ir, y ninguna app de dictado general le llevará. El respeto, donde corresponde.
Lo que el reflejo deja fuera es todo lo demás que tecleó hoy. Abra la actividad de GitHub de ayer y el historial de Slack y cuente las palabras. La descripción del PR. Tres comentarios de revisión. El update del standup. Un informe de error con pasos de reproducción. Cuatro mensajes de commit. El prompt que escribió para Claude, y luego reescribió dos veces. En nuestra experiencia eso suma el 30 a 50% de lo que se teclea en un día de trabajo para muchos desarrolladores, y nada de eso implica sintaxis.
El dictado general cubre esa franja entera hoy, sin más curva de aprendizaje que un atajo de teclado. Esa es la propuesta honesta, y el resto de esta guía se queda dentro.
La encuesta a desarrolladores de Stack Overflow de 2025 encontró que el 84% de los desarrolladores usa o planea usar herramientas de IA en su flujo de trabajo (Stack Overflow). Ese giro cambió en silencio de qué está hecha la escritura de un desarrollador. Escribir prompts es escribir prosa, y cuanto más detallada sea esa prosa, mejor sale el resultado.
Aquí está el problema que conoce todo usuario de Copilot, Claude y ChatGPT: el prompt detallado gana, y el prompt corto se teclea igual. Un buen prompt lleva contexto, restricciones, lo que ya intentó y la forma de la respuesta que quiere. Eso son 150 a 300 palabras, y a 40 palabras por minuto de tecleo son cinco minutos de fricción. Así que todos tecleamos "arregla este test" y luego pasamos tres rondas aclarando.
La voz quita esa fricción. Doscientas palabras son unos 90 segundos de habla. Suelte todo el contexto de una vez, el modelo hace mejor trabajo a la primera y desaparecen los ida y vuelta. Funciona igual en Copilot Chat, el panel de chat de Cursor, Claude y ChatGPT, porque todos son campos de texto. Nuestra guía de voz a texto en ChatGPT recorre la configuración.
El matiz honesto: los prompts cortos no se benefician. "Renombra esta variable" se teclea más rápido. La ganancia está en los prompts largos y cargados de contexto, que casualmente son los que producen código usable.
Abra el pull request, haga clic en el campo de descripción, pulse su atajo de dictado (Ctrl+Space en BlabbyAI) y explique el cambio como se lo contaría a un revisor de pie junto a su mesa: qué cambió, por qué, qué probó, de qué no está seguro. Pulse el atajo otra vez, haga un pase de edición de diez segundos, listo.
La transcripción se lee como una persona explicando un cambio, que es justo lo que quieren los revisores. Las descripciones de PR vacías rara vez son pereza; son fatiga de tecleo a las 5 de la tarde. Hablar quita el coste, así que el contexto sí llega a escribirse.
Pegue el código relevante en el chat y luego hable el resto: el contexto del sistema, la restricción ("mantenga la API pública estable"), los dos enfoques que ya rechazó y por qué, y el formato de salida que quiere. Hablar anima a incluir contexto que habría recortado al teclear, y ese contexto suele ser la diferencia entre una respuesta genérica y una usable.
Reproduzca el error con la mano del ratón y narre en el campo del issue mientras hace clic: "Abra la página de ajustes, cambie el workspace, pulse guardar, observe que el toast nunca aparece." Los pasos caen en el orden correcto porque los está haciendo de verdad. Añada el comportamiento esperado frente al real al final. El mismo patrón sirve para notas de standup y cronologías de incidentes: narre mientras está fresco, edite después.
Donde parpadee un cursor. Las herramientas de dictado de todo el sistema escriben en el campo que tenga el foco, así que la cobertura es más amplia de lo que la mayoría de desarrolladores espera:
Donde no funciona: el código en sí. Los cuerpos de función, los identificadores y todo aquello en lo que importan los símbolos exactos pertenecen al teclado, o a Talon si lo necesita sin manos. Más sobre el problema de los identificadores a continuación.
De serie, un motor de la clase Whisper ya maneja bien el vocabulario técnico habitual: Whisper large v3 turbo alcanzó un 97.93% de precisión por palabra en audio limpio en el benchmark de MLCommons de 2025 (MLCommons). Dos funciones cierran el hueco que queda para los desarrolladores.
Un modo personalizado de "Escritura técnica". En BlabbyAI, un modo pasa su transcripción por una IA con sus propias instrucciones antes de que aterrice en el campo. Un modo útil para desarrolladores dice algo así: "Corrija la gramática y quite muletillas. Conserve los términos técnicos, las rutas de archivos y las siglas exactamente como se dijeron. Mantenga un tono llano. No añada saludos ni despedidas." Asígnele un atajo y su parloteo hablado sale como prosa de PR limpia, sin que la IA "mejore" su jerga hasta hacerla desaparecer.
Grafías personalizadas para nombres que el motor no puede adivinar. Enséñele PostgreSQL, kubectl, useEffect, OAuth y los nombres de sus servicios internos una vez, y salen con las mayúsculas correctas siempre. Esa es la diferencia entre una transcripción que envía y una que tiene que estar vigilando.
La salvedad del camelCase, con franqueza. Los motores de voz producen lenguaje natural. Diga "getUserById" y a menudo obtendrá "get user by ID". Las grafías personalizadas arreglan los identificadores que dice con frecuencia, pero los identificadores sueltos de una sola vez se teclean mejor. El patrón que funciona en la práctica: dicte la frase, teclee el identificador, siga hablando. Suena tosco y en un día se vuelve automático.
Aquí el dictado deja de ser un truco de productividad y pasa a proteger su carrera. Investigadores de NIOSH midieron una prevalencia del 7.8% de síndrome del túnel carpiano en poblaciones laborales de EE. UU. (NIOSH vía PMC), y un metaanálisis en el Journal of the Neurological Sciences encontró la afección asociada de forma positiva con el uso intensivo de ordenador, teclado y ratón (JNS).
No es casualidad que buena parte de la comunidad de codificación por voz llegara a través de una lesión; la profundidad de Talon existe porque la gente necesitaba seguir trabajando. No hace falta esperar a ese punto. Pasar prompts, PRs, docs y chat a la voz recorta una parte grande de las pulsaciones diarias mientras el código se queda en el teclado. Si las muñecas ya protestan, empiece por nuestra guía para escribir con túnel carpiano.
| Herramienta | Alcance | Curva de aprendizaje | Precio |
|---|---|---|---|
| BlabbyAI | Prosa alrededor del código, todo el sistema (Windows, Linux) | Minutos | Gratis: 60 créditos/semana (unas 2000 palabras); $8.49/mes ilimitado |
| Talon + Cursorless | Codificación por voz real, edición sin manos | Semanas | Gratis |
| Wispr Flow | Dictado de prosa, apps nativas en todas las plataformas | Minutos | $12 a $15/mes |
| Escritura por voz de Windows (Win+H) | Notas informales, integrado en Windows | Ninguna | Gratis |
BlabbyAI (transparencia: nuestro producto) es una app nativa de Windows construida sobre Whisper large v3 turbo, con un atajo global Ctrl+Space que escribe en el campo que tenga el foco. Admite más de 90 idiomas, modos de IA personalizados, grafías personalizadas, transcripción con retención cero de datos y un Historial local que guarda el audio en su equipo. También hay una app para Linux, algo raro entre las herramientas comerciales de dictado y relevante aquí, porque los usuarios de Linux son desproporcionadamente desarrolladores (véase voz a texto en Linux). Contras reales: la transcripción ocurre en la nube, así que no hay modo sin conexión; el plan gratuito tiene tope semanal; los usuarios de Mac solo tienen la extensión de Chrome; y no va a escribir código por usted, a propósito.
Talon + Cursorless responde a otra pregunta. Si necesita escribir y editar código de verdad por voz, por elección o por necesidad, esta pila gratuita e impulsada por la comunidad es el estándar, y la edición estructural de Cursorless en VS Code es de verdad impresionante. Reserve semanas de práctica. Que nadie le venda una app de dictado general para este caso de uso, ni siquiera nosotros.
Wispr Flow cubre el mismo caso de uso de prosa alrededor del código, con apps nativas en Mac, Windows, iPhone y Android. Es la opción práctica para desarrolladores que van primero a Mac. Cuesta de $12 a $15 al mes, y las reseñas coinciden en que la app de Windows es pesada.
La escritura por voz de Windows (pulse Win+H) es la forma gratuita de probar si este flujo le encaja antes de gastar nada. La precisión y la puntuación van por detrás de las herramientas de la clase Whisper, y no hay vocabulario personalizado, pero demuestra el concepto en diez segundos. Para el campo completo de 11 apps más allá del uso para desarrolladores, vea nuestra comparativa de las mejores apps de dictado.
Sí, para la mitad en prosa del trabajo: prompts de IA, descripciones de PR, comentarios de revisión, mensajes de commit, docs, issues y chat. Para muchos desarrolladores eso es el 30 a 50% de lo que teclean en un día. El dictado es la herramienta equivocada para identificadores y sintaxis, y por eso el teclado no va a desaparecer.
Sí, pero es otra categoría de herramienta. Talon, normalmente junto con Cursorless en VS Code, está pensado para la codificación por voz de verdad: gramáticas de comandos hablados, edición estructural y navegación sin manos. Tiene una curva de aprendizaje de semanas. Las apps de dictado general como BlabbyAI cubren la prosa alrededor del código, sin curva de aprendizaje.
Para la prosa alrededor del código en Windows o Linux, le señalaríamos BlabbyAI (nuestro producto, así que téngalo en cuenta): precisión de Whisper large v3 turbo, un atajo global Ctrl+Space, modos de IA personalizados y grafías personalizadas para nombres de API. Para programar de verdad sin manos, Talon más Cursorless. Para equipos centrados en Mac, Wispr Flow es el equivalente más cercano.
El dictado de todo el sistema escribe en el campo que tenga el foco, y VS Code no es una excepción. Funciona en el editor para bloques de comentarios, docstrings y archivos markdown, en el cuadro de mensaje de commit de Source Control y en Copilot Chat. No conoce la sintaxis de su lenguaje, así que limítelo a la prosa.
Es uno de los cambios de mayor impacto que hay. Investigadores de NIOSH midieron una prevalencia del 7.8% de síndrome del túnel carpiano en poblaciones laborales de EE. UU., y el uso intensivo de teclado y ratón es un factor de riesgo documentado. Pasar prompts, PRs, docs y chat a la voz quita miles de pulsaciones al día sin cambiar cómo escribe código.
En prompts largos y detallados, sí. La gente habla a 130 a 150 palabras por minuto y teclea unas 40 (Mobius MD). Un prompt de 200 palabras con contexto, restricciones y ejemplos lleva unos 90 segundos de habla y unos cinco minutos de tecleo. El detalle es lo que hace que los prompts funcionen, y la voz hace que el detalle salga barato.
Sí, de dos maneras. Dicte directamente en el cuadro de mensaje de commit de VS Code o de su cliente Git, o ejecute git commit sin el flag -m para que se abra su editor configurado y dicte el mensaje ahí. El dictado de todo el sistema escribe donde esté el cursor, así que cualquier editor vale.
Los motores de la clase Whisper ya conocen el vocabulario técnico habitual, y Whisper alcanzó un 97.93% de precisión por palabra en audio limpio en el benchmark de MLCommons de 2025. Para nombres de servicios internos y APIs poco comunes, las grafías personalizadas de BlabbyAI le permiten definir las mayúsculas exactas una vez, para que los nombres de su proyecto salgan bien siempre.
En su mayoría no para las herramientas comerciales, y eso lleva tiempo siendo un punto sensible para los desarrolladores. BlabbyAI incluye una app para Linux que funciona como la de Windows: barra inferior centrada, guiada por atajos, con modos personalizados y grafías. Talon también admite Linux, en el lado de la codificación por voz.
No para el dictado general. Las herramientas modernas basadas en Whisper puntúan a partir de su tono, así que no hay que decir "coma" ni "punto". Pulse un atajo, hable con normalidad y púlselo otra vez. Las gramáticas de comandos son cosa de Talon, y esa inversión solo compensa si su objetivo es la codificación por voz de verdad.
Dicte la descripción de su próximo PR
BlabbyAI: dictado con IA en todo el sistema en Windows. 2000 palabras a la semana gratis.