Actualizado 3 de septiembre de 2026 · By Sumbat.T

Voice Coding en 2026: el término ahora significa otra cosa

Un micrófono de escritorio junto a un portátil que muestra un archivo Python en un editor de código

La respuesta corta

  • El voice coding antes significaba dictar sintaxis. En 2026 significa sobre todo hablar prompts a un agente de IA. Son actividades distintas con el mismo nombre, y casi cada debate sobre si el voice coding funciona es en realidad dos personas hablando de cosas diferentes.
  • La versión nueva no necesita software especial. Usted está dictando prosa en inglés en un cuadro de texto, así que cualquier herramienta de dictado precisa lo hace. Por eso la barrera pasó de semanas de práctica a ninguna. BlabbyAI escribe en cualquier campo con foco, incluido el prompt de un agente, a $8.49/mes con un plan gratis.
  • La versión antigua no está muerta, solo se ha estrechado. Talon Voice se mantiene activo y sigue siendo la respuesta para el trabajo genuinamente manos libres. Serenade, que aún ocupa el tercer puesto en Google para este término, recibió el último commit en junio de 2024.
  • Hay dictado integrado en Claude Code y en VS Code, con límites reales. El de Claude Code necesita una cuenta de Claude.ai, no funciona por SSH y deja de grabar a los dos minutos. El de VS Code corre en el dispositivo y offline, pero solo dentro de VS Code.

Dictado que funciona en el cuadro de prompt y en todas partes

ChatGPTGoogle DocsGmailWhatsAppMicrosoft Word

Microphone

El prompt de su agente es prosa. Háblelo.

BlabbyAI escribe en el campo que tenga el cursor, ya sea Claude Code, Cursor, una descripción de pull request o un ticket de Jira. Nunca pulsa Enter por usted. 60 créditos a la semana gratis, sin tarjeta.

Add BlabbyAI to Chrome

Dos actividades, un nombre

Si buscó voice coding hace cinco años y otra vez esta semana, le mostraron respuestas a dos preguntas distintas. La frase se ha reutilizado en silencio y nadie lo anunció. Conviene desenredarlo antes que nada, porque lo que usted quiera decir determina si la respuesta es "esto lleva un mes aprenderlo" o "puede empezar en los próximos diez minutos".

El sentido de 2000 a 2022

Dictar sintaxis

Usted habla una gramática de comandos y un motor la convierte en código. "Camel case new function get user by ID" produce getUserById(). Exige una herramienta especializada, un vocabulario aprendido y semanas de práctica.

Herramientas: Talon Voice, Serenade, VoiceCode, Dragon con gramáticas propias

Curva de aprendizaje: Semanas de entrenamiento

El sentido de 2026

Dictar prompts

Usted habla inglés corriente a un agente de IA y él escribe la sintaxis. "Add a retry with exponential backoff to the fetch helper and cover it with a test" es una instrucción completa. Sin gramática que aprender.

Herramientas: Cualquier dictado preciso, más Claude Code, Cursor, Copilot

Curva de aprendizaje: Ninguna

El desarrollador cuyo artículo ocupa hoy la primera página de Google para este término resumió el cambio en una frase, y es la formulación más clara que hay:

Instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable.

dev.to, "I Ditched My Keyboard for Voice Coding", abril de 2026

Léalo con cuidado, porque ahí está la consecuencia práctica. Lo que hacía difícil el voice coding nunca fue el hablar. Fue que el código es una cosa terrible de decir en voz alta. La puntuación, las mayúsculas, el anidamiento y los nombres de símbolos hay que pronunciarlos uno a uno, por eso las herramientas antiguas necesitaban una gramática de comandos y por eso aprenderla llevaba semanas. Cuando la sintaxis la genera un modelo, nada de eso aplica. Usted está dictando una frase, y dictar frases es un problema resuelto desde hace tiempo.

Por qué importa al elegir herramienta

Si está dictando prompts y no sintaxis, una herramienta especializada de voice coding no le aporta nada. Lo que necesita es un dictado general preciso que escriba en el campo que tenga el foco, porque el cuadro de prompt es solo uno de los que rellena en un día. Esa es otra categoría de producto, y mucho más barata.

Cómo cambió el significado, con fechas

Esto no es una intuición. Cada punto se puede comprobar, y juntos muestran una práctica de accesibilidad de quince años a la que se une, y luego supera en números, algo que casualmente comparte el nombre.

2000

Programming by voice entra en la literatura

Se publica el paper de la ACM "Programming by voice, VocalProgramming", aún citado 77 veces. El voice coding nace como problema de investigación en accesibilidad.

Octubre 2020

Talon se convierte en la respuesta práctica

Josh Comeau publica su relato de coding manos libres con Talon Voice. Durante casi cinco años es la referencia canónica, y trata por completo de dictar sintaxis.

Diciembre 2022

Atom se retira

GitHub retira Atom. Serenade, que hoy sigue en el tercer puesto para voice coding, aún lista Atom como editor compatible en su página de inicio.

Junio 2024

Serenade se queda en silencio

El último commit llega a serenadeai/serenade, con 26 issues abiertos. El repositorio no está archivado, así que sigue apareciendo en recomendaciones.

Abril 2026

La definición cambia en público

Un artículo en dev.to que ahora aparece en la primera página formula la nueva premisa directamente: "instead of dictating code itself, I use my voice to tell Claude which code it should write. This is the key insight that makes voice coding actually viable."

Septiembre 2026

Ambas ramas viven, una crece

El repositorio de comunidad de Talon recibe un push el 2 de septiembre. Mientras tanto Claude Code lanza el dictado /voice y VS Code un modelo de dictado en el dispositivo. Las búsquedas de voice coding suben un 23% interanual.

Las herramientas, y qué cubre cada una de verdad

La precisión ya no es el eje que las separa. Todas las opciones actuales transcriben bien el inglés técnico corriente. Lo que las separa es el alcance: cuánto del día cubre cada herramienta, y si se detiene en el borde de un solo programa.

HerramientaDónde funcionaCorre enEnvía por ustedPrecio
Logo de BlabbyAIBlabbyAI
Cualquier campo de texto, en todo el sistemaApp Windows, extensión ChromeNunca, usted pulsa Enter$8.49/mes
Logo de Claude Code /voiceClaude Code /voice
Solo el prompt de Claude CodeCLI y extensión de VS CodeSí en modo tapIncluido con Claude.ai
Logo de VS Code dictationVS Code dictation
Editor y chat de VS CodeModelo en el dispositivoNoGratis
Logo de Wispr FlowWispr Flow
Cualquier campo de texto, en todo el sistemaMac, Windows, iOS, AndroidNo$15/mes
Talon Voice
Control manos libres completoMac, Windows, LinuxPor comandosGratis, nivel beta de pago
Serenade
Comandos de sintaxis en editoresÚltimo push junio 2024Por comandosGratis, open source

Dos filas de esa tabla merecen su propio párrafo, porque ambas se recomiendan a menudo en artículos que no comprobaron.

Serenade ocupa el tercer puesto y dejó de publicar en 2024

Serenade es una herramienta open source de voice coding que está en la posición tres de Google para este término, lo que significa que una gran parte de quien investiga voice coding acaba apuntando directamente a ella. Su repositorio de GitHub, serenadeai/serenade, recibió el último push el 11 de junio de 2024, con 26 issues aún abiertos. El repositorio no está archivado, y precisamente por eso sigue recomendándose: nada en él anuncia que el trabajo se detuvo.

Hay una segunda señal en el propio sitio de marketing. Serenade lista sus editores compatibles de forma destacada, y Atom sigue entre ellos. GitHub retiró Atom en diciembre de 2022. Una página que anuncia soporte para un editor retirado desde hace casi cuatro años es una página que nadie ha revisitado.

$ gh api repos/serenadeai/serenade --jq .pushed_at

2024-06-11T20:08:49Z

$ gh api repos/talonhub/community --jq .pushed_at

2026-09-02T08:27:58Z

Comprobar la actividad real de un proyecto lleva un comando, y vale la pena hacerlo antes de construir un flujo de trabajo sobre cualquier herramienta.

Nada de esto significa que Serenade no funcione hoy. Significa que la recomendación que leyó probablemente se escribió antes de que el proyecto se quedara en silencio, y que debería revisar el repositorio usted mismo en lugar de fiarse de un ranking de búsqueda. El mismo comando lo resuelve para cualquier herramienta de esta categoría.

Talon está vivo, y es otro producto

El contraste importa porque Talon Voice suele quedar arrastrado en las tesis de "el voice coding está muerto". No lo está. Su repositorio de comunidad recibió un push el 2 de septiembre de 2026, y sigue siendo la herramienta en la que confían quienes de verdad no pueden usar un teclado. Talon no compite realmente con las apps de dictado: sustituye el ratón y el teclado por completo, con comandos hablados para navegación, selección, gestión de ventanas y sintaxis. Eso es mucho más grande y más difícil, por eso tiene curva de aprendizaje y por eso nada más lo ha reemplazado.

Cómo elegir entre ellas

Si su objetivo es teclear menos, use dictado general, porque la mayor parte de lo que teclea en un día es prosa. Si su objetivo es no usar teclado en absoluto, aprenda Talon. No son respuestas rivales a una sola pregunta, son respuestas a dos.

Lo que su editor ya le da

Antes de pagar por nada, conviene saber que dos de los sitios donde más dictan los desarrolladores ya tienen dictado integrado, y que tomaron decisiones de diseño opuestas. Ambas se leen de primera mano en la documentación de los propios proveedores más abajo.

AnfitriónDictado integradoAudio procesadoDónde se detiene
Logo de Claude Code CLIClaude Code CLI
Sí, /voiceServidores de AnthropicNecesita cuenta Claude.ai. Sin SSH, sin web. Se detiene a los 2 minutos.
Logo de VS CodeVS Code
Sí, Ctrl+Alt+VEn el dispositivo, offlineSolo dentro de VS Code. No en Remote-SSH vía la extensión de Claude.
Logo de CursorCursor
Sin dictado de primera parteNo aplicaNecesita una herramienta de todo el sistema o la tecla de dictado del SO.
Logo de Claude

Claude Code tiene /voice, con tres límites que conviene conocer

Claude Code incluye dictado que se activa con /voice. Ofrece dos modos: modo hold, en el que mantiene Space mientras habla, y modo tap, en el que pulsa una vez para empezar y otra para enviar. La transcripción está afinada para vocabulario de coding, y la documentación de Anthropic señala que el nombre del proyecto y la rama git actual se añaden automáticamente como pistas de reconocimiento, un detalle de verdad bien pensado.

> /voice

Voice mode enabled (hold). Hold space to record.

Dictation language: en (/config to change).

Fuente: documentación de Claude Code, code.claude.com/docs/en/voice-dictation

Los tres límites están dichos con claridad en el mismo documento, y cada uno descarta un setup de trabajo real. El primero es sobre la autenticación:

A Claude.ai account: the speech-to-text service is only available when you authenticate with one, and is not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry.

Documentación de Claude Code, Voice dictation, Requirements

En la práctica es una exclusión grande. Bastantes organizaciones de ingeniería enrutan Claude Code por Bedrock o por una API key directa por motivos de facturación y cumplimiento, y cada desarrollador de esas organizaciones queda fuera del dictado integrado por completo.

El segundo es sobre dónde trabaja. El dictado necesita un micrófono local, así que no corre en Claude Code en la web ni por SSH. La extensión de VS Code tiene el mismo problema por la misma razón: la documentación explica que no está disponible en Remote-SSH, Dev Containers y Codespaces "because the microphone is on your local machine and the extension runs on the remote host". Si su entorno de desarrollo vive en un contenedor o en una máquina remota, cada vez más habitual, eso lo descarta.

El tercero es un temporizador. La grabación "stops automatically after 15 seconds of silence or two minutes total". Dos minutos son mucho habla para un mensaje de chat y no tanto para el tipo de prompt que de verdad se beneficia de ser hablado, donde usted describe un bug, las tres cosas que ya probó y la restricción que el arreglo debe respetar. Pausar a pensar dieciséis segundos termina la grabación.

El que sorprende a la gente

El dictado de Claude Code no es local. La documentación lo dice directamente: "Voice dictation streams your recorded audio to Anthropic's servers for transcription. Audio is not processed locally." Es habitual en una herramienta en la nube, pero conviene saberlo si asumía que un CLI que corre en su máquina transcribía en su máquina.

Logo de VS Code

VS Code fue al otro extremo y lo hizo offline

El dictado integrado de VS Code es la opción más interesante de toda esta categoría y la menos comentada, porque hizo el intercambio opuesto al de todos los demás. Está activado por defecto cuando las funciones de IA están encendidas, se inicia con Ctrl+Alt+V en el editor o Ctrl+I en el chat, y el modelo corre donde usted está sentado:

Dictation uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service. After the initial model download, speech recognition does not require an internet connection.

Documentación de Visual Studio Code, Voice support

Para un desarrollador cuya objeción al dictado es que el audio salga de la máquina, esta es la respuesta, y ya está instalada. No cuesta nada y no necesita cuenta. Hay un matiz en la misma documentación: un ajuste opcional llamado llmCleanup envía el texto de la transcripción, aunque no el audio, a un modelo de lenguaje para limpiarlo. Déjelo desactivado y nada sale del dispositivo.

La limitación es la obvia, y es la razón de que esto no sea el final del artículo. Dicta dentro de VS Code. La descripción del pull request está en un navegador. El ticket está en Jira. La respuesta a quien lo revisó está en Slack. La respuesta al cliente que reportó el bug está en una herramienta de soporte. En un día típico el editor no es donde van la mayoría de sus palabras.

La mayor parte de lo que teclea un desarrollador no es código

Este es el punto que toda la categoría sigue pasando por alto, y es la razón de que el alcance gane a la precisión al elegir herramienta. Piense con honestidad en un día de trabajo y cuente adónde van las palabras. Muy poco es sintaxis, y casi todo el resto es prosa que sería más rápida hablada.

Prompts de agente

La parte que se alargó a medida que los agentes mejoraban. Describir la intención, las restricciones y lo que ya descartó es prosa pura, y ahora es una porción grande del trabajo.

Descripciones de pull request

Contexto, razonamiento, qué debería mirar primero un revisor. Se escriben en un área de texto del navegador, no en el editor.

Comentarios de code review

Explicar por qué algo debería cambiar, lo que lleva más palabras que el cambio en sí. En GitHub o GitLab, en el navegador.

Tickets y standups

Jira, Linear, Slack. Cortos, frecuentes y desproporcionadamente molestos de teclear porque interrumpen otra cosa.

Documentación y READMEs

Lo que todo el mundo pospone. Hablar un primer borrador y limpiarlo gana a mirar un archivo vacío.

Mensajes de commit

Sobre todo el cuerpo, que es donde pertenece el razonamiento y donde normalmente no acaba.

Cada uno de esos es prosa, y la prosa es donde el habla gana con claridad. Hablar con comodidad ronda las 130 a 150 palabras por minuto frente a unas 40 del tecleo medio. Recorrimos la investigación de base en nuestro artículo sobre palabras por minuto al hablar, y la versión corta es que la brecha es real para las frases y desaparece para los símbolos.

Fíjese en lo que eso implica para elegir herramienta. Una acotada a su editor cubre la porción más pequeña de esa lista. Una acotada a un agente cubre un solo ítem. Una que escriba en el campo que tenga el cursor cubre las seis, y es la más barata de las tres.

Logo de BlabbyAI

BlabbyAI: dictado al que no le importa en qué programa esté

BlabbyAI se construye sobre la premisa de arriba: que la unidad útil no es "dictado para coding" sino dictado en todas partes, porque el editor es una ventana entre una docena. Pulse Ctrl+Space, hable, púlselo otra vez, y el texto se escribe en el campo que tenía el foco. Ese campo puede ser el prompt de Claude Code, el composer de Cursor, un cuadro de review de GitHub, una descripción de Jira, un hilo de Slack o una terminal. No hay nada que integrar, porque no hay integración: escribe donde ya está el cursor.

Ajustes del atajo de teclado de BlabbyAI, mostrando el atajo global de grabación

El atajo global se puede reasignar en Settings, y aquí importa: Ctrl+Space es IntelliSense en la mayoría de editores, así que los desarrolladores suelen moverlo.

Ese valor por defecto merece señalarse en lugar de pasarlo por alto. Ctrl+Space es el disparador de autocompletado en VS Code, IntelliJ y la mayoría de editores, así que es lo primero que un desarrollador debería cambiar. Lleva un clic en Settings, y no hay razón para dejarlo en conflicto.

Los custom modes son la parte que encaja en este flujo

Un mode es una instrucción libre aplicada a lo que acaba de decir, después de la transcripción y antes de que se escriba el texto. Escribe la instrucción una vez, le asigna un atajo, y a partir de entonces ese atajo produce habla con esa forma. Su voz es la entrada, no una petición: un mode remodela lo que dijo en lugar de responderlo.

Para desarrolladores esto es más útil de lo que suena al principio, porque las tareas de escritura de esa lista tienen cada una un estilo de casa, y el reformateo es lo que las hace tediosas. Unas instrucciones que hacen trabajo real:

Instrucción del modeLo que diceLo que se escribe
Reescribe como conventional commit con prefijo de tipo y un cuerpo que explique el porqué"fixed the retry loop, it was hammering the API when the token expired"Una línea de asunto fix: con el razonamiento en el cuerpo
Formatea como descripción de PR con un resumen y una sección de testingSu recorrido hablado del cambioMarkdown estructurado con los encabezados ya puestos
Quita muletillas y arranques en falso, deja todo lo demás literalUn prompt de agente largo y divagante pensado en voz altaEl mismo prompt sin los eh y los reinicios
Cuando diga "new bullet", empieza un ítem de lista nuevo en lugar de escribir esas palabras"the cache is stale new bullet the TTL is wrong"Dos viñetas de verdad
El editor de modes de BlabbyAI con un campo de instrucción de IA libre, nombre y selector de modelo

Un mode es una instrucción más un atajo. La última fila de arriba es cómo funcionan los comandos hablados: usted los describe en la instrucción en lugar de depender de una lista fija de comandos.

Esa última fila merece detenerse, porque es la mecánica que la gente entiende mal. El modelo recibe su transcripción literal completa, incluidas las palabras que usted quiso como comandos, así que puede definir su propio vocabulario hablado describiéndolo en la instrucción. "New paragraph", "bullet point", "scratch that": ninguna de estas es una función integrada, y todas funcionan, porque usted define lo que significan.

Enseñarle el vocabulario de su codebase

La objeción previsible a dictar cerca del código son los nombres propios. Su servicio interno se llama algo que nadie fuera de la empresa ha oído, y ningún modelo general lo va a escribir bien. La ortografía personalizada lo resuelve: añada el término una vez en Settings y luego Languages, escrito exactamente como quiere que aparezca, y a partir de ahí se empareja. Nombres de librerías, servicios, el apellido de un compañero, un acrónimo que inventó el equipo. Blabby también admite más de 90 idiomas con detección automática, lo que importa en equipos distribuidos donde la gente piensa en un idioma y entrega en otro.

Nunca pulsa Enter

Blabby escribe texto en el campo con foco y se detiene ahí. No hace clic en botones, no envía formularios ni pulsa Enter. Para un prompt de agente ese es el comportamiento que quiere: sus palabras llegan al cuadro y esperan, para que pueda releer una instrucción larga antes de enviarla en lugar de que se dispare en el momento en que deja de hablar.

Dos productos, y el del navegador no necesita instalación

La app de escritorio para Windows es el producto más completo: escribe en todo el sistema en cualquier aplicación, y tiene History, que escribe cada grabación en su propio disco en el instante en que deja de hablar, antes de que empiece la transcripción. Nada de History toca un servidor, y puede reproducir o volver a transcribir cualquier grabación pasada más tarde, opcionalmente con un mode distinto.

La extensión de Chrome es la otra mitad, y para muchos desarrolladores es la que encaja. Si su agente es la vista web de Cursor, si las reviews ocurren en GitHub, si los tickets están en Linear y la docs en Notion, entonces todo lo que dicta ya está en una pestaña del navegador. La extensión muestra una burbuja pequeña junto al campo de texto con foco y no necesita descarga ni derechos de administrador, la diferencia entre trabajar y no trabajar en un portátil gestionado. También es la opción para Mac y Chrome OS. Ambos quedan cubiertos por los mismos $8.49 al mes, y el plan gratis son 60 créditos a la semana sin tarjeta.

Un setup que funciona, en unos diez minutos

Nada de esto exige comprometerse con un flujo de trabajo antes de saber si le gusta. El orden importa un poco: haga funcionar el dictado en prosa primero, porque ahí la ganancia es obvia, y solo después decida si quiere algo más especializado.

  1. Reasigne el atajo antes que nada. Sea cual sea la herramienta, póngalo donde su editor no lo esté usando ya. Ctrl+Space es el autocompletado y Ctrl+Alt+V puede estar ocupado. Diez segundos ahora ahorran una semana de conflictos.
  2. Empiece con una descripción de pull request, no con un prompt. Es larga, es prosa, tiene poco riesgo, y es la tarea donde la diferencia de velocidad es imposible de pasar por alto. Si el dictado va a funcionar para usted, lo sabrá al final de un PR.
  3. Añada sus cinco peores palabras al diccionario. El nombre del servicio, la librería, el acrónimo, el apellido. Cinco entradas quitan la mayor parte de la fricción por la que la gente abandona.
  4. Luego pruébelo en un prompt de agente, y sea más específico de lo que teclearía. Ese es el desbloqueo real. Como hablar es unas tres veces más rápido que teclear, el prompt que habla sale de forma natural más largo y más detallado que el que habría tecleado, y los agentes responden bien a eso. Diga la restricción. Diga lo que ya probó. Diga lo que el arreglo no debe romper.
  5. Solo entonces considere herramientas manos libres. Si su necesidad es médica más que de comodidad, aquí entra Talon, y merece un compromiso de tiempo de verdad en lugar de una tarde.

El hábito que lo hace funcionar

Hable el prompt que habría pensado y luego abreviado. La mayoría de los prompts de agente flojos lo son porque teclearlos enteros era tedioso, no porque el desarrollador no conociera el contexto. Quitar el coste de teclear quita la razón de abreviar.

Dónde hablar sigue siendo la herramienta equivocada

Una guía que afirma que la voz gana en todas partes no merece leerse, y los límites aquí están lo bastante claros para enunciarlos.

La sintaxis en bruto sigue siendo más rápida tecleada, para quien teclea con competencia. Pronunciar const [x, setX] = useState(0) en voz alta es una peor experiencia que teclearlo, en todas las herramientas, y ninguna mejora del modelo cambia eso, porque el cuello de botella es la forma hablada de la puntuación y no el reconocimiento. Las ediciones precisas tienen el mismo problema: mover el cursor tres caracteres a la izquierda es una pulsación y una frase.

También hay una restricción de entorno que ninguna página de fabricante menciona. El dictado asume que usted puede hablar. En una oficina abierta, en un tren o en una habitación compartida en casa con alguien dormido, esa asunción falla, y falla días enteros de golpe en lugar de de vez en cuando. Es una razón real por la que la gente abandona las herramientas de dictado, y no tiene nada que ver con el software.

El encuadre honesto es que el dictado es un segundo método de entrada más que un reemplazo. Usted sigue tecleando, y habla las partes que son frases. Esa es una afirmación más pequeña que la que hace la mayor parte de esta categoría, y es la que sobrevive al contacto con una semana de trabajo.

Entonces, ¿funciona el voice coding?

Ambas versiones funcionan, para personas distintas, y la razón de que la pregunta se sienta sin resolver es que en realidad son dos preguntas.

Dictar sintaxis funciona, lleva años funcionando y sigue siendo exigente. Talon se mantiene activo y es la respuesta correcta si no puede usar un teclado, pero es una habilidad que se adquiere más que una herramienta que se instala. Quien diga que esta versión no cuesta esfuerzo no la ha hecho.

Dictar instrucciones a un agente funciona de inmediato, no necesita entrenamiento, y es lo que el término significa sobre todo ahora. También tiene una consecuencia que el debate de herramientas suele saltarse: como lo que está hablando es prosa, la herramienta que necesita no es una de coding en absoluto. Es dictado preciso que sigue al cursor a la ventana en la que esté, porque el cuadro de prompt es uno de quizá seis sitios a los que van sus palabras en un día.

Ese es todo el cambio, y es por qué un término que fue nicho quince años sube un 23% interanual. BlabbyAI cubre ese trabajo por $8.49 al mes, en Windows o en Chrome, y el plan gratis basta para saber si le gusta hablar sus prompts antes de pagar nada. Si quiere la comparación más amplia, mantenemos un resumen de las mejores apps de dictado, y una guía de dictado para programadores que entra más en el lado diario de la escritura.

Preguntas frecuentes

¿Qué es el voice coding?

La palabra cubre hoy dos prácticas distintas, y casi toda la confusión sobre voice coding viene de mezclarlas. El sentido antiguo es dictar el código en sí: usted habla una gramática de comandos y un motor especializado la convierte en sintaxis, de modo que "camel case new function get user by id" se convierte en getUserById(). Talon Voice y Serenade funcionan así y exigen semanas de práctica. El sentido nuevo, el que casi todo el mundo entiende en 2026, es hablarle instrucciones a un agente de coding con IA como Claude Code, Cursor o Copilot y dejar que el agente escriba la sintaxis. Esa segunda versión no necesita motor de sintaxis alguno, porque usted está dictando prosa en inglés en un cuadro de texto. Cualquier herramienta de dictado general precisa lo hace, y por eso se derrumbó la barrera de entrada. BlabbyAI escribe su voz en el campo que tenga el cursor, incluido el cuadro de prompt de un agente, a $8.49 al mes.

¿Se puede escribir código de verdad con la voz?

Sí, pero la respuesta honesta depende de cuál de las dos prácticas quiera decir. Dictar sintaxis en bruto por voz funciona y hay gente que lo hace a tiempo completo, sobre todo con Talon Voice, cuyo repositorio de comunidad seguía actualizándose en septiembre de 2026. Exige aprender una gramática de comandos y es realmente lento al principio, por eso se quedó en un nicho quince años. Dictar instrucciones a un agente de IA, en cambio, funciona de inmediato y sin entrenamiento, porque usted habla frases normales en inglés como "add a retry with exponential backoff to the fetch helper and cover it with a test". El agente produce la sintaxis. Los desarrolladores que probaron el voice coding hace años y lo abandonaron casi siempre probaron la primera versión. La segunda es otra actividad que casualmente comparte el nombre.

¿Claude Code tiene entrada por voz?

Sí. Claude Code tiene dictado integrado que se activa con el comando /voice, en modo hold-to-record (mantenga Space mientras habla) o en modo tap (pulse una vez para empezar y otra para enviar). Tres límites conviene conocer antes de fiarse, y los tres aparecen en la documentación de Anthropic. Primero, exige una cuenta de Claude.ai y está explícitamente "not available when Claude Code is configured to use an Anthropic API key directly, Amazon Bedrock, Google Cloud's Agent Platform, or Microsoft Foundry", así que un equipo en Bedrock no puede usarlo. Segundo, necesita un micrófono local y no funciona por SSH ni en Claude Code en la web. Tercero, la grabación "stops automatically after 15 seconds of silence or two minutes total", así que un prompt largo pensado en voz alta se corta. Una herramienta de dictado de todo el sistema no tiene ninguna de esas tres restricciones, porque no le importa en qué programa esté el cursor.

¿VS Code tiene dictado integrado?

Sí, y funciona distinto de todas las herramientas en la nube de esta categoría. VS Code incluye dictado activado por defecto cuando las funciones de IA están encendidas, se inicia con Ctrl+Alt+V (Cmd+Option+V en Mac) en el editor o Ctrl+I en el chat. Lo notable es dónde ocurre el procesamiento: la documentación de Microsoft dice que "uses an on-device speech recognition model by default, so you can dictate without sending audio to an online service", y que tras la descarga inicial del modelo "speech recognition does not require an internet connection". Eso lo convierte en la única opción realmente offline que la mayoría de desarrolladores ya tiene instalada. El intercambio es el alcance. Dicta dentro de VS Code y en ningún otro sitio, así que la descripción del pull request, el ticket de Jira, la respuesta de Slack y la terminal siguen necesitando otra cosa.

¿El voice coding es más rápido que teclear?

Para la prosa, cómodamente sí. Hablar con comodidad ronda las 130 a 150 palabras por minuto frente a unas 40 del tecleo medio, y esa brecha es por qué el dictado compensa en todo lo que tiene forma de frase. Para la sintaxis, no, y quien diga lo contrario está vendiendo algo: pronunciar puntuación y camel case es más lento que teclearlo para quien teclea bien. Exactamente por eso despegó la versión de dictar prompts del voice coding y no la de sintaxis. Los prompts a un agente de IA son prosa, así que quedan del lado bueno de esa ratio, y son la parte del trabajo que se alargó a medida que los agentes mejoraban. Vea nuestro desglose de velocidad al hablar frente a teclear para los números de base.

¿Cuál es la mejor herramienta de voz a texto para coding?

La pregunta correcta es el alcance, no la precisión, porque toda herramienta seria de esta categoría ya es lo bastante precisa. Si solo dicta dentro de un editor, el dictado integrado de ese editor basta y es gratis: el de VS Code corre en el dispositivo. Si dicta a lo largo del día, y para la mayoría de desarrolladores eso significa un prompt de agente, una descripción de pull request, un comentario de Jira, una respuesta de Slack y documentación, quiere una herramienta de todo el sistema que escriba en cualquier campo con foco. BlabbyAI cuesta $8.49 al mes para eso, con un plan gratis de 60 créditos a la semana sin tarjeta, como app de escritorio para Windows o extensión de Chrome. Si necesita navegación manos libres en lugar de dictado, por RSI o una necesidad de movilidad, Talon Voice es la respuesta seria y nada más se acerca.

¿Serenade sigue mantenido?

Parece que no. Serenade es una herramienta open source de voice coding que sigue cerca del top en Google para el término, así que la recomiendan sin parar, pero su repositorio de GitHub en serenadeai/serenade recibió el último push el 11 de junio de 2024, más de dos años antes de este artículo, con 26 issues aún abiertos. Su propia web también sigue listando Atom entre los editores compatibles, y GitHub retiró Atom en diciembre de 2022. Nada de eso significa que el software no funcione hoy, y el proyecto no está archivado. Sí significa que debe tratar una recomendación de Serenade en 2026 con cuidado y revisar el repositorio usted mismo antes de construir un flujo de trabajo encima. Talon Voice, en cambio, se mantiene activo: su repositorio de comunidad recibió un push el 2 de septiembre de 2026.

¿Puedo programar por voz con RSI o túnel carpiano?

Este es el caso de uso para el que se construyó originalmente el voice coding y sigue siendo el más fuerte. Ayudan dos cosas, y son herramientas distintas para trabajos distintos. Para sustituir el teclado por completo, incluida la navegación, la selección y la gestión de ventanas, Talon Voice es la respuesta consolidada, tiene una comunidad activa y es la herramienta que usan de verdad la mayoría de desarrolladores que trabajan manos libres. Para reducir el volumen de tecleo en lugar de eliminarlo, el dictado general hace la mayor parte del trabajo sin curva de aprendizaje, porque la mayor parte de lo que un desarrollador teclea en un día es prosa y no sintaxis: prompts, reseñas, tickets, mensajes, docs. Quitar esa porción suele bastar. Tenemos una guía aparte sobre escribir con túnel carpiano que cubre el lado del setup.

¿El dictado maneja términos técnicos y nombres de variables?

Mejor que antes, y ese manejo es ahora lo principal que separa las herramientas. Claude Code afirma que su transcripción está "tuned for coding vocabulary" y que reconoce términos como regex, OAuth, JSON y localhost, con el nombre del proyecto y la rama git actual añadidos automáticamente como pistas de reconocimiento. Las herramientas generales lo resuelven con un diccionario personalizado. BlabbyAI tiene una función de ortografía personalizada: añade el término una vez en Settings y luego Languages, y a partir de ahí se empareja, así es como le enseña nombres de servicios internos, una librería poco habitual o el apellido de un compañero. Lo que ninguna herramienta hace bien son identificadores en bruto hablados como sintaxis, así que dictar getUserById carácter a carácter sigue siendo torpe en todas partes. En el flujo con agente nunca lo necesita, porque dice "the get user by ID helper" y el modelo lo resuelve.

¿El dictado puede enviar el prompt por mí?

Algunas herramientas lo hacen automáticamente, y si lo quiere es una preferencia real, no un hueco de funciones. El modo tap de Claude Code envía el prompt cuando la transcripción tiene al menos tres palabras, y el modo hold puede hacer lo mismo con un ajuste autoSubmit. El desarrollador cuyo artículo en dev.to aparece en la primera página para voice coding nombró eso como lo que lo apartó del voice integrado: el problema, escribió, "is that it automatically sends the message when you finish talking, so you don't have time to actually think". BlabbyAI nunca envía. Es una herramienta de dictado y solo escribe texto en el campo con foco, así que sus palabras llegan al cuadro de prompt y se quedan ahí hasta que usted pulsa Enter. Para un prompt de agente largo que quiere releer antes de enviarlo, ese es el comportamiento que busca.

Hable su próximo prompt de agente

BlabbyAI escribe en cualquier campo con foco, en Windows o en Chrome, y nunca pulsa Enter por usted. $8.49 al mes, o 60 créditos a la semana gratis sin tarjeta.

Add BlabbyAI to Chrome