Voicebox es una app de escritorio gratuita y open source (licencia MIT) que hace en tu máquina lo que ElevenLabs y Wispr Flow hacen en la nube: clona voces con IA a partir de 10 a 30 segundos de audio, convierte texto a voz, transcribe tu dictado por voz y, gracias a su servidor MCP integrado, hace que Claude Code, Cursor o Windsurf te hablen con una voz que es tuya.
También es un proyecto con 54.100 estrellas en GitHub y ningún release desde abril. Las dos cosas importan si vas a instalarlo, así que esta guía cubre qué hace, cómo conectarlo a tu agente y qué significa su estado de mantenimiento para ti.
¿Qué es Voicebox?
Voicebox es un estudio de voz con IA local-first creado por Jamie Pine, el autor de Spacedrive. El proyecto se presenta como la pieza que cubre las dos mitades del ciclo de voz: la salida (text to speech y voice cloning, el terreno de ElevenLabs) y la entrada (dictado en todo el sistema, el terreno de Wispr Flow), con un LLM local en medio.
Lo que incluye el release actual, v0.5.0:
- Clonación de voz y texto a voz con siete motores: Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA y Kokoro, intercambiables en cada generación. Algunos clonan a partir de una muestra; Kokoro y Qwen CustomVoice ofrecen más de 50 voces predefinidas.
- Dictado por voz con un atajo global (mantener pulsado o alternar), transcrito con OpenAI Whisper y, si quieres, limpiado de muletillas por el LLM local.
- Captures: cada dictado y grabación se guarda con su audio y su transcripción, y puedes volver a transcribirlo o convertirlo en muestra de voz.
- Editor de Stories: una línea de tiempo multipista para podcasts, diálogos y narraciones.
- Efectos de postproducción (cambio de tono, reverb, compresión y más) construidos sobre
pedalboardde Spotify. - Personalidades de voz: le asignas una personalidad libre a un perfil y un modelo Qwen3 local (0.6B, 1.7B o 4B) reescribe el texto en ese personaje antes de leerlo.
- Una API REST y un servidor MCP en
127.0.0.1:17493.
La app de escritorio está hecha con Tauri (Rust), el backend con FastAPI (Python) y la inferencia corre sobre MLX en Apple Silicon o sobre PyTorch en el resto (CUDA, ROCm, DirectML, Intel XPU o CPU). Al momento de publicar esta nota, el repositorio tiene 54.100 estrellas y unos 6.800 forks.
¿Es una alternativa gratis a ElevenLabs?
Sí, para clonar voces, generar audio y tener una API que puedes automatizar, con una condición: el cómputo lo pones tú. Como alternativa a ElevenLabs no hay cobro por carácter ni el audio sale de tu equipo, pero la velocidad y la calidad dependen de tu hardware y del motor que elijas. Quien busca “ElevenLabs gratis” encuentra aquí una respuesta real, no un plan de prueba.
Los motores no son intercambiables, y elegir bien es la mitad del trabajo:
| Motor | Idiomas | Puntos fuertes (según el proyecto) |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10 | Clonación multilingüe, instrucciones de entonación como “habla despacio” |
| Qwen CustomVoice | 10 | 9 voces predefinidas con control de entonación en lenguaje natural |
| LuxTTS | Inglés | ~1 GB de VRAM, salida a 48 kHz |
| Chatterbox Multilingual | 23 | La mayor cobertura de idiomas |
| Chatterbox Turbo | Inglés | Modelo rápido de 350M con etiquetas de emoción como [laugh] y [sigh] |
| TADA (1B / 3B) | 10 (3B) | Audio largo y coherente |
| Kokoro | 8 | Modelo de 82M, 50 voces predefinidas, rápido en CPU |
Las cifras de rendimiento del README (LuxTTS “150x en tiempo real en CPU”, TADA con “más de 700 s” de audio coherente, MLX “4-5x más rápido”) son números del propio proyecto, no benchmarks independientes.
¿Funciona el texto a voz gratis en español?
Sí: cuatro motores generan audio en español, algo que verificamos en el código fuente del proyecto y no solo en su marketing. Son Qwen3-TTS (y Qwen CustomVoice), Chatterbox Multilingual, TADA 3B y Kokoro. Kokoro trae tres voces predefinidas en español (Dora, Alex y Santa), así que puedes generar una voz IA gratis en español sin grabar nada.
Dos matices:
- Las etiquetas de emoción no funcionan en español. Solo Chatterbox Turbo interpreta etiquetas como
[laugh], y ese motor es solo en inglés. Los demás motores las leen en voz alta como texto. - La transcripción usa Whisper. El roadmap menciona nuevos motores de STT (Parakeet v3 y Qwen3-ASR) con mejor calidad fuera del inglés, pero son trabajo planificado, no publicado.
¿Cómo clonar voz con IA gratis y en local?
Para clonar una voz con Voicebox necesitas entre 10 y 30 segundos de habla clara, que puedes grabar dentro de la app o subir como archivo. La documentación recomienda WAV (también acepta MP3, M4A y FLAC), un cuarto silencioso, un tono constante y frases completas. Con eso creas un perfil de voz, eliges un motor de clonación y generas una frase de prueba. Si el resultado no convence, añade más muestras al mismo perfil.
Si no quieres clonar a nadie, las voces predefinidas de Kokoro funcionan igual de bien, por ejemplo para las notificaciones de un agente.
Un límite que conviene tener claro: el archivo RESPONSIBLE_USE.md del proyecto aclara que Voicebox no puede verificar a quién pertenece una muestra de voz, y prohíbe expresamente suplantar identidades, cometer fraudes o saltarse sistemas de autenticación por voz. Clona tu propia voz o voces que tengas permiso para usar.
¿Sirve como dictado por voz, igual que Wispr Flow?
En parte. El dictado por voz funciona en macOS y en Windows con un atajo global: mantienes pulsada la combinación, hablas y sueltas. Pero el pegado automático en el campo de texto activo, que es lo que hace útil a Wispr Flow, hoy solo funciona en macOS. En Windows y Linux el pegado automático está en el roadmap; mientras tanto, la transcripción queda guardada en la pestaña Captures.
¿Cómo instalar Voicebox?
Descarga el instalador para tu plataforma desde el sitio del proyecto: un DMG para macOS (con versiones separadas para Apple Silicon e Intel) o un MSI para Windows. Todos los binarios también están en la página de releases de GitHub. Si prefieres correrlo como servidor sin interfaz de escritorio, con una UI web, clona el repositorio y usa Docker:
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
docker compose up
La interfaz queda disponible en http://localhost:17493. El docker-compose.yml por defecto solo escucha en localhost.
Qué esperar en el primer arranque:
- Los modelos se descargan cuando los usas por primera vez, no al instalar. Van desde unos 350 MB (Kokoro) hasta unos 8 GB (TADA 3B); según la documentación, la mayoría empieza con Qwen 1.7B, de unos 3,5 GB.
- Requisitos: 8 GB de RAM como mínimo, 16 GB recomendados, y entre 5 y 10 GB de disco libre. Funciona en CPU, pero bastante más lento; para uso en tiempo real se recomienda GPU. Si quieres saber qué puede correr tu hardware antes de bajar modelos de varios gigas, revisa nuestra guía sobre qué hardware necesitas para ejecutar modelos locales.
- Tus datos se guardan en
~/Library/Application Support/sh.voicebox.app/en macOS y en%APPDATA%/sh.voicebox.app/en Windows. Puedes mover los modelos a otra ubicación con la variable de entornoVOICEBOX_MODELS_DIR.
¿Funciona Voicebox en Linux?
No directamente. Al momento de publicar esta nota no hay binarios precompilados para Linux; el README remite a instrucciones para compilar desde el código fuente en voicebox.sh/linux-install. En Linux, Docker es el camino práctico, y el changelog sin publicar incluye correcciones para GPUs AMD con ROCm, tanto en Docker como en instalación nativa. El pegado automático del dictado tampoco está disponible en Linux.
¿Cómo hacer que Claude Code te hable con tu voz?
Necesitas tres cosas: Voicebox abierto, un perfil de voz (clonado o predefinido) y el servidor MCP registrado en tu agente.
Registra el servidor MCP en Claude Code
La sintaxis documentada de Claude Code recibe la URL del servidor como argumento posicional:
claude mcp add --transport http voicebox http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
Ojo: el README de Voicebox muestra una variante con un flag --url. La documentación de MCP de Claude Code no incluye ese flag, así que usa la forma de arriba. Añade --scope user si quieres el servidor disponible en todos tus proyectos. Después comprueba la conexión con claude mcp list, o con /mcp dentro de una sesión.
El header X-Voicebox-Client-Id no es una credencial. Es una etiqueta que le dice a Voicebox qué agente está llamando, para aplicarle su configuración.
Asigna una voz a cada agente
En Voicebox → Settings → MCP puedes asociar Claude Code a un perfil de voz y Cursor a otro, para saber qué agente te habla sin mirar la pantalla. El mismo panel muestra cuándo se conectó cada cliente por última vez, lo que confirma que la instalación funcionó.
¿Y en Cursor, Windsurf u otros clientes MCP?
La documentación de Voicebox da este bloque para clientes con soporte HTTP como Cursor, Windsurf y VS Code:
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp",
"headers": { "X-Voicebox-Client-Id": "cursor" }
}
}
}
No lo pegues tal cual en el .mcp.json de Claude Code: Claude Code trata una entrada con url pero sin "type": "http" como un error de configuración. El .mcp.json del propio repositorio sí incluye ese campo.
Para clientes que solo soportan stdio, la app incluye un binario voicebox-mcp. En macOS está en /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp; la documentación lista las rutas para Windows y Linux. Voicebox tiene que estar abierto para que ese binario se conecte.
¿Qué puede hacer el agente con Voicebox?
El servidor expone cuatro herramientas: voicebox.speak, voicebox.transcribe, voicebox.list_captures y voicebox.list_profiles. La que vas a usar es speak, que recibe el texto, un perfil opcional (si no lo pasas, usa la voz asignada al agente), un motor opcional, el idioma y personality: true para reescribir el texto con la personalidad del perfil antes de leerlo. El agente la llama cuando decide hacerlo, así que dile cuándo quieres escucharlo; por ejemplo: “avísame con voicebox cuando terminen los tests”.
Lo que no habla MCP, como scripts de shell o jobs de CI, puede usar el mismo camino por REST con POST /speak.
Cada vez que un agente habla, aparece en pantalla un indicador con el nombre de la voz durante toda la reproducción. El argumento del proyecto es que un text to speech silencioso en segundo plano es un problema de confianza: con el indicador, nada habla desde tu máquina sin que lo veas.
¿Es seguro conectar Voicebox a tus agentes?
En una máquina de un solo usuario, el diseño es razonable; fuera de eso, todavía no está listo. En la versión v0.5.0:
- El servidor escucha en
127.0.0.1y no tiene autenticación. Cualquier proceso local puede llamarlo, y la autenticación con bearer token figura en el roadmap. Si alguna vez expones Voicebox más allá de loopback, estás exponiendo una API sin autenticación. - La transcripción por ruta de archivo solo se acepta desde loopback, para que un Voicebox escuchando en
0.0.0.0no se convierta en una forma de leer archivos arbitrarios. Aun así, en equipos compartidos la documentación recomienda enviar el audio en base64. - El consentimiento es tu responsabilidad, como se explicó en la sección de clonación.
Si tu equipo ya conecta varios servidores MCP a sus agentes, el problema de fondo es más amplio que esta herramienta; lo analizamos en MCP Gateway: la próxima gran categoría de seguridad para agentes.
¿Voicebox está abandonado?
No hay una respuesta oficial, pero los datos piden cautela. Al 16 de septiembre de 2026, el último release sigue siendo v0.5.0, publicado el 25 de abril, y el commit más reciente en la rama principal es del 27 de julio. Un issue abierto, el #1101, pregunta directamente si el proyecto está abandonado; al momento de publicar esta nota no tiene respuesta del mantenedor.
El documento de estado del propio proyecto, actualizado por última vez el 2 de julio, registraba 402 issues abiertos, 88 pull requests abiertos y 34.800 estrellas. Hoy el repositorio muestra 520 issues, 173 pull requests y 54.100 estrellas. El interés creció más de la mitad en diez semanas mientras la cola de revisión casi se duplicó.
Eso no hace inservible a v0.5.0: es un release completo y documentado, y todo lo que explica esta guía se basa en él. Pero cambia la forma de adoptarlo:
- Toma v0.5.0 como lo que hay. No planifiques en función de lo que está en el roadmap (pegado automático en Linux, autenticación del MCP, nuevos motores de STT).
- Mantenlo en loopback. La falta de autenticación no se va a resolver pronto.
- Para flujos personales, el riesgo es bajo: audio local, modelos locales y licencia MIT. Para algo de lo que dependa un equipo, vuelve a revisar la actividad del repositorio antes de comprometerte.
¿Vale la pena instalar Voicebox?
Sí, si quieres que tu agente de código te avise que terminó el build, con tu propia voz o con una voz predefinida en español, sin enviar audio a nadie. Hoy es la forma más completa de hacerlo, y una vez que tienes un perfil, la configuración es un solo comando. Solo ten presente que estás instalando un release terminado de un proyecto que perdió ritmo, no una herramienta en plena evolución.