Voicebox é um aplicativo de desktop gratuito e open source (licença MIT) que faz na sua máquina o que ElevenLabs e Wispr Flow fazem na nuvem: clona vozes com IA a partir de 10 a 30 segundos de áudio, converte texto em fala, transcreve seu ditado por voz e, graças ao seu servidor MCP integrado, faz com que Claude Code, Cursor ou Windsurf falem com uma voz que é sua.
Também é um projeto com 54.100 estrelas no GitHub e nenhuma release desde abril. As duas coisas importam se você vai instalá-lo, então este guia cobre o que faz, como conectá-lo ao seu agente e o que significa seu estado de manutenção para você.
O que é Voicebox?
Voicebox é um estúdio de voz com IA local-first criado por Jamie Pine, o autor de Spacedrive. O projeto se apresenta como a peça que cobre as duas metades do ciclo de voz: a saída (text to speech e voice cloning, o território do ElevenLabs) e a entrada (ditado em todo o sistema, o território do Wispr Flow), com um LLM local no meio.
O que inclui a release atual, v0.5.0:
- Clonagem de voz e texto para fala com sete motores: Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA e Kokoro, intercambiáveis em cada geração. Alguns clonam a partir de uma amostra; Kokoro e Qwen CustomVoice oferecem mais de 50 vozes predefinidas.
- Ditado por voz com um atalho global (manter pressionado ou alternar), transcrito com OpenAI Whisper e, se quiser, limpo de muletilhas pelo LLM local.
- Captures: cada ditado e gravação é salvo com seu áudio e sua transcrição, e você pode transcrever novamente ou convertê-lo em amostra de voz.
- Editor de Stories: uma linha do tempo multipista para podcasts, diálogos e narrações.
- Efeitos de pós-produção (mudança de tom, reverb, compressão e mais) construídos sobre
pedalboarddo Spotify. - Personalidades de voz: você atribui uma personalidade livre a um perfil e um modelo Qwen3 local (0.6B, 1.7B ou 4B) reescreve o texto naquele personagem antes de lê-lo.
- Uma API REST e um servidor MCP em
127.0.0.1:17493.
O aplicativo de desktop é feito com Tauri (Rust), o backend com FastAPI (Python) e a inferência roda sobre MLX em Apple Silicon ou sobre PyTorch no resto (CUDA, ROCm, DirectML, Intel XPU ou CPU). No momento da publicação desta nota, o repositório tem 54.100 estrelas e cerca de 6.800 forks.
É uma alternativa gratuita ao ElevenLabs?
Sim, para clonar vozes, gerar áudio e ter uma API que você pode automatizar, com uma condição: o cálculo é por sua conta. Como alternativa ao ElevenLabs não há cobrança por caractere nem o áudio sai do seu equipamento, mas a velocidade e a qualidade dependem do seu hardware e do motor que você escolher. Quem procura “ElevenLabs gratuito” encontra aqui uma resposta real, não um plano de teste.
Os motores não são intercambiáveis, e escolher bem é metade do trabalho:
| Motor | Idiomas | Pontos fortes (segundo o projeto) |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10 | Clonagem multilíngue, instruções de entonação como “fale devagar” |
| Qwen CustomVoice | 10 | 9 vozes predefinidas com controle de entonação em linguagem natural |
| LuxTTS | Inglês | ~1 GB de VRAM, saída a 48 kHz |
| Chatterbox Multilingual | 23 | A maior cobertura de idiomas |
| Chatterbox Turbo | Inglês | Modelo rápido de 350M com etiquetas de emoção como [laugh] e [sigh] |
| TADA (1B / 3B) | 10 (3B) | Áudio longo e coerente |
| Kokoro | 8 | Modelo de 82M, 50 vozes predefinidas, rápido em CPU |
Os números de desempenho do README (LuxTTS “150x em tempo real em CPU”, TADA com “mais de 700 s” de áudio coerente, MLX “4-5x mais rápido”) são números do próprio projeto, não benchmarks independentes.
O texto para fala gratuito funciona em espanhol?
Sim: quatro motores geram áudio em espanhol, algo que verificamos no código-fonte do projeto e não apenas em seu marketing. São Qwen3-TTS (e Qwen CustomVoice), Chatterbox Multilingual, TADA 3B e Kokoro. Kokoro traz três vozes predefinidas em espanhol (Dora, Alex e Santa), então você pode gerar uma voz IA gratuita em espanhol sem gravar nada.
Duas nuances:
- As etiquetas de emoção não funcionam em espanhol. Apenas Chatterbox Turbo interpreta etiquetas como
[laugh], e esse motor é apenas em inglês. Os outros motores as leem em voz alta como texto. - A transcrição usa Whisper. O roadmap menciona novos motores de STT (Parakeet v3 e Qwen3-ASR) com melhor qualidade fora do inglês, mas são trabalho planejado, não publicado.
Como clonar voz com IA gratuitamente e localmente?
Para clonar uma voz com Voicebox você precisa entre 10 e 30 segundos de fala clara, que você pode gravar dentro do aplicativo ou enviar como arquivo. A documentação recomenda WAV (também aceita MP3, M4A e FLAC), um quarto silencioso, um tom constante e frases completas. Com isso você cria um perfil de voz, escolhe um motor de clonagem e gera uma frase de teste. Se o resultado não convencer, adicione mais amostras ao mesmo perfil.
Se você não quer clonar ninguém, as vozes predefinidas de Kokoro funcionam tão bem quanto, por exemplo para as notificações de um agente.
Um limite que é bom ter claro: o arquivo RESPONSIBLE_USE.md do projeto deixa claro que Voicebox não pode verificar a quem pertence uma amostra de voz, e proíbe expressamente usurpar identidades, cometer fraudes ou contornar sistemas de autenticação por voz. Clone sua própria voz ou vozes para as quais você tem permissão de usar.
Funciona como ditado por voz, igual ao Wispr Flow?
Em parte. O ditado por voz funciona em macOS e em Windows com um atalho global: você mantém pressionada a combinação, fala e solta. Mas a colagem automática no campo de texto ativo, que é o que torna Wispr Flow útil, hoje funciona apenas em macOS. Em Windows e Linux a colagem automática está no roadmap; enquanto isso, a transcrição fica salva na aba Captures.
Como instalar Voicebox?
Baixe o instalador para sua plataforma no site do projeto: um DMG para macOS (com versões separadas para Apple Silicon e Intel) ou um MSI para Windows. Todos os binários também estão na página de releases do GitHub. Se você preferir executá-lo como servidor sem interface de desktop, com uma UI web, clone o repositório e use Docker:
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
docker compose up
A interface fica disponível em http://localhost:17493. O docker-compose.yml padrão escuta apenas em localhost.
O que esperar na primeira execução:
- Os modelos são baixados quando você os usa pela primeira vez, não durante a instalação. Variam de cerca de 350 MB (Kokoro) até cerca de 8 GB (TADA 3B); de acordo com a documentação, a maioria começa com Qwen 1.7B, de aproximadamente 3,5 GB.
- Requisitos: 8 GB de RAM no mínimo, 16 GB recomendados, e entre 5 e 10 GB de espaço em disco livre. Funciona em CPU, mas bem mais lento; para uso em tempo real recomenda-se GPU. Se quiser saber o que seu hardware consegue executar antes de baixar modelos de vários gigas, confira nosso guia sobre que hardware você precisa para executar modelos locais.
- Seus dados são salvos em
~/Library/Application Support/sh.voicebox.app/no macOS e em%APPDATA%/sh.voicebox.app/no Windows. Você pode mover os modelos para outro local com a variável de ambienteVOICEBOX_MODELS_DIR.
O Voicebox funciona no Linux?
Não diretamente. No momento da publicação desta nota não há binários pré-compilados para Linux; o README remete a instruções para compilar a partir do código-fonte em voicebox.sh/linux-install. No Linux, Docker é o caminho prático, e o changelog não publicado inclui correções para GPUs AMD com ROCm, tanto em Docker quanto em instalação nativa. A colagem automática da ditação também não está disponível no Linux.
Como fazer o Claude Code falar com sua voz?
Você precisa de três coisas: Voicebox aberto, um perfil de voz (clonado ou predefinido) e o servidor MCP registrado em seu agente.
Registre o servidor MCP no Claude Code
A sintaxe documentada do Claude Code recebe a URL do servidor como argumento posicional:
claude mcp add --transport http voicebox http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
Atençao: o README do Voicebox mostra uma variante com uma flag --url. A documentação MCP do Claude Code não inclui essa flag, então use a forma acima. Adicione --scope user se quiser o servidor disponível em todos os seus projetos. Depois verifique a conexão com claude mcp list, ou com /mcp dentro de uma sessão.
O header X-Voicebox-Client-Id não é uma credencial. É uma etiqueta que diz ao Voicebox qual agente está chamando, para aplicar sua configuração.
Atribua uma voz a cada agente
Em Voicebox → Settings → MCP você pode associar Claude Code a um perfil de voz e Cursor a outro, para saber qual agente está falando com você sem olhar para a tela. O mesmo painel mostra quando cada cliente se conectou pela última vez, o que confirma que a instalação funcionou.
E no Cursor, Windsurf ou outros clientes MCP?
A documentação do Voicebox fornece este bloco para clientes com suporte HTTP como Cursor, Windsurf e VS Code:
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp",
"headers": { "X-Voicebox-Client-Id": "cursor" }
}
}
}
Não cole tal qual no .mcp.json do Claude Code: Claude Code trata uma entrada com url mas sem "type": "http" como um erro de configuração. O .mcp.json do próprio repositório sim inclui esse campo.
Para clientes que só suportam stdio, a app inclui um binário voicebox-mcp. No macOS está em /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp; a documentação lista as rotas para Windows e Linux. Voicebox tem que estar aberto para que esse binário se conecte.
O que pode fazer o agente com Voicebox?
O servidor expõe quatro ferramentas: voicebox.speak, voicebox.transcribe, voicebox.list_captures e voicebox.list_profiles. A que você vai usar é speak, que recebe o texto, um perfil opcional (se não o passar, usa a voz atribuída ao agente), um mecanismo opcional, o idioma e personality: true para reescrever o texto com a personalidade do perfil antes de lê-lo. O agente a chama quando decide fazê-lo, então diga quando você quer ouvi-lo; por exemplo: “me avise com voicebox quando os testes terminarem”.
O que não fala MCP, como scripts de shell ou jobs de CI, pode usar o mesmo caminho por REST com POST /speak.
Cada vez que um agente fala, aparece na tela um indicador com o nome da voz durante toda a reprodução. O argumento do projeto é que um text to speech silencioso em segundo plano é um problema de confiança: com o indicador, nada fala da sua máquina sem que você veja.
É seguro conectar Voicebox aos seus agentes?
Em uma máquina de um único usuário, o design é razoável; fora disso, ainda não está pronto. Na versão v0.5.0:
- O servidor escuta em
127.0.0.1e não tem autenticação. Qualquer processo local pode chamá-lo, e a autenticação com bearer token figura no roadmap. Se alguma vez você expor Voicebox além de loopback, estará expondo uma API sem autenticação. - A transcrição por rota de arquivo só é aceita desde loopback, para que um Voicebox escutando em
0.0.0.0não se torne uma forma de ler arquivos arbitrários. Mesmo assim, em equipos compartilhados a documentação recomenda enviar o áudio em base64. - O consentimento é sua responsabilidade, como se explicou na seção de clonagem.
Se sua equipe já conecta vários servidores MCP aos seus agentes, o problema de fundo é mais amplo que essa ferramenta; o analisamos em MCP Gateway: a próxima grande categoria de segurança para agentes.
Voicebox está abandonado?
Não há uma resposta oficial, mas os dados pedem cautela. Em 16 de setembro de 2026, o último release segue sendo v0.5.0, publicado em 25 de abril, e o commit mais recente na branch principal é de 27 de julho. Uma issue aberta, a #1101, pergunta diretamente se o projeto está abandonado; no momento de publicar essa nota não tem resposta do mantenedor.
O documento de status do próprio projeto, atualizado pela última vez em 2 de julho, registrava 402 issues abertas, 88 pull requests abertos e 34.800 estrelas. Hoje o repositório mostra 520 issues, 173 pull requests e 54.100 estrelas. O interesse cresceu mais da metade em dez semanas enquanto a fila de revisão quase se dobrou.
Isso não faz inservível v0.5.0: é um release completo e documentado, e tudo que essa guia explica se baseia nele. Mas muda a forma de adotá-lo:
- Tome v0.5.0 como o que há. Não planeje em função do que está no roadmap (colagem automática no Linux, autenticação do MCP, novos mecanismos de STT).
- Mantenha em loopback. A falta de autenticação não se vai resolver logo.
- Para fluxos pessoais, o risco é baixo: áudio local, modelos locais e licença MIT. Para algo de que dependa uma equipe, revise de novo a atividade do repositório antes de se comprometer.
Vale a pena instalar Voicebox?
Sim, se você quer que seu agente de código te avise que terminou o build, com sua própria voz ou com uma voz predefinida em português, sem enviar áudio para ninguém. Hoje é a forma mais completa de fazê-lo, e uma vez que você tem um perfil, a configuração é um só comando. Só tenha em mente que está instalando um release terminado de um projeto que perdeu ritmo, não uma ferramenta em plena evolução.