Voicebox: un estudio de voz local que une síntesis, dictado y agentes
jamiepine/voicebox · 55.672★ · 6.937 forks
Todo lo que hay que saber sobre jamiepine/voicebox: una aplicación de escritorio de código abierto para clonar voces, generar audio, dictar texto y conectar entrada/salida de voz con agentes mediante MCP.
Qué es Voicebox
Voicebox es un estudio de voz con IA de enfoque local. Su README lo sitúa explícitamente como alternativa gratuita y de código abierto a ElevenLabs para la salida de voz y a WisprFlow para el dictado, reunidas en una aplicación. Los modelos, muestras de voz, capturas y la inferencia se ejecutan en el equipo del usuario.
Puede crear un perfil desde una muestra breve, sintetizar texto con siete motores TTS, transcribir con Whisper y pegar el resultado de un dictado en el campo que tenía el foco.

También expone una API REST local y un servidor MCP: un agente compatible puede hablar mediante voicebox.speak, transcribir y consultar perfiles o capturas.
La aplicación no verifica quién tiene derechos sobre una voz. Su política de uso responsable limita el uso a la propia voz, material autorizado o con licencia, y prohíbe la suplantación sin permiso, fraude, acoso y elusión de autenticación por voz.
El origen: de estudio de clonación a bucle completo de voz
El repositorio se creó el 25 de enero de 2026. Su autor principal es Jamie Pine (jamiepine), cuya cuenta de GitHub identifica a Spacedrive Technology Inc. como empresa y enlaza voicebox.sh; la misma cuenta describe su trabajo actual como discover.me. No se recuperó una publicación de lanzamiento con una narración independiente anterior a la creación del repositorio, por lo que no se atribuye otra cronología.
La versión v0.5.0, publicada el 25 de abril de 2026, marcó el cambio de alcance denominado «Capture»: según sus notas, Voicebox dejó de ser solo un estudio de clonación y pasó a incorporar dictado global, refinamiento local de transcripciones, perfiles con personalidad y salida para agentes vía MCP. La tensión de diseño es clara: servicios como ElevenLabs y WisprFlow resuelven, respectivamente, salida e ingreso de voz en servicios distintos; Voicebox propone conservar ambas mitades y la información privada en una misma máquina.
Filosofía y principios
- Local primero: no requiere claves de API, cuotas ni pago por carácter para los modelos descargados; el sitio y el README afirman que los datos de audio permanecen en el equipo.

- Un ciclo bidireccional: dictar a una aplicación y recibir respuesta hablada de un agente se presentan como estados de la misma interfaz flotante, no como productos inconexos.
- Elección de modelo y hardware: los motores TTS, el tamaño de Whisper y las rutas de ejecución cambian según calidad, idioma, memoria y acelerador disponible.
- Control visible: toda locución iniciada por un agente muestra una píldora en pantalla; el diseño evita que la salida de voz ocurra silenciosamente en segundo plano.

- Consentimiento como responsabilidad del usuario: la privacidad local no sustituye el permiso del titular de la voz ni las obligaciones de divulgación de audio sintético.
Cómo funciona
La interfaz Tauri combina un frontal React/TypeScript, servidor FastAPI en Python, componentes nativos en Rust y SQLite. La síntesis ofrece Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA y Kokoro; Whisper y Whisper Turbo cubren la transcripción. Qwen3 local puede limpiar muletillas y autocorrecciones del dictado o reescribir texto conforme a la personalidad de un perfil antes de sintetizarlo.
Un agente compatible puede conectarse mediante el protocolo abierto MCP: la aplicación expone voicebox.speak y otras herramientas a través de un cubo de IA holográfico conectado por un flujo de datos etiquetado como “MCP” a una terminal local.

El flujo normal es crear o importar un perfil, elegir motor y generar. Para textos largos, Voicebox divide en límites de frase y realiza fundidos cruzados; documenta un máximo de 50.000 caracteres, un límite de partición configurable de 100 a 5.000 caracteres y fundidos de 0 a 200 ms.

La cola serial evita la contención de GPU y conserva versiones, tomas y procedencia de cada generación.
En macOS y Windows puede configurarse una combinación global para pulsar y hablar o activar/desactivar captura. Voicebox transcribe, puede refinar localmente y deposita el texto en el campo que tenía el foco; el comportamiento de pegado automático para Windows y Linux figura todavía en la hoja de ruta. Sus rutas locales incluyen POST /generate, POST /speak, POST /transcribe, GET /profiles y documentación OpenAPI en http://127.0.0.1:17493/docs cuando la aplicación está en marcha.

Estado oficial y semioficial
No se recuperó evidencia de que Voicebox haya sido aceptado en un mercado oficial de un proveedor de IA, ni de que ElevenLabs, WisprFlow, Anthropic, OpenAI o Cursor lo hayan avalado. Por tanto, no debe presentarse como complemento oficial de ninguno.
Sí implementa el protocolo abierto MCP con transporte HTTP y un adaptador stdio. La documentación declara compatibilidad con Claude Code, Cursor, Windsurf, Cline y extensiones MCP de VS Code; esto es una integración técnica documentada, no una certificación de los fabricantes. El proyecto dispone de sitio, documentación y binarios propios, pero no hay una designación verificable de estándar de facto.
El ecosistema
Integraciones y herramientas del autor
jamiepine/hermes-voicebox(15 estrellas en la consulta a la API) ofrece proveedores TTS y STT locales para Hermes Agent con clonación y Whisper; es el complemento público más directo localizado del mismo autor.jamiepine/keytap(18 estrellas) es una biblioteca para observar pulsaciones globales entre macOS, Windows y Linux; su ámbito encaja con el atajo global de Voicebox, aunque la API no documenta una dependencia de producto entre ambos.- El repositorio trae una habilidad para agentes en
.agents/skills/add-tts-engine/SKILL.md, destinada a integrar un motor TTS siguiendo el protocolo de backend, el cableado del frontal y el empaquetado. También incluye.mcp.jsonpara que Claude Code use las herramientas locales durante el desarrollo. - El servidor MCP incluido entrega cuatro herramientas:
voicebox.speak,voicebox.transcribe,voicebox.list_capturesyvoicebox.list_profiles. Puede utilizar HTTP enhttp://127.0.0.1:17493/mcpo el binariovoicebox-mcppara clientes solostdio.
Bifurcaciones, puertos y extensiones comunitarias
La API de bifurcaciones, ordenada por estrellas, mostró sobre todo copias del repositorio. Las que aportan una diferenciación explícita son:
hacksider/voicebox(14 estrellas): se describe como estudio de síntesis de voz de código abierto.sumire608/voicebox(4 estrellas): se describe como estudio basado en Qwen3-TTS.sergio-caracas/voicebox-docker(2 estrellas): bifurcación con empaquetado Docker en el nombre y descripción.lowchristopher-praiseJesus/voicebox: la búsqueda de GitHub lo identifica como una copia con un punto final personalizado/podcast.charlyfavela1-eng/voicebox: la búsqueda lo describe como bifurcación con ajuste Docker para Render; es una extensión de despliegue, no una traducción confirmada.chainchopper/flex-voice: se presenta como servidor TTS de Voicebox renombrado, sincronizado con el proyecto original y con soporte GPU/ROCm.
No se identificó una traducción no inglesa con documentación propia y verificable en los resultados recuperados. Las demás bifurcaciones de mayor visibilidad conservaban la descripción original o eran copias personales; no se las eleva a «puertos» sin prueba adicional.
Entorno relacionado
Las comparaciones explícitas del README nombran ElevenLabs y WisprFlow. En el plano de modelos, Qwen3-TTS, Whisper, Kokoro, Chatterbox y TADA son componentes seleccionables, no competidores de aplicación. La búsqueda también recuperó listas curadas que incluyen el repositorio, como alvinreal/awesome-opensource-ai, filipecalegario/awesome-generative-ai y ikaijua/Awesome-AITools; esa inclusión acredita visibilidad en listados, no soporte ni integración.
Números del repo
Medición: 5 de agosto de 2026; API y página pública de GitHub.
| Métrica | Valor |
|---|---|
| Estrellas | 49.421 |
| Bifurcaciones | 6.085 |
| Suscriptores reales | 231 |
| Commits visibles | 638 |
| Incidencias abiertas visibles | 466 |
| Solicitudes de cambios abiertas visibles | 117 |
| Ramas / etiquetas visibles | 67 / 27 |
| Lenguaje principal | TypeScript |
| Licencia | MIT |
| Creación | 25 de enero de 2026 |
| Última versión publicada | v0.5.0, 25 de abril de 2026 |
Los contribuidores principales que devolvió la API por número de contribuciones fueron jamiepine (527), tomasmach (7), y, con 3 cada uno, lemassykoi, pandego, mikeswann, selop, sridhar-3009, Spyabo, mvanhorn, iegui-ops y DaddyRaegen.
La respuesta de metadatos de la API devolvió 583 en open_issues_count, mientras la página pública mostraba 466 incidencias y 117 solicitudes de cambios. GitHub advierte que open_issues_count puede mezclar incidencias y solicitudes de cambios, de ahí que se informen las dos cifras visibles por separado. watchers_count replica las estrellas en esa respuesta; por eso se usa subscribers_count para suscriptores. La API devolvió además updated_at: 6 de agosto de 2026, posterior a la fecha de esta ejecución; se transcribe como anomalía de metadatos y no como actividad futura inferida.
El sitio oficial mostraba 2.000.529 descargas acumuladas para v0.5.0. Es un contador promocional del propio proyecto, no una métrica auditada de instalaciones activas.
Cómo contribuir
El proceso está documentado en CONTRIBUTING.md:
- Instalar Bun, Python 3.11+, Rust, las dependencias de Tauri, Git y
just. - Crear una bifurcación, clonar la copia y ejecutar
just setup; prepara entorno virtual y dependencias Python/JavaScript. - Ejecutar
just devpara levantar servidor y aplicación, crear una ramafeature/...ofix/..., probar y abrir una solicitud de cambios. - Incluir descripción clara, capturas para cambios visuales y referencias a incidencias. Antes de pedir revisión, actualizar documentación y
CHANGELOG.mdcuando corresponda.
La guía exige TypeScript estricto y Biome en el frontal, PEP 8, anotaciones y asincronía en Python, y convenciones de Rust. Las pruebas son principalmente manuales actualmente; recomienda pytest para backend, Vitest para React y Playwright como futuro E2E. Para endpoints, pide actualizar ruta, modelos Pydantic, documentación y regenerar el cliente con bun run generate:api.
Cómo lo recibió la comunidad
La recepción verificable recuperada es desigual y de alcance limitado fuera de GitHub:
- Hacker News contiene el envío 47073053, «aplicación de clonación de voz de código abierto con Qwen3-TTS», publicado por angelmm: 4 puntos y 0 comentarios. Sirve para documentar difusión, no elogio externo.
- El envío 47831411, enviado por sebakubisz, obtuvo 1 punto y 0 comentarios; 48863385, enviado por idleplant, también obtuvo 1 punto y 0 comentarios. No se recuperaron comentarios HN directamente relacionados con Voicebox, por lo que no se puede atribuir un consenso ni críticas de esa comunidad.
- En GitHub sí hay señales concretas de fricción técnica: la incidencia #141, de CHKE9, pregunta por qué no usa GPU y tenía 28 comentarios; #84, de StephanBaum, informa «GPU no disponible» y tenía 27. Son informes de usuarios, no pruebas comparativas de rendimiento. La documentación responde con rutas de CPU, CUDA, ROCm, DirectML, Intel Arc y consejos para liberar memoria.
- La incidencia #185, «instrucciones para ajuste fino», de LucianoDaluz, acumulaba 32 comentarios. Indica interés comunitario en personalización más allá de la clonación de muestra corta, pero no prueba que dicha capacidad esté disponible en todas las versiones.
- El sitio oficial agrupa tutoriales comunitarios, entre ellos «Free AI Voice Generator on Your PC (Clones Any Voice)» de Kevin Stratvert, «NEW Voicebox DESTROYS ElevenLabs?» de Julian Goldie SEO, y «This Open-Source TTS App Sounds Scary Good (And It’s Free)» de Dave Swift. Son títulos y selección editorial del proyecto; el título comparativo de Julian Goldie SEO no es un benchmark independiente.
Se intentaron búsquedas de Reddit, X, Product Hunt, Dev.to, Hashnode, YouTube y listas; Reddit/X/Product Hunt no entregaron contenido recuperable en esta ejecución. Por ello no se inventan hilos, votos, opiniones ni cifras de esas plataformas. Tampoco se recuperó un paquete npm, PyPI, crates.io o Docker Hub oficial que permita dar descargas de registro.
Voicebox frente a otras propuestas
| Propuesta | Coincidencia verificable | Diferencia verificable |
|---|---|---|
| ElevenLabs | Servicio de generación y clonación de voz; Voicebox lo nombra como alternativa de salida. | Voicebox ejecuta modelos y API en localhost; el README lo plantea sin claves, límites ni tarifas por carácter. No se recuperó una comparación de calidad controlada. |
| WisprFlow | Producto de dictado; Voicebox lo nombra como alternativa de entrada de voz. | Voicebox añade TTS, clonación, editor de historias y salida MCP; el pegado automático está documentado para macOS y Windows, con paridad Windows/Linux aún en la hoja de ruta. |
chainchopper/flex-voice | Derivado declarado de Voicebox con servidor TTS y sincronización con el original. | Se presenta con marca propia, soporte GPU/ROCm y funciones de nube; su descripción no permite validar una matriz de capacidades ni sustituye las pruebas del original. |
La distinción práctica es el conjunto, no una afirmación de superioridad: Voicebox combina dictado, clonación, TTS y agentes en la misma aplicación local. ElevenLabs y WisprFlow solo se comparan aquí porque el propio proyecto los nombra; no hay evaluación independiente recuperada que permita declarar ganador a ninguno.
Guía rápida de uso
Instalación y primer arranque
- macOS Apple Silicon: descargar
voicebox_aarch64.app.tar.gz, ejecutartar -xzf voicebox_aarch64.app.tar.gzy moverVoicebox.appa/Applications/. Para Intel se usavoicebox_x64.app.tar.gz. - Windows: descargar
voicebox_x64_en-US.msiovoicebox_x64-setup.exedesde la versión más reciente y seguir el asistente. - Linux: la documentación indica que los binarios siguen bloqueados por límites de espacio de los ejecutores de GitHub; el README dirige a
https://voicebox.sh/linux-installpara compilar desde fuente. Para desarrollo:git clone https://github.com/jamiepine/voicebox.git,cd voicebox,just setupyjust dev.
En el primer inicio se descarga el modelo elegido: aproximadamente 350 MB para Kokoro y hasta 8 GB para TADA 3B; Qwen 1.7B ronda 3,5 GB. Los datos se guardan en ~/Library/Application Support/sh.voicebox.app/ en macOS, %APPDATA%/sh.voicebox.app/ en Windows y ~/.config/sh.voicebox.app/ en Linux. Verificar el indicador verde del servidor, crear un perfil en Profiles y generar un clip breve.
Flujos de trabajo habituales
- Clonar y locutar: crear perfil desde archivo, micrófono o captura del sistema; elegir motor y escribir texto. Para material extenso, la aplicación divide y funde automáticamente. Con Chatterbox Turbo se pueden insertar etiquetas como
[laugh]o[sigh]; los demás motores las leen literalmente. - Dictar en otra aplicación: configurar las combinaciones en Settings → Captures, mantener el atajo global, hablar y soltar. En macOS el texto se pega en el campo que tenía foco; el refinamiento LLM opcional limpia muletillas y autocorrecciones.
- Generar desde un script: enviar
POST /generateahttp://127.0.0.1:17493/generatecontext,profile_idylanguage;POST /transcribeaceptaaudio=@recording.wavymodel=whisper-turbo. - Hacer hablar a un agente: añadir el servidor MCP y usar
voicebox.speak; el resultado aparece en la píldora visible y en Captures.
Configuración esencial
- Settings → Models: descargar, descargar de memoria o cambiar los modelos;
VOICEBOX_MODELS_DIRpermite elegir directorio de modelos. - Settings → Captures: define combinaciones de pulsar para hablar y modo conmutado.
- Settings → MCP: asigna una voz por cliente y permite comprobar cuándo se conectó por última vez.
- Perfil de voz: contiene muestras, idioma, efectos y personalidad; varias muestras coherentes mejoran la clonación.
VOICEBOX_CLIENT_ID/X-Voicebox-Client-Id: identifica al cliente MCP/HTTP para aplicar su perfil de voz asignado.
Trampas frecuentes y soluciones
- Si macOS indica que la aplicación está dañada, la guía propone
xattr -cr /Applications/Voicebox.app; se debe a que el binario no está firmado con certificado de Apple. - SmartScreen puede mostrar advertencia en Windows por aplicación no reconocida; la documentación indica «More info» → «Run anyway» y señala que la firma de código aún está pendiente.
- La primera generación puede tardar entre dos y cinco minutos por descarga e inicialización; esperar, revisar Settings → Models y empezar con Kokoro o LuxTTS en conexiones o equipos modestos.
- Ante falta de memoria, cerrar aplicaciones que usen GPU, reiniciar o activar Settings → Generation → Use CPU instead of GPU. El modo CPU consume RAM, pero la guía advierte que es entre 5 y 10 veces más lento.
flash-attn is not installedes una advertencia no bloqueante: la documentación recomienda ignorarla en la mayoría de equipos porque PyTorch SDPA continúa la inferencia.- Si el agente no conecta por MCP, comprobar que Voicebox siga abierto: el backend solo escucha mientras la aplicación está en ejecución. El servidor se ata a
127.0.0.1, no tiene autenticación en v0.5.0 y los procesos locales comparten ese límite de confianza.
Integraciones y migración
Para Claude Code, el comando documentado es:
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
Cursor, Windsurf y extensiones MCP de VS Code pueden configurar la URL http://127.0.0.1:17493/mcp y una cabecera X-Voicebox-Client-Id. Para clientes que solo aceptan stdio, se apunta al binario voicebox-mcp; el ejemplo de macOS usa /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp. npx @modelcontextprotocol/inspector http://127.0.0.1:17493/mcp permite comprobar voicebox.list_profiles y voicebox.speak antes de integrarlo con un agente. No se recuperó una guía formal de migración desde ElevenLabs o WisprFlow.
Casos de uso y a quién puede ayudar este repositorio
- Personas que requieren control local o privacidad pueden mantener muestras, transcripciones y síntesis en su equipo, siempre que cuenten con autorización para las voces empleadas.
- Creadores de narrativas, podcasts y diálogos de juego pueden usar perfiles, efectos, versiones y el editor de historias de varias pistas; el generador soporta textos largos mediante fragmentación y fundidos.
- Usuarios que escriben por voz pueden dictar con una combinación global, corregir opcionalmente la transcripción con el LLM local y conservar el audio/transcrito en Captures para reproducir o volver a procesar.
- Desarrolladores de herramientas, juegos o automatizaciones pueden usar la API REST local para generar, transcribir, enumerar perfiles y revisar salud sin una cuenta de servicio.
- Equipos que operan agentes compatibles con MCP pueden asociar una voz a Claude Code, Cursor, Windsurf, Cline o una extensión de VS Code para notificaciones y respuestas habladas visibles. En un equipo compartido conviene no exponer el servidor fuera de
localhost, pues v0.5.0 no incluye autenticación.

Recursos
- Repositorio: https://github.com/jamiepine/voicebox
- Sitio oficial y demostración: https://voicebox.sh/
- Documentación e instalación: https://docs.voicebox.sh/
- Guía MCP oficial: https://docs.voicebox.sh/overview/mcp-server
- Solución de problemas: https://docs.voicebox.sh/overview/troubleshooting
- Versiones y cambios: https://github.com/jamiepine/voicebox/releases
- Contribución: https://github.com/jamiepine/voicebox/blob/main/CONTRIBUTING.md
- Uso responsable: https://github.com/jamiepine/voicebox/blob/main/RESPONSIBLE_USE.md
- Complemento Hermes: https://github.com/jamiepine/hermes-voicebox
- Tutoriales y demostraciones: https://voicebox.sh/ (sección «Learn by watching»; Kevin Stratvert, Julian Goldie SEO, Dave Swift y Tech指南)
- Hilos Hacker News: https://news.ycombinator.com/item?id=47073053, https://news.ycombinator.com/item?id=47831411, https://news.ycombinator.com/item?id=48863385
Nota: este artículo combina el README, la documentación y las políticas oficiales de Voicebox, sus versiones, la API y página de GitHub, el sitio oficial y resultados de Hacker News consultados el 5 de agosto de 2026. Las cifras cambian con el tiempo; las limitaciones de acceso a Reddit, X, Product Hunt y registros se han indicado expresamente.
Comentarios