16. August 2026 · Von YasKad
jamiepine/voicebox

Voicebox: ein lokales Voice-Studio, das Synthese, Diktat und Agenten vereint

jamiepine/voicebox · 55.672★ · 6.937 forks

Alles Wissenswerte über jamiepine/voicebox: eine quelloffene Desktop-Anwendung zum Klonen von Stimmen, Generieren von Audio, Diktieren von Text und Verbinden von Sprach-Ein-/Ausgabe mit Agenten über MCP.


Was Voicebox ist

Voicebox ist ein lokal ausgerichtetes KI-Voice-Studio. Sein README positioniert es ausdrücklich als kostenlose, quelloffene Alternative zu ElevenLabs für die Sprachausgabe und zu WisprFlow für das Diktieren, vereint in einer einzigen Anwendung. Modelle, Stimmproben, Aufzeichnungen und Inferenz laufen alle auf dem eigenen Rechner der Nutzerin oder des Nutzers.

Die Anwendung kann ein Profil aus einer kurzen Probe erstellen, Text mit sieben TTS-Engines synthetisieren, mit Whisper transkribieren und das Ergebnis eines Diktats in das gerade fokussierte Feld einfügen.

Schallwelle, die eine menschliche Silhouette umschließt und die Stimmklonung aus einer kurzen Probe darstellt

Außerdem stellt sie eine lokale REST-API und einen MCP-Server bereit: Ein kompatibler Agent kann über voicebox.speak sprechen, transkribieren und Profile oder Aufzeichnungen abfragen.

Die Anwendung prüft nicht, wer die Rechte an einer Stimme hält. Ihre Richtlinie zur verantwortungsvollen Nutzung beschränkt die Verwendung auf die eigene Stimme sowie autorisiertes oder lizenziertes Material und verbietet Identitätsmissbrauch ohne Erlaubnis, Betrug, Belästigung und die Umgehung von Sprachauthentifizierung.

Der Ursprung: vom Klon-Studio zum vollständigen Sprachkreislauf

Das Repository wurde am 25. Januar 2026 angelegt. Hauptautor ist Jamie Pine (jamiepine), dessen GitHub-Konto Spacedrive Technology Inc. als Unternehmen angibt und auf voicebox.sh verlinkt; dasselbe Konto beschreibt die aktuelle Tätigkeit als discover.me. Es wurde kein Launch-Beitrag mit einer unabhängigen, der Repository-Erstellung vorausgehenden Erzählung gefunden, daher wird keine alternative Zeitlinie zugeschrieben.

Die Version v0.5.0, veröffentlicht am 25. April 2026, markierte den als „Capture” bezeichneten Umfangswechsel: Laut den Release-Notes wurde Voicebox von einem reinen Klon-Studio zu einer Anwendung mit globalem Diktat, lokaler Verfeinerung von Transkriptionen, Profilen mit Persönlichkeit und Agenten-Ausgabe über MCP. Die gestalterische Spannung ist klar: Dienste wie ElevenLabs und WisprFlow lösen jeweils eine Hälfte — Sprachausgabe beziehungsweise Spracheingabe — in getrennten Diensten; Voicebox schlägt vor, beide Hälften und die dahinterliegenden privaten Daten auf derselben Maschine zu behalten.

Philosophie und Prinzipien

  • Lokal zuerst: Für heruntergeladene Modelle sind keine API-Schlüssel, Kontingente oder Abrechnung pro Zeichen erforderlich; die Website und das README erklären, dass die Audiodaten auf dem Gerät verbleiben.

Neonblaue Wellenform, gespiegelt geteilt in ein Mikrofon und einen Lautsprecher, innerhalb eines holografischen „Local Machine"-Schilds

  • Ein bidirektionaler Kreislauf: Diktieren an eine Anwendung und das Empfangen einer gesprochenen Antwort von einem Agenten werden als Zustände derselben schwebenden Oberfläche dargestellt, nicht als getrennte Produkte.
  • Modell- und Hardware-Wahl: Die TTS-Engines, die Whisper-Größe und die Ausführungspfade ändern sich je nach Qualität, Sprache, Speicher und verfügbarem Beschleuniger.
  • Sichtbare Kontrolle: Jede von einem Agenten ausgelöste Äußerung zeigt eine Pille auf dem Bildschirm; das Design verhindert, dass Sprachausgabe still im Hintergrund abläuft.

Schwebende Pillen-Benachrichtigung mit der Aufschrift „Agent Speaking..." und einer pulsierenden Wellenform in Neon-Magenta auf einem dunklen Desktop

  • Einwilligung als Verantwortung der Nutzerin oder des Nutzers: Lokale Privatsphäre ersetzt nicht die Erlaubnis der Stimminhaberin oder des Stimminhabers noch die Offenlegungspflichten für synthetisches Audio.

Wie es funktioniert

Die Tauri-Oberfläche kombiniert ein React/TypeScript-Frontend, einen Python-FastAPI-Server, native Rust-Komponenten und SQLite. Die Synthese bietet Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA und Kokoro; Whisper und Whisper Turbo decken die Transkription ab. Das lokale Qwen3-Modell kann Füllwörter und Selbstkorrekturen aus dem Diktat bereinigen oder Text vor der Synthese gemäß der Persönlichkeit eines Profils umschreiben.

Ein kompatibler Agent kann sich über das offene MCP-Protokoll verbinden: Die Anwendung stellt voicebox.speak und weitere Werkzeuge über einen holografischen KI-Agenten-Würfel bereit, der über einen mit „MCP” beschrifteten Datenstrom mit einem lokalen Terminal verbunden ist.

Holografischer KI-Agenten-Würfel, verbunden über einen mit „MCP" beschrifteten Datenstrom mit einem lokalen Terminal

Der übliche Ablauf ist, ein Profil zu erstellen oder zu importieren, eine Engine zu wählen und zu generieren. Bei langen Texten teilt Voicebox an Satzgrenzen und führt Überblendungen durch; dokumentiert sind ein Maximum von 50.000 Zeichen, ein konfigurierbares Aufteilungslimit von 100 bis 5.000 Zeichen und Überblendungen von 0 bis 200 ms.

Auswahlfeld für die TTS-Engine mit Reitern für Qwen3-TTS, Chatterbox, Kokoro und Whisper Turbo, wobei Text in Segmente mit Überblendungen zerlegt wird

Die serielle Warteschlange vermeidet GPU-Konkurrenz und bewahrt Versionen, Takes und Herkunft jeder Generierung.

Unter macOS und Windows lässt sich eine globale Tastenkombination für Push-to-Talk oder das Ein-/Ausschalten der Aufnahme einrichten. Voicebox transkribiert, kann optional lokal verfeinern und legt den Text in dem Feld ab, das zuvor den Fokus hatte; das automatische Einfügen für Windows und Linux steht noch auf der Roadmap. Zu den lokalen Routen gehören POST /generate, POST /speak, POST /transcribe, GET /profiles sowie OpenAPI-Dokumentation unter http://127.0.0.1:17493/docs, während die Anwendung läuft.

Serverturm in einem transparenten PC-Gehäuse, das die Texte „REST API" und „127.0.0.1:17493" als Neonlichtstrahlen aussendet

Offizieller und halboffizieller Status

Es wurden keine Belege dafür gefunden, dass Voicebox in einen offiziellen Marktplatz eines KI-Anbieters aufgenommen wurde, noch dass ElevenLabs, WisprFlow, Anthropic, OpenAI oder Cursor es offiziell unterstützen. Es sollte daher nicht als offizielle Ergänzung zu einem dieser Anbieter dargestellt werden.

Es implementiert jedoch das offene MCP-Protokoll mit HTTP-Transport und einem stdio-Adapter. Die Dokumentation erklärt Kompatibilität mit Claude Code, Cursor, Windsurf, Cline und MCP-Erweiterungen für VS Code; das ist eine dokumentierte technische Interoperabilität, keine Zertifizierung durch die Hersteller. Das Projekt verfügt über eine eigene Website, Dokumentation und eigene Binärdateien, aber es gibt keine überprüfbare Einstufung als De-facto-Standard.

Das Ökosystem

Integrationen und Werkzeuge des Autors

  • jamiepine/hermes-voicebox (15 Sterne zum Zeitpunkt der API-Abfrage) bietet lokale TTS- und STT-Anbieter für Hermes Agent mit Klonung und Whisper; es ist die am direktesten lokalisierte öffentliche Ergänzung desselben Autors.
  • jamiepine/keytap (18 Sterne) ist eine Bibliothek zur Beobachtung globaler Tastenanschläge auf macOS, Windows und Linux; ihr Umfang passt zur globalen Tastenkombination von Voicebox, wobei die API keine Produktabhängigkeit zwischen beiden dokumentiert.
  • Das Repository bringt eine Agenten-Fähigkeit unter .agents/skills/add-tts-engine/SKILL.md mit, die auf die Integration einer TTS-Engine gemäß Backend-Protokoll, Frontend-Verdrahtung und Paketierung zielt. Es enthält außerdem .mcp.json, damit Claude Code während der Entwicklung die lokalen Werkzeuge nutzen kann.
  • Der mitgelieferte MCP-Server stellt vier Werkzeuge bereit: voicebox.speak, voicebox.transcribe, voicebox.list_captures und voicebox.list_profiles. Er ist per HTTP unter http://127.0.0.1:17493/mcp erreichbar oder über die Binärdatei voicebox-mcp für Clients, die nur stdio unterstützen.

Forks, Ports und Community-Erweiterungen

Die nach Sternen sortierte Forks-API lieferte vor allem Kopien des Repositorys. Diejenigen mit einer expliziten Differenzierung sind:

  • hacksider/voicebox (14 Sterne): beschreibt sich als quelloffenes Sprachsynthese-Studio.
  • sumire608/voicebox (4 Sterne): beschreibt sich als Studio auf Basis von Qwen3-TTS.
  • sergio-caracas/voicebox-docker (2 Sterne): ein Fork mit Docker-Paketierung im Namen und in der Beschreibung.
  • lowchristopher-praiseJesus/voicebox: Die GitHub-Suche identifiziert ihn als Kopie mit einem eigenen /podcast-Endpunkt.
  • charlyfavela1-eng/voicebox: Die Suche beschreibt ihn als Fork mit einer Docker-Anpassung für Render; das ist eine Deployment-Erweiterung, keine bestätigte Übersetzung.
  • chainchopper/flex-voice: präsentiert sich als umbenannter Voicebox-TTS-Server, synchron mit dem Originalprojekt und mit GPU/ROCm-Unterstützung.

In den ausgewerteten Ergebnissen wurde keine nicht-englische Übersetzung mit eigener, überprüfbarer Dokumentation identifiziert. Die übrigen sichtbareren Forks behielten die ursprüngliche Beschreibung bei oder waren persönliche Kopien; sie werden ohne zusätzlichen Beleg nicht zu „Ports” aufgewertet.

Verwandtes Umfeld

Die expliziten Vergleiche des README nennen ElevenLabs und WisprFlow. Auf der Modellebene sind Qwen3-TTS, Whisper, Kokoro, Chatterbox und TADA wählbare Komponenten, keine Konkurrenzanwendungen. Die Suche fand auch kuratierte Listen, die das Repository enthalten, etwa alvinreal/awesome-opensource-ai, filipecalegario/awesome-generative-ai und ikaijua/Awesome-AITools; diese Aufnahme belegt Sichtbarkeit in Listen, nicht Unterstützung oder Integration.

Zahlen zum Repository

Messung: 5. August 2026; GitHub-API und öffentliche Seite.

KennzahlWert
Sterne49.421
Forks6.085
Echte Abonnenten231
Sichtbare Commits638
Sichtbare offene Issues466
Sichtbare offene Pull Requests117
Sichtbare Branches / Tags67 / 27
HauptspracheTypeScript
LizenzMIT
Erstellt25. Januar 2026
Letzte veröffentlichte Versionv0.5.0, 25. April 2026

Die von der API nach Anzahl der Beiträge zurückgegebenen Hauptmitwirkenden waren jamiepine (527), tomasmach (7) sowie, mit je 3, lemassykoi, pandego, mikeswann, selop, sridhar-3009, Spyabo, mvanhorn, iegui-ops und DaddyRaegen.

Die Metadaten-Antwort der API gab 583 für open_issues_count zurück, während die öffentliche Seite 466 Issues und 117 Pull Requests anzeigte. GitHub weist darauf hin, dass open_issues_count Issues und Pull Requests vermischen kann, weshalb beide sichtbaren Zahlen getrennt angegeben werden. watchers_count dupliziert in dieser Antwort die Sternezahl; deshalb wird subscribers_count für Abonnenten verwendet. Die API gab außerdem updated_at: 6. August 2026 zurück, später als das Messdatum dieses Durchlaufs; dies wird als Metadaten-Anomalie festgehalten, nicht als abgeleitete zukünftige Aktivität.

Die offizielle Website zeigte 2.000.529 kumulierte Downloads für v0.5.0. Das ist ein projekteigener Werbezähler, keine geprüfte Metrik aktiver Installationen.

Wie man beiträgt

Der Prozess ist in CONTRIBUTING.md dokumentiert:

  1. Bun, Python 3.11+, Rust, die Tauri-Abhängigkeiten, Git und just installieren.
  2. Einen Fork erstellen, die Kopie klonen und just setup ausführen; dies bereitet die virtuelle Umgebung sowie die Python-/JavaScript-Abhängigkeiten vor.
  3. just dev ausführen, um Server und Anwendung zu starten, einen Branch feature/... oder fix/... anlegen, testen und einen Pull Request eröffnen.
  4. Eine klare Beschreibung, Screenshots für visuelle Änderungen und Issue-Verweise beifügen. Vor der Anfrage einer Review Dokumentation und CHANGELOG.md gegebenenfalls aktualisieren.

Der Leitfaden verlangt striktes TypeScript und Biome im Frontend, PEP 8, Typannotationen und Asynchronität in Python sowie Rust-Konventionen. Tests sind derzeit größtenteils manuell; empfohlen werden pytest für das Backend, Vitest für React und Playwright als zukünftige E2E-Schicht. Für Endpunkte wird verlangt, Route, Pydantic-Modelle und Dokumentation zu aktualisieren und den Client mit bun run generate:api neu zu generieren.

Wie die Community reagierte

Die überprüfbare, wiedergefundene Resonanz ist uneinheitlich und außerhalb von GitHub von begrenztem Umfang:

  • Hacker News enthält den Beitrag 47073053, „quelloffene App zum Klonen von Stimmen mit Qwen3-TTS”, veröffentlicht von angelmm: 4 Punkte und 0 Kommentare. Das dokumentiert Reichweite, kein externes Lob.
  • Der Beitrag 47831411, eingereicht von sebakubisz, erhielt 1 Punkt und 0 Kommentare; 48863385, eingereicht von idleplant, erhielt ebenfalls 1 Punkt und 0 Kommentare. Es wurden keine HN-Kommentare mit direktem Bezug zu Voicebox gefunden, sodass sich weder Konsens noch Kritik dieser Community zuschreiben lassen.
  • Auf GitHub gibt es konkrete Anzeichen technischer Reibung: Issue #141 von CHKE9 fragt, warum keine GPU genutzt wird, und hatte 28 Kommentare; #84 von StephanBaum meldet „GPU nicht verfügbar” und hatte 27. Das sind Nutzerberichte, keine vergleichenden Leistungstests. Die Dokumentation antwortet mit Pfaden für CPU, CUDA, ROCm, DirectML, Intel Arc sowie Tipps zur Speicherfreigabe.
  • Issue #185, „Anleitung für Fine-Tuning”, von LucianoDaluz, hatte 32 Kommentare angesammelt. Das deutet auf Community-Interesse an Anpassung über die Klonung aus kurzen Proben hinaus hin, belegt aber nicht, dass diese Fähigkeit in allen Versionen verfügbar ist.
  • Die offizielle Website versammelt Community-Tutorials, darunter „Free AI Voice Generator on Your PC (Clones Any Voice)” von Kevin Stratvert, „NEW Voicebox DESTROYS ElevenLabs?” von Julian Goldie SEO und „This Open-Source TTS App Sounds Scary Good (And It’s Free)” von Dave Swift. Das sind Titel und redaktionelle Auswahl des Projekts selbst; der vergleichende Titel von Julian Goldie SEO ist kein unabhängiger Benchmark.

Es wurden Suchen auf Reddit, X, Product Hunt, Dev.to, Hashnode, YouTube und in Listen versucht; Reddit/X/Product Hunt lieferten in diesem Durchlauf keinen verwertbaren Inhalt. Deshalb werden keine Threads, Stimmen, Meinungen oder Zahlen von diesen Plattformen erfunden. Ebenso wurde kein offizielles npm-, PyPI-, crates.io- oder Docker-Hub-Paket gefunden, das Download-Zahlen aus einer Registry liefern würde.

Voicebox im Vergleich zu anderen Angeboten

AngebotÜberprüfbare ÜbereinstimmungÜberprüfbarer Unterschied
ElevenLabsDienst zur Sprachgenerierung und -klonung; Voicebox nennt ihn als Alternative für die Ausgabe.Voicebox betreibt Modelle und API auf localhost; das README stellt das als ohne Schlüssel, Limits oder Gebühren pro Zeichen dar. Es wurde kein kontrollierter Qualitätsvergleich gefunden.
WisprFlowDiktat-Produkt; Voicebox nennt es als Alternative für die Spracheingabe.Voicebox ergänzt TTS, Klonung, einen mehrspurigen Story-Editor und MCP-Ausgabe; automatisches Einfügen ist für macOS und Windows dokumentiert, während die Parität zu Windows/Linux noch auf der Roadmap steht.
chainchopper/flex-voiceErklärtes Derivat von Voicebox mit TTS-Server und Synchronisation mit dem Original.Präsentiert sich mit eigener Marke, GPU/ROCm-Unterstützung und Cloud-Funktionen; seine Beschreibung erlaubt keine Validierung einer vollständigen Funktionsmatrix und ersetzt nicht die Tests des Originals.

Der praktische Unterschied liegt in der Kombination, nicht in einer Überlegenheitsbehauptung: Voicebox vereint Diktat, Klonung, TTS und Agenten in derselben lokalen Anwendung. ElevenLabs und WisprFlow werden hier nur verglichen, weil das Projekt selbst sie nennt; es wurde keine unabhängige Bewertung gefunden, die einen der beiden zum Sieger erklären würde.

Kurzanleitung zur Nutzung

Installation und erster Start

  • macOS Apple Silicon: voicebox_aarch64.app.tar.gz herunterladen, tar -xzf voicebox_aarch64.app.tar.gz ausführen und Voicebox.app nach /Applications/ verschieben. Für Intel wird voicebox_x64.app.tar.gz verwendet.
  • Windows: voicebox_x64_en-US.msi oder voicebox_x64-setup.exe aus der neuesten Version herunterladen und dem Assistenten folgen.
  • Linux: Die Dokumentation weist darauf hin, dass Binärdateien weiterhin durch Speicherplatzgrenzen der GitHub-Runner blockiert sind; das README verweist auf https://voicebox.sh/linux-install zum Kompilieren aus dem Quellcode. Für die Entwicklung: git clone https://github.com/jamiepine/voicebox.git, cd voicebox, just setup und just dev.

Beim ersten Start wird das gewählte Modell heruntergeladen: etwa 350 MB für Kokoro und bis zu 8 GB für TADA 3B; Qwen 1.7B liegt bei rund 3,5 GB. Die Daten werden unter ~/Library/Application Support/sh.voicebox.app/ auf macOS, %APPDATA%/sh.voicebox.app/ auf Windows und ~/.config/sh.voicebox.app/ auf Linux gespeichert. Die grüne Anzeige des Servers prüfen, ein Profil in Profiles anlegen und einen kurzen Clip erzeugen.

Übliche Arbeitsabläufe

  1. Klonen und sprechen lassen: ein Profil aus Datei, Mikrofon oder Systemaufnahme erstellen; Engine wählen und Text eingeben. Bei umfangreichem Material teilt und überblendet die Anwendung automatisch. Mit Chatterbox Turbo lassen sich Tags wie [laugh] oder [sigh] einfügen; die übrigen Engines lesen sie wörtlich.
  2. In eine andere Anwendung diktieren: die Kombinationen unter Settings → Captures einrichten, die globale Tastenkombination halten, sprechen und loslassen. Unter macOS wird der Text in das zuvor fokussierte Feld eingefügt; die optionale LLM-Verfeinerung bereinigt Füllwörter und Selbstkorrekturen.
  3. Aus einem Skript generieren: POST /generate an http://127.0.0.1:17493/generate mit text, profile_id und language senden; POST /transcribe akzeptiert audio=@recording.wav und model=whisper-turbo.
  4. Einen Agenten sprechen lassen: den MCP-Server hinzufügen und voicebox.speak verwenden; das Ergebnis erscheint in der sichtbaren Pille und in Captures.

Wesentliche Konfiguration

  • Settings → Models: Modelle herunterladen, aus dem Speicher entladen oder wechseln; VOICEBOX_MODELS_DIR erlaubt die Wahl eines Modellverzeichnisses.
  • Settings → Captures: legt Push-to-Talk- und Umschalt-Kombinationen fest.
  • Settings → MCP: weist pro Client eine Stimme zu und zeigt, wann dieser zuletzt verbunden war.
  • Stimmprofil: enthält Proben, Sprache, Effekte und Persönlichkeit; mehrere konsistente Proben verbessern die Klonung.
  • VOICEBOX_CLIENT_ID / X-Voicebox-Client-Id: identifiziert den MCP-/HTTP-Client, damit dessen zugewiesenes Stimmprofil angewendet wird.

Häufige Fallstricke und Lösungen

  • Meldet macOS, die Anwendung sei beschädigt, schlägt der Leitfaden xattr -cr /Applications/Voicebox.app vor; der Grund ist, dass die Binärdatei nicht mit einem Apple-Zertifikat signiert ist.
  • SmartScreen kann unter Windows eine Warnung für eine nicht erkannte Anwendung anzeigen; die Dokumentation verweist auf „More info” → „Run anyway” und weist darauf hin, dass die Code-Signierung noch aussteht.
  • Die erste Generierung kann durch Download und Initialisierung zwei bis fünf Minuten dauern; abwarten, Settings → Models prüfen und bei bescheidenen Verbindungen oder Geräten mit Kokoro oder LuxTTS beginnen.
  • Bei Speichermangel GPU-nutzende Anwendungen schließen, neu starten oder Settings → Generation → Use CPU instead of GPU aktivieren. Der CPU-Modus verbraucht RAM, ist laut Leitfaden aber 5- bis 10-mal langsamer.
  • flash-attn is not installed ist eine nicht blockierende Warnung: Die Dokumentation empfiehlt, sie auf den meisten Geräten zu ignorieren, da PyTorch SDPA die Inferenz fortsetzt.
  • Verbindet sich der Agent nicht über MCP, prüfen, ob Voicebox noch geöffnet ist: Das Backend lauscht nur, solange die Anwendung läuft. Der Server bindet an 127.0.0.1, hat in v0.5.0 keine Authentifizierung, und lokale Prozesse teilen sich diese Vertrauensgrenze.

Integrationen und Migration

Für Claude Code lautet der dokumentierte Befehl:

claude mcp add voicebox \
  --transport http \
  --url http://127.0.0.1:17493/mcp \
  --header "X-Voicebox-Client-Id: claude-code"

Cursor, Windsurf und MCP-Erweiterungen für VS Code können die URL http://127.0.0.1:17493/mcp und einen X-Voicebox-Client-Id-Header konfigurieren. Für Clients, die nur stdio akzeptieren, wird auf die Binärdatei voicebox-mcp verwiesen; das macOS-Beispiel verwendet /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp. npx @modelcontextprotocol/inspector http://127.0.0.1:17493/mcp erlaubt es, voicebox.list_profiles und voicebox.speak zu prüfen, bevor die Integration in einen Agenten erfolgt. Es wurde keine formale Migrationsanleitung von ElevenLabs oder WisprFlow gefunden.

Anwendungsfälle und wem dieses Repository helfen kann

  • Menschen, die lokale Kontrolle oder Privatsphäre benötigen, können Proben, Transkriptionen und Synthese auf ihrem eigenen Gerät behalten, sofern sie über eine Autorisierung für die verwendeten Stimmen verfügen.
  • Erstellerinnen und Ersteller von Erzählungen, Podcasts und Spieldialogen können Profile, Effekte, Versionen und den mehrspurigen Story-Editor nutzen; der Generator unterstützt lange Texte durch Aufteilung und Überblendungen.
  • Nutzerinnen und Nutzer, die per Sprache schreiben, können mit einer globalen Tastenkombination diktieren, die Transkription optional mit dem lokalen LLM korrigieren und Audio/Transkript in Captures zur Wiedergabe oder erneuten Verarbeitung aufbewahren.
  • Entwicklerinnen und Entwickler von Werkzeugen, Spielen oder Automatisierungen können die lokale REST-API nutzen, um zu generieren, zu transkribieren, Profile aufzulisten und den Status zu prüfen, ohne ein Dienstkonto.
  • Teams, die MCP-kompatible Agenten betreiben, können Claude Code, Cursor, Windsurf, Cline oder einer VS-Code-Erweiterung eine Stimme zuweisen, um Benachrichtigungen und Antworten sichtbar hörbar zu machen. Auf einem gemeinsam genutzten Gerät sollte der Server nicht über localhost hinaus freigegeben werden, da v0.5.0 keine Authentifizierung enthält.

Neon-Mikrofon und -Lautsprecher, die zu einem einzigen Kreis verschmelzen, umgeben von Symbolen für macOS, Windows und Linux

Ressourcen


Hinweis: Dieser Artikel kombiniert das README, die Dokumentation und die offiziellen Richtlinien von Voicebox, seine Versionen, die GitHub-API und -Seite, die offizielle Website sowie am 5. August 2026 abgerufene Hacker-News-Ergebnisse. Zahlen ändern sich mit der Zeit; Zugriffseinschränkungen bei Reddit, X, Product Hunt und Registries wurden ausdrücklich vermerkt.

Kommentare