Voicebox: ein lokales Voice-Studio, das Synthese, Diktat und Agenten vereint
jamiepine/voicebox · 55.672★ · 6.937 forks
Alles Wissenswerte über jamiepine/voicebox: eine quelloffene Desktop-Anwendung zum Klonen von Stimmen, Generieren von Audio, Diktieren von Text und Verbinden von Sprach-Ein-/Ausgabe mit Agenten über MCP.
Was Voicebox ist
Voicebox ist ein lokal ausgerichtetes KI-Voice-Studio. Sein README positioniert es ausdrücklich als kostenlose, quelloffene Alternative zu ElevenLabs für die Sprachausgabe und zu WisprFlow für das Diktieren, vereint in einer einzigen Anwendung. Modelle, Stimmproben, Aufzeichnungen und Inferenz laufen alle auf dem eigenen Rechner der Nutzerin oder des Nutzers.
Die Anwendung kann ein Profil aus einer kurzen Probe erstellen, Text mit sieben TTS-Engines synthetisieren, mit Whisper transkribieren und das Ergebnis eines Diktats in das gerade fokussierte Feld einfügen.

Außerdem stellt sie eine lokale REST-API und einen MCP-Server bereit: Ein kompatibler Agent kann über voicebox.speak sprechen, transkribieren und Profile oder Aufzeichnungen abfragen.
Die Anwendung prüft nicht, wer die Rechte an einer Stimme hält. Ihre Richtlinie zur verantwortungsvollen Nutzung beschränkt die Verwendung auf die eigene Stimme sowie autorisiertes oder lizenziertes Material und verbietet Identitätsmissbrauch ohne Erlaubnis, Betrug, Belästigung und die Umgehung von Sprachauthentifizierung.
Der Ursprung: vom Klon-Studio zum vollständigen Sprachkreislauf
Das Repository wurde am 25. Januar 2026 angelegt. Hauptautor ist Jamie Pine (jamiepine), dessen GitHub-Konto Spacedrive Technology Inc. als Unternehmen angibt und auf voicebox.sh verlinkt; dasselbe Konto beschreibt die aktuelle Tätigkeit als discover.me. Es wurde kein Launch-Beitrag mit einer unabhängigen, der Repository-Erstellung vorausgehenden Erzählung gefunden, daher wird keine alternative Zeitlinie zugeschrieben.
Die Version v0.5.0, veröffentlicht am 25. April 2026, markierte den als „Capture” bezeichneten Umfangswechsel: Laut den Release-Notes wurde Voicebox von einem reinen Klon-Studio zu einer Anwendung mit globalem Diktat, lokaler Verfeinerung von Transkriptionen, Profilen mit Persönlichkeit und Agenten-Ausgabe über MCP. Die gestalterische Spannung ist klar: Dienste wie ElevenLabs und WisprFlow lösen jeweils eine Hälfte — Sprachausgabe beziehungsweise Spracheingabe — in getrennten Diensten; Voicebox schlägt vor, beide Hälften und die dahinterliegenden privaten Daten auf derselben Maschine zu behalten.
Philosophie und Prinzipien
- Lokal zuerst: Für heruntergeladene Modelle sind keine API-Schlüssel, Kontingente oder Abrechnung pro Zeichen erforderlich; die Website und das README erklären, dass die Audiodaten auf dem Gerät verbleiben.

- Ein bidirektionaler Kreislauf: Diktieren an eine Anwendung und das Empfangen einer gesprochenen Antwort von einem Agenten werden als Zustände derselben schwebenden Oberfläche dargestellt, nicht als getrennte Produkte.
- Modell- und Hardware-Wahl: Die TTS-Engines, die Whisper-Größe und die Ausführungspfade ändern sich je nach Qualität, Sprache, Speicher und verfügbarem Beschleuniger.
- Sichtbare Kontrolle: Jede von einem Agenten ausgelöste Äußerung zeigt eine Pille auf dem Bildschirm; das Design verhindert, dass Sprachausgabe still im Hintergrund abläuft.

- Einwilligung als Verantwortung der Nutzerin oder des Nutzers: Lokale Privatsphäre ersetzt nicht die Erlaubnis der Stimminhaberin oder des Stimminhabers noch die Offenlegungspflichten für synthetisches Audio.
Wie es funktioniert
Die Tauri-Oberfläche kombiniert ein React/TypeScript-Frontend, einen Python-FastAPI-Server, native Rust-Komponenten und SQLite. Die Synthese bietet Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA und Kokoro; Whisper und Whisper Turbo decken die Transkription ab. Das lokale Qwen3-Modell kann Füllwörter und Selbstkorrekturen aus dem Diktat bereinigen oder Text vor der Synthese gemäß der Persönlichkeit eines Profils umschreiben.
Ein kompatibler Agent kann sich über das offene MCP-Protokoll verbinden: Die Anwendung stellt voicebox.speak und weitere Werkzeuge über einen holografischen KI-Agenten-Würfel bereit, der über einen mit „MCP” beschrifteten Datenstrom mit einem lokalen Terminal verbunden ist.

Der übliche Ablauf ist, ein Profil zu erstellen oder zu importieren, eine Engine zu wählen und zu generieren. Bei langen Texten teilt Voicebox an Satzgrenzen und führt Überblendungen durch; dokumentiert sind ein Maximum von 50.000 Zeichen, ein konfigurierbares Aufteilungslimit von 100 bis 5.000 Zeichen und Überblendungen von 0 bis 200 ms.

Die serielle Warteschlange vermeidet GPU-Konkurrenz und bewahrt Versionen, Takes und Herkunft jeder Generierung.
Unter macOS und Windows lässt sich eine globale Tastenkombination für Push-to-Talk oder das Ein-/Ausschalten der Aufnahme einrichten. Voicebox transkribiert, kann optional lokal verfeinern und legt den Text in dem Feld ab, das zuvor den Fokus hatte; das automatische Einfügen für Windows und Linux steht noch auf der Roadmap. Zu den lokalen Routen gehören POST /generate, POST /speak, POST /transcribe, GET /profiles sowie OpenAPI-Dokumentation unter http://127.0.0.1:17493/docs, während die Anwendung läuft.

Offizieller und halboffizieller Status
Es wurden keine Belege dafür gefunden, dass Voicebox in einen offiziellen Marktplatz eines KI-Anbieters aufgenommen wurde, noch dass ElevenLabs, WisprFlow, Anthropic, OpenAI oder Cursor es offiziell unterstützen. Es sollte daher nicht als offizielle Ergänzung zu einem dieser Anbieter dargestellt werden.
Es implementiert jedoch das offene MCP-Protokoll mit HTTP-Transport und einem stdio-Adapter. Die Dokumentation erklärt Kompatibilität mit Claude Code, Cursor, Windsurf, Cline und MCP-Erweiterungen für VS Code; das ist eine dokumentierte technische Interoperabilität, keine Zertifizierung durch die Hersteller. Das Projekt verfügt über eine eigene Website, Dokumentation und eigene Binärdateien, aber es gibt keine überprüfbare Einstufung als De-facto-Standard.
Das Ökosystem
Integrationen und Werkzeuge des Autors
jamiepine/hermes-voicebox(15 Sterne zum Zeitpunkt der API-Abfrage) bietet lokale TTS- und STT-Anbieter für Hermes Agent mit Klonung und Whisper; es ist die am direktesten lokalisierte öffentliche Ergänzung desselben Autors.jamiepine/keytap(18 Sterne) ist eine Bibliothek zur Beobachtung globaler Tastenanschläge auf macOS, Windows und Linux; ihr Umfang passt zur globalen Tastenkombination von Voicebox, wobei die API keine Produktabhängigkeit zwischen beiden dokumentiert.- Das Repository bringt eine Agenten-Fähigkeit unter
.agents/skills/add-tts-engine/SKILL.mdmit, die auf die Integration einer TTS-Engine gemäß Backend-Protokoll, Frontend-Verdrahtung und Paketierung zielt. Es enthält außerdem.mcp.json, damit Claude Code während der Entwicklung die lokalen Werkzeuge nutzen kann. - Der mitgelieferte MCP-Server stellt vier Werkzeuge bereit:
voicebox.speak,voicebox.transcribe,voicebox.list_capturesundvoicebox.list_profiles. Er ist per HTTP unterhttp://127.0.0.1:17493/mcperreichbar oder über die Binärdateivoicebox-mcpfür Clients, die nurstdiounterstützen.
Forks, Ports und Community-Erweiterungen
Die nach Sternen sortierte Forks-API lieferte vor allem Kopien des Repositorys. Diejenigen mit einer expliziten Differenzierung sind:
hacksider/voicebox(14 Sterne): beschreibt sich als quelloffenes Sprachsynthese-Studio.sumire608/voicebox(4 Sterne): beschreibt sich als Studio auf Basis von Qwen3-TTS.sergio-caracas/voicebox-docker(2 Sterne): ein Fork mit Docker-Paketierung im Namen und in der Beschreibung.lowchristopher-praiseJesus/voicebox: Die GitHub-Suche identifiziert ihn als Kopie mit einem eigenen/podcast-Endpunkt.charlyfavela1-eng/voicebox: Die Suche beschreibt ihn als Fork mit einer Docker-Anpassung für Render; das ist eine Deployment-Erweiterung, keine bestätigte Übersetzung.chainchopper/flex-voice: präsentiert sich als umbenannter Voicebox-TTS-Server, synchron mit dem Originalprojekt und mit GPU/ROCm-Unterstützung.
In den ausgewerteten Ergebnissen wurde keine nicht-englische Übersetzung mit eigener, überprüfbarer Dokumentation identifiziert. Die übrigen sichtbareren Forks behielten die ursprüngliche Beschreibung bei oder waren persönliche Kopien; sie werden ohne zusätzlichen Beleg nicht zu „Ports” aufgewertet.
Verwandtes Umfeld
Die expliziten Vergleiche des README nennen ElevenLabs und WisprFlow. Auf der Modellebene sind Qwen3-TTS, Whisper, Kokoro, Chatterbox und TADA wählbare Komponenten, keine Konkurrenzanwendungen. Die Suche fand auch kuratierte Listen, die das Repository enthalten, etwa alvinreal/awesome-opensource-ai, filipecalegario/awesome-generative-ai und ikaijua/Awesome-AITools; diese Aufnahme belegt Sichtbarkeit in Listen, nicht Unterstützung oder Integration.
Zahlen zum Repository
Messung: 5. August 2026; GitHub-API und öffentliche Seite.
| Kennzahl | Wert |
|---|---|
| Sterne | 49.421 |
| Forks | 6.085 |
| Echte Abonnenten | 231 |
| Sichtbare Commits | 638 |
| Sichtbare offene Issues | 466 |
| Sichtbare offene Pull Requests | 117 |
| Sichtbare Branches / Tags | 67 / 27 |
| Hauptsprache | TypeScript |
| Lizenz | MIT |
| Erstellt | 25. Januar 2026 |
| Letzte veröffentlichte Version | v0.5.0, 25. April 2026 |
Die von der API nach Anzahl der Beiträge zurückgegebenen Hauptmitwirkenden waren jamiepine (527), tomasmach (7) sowie, mit je 3, lemassykoi, pandego, mikeswann, selop, sridhar-3009, Spyabo, mvanhorn, iegui-ops und DaddyRaegen.
Die Metadaten-Antwort der API gab 583 für open_issues_count zurück, während die öffentliche Seite 466 Issues und 117 Pull Requests anzeigte. GitHub weist darauf hin, dass open_issues_count Issues und Pull Requests vermischen kann, weshalb beide sichtbaren Zahlen getrennt angegeben werden. watchers_count dupliziert in dieser Antwort die Sternezahl; deshalb wird subscribers_count für Abonnenten verwendet. Die API gab außerdem updated_at: 6. August 2026 zurück, später als das Messdatum dieses Durchlaufs; dies wird als Metadaten-Anomalie festgehalten, nicht als abgeleitete zukünftige Aktivität.
Die offizielle Website zeigte 2.000.529 kumulierte Downloads für v0.5.0. Das ist ein projekteigener Werbezähler, keine geprüfte Metrik aktiver Installationen.
Wie man beiträgt
Der Prozess ist in CONTRIBUTING.md dokumentiert:
- Bun, Python 3.11+, Rust, die Tauri-Abhängigkeiten, Git und
justinstallieren. - Einen Fork erstellen, die Kopie klonen und
just setupausführen; dies bereitet die virtuelle Umgebung sowie die Python-/JavaScript-Abhängigkeiten vor. just devausführen, um Server und Anwendung zu starten, einen Branchfeature/...oderfix/...anlegen, testen und einen Pull Request eröffnen.- Eine klare Beschreibung, Screenshots für visuelle Änderungen und Issue-Verweise beifügen. Vor der Anfrage einer Review Dokumentation und
CHANGELOG.mdgegebenenfalls aktualisieren.
Der Leitfaden verlangt striktes TypeScript und Biome im Frontend, PEP 8, Typannotationen und Asynchronität in Python sowie Rust-Konventionen. Tests sind derzeit größtenteils manuell; empfohlen werden pytest für das Backend, Vitest für React und Playwright als zukünftige E2E-Schicht. Für Endpunkte wird verlangt, Route, Pydantic-Modelle und Dokumentation zu aktualisieren und den Client mit bun run generate:api neu zu generieren.
Wie die Community reagierte
Die überprüfbare, wiedergefundene Resonanz ist uneinheitlich und außerhalb von GitHub von begrenztem Umfang:
- Hacker News enthält den Beitrag 47073053, „quelloffene App zum Klonen von Stimmen mit Qwen3-TTS”, veröffentlicht von angelmm: 4 Punkte und 0 Kommentare. Das dokumentiert Reichweite, kein externes Lob.
- Der Beitrag 47831411, eingereicht von sebakubisz, erhielt 1 Punkt und 0 Kommentare; 48863385, eingereicht von idleplant, erhielt ebenfalls 1 Punkt und 0 Kommentare. Es wurden keine HN-Kommentare mit direktem Bezug zu Voicebox gefunden, sodass sich weder Konsens noch Kritik dieser Community zuschreiben lassen.
- Auf GitHub gibt es konkrete Anzeichen technischer Reibung: Issue #141 von CHKE9 fragt, warum keine GPU genutzt wird, und hatte 28 Kommentare; #84 von StephanBaum meldet „GPU nicht verfügbar” und hatte 27. Das sind Nutzerberichte, keine vergleichenden Leistungstests. Die Dokumentation antwortet mit Pfaden für CPU, CUDA, ROCm, DirectML, Intel Arc sowie Tipps zur Speicherfreigabe.
- Issue #185, „Anleitung für Fine-Tuning”, von LucianoDaluz, hatte 32 Kommentare angesammelt. Das deutet auf Community-Interesse an Anpassung über die Klonung aus kurzen Proben hinaus hin, belegt aber nicht, dass diese Fähigkeit in allen Versionen verfügbar ist.
- Die offizielle Website versammelt Community-Tutorials, darunter „Free AI Voice Generator on Your PC (Clones Any Voice)” von Kevin Stratvert, „NEW Voicebox DESTROYS ElevenLabs?” von Julian Goldie SEO und „This Open-Source TTS App Sounds Scary Good (And It’s Free)” von Dave Swift. Das sind Titel und redaktionelle Auswahl des Projekts selbst; der vergleichende Titel von Julian Goldie SEO ist kein unabhängiger Benchmark.
Es wurden Suchen auf Reddit, X, Product Hunt, Dev.to, Hashnode, YouTube und in Listen versucht; Reddit/X/Product Hunt lieferten in diesem Durchlauf keinen verwertbaren Inhalt. Deshalb werden keine Threads, Stimmen, Meinungen oder Zahlen von diesen Plattformen erfunden. Ebenso wurde kein offizielles npm-, PyPI-, crates.io- oder Docker-Hub-Paket gefunden, das Download-Zahlen aus einer Registry liefern würde.
Voicebox im Vergleich zu anderen Angeboten
| Angebot | Überprüfbare Übereinstimmung | Überprüfbarer Unterschied |
|---|---|---|
| ElevenLabs | Dienst zur Sprachgenerierung und -klonung; Voicebox nennt ihn als Alternative für die Ausgabe. | Voicebox betreibt Modelle und API auf localhost; das README stellt das als ohne Schlüssel, Limits oder Gebühren pro Zeichen dar. Es wurde kein kontrollierter Qualitätsvergleich gefunden. |
| WisprFlow | Diktat-Produkt; Voicebox nennt es als Alternative für die Spracheingabe. | Voicebox ergänzt TTS, Klonung, einen mehrspurigen Story-Editor und MCP-Ausgabe; automatisches Einfügen ist für macOS und Windows dokumentiert, während die Parität zu Windows/Linux noch auf der Roadmap steht. |
chainchopper/flex-voice | Erklärtes Derivat von Voicebox mit TTS-Server und Synchronisation mit dem Original. | Präsentiert sich mit eigener Marke, GPU/ROCm-Unterstützung und Cloud-Funktionen; seine Beschreibung erlaubt keine Validierung einer vollständigen Funktionsmatrix und ersetzt nicht die Tests des Originals. |
Der praktische Unterschied liegt in der Kombination, nicht in einer Überlegenheitsbehauptung: Voicebox vereint Diktat, Klonung, TTS und Agenten in derselben lokalen Anwendung. ElevenLabs und WisprFlow werden hier nur verglichen, weil das Projekt selbst sie nennt; es wurde keine unabhängige Bewertung gefunden, die einen der beiden zum Sieger erklären würde.
Kurzanleitung zur Nutzung
Installation und erster Start
- macOS Apple Silicon:
voicebox_aarch64.app.tar.gzherunterladen,tar -xzf voicebox_aarch64.app.tar.gzausführen undVoicebox.appnach/Applications/verschieben. Für Intel wirdvoicebox_x64.app.tar.gzverwendet. - Windows:
voicebox_x64_en-US.msiodervoicebox_x64-setup.exeaus der neuesten Version herunterladen und dem Assistenten folgen. - Linux: Die Dokumentation weist darauf hin, dass Binärdateien weiterhin durch Speicherplatzgrenzen der GitHub-Runner blockiert sind; das README verweist auf
https://voicebox.sh/linux-installzum Kompilieren aus dem Quellcode. Für die Entwicklung:git clone https://github.com/jamiepine/voicebox.git,cd voicebox,just setupundjust dev.
Beim ersten Start wird das gewählte Modell heruntergeladen: etwa 350 MB für Kokoro und bis zu 8 GB für TADA 3B; Qwen 1.7B liegt bei rund 3,5 GB. Die Daten werden unter ~/Library/Application Support/sh.voicebox.app/ auf macOS, %APPDATA%/sh.voicebox.app/ auf Windows und ~/.config/sh.voicebox.app/ auf Linux gespeichert. Die grüne Anzeige des Servers prüfen, ein Profil in Profiles anlegen und einen kurzen Clip erzeugen.
Übliche Arbeitsabläufe
- Klonen und sprechen lassen: ein Profil aus Datei, Mikrofon oder Systemaufnahme erstellen; Engine wählen und Text eingeben. Bei umfangreichem Material teilt und überblendet die Anwendung automatisch. Mit Chatterbox Turbo lassen sich Tags wie
[laugh]oder[sigh]einfügen; die übrigen Engines lesen sie wörtlich. - In eine andere Anwendung diktieren: die Kombinationen unter Settings → Captures einrichten, die globale Tastenkombination halten, sprechen und loslassen. Unter macOS wird der Text in das zuvor fokussierte Feld eingefügt; die optionale LLM-Verfeinerung bereinigt Füllwörter und Selbstkorrekturen.
- Aus einem Skript generieren:
POST /generateanhttp://127.0.0.1:17493/generatemittext,profile_idundlanguagesenden;POST /transcribeakzeptiertaudio=@recording.wavundmodel=whisper-turbo. - Einen Agenten sprechen lassen: den MCP-Server hinzufügen und
voicebox.speakverwenden; das Ergebnis erscheint in der sichtbaren Pille und in Captures.
Wesentliche Konfiguration
- Settings → Models: Modelle herunterladen, aus dem Speicher entladen oder wechseln;
VOICEBOX_MODELS_DIRerlaubt die Wahl eines Modellverzeichnisses. - Settings → Captures: legt Push-to-Talk- und Umschalt-Kombinationen fest.
- Settings → MCP: weist pro Client eine Stimme zu und zeigt, wann dieser zuletzt verbunden war.
- Stimmprofil: enthält Proben, Sprache, Effekte und Persönlichkeit; mehrere konsistente Proben verbessern die Klonung.
VOICEBOX_CLIENT_ID/X-Voicebox-Client-Id: identifiziert den MCP-/HTTP-Client, damit dessen zugewiesenes Stimmprofil angewendet wird.
Häufige Fallstricke und Lösungen
- Meldet macOS, die Anwendung sei beschädigt, schlägt der Leitfaden
xattr -cr /Applications/Voicebox.appvor; der Grund ist, dass die Binärdatei nicht mit einem Apple-Zertifikat signiert ist. - SmartScreen kann unter Windows eine Warnung für eine nicht erkannte Anwendung anzeigen; die Dokumentation verweist auf „More info” → „Run anyway” und weist darauf hin, dass die Code-Signierung noch aussteht.
- Die erste Generierung kann durch Download und Initialisierung zwei bis fünf Minuten dauern; abwarten, Settings → Models prüfen und bei bescheidenen Verbindungen oder Geräten mit Kokoro oder LuxTTS beginnen.
- Bei Speichermangel GPU-nutzende Anwendungen schließen, neu starten oder Settings → Generation → Use CPU instead of GPU aktivieren. Der CPU-Modus verbraucht RAM, ist laut Leitfaden aber 5- bis 10-mal langsamer.
flash-attn is not installedist eine nicht blockierende Warnung: Die Dokumentation empfiehlt, sie auf den meisten Geräten zu ignorieren, da PyTorch SDPA die Inferenz fortsetzt.- Verbindet sich der Agent nicht über MCP, prüfen, ob Voicebox noch geöffnet ist: Das Backend lauscht nur, solange die Anwendung läuft. Der Server bindet an
127.0.0.1, hat in v0.5.0 keine Authentifizierung, und lokale Prozesse teilen sich diese Vertrauensgrenze.
Integrationen und Migration
Für Claude Code lautet der dokumentierte Befehl:
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
Cursor, Windsurf und MCP-Erweiterungen für VS Code können die URL http://127.0.0.1:17493/mcp und einen X-Voicebox-Client-Id-Header konfigurieren. Für Clients, die nur stdio akzeptieren, wird auf die Binärdatei voicebox-mcp verwiesen; das macOS-Beispiel verwendet /Applications/Voicebox.app/Contents/MacOS/voicebox-mcp. npx @modelcontextprotocol/inspector http://127.0.0.1:17493/mcp erlaubt es, voicebox.list_profiles und voicebox.speak zu prüfen, bevor die Integration in einen Agenten erfolgt. Es wurde keine formale Migrationsanleitung von ElevenLabs oder WisprFlow gefunden.
Anwendungsfälle und wem dieses Repository helfen kann
- Menschen, die lokale Kontrolle oder Privatsphäre benötigen, können Proben, Transkriptionen und Synthese auf ihrem eigenen Gerät behalten, sofern sie über eine Autorisierung für die verwendeten Stimmen verfügen.
- Erstellerinnen und Ersteller von Erzählungen, Podcasts und Spieldialogen können Profile, Effekte, Versionen und den mehrspurigen Story-Editor nutzen; der Generator unterstützt lange Texte durch Aufteilung und Überblendungen.
- Nutzerinnen und Nutzer, die per Sprache schreiben, können mit einer globalen Tastenkombination diktieren, die Transkription optional mit dem lokalen LLM korrigieren und Audio/Transkript in Captures zur Wiedergabe oder erneuten Verarbeitung aufbewahren.
- Entwicklerinnen und Entwickler von Werkzeugen, Spielen oder Automatisierungen können die lokale REST-API nutzen, um zu generieren, zu transkribieren, Profile aufzulisten und den Status zu prüfen, ohne ein Dienstkonto.
- Teams, die MCP-kompatible Agenten betreiben, können Claude Code, Cursor, Windsurf, Cline oder einer VS-Code-Erweiterung eine Stimme zuweisen, um Benachrichtigungen und Antworten sichtbar hörbar zu machen. Auf einem gemeinsam genutzten Gerät sollte der Server nicht über
localhosthinaus freigegeben werden, da v0.5.0 keine Authentifizierung enthält.

Ressourcen
- Repository: https://github.com/jamiepine/voicebox
- Offizielle Website und Demo: https://voicebox.sh/
- Dokumentation und Installation: https://docs.voicebox.sh/
- Offizieller MCP-Leitfaden: https://docs.voicebox.sh/overview/mcp-server
- Fehlerbehebung: https://docs.voicebox.sh/overview/troubleshooting
- Versionen und Änderungen: https://github.com/jamiepine/voicebox/releases
- Mitwirken: https://github.com/jamiepine/voicebox/blob/main/CONTRIBUTING.md
- Verantwortungsvolle Nutzung: https://github.com/jamiepine/voicebox/blob/main/RESPONSIBLE_USE.md
- Hermes-Ergänzung: https://github.com/jamiepine/hermes-voicebox
- Tutorials und Demos: https://voicebox.sh/ (Abschnitt „Learn by watching”; Kevin Stratvert, Julian Goldie SEO, Dave Swift und Tech指南)
- Hacker-News-Threads: https://news.ycombinator.com/item?id=47073053, https://news.ycombinator.com/item?id=47831411, https://news.ycombinator.com/item?id=48863385
Hinweis: Dieser Artikel kombiniert das README, die Dokumentation und die offiziellen Richtlinien von Voicebox, seine Versionen, die GitHub-API und -Seite, die offizielle Website sowie am 5. August 2026 abgerufene Hacker-News-Ergebnisse. Zahlen ändern sich mit der Zeit; Zugriffseinschränkungen bei Reddit, X, Product Hunt und Registries wurden ausdrücklich vermerkt.
Kommentare