VibeVoice: Microsofts Open-Source-Stimmfamilie, wegen Missbrauchs zurückgezogen und um Spracherkennung neu aufgebaut
microsoft/VibeVoice · 54.494★ · 6.137 forks
Eine Open-Source-Familie von Sprachmodellen (TTS und ASR) von Microsoft, MIT-lizenziert, deren Alleinstellungsmerkmal die Verarbeitung langer Audiodateien ist: Sie synthetisiert Gespräche von bis zu 90 Minuten mit bis zu 4 Sprechern und transkribiert bis zu 60 Minuten Audio in einem einzigen Durchgang, mit Sprechererkennung und Zeitstempeln. Das Projekt hat 53.121 Sterne gesammelt, und seine Geschichte enthält eine ungewöhnliche Episode: Microsoft zog den Code des ursprünglichen TTS-Modells vorübergehend wegen Missbrauchs zurück und baute die Projektfamilie danach um die Spracherkennung (VibeVoice-ASR) herum neu auf.
Ursprung
Das Repository wurde am 25. August 2025 erstellt. Es startete zusammen mit VibeVoice-TTS (Varianten 7B „Large” und 1.5B), einem konversationellen Text-zu-Sprache-Modell für lange Formate, dokumentiert im technischen Bericht arXiv:2508.19205, dessen Zusammenfassung es als eine Möglichkeit darstellt, den „echten konversationellen Vibe” zu synthetisieren, überlegen sowohl offenen als auch proprietären Dialogmodellen. Die Arbeit wurde als Oral bei ICLR 2026 angenommen.
Die zentrale Episode der Geschichte ereignete sich 9 Tage später: Am 4. September 2025 entfernte Microsoft das 7B-Modell von Hugging Face und löschte das Repository; am 5. September veröffentlichte es es erneut ohne den Code, mit diesem im aktuellen README vollständig wiedergegebenen Hinweis: „VibeVoice is an open-source research framework intended to advance collaboration in the speech synthesis community. After release, we discovered instances where the tool was used in ways inconsistent with the stated intent. Since responsible use of AI is one of Microsoft’s guiding principles, we have removed the VibeVoice-TTS code from this repository.”
Die Reaktion der Community wurde dokumentiert: Backup-Forks und ein PyPI-Paket erschienen, vibevoice 0.0.1 (hochgeladen am 26. September 2025), dessen changelog-artige Beschreibung Tag für Tag die Löschung, die codelose Wiederherstellung und das Auftauchen inoffizieller Implementierungen festhält. Im Hacker-News-Thread über die Entfernung fasste Nutzer mustaphah es so zusammen: Das Repo überschritt in wenigen Tagen 8.000 Sterne, und bei Überprüfung war der Code verschwunden und die Sterne fielen unter 200, weil es gelöscht und ein neues erstellt wurde.
Von da an wurde die Familie um das ASR und kontrolliertere TTS-Varianten herum neu aufgebaut: 2025-12-03 wurde VibeVoice-Realtime-0.5B eröffnet (Echtzeit-TTS mit Streaming-Texteingabe); 2026-01-21 wurde VibeVoice-ASR eröffnet, das vereinheitlichte Spracherkennungsmodell (60 Minuten in einem Durchgang, 50+ Sprachen), mit technischem Bericht bei arXiv:2601.18184; 2026-03-06 kam VibeVoice-ASR in die Hugging-Face-Transformers-Bibliothek; 2026-03-12 wurde es in Azure AI Foundry Labs integriert; 2026-07-23 wurde VibeASR.cpp veröffentlicht, eine CPU-Inferenz-Engine mit heterogener Quantisierung.

Philosophie und Prinzipien
Die im README, in der Dokumentation und in CONTRIBUTING.md verifizierbaren Prinzipien:
- Forschung vor Produkt: Das README erklärt explizit, dass „VibeVoice nicht für den Einsatz in kommerziellen oder realen Anwendungen ohne weitere Tests und Entwicklung empfohlen wird.”
- Langform-Sprache als eigene Kategorie: Gegen die übliche Praxis, Audio in kurze Fragmente zu schneiden, ist die These des Projekts, langes Audio nativ innerhalb eines 64K-Token-Fensters zu behandeln.
- Effizienz durch kontinuierliche 7,5-Hz-Tokenizer: Der kontinuierliche Sprach-Tokenizer arbeitet mit einer ultraniedrigen Framerate von 7,5 Hz. Der technische Bericht behauptet, dies verbessere die Datenkompression im Vergleich zu EnCodec um das 80-Fache.
- Code-Minimalismus: „unsere Kernprinzipien sind Code-Minimalismus, hohe Lesbarkeit und funktionale Reinheit.” Überengineering, rein kosmetische PRs und nicht-englische Beiträge werden explizit abgelehnt.
- Verantwortungsvoller Einsatz als Bedingung: Das Deepfake-Risiko wird in jedem Modelldokument behandelt.
- MIT-Lizenz für Code und Gewichte, wobei die Community deren praktische Bedeutung diskutierte, als das Repo „codelos” wurde.

Wie es funktioniert
VibeVoice ist kein einzelnes Werkzeug, sondern eine Familie von Modellen mit gemeinsamer Architektur: ein Next-Token-Diffusion-Framework — das LLM versteht textuellen Kontext und Dialogfluss, und ein Diffusionskopf erzeugt feines akustisches Detail — auf einer Qwen2.5-Basis (1,5B in TTS-1.5B, 0,5B in Realtime-0.5B, 7B im ASR).

Die aktiven Modelle des Repositorys: VibeVoice-ASR: strukturierte „Wer/Wann/Was”-Transkription — es führt gleichzeitig ASR, Diarisierung und Zeitstempelung durch, mit Unterstützung für benutzerdefinierte Hotwords und 50+ Sprachen ohne Sprachangabe; verarbeitet bis zu 60 Minuten kontinuierliches Audio in einem Durchgang. VibeVoice-TTS: konversationelle Generierung von bis zu 90 Minuten mit bis zu 4 unterschiedlichen Sprechern; der Installationsabschnitt liest wörtlich „Disabled due to widespread misuse.” VibeVoice-Realtime-0.5B: Echtzeit-TTS (~200–300 ms Latenz bis zum ersten hörbaren Wort), Streaming-Texteingabe, ~10 Minuten robuste Generierung. VibeVoice-ASR-BitNet (in microsoft/VibeASR.cpp): eine CPU-Variante mit heterogener Quantisierung, die das Modell von 4,62 GB auf 1,58 GB komprimiert.



Das Ökosystem
Offizielle Microsoft-Repos: microsoft/VibeASR.cpp — die offizielle CPU-Inferenz-Engine (166 Sterne, 21 Forks); Hugging Face Transformers (microsoft/VibeVoice-ASR-HF); eine Hugging-Face-Sammlung, die die Gewichte bündelt; und Integration in Azure AI Foundry Labs.
Die GitHub-Suche nach „VibeVoice” liefert 371 Repositories. Die bemerkenswertesten nach Sternen: Enemyx-net/VibeVoice-ComfyUI (1.547, eine ComfyUI-Integration für das TTS), vibevoice-community/VibeVoice (1.527, ein Community-Fork des ursprünglichen Modells), wildminder/ComfyUI-VibeVoice (596), zhao-kun/VibeVoiceFusion (490), voicepowered-ai/VibeVoice-finetuning (373), mpaepper/vibevoice (160, lokales STT mit faster-whisper), localai-org/vibevoice.cpp (121, ein C++-Port über ggml), marhensa/vibevoice-realtime-openai-api (88), danielclough/vibevoice-rs (66, Rust).
Das PyPI-Paket vibevoice 0.0.1 ist ein Backup des ursprünglichen TTS-Codes vor der Löschung. Simon Willison dokumentierte einen One-Liner, um VibeVoice-ASR auf einem Mac mit mlx-audio und der 4-Bit-MLX-Konvertierung auszuführen — ein Beleg für ein Community-Konvertierungs-Ökosystem (MLX, GGUF, Quantisierungen).

Offizieller / halboffizieller Status
- Ein offizielles Projekt der
microsoft-Organisation auf GitHub, mit eigener Website, technischen Berichten auf arXiv und Annahme als Oral bei ICLR 2026. - Integration in Azure AI Foundry Labs (12. März 2026): die einzige verifizierbare „Vendor-Unterstützung”, und sie kommt vom Vendor selbst.
- Verteilung in Hugging Face Transformers (6. März 2026) für das ASR.
- Eine dauerhafte offizielle Einschränkung des 7B-TTS: Das ursprüngliche Modell ist in der Tabelle des README „Disabled”, seine Installation wurde „wegen weitverbreitetem Missbrauchs” deaktiviert.
- Kein verifizierbarer „De-facto-Standard”-Status; das README erklärt, das Projekt sei für Forschung bestimmt und rät von kommerzieller Nutzung ab.

Repo-Zahlen
Von der GitHub-API, Stand 00:35 UTC am 23. August 2026:
| Metrik | Wert |
|---|---|
| Sterne | 53.121 |
| Forks | 5.990 |
| Abonnenten (Watchers) | 259 |
| Offene Issues + PRs | 183 |
| Commits im Hauptzweig | 140 |
| Releases | keine |
| Sprache | Python |
| Lizenz | MIT |
Top-Beitragende: YaoyaoChang (50), MSLDCherryPick (18), pengzhiliang (16), jsoref (12), Damon-Salvetore (10). Gesamte Hugging-Face-Downloads: VibeVoice-ASR 697.553, VibeVoice-Realtime-0.5B 647.155, VibeVoice-1.5B 119.947, VibeVoice-ASR-BitNet 19.273.
Schnellstart-Anleitung
Installation und erster Start
Voraussetzungen: eine NVIDIA-GPU (empfohlen) und der NVIDIA Deep Learning Container für CUDA.
Für das ASR:
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice
pip install -e .
Für Echtzeit-TTS:
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice/
pip install -e .[streamingtts]
Für VibeASR.cpp (CPU, ohne GPU):
git clone --recursive https://github.com/microsoft/VibeASR.cpp.git
cd VibeASR.cpp
pip install -r requirements.txt
python setup_env.py
Das Modell wird in den Hugging-Face-Cache heruntergeladen; das ASR-7B belegt 17,3 GB in FP16.
Häufige Workflows
- Ein langes Meeting transkribieren:
python demo/vibevoice_asr_gradio_demo.py --model_path microsoft/VibeVoice-ASR --share(erfordertffmpeg). - Mit Domain-Hotwords transkribieren:
python demo/vibevoice_asr_inference_from_file.py --model_path microsoft/VibeVoice-ASR --audio_files [Pfad]. - Echtzeit-TTS ohne eigene GPU testen: das Colab-Notebook oder
python demo/vibevoice_realtime_demo.py --model_path microsoft/VibeVoice-Realtime-0.5B. - Das ASR als OpenAI-kompatible API bereitstellen:
docker run -d --gpus all ... vllm/vllm-openai:v0.14.1 -c "python3 /app/vllm_plugin/scripts/start_server.py --dp 4".
Wesentliche Konfiguration
--model_path: der Hugging-Face-Modellname; wird automatisch in den HF-Cache heruntergeladen.--hotwords: eine Liste von Begriffen, die die Genauigkeit bei Domain-Fachjargon verbessern.VIBEVOICE_FFMPEG_MAX_CONCURRENCY(vLLM-Server, Standard 64).--tp/--dp(vLLM-Server): Tensor- und Datenparallelismus.
Häufige Stolperfallen und Lösungen
- Zufällige Musik/Geräusche im TTS: sie sind spontan und unkontrollierbar („ein Easter Egg”); das Large-Modell ist stabiler.
- Instabilität bei chinesischem Text: englische Interpunktion, die Large-Variante verwenden und den Text in mehrere Wendungen mit demselben Sprecher-Tag aufteilen.
- Unzureichende
--max-tokensim ASR: der Standardwert (8192) deckt ~25 Minuten ab; eine volle Stunde erfordert eine Erhöhung (z. B. auf 32768). - „CUDA out of memory”:
--gpu-memory-utilization,--max-num-seqsoder--max-model-lensenken. - Das ursprüngliche 7B-TTS ist offiziell nicht verfügbar: die einzigen Wege sind Community-Forks/Backups, ohne offiziellen Support.
Integrationen und Migration
vLLM: ein offizielles Plugin, das OpenAI-kompatible Endpunkte bereitstellt. Hugging Face Transformers: das ASR wird als microsoft/VibeVoice-ASR-HF konsumiert. ComfyUI: Community-Nodes. MLX (Apple Silicon): über mlx-audio und eine 4-Bit-Konvertierung. Migration von Whisper: VibeASR.cpp wird direkt mit Whisper.cpp verglichen (1,6–2,3× schneller bei vergleichbarer Größe).
Mitwirken
CONTRIBUTING.md dokumentiert strenge Kriterien: einen akademischen, forschungsorientierten Fokus; bevorzugte Beiträge sind Fehlerbehebungen und neue Funktionen; Überengineering, rein kosmetische PRs und nicht-englische Beiträge werden abgelehnt; manuelle zeilenweise Überprüfung durch die Maintainer, mit expliziter Ablehnung großer Blöcke LLM-generierten Codes ohne rigorose menschliche Bereinigung.
Wie die Community reagierte
Hacker News — TTS-Launch (448 Punkte, 170 Kommentare): baal80spam sagt, es „klingt SEHR beeindruckend”; die am häufigsten wiederholte Kritik ist, dass männliche Stimmen roboterhaft klingen (simiones, IshKebab, strangescript). TheAceOfHearts wies auf ein Hardware-Problem hin: „erzeugte einen 66-sekündigen Clip in 832 Sekunden auf CPU mit float32.” echelon: „nah am emotionalen SOTA… frage mich, ob ElevenLabs seinen riesigen ARR halten wird”; odie5533 entgegnete, Chatterbox wirke auf ihn realistischer.
Hacker News — Code-Entfernung: ein Thread, in dem mustaphah das Vorher/Nachher dokumentierte: über 8.000 Sterne in wenigen Tagen, dann „Code weg, Sterne unter 200.”
Hacker News — ASR-Wiederbelebung (386 Punkte, 181 Kommentare): CubsFan1060 verlinkte Simon Willisons Bericht, der das ASR auf einem MacBook Pro M5 Max mit mlx-audio ausführte: 8 Min 45 Sek für die Transkription einer Stunde Podcast. walthamstow: „scheint ziemlich schwer für STT; Parakeet und Whisper sind viel kleiner und funktionieren gut für schnelles Diktat.”
VibeVoice im Vergleich zu anderen Angeboten
| Projekt | Beziehung zu VibeVoice |
|---|---|
| Whisper / Whisper.cpp (OpenAI) | Der klassische STT-Benchmark; VibeASR.cpp misst sich direkt daran (1,6–2,3× schneller bei vergleichbarer Größe). |
| Parakeet (NVIDIA) | Eine kleinere, schnellere STT-Alternative für Diktat. |
| SenseVoice / FunASR (Alibaba) | In denselben WER-Tabellen enthalten. |
| ElevenLabs | Eine kommerzielle Referenz für ausdrucksstarkes TTS, zitiert von HN-Kommentatoren. |
| Kokoro TTS | Eine lokale Alternative, als bevorzugt genannt, mit Phonem-(IPA)-Lesung. |
| Chatterbox | Als „realistischer, ohne den robotischen Klang” zitiert. |
Anwendungsfälle und wem dieses Repository helfen kann
- Teams, die lange Meetings/Podcasts transkribieren: das 60-minütige Single-Pass-ASR mit Diarisierung, Zeitstempeln und Hotwords deckt den gesamten Workflow ohne externe Chunking-Ketten ab; die BitNet-Variante ermöglicht GPU-freie Deployments.
- Produktteams, die Live-Sprache bauen: VibeVoice-Realtime-0.5B ist so konzipiert, dass Assistenten ab dem ersten Token sprechen können.
- Produktion konversationeller Audioinhalte: das 90-minütige TTS-1.5B mit 4 Sprechern deckt Dialog-Prototyping ab; Community-ComfyUI-Integrationen binden es in visuelle/Audio-Pipelines ein.
- Forscher und ML-Sprachteams: zitierbare technische Berichte, dokumentiertes LoRA-Fine-Tuning und eine Referenzarchitektur.
- Apple-Silicon-/Edge-Entwickler: die 4-Bit-MLX-Konvertierung und die VibeASR.cpp-Runtime ermöglichen lokale Transkription ohne GPU.
Ressourcen
- Repository: https://github.com/microsoft/VibeVoice
- Dokumentation: https://microsoft.github.io/VibeVoice/
- Offizielle Modelle: https://huggingface.co/microsoft/VibeVoice-ASR
- ASR-Playground: https://aka.ms/vibevoice-asr
- Technische Paper: TTS https://arxiv.org/abs/2508.19205 · ASR https://arxiv.org/abs/2601.18184
- Offizielles Geschwister-Repo: https://github.com/microsoft/VibeASR.cpp
- Reviews: Simon Willison (27. April 2026) https://simonwillison.net/2026/Apr/27/vibevoice/
Hinweis: Dieser Artikel fasst das README und die offizielle Dokumentation von VibeVoice, die GitHub-API, technische Paper auf arXiv, Hacker-News-Diskussionen und Simon Willisons Bericht zusammen, abgerufen am 22. August 2026. Zahlen ändern sich mit der Zeit. In diesem Durchlauf wurden keine verwertbaren Reddit-Belege gefunden.
Kommentare