27. August 2026 · Von YasKad
microsoft/VibeVoice

VibeVoice: Microsofts Open-Source-Stimmfamilie, wegen Missbrauchs zurückgezogen und um Spracherkennung neu aufgebaut

microsoft/VibeVoice · 54.494★ · 6.137 forks

Eine Open-Source-Familie von Sprachmodellen (TTS und ASR) von Microsoft, MIT-lizenziert, deren Alleinstellungsmerkmal die Verarbeitung langer Audiodateien ist: Sie synthetisiert Gespräche von bis zu 90 Minuten mit bis zu 4 Sprechern und transkribiert bis zu 60 Minuten Audio in einem einzigen Durchgang, mit Sprechererkennung und Zeitstempeln. Das Projekt hat 53.121 Sterne gesammelt, und seine Geschichte enthält eine ungewöhnliche Episode: Microsoft zog den Code des ursprünglichen TTS-Modells vorübergehend wegen Missbrauchs zurück und baute die Projektfamilie danach um die Spracherkennung (VibeVoice-ASR) herum neu auf.


Ursprung

Das Repository wurde am 25. August 2025 erstellt. Es startete zusammen mit VibeVoice-TTS (Varianten 7B „Large” und 1.5B), einem konversationellen Text-zu-Sprache-Modell für lange Formate, dokumentiert im technischen Bericht arXiv:2508.19205, dessen Zusammenfassung es als eine Möglichkeit darstellt, den „echten konversationellen Vibe” zu synthetisieren, überlegen sowohl offenen als auch proprietären Dialogmodellen. Die Arbeit wurde als Oral bei ICLR 2026 angenommen.

Die zentrale Episode der Geschichte ereignete sich 9 Tage später: Am 4. September 2025 entfernte Microsoft das 7B-Modell von Hugging Face und löschte das Repository; am 5. September veröffentlichte es es erneut ohne den Code, mit diesem im aktuellen README vollständig wiedergegebenen Hinweis: „VibeVoice is an open-source research framework intended to advance collaboration in the speech synthesis community. After release, we discovered instances where the tool was used in ways inconsistent with the stated intent. Since responsible use of AI is one of Microsoft’s guiding principles, we have removed the VibeVoice-TTS code from this repository.”

Die Reaktion der Community wurde dokumentiert: Backup-Forks und ein PyPI-Paket erschienen, vibevoice 0.0.1 (hochgeladen am 26. September 2025), dessen changelog-artige Beschreibung Tag für Tag die Löschung, die codelose Wiederherstellung und das Auftauchen inoffizieller Implementierungen festhält. Im Hacker-News-Thread über die Entfernung fasste Nutzer mustaphah es so zusammen: Das Repo überschritt in wenigen Tagen 8.000 Sterne, und bei Überprüfung war der Code verschwunden und die Sterne fielen unter 200, weil es gelöscht und ein neues erstellt wurde.

Von da an wurde die Familie um das ASR und kontrolliertere TTS-Varianten herum neu aufgebaut: 2025-12-03 wurde VibeVoice-Realtime-0.5B eröffnet (Echtzeit-TTS mit Streaming-Texteingabe); 2026-01-21 wurde VibeVoice-ASR eröffnet, das vereinheitlichte Spracherkennungsmodell (60 Minuten in einem Durchgang, 50+ Sprachen), mit technischem Bericht bei arXiv:2601.18184; 2026-03-06 kam VibeVoice-ASR in die Hugging-Face-Transformers-Bibliothek; 2026-03-12 wurde es in Azure AI Foundry Labs integriert; 2026-07-23 wurde VibeASR.cpp veröffentlicht, eine CPU-Inferenz-Engine mit heterogener Quantisierung.

Eine dramatische Cyberpunk-Visualisierung des Ursprungs und der vorübergehenden Entfernung des Microsoft-VibeVoice-Repositorys, ein leuchtendes GitHub-artiges Repository-Panel schwebt in einer dunklen digitalen Leere, ein roter Löschstrahl fegt durch den Hauptabschnitt des TTS-Codes, Backup-Forks entstehen als verzweigte Neon-Konstellationen, eine kleine PyPI-Paketkapsel schwebt in der Nähe als Community-Backup, abstrakte Hacker-News-Kommentarstränge dargestellt als durchscheinende Lichtbänder, eine Zeitleiste zeigt die erste Veröffentlichung, die Entfernung und den späteren Wiederaufbau um das ASR, Dark Mode, Cyberpunk-Tech-Ästhetik, Neon-Akzente, ultra-detailliert, 8K-Auflösung

Philosophie und Prinzipien

Die im README, in der Dokumentation und in CONTRIBUTING.md verifizierbaren Prinzipien:

  • Forschung vor Produkt: Das README erklärt explizit, dass „VibeVoice nicht für den Einsatz in kommerziellen oder realen Anwendungen ohne weitere Tests und Entwicklung empfohlen wird.”
  • Langform-Sprache als eigene Kategorie: Gegen die übliche Praxis, Audio in kurze Fragmente zu schneiden, ist die These des Projekts, langes Audio nativ innerhalb eines 64K-Token-Fensters zu behandeln.
  • Effizienz durch kontinuierliche 7,5-Hz-Tokenizer: Der kontinuierliche Sprach-Tokenizer arbeitet mit einer ultraniedrigen Framerate von 7,5 Hz. Der technische Bericht behauptet, dies verbessere die Datenkompression im Vergleich zu EnCodec um das 80-Fache.
  • Code-Minimalismus: „unsere Kernprinzipien sind Code-Minimalismus, hohe Lesbarkeit und funktionale Reinheit.” Überengineering, rein kosmetische PRs und nicht-englische Beiträge werden explizit abgelehnt.
  • Verantwortungsvoller Einsatz als Bedingung: Das Deepfake-Risiko wird in jedem Modelldokument behandelt.
  • MIT-Lizenz für Code und Gewichte, wobei die Community deren praktische Bedeutung diskutierte, als das Repo „codelos” wurde.

Ein konzeptuelles Bild der Forschung-zuerst-Philosophie und des Langform-Audio-Prinzips von VibeVoice, eine minimalistische dunkle Oberfläche zeigt ein kontinuierliches 64K-Token-Fenster als eine lange leuchtende Spur, winzige kontinuierliche 7,5-Hz-Sprach-Tokens bewegen sich in einem präzisen Strom mit niedriger Rate, ein Schild-Symbol repräsentiert verantwortungsvolle KI-Nutzung, ein subtiles Warnglyphen deutet auf reine Forschungsnutzung hin, saubere funktionale Code-Panels mit abstrakter Syntax, keine Unordnung, rein funktionales Design, elegante Neon-Linien, Dark Mode, Cyberpunk-Tech-Ästhetik, Cyan- und Violett-Neon-Akzente, ultra-detailliert, 8K-Auflösung

Wie es funktioniert

VibeVoice ist kein einzelnes Werkzeug, sondern eine Familie von Modellen mit gemeinsamer Architektur: ein Next-Token-Diffusion-Framework — das LLM versteht textuellen Kontext und Dialogfluss, und ein Diffusionskopf erzeugt feines akustisches Detail — auf einer Qwen2.5-Basis (1,5B in TTS-1.5B, 0,5B in Realtime-0.5B, 7B im ASR).

Eine detaillierte architektonische Visualisierung des Next-Token-Diffusion-Frameworks von VibeVoice, ein großer durchscheinender Qwen2.5-Sprachmodellkern links, der den Dialogkontext und den Textfluss versteht, ein Diffusionskopf rechts, der feines akustisches Detail erzeugt, Token-Pfeile fließen vom semantischen Textverständnis zur hochwertigen Wellenform-Synthese, eine geschichtete neuronale Karte zeigt Modellvarianten 1,5B, 0,5B und 7B als verschachtelte leuchtende Kerne, ein 64K-Token-Kontextfenster gerendert als gekrümmter leuchtender Ring, Dark Mode, Cyberpunk-Tech-Ästhetik, Neon-Akzente, ultra-detailliert, 8K-Auflösung

Die aktiven Modelle des Repositorys: VibeVoice-ASR: strukturierte „Wer/Wann/Was”-Transkription — es führt gleichzeitig ASR, Diarisierung und Zeitstempelung durch, mit Unterstützung für benutzerdefinierte Hotwords und 50+ Sprachen ohne Sprachangabe; verarbeitet bis zu 60 Minuten kontinuierliches Audio in einem Durchgang. VibeVoice-TTS: konversationelle Generierung von bis zu 90 Minuten mit bis zu 4 unterschiedlichen Sprechern; der Installationsabschnitt liest wörtlich „Disabled due to widespread misuse.” VibeVoice-Realtime-0.5B: Echtzeit-TTS (~200–300 ms Latenz bis zum ersten hörbaren Wort), Streaming-Texteingabe, ~10 Minuten robuste Generierung. VibeVoice-ASR-BitNet (in microsoft/VibeASR.cpp): eine CPU-Variante mit heterogener Quantisierung, die das Modell von 4,62 GB auf 1,58 GB komprimiert.

Eine High-Tech-Szene, die VibeVoice-ASR darstellt, eine 60-minütige kontinuierliche Audiodatei wird in einem einzigen Durchgang verarbeitet, strukturierte Transkriptionspanels zeigen, wer sprach, wann es geschah und was gesagt wurde, Sprecher-Diarisierung visualisiert als farbcodierte Stimmspuren, Zeitstempelmarker leuchten entlang der Wellenform, Hotword-Tokens als kleine Neon-Chips hervorgehoben, mehrsprachige Unterstützung dargestellt durch abstrakte Sprachglyphen für mehr als 50 Sprachen, Code-Switching gezeigt als gemischte Wellenformfarben, Dark Mode, Cyberpunk-Tech-Ästhetik, Cyan-, Grün- und Magenta-Neon-Akzente, ultra-detailliert, 8K-Auflösung

Eine filmische Visualisierung der Langform-Generierung von VibeVoice TTS, eine 90-minütige konversationelle Wellenform entfaltet sich auf einer dunklen Cyberpunk-Bühne, vier unterschiedliche Sprecher-Avatare sprechen in natürlichen Wechseln, jeder mit einer einzigartigen Neonfarb-Signatur, Dialogkontinuität gezeigt als sanfte Verbindungsbögen zwischen Sprechern, ein gesperrter 7B-Modellabschnitt markiert mit einem roten Siegel für eingeschränkte Nutzung, ein kleineres 1,5B-Modell und ein 0,5B-Echtzeitmodell als kompakte leuchtende Motoren dargestellt, Streaming-Texteingabe fließt von einer Seite in sofortige Sprachausgabe, Dark Mode, Cyberpunk-Tech-Ästhetik, Neon-Akzente, ultra-detailliert, 8K-Auflösung

Eine technische Visualisierung der CPU-Inferenz von VibeASR.cpp, eine kompakte Laptop- oder eingebettete CPU-Platine führt Spracherkennung ohne GPU aus, ein großes 4,62-GB-Modell wird zu einem BitNet-optimierten 1,58-GB-Motor komprimiert, heterogene Quantisierung als I8_S- und I2_S-Token-Ströme dargestellt, mehrere CPU-Threads visualisiert als parallele Neon-Pipelines, ein Echtzeitfaktor-Indikator unter 1 als sanft leuchtender Messwert angezeigt, Wellenformeingabe und Textausgabe bewegen sich in synchronisierten Strömen, Dark Mode, Cyberpunk-Tech-Ästhetik, Neon-Akzente, ultra-detailliert, 8K-Auflösung

Das Ökosystem

Offizielle Microsoft-Repos: microsoft/VibeASR.cpp — die offizielle CPU-Inferenz-Engine (166 Sterne, 21 Forks); Hugging Face Transformers (microsoft/VibeVoice-ASR-HF); eine Hugging-Face-Sammlung, die die Gewichte bündelt; und Integration in Azure AI Foundry Labs.

Die GitHub-Suche nach „VibeVoice” liefert 371 Repositories. Die bemerkenswertesten nach Sternen: Enemyx-net/VibeVoice-ComfyUI (1.547, eine ComfyUI-Integration für das TTS), vibevoice-community/VibeVoice (1.527, ein Community-Fork des ursprünglichen Modells), wildminder/ComfyUI-VibeVoice (596), zhao-kun/VibeVoiceFusion (490), voicepowered-ai/VibeVoice-finetuning (373), mpaepper/vibevoice (160, lokales STT mit faster-whisper), localai-org/vibevoice.cpp (121, ein C++-Port über ggml), marhensa/vibevoice-realtime-openai-api (88), danielclough/vibevoice-rs (66, Rust).

Das PyPI-Paket vibevoice 0.0.1 ist ein Backup des ursprünglichen TTS-Codes vor der Löschung. Simon Willison dokumentierte einen One-Liner, um VibeVoice-ASR auf einem Mac mit mlx-audio und der 4-Bit-MLX-Konvertierung auszuführen — ein Beleg für ein Community-Konvertierungs-Ökosystem (MLX, GGUF, Quantisierungen).

Eine Ökosystemkarte des VibeVoice-Projekts, ein zentraler leuchtender VibeVoice-Kern verbunden mit offiziellen und Community-Knoten, Hugging Face Transformers dargestellt als Standard-Bibliotheksportal, Azure AI Foundry Labs dargestellt als Cloud-Service-Gateway, VibeASR.cpp dargestellt als CPU-Inferenz-Chip, Community-Forks als verzweigte Neon-Repositories dargestellt, MLX- und GGUF-Konvertierungsknoten als kompakte Modellkassetten gerendert, eine Web-Studio-Oberfläche und ein ComfyUI-Node-Panel schweben in der Nähe, Dark Mode, Cyberpunk-Tech-Ästhetik, Neon-Akzente, ultra-detailliert, 8K-Auflösung

Offizieller / halboffizieller Status

  • Ein offizielles Projekt der microsoft-Organisation auf GitHub, mit eigener Website, technischen Berichten auf arXiv und Annahme als Oral bei ICLR 2026.
  • Integration in Azure AI Foundry Labs (12. März 2026): die einzige verifizierbare „Vendor-Unterstützung”, und sie kommt vom Vendor selbst.
  • Verteilung in Hugging Face Transformers (6. März 2026) für das ASR.
  • Eine dauerhafte offizielle Einschränkung des 7B-TTS: Das ursprüngliche Modell ist in der Tabelle des README „Disabled”, seine Installation wurde „wegen weitverbreitetem Missbrauchs” deaktiviert.
  • Kein verifizierbarer „De-facto-Standard”-Status; das README erklärt, das Projekt sei für Forschung bestimmt und rät von kommerzieller Nutzung ab.

Ein Bild zum Thema verantwortungsvolle Nutzung und Sicherheit für VibeVoice, ein durchscheinender Schild schützt eine Sprachwellenform vor Missbrauch, Deepfake-Risiko dargestellt als verzerrte, gestörte Stimmklone, die herausgefiltert werden, eingebettete Sprachprobenkapseln als sichere Neon-Container dargestellt, ein MIT-Lizenzsiegel und ein Nur-Forschung-Abzeichen als abstrakte Embleme gerendert, Community-Feedbackströme fließen von öffentlicher Diskussion zu verbesserten Schutzmaßnahmen, eine ausgewogene Komposition aus Offenheit und Verantwortlichkeit, Dark Mode, Cyberpunk-Tech-Ästhetik, Cyan-, Violett- und Bernstein-Neon-Akzente, ultra-detailliert, 8K-Auflösung

Repo-Zahlen

Von der GitHub-API, Stand 00:35 UTC am 23. August 2026:

MetrikWert
Sterne53.121
Forks5.990
Abonnenten (Watchers)259
Offene Issues + PRs183
Commits im Hauptzweig140
Releaseskeine
SprachePython
LizenzMIT

Top-Beitragende: YaoyaoChang (50), MSLDCherryPick (18), pengzhiliang (16), jsoref (12), Damon-Salvetore (10). Gesamte Hugging-Face-Downloads: VibeVoice-ASR 697.553, VibeVoice-Realtime-0.5B 647.155, VibeVoice-1.5B 119.947, VibeVoice-ASR-BitNet 19.273.

Schnellstart-Anleitung

Installation und erster Start

Voraussetzungen: eine NVIDIA-GPU (empfohlen) und der NVIDIA Deep Learning Container für CUDA.

Für das ASR:

git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice
pip install -e .

Für Echtzeit-TTS:

git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice/
pip install -e .[streamingtts]

Für VibeASR.cpp (CPU, ohne GPU):

git clone --recursive https://github.com/microsoft/VibeASR.cpp.git
cd VibeASR.cpp
pip install -r requirements.txt
python setup_env.py

Das Modell wird in den Hugging-Face-Cache heruntergeladen; das ASR-7B belegt 17,3 GB in FP16.

Häufige Workflows

  1. Ein langes Meeting transkribieren: python demo/vibevoice_asr_gradio_demo.py --model_path microsoft/VibeVoice-ASR --share (erfordert ffmpeg).
  2. Mit Domain-Hotwords transkribieren: python demo/vibevoice_asr_inference_from_file.py --model_path microsoft/VibeVoice-ASR --audio_files [Pfad].
  3. Echtzeit-TTS ohne eigene GPU testen: das Colab-Notebook oder python demo/vibevoice_realtime_demo.py --model_path microsoft/VibeVoice-Realtime-0.5B.
  4. Das ASR als OpenAI-kompatible API bereitstellen: docker run -d --gpus all ... vllm/vllm-openai:v0.14.1 -c "python3 /app/vllm_plugin/scripts/start_server.py --dp 4".

Wesentliche Konfiguration

  • --model_path: der Hugging-Face-Modellname; wird automatisch in den HF-Cache heruntergeladen.
  • --hotwords: eine Liste von Begriffen, die die Genauigkeit bei Domain-Fachjargon verbessern.
  • VIBEVOICE_FFMPEG_MAX_CONCURRENCY (vLLM-Server, Standard 64).
  • --tp / --dp (vLLM-Server): Tensor- und Datenparallelismus.

Häufige Stolperfallen und Lösungen

  • Zufällige Musik/Geräusche im TTS: sie sind spontan und unkontrollierbar („ein Easter Egg”); das Large-Modell ist stabiler.
  • Instabilität bei chinesischem Text: englische Interpunktion, die Large-Variante verwenden und den Text in mehrere Wendungen mit demselben Sprecher-Tag aufteilen.
  • Unzureichende --max-tokens im ASR: der Standardwert (8192) deckt ~25 Minuten ab; eine volle Stunde erfordert eine Erhöhung (z. B. auf 32768).
  • „CUDA out of memory”: --gpu-memory-utilization, --max-num-seqs oder --max-model-len senken.
  • Das ursprüngliche 7B-TTS ist offiziell nicht verfügbar: die einzigen Wege sind Community-Forks/Backups, ohne offiziellen Support.

Integrationen und Migration

vLLM: ein offizielles Plugin, das OpenAI-kompatible Endpunkte bereitstellt. Hugging Face Transformers: das ASR wird als microsoft/VibeVoice-ASR-HF konsumiert. ComfyUI: Community-Nodes. MLX (Apple Silicon): über mlx-audio und eine 4-Bit-Konvertierung. Migration von Whisper: VibeASR.cpp wird direkt mit Whisper.cpp verglichen (1,6–2,3× schneller bei vergleichbarer Größe).

Mitwirken

CONTRIBUTING.md dokumentiert strenge Kriterien: einen akademischen, forschungsorientierten Fokus; bevorzugte Beiträge sind Fehlerbehebungen und neue Funktionen; Überengineering, rein kosmetische PRs und nicht-englische Beiträge werden abgelehnt; manuelle zeilenweise Überprüfung durch die Maintainer, mit expliziter Ablehnung großer Blöcke LLM-generierten Codes ohne rigorose menschliche Bereinigung.

Wie die Community reagierte

Hacker News — TTS-Launch (448 Punkte, 170 Kommentare): baal80spam sagt, es „klingt SEHR beeindruckend”; die am häufigsten wiederholte Kritik ist, dass männliche Stimmen roboterhaft klingen (simiones, IshKebab, strangescript). TheAceOfHearts wies auf ein Hardware-Problem hin: „erzeugte einen 66-sekündigen Clip in 832 Sekunden auf CPU mit float32.” echelon: „nah am emotionalen SOTA… frage mich, ob ElevenLabs seinen riesigen ARR halten wird”; odie5533 entgegnete, Chatterbox wirke auf ihn realistischer.

Hacker News — Code-Entfernung: ein Thread, in dem mustaphah das Vorher/Nachher dokumentierte: über 8.000 Sterne in wenigen Tagen, dann „Code weg, Sterne unter 200.”

Hacker News — ASR-Wiederbelebung (386 Punkte, 181 Kommentare): CubsFan1060 verlinkte Simon Willisons Bericht, der das ASR auf einem MacBook Pro M5 Max mit mlx-audio ausführte: 8 Min 45 Sek für die Transkription einer Stunde Podcast. walthamstow: „scheint ziemlich schwer für STT; Parakeet und Whisper sind viel kleiner und funktionieren gut für schnelles Diktat.”

VibeVoice im Vergleich zu anderen Angeboten

ProjektBeziehung zu VibeVoice
Whisper / Whisper.cpp (OpenAI)Der klassische STT-Benchmark; VibeASR.cpp misst sich direkt daran (1,6–2,3× schneller bei vergleichbarer Größe).
Parakeet (NVIDIA)Eine kleinere, schnellere STT-Alternative für Diktat.
SenseVoice / FunASR (Alibaba)In denselben WER-Tabellen enthalten.
ElevenLabsEine kommerzielle Referenz für ausdrucksstarkes TTS, zitiert von HN-Kommentatoren.
Kokoro TTSEine lokale Alternative, als bevorzugt genannt, mit Phonem-(IPA)-Lesung.
ChatterboxAls „realistischer, ohne den robotischen Klang” zitiert.

Anwendungsfälle und wem dieses Repository helfen kann

  • Teams, die lange Meetings/Podcasts transkribieren: das 60-minütige Single-Pass-ASR mit Diarisierung, Zeitstempeln und Hotwords deckt den gesamten Workflow ohne externe Chunking-Ketten ab; die BitNet-Variante ermöglicht GPU-freie Deployments.
  • Produktteams, die Live-Sprache bauen: VibeVoice-Realtime-0.5B ist so konzipiert, dass Assistenten ab dem ersten Token sprechen können.
  • Produktion konversationeller Audioinhalte: das 90-minütige TTS-1.5B mit 4 Sprechern deckt Dialog-Prototyping ab; Community-ComfyUI-Integrationen binden es in visuelle/Audio-Pipelines ein.
  • Forscher und ML-Sprachteams: zitierbare technische Berichte, dokumentiertes LoRA-Fine-Tuning und eine Referenzarchitektur.
  • Apple-Silicon-/Edge-Entwickler: die 4-Bit-MLX-Konvertierung und die VibeASR.cpp-Runtime ermöglichen lokale Transkription ohne GPU.

Ressourcen


Hinweis: Dieser Artikel fasst das README und die offizielle Dokumentation von VibeVoice, die GitHub-API, technische Paper auf arXiv, Hacker-News-Diskussionen und Simon Willisons Bericht zusammen, abgerufen am 22. August 2026. Zahlen ändern sich mit der Zeit. In diesem Durchlauf wurden keine verwertbaren Reddit-Belege gefunden.

Kommentare