Nvidia veröffentlicht Nemotron 3 Diarization – Echtzeit‑Sprecherzuordnung mit freien Gewichten

28.09.2026 | Allgemein, KI

Nvidia hat Nemotron 3 Diarization freigegeben: ein 100‑Mio‑Parameter‑Modell zur Sprecherzuordnung, das bis zu acht Stimmen in Echtzeit erkennt.

In Kürze

  • Modell (~100 Mio Parameter) – Gewichte frei verfügbar
  • Erkennt bis zu acht Sprecher, auch überlappende Sprache; funktioniert live
  • Bessere DER (14,72%); Audiopuffer steuern Latenz vs. Genauigkeit

Nvidia hat ein neues Modell zur Sprecherzuordnung veröffentlicht: Nemotron 3 Diarization.

Kurz gesagt sorgt das System dafür, dass in Gesprächen erkannt wird, wer wann spricht — die trainierten Modellgewichte sind frei verfügbar.

Was das Modell kann

  • Größe: rund 100 Millionen Parameter, ein Hinweis auf die Modellkomplexität.
  • Bis zu acht verschiedene Sprecher werden erkannt; auch überlappende Sprache (mehrere Personen gleichzeitig) kann das Modell identifizieren.
  • Es funktioniert sowohl mit aufgezeichnetem Material als auch in Echtzeit (live).
  • Stärkere Störgeräusche, Hall oder eine größere Zahl an Teilnehmern erhöhen die Fehlerrate.

Wie du es mit Spracherkennung kombinieren kannst

Nemotron 3 lässt sich mit Speech‑to‑Text-Systemen wie Parakeet koppeln. So entstehen Transkripte mit Sprecherzuordnung — die Sprecher werden dabei anonym benannt (zum Beispiel „speaker_2“), nicht mit realen Namen.

Audiopuffer und Latenz-Genauigkeits-Trade-off

Das System bietet vier Audiopuffer-Stufen zwischen 30,4 und 0,32 Sekunden. Der Audiopuffer ist die Zeitspanne, die das Modell zur Analyse nutzt: kürzere Puffer reduzieren die Latenz, wirken sich aber meist negativ auf die Genauigkeit aus.

Benchmark‑Ergebnisse

Im Diarization‑Benchmark von VoiceArena erreicht Nemotron 3 eine Fehlerrate (DER) von 14,72 %, damit liegt es vor dem nächstbesten System mit 19,3 %. Der Test ist sehr streng: überlappende Sprache wird mitgezählt und selbst kleine Abweichungen an Übergängen gelten als Fehler. Gegenüber dem Vorgänger Streaming Sortformer sinkt die Fehlerrate bei 1,04‑Sekunden‑Puffer über acht Testszenarien im Schnitt um 41 %.

Quelle

Quellen

  • Quelle: Nvidia
  • Der ursprüngliche Artikel wurde hier veröffentlicht
  • Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.

💡Über das Projekt KI News Daily

Dieser Artikel wurde vollständig mit KI generiert und ist Teil des Projektes KI News Daily der Pickert GmbH. Wir arbeiten an der ständigen Verbesserung der Mechanismen, können aber leider Fehler und Irrtümer nicht ausschließen. Sollte dir etwas auffallen, wende dich bitte umgehend an unseren Support und feedback[at]pickert.io

Vielen Dank! 🙏

Du möchtest deine Prozesse optimieren und automatisieren?

KI News Daily ist unser Showcase für Automatisierung. Wir nutzen unterschiedlichste Technologien, je nachdem, welches Prozessproblem du lösen möchtest. Ins Thema einsteigen kannst du beispielsweise mit unserer KI-Reifegradanalyse.

Aktuelle KI-News auf dem Blog

Agenten-KI: Menschen behalten meist die Richtungsentscheidung

Agenten-KI: Menschen behalten meist die Richtungsentscheidung

Feldstudie aus Shanghai: Agenten-KI hilft häufig, entscheidet aber selten die Richtung; steigende Delegation birgt Aufsichtsrisiken.In KürzeKI in 96,5% der Aufgaben eingesetztMenschen treffen 85–93% der EndentscheidungenDelegation steigt, Kontrolle kann schwinden Wer...