Nvidia hat Nemotron 3 Diarization freigegeben: ein 100‑Mio‑Parameter‑Modell zur Sprecherzuordnung, das bis zu acht Stimmen in Echtzeit erkennt.
In Kürze
- Modell (~100 Mio Parameter) – Gewichte frei verfügbar
- Erkennt bis zu acht Sprecher, auch überlappende Sprache; funktioniert live
- Bessere DER (14,72%); Audiopuffer steuern Latenz vs. Genauigkeit
Nvidia hat ein neues Modell zur Sprecherzuordnung veröffentlicht: Nemotron 3 Diarization.
Kurz gesagt sorgt das System dafür, dass in Gesprächen erkannt wird, wer wann spricht — die trainierten Modellgewichte sind frei verfügbar.
Was das Modell kann
- Größe: rund 100 Millionen Parameter, ein Hinweis auf die Modellkomplexität.
- Bis zu acht verschiedene Sprecher werden erkannt; auch überlappende Sprache (mehrere Personen gleichzeitig) kann das Modell identifizieren.
- Es funktioniert sowohl mit aufgezeichnetem Material als auch in Echtzeit (live).
- Stärkere Störgeräusche, Hall oder eine größere Zahl an Teilnehmern erhöhen die Fehlerrate.
Wie du es mit Spracherkennung kombinieren kannst
Nemotron 3 lässt sich mit Speech‑to‑Text-Systemen wie Parakeet koppeln. So entstehen Transkripte mit Sprecherzuordnung — die Sprecher werden dabei anonym benannt (zum Beispiel „speaker_2“), nicht mit realen Namen.
Audiopuffer und Latenz-Genauigkeits-Trade-off
Das System bietet vier Audiopuffer-Stufen zwischen 30,4 und 0,32 Sekunden. Der Audiopuffer ist die Zeitspanne, die das Modell zur Analyse nutzt: kürzere Puffer reduzieren die Latenz, wirken sich aber meist negativ auf die Genauigkeit aus.
Benchmark‑Ergebnisse
Im Diarization‑Benchmark von VoiceArena erreicht Nemotron 3 eine Fehlerrate (DER) von 14,72 %, damit liegt es vor dem nächstbesten System mit 19,3 %. Der Test ist sehr streng: überlappende Sprache wird mitgezählt und selbst kleine Abweichungen an Übergängen gelten als Fehler. Gegenüber dem Vorgänger Streaming Sortformer sinkt die Fehlerrate bei 1,04‑Sekunden‑Puffer über acht Testszenarien im Schnitt um 41 %.
Quelle
Quellen
- Quelle: Nvidia
- Der ursprüngliche Artikel wurde hier veröffentlicht
- Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.




