Audio, VAD & Diarization
Collection
Voice Activity Detection, Diarization, and Audio Processing models • 28 items • Updated
ONNX export of pyannote/segmentation-3.0 for speaker diarization (voice activity and speaker segmentation).
[batch, channels, samples], 16 kHz mono, e.g. [1, 1, 160000] for 10 seconds.[batch, num_frames, num_classes] (7 classes, powerset decoding).Derived from pyannote.audio; see pyannote/segmentation-3.0 for the original model and license.