Streaming Sortformer v2.1(safetensors)

本仓库将 NVIDIA 的 diar_streaming_sortformer_4spk-v2.1 官方权重转换为 safetensors,未微调、未量化。支持流式说话人分离,最多 4 位说话人,不包含语音转写。

model.safetensors 包含原始的 990 个张量;config.json 包含原生 PyTorch 实现所需的架构与流式参数;source.json 记录来源版本和原始归档 SHA-256。仓库不包含 .nemo 或 pickle 权重。

使用

hf download MigoXV/diar_streaming_sortformer_4spk-v2.1 --local-dir /path/to/model
# 在 sortformer-dia 项目环境中运行:
poetry run sortformer-dia serve --model /path/to/model --device cpu --dtype float32

本仓库供 sortformer-dia 的原生 PyTorch 加载器使用,模型实现代码不包含在本仓库中。safetensors 是张量存储格式,不代表 Transformers 的 AutoModel 已实现此架构。运行不需要 NeMo;CUDA 下可使用该项目保留的 Triton 内核。NPU 尚未验证。

来源与许可证

原始模型:NVIDIA Streaming Sortformer v2.1。权重沿用 NVIDIA Open Model License,完整协议见 LICENSE.pdf,归属声明见 NOTICE。本仓库为格式转换版本,并非 NVIDIA 官方发布。

Downloads last month
15
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MigoXV/diar_streaming_sortformer_4spk-v2.1

Finetuned
(11)
this model