maobailing_rvc — RVC v2 / 40kHz 声线克隆模型
一款基于 RVC(Retrieval-based-Voice-Conversion-WebUI)v2、在 40kHz 采样率下训练的中文女声声线克隆模型。
数据集来源
训练该模型所用数据集全部来源于index-tts 2克隆产物,未使用任何人类语音数据训练。
模型简介
| 项 | 值 |
|---|---|
| 模型名 | maobailing_rvc |
| 框架 | RVC v2(Retrieval-based Voice Conversion) |
| 版本 / 采样率 | v2 / 40 kHz |
| 是否使用 f0 | 是(f0=1) |
| 说话人数 | 109(实际训练使用 speaker 0) |
| 特征 | HuBERT 768 维 + RMVPE 音高 |
| 训练精度 | float16 |
文件清单
maobailing_rvc.pth # RVC 推理模型(53 MB)
maobailing_rvc.index # faiss 索引(IVF751_Flat_nprobe_1, ~89 MB)
maobailing_rvc_trained.index # faiss 训练索引(~2.3 MB)
config.json # 模型配置
PARAMS.md # 完整参数说明
README.md # 本说明
LICENSE # Apache-2.0
训练数据
- 中文女声干声数据集(6 段 FLAC,单声道,22.05kHz,约 29.4 分钟)。
- 预处理:切片为 163 段;重采样 40k / 16k;RMVPE 提取 f0;HuBERT 提取 768 维特征。
- 说话人:单一说话人(speaker_id = 0)。
使用方法(RVC WebUI / 命令行)
- 将
maobailing_rvc.pth放入assets/weights/,maobailing_rvc.index放入assets/indices/。 - WebUI 中选择模型
maobailing_rvc,设置推荐参数:index_rate = 0.6、rms_mix_rate = 0.5、protect = 0.4、f0_method = rmvpe、f0_up_key = 0(女声偏高/吃力可调 ±2)。
- 上传干声,点击转换。
命令行推理(参考):使用 RVC 的 VC 接口(get_vc + vc_single)。关键环境变量需设为:
weight_root=<assets/weights>、rmvpe_root=<assets/rmvpe>、index_root=<assets/indices>;
超长音频建议设 RVC_CUDA_GRAPH=0 并分段处理。
环境
- Python 3.12.13
- torch 2.7.1+cu118、torchaudio 2.7.1+cu118
- faiss-cpu 1.15.0、transformers 4.49.0、gradio 3.14.0、librosa 0.10.2、soundfile 等
- 仓库版本要求 Python 3.12(依赖文件
requirments_cu118_py312.txt)
说明:安装时未启用 onnxruntime-gpu(其依赖的
nvidia-cudnn-cu11==8.9.5.29在 PyPI/镜像上不存在,且与 torch 冲突;该路径仅用于 Windows/DirectML,Linux+CUDA 推理不需要)。详见PARAMS.md。
许可
本项目模型按 Apache License 2.0 发布,详见 LICENSE。训练数据与使用场景请遵守相应版权与授权要求。
致谢
- RVC-Project / RVC-Boss 的 RVC 框架;index-tts 2;RMVPE、ContentVec/HuBERT、HiFi-GAN / VITS 等相关开源项目。
- Downloads last month
- -