maobailing_rvc — RVC v2 / 40kHz 声线克隆模型

一款基于 RVC(Retrieval-based-Voice-Conversion-WebUI)v2、在 40kHz 采样率下训练的中文女声声线克隆模型。

数据集来源

训练该模型所用数据集全部来源于index-tts 2克隆产物,未使用任何人类语音数据训练。

模型简介

模型名 maobailing_rvc
框架 RVC v2(Retrieval-based Voice Conversion)
版本 / 采样率 v2 / 40 kHz
是否使用 f0 是(f0=1
说话人数 109(实际训练使用 speaker 0
特征 HuBERT 768 维 + RMVPE 音高
训练精度 float16

文件清单

maobailing_rvc.pth            # RVC 推理模型(53 MB)
maobailing_rvc.index          # faiss 索引(IVF751_Flat_nprobe_1, ~89 MB)
maobailing_rvc_trained.index  # faiss 训练索引(~2.3 MB)
config.json                   # 模型配置
PARAMS.md                     # 完整参数说明
README.md                     # 本说明
LICENSE                       # Apache-2.0

训练数据

  • 中文女声干声数据集(6 段 FLAC,单声道,22.05kHz,约 29.4 分钟)。
  • 预处理:切片为 163 段;重采样 40k / 16k;RMVPE 提取 f0;HuBERT 提取 768 维特征。
  • 说话人:单一说话人(speaker_id = 0)。

使用方法(RVC WebUI / 命令行)

  1. maobailing_rvc.pth 放入 assets/weights/maobailing_rvc.index 放入 assets/indices/
  2. WebUI 中选择模型 maobailing_rvc,设置推荐参数:
    • index_rate = 0.6rms_mix_rate = 0.5protect = 0.4f0_method = rmvpef0_up_key = 0(女声偏高/吃力可调 ±2)。
  3. 上传干声,点击转换。

命令行推理(参考):使用 RVC 的 VC 接口(get_vc + vc_single)。关键环境变量需设为: weight_root=<assets/weights>rmvpe_root=<assets/rmvpe>index_root=<assets/indices>; 超长音频建议设 RVC_CUDA_GRAPH=0 并分段处理。

环境

  • Python 3.12.13
  • torch 2.7.1+cu118、torchaudio 2.7.1+cu118
  • faiss-cpu 1.15.0、transformers 4.49.0、gradio 3.14.0、librosa 0.10.2、soundfile 等
  • 仓库版本要求 Python 3.12(依赖文件 requirments_cu118_py312.txt

说明:安装时未启用 onnxruntime-gpu(其依赖的 nvidia-cudnn-cu11==8.9.5.29 在 PyPI/镜像上不存在,且与 torch 冲突;该路径仅用于 Windows/DirectML,Linux+CUDA 推理不需要)。详见 PARAMS.md

许可

本项目模型按 Apache License 2.0 发布,详见 LICENSE。训练数据与使用场景请遵守相应版权与授权要求。

致谢

  • RVC-Project / RVC-Boss 的 RVC 框架;index-tts 2;RMVPE、ContentVec/HuBERT、HiFi-GAN / VITS 等相关开源项目。
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support