YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

CosyVoice Podcast Model

这是使用 300 期播客音频训练的 CosyVoice 模型。

模型信息

  • 基础模型: CosyVoice2-0.5B
  • 训练数据: 300 期播客音频
  • 说话人: dumubuchenlin
  • 训练时间: 2026-03-01 至 2026-03-05

文件结构

checkpoints_backup/
  ├── llm_epoch24_loss0.056_acc99.2.pt (1.9GB)
  └── flow_epoch40_loss0.519.pt (430MB)

hf_checkpoints/
  ├── llm/epoch_24_whole.pt
  └── flow/epoch_40_whole.pt

scripts/
  ├── generate_full_text_v2.py (推荐使用)
  ├── generate_episode_v6_segmented.py
  └── generate_fixed_v2.py

config/
  └── cosyvoice2_small_batch.yaml

data/
  └── episode_script_v6.txt (示例脚本)

使用方法

1. 加载模型

from cosyvoice.cli.cosyvoice import CosyVoice2
import torch

# 加载基础模型
cosyvoice = CosyVoice2(pretrained/CosyVoice2-0.5B)

# 加载 fine-tuned checkpoints
llm_ckpt = torch.load(checkpoints_backup/llm_epoch24_loss0.056_acc99.2.pt)
flow_ckpt = torch.load(checkpoints_backup/flow_epoch40_loss0.519.pt)

cosyvoice.model.llm.load_state_dict(llm_ckpt, strict=False)
cosyvoice.model.flow.load_state_dict(flow_ckpt, strict=False)

2. 生成音频

# 完整文本一次性生成(推荐)
text = "你的播客文本内容..."
speaker = "dumubuchenlin"

all_audio = []
for output in cosyvoice.inference_sft(text, speaker, stream=False, speed=1.0):
    audio = output[tts_speech].numpy().flatten()
    all_audio.append(audio)

final_audio = np.concatenate(all_audio)

训练日志

  • LLM: epoch 24, loss 0.056, accuracy 99.2%
  • Flow: epoch 40, loss 0.519
  • HiFiGAN: epoch 15-20

备份时间

2026-03-06

许可证

仅供个人研究使用。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support