YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
CosyVoice Podcast Model
这是使用 300 期播客音频训练的 CosyVoice 模型。
模型信息
- 基础模型: CosyVoice2-0.5B
- 训练数据: 300 期播客音频
- 说话人: dumubuchenlin
- 训练时间: 2026-03-01 至 2026-03-05
文件结构
checkpoints_backup/
├── llm_epoch24_loss0.056_acc99.2.pt (1.9GB)
└── flow_epoch40_loss0.519.pt (430MB)
hf_checkpoints/
├── llm/epoch_24_whole.pt
└── flow/epoch_40_whole.pt
scripts/
├── generate_full_text_v2.py (推荐使用)
├── generate_episode_v6_segmented.py
└── generate_fixed_v2.py
config/
└── cosyvoice2_small_batch.yaml
data/
└── episode_script_v6.txt (示例脚本)
使用方法
1. 加载模型
from cosyvoice.cli.cosyvoice import CosyVoice2
import torch
# 加载基础模型
cosyvoice = CosyVoice2(pretrained/CosyVoice2-0.5B)
# 加载 fine-tuned checkpoints
llm_ckpt = torch.load(checkpoints_backup/llm_epoch24_loss0.056_acc99.2.pt)
flow_ckpt = torch.load(checkpoints_backup/flow_epoch40_loss0.519.pt)
cosyvoice.model.llm.load_state_dict(llm_ckpt, strict=False)
cosyvoice.model.flow.load_state_dict(flow_ckpt, strict=False)
2. 生成音频
# 完整文本一次性生成(推荐)
text = "你的播客文本内容..."
speaker = "dumubuchenlin"
all_audio = []
for output in cosyvoice.inference_sft(text, speaker, stream=False, speed=1.0):
audio = output[tts_speech].numpy().flatten()
all_audio.append(audio)
final_audio = np.concatenate(all_audio)
训练日志
- LLM: epoch 24, loss 0.056, accuracy 99.2%
- Flow: epoch 40, loss 0.519
- HiFiGAN: epoch 15-20
备份时间
2026-03-06
许可证
仅供个人研究使用。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support