YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

FireRedTTS3 MNN(fp16 + w8 混合精度,CPU,免 torch)

FireRedTTS3 的 MNN 转换产物,共 19 个 分段文件、5.35GB:编码器/解码器/DiT/embed/小头为 fp16(近无损),backbone (prefill_seg1-4 / step_seg1-4)为 w8 权重量化(11.3GB → 2.8GB)。

用法

pip install fireredtts3-mnn         # 或 uvx fireredtts3-mnn
fireredtts3-mnn                     # 自动下载本仓库 + tokenizer,启动 HTTP 服务
fireredtts3-mnn --text "你好世界" --prompt-wav ref.wav --prompt-text "参考文本" --out gen.wav

国内可设 HF_ENDPOINT=https://hf-mirror.com

为什么是混合精度

各组件输出 vs torch fp32 的最大绝对误差:

组件 w8(int8 权重) fp16 fp32
redae_encoder 1.69 0.059 2.8e-4
campp 0.61 0.080 1.9e-3
redae_decoder 0.27 3.1e-5
dit 0.093 0.014 1.0e-5
backbone 分段 stop 轨迹与 torch 一致 一致

纯 w8 会显著损伤音质(分块 int8 --weightQuantBlock 64 实测无改善);fp16 后端到端与 torch 同种子轨迹一致(同第 30 步停止、4.80s)。mnnquant 全 int8 在当前 MNN 构建上崩溃 不可用。

性能(4 线程 Xeon,无 VNNI,RTF 越小越好)

torch fp32 本仓库 MNN fp16+w8 ONNX fp32
86.6 112 117

无 VNNI/fp16 硬件的 CPU 上 int8/fp16 只省体积不提速;w8 backbone 的加速在 VNNI(x86) / i8mm(ARM) 机器上体现。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support