FastEnhancer.AXERA

FastEnhancer (ICASSP 2026) 语音增强 AXERA 板端推理 demo。 AX650/NPU3 预编译模型 + Python SDK + C++ 可执行文件,即取即用。

  • Python 示例(numpy + pyaxengine,无 torch/onnxruntime 回退)
  • C++ 示例(bin/ 下可执行文件,无需编译)

支持模型

模型 采样率 axmodel 降噪 Python RTF C++ RTF
fastenhancer_t_16k 16 kHz 148 KB RMS -13% 0.20 0.02
fastenhancer_t_48k 48 kHz 153 KB RMS -12% 0.31 0.06

RTF = 推理时间 / 音频时长(不含模型加载),AX650 板端实测。RTF < 1.0 即可实时。

目录结构

FastEnhancer.AXERA/
├── models/
│   ├── 16k/              # 16kHz axmodel + model_meta.json
│   └── 48k/              # 48kHz axmodel + model_meta.json
├── bin/                  # C++ 可执行文件(板端直接运行,无需编译)
│   ├── fastenhancer_ax650_16k
│   └── fastenhancer_ax650_48k
├── python/               # Python SDK
│   ├── fastenhancer_sdk/ # inference.py + 16k/ 48k/ STFT 窗
│   ├── demo.py           # 降噪 demo
│   └── requirements.txt  # numpy + pyaxengine
├── run_ax650.sh          # 一键运行脚本(16k/48k,Python 或 C++)
├── samples/              # 降噪前后对比音频
└── README.md

快速开始(AX650 板端)

# 下载本仓库到板端后:
bash run_ax650.sh 16k        # 16kHz C++ 一键降噪
bash run_ax650.sh 48k        # 48kHz C++ 一键降噪
bash run_ax650.sh 16k python # 16kHz Python 降噪

输出:output_16k_enhanced.wav / output_48k_enhanced.wav(输入默认为 samples/p232_013_original.wav)。

Python 推理

环境

conda create -n fastenhancer python=3.10
conda activate fastenhancer

# 安装 pyaxengine (https://github.com/AXERA-TECH/pyaxengine/releases/latest)
pip install axengine-x.x.x-py3-none-any.whl

pip install -r python/requirements.txt

运行

cd python
# 16kHz
python3 demo.py --model ../models/16k/model.axmodel --input noisy.wav --output enhanced.wav
# 48kHz
python3 demo.py --model ../models/48k/model.axmodel --input noisy.wav --output enhanced.wav

C++ 推理(bin/ 可执行文件)

bin/ 下的可执行文件已按 AX650 交叉编译好,板端直接运行,无需编译:

# 16kHz
./bin/fastenhancer_ax650_16k models/16k/model.axmodel noisy.wav enhanced.wav
# 48kHz
./bin/fastenhancer_ax650_48k models/48k/model.axmodel noisy.wav enhanced.wav

板端运行库在 /soc/lib,系统已配置搜索路径,一般直接运行即可;如提示找不到 libax_*.so,再加 export LD_LIBRARY_PATH=/soc/lib:${LD_LIBRARY_PATH:-}

C++ 源码(编译方法 + 工具链下载说明)见 GitHub 仓库: https://github.com/AXERA-TECH/fastenhancer.axera

示例音频 (samples/)

  • p232_013_original.wav — 原始嘈杂语音
  • p232_013_16k_core_onnx.wav — 16kHz ONNX 参考降噪
  • p232_013_16k_board_enhanced.wav — 16kHz AX650 板端降噪输出
  • p232_013_48k_core_onnx.wav — 48kHz ONNX 参考降噪
  • p232_013_48k_board_enhanced.wav — 48kHz AX650 板端降噪输出

参考

Downloads last month
7
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support