FastEnhancer.AXERA
FastEnhancer (ICASSP 2026) 语音增强 AXERA 板端推理 demo。 AX650/NPU3 预编译模型 + Python SDK + C++ 可执行文件,即取即用。
- Python 示例(numpy + pyaxengine,无 torch/onnxruntime 回退)
- C++ 示例(
bin/下可执行文件,无需编译)
支持模型
| 模型 | 采样率 | axmodel | 降噪 | Python RTF | C++ RTF |
|---|---|---|---|---|---|
| fastenhancer_t_16k | 16 kHz | 148 KB | RMS -13% | 0.20 | 0.02 |
| fastenhancer_t_48k | 48 kHz | 153 KB | RMS -12% | 0.31 | 0.06 |
RTF = 推理时间 / 音频时长(不含模型加载),AX650 板端实测。RTF < 1.0 即可实时。
目录结构
FastEnhancer.AXERA/
├── models/
│ ├── 16k/ # 16kHz axmodel + model_meta.json
│ └── 48k/ # 48kHz axmodel + model_meta.json
├── bin/ # C++ 可执行文件(板端直接运行,无需编译)
│ ├── fastenhancer_ax650_16k
│ └── fastenhancer_ax650_48k
├── python/ # Python SDK
│ ├── fastenhancer_sdk/ # inference.py + 16k/ 48k/ STFT 窗
│ ├── demo.py # 降噪 demo
│ └── requirements.txt # numpy + pyaxengine
├── run_ax650.sh # 一键运行脚本(16k/48k,Python 或 C++)
├── samples/ # 降噪前后对比音频
└── README.md
快速开始(AX650 板端)
# 下载本仓库到板端后:
bash run_ax650.sh 16k # 16kHz C++ 一键降噪
bash run_ax650.sh 48k # 48kHz C++ 一键降噪
bash run_ax650.sh 16k python # 16kHz Python 降噪
输出:output_16k_enhanced.wav / output_48k_enhanced.wav(输入默认为
samples/p232_013_original.wav)。
Python 推理
环境
conda create -n fastenhancer python=3.10
conda activate fastenhancer
# 安装 pyaxengine (https://github.com/AXERA-TECH/pyaxengine/releases/latest)
pip install axengine-x.x.x-py3-none-any.whl
pip install -r python/requirements.txt
运行
cd python
# 16kHz
python3 demo.py --model ../models/16k/model.axmodel --input noisy.wav --output enhanced.wav
# 48kHz
python3 demo.py --model ../models/48k/model.axmodel --input noisy.wav --output enhanced.wav
C++ 推理(bin/ 可执行文件)
bin/ 下的可执行文件已按 AX650 交叉编译好,板端直接运行,无需编译:
# 16kHz
./bin/fastenhancer_ax650_16k models/16k/model.axmodel noisy.wav enhanced.wav
# 48kHz
./bin/fastenhancer_ax650_48k models/48k/model.axmodel noisy.wav enhanced.wav
板端运行库在 /soc/lib,系统已配置搜索路径,一般直接运行即可;如提示找不到
libax_*.so,再加 export LD_LIBRARY_PATH=/soc/lib:${LD_LIBRARY_PATH:-}。
C++ 源码(编译方法 + 工具链下载说明)见 GitHub 仓库: https://github.com/AXERA-TECH/fastenhancer.axera
示例音频 (samples/)
p232_013_original.wav— 原始嘈杂语音p232_013_16k_core_onnx.wav— 16kHz ONNX 参考降噪p232_013_16k_board_enhanced.wav— 16kHz AX650 板端降噪输出p232_013_48k_core_onnx.wav— 48kHz ONNX 参考降噪p232_013_48k_board_enhanced.wav— 48kHz AX650 板端降噪输出
参考
- FastEnhancer — 原始模型
- FastEnhancer.AXERA(GitHub 源码) — 模型转换 + C++ 源码
- Magnetar — AXERA 模型部署 agent 工具
- Downloads last month
- 7