GCRN 语音增强(AX650 NPU3)

GCRN(Graph Convolutional Recurrent Network)单声道语音增强模型,输入 16 kHz 噪声语音, 输出同长增强语音。本包为 AX650 / NPU3 量化部署版:

  • 精度:AXMODEL 与 ONNX 参考余弦相似度 0.9992(增强波形余弦 0.9997)
  • 速度:AX650 板端 RTF 0.029(9.77 秒音频约 0.28 秒处理完)
  • 大小:AXMODEL 27.6 MB(ONNX 38 MB)

快速开始(两步)

1. 安装环境

bash setup.sh

2. 跑推理

bash run.sh

脚本会自动选择后端:板端(有 axengine)跑 NPU 模型,普通电脑自动用 ONNX 模型演示。 输出为 enhanced.wav,增强前后的对比音频可以自己听一下。

目录说明

目录 用途
models/ AXMODEL 模型 + model_meta.json
python/ Python SDK(axengine / onnxruntime 双后端)
cpp/ C++ SDK(AX Engine runtime,aarch64 交叉编译)
model_convert/ 导出、校准、Pulsar2 编译全套可复现脚本
reports/ 导出/编译/仿真/板端验证报告
test_audio/ 自带 9.77 秒测试音频

在自己的代码里用

from gcrn_sdk import GCRNDenoiser

denoiser = GCRNDenoiser("models/model.axmodel")
report = denoiser.enhance_file("test_audio/mix.wav", "enhanced.wav")
print(report)  # 含 RTF 等性能指标

常见问题

Q: import 报错找不到 axengine? A: 说明当前不在 AX 板端。代码会自动用 ONNX 模型演示;要在 NPU 上跑,需在 AX650 板端 安装匹配的 axengine wheel(见 setup.sh 输出提示)。

Q: 想自己重新编译 AXMODEL? A: 进入 model_convert/ 按 README 操作,Pulsar2 会从 ONNX 重新量化编译。 原始编译使用 Docker 镜像 pulsar2:7.0-lite,配置为 NPU3 + U16 高精度模式。

Q: 输入音频有什么要求? A: 16 kHz、单声道、16-bit PCM WAV;更长音频会自动按 4 秒分块处理并拼接。

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support