YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
ASR Voice Recognition — 模型包
ASR_Voice-Recognition(昇腾 910B / TorchAir Whisper + 说话人分离)服务需要的全部模型,
从 ModelScope 原样镜像过来,保持原始目录结构,方便一台新机器/新容器一次拉齐。
内容
| 目录 | 来源(ModelScope) | 体积 | 缺失后果 |
|---|---|---|---|
whisper-torchair/ |
iic/Whisper-large-v3@master 的 large-v3.pt |
3.09 GB | 服务起不来(启动即 FileNotFoundError,非懒加载) |
speech_fsmn_vad_zh-cn-16k-common-pytorch/ |
iic/speech_fsmn_vad_zh-cn-16k-common-pytorch@v2.0.4 |
4 MB | 退回 hub id 联网下载 |
speech_campplus_sv_zh-cn_16k-common/ |
iic/speech_campplus_sv_zh-cn_16k-common@v1.0.0 |
29 MB | 同上 |
speech_campplus_speaker-diarization_common/ |
iic/speech_campplus_speaker-diarization_common@master |
347 MB | 同上 |
合计约 3.47 GB。服务侧 configuration.json 里引用的
damo/speech_campplus-transformer_scl_zh-cn_16k-common(39 MB)不需要:
segmentation-clustering + cluster-backend 链路用不到它,容器启动时会把这个字段删掉。
diarization 目录里的 onnx/(325 MB,人脸/ASD)音频链路同样用不到,为保持与原仓库一致而保留。
用法
# 直接用 huggingface_hub(或容器里的自动拉取逻辑)
python3 -c "from huggingface_hub import snapshot_download; \
snapshot_download('tari-tech/asr-voice-recognition-models', repo_type='model', \
local_dir='/data/asr-service/models')"
# 或 CLI
hf download tari-tech/asr-voice-recognition-models --local-dir /data/asr-service/models
国内网络可加 HF_ENDPOINT=https://hf-mirror.com。
容器方式:docker run ... <asr 镜像> serve 时若 /data/asr-service/models/whisper-torchair/large-v3.pt
不存在,入口脚本会自动拉这份模型树,然后把 diarization 的 configuration.json
(speaker_model / vad_model)改写成指向本地目录,因此之后可离线启动。
说明
- 这些文件是从 ModelScope 对应仓库原样复制的(含 README、示例音频等原始文件),未做转换。
- 各模型的许可与使用条款以其 ModelScope 页面为准(Whisper 权重为 OpenAI 的 MIT 许可)。
- 校验:本仓库用镜像内固定的
huggingface_hub(>=0.23,<1,实测 0.36.2)拉取后与原始文件逐字节一致。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support