SIYUAN — instruct_tts 交付包
支持 情感切换(emotion-change) 的指令式 TTS 交付版本。
基于 Universal-TTS-Framework + Qwen3-TTS-12Hz-1.7B 基座 + 自研 <|EMO_CHANGE|> 标记 + InnerEmoEval 打分工具链,打包为一份完全自包含、换机器即用的交付版本。
原始文件 instruct_tts_deliverable.zip 大小 49 GB,因为超过 HuggingFace 单文件 50 GB 限制,
所以被切成 4 份 (~13 GB × 3 + 10 GB × 1) 上传。请下载所有分片后合并解压。
分片文件
| 文件 | 大小 | MD5 |
|---|---|---|
instruct_tts_deliverable.zip.part00 |
13 GB | bc92130fa9a1c55ab884252fd8eac5f6 |
instruct_tts_deliverable.zip.part01 |
13 GB | 7c1ea795848fd77671ecec326ec8611f |
instruct_tts_deliverable.zip.part02 |
13 GB | e7918a07daf15e464b62e0da3308b6e6 |
instruct_tts_deliverable.zip.part03 |
10 GB | c33c3f9ceedec2c204367aa811b2c995 |
合并后原 zip 的 MD5:d752f0ad11d36b345e32168c0052d2e8
下载 + 合并 + 解压
# 1) 下载 (推荐 huggingface-cli)
pip install -U "huggingface_hub[cli]"
huggingface-cli download ScorpioMiku/SIYUAN --local-dir ./SIYUAN --local-dir-use-symlinks False
# 或者用 hf_hub_download 一个个下(示例):
# python -c 'from huggingface_hub import hf_hub_download; \
# [hf_hub_download("ScorpioMiku/SIYUAN", f"instruct_tts_deliverable.zip.part0{i}", local_dir="./SIYUAN") for i in range(4)]'
# 2) 校验分片
cd ./SIYUAN
md5sum -c <(cat <<EOF
bc92130fa9a1c55ab884252fd8eac5f6 instruct_tts_deliverable.zip.part00
7c1ea795848fd77671ecec326ec8611f instruct_tts_deliverable.zip.part01
e7918a07daf15e464b62e0da3308b6e6 instruct_tts_deliverable.zip.part02
c33c3f9ceedec2c204367aa811b2c995 instruct_tts_deliverable.zip.part03
EOF
)
# 3) 合并 4 份为原 zip
cat instruct_tts_deliverable.zip.part00 \
instruct_tts_deliverable.zip.part01 \
instruct_tts_deliverable.zip.part02 \
instruct_tts_deliverable.zip.part03 > instruct_tts_deliverable.zip
# (可选) 校验合并后的 zip 完整
echo "d752f0ad11d36b345e32168c0052d2e8 instruct_tts_deliverable.zip" | md5sum -c
# 4) 解压 + 首次修复 + 跑单条推理
unzip instruct_tts_deliverable.zip
cd instruct_tts
bash envs/first_run_fix.sh
source env.sh
bash scripts/infer/infer_single.sh
包内包含
- 源码 (Universal-TTS-Framework 精简版 + 训练/推理/评测脚本)
- 4 份模型权重: Qwen3-TTS-12Hz-1.7B-{Base, VoiceDesign, Merged} + instruct_tts_sft_ckpt (checkpoint-46000)
- 两个完整可运行的 conda 环境 (py_tts + py_eval, torch 2.6.0+cu124)
- 交付评测集 (data/esd_eval, 535 rows × 2 variants, 3 模型的合成 wavs 已预置)
- InnerEmoEval 打分工具链 (emo2vec + audeer + autopcp + senseVoice)
- 完整文档 (README.md / QUICKSTART.md / DELIVERABLE.md / docs/*)
目标机器要求
- Linux x86_64
- NVIDIA GPU (24GB+ 显存,兼容 CUDA 12.4 driver ≥ 550)
- 磁盘 ≥ 120 GB (49G zip + 49G 解压)
已通过测试
- ✅ 单条推理 (含
<|EMO_CHANGE|>情感切换) - ✅ 批量推理 (ESD emo-change bench)
- ✅ 换机器物理拷贝后 python / torch / cuda 全部可用
- ✅
first_run_fix.sh幂等 (可反复跑无害)
详细使用文档见解压后的 README.md + DELIVERABLE.md。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support