SIYUAN — instruct_tts 交付包

支持 情感切换(emotion-change) 的指令式 TTS 交付版本。 基于 Universal-TTS-Framework + Qwen3-TTS-12Hz-1.7B 基座 + 自研 <|EMO_CHANGE|> 标记 + InnerEmoEval 打分工具链,打包为一份完全自包含、换机器即用的交付版本。

原始文件 instruct_tts_deliverable.zip 大小 49 GB,因为超过 HuggingFace 单文件 50 GB 限制, 所以被切成 4 份 (~13 GB × 3 + 10 GB × 1) 上传。请下载所有分片后合并解压。

分片文件

文件 大小 MD5
instruct_tts_deliverable.zip.part00 13 GB bc92130fa9a1c55ab884252fd8eac5f6
instruct_tts_deliverable.zip.part01 13 GB 7c1ea795848fd77671ecec326ec8611f
instruct_tts_deliverable.zip.part02 13 GB e7918a07daf15e464b62e0da3308b6e6
instruct_tts_deliverable.zip.part03 10 GB c33c3f9ceedec2c204367aa811b2c995

合并后原 zip 的 MD5:d752f0ad11d36b345e32168c0052d2e8

下载 + 合并 + 解压

# 1) 下载 (推荐 huggingface-cli)
pip install -U "huggingface_hub[cli]"
huggingface-cli download ScorpioMiku/SIYUAN --local-dir ./SIYUAN --local-dir-use-symlinks False

# 或者用 hf_hub_download 一个个下(示例):
# python -c 'from huggingface_hub import hf_hub_download; \
#   [hf_hub_download("ScorpioMiku/SIYUAN", f"instruct_tts_deliverable.zip.part0{i}", local_dir="./SIYUAN") for i in range(4)]'

# 2) 校验分片
cd ./SIYUAN
md5sum -c <(cat <<EOF
bc92130fa9a1c55ab884252fd8eac5f6  instruct_tts_deliverable.zip.part00
7c1ea795848fd77671ecec326ec8611f  instruct_tts_deliverable.zip.part01
e7918a07daf15e464b62e0da3308b6e6  instruct_tts_deliverable.zip.part02
c33c3f9ceedec2c204367aa811b2c995  instruct_tts_deliverable.zip.part03
EOF
)

# 3) 合并 4 份为原 zip
cat instruct_tts_deliverable.zip.part00 \
    instruct_tts_deliverable.zip.part01 \
    instruct_tts_deliverable.zip.part02 \
    instruct_tts_deliverable.zip.part03 > instruct_tts_deliverable.zip

# (可选) 校验合并后的 zip 完整
echo "d752f0ad11d36b345e32168c0052d2e8  instruct_tts_deliverable.zip" | md5sum -c

# 4) 解压 + 首次修复 + 跑单条推理
unzip instruct_tts_deliverable.zip
cd instruct_tts
bash envs/first_run_fix.sh
source env.sh
bash scripts/infer/infer_single.sh

包内包含

  • 源码 (Universal-TTS-Framework 精简版 + 训练/推理/评测脚本)
  • 4 份模型权重: Qwen3-TTS-12Hz-1.7B-{Base, VoiceDesign, Merged} + instruct_tts_sft_ckpt (checkpoint-46000)
  • 两个完整可运行的 conda 环境 (py_tts + py_eval, torch 2.6.0+cu124)
  • 交付评测集 (data/esd_eval, 535 rows × 2 variants, 3 模型的合成 wavs 已预置)
  • InnerEmoEval 打分工具链 (emo2vec + audeer + autopcp + senseVoice)
  • 完整文档 (README.md / QUICKSTART.md / DELIVERABLE.md / docs/*)

目标机器要求

  • Linux x86_64
  • NVIDIA GPU (24GB+ 显存,兼容 CUDA 12.4 driver ≥ 550)
  • 磁盘 ≥ 120 GB (49G zip + 49G 解压)

已通过测试

  • ✅ 单条推理 (含 <|EMO_CHANGE|> 情感切换)
  • ✅ 批量推理 (ESD emo-change bench)
  • ✅ 换机器物理拷贝后 python / torch / cuda 全部可用
  • first_run_fix.sh 幂等 (可反复跑无害)

详细使用文档见解压后的 README.md + DELIVERABLE.md

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support