SBV2 Core ML 共通モデル・辞書
iPhone/Apple Silicon Mac用の共通BERTとOpen JTalk辞書です。 SDK・サンプルアプリと、別配布の声モデルを合わせて使います。
使う版を選ぶ
INT8版はint8/、元のFP32版はfloat32/です。 各フォルダにBERT・辞書・ライセンス・取得用マニフェストが揃っています。
声モデルは両方で同じものを使えます。
| 版・ファイル一覧 | 共通BERT・辞書 | JVNV込み | 選ぶ目安 | アプリ用マニフェスト |
|---|---|---|---|---|
| INT8 | 約503 MB | 約797 MB | ファイル容量を抑えたい | INT8版を取得 |
| FP32(float32) | 約1.52 GB | 約1.81 GB | 重み量子化による数値差を避けたい、準備時間を短くしたい | FP32版を取得 |
INT8版はBERTの重みを8bitで保存します。BERTの演算と入出力は、両版ともFP32です。 iOS 18以上、macOS 15以上のApple Siliconに対応します。コンパイルキャッシュ用に追加の空き容量が必要です。 容量は配布ファイルの概算であり、RAMの削減率を示すものではありません。
サンプルアプリから取得する
モデル設定 → URLからモデルを取得 → 取得するモデル:共通モデルを開き、 共通モデルの版でINT8(約503 MB)またはFP32(約1.52 GB)を選び、ダウンロードを押します。 取得URLが自動設定されます。カスタムURLで取得する場合やSDKから取得する場合は、次のURLを使えます。 以下はファイル一式の版を固定したURLです。
INT8版
https://huggingface.co/AILogDev/sbv2-coreml-common/resolve/973d6e239af305f0d78a8bf30c6af5093c0fd47d/int8/download.json
元のFP32版
https://huggingface.co/AILogDev/sbv2-coreml-common/resolve/973d6e239af305f0d78a8bf30c6af5093c0fd47d/float32/download.json
取得後にモデルを準備を押します。声モデルは別途取得するか、自分で変換した声フォルダを選びます。 取得後の音声合成はオフラインで動作します。
Macで片方だけ取得する
Hugging Face CLIを使います。
--includeで選んだ版だけを取得してください。リポジトリ一式の取得では両版と互換用ファイルもダウンロードされます。
INT8版 → models/int8/
hf download AILogDev/sbv2-coreml-common \
--revision 973d6e239af305f0d78a8bf30c6af5093c0fd47d \
--include "int8/*" --local-dir models
元のFP32版 → models/float32/
hf download AILogDev/sbv2-coreml-common \
--revision 973d6e239af305f0d78a8bf30c6af5093c0fd47d \
--include "float32/*" --local-dir models
サンプルの共通モデルには、取得したint8/またはfloat32/を選びます。
SDKにはそのフォルダのbert/とdictionary/、別の声フォルダを渡します。
.mlpackageの中身を含め、選んだフォルダ全体を取得してください。
切り替えと音質・速度
取得済みモデルを切り替えるには、合成・再生を停止し、共通モデルで使う版のフォルダを選び、モデルを準備を押します。
フォルダ表示にINT8/FP32の版も表示します。取得欄での版選択だけでは、準備済みモデルは切り替わりません。
SDKでは処理の終了を待ってから、選んだ共通フォルダでloadとwarmUpを行います。
古いモデルとキャッシュは自動削除されません。不要な共通フォルダを削除する場合はアプリを終了するかSDKでunloadし、共用する声フォルダは保持します。
| iPhone 17 Pro・JVNV Neutralの測定例 | INT8版 | 元のFP32版 |
|---|---|---|
コンパイル済みキャッシュがある再ロード後の準備(load+warmUp) |
約18秒 | 約6秒 |
| 準備後の3文合成RTF中央値 | 0.071 | 0.067 |
初回コンパイル、再生時間、LLMとの同時実行は含みません。声・文章・端末で値は変わり、INT8版が常に高速になるわけではありません。 BERTの量子化によって抑揚・間・音声の長さ・波形に差が生じる場合があります。声モデルの重みと辞書は変更しません。 JVNV Neutralの比較音声では聴き比べで気になる差はありませんでした。採用する声と文章でも確認してください。
SDK導入 · サンプルの起動 · 自分で共通BERTを圧縮する
以前の取得URL
以前の固定リビジョンの取得URLは引き続き使えます。ルートのdownload.json・bert/・dictionary/は既存URLの互換用INT8モデルです。
これから取得する場合は、上の選択表からint8/またはfloat32/を選んでください。
出典とライセンス
BERTは京都大学の自然言語処理研究グループによるDeBERTa日本語モデルからの変換物です。
原本のコミットは547b0e8b044fba3f9b84d0ab9f990440bd130c8bです。
BERTはCC BY-SA 4.0です。各版のLICENSE.md、出典と変換記録のprovenance.jsonを参照してください。
Open JTalk 1.11 UTF-8辞書には別のBSD系条件があり、各版のdictionary/COPYINGに記載しています。
各版のchecksums.jsonでファイルを検証できます。SDK・サンプル・変換ツールのコードはAGPL-3.0です。
非公式の変換物であり、原作者による承認・推奨を示すものではありません。
- Downloads last month
- 21
Model tree for AILogDev/sbv2-coreml-common
Base model
ku-nlp/deberta-v2-large-japanese-char-wwm