BypBERT-tiny-zh-v3 (MacBERT)

8.7M 参数中文 BERT-tiny,MacBERT 策略预训练(近义词替换 + 混合回退)。

训练配置

项目 值
语料 中文维基 1,287,957 句
策略 15% token 遮盖,优先近义词替换,无近义词回退 [MASK]
同义词词典 222 条目(内置紧凑版)
模型架构 hidden=256, layers=4, heads=4, intermediate=1024, max_position=128
参数量 8,689,032
超参 batch_size=64, lr=1e-4, warmup_ratio=0.1, 5 epochs
总步数 100,625
硬件 Colab T4

与 v1/v2 对比

训练 loss 对比

步数 v1 MLM v2 WWM v3 MacBERT
1,000 8.48 8.47 8.26
5,000 6.32 6.26 5.00
10,000 5.68 5.61 4.18
50,000 ~4.9 ~4.6 2.42
100,625 ~4.9 4.31 2.17

注:loss 因任务难度不同不可直接比较,策略优劣以五维度评估为准。

五维度评估

维度 v1 MLM v2 WWM v3 MacBERT
困惑度 2.0483 1.2967 [待填]
MLM 命中率 1/10 (10%) 0/10 (0%) [待填]
语义区分(差值) 0.1065 0.0378 [待填]
语法判断 4/5 (80%) 3/5 (60%) [待填]
上下文敏感性 0.7653 0.8684 [待填]

使用示例

from transformers import AutoModelForMaskedLM, AutoTokenizer

model = AutoModelForMaskedLM.from_pretrained("eebyp/BypBERT-tiny-zh-v3")
tokenizer = AutoTokenizer.from_pretrained("eebyp/BypBERT-tiny-zh-v3")

inputs = tokenizer("今天天气真[MASK]", return_tensors="pt")
outputs = model(**inputs)
predicted_token_id = outputs.logits.argmax(dim=-1)[0, 3].item()
print(tokenizer.decode([predicted_token_id]))

License

Apache 2.0

Downloads last month
30
Safetensors
Model size
8.69M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support